arXiv 机器学习· Liv G. d'Aliberti, Marwa Abdulhai, Sofiia Druchyna, Peter Henderson, Manoel Horta Ribeiro·· 8 小时前AI 评分43
RLVR 中解模式崩溃的测量与缓解
Measuring and Mitigating Solution Mode Collapse in RLVR
AI 导读
针对 RLVR 后训练中大语言模型概率过度集中于少数正确解的模式崩溃问题,研究团队推出了多解评测基准 ModeBench 与缓解方案 Re:Max。ModeBench 测试证实 RLVR 会降低解的多样性,且前沿模型已高度集中。Re:Max 通过在重放缓冲区中均匀训练已发现的各模式样本,在 3 种模型规模和 2 种 RL 目标下同时提升了策略成功率与解的多样性。
来源:arXiv 机器学习 · arxiv.org