arXiv 机器学习· Jinyuan Li, Chengsong Huang, Langlin Huang, Donghong Cai, Shiping Gao, Yuyi Yang, Jiaxin Huang·· 5 小时前AI 评分40
质疑问题:维持推理模型的持续自我进化
Questioning the Questions: Sustaining Self-Evolution in Reasoning Models
AI 导读
针对推理模型自训练容易出现性能崩溃的问题,研究人员提出利用问题有效性与新颖性反馈指导自我进化的 R-Quest 方法。该方法通过训练解题器识别并过滤无效问题,同时利用冻结基座模型提供新颖性反馈以避免数学等价问题重复。实验显示,R-Quest 在跨两个模型族的 12 个基准测试中均取得最高平均性能,并在 10 轮自我进化中保持稳定增长,最终轮得分超越 R-Zero 达 17.32 分。
来源:arXiv 机器学习 · arxiv.org