跳到正文
原文
arXiv 自然语言处理· Ryan Brown, Zihao Fu, Chris Russell·· 1 天前AI 评分51

Settle:让推理模型学会何时停止思考

Settle: Learning When to Stop Reasoning

AI 导读

研究人员提出 Settle 方法,通过分析完整轨迹中的答案稳定性来训练推理结束 token,使模型学会提前停止生成。在 MATH-500 数据集上配合 Qwen3-4B 测试,该方法在准确率仅下降 0.5 个百分点的情况下减少了 40% 的 token 消耗,且推理阶段仅需常规解码。

来源:arXiv 自然语言处理 · arxiv.org