跳到正文
原文
arXiv 人工智能· Muhammad Ahmed Mohsin, Myeongsoo Kim, Kangrui Ruan, Shweta Garg, Varun Kumar, Murali Krishna Ramanathan·· 3 小时前AI 评分50

训练 AI 智能体实现高可靠代码编写

Teaching Agents to Code Reliably

AI 导读

研究提出通过加权 SFT 与强化学习将搜索与验证行为内化到策略模型,使 AI 智能体在 SWE-bench Verified 上以基准 48.1% 的步数取得 52.8% 的解决率。强化学习进一步将保留测试集的 pass@1 和 pass@8 分别提升至 43.0% 与 60.7%,并将验证器精度从 26.8% 提至 41.7%。该收益在 7B、14B 及 30B 规模模型上均保持有效。

来源:arXiv 人工智能 · arxiv.org