跳到正文
原文
arXiv 人工智能· Xi Qin, Isabel Kurth, Xin Cui, Elin Park, Alexander Schaefer, Yaad Oren·· 4 小时前AI 评分44

终端 AI 智能体训练停滞分析:揭秘数据生成与验证挑战

When Terminal-Agent Training Stalls: Demystifying Data Generation and Verification Challenge

AI 导读

研究揭示使用 Claude Opus 作为 meta-agent 生成强化学习终端任务时,存在基准失效、测试框架脆弱和奖励不对齐三类故障。提示词优化与上下文扩展使基线可解性提升 5.6 倍,但 9B 模型在 20 步内达到 81.3% 的平均 pass@2 饱和,加入困难任务后降至 20.6%。这表明保障 meta-agent 可靠性需依赖可解性区间校准与验证器审计。

来源:arXiv 人工智能 · arxiv.org