arXiv 自然语言处理· Sergei Polezhaev, Barys Liskavets, Ori Press, Alexander Golubev·· 6 小时前AI 评分44
基于任务结果训练 LLM Agent 顾问:Caddie 方法
Training Advisors for LLM Agents from Task Outcomes
AI 导读
研究团队提出 Caddie 方法,通过强化学习并基于任务最终成败训练自然语言 critic,为多步任务 LLM Agent 提供执行建议。以 Qwen3-4B 训练的 critic 具备跨模型泛化能力,在 MuSiQue 基准上将 Qwen3-4B 成功率提升超 25 个百分点,超越无 critic 的 Kimi K3。
来源:arXiv 自然语言处理 · arxiv.org