跳到正文
原文
arXiv 自然语言处理· Sergei Polezhaev, Barys Liskavets, Ori Press, Alexander Golubev·· 6 小时前AI 评分44

基于任务结果训练 LLM Agent 顾问:Caddie 方法

Training Advisors for LLM Agents from Task Outcomes

AI 导读

研究团队提出 Caddie 方法,通过强化学习并基于任务最终成败训练自然语言 critic,为多步任务 LLM Agent 提供执行建议。以 Qwen3-4B 训练的 critic 具备跨模型泛化能力,在 MuSiQue 基准上将 Qwen3-4B 成功率提升超 25 个百分点,超越无 critic 的 Kimi K3。

来源:arXiv 自然语言处理 · arxiv.org