arXiv 自然语言处理· Dongwon Jung, Hemanth Neelgund Ramesh, Yifan Wang, Xiaomin Li, Yuexing Hao, Yu Hu, Muhao Chen, Varun Chandrasekaran, Andrzej Banburski-Fahey, Jaron Lanier·· 1 天前AI 评分35
面向智能体强化学习关键决策信用分配的 ProVer 框架
Targeting Pivotal Decisions for Credit Assignment in Agentic Reinforcement Learning
AI 导读
研究人员提出智能体强化学习框架 ProVer,通过对比成功与失败轨迹并验证关键决策优势,解决了 GRPO 难以区分关键动作的细粒度信用分配难题。在 ALFWorld、WebShop 和 SearchQA 评测中,ProVer 取得最优平均表现,相比 GRPO 使 Qwen3.5-2B 和 Qwen3.5-4B 的性能分别相对提升 9.91% 和 7.12%。
来源:arXiv 自然语言处理 · arxiv.org