跳到正文
原文
arXiv 机器学习· Bo-Wen Zhang, Junwei He, Maoqi Liu, Feiran Li, Song-Lin Lv, Wentao Ma, Rongyi Lin, Shuhan Zhong, Lan-Zhe Guo·· 6 小时前AI 评分34

T2SPO:面向智能体强化学习的轨迹到步骤策略优化方法

T2SPO: Trajectory-to-Step Policy Optimization for Agentic Reinforcement Learning

AI 导读

研究人员提出面向智能体强化学习的方法 T2SPO,利用历史成功轨迹为大语言模型策略学习提供步级反馈。该方法通过预训练 TabPFN 回归器估计各状态距成功的剩余距离以提供辅助信用分配,并在训练中动态刷新上下文而无需更新参数。在 ALFWorld 和 WebShop 上的 1.5B 与 7B 模型实验表明,T2SPO 的任务成功率持续优于 GRPO。

来源:arXiv 机器学习 · arxiv.org