跳到正文
热点事件持续更新

研究团队提出智能体强化学习方法T2SPO

1 篇报道1 个报道来源4 小时前更新

先了解这件事

AI 综述

2026年10月,研究人员提出面向智能体强化学习的轨迹到步骤策略优化方法T2SPO。该方法利用历史成功轨迹,为大语言模型的策略学习提供步级反馈。具体实现上,T2SPO通过预训练TabPFN回归器估计各状态距成功的剩余距离,以此提供辅助信用分配,并支持在训练中动态刷新上下文而无需更新参数。在ALFWorld和WebShop基准测试中,针对1.5B与7B模型的实验表明,T2SPO的任务成功率持续优于GRPO。

AI 根据报道生成 · 3 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. arXiv 机器学习
    T2SPO:面向智能体强化学习的轨迹到步骤策略优化方法

    研究人员提出面向智能体强化学习的方法 T2SPO,利用历史成功轨迹为大语言模型策略学习提供步级反馈。该方法通过预训练 TabPFN 回归器估计各状态距成功的剩余距离以提供辅助信用分配,并在训练中动态刷新上下文而无需更新参数。在 ALFWorld 和 WebShop 上的 1.5B 与 7B 模型实验表明,T2SPO 的任务成功率持续优于 GRPO。

本事件热度走势

当前热度 9·可比范围峰值 10(10月2日 13:00)·近 24 小时可比范围变化 –

02.557.51010月2日13:0010月2日14:0010月2日14:0010月2日15:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。