跳到正文
原文
arXiv 人工智能· Hanwen Li, Jinhao Duan, Guanhua Zhu, Junchi Lu, Bo Shen, Chenxi Yuan, Kaidi Xu·· 7 小时前AI 评分43

从不确定性到行动:学习引导 LLM Agent

From Uncertainty to Action: Learning to Steer LLM Agents

AI 导读

研究提出轨迹级监控器 VoS(Value of Steering),通过基于约 8.2 万条反事实轨迹的分步结果表(SOT)学习干预价值,决定是否及在何处引导 LLM Agent。配合危害预算触发机制,VoS 在 3 个基准和 2 种 Agent 的全部 12 种测试配置中相比未修改执行平均提升 7.8 点。该方法在 11 种配置下超越了现存最强的不确定性触发方法,平均领先 2.9 点。

来源:arXiv 人工智能 · arxiv.org