跳到正文
原文
arXiv 人工智能· Shuyao Xiao, Shengling Wang, Xuan Chen, Ke Chao, Ming Cui, Feifei Qian, Chaoyang Mei, Fanlin Meng, Ziming Yu, Junxi Yin·· 6 小时前AI 评分39

大语言模型智能体错误恢复的因果评估与干预路由

When Harnesses Lose the Signal: Causal Evaluation of Recovery in LLM Agents

AI 导读

研究提出将大语言模型智能体的错误恢复建模为因果决策问题,并推出轻量级策略因果干预路由器(CIR),用于在错误恢复前自主判断介入时机。在基于 Qwen3-14B 的长程 ALFWorld 任务中,CIR 将成功率从 70.33% 提升至 73.33%(提升 3.00 个百分点),且不干扰具有正确观察值的正常轨迹。

来源:arXiv 人工智能 · arxiv.org