跳到正文
原文
arXiv 自然语言处理· Yanjie Zhang, Bowen Cao, Zixin Chen, Yushi Sun·· 1 天前AI 评分50

当用户改变主意时:测量与修复 LLM 智能体中的意图漂移

When Users Change Their Minds: Measuring and Repairing Intent Drift in LLM Agents

AI 导读

研究团队针对 LLM 智能体在多轮对话中受过时信息干扰的“意图漂移”失效问题,推出了评测基准 IntentFlux 与修复方法 StateForge。在 627 个案例的校准测试中,被取代或撤回的信息使平均任务得分从 0.476 降至 0.384。StateForge 通过在生成前显式维护有效需求,在 General-Test 上将平均任务得分从 0.367 提升至 0.467。

来源:arXiv 自然语言处理 · arxiv.org