arXiv 自然语言处理· Yanjie Zhang, Bowen Cao, Zixin Chen, Yushi Sun·· 1 天前AI 评分50
当用户改变主意时:测量与修复 LLM 智能体中的意图漂移
When Users Change Their Minds: Measuring and Repairing Intent Drift in LLM Agents
AI 导读
研究团队针对 LLM 智能体在多轮对话中受过时信息干扰的“意图漂移”失效问题,推出了评测基准 IntentFlux 与修复方法 StateForge。在 627 个案例的校准测试中,被取代或撤回的信息使平均任务得分从 0.476 降至 0.384。StateForge 通过在生成前显式维护有效需求,在 General-Test 上将平均任务得分从 0.367 提升至 0.467。
来源:arXiv 自然语言处理 · arxiv.org