arXiv 人工智能· Boyang Yang, Zhenhao Li, Ziyao Yang, Kanghui Jia, Xin Yin, Mingmou Liu, Haoye Tian·· 4 小时前精选AI 评分67
大模型智能体工具调用是否符合预期执行?IEC意图与执行一致性度量与修复
Do Tool Calls Execute as Intended? Measuring and Repairing Intent-Execution Correspondence in LLM Agents
AI 导读
研究团队提出了意图-执行一致性概念与修复机制 IntAct,并构建了评测基准 IEC-Bench,用于解决 LLM 智能体工具调用在多跳链路中被静默篡改的问题。实测显示 Claude Code 的 Bash 工具修改了 12.0% 包含代码或转义序列的调用,其中 80.7% 的反斜杠篡改在未报错情况下直接错误执行。IntAct 部署在商用产品后成功恢复了 79.2% 因调用被篡改导致的失败。
推荐理由
论文揭示了智能体工具调用在中间跳转链路中被篡改并导致静默失败的问题,为工具执行框架的逐跳校验与修复提供了可复用基准。
来源:arXiv 人工智能 · arxiv.org