arXiv 自然语言处理· Jiayi Li, Ruizhe Li·· 1 天前AI 评分35
矫正何时成为修复?工具调用大语言模型内部干预的机制审计
When Does Correction Become Repair? Mechanistic Auditing of Internal Interventions in Tool-Using LLMs
AI 导读
研究提出 SAKIKO 审计框架,用于评估工具调用大语言模型内部激活干预是否真正实现表征修复。在 When2Call 和 MetaTool 的 7 个模型测试中,定向干预在 5 个模型中带来净收益,59 个随机方向均未达标。然而审计表明行为改变不等于修复,例如取得 +55 净收益的干预破坏了超半数基线正确决策,Qwen3-4B 和 Gemma-2-9B 的估计也因不确定性被否决。
来源:arXiv 自然语言处理 · arxiv.org