跳到正文
原文
arXiv 自然语言处理· Radhika Gaonkar·· 4 小时前AI 评分45

TRACE:诊断 AI 智能体评测中验证器的脆弱性

TRACE: Diagnosing Verifier Brittleness in Agentic Evaluation

AI 导读

研究者提出 TRACE 协议,通过定向变更评测设置并重新评分,诊断大语言模型智能体评测中验证器的脆弱性。测试显示仅重命名工具即可使智能体分数下降 0.250,相同重跑有 15-36% 的任务结果发生翻转,且两个前沿 LLM 裁判在 57% 的记录上意见相左。TRACE 有效将智能体的真实能力变化与测量误差解耦。

来源:arXiv 自然语言处理 · arxiv.org