arXiv 人工智能· Yangze Liu, Zhongyi Han·· 2 小时前精选AI 评分65
论文揭示 BFCL 多轮评测存在提问不计分缺陷并提出动作决策评分方法
Asking Earns Nothing: Scoring the Decision to Act in BFCL Multi-Turn
AI 导读
论文指出 BFCL 多轮基准测试在评估智能体主动提问时存在机制缺陷,其评分器会跳过提问轮次导致主动提问无法得分、盲目猜测不受惩罚。研究构建了 223 对完整与缺失信息的控制实验,发现 gpt-5.4 取得了 80.7% 的最高决策准确率却在官方榜单仅排第六,加入不提问提示词反而能让官方得分大幅提升 13.5 至 23.5 分。
推荐理由
研究通过成对控制实验揭示了基准测试偏袒盲目行动的机制漏洞,为评估智能体在信息缺失时的主动提问决策提供了修正方案。
来源:arXiv 人工智能 · arxiv.org