跳到正文
热点事件持续更新

研究揭示BFCL多轮评测缺陷并提出动作决策评分方法

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026年10月,发表于arXiv的一项研究指出,BFCL多轮基准测试在评估智能体主动提问时存在机制缺陷。由于评分器会跳过提问轮次,导致智能体的主动提问无法得分,而盲目猜测也不会受到惩罚。研究人员构建了223对完整与缺失信息的控制实验,结果显示gpt-5.4取得了80.7%的最高决策准确率,但在官方榜单上仅排第六;若在输入中加入不提问的提示词,官方得分反而能大幅提升13.5至23.5分。针对该问题,研究提出了动作决策评分方法。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月6日
  1. arXiv 人工智能精选
    论文揭示 BFCL 多轮评测存在提问不计分缺陷并提出动作决策评分方法

    论文指出 BFCL 多轮基准测试在评估智能体主动提问时存在机制缺陷,其评分器会跳过提问轮次导致主动提问无法得分、盲目猜测不受惩罚。研究构建了 223 对完整与缺失信息的控制实验,发现 gpt-5.4 取得了 80.7% 的最高决策准确率却在官方榜单仅排第六,加入不提问提示词反而能让官方得分大幅提升 13.5 至 23.5 分。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。