跳到正文
热点事件持续更新

研究人员推出LLM Agent闭环评测基准XiangqiBench

1 篇报道1 个报道来源4 小时前更新

先了解这件事

AI 综述

2026年10月5日,研究人员推出中国象棋可执行评测基准XiangqiBench,包含119个绝杀残局,用于评估大语言模型智能体对抗引擎防守方的闭环将死能力。该测试记录了12款前沿大语言模型的8,568条多轮轨迹。评测结果显示,模型走出首步参考招法的比例为26.1%,但实际胜率仅为13.9%;同时,领先模型的pass@3达到38.7%,而pass^3仅为5.9%,揭示出模型即便能找到局部招法也难以在多轮闭环对抗中赢得比赛的问题。

AI 根据报道生成 · 4 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv 自然语言处理
    找到招法不等于赢得比赛:大语言模型智能体闭环评测基准 XiangqiBench

    研究人员推出中国象棋可执行评测基准 XiangqiBench,包含 119 个绝杀残局,用于评估大语言模型智能体对抗引擎防守方的闭环将死能力。测试记录了 12 款前沿 LLM 的 8,568 条多轮轨迹,发现模型走出首步参考招法比例为 26.1% 但胜率仅 13.9%,领先模型 pass@3 达 38.7% 而 pass^3 仅 5.9%。

本事件热度走势

当前热度 9·可比范围峰值 10(10月5日 12:00)·近 24 小时可比范围变化 –

02.557.51010月5日12:0010月5日13:0010月5日14:0010月5日15:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。