arXiv 自然语言处理· Yekun Chai, Qiwei Peng, Haoyi Xiong·· 5 小时前AI 评分45
找到招法不等于赢得比赛:大语言模型智能体闭环评测基准 XiangqiBench
Finding the Move Is Not Winning the Game: XiangqiBench for Closed-Loop Evaluation of LLM Agents
AI 导读
研究人员推出中国象棋可执行评测基准 XiangqiBench,包含 119 个绝杀残局,用于评估大语言模型智能体对抗引擎防守方的闭环将死能力。测试记录了 12 款前沿 LLM 的 8,568 条多轮轨迹,发现模型走出首步参考招法比例为 26.1% 但胜率仅 13.9%,领先模型 pass@3 达 38.7% 而 pass^3 仅 5.9%。
来源:arXiv 自然语言处理 · arxiv.org