跳到正文
热点事件持续更新

研究团队推出基于国际象棋的LLM提示词优化评测基准并开源

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026年10月2日,研究团队推出了一套基于 1,118 道 Lichess 谜题的国际象棋基准,旨在评测大语言模型(LLM)在冻结权重条件下的自动提示词优化(APO)能力。该基准评估了 6 种 APO 算法在 8 个目标模型上的表现。结果显示,表现最佳的 Gemini 3.5 Flash 谜题解题率仅约 55%,且完整评测成本约为 800 美元。目前,相关谜题、优化与评估代码以及数据集更新脚本已全部开源。

AI 根据报道生成 · 3 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. arXiv 人工智能
    基于国际象棋的大语言模型提示词优化评测基准

    研究团队推出基于 1,118 道 Lichess 谜题的国际象棋基准,用于评测冻结权重下大语言模型(LLM)的自动提示词优化(APO)能力。该基准测试了 6 种 APO 算法在 8 个目标模型上的表现,其中最强的 Gemini 3.5 Flash 谜题解题率仅约 55%,且完整评测成本约 $800。相关谜题、优化与评估代码及数据集更新脚本已全部开源。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。