热点事件持续更新
研究团队推出基于国际象棋的LLM提示词优化评测基准并开源
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
2026年10月2日,研究团队推出了一套基于 1,118 道 Lichess 谜题的国际象棋基准,旨在评测大语言模型(LLM)在冻结权重条件下的自动提示词优化(APO)能力。该基准评估了 6 种 APO 算法在 8 个目标模型上的表现。结果显示,表现最佳的 Gemini 3.5 Flash 谜题解题率仅约 55%,且完整评测成本约为 800 美元。目前,相关谜题、优化与评估代码以及数据集更新脚本已全部开源。
AI 根据报道生成 · 3 小时前更新
最新进展10月2日 12:00
研究团队推出基于1118道Lichess谜题的LLM提示词优化基准,并开源全部代码与数据集。报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- arXiv 人工智能基于国际象棋的大语言模型提示词优化评测基准
研究团队推出基于 1,118 道 Lichess 谜题的国际象棋基准,用于评测冻结权重下大语言模型(LLM)的自动提示词优化(APO)能力。该基准测试了 6 种 APO 算法在 8 个目标模型上的表现,其中最强的 Gemini 3.5 Flash 谜题解题率仅约 55%,且完整评测成本约 $800。相关谜题、优化与评估代码及数据集更新脚本已全部开源。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。