跳到正文
原文
arXiv 人工智能· Timoth\'ee Lesort, Alejandra L\'opez de Aberasturi G\'omez, Tristan Karch, Tom Veniat, Philippe Modard, Karl Tuyls, Ludovic Denoyer·· 4 小时前AI 评分37

基于国际象棋的大语言模型提示词优化评测基准

Benchmarking Prompt Optimization of Large Language Models With Chess

AI 导读

研究团队推出基于 1,118 道 Lichess 谜题的国际象棋基准,用于评测冻结权重下大语言模型(LLM)的自动提示词优化(APO)能力。该基准测试了 6 种 APO 算法在 8 个目标模型上的表现,其中最强的 Gemini 3.5 Flash 谜题解题率仅约 55%,且完整评测成本约 $800。相关谜题、优化与评估代码及数据集更新脚本已全部开源。

来源:arXiv 人工智能 · arxiv.org