跳到正文
原文
arXiv 人工智能· Zhiyi Li, Sihan Hu, Tianning Xiao, Xiansheng Cai, Xiaojun Tan, Youjin Deng, Kun Chen·· 3 小时前AI 评分43

OpenProblemBench:在基础理论科学未解问题上评测 AI

OpenProblemBench: Benchmarking AI on Open Problems in the Foundational Theoretical Sciences

AI 导读

研究人员推出基准测试 OpenProblemBench,包含来自数学和理论物理文献的 82 道未解决问题,用于评估 AI 超越既有知识解决开放性科学难题的能力。评测由 4 个评估模型在无参考答案下独立打分,在 7 种测试配置中,GPT-6-Astra 取得最高的 14.0% 平均解决率,高于全尺寸开源模型的 5.5-6.7% 和 Flash 模型的 2.4-3.7%。

来源:arXiv 人工智能 · arxiv.org