跳到正文
原文
arXiv 自然语言处理· Jiayi Geng, Zhengxuan Wu, Kevin S. Chen, Seungone Kim, Joseph Janssen, Zora Zhiruo Wang, Bhupalee Kalita, Runtian Gao, Aaron Ho, Andrew Oakleigh Nelson, Olexandr Isayev, Francisco Villaescusa-Navarro, Ching-Yao Lai, Howard Chen, Graham Neubig·· 5 小时前AI 评分53

EurekaBench:评测 AI Agent 发现新科学见解能力的跨学科基准

EurekaBench: Measuring Agentic Ability to Discover New Scientific Insights

AI 导读

研究团队推出跨学科基准 EurekaBench,用于评估 AI Agent 进行长流程实验并发现解释性科学机制的能力。该基准涵盖神经科学、化学、天体物理学等 6 个领域的 26 个长程任务及 306 个科学见解,从约束遵循、预测精度和见解推导三个维度进行评估。测试结果显示当前 Agent 虽然在预测精度优化上超过人类科学家,但在推导实质性科学见解方面仍存在显著差距。

来源:arXiv 自然语言处理 · arxiv.org