arXiv 自然语言处理· Jiayi Geng, Zhengxuan Wu, Kevin S. Chen, Seungone Kim, Joseph Janssen, Zora Zhiruo Wang, Bhupalee Kalita, Runtian Gao, Aaron Ho, Andrew Oakleigh Nelson, Olexandr Isayev, Francisco Villaescusa-Navarro, Ching-Yao Lai, Howard Chen, Graham Neubig·· 5 小时前AI 评分53
EurekaBench:评测 AI Agent 发现新科学见解能力的跨学科基准
EurekaBench: Measuring Agentic Ability to Discover New Scientific Insights
AI 导读
研究团队推出跨学科基准 EurekaBench,用于评估 AI Agent 进行长流程实验并发现解释性科学机制的能力。该基准涵盖神经科学、化学、天体物理学等 6 个领域的 26 个长程任务及 306 个科学见解,从约束遵循、预测精度和见解推导三个维度进行评估。测试结果显示当前 Agent 虽然在预测精度优化上超过人类科学家,但在推导实质性科学见解方面仍存在显著差距。
来源:arXiv 自然语言处理 · arxiv.org