跳到正文
原文
arXiv 人工智能· Chenmu Zhang, Levi Felix, Jun-Jie Zhang, Xingfu Li, Xuelian Jiang, Tao Jiang, Subhendu Mishra, Xixi Qin, Boris Yakobson·· 4 小时前AI 评分39

CompMat-Bench:面向计算材料学 AI 智能体的评测基准

CompMat-Bench: Benchmarking AI Agents for Computational Materials Science

AI 导读

研究人员推出计算材料学 AI 智能体评测基准 CompMat-Bench,包含源自真实研究的 94 个任务,通过提前复现步骤来评测输入准备与结果分析,免去评测中的高成本仿真。该基准采用固定规则打分且无需 LLM 裁判,测试中基于 3 个 LLM 的智能体在全指导单一任务下的通过率达 66.0-90.4%,失败分析显示多数错误源于科学理解而非软件操作。

来源:arXiv 人工智能 · arxiv.org