跳到正文
原文
Hacker News · AI· lukaspetersson·· 3 小时前精选AI 评分60

TasteVal 基准发布:评估 AI 模型的科研实验品味

TasteVal: Does AI have research taste?

AI 导读

研究团队推出基准测试 TasteVal,通过 8 项前沿 AI 研发任务评估模型迭代设计实验与得出结论的能力,并将其量化为相对人类专家的算力效率。测试将实验设计与代码实现分离,由固定的编码智能体在单张 H100 上执行;结果显示 Opus 5.5 达到人类专家基准 2.30x 的算力效率,单次尝试成本约为专家的 1/30。

推荐理由

原文将科研品味量化为达到人类专家水准所需的算力效率,为衡量 AI 自动化研发能力提供了可复用的评测方法。

来源:Hacker News · AI · pzeroresearch.com