研究团队推出AI科研实验能力基准TasteVal
先了解这件事
研究团队推出基准测试 TasteVal,用于评估前沿 AI 模型在固定科研问题下迭代设计实验与解读结果的能力。该基准涵盖 8 项开放式 AI 研发任务,并将模型的表现量化为相对人类专家的算力效率乘数。在测试设置上,TasteVal 将实验设计与代码实现分离,由被测模型担任研究员,固定的编码智能体在单张 H100 上执行具体代码。测试结果显示,Opus 5.5 达到了人类专家基准 2.3 倍的算力效率,同时单次尝试成本仅约为人类专家的三十分之一。此外,测试数据显示,前沿模型的该指标自 2025 年 12 月起约每 3 个月翻倍。
AI 根据报道生成 · 28 分钟前更新
报道时间线
沿着报道,了解事件的不同侧面。
- Hacker News · AITasteVal 基准提出:对比人类专家衡量 AI 系统的实验研究品味
研究团队提出 TasteVal 基准,用于评估前沿大模型在固定科研问题下迭代设计实验与解读结果的实验研究品味。该基准将研究品味量化为算力效率乘数,在 8 项开放式 AI 研发任务中由被测模型担任研究员、固定 Coder 负责代码实现。测试显示 Opus 5.5 算力乘数达到人类专家的 2.3 倍且单次运行成本仅为其约三十分之一,前沿模型的该指标自 2025 年 12 月起约每 3 个月翻倍。
- Hacker News · AI精选TasteVal 基准发布:评估 AI 模型的科研实验品味
研究团队推出基准测试 TasteVal,通过 8 项前沿 AI 研发任务评估模型迭代设计实验与得出结论的能力,并将其量化为相对人类专家的算力效率。测试将实验设计与代码实现分离,由固定的编码智能体在单张 H100 上执行;结果显示 Opus 5.5 达到人类专家基准 2.30x 的算力效率,单次尝试成本约为专家的 1/30。
本事件热度走势
当前热度 10·可比范围峰值 10(10月7日 00:00)·近 24 小时可比范围变化 –
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。