跳到正文
热点事件持续更新

Gamow Labs推出湿实验AI评测基准LabBench

1 篇报道1 个报道来源9 小时前更新

先了解这件事

AI 综述

2026年9月30日,Gamow Labs 推出了基于真实药物研发与基因组学湿实验记录的评测基准 LabBench,用于评估 AI 智能体决定下一步实验的能力。评测结果显示,前沿 AI 智能体普遍擅长数据解释,但在实验设计方面表现欠佳。在包含的 20 项任务测试中,GPT-6 Astra 与 Claude Opus 5.5 分别取得 40.8% 和 40.5% 的平均通过率并列领先;而在耗时方面,GPT-6 Astra 的中位耗时为 5 分钟,显著快于 Claude Opus 5.5 的 35 分钟。

AI 根据报道生成 · 8 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

9月30日
  1. Hacker News · AI精选
    LabBench 湿实验决策评测发布:前沿 AI 智能体擅长数据解释但在实验设计上表现欠佳

    Gamow Labs 推出基于真实药物研发与基因组学湿实验记录的评测基准 LabBench,用于评估 AI 智能体决定下一步实验的能力。在 20 项任务测试中,GPT-6 Astra(40.8%)与 Claude Opus 5.5(40.5%)平均通过率并列领先,但 Astra 中位耗时 5 分钟远快于 Opus 的 35 分钟。

本事件热度走势

当前热度 8·可比范围峰值 10(9月30日 10:00)·近 24 小时可比范围变化 –

02.557.5109月30日10:009月30日12:009月30日15:009月30日17:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。