Hacker News · AI· wardbradt·· 13 小时前精选AI 评分60
LabBench 湿实验决策评测发布:前沿 AI 智能体擅长数据解释但在实验设计上表现欠佳
LabBench: Can AI agents decide what experiment to run next?
AI 导读
Gamow Labs 推出基于真实药物研发与基因组学湿实验记录的评测基准 LabBench,用于评估 AI 智能体决定下一步实验的能力。在 20 项任务测试中,GPT-6 Astra(40.8%)与 Claude Opus 5.5(40.5%)平均通过率并列领先,但 Astra 中位耗时 5 分钟远快于 Opus 的 35 分钟。
推荐理由
评测通过真实湿实验记录量化了模型在实验决策上的短板,为理解智能体在科研工作流中的能力边界提供了参考。
来源:Hacker News · AI · gamowlabs.com