LabBench 评测 AI 智能体湿实验决策能力:模型长于数据解释却难选下一步实验
Gamow Labs 推出基于真实药物发现与基因组学湿实验记录的评测基准 LabBench,测试前沿 AI 智能体自主决策后续实验步骤的能力。结果显示 GPT-6 Astra 与 Claude Opus 5.5 分别以 40.8% 和 40.5% 的标准通过率领跑,但 Astra 耗时中位数 5 分钟远快于 Opus 的 35 分钟。
推荐理由:基准揭示了前沿模型在生物实验中分析能力与决策行动力之间的明显落差,为评估科学智能体提供了量化参考。