Hacker News · AI· Betelbuddy·· 2 小时前AI 评分56
TasteVal 基准提出:对比人类专家衡量 AI 系统的实验研究品味
Measuring the Experimental Research Taste of AI Systems Against Human Experts
AI 导读
研究团队提出 TasteVal 基准,用于评估前沿大模型在固定科研问题下迭代设计实验与解读结果的实验研究品味。该基准将研究品味量化为算力效率乘数,在 8 项开放式 AI 研发任务中由被测模型担任研究员、固定 Coder 负责代码实现。测试显示 Opus 5.5 算力乘数达到人类专家的 2.3 倍且单次运行成本仅为其约三十分之一,前沿模型的该指标自 2025 年 12 月起约每 3 个月翻倍。
来源:Hacker News · AI · arxiv.org