跳到正文
原文
Hacker News · AI· luhe1900·· 3 小时前精选AI 评分74

为什么 AI 基准的 82% 实际只有 57%:金融 Agent 评测的水分与折算指南

AI Benchmark Scores: Why 82% is actually 57%

AI 导读

公开 AI 基准得分存在严重虚高,模型在经过清洗的输入、单次运行与宽松评分下的高分无法直接反映真实业务可靠性。在 OfficeQA Pro 等基准中,直接提供清洗后的文本比原始 PDF 能使得分提升 19 到 29 个百分点,其效果甚至超过数月间的模型迭代;同时单次通过率 Pass@1 掩盖了多次执行的波动,Pass^4 与 Pass@4 差距可达 17 到 31 个百分点。

推荐理由

文章拆解了主流智能体榜单与实际业务交付的差距,为评估真实工作流提供了可落地的评测自建标准。

来源:Hacker News · AI · lessuncertain.substack.com