跳到正文

评测基准

模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化的持续记录。

最新精选

第 21–26 条 · 共 26 条
8月12日周三
8月11日周二
  1. Hugging Face66

    IBM 研究团队对比 ALTK-Evolve 与 ACE:按需交付智能体记忆可大幅削减 Token 消耗

    IBM Research 公布 ALTK-Evolve 与 ACE 智能体记忆机制的对比评测,表明通过按需检索与动态交付经验规则,能在保持或提升 AppWorld 任务准确率的同时显著降低推理 Token 消耗。

    推荐理由:IBM Research 对比了 ALTK-Evolve 与 ACE 在智能体记忆交付上的机制差异,展示了按需检索经验规则以大幅降低推理 Token 成本的可行性。

7月15日周三
  1. Hugging Face60

    Hugging Face 推出 Real World VoiceEQ 语音 AI 评测基准

    Hugging Face 推出 Real World VoiceEQ 评测基准,旨在衡量语音 AI 在真实复杂对话中的拟人交互质量。该基准基于超过 100 万次人类评分,包含 78.5 万条 TTS 和 4.8 万条 STS 评分,涵盖 15 个以上评估维度与 60 多项指标,对 40 多个主流开源及专有模型展开了评测。

    推荐理由:该基准基于超百万次人类评分评估语音交互的拟人表现,揭示了传统指标高估现实能力的短板,为检验语音感知提供了新参考。

  2. MIT News · AI67

    MIT 举办 JARVIS 挑战赛:测试 AI 副驾驶辅助制造喷气发动机的工程能力

    MIT 航空航天系举办 JARVIS 挑战赛,组织 31 名本科生在 4 周内借助生成式 AI 探索设计、制造与测试推力 50–100 磅的小型喷气发动机。各团队通过 MIT Parley 平台调用前沿大语言模型加速了文献查阅、软件学习和架构比选,但模型幻觉、缺乏物理直觉以及供应链制造延迟成为主要制约。

    推荐理由:实测记录了学生借助大模型设计喷气发动机的过程,揭示了 AI 辅助复杂硬件工程时的提效空间与物理制造瓶颈。

10月5日周日
  1. Sebastian Raschka66

    从零理解大模型评测的 4 种主流方法

    Sebastian Raschka 撰文详解并用代码实操了大模型评测的 4 大主流方法,将其归纳为基准测试与裁判评估两大类。内容涵盖 MMLU 多选题准确率评测、面向数学和代码领域的确定性验证器(Verifier)、LM Arena 风格的 Elo 偏好排行榜,以及通过 Ollama 调用大模型充当裁判(LLM-as-a-judge)的具体实现与优缺点权衡。

    推荐理由:原文从零代码拆解了多选题、验证器、排行榜和 LLM 裁判四类评测机制,有助于读者厘清基准测试的局限与组合评估策略。

8月20日周三
  1. SemiAnalysis · 算力产业77

    SemiAnalysis 发布 H100 与 GB200 NVL72 训练基准评测:功耗、TCO 与可靠性分析

    SemiAnalysis 发布 H100 与 GB200 NVL72 的训练基准与 TCO 测算,指出 GB200 NVL72 的每 GPU 综合 TCO 约是 H100 的 1.6 倍,实际训练性能需至少提升 1.6 倍才具备成本优势。

    推荐理由:报告通过实际集群实测对比了芯片全周期 TCO,量化了新架构在可靠性不足与软件未成熟时的真实成本门槛。