跳到正文
9月29日周二
  1. arXiv 机器学习35

    EEGAgentBench:短程与长程脑电分析的 LLM 智能体评测基准

    EEGAgentBench 是系统评测 LLM 智能体短程与长程脑电(EEG)分析能力的统一基准。该基准涵盖从知识问答到睡眠分期的 6 项代表性应用,跨越 2 秒至近 23 小时信号时长,并提供 10 种确定性分析工具供模型自主调用。对 15 个模型族的 29 款前沿 LLM 评测显示,现有智能体在长程 EEG 分析的持续证据积累与多步推理上仍存在显著局限。

  2. arXiv 人工智能39

    ConflictVLA-Bench:评测 VLA 模型对前提冲突的行为响应

    研究人员提出评测基准 ConflictVLA-Bench,基于 LIBERO 构建 2,826 个冲突任务,用于评估 VLA 模型应对无效任务前提的行为响应与执行过程。在评测的 8 个 VLA 模型中,无效前提导致目标完成率至少下降 17.3 个百分点,OpenVLA 下降达 56.2 个百分点。结果显示模型普遍存在继续盲目逼近目标的“失败持续性”,显式前提检查也未能稳定产生协调的行为改变。

9月28日周一
9月25日周五
9月24日周四
9月23日周三
9月22日周二
  1. Simon Willison75

    Simon Willison 解读 TypeSafe AI 新型决策模型 Jev 与系统一架构

    TypeSafe AI 推出新型模型 Jev,主打输入非结构化文本并直接输出分类、评分与布尔判断等类型化浮点概率决策。该模型输出免费且输入价格为 $0.042 per M tokens,支持在上下文窗口内并行评估多个问题,适用于垃圾检测、标签推荐与搜索重排序等分类任务。Simon Willison 指出 Jev 带来了更彻底的黑盒特性与潜在偏见风险,当前社区已出现开源权重复现项目及评测基准。

    推荐理由:原文详细拆解了仅输出类型化浮点概率的决策模型机制与定价特点,有助于读者理解分类与重排序场景下降低成本的新架构路径。

9月20日周日
  1. 腾讯混元 公众号49

    腾讯混元等提出 WebCraftBench:面向 AI 网页生成的实测评测基准

    腾讯混元团队联合清华大学、北京大学提出 AI 网页生成评测基准 WebCraftBench,引入代码覆盖率引导智能体实际操作网页,并从美观度、易用性和需求符合度三个维度打分。该基准包含 369 条真实需求与 5,088 条验收标准,在 17 个前沿模型实测中 Claude-Opus-5 综合排名第一,且在 197 组对比中与人类偏好的判断一致率达 85.3%。

9月19日周六
9月17日周四
  1. Apple Machine Learning Research39

    REVERSAL-BENCH:用于度量无重置强化学习断崖的可逆性轴与重置预言机

    研究人员推出强化学习基准 REVERSAL-BENCH,通过连续参数 ρ∈ [0, 1] 控制环境可逆性,并提供验证状态可恢复性的重置预言机。评测显示无重置智能体存在显著的可逆性断崖,会永久陷入不可恢复状态导致学习终止,证实该崩溃因果性地由不可逆性驱动。该基准套件涵盖 5 个物理引擎中的 8 种操作设置并开放数据集。

  2. NVIDIA Developer Blog40

    TensorRT Edge-LLM 在 Jetson AGX Thor 上运行 MLPerf 边缘智能体基准测试提速 6.4 倍

    TensorRT Edge-LLM 在 NVIDIA Jetson AGX Thor 上将 MLPerf Edge 智能体基准测试的完成速度提升了 6.4 倍。随着 AI 智能体从云端数据中心走向汽车、机器人等边缘设备,其需要执行工具选择与长对话推理等多步工作流,对边缘推理的速度和 token 生成能力提出了更高要求。

9月16日周三
  1. NVIDIA · AI 筛选76

    NVIDIA Vera Rubin NVL72 首度亮相 MLPerf Inference v6.1 评测

    NVIDIA 在 MLPerf Inference v6.1 预览评测中展示了 Vera Rubin NVL72 系统,在 Qwen3-VL 任务上的吞吐量达到 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上的吞吐量最高达到 2.5 倍。

    推荐理由:原文通过实测基准数据对比了新一代架构在长上下文与多模态模型上的吞吐与扩展效率,便于评估大模型推理基础设施的代际演进。

9月2日周三
  1. Hugging Face64

    AllenAI 推出 BenchMIRT:基于多维项目反应理论审计 LLM 基准测试

    AllenAI 推出 BenchMIRT 评估方法,利用多维项目反应理论在单题层级审计 LLM 基准测试实际衡量的潜在能力,并开源了代码、数据与技术报告。该方法分析了 100 个大模型在 16 个基准中超过 34K 道题目的表现,独立分离出安全性和通用推理两大主维度,发现 BBQ 与 WMDP 等传统安全基准的得分受通用推理能力影响更显著。

    推荐理由:该方法引入多维项目反应理论拆解评测题目实际测量的能力维度,有助于研究者诊断基准中的混杂信号并精简测试集。

8月28日周五
8月27日周四
  1. Google DeepMind64

    Google DeepMind 试点双盲 AI 评测以防止基准污染

    Google DeepMind 联合新加坡 AI 安全研究所、OpenMined、AVERI 及 MLCommons 试点双盲 AI 评测机制,旨在解决基准污染问题。该方案将外部评测置于密码学安全环境中,确保模型在测试前无法接触保密题目以人为刷高分数,本次试点已在隐私保护环境中对 Gemini Flash Lite 模型展开保密基准测试。

    推荐理由:原文介绍了用密码学安全环境隔离测试集以防止基准污染的机制,读者可以了解前沿模型第三方评测如何提升真实可信度。

8月21日周五
  1. Hugging Face73

    Hugging Face 评估语音识别模型基准过拟合现象

    Hugging Face 发布研究评估了 11 款主流开源 ASR 模型的基准过拟合现象,发现部分低 WER 高分模型会依据声学线索复现基准参考文本中的错误甚至补全被静音的数字。研究设计了参考文本不一致、掩码实体检索和正字法切换三项测试,并在 Open ASR Leaderboard 上线了基准拟合分析标签页与开源脚本。

    推荐理由:研究设计了量化 ASR 模型刷榜过拟合的具体探针方法,读者可据此审视公开基准分数的真实泛化能力。

8月19日周三
8月13日周四
  1. Hugging Face78

    Hugging Face 总结 ICML 2026 论文大规模智能体复现挑战赛经验

    Hugging Face 总结了社区利用编码智能体对 ICML 2026 论文开展的大规模复现挑战赛,在 19 天内针对 2,226 篇论文完成了 6,816 份复现记录并裁决了 35,908 项科研主张。

    推荐理由:原文展示了利用编码智能体规模化复现学术论文的实测数据与局限,为自动化科研审计与人机协同评测提供了可参考的范式。

  2. Microsoft Research45

    MindTopo 揭示 VLM 的空间拓扑推理能力

    MindTopo 评测基准针对多模态模型(VLM)发布,旨在从连通性、分离、顺序、包围与绳结五个维度评估其空间拓扑推理与交互规划能力。测试显示,主流闭源与开源模型在静态识别上的表现普遍优于交互规划,但整体均远落后于人类水平。模型的失败主要集中在多步规划阶段,容易在动态变化中丢失结构追踪或违反物理约束。

8月12日周三
8月11日周二
  1. Hugging Face66

    IBM 研究团队对比 ALTK-Evolve 与 ACE:按需交付智能体记忆可大幅削减 Token 消耗

    IBM Research 公布 ALTK-Evolve 与 ACE 智能体记忆机制的对比评测,表明通过按需检索与动态交付经验规则,能在保持或提升 AppWorld 任务准确率的同时显著降低推理 Token 消耗。

    推荐理由:IBM Research 对比了 ALTK-Evolve 与 ACE 在智能体记忆交付上的机制差异,展示了按需检索经验规则以大幅降低推理 Token 成本的可行性。

7月16日周四
  1. Hugging Face35

    DharmaOCR:面对更新模型,垂直专精优势依旧

    DharmaOCR 在巴西葡萄牙语基准测试中取得 0.925 分,显著领先更新的 Mistral OCR4(0.798 分)和 Unlimited-OCR(0.7587 分)。该模型通过监督微调将全部参数容量集中于目标语言结构,并引入直接偏好优化(DPO)抑制重复与不连贯输出。测试结果表明,垂直领域专精训练在复杂文档抽取质量和推理稳定性上明显优于多语言通用模型。

7月15日周三
  1. Hugging Face60

    Hugging Face 推出 Real World VoiceEQ 语音 AI 评测基准

    Hugging Face 推出 Real World VoiceEQ 评测基准,旨在衡量语音 AI 在真实复杂对话中的拟人交互质量。该基准基于超过 100 万次人类评分,包含 78.5 万条 TTS 和 4.8 万条 STS 评分,涵盖 15 个以上评估维度与 60 多项指标,对 40 多个主流开源及专有模型展开了评测。

    推荐理由:该基准基于超百万次人类评分评估语音交互的拟人表现,揭示了传统指标高估现实能力的短板,为检验语音感知提供了新参考。

  2. MIT News · AI67

    MIT 举办 JARVIS 挑战赛:测试 AI 副驾驶辅助制造喷气发动机的工程能力

    MIT 航空航天系举办 JARVIS 挑战赛,组织 31 名本科生在 4 周内借助生成式 AI 探索设计、制造与测试推力 50–100 磅的小型喷气发动机。各团队通过 MIT Parley 平台调用前沿大语言模型加速了文献查阅、软件学习和架构比选,但模型幻觉、缺乏物理直觉以及供应链制造延迟成为主要制约。

    推荐理由:实测记录了学生借助大模型设计喷气发动机的过程,揭示了 AI 辅助复杂硬件工程时的提效空间与物理制造瓶颈。

4月9日周四
  1. Google Research46

    ConvApparel:衡量并弥合用户模拟器的真实感差距

    Google Research 推出数据集与评估框架 ConvApparel,旨在衡量并弥合大语言模型用户模拟器与真实人类行为之间的真实感差距。该数据集包含服装导购场景下超过 4,000 场人机多轮对话(近 15,000 轮),采用优质与劣质双 AI 智能体收集从满意到沮丧的真实反应。研究团队结合群体统计对齐、拟人度评分与反事实验证,全面评估模拟器的泛化适应能力。

4月1日周三
  1. Google Research50

    Google Research:构建更好的 AI 评测基准需要多少名标注员?

    Google Research 的研究表明,AI 评测常用的单样本 1 至 5 名标注员标准不足以捕捉人类真实分歧,通常需要 10 名以上标注员才能保证可靠性。团队在 GitHub 开源了评估模拟器,证实依据评测指标合理权衡样本量与标注人数后,仅需约 1,000 次总标注量即可达成高复现性。

3月5日周四
10月5日周日
  1. Sebastian Raschka66

    从零理解大模型评测的 4 种主流方法

    Sebastian Raschka 撰文详解并用代码实操了大模型评测的 4 大主流方法,将其归纳为基准测试与裁判评估两大类。内容涵盖 MMLU 多选题准确率评测、面向数学和代码领域的确定性验证器(Verifier)、LM Arena 风格的 Elo 偏好排行榜,以及通过 Ollama 调用大模型充当裁判(LLM-as-a-judge)的具体实现与优缺点权衡。

    推荐理由:原文从零代码拆解了多选题、验证器、排行榜和 LLM 裁判四类评测机制,有助于读者厘清基准测试的局限与组合评估策略。

8月20日周三
  1. SemiAnalysis · 算力产业77

    SemiAnalysis 发布 H100 与 GB200 NVL72 训练基准评测:功耗、TCO 与可靠性分析

    SemiAnalysis 发布 H100 与 GB200 NVL72 的训练基准与 TCO 测算,指出 GB200 NVL72 的每 GPU 综合 TCO 约是 H100 的 1.6 倍,实际训练性能需至少提升 1.6 倍才具备成本优势。

    推荐理由:报告通过实际集群实测对比了芯片全周期 TCO,量化了新架构在可靠性不足与软件未成熟时的真实成本门槛。