EEGAgentBench:短程与长程脑电分析的 LLM 智能体评测基准
EEGAgentBench 是系统评测 LLM 智能体短程与长程脑电(EEG)分析能力的统一基准。该基准涵盖从知识问答到睡眠分期的 6 项代表性应用,跨越 2 秒至近 23 小时信号时长,并提供 10 种确定性分析工具供模型自主调用。对 15 个模型族的 29 款前沿 LLM 评测显示,现有智能体在长程 EEG 分析的持续证据积累与多步推理上仍存在显著局限。
EEGAgentBench 是系统评测 LLM 智能体短程与长程脑电(EEG)分析能力的统一基准。该基准涵盖从知识问答到睡眠分期的 6 项代表性应用,跨越 2 秒至近 23 小时信号时长,并提供 10 种确定性分析工具供模型自主调用。对 15 个模型族的 29 款前沿 LLM 评测显示,现有智能体在长程 EEG 分析的持续证据积累与多步推理上仍存在显著局限。
研究人员提出评测基准 ConflictVLA-Bench,基于 LIBERO 构建 2,826 个冲突任务,用于评估 VLA 模型应对无效任务前提的行为响应与执行过程。在评测的 8 个 VLA 模型中,无效前提导致目标完成率至少下降 17.3 个百分点,OpenVLA 下降达 56.2 个百分点。结果显示模型普遍存在继续盲目逼近目标的“失败持续性”,显式前提检查也未能稳定产生协调的行为改变。
爱范儿发布荣耀Magic9 Pro Max 首发评测。原文正文未包含实际评测内容与具体规格数据,仅展示了爱范儿网站版权及 CC BY-NC 4.0 授权许可说明。
GPT-6 Astra 完成一份包含 50 个标签页的税务工作簿的速度是 GPT-5.6 Sol 的 2 倍。该模型对用户意图具备更强的理解能力,使 Basis 在实际业务场景中更具信心。
ASRock Rack 推出 SORANOD8-2L2T 主板,专为中端 SP6 平台的 AMD EPYC 8005“Sorano”处理器设计。该板采用 12 英寸 x 10 英寸的“ATX-like”板型,提供 8 个 DDR5 RDIMM 插槽,最高支持 2TB 内存与 DDR5-5200 速率。
SWE-Serve 基准揭示了 AI 编码智能体生成的补丁虽能通过单元测试但在实际加载模型提供服务时可能失效的问题。该评测结合 SGLang 团队的输入开发,包含 53 个任务,强调评估推理服务软件改动时必须覆盖包含公共接口返回结果在内的完整服务链路。
OpenAI 推出评测基准 MentalHealthBench。该基准结合专家专业意见构建,旨在评估 AI 在真实心理健康对话场景中回复的帮助性与安全性。
Anthropic 与 OpenAI 分别推出 Claude Opus 5.5 以及 GPT-6 Sol 和 GPT-6 Luna,新模型价格大幅下调并引发了新一轮 API 定价竞争。
推荐理由:原文对比了新一代模型的价格梯度与实测表现,读者可以据此评估不同推理级别在应用开发中的成本与限制。
英国人工智能安全研究所(UK AISI)正式采用 EvalEval 基础设施公开基准评测结果,利用 Evaluation Cards 平台与统一的 EEE 规范提升评测的可复现性与透明度。
推荐理由:通过统一元数据和运行配置公开评测记录,为行业对比前沿模型评测差异提供了标准化的复现参考。
TypeSafe AI 推出新型模型 Jev,主打输入非结构化文本并直接输出分类、评分与布尔判断等类型化浮点概率决策。该模型输出免费且输入价格为 $0.042 per M tokens,支持在上下文窗口内并行评估多个问题,适用于垃圾检测、标签推荐与搜索重排序等分类任务。Simon Willison 指出 Jev 带来了更彻底的黑盒特性与潜在偏见风险,当前社区已出现开源权重复现项目及评测基准。
推荐理由:原文详细拆解了仅输出类型化浮点概率的决策模型机制与定价特点,有助于读者理解分类与重排序场景下降低成本的新架构路径。
腾讯混元团队联合清华大学、北京大学提出 AI 网页生成评测基准 WebCraftBench,引入代码覆盖率引导智能体实际操作网页,并从美观度、易用性和需求符合度三个维度打分。该基准包含 369 条真实需求与 5,088 条验收标准,在 17 个前沿模型实测中 Claude-Opus-5 综合排名第一,且在 197 组对比中与人类偏好的判断一致率达 85.3%。
AIPerf 用于大规模评测大语言模型(LLM)的推理性能。在评估部署模型的推理速度时,常规的 curl 命令、手写 asyncio 脚本或临时负载生成器容易遭遇单进程性能瓶颈以及 Python 的 GIL 并发上限限制。AIPerf 旨在解决这些传统压测方式面临的并发瓶颈,支持高负载基准测试。
研究人员推出强化学习基准 REVERSAL-BENCH,通过连续参数 ρ∈ [0, 1] 控制环境可逆性,并提供验证状态可恢复性的重置预言机。评测显示无重置智能体存在显著的可逆性断崖,会永久陷入不可恢复状态导致学习终止,证实该崩溃因果性地由不可逆性驱动。该基准套件涵盖 5 个物理引擎中的 8 种操作设置并开放数据集。
TensorRT Edge-LLM 在 NVIDIA Jetson AGX Thor 上将 MLPerf Edge 智能体基准测试的完成速度提升了 6.4 倍。随着 AI 智能体从云端数据中心走向汽车、机器人等边缘设备,其需要执行工具选择与长对话推理等多步工作流,对边缘推理的速度和 token 生成能力提出了更高要求。
NVIDIA 在 MLPerf Inference v6.1 预览评测中展示了 Vera Rubin NVL72 系统,在 Qwen3-VL 任务上的吞吐量达到 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上的吞吐量最高达到 2.5 倍。
推荐理由:原文通过实测基准数据对比了新一代架构在长上下文与多模态模型上的吞吐与扩展效率,便于评估大模型推理基础设施的代际演进。
AllenAI 推出 BenchMIRT 评估方法,利用多维项目反应理论在单题层级审计 LLM 基准测试实际衡量的潜在能力,并开源了代码、数据与技术报告。该方法分析了 100 个大模型在 16 个基准中超过 34K 道题目的表现,独立分离出安全性和通用推理两大主维度,发现 BBQ 与 WMDP 等传统安全基准的得分受通用推理能力影响更显著。
推荐理由:该方法引入多维项目反应理论拆解评测题目实际测量的能力维度,有助于研究者诊断基准中的混杂信号并精简测试集。
Hugging Face 联合 Voice Arena 在 Open ASR Leaderboard 中上线 Monsoon 评测集,将印度英语和印地语纳入开源语音识别评测体系。
Google DeepMind 联合新加坡 AI 安全研究所、OpenMined、AVERI 及 MLCommons 试点双盲 AI 评测机制,旨在解决基准污染问题。该方案将外部评测置于密码学安全环境中,确保模型在测试前无法接触保密题目以人为刷高分数,本次试点已在隐私保护环境中对 Gemini Flash Lite 模型展开保密基准测试。
推荐理由:原文介绍了用密码学安全环境隔离测试集以防止基准污染的机制,读者可以了解前沿模型第三方评测如何提升真实可信度。
NVIDIA AVO 在 ARC-AGI-3 评测中达到 100%,展示了面向长程自主 AI 智能体的前沿级通用架构。该架构专注于大语言模型外围的智能体系统(harness)设计,旨在优化上下文接收、工具调用、状态维护、反馈响应与故障恢复能力,确保模型在长时间运行任务中可靠推进。
Hugging Face 发布研究评估了 11 款主流开源 ASR 模型的基准过拟合现象,发现部分低 WER 高分模型会依据声学线索复现基准参考文本中的错误甚至补全被静音的数字。研究设计了参考文本不一致、掩码实体检索和正字法切换三项测试,并在 Open ASR Leaderboard 上线了基准拟合分析标签页与开源脚本。
推荐理由:研究设计了量化 ASR 模型刷榜过拟合的具体探针方法,读者可据此审视公开基准分数的真实泛化能力。
IBM Research 在 AppWorld 基准上评估了 ALTK-Evolve 记忆机制在 8 个模型上的表现,发现 Agent 记忆并非越多越好,必须根据模型能力校准注入剂量。
推荐理由:原文通过多模型实测给出记忆注入策略,为开发者在智能体记忆构建与推理成本控制之间提供了量化参考。
Hugging Face 总结了社区利用编码智能体对 ICML 2026 论文开展的大规模复现挑战赛,在 19 天内针对 2,226 篇论文完成了 6,816 份复现记录并裁决了 35,908 项科研主张。
推荐理由:原文展示了利用编码智能体规模化复现学术论文的实测数据与局限,为自动化科研审计与人机协同评测提供了可参考的范式。
MindTopo 评测基准针对多模态模型(VLM)发布,旨在从连通性、分离、顺序、包围与绳结五个维度评估其空间拓扑推理与交互规划能力。测试显示,主流闭源与开源模型在静态识别上的表现普遍优于交互规划,但整体均远落后于人类水平。模型的失败主要集中在多步规划阶段,容易在动态变化中丢失结构追踪或违反物理约束。
Google Research 提出知识画像(knowledge profiling)分析框架与 WikiProfile 基准,指出前沿大语言模型的事实性瓶颈在于知识提取而非参数编码。
推荐理由:研究将大模型事实错误归因于提取而非编码瓶颈,为后训练与推理期事实检索优化提供了分析框架。
IBM Research 公布 ALTK-Evolve 与 ACE 智能体记忆机制的对比评测,表明通过按需检索与动态交付经验规则,能在保持或提升 AppWorld 任务准确率的同时显著降低推理 Token 消耗。
推荐理由:IBM Research 对比了 ALTK-Evolve 与 ACE 在智能体记忆交付上的机制差异,展示了按需检索经验规则以大幅降低推理 Token 成本的可行性。
DharmaOCR 在巴西葡萄牙语基准测试中取得 0.925 分,显著领先更新的 Mistral OCR4(0.798 分)和 Unlimited-OCR(0.7587 分)。该模型通过监督微调将全部参数容量集中于目标语言结构,并引入直接偏好优化(DPO)抑制重复与不连贯输出。测试结果表明,垂直领域专精训练在复杂文档抽取质量和推理稳定性上明显优于多语言通用模型。
Hugging Face 推出 Real World VoiceEQ 评测基准,旨在衡量语音 AI 在真实复杂对话中的拟人交互质量。该基准基于超过 100 万次人类评分,包含 78.5 万条 TTS 和 4.8 万条 STS 评分,涵盖 15 个以上评估维度与 60 多项指标,对 40 多个主流开源及专有模型展开了评测。
推荐理由:该基准基于超百万次人类评分评估语音交互的拟人表现,揭示了传统指标高估现实能力的短板,为检验语音感知提供了新参考。
MIT 航空航天系举办 JARVIS 挑战赛,组织 31 名本科生在 4 周内借助生成式 AI 探索设计、制造与测试推力 50–100 磅的小型喷气发动机。各团队通过 MIT Parley 平台调用前沿大语言模型加速了文献查阅、软件学习和架构比选,但模型幻觉、缺乏物理直觉以及供应链制造延迟成为主要制约。
推荐理由:实测记录了学生借助大模型设计喷气发动机的过程,揭示了 AI 辅助复杂硬件工程时的提效空间与物理制造瓶颈。
Google Research 推出数据集与评估框架 ConvApparel,旨在衡量并弥合大语言模型用户模拟器与真实人类行为之间的真实感差距。该数据集包含服装导购场景下超过 4,000 场人机多轮对话(近 15,000 轮),采用优质与劣质双 AI 智能体收集从满意到沮丧的真实反应。研究团队结合群体统计对齐、拟人度评分与反事实验证,全面评估模拟器的泛化适应能力。
Google Research 的研究表明,AI 评测常用的单样本 1 至 5 名标注员标准不足以捕捉人类真实分歧,通常需要 10 名以上标注员才能保证可靠性。团队在 GitHub 开源了评估模拟器,证实依据评测指标合理权衡样本量与标注人数后,仅需约 1,000 次总标注量即可达成高复现性。
AWS 深度解析了 Amazon EC2 Hpc8a 实例的硬件架构及其在工程与科学计算负载下的基准测试表现。Hpc8a 单实例提供 192 个物理核心(基于第五代 AMD EPYC 处理器并禁用 SMT)和 768 GiB 内存,结合 AWS Nitro System v6 与 300 Gbps EFA 网络降低通信延迟并提升内存带宽。
Sebastian Raschka 撰文详解并用代码实操了大模型评测的 4 大主流方法,将其归纳为基准测试与裁判评估两大类。内容涵盖 MMLU 多选题准确率评测、面向数学和代码领域的确定性验证器(Verifier)、LM Arena 风格的 Elo 偏好排行榜,以及通过 Ollama 调用大模型充当裁判(LLM-as-a-judge)的具体实现与优缺点权衡。
推荐理由:原文从零代码拆解了多选题、验证器、排行榜和 LLM 裁判四类评测机制,有助于读者厘清基准测试的局限与组合评估策略。
SemiAnalysis 发布 H100 与 GB200 NVL72 的训练基准与 TCO 测算,指出 GB200 NVL72 的每 GPU 综合 TCO 约是 H100 的 1.6 倍,实际训练性能需至少提升 1.6 倍才具备成本优势。
推荐理由:报告通过实际集群实测对比了芯片全周期 TCO,量化了新架构在可靠性不足与软件未成熟时的真实成本门槛。