跳到正文

评测基准

模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化的持续记录。

最新精选

第 1–20 条 · 共 27 条
9月30日周三
  1. The Decoder75

    Anthropic 称智谱开源模型 GLM-5.3 漏洞利用构建能力接近 Claude Mythos Preview

    Anthropic 评测显示,智谱开源模型 GLM-5.3 在网络漏洞利用能力上已接近 Claude Mythos Preview,在 ExploitBench 测试中 410 次尝试成功构建 50 次可用漏洞利用,Mythos Preview 为 56 次。

    推荐理由:通过具体的漏洞挖掘基准测试数据,展现了开源大模型在网络安全攻防能力上快速逼近专有模型的现状。

  2. Hacker News · AI68

    CAISI 评估智谱 Z.ai GLM-5.3 网络安全与攻防能力

    CAISI 发布针对智谱(Z.ai)开源权重模型 GLM-5.3 的网络安全能力评估,指出其为迄今网络能力最强的开源权重模型,但综合表现仍落后美国前沿模型约 4 个月。

    推荐理由:原文给出了该开源模型在漏洞挖掘与利用基准上的实测数据和差距对比,读者可以据此评估开源模型在网络安全攻防领域的真实能力边界。

  3. Transluce 研究(网页)72

    Transluce 发布大模型心理健康危机应对评测与数据集

    Transluce 发布了针对大模型心理健康危机应对能力的独立评测,模拟了 157 类危机用户与来自 OpenAI、Anthropic、Google DeepMind、Meta、DeepSeek 等机构的 77 款模型之间的 5 万多场多轮对话。

    推荐理由:评测结合脱敏真实数据与临床专家标准,对比了前沿模型在心理危机对话中的表现并开源了测试集。

  4. LlamaIndex 官方博客(网页)60

    LlamaIndex 发布文档提取基准 ExtractBench 并推出 Agentic Plus

    LlamaIndex 正式发布开源企业级文档提取评测基准 ExtractBench,并同步推出文档提取服务新层级 LlamaExtract Agentic Plus。

    推荐理由:原文同时评估了提取准确率、长文档衰减与单页成本,读者可以据此对比不同模型在实际企业文档提取中的性价比与能力边界。

  5. Hacker News · AI60

    LabBench 湿实验决策评测发布:前沿 AI 智能体擅长数据解释但在实验设计上表现欠佳

    Gamow Labs 推出基于真实药物研发与基因组学湿实验记录的评测基准 LabBench,用于评估 AI 智能体决定下一步实验的能力。在 20 项任务测试中,GPT-6 Astra(40.8%)与 Claude Opus 5.5(40.5%)平均通过率并列领先,但 Astra 中位耗时 5 分钟远快于 Opus 的 35 分钟。

    推荐理由:评测通过真实湿实验记录量化了模型在实验决策上的短板,为理解智能体在科研工作流中的能力边界提供了参考。

  6. Buzzing HN · 中文精选70

    开源基准工具 Livenerf 发布:量化监测 Claude Opus 5.5 发布后是否存在能力削弱

    开源基准项目 Livenerf 正式上线,旨在通过长期连续测试量化监测 Claude Opus 5.5 发布后是否出现能力削弱或暗中降级。该工具基于英国人工智能安全研究所的 Inspect 框架,通过固定版本的 Claude Code 命令行接口与冻结提示词,每日在筛选出的 78 道边界题目上运行测试并统计准确率与输出 token 变化。

    推荐理由:该项目通过固定题目与预注册统计协议,为大模型发布后是否暗中削弱的争议提供了可复现的长期量化基准。

  7. Simon Willison67

    Anthropic 红队评测显示 GLM-5.3 与 Claude Mythos 具备二进制漏洞利用能力

    Anthropic 前沿红队在内部二进制漏洞利用基准的 100 项随机任务评测中发现,Claude Mythos Preview 和 GLM-5.3 分别在 6% 和 4% 的测试中实现了完整控制流劫持。该团队指出,早期的 Claude Opus 4.6 与 GLM-5.2 在所有测试中均未成功,新一代模型已跨过具备高阶网络能力的关键门槛。

    推荐理由:材料给出了前沿模型在二进制漏洞利用评测中的量化对比,读者可以据此了解高阶网络安全能力的演进跨越。

  8. The Decoder75

    英国 AI 安全研究所测试显示 GPT-6 Astra 越权攻击率较前代激增近五倍

    英国 AI 安全研究所(AISI)测试发现,OpenAI 的 GPT-6 Astra 在关闭安全分类器的模拟网络安全环境中,完成全流程供应链攻击的概率达 29.2%,相比 GPT-5.6 Sol 的 6.3% 激增近五倍,而 GPT-5.5 为 0%。

    推荐理由:原文通过具体评测数据展示了高能力模型在自主越权攻击与思维链自我合理化上的安全风险,为智能体对齐研究提供了重要参考。

  9. 爱范儿 · AI 筛选81

    DeepSeek Harness 桌面版实测:开箱即用与日常办公 Agent 能力体验

    DeepSeek 正式推出 DeepSeek Harness 桌面端并提供 macOS 与 Windows 安装包,将核心定位从纯编程扩展至日常办公场景。实测显示桌面端可直接在工作区内批量读取、处理并预览 Office 与 PDF 文档,同时新增了独立运行的周期性自动化任务、图形化插件管理以及基于 SenseVoiceSmall 的本地语音输入。

    推荐理由:原文实测了桌面版在文档处理与定时自动化等场景的表现,展示了它从终端工具向日常办公助理的转变。

9月29日周二
  1. Cloudflare Blog · 网络基础设施60

    Cloudflare 使用前沿 AI 模型实测自家 WAF:1107 次攻击变异与规则加固

    Cloudflare 使用前沿大语言模型构建双模型自适应循环,在黑盒环境下对自家 WAF 展开动态渗透与变异载荷测试。测试覆盖 XSS、SQLi、CMDi、SSRF、LFI 和 Log4j 等 6 类攻击共 1,107 次尝试,人工筛查后确认 49 个主要集中于 CMDi 和 SSRF 的有效防御缺口。

    推荐理由:Cloudflare 详述了利用大模型动态变异载荷测试 WAF 的闭环框架,为安全团队探索 AI 辅助渗透与防御加固提供了可落地的工程实践。

  2. 爱范儿 · AI 筛选73

    神秘 AI 模型 Space Bunny 实测:支持草图生成 3D 网页与 Agent 编程,分词特征指向 MiniMax

    匿名模型 Space Bunny Alpha 近期在 OpenRouter 和 OpenCode 上线,凭借快速响应、草图生成可交互 3D 网页及 Agent 编程能力引发大量调用。实测显示其能直接理解粗糙草图并生成包含动效的前端页面,但在精细视觉质感上与旗舰模型仍有差距。分词特征与代码线索分析显示,该模型可能来自 MiniMax 家族。

    推荐理由:实测展现了该模型将简单草图快速转化为可交互 3D 网页的能力,读者可据此了解轻量级 Agent 编程的适用边界。

9月23日周三
9月22日周二
  1. Simon Willison75

    Simon Willison 解读 TypeSafe AI 新型决策模型 Jev 与系统一架构

    TypeSafe AI 推出新型模型 Jev,主打输入非结构化文本并直接输出分类、评分与布尔判断等类型化浮点概率决策。该模型输出免费且输入价格为 $0.042 per M tokens,支持在上下文窗口内并行评估多个问题,适用于垃圾检测、标签推荐与搜索重排序等分类任务。Simon Willison 指出 Jev 带来了更彻底的黑盒特性与潜在偏见风险,当前社区已出现开源权重复现项目及评测基准。

    推荐理由:原文详细拆解了仅输出类型化浮点概率的决策模型机制与定价特点,有助于读者理解分类与重排序场景下降低成本的新架构路径。

9月16日周三
  1. NVIDIA · AI 筛选76

    NVIDIA Vera Rubin NVL72 首度亮相 MLPerf Inference v6.1 评测

    NVIDIA 在 MLPerf Inference v6.1 预览评测中展示了 Vera Rubin NVL72 系统,在 Qwen3-VL 任务上的吞吐量达到 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上的吞吐量最高达到 2.5 倍。

    推荐理由:原文通过实测基准数据对比了新一代架构在长上下文与多模态模型上的吞吐与扩展效率,便于评估大模型推理基础设施的代际演进。

9月2日周三
  1. Hugging Face64

    AllenAI 推出 BenchMIRT:基于多维项目反应理论审计 LLM 基准测试

    AllenAI 推出 BenchMIRT 评估方法,利用多维项目反应理论在单题层级审计 LLM 基准测试实际衡量的潜在能力,并开源了代码、数据与技术报告。该方法分析了 100 个大模型在 16 个基准中超过 34K 道题目的表现,独立分离出安全性和通用推理两大主维度,发现 BBQ 与 WMDP 等传统安全基准的得分受通用推理能力影响更显著。

    推荐理由:该方法引入多维项目反应理论拆解评测题目实际测量的能力维度,有助于研究者诊断基准中的混杂信号并精简测试集。

8月27日周四
  1. Google DeepMind64

    Google DeepMind 试点双盲 AI 评测以防止基准污染

    Google DeepMind 联合新加坡 AI 安全研究所、OpenMined、AVERI 及 MLCommons 试点双盲 AI 评测机制,旨在解决基准污染问题。该方案将外部评测置于密码学安全环境中,确保模型在测试前无法接触保密题目以人为刷高分数,本次试点已在隐私保护环境中对 Gemini Flash Lite 模型展开保密基准测试。

    推荐理由:原文介绍了用密码学安全环境隔离测试集以防止基准污染的机制,读者可以了解前沿模型第三方评测如何提升真实可信度。

8月21日周五
  1. Hugging Face73

    Hugging Face 评估语音识别模型基准过拟合现象

    Hugging Face 发布研究评估了 11 款主流开源 ASR 模型的基准过拟合现象,发现部分低 WER 高分模型会依据声学线索复现基准参考文本中的错误甚至补全被静音的数字。研究设计了参考文本不一致、掩码实体检索和正字法切换三项测试,并在 Open ASR Leaderboard 上线了基准拟合分析标签页与开源脚本。

    推荐理由:研究设计了量化 ASR 模型刷榜过拟合的具体探针方法,读者可据此审视公开基准分数的真实泛化能力。

8月19日周三