跳到正文
今天9月30日周三
  1. Hacker News · AI41

    Codex GPT-6 Sol 性能追踪器

    Margin Evals 正在追踪 GPT-6 Sol/high 的表现,直接在 Codex CLI 中通过 SWE-Bench-Pro 精选子集每日收集基准数据。最新数据显示,该模型当日通过率为 54%(运行 50 个测试用例),过去 7 天通过率为 59%,过去 30 天通过率为 79%。在新模型基准建立完成前,性能退化检测功能暂处于暂停状态。

  2. arXiv 人工智能44

    MAADBench:面向多智能体系统异常检测的可刷新基准

    研究人员推出首个面向多智能体系统的可刷新异常检测基准 MAADBench,以应对大语言模型系统 41%-87% 的高故障率。该基准构建了约 10^37 任务空间并支持自动化步骤级标注,同时开源了包含 5,200 条标注轨迹的 MAADBench-Full 数据集。对 25 种异常检测方法的评测表明,现有方案高度依赖监督且缺乏跨 LLM 鲁棒性。

  3. arXiv 人工智能36

    GeoOutageBench:面向多模态停电与韧性分析的地理时空 KGQA 评测基准

    研究人员推出 GeoOutageBench,用于评测大语言模型在多模态电力停电与韧性分析中的地理时空知识图谱问答(KGQA)能力。该基准整合停电记录、遥感与气象等多模态数据,评估大语言模型在歧义条件下的自然语言转 SPARQL 解析、本体效用及多模态检索准确率。目前相关基准、代码与数据已公开提供。

  4. AITNT · AI头条(网页)71

    神秘模型 Space Bunny Alpha 实测:支持涂鸦生成交互网页与 Agent 编程

    匿名模型 Space Bunny Alpha 近期在 OpenRouter 和 OpenCode 平台上线,展现出较强的长上下文、多模态理解与 Agent 编程能力。实测表明其能直接将手绘草图转化为可交互网页与 3D 场景,并在小型游戏及交互展台搭建中快速产出可用代码。研究人员分析其分词特征与配置发现,该模型可能与 MiniMax 旗下新版本相关,目前两平台均提供免费体验。

  5. arXiv 机器学习39

    基于 TRIAGE 的大语言模型遗忘评估框架

    TRIAGE 是一种大语言模型机器遗忘评估框架,通过 Fisher 信息与 Hessian 对角线近似测量参数敏感度与局部曲率变化,从而量化语义相关知识的邻接差距。在 12 种遗忘方法、4 个大语言模型以及 WMDP、TOFU、MUSE 基准上的测试显示,行为层面上遗忘程度相似的方法,在模型内部参数改变及附带损伤模式上存在显著差异。

  6. arXiv 人工智能34

    CoMemBench:多智能体工作流拓扑中的协同记忆边界评测基准

    CoMemBench 是一个用于评测多智能体工作流拓扑中协同记忆共享与隔离的基准。该基准基于依赖图构建了跨 4 个领域的 800 个复合工作流,用于评估工作流完成度、节点进度、交接可靠性、隔离鲁棒性及 token 成本。实验表明系统存在共享与隔离的权衡,且系统排名会随拓扑结构和工件冲突发生变化。

  7. arXiv 人工智能35

    READ-Bench:面向时间序列诊断的历史实例检索评测基准

    READ-Bench 是面向多元时间序列诊断的历史案例检索评测基准,涵盖 12 个诊断数据集,以共享故障或事件类型定义检索相关性。评测显示预训练表征在基础检索中并未显著优于经典与符号基线,关键增益来自重排阶段的高斯过程重排器。最终融合方案在全部 12 个数据集上均取得提升,NDCG@10 相比最强单一基础检索器提高 +0.16。

  8. arXiv 人工智能33

    针对大语言模型初高中科学理解能力的评测基准

    研究人员构建了符合 NGSS 标准的大语言模型评测基准,并系统测试了 9 款开源权重模型在初高中科学领域的表现。评估结果显示,数款可本地部署的小型模型在各学科题型中均取得了高准确率,且模型规模与其性能表现并不完全一致。人工复核同时指出合成题目未完全贴合课程标准,凸显了教育场景下引入人机协同的必要性。

  9. arXiv 机器学习37

    ACDB 主动因果发现基准:评估预算干预下的 LLM 智能体

    研究团队推出基准 ACDB,用于评估 LLM 智能体在预算约束干预下恢复因果图结构的能力。在六级测试中,PC 算法以 42.7% 有向 F1 和 4.79 SHD 位列第一,优于 Claude Sonnet 4.6(31.7%、7.25)与 GPT-5.4(22.9%、9.27)。分析显示 LLM 存在低精确率的过度预测倾向,表明现有模型尚未解决主动因果发现。

  10. arXiv 机器学习35

    EVLA:面向意图驱动住宅能源管理的可控多模态基准

    研究团队提出住宅能源管理多模态基准 EVLA,将电池调度建模为结合 RGB 能量场、数值状态与自然语言目标的 16 步动作预测任务。该基准涵盖 3 种隐藏工况与 5 种语言目标,共包含 6,588,045 个多模态样本。MobileNet 测试显示,移除语言使轨迹 MSE 从 0.3856 增至 0.8628,而移除视觉后为 0.3843,表明预测质量高度依赖语言模态。

  11. arXiv 自然语言处理40

    FA-Bench:清晰与噪声条件下的词级与音素级强制对齐及 ASR 时间戳评测基准

    研究人员推出开源基准 FA-Bench,在清晰及 4 种退化音频条件下统一评估了 21 个开源模型与 9 个商业 API 的强制对齐及 ASR 时间戳性能。评测采用基于容差的 F1 分数为主指标,消除了标准 MAE 带来的 9% 至 14% 分数虚高。结果显示现有系统普遍存在时间偏差,如 Whisper 提前约 150 ms,多个商业 API 滞后超 50 ms。

  12. arXiv 自然语言处理46

    mu-bench:多语言话语转写评测基准

    研究团队推出多语言语音转写评测基准 mu-bench,包含面向 AI 银行智能体的英语、西班牙语、土耳其语、越南语和普通话 5 种语言共 4,270 条真实通话话语。该基准同步提出基于 LLM judge 的语义评估指标 UER,与人类标注者的一致性达 κ = 0.78;公开排行榜评测了 6 家商业供应商,其中最佳 UER 达 11.9%,且普通话转写难度最高。

  13. arXiv 自然语言处理43

    IndicFDB:跨印度语言全双工语音 AI 智能体评测基准

    研究人员推出评测基准 IndicFDB,将全双工语音智能体评测扩展至 10 种印度语言,共包含 12,350 个样本。该基准从约 50,000 小时对话中挖掘停顿处理、轮次转换和搭话样本,并构建了人工验证的用户打断测试。在 7 个语音智能体的评测中,商业 API 难以同时兼顾速度与停顿鲁棒性,开源全双工模型也在搭话、质量与延迟间存在权衡。

  14. Cerebras 官方博客(网页)44

    ExomeBench:外显子区域临床变异解读评测基准发布

    外显子区域临床变异解读评测基准 ExomeBench 正式开源发布,旨在评估与改进基因组学模型在实际健康预测任务中的表现。该基准基于 ClinVar 数据库构建,涵盖超 158k 个单核苷酸变异与 100 bp 序列窗口,包含致病性变异预测(PV)等 5 项监督分类任务。相关数据集与端到端工作流已上线 Hugging Face 和 GitHub,主要采用马修斯相关系数(MCC)进行评估。

  15. Cerebras 官方博客(网页)38

    Cerebras:为什么网络防御需要更快的 AI 推理

    Cerebras AI 推理运行 GPT-5.6 Sol Ultrafast 比标准处理快达 14×,可将网络安全分类与响应速度提升 5–10×。在可疑文件分析测试中,Cerebras 仅耗时 58 秒,而标准处理需 4 分 43 秒。此外,Cerebras 携手 CrowdStrike Falcon AI 检测与响应平台,为告警分流与威胁搜猎等场景提供推理加速。

  16. Transluce 研究(网页)31

    Transluce 推动前沿 AI 独立评估标准,并发布 77 款模型心理健康危机评测

    独立研究机构 Transluce 联合逾 100 位 AI 专家提出 5 项最低要求,敦促前沿开发商保障嵌入式外部评估员的独立性、高权限访问及免受报复。该机构还评测了 OpenAI、Anthropic、DeepSeek 等厂商的 77 款模型在心理危机中的表现;通过超 100 万条对话发现新模型整体更安全,但在告别信撰写等场景中仍有 20%-64% 的几率协助自杀相关创作。

  17. LlamaIndex 官方博客(网页)60

    LlamaIndex 发布文档提取基准 ExtractBench 并推出 Agentic Plus

    LlamaIndex 正式发布开源企业级文档提取评测基准 ExtractBench,并同步推出文档提取服务新层级 LlamaExtract Agentic Plus。

    推荐理由:原文同时评估了提取准确率、长文档衰减与单页成本,读者可以据此对比不同模型在实际企业文档提取中的性价比与能力边界。

  18. AITNT · AI头条(网页)16

    AITNT「AI产品测评」动态汇总

    AITNT汇总了多款前沿AI模型与Agent工具的最新实测动态。重点涵盖27B参数的Qwen3.8上线两天下载量突破100万次、OpenClaw 2.0将LLM请求与工具调用分别减少38%和35%,以及豆包工作新增多Agents并行与GUI操作能力。此外内容还收录了GPT-6三维场景生成与DeepSeek多模态模型的实测表现。

  19. Hacker News · AI60

    LabBench 湿实验决策评测发布:前沿 AI 智能体擅长数据解释但在实验设计上表现欠佳

    Gamow Labs 推出基于真实药物研发与基因组学湿实验记录的评测基准 LabBench,用于评估 AI 智能体决定下一步实验的能力。在 20 项任务测试中,GPT-6 Astra(40.8%)与 Claude Opus 5.5(40.5%)平均通过率并列领先,但 Astra 中位耗时 5 分钟远快于 Opus 的 35 分钟。

    推荐理由:评测通过真实湿实验记录量化了模型在实验决策上的短板,为理解智能体在科研工作流中的能力边界提供了参考。

  20. Buzzing HN · 中文精选70

    开源基准工具 Livenerf 发布:量化监测 Claude Opus 5.5 发布后是否存在能力削弱

    开源基准项目 Livenerf 正式上线,旨在通过长期连续测试量化监测 Claude Opus 5.5 发布后是否出现能力削弱或暗中降级。该工具基于英国人工智能安全研究所的 Inspect 框架,通过固定版本的 Claude Code 命令行接口与冻结提示词,每日在筛选出的 78 道边界题目上运行测试并统计准确率与输出 token 变化。

    推荐理由:该项目通过固定题目与预注册统计协议,为大模型发布后是否暗中削弱的争议提供了可复现的长期量化基准。

  21. 爱范儿 · AI 筛选81

    DeepSeek Harness 桌面版实测:开箱即用与日常办公 Agent 能力体验

    DeepSeek 正式推出 DeepSeek Harness 桌面端并提供 macOS 与 Windows 安装包,将核心定位从纯编程扩展至日常办公场景。实测显示桌面端可直接在工作区内批量读取、处理并预览 Office 与 PDF 文档,同时新增了独立运行的周期性自动化任务、图形化插件管理以及基于 SenseVoiceSmall 的本地语音输入。

    推荐理由:原文实测了桌面版在文档处理与定时自动化等场景的表现,展示了它从终端工具向日常办公助理的转变。

9月29日周二
  1. 爱范儿 · AI 筛选73

    神秘 AI 模型 Space Bunny 实测:支持草图生成 3D 网页与 Agent 编程,分词特征指向 MiniMax

    匿名模型 Space Bunny Alpha 近期在 OpenRouter 和 OpenCode 上线,凭借快速响应、草图生成可交互 3D 网页及 Agent 编程能力引发大量调用。实测显示其能直接理解粗糙草图并生成包含动效的前端页面,但在精细视觉质感上与旗舰模型仍有差距。分词特征与代码线索分析显示,该模型可能来自 MiniMax 家族。

    推荐理由:实测展现了该模型将简单草图快速转化为可交互 3D 网页的能力,读者可据此了解轻量级 Agent 编程的适用边界。

  2. arXiv 人工智能36

    DriveHierarchy:从开环理解到闭环执行诊断 VLM 自动驾驶能力的评测基准

    研究人员提出分层评测基准 DriveHierarchy,将基于 VLM 的自动驾驶能力划分为感知定位、上下文记忆、思维推理与闭环执行四级架构。该基准整合开源数据集构建出包含 84,279 帧和 76,798 个问答对的开环评测,并基于真实路网开发出包含 100 个交互场景的闭环仿真平台。在 15 个 VLM 上的实验表明,该基准能有效关联开环理解与闭环驾驶表现,为模型诊断与优化提供依据。

  3. arXiv 机器学习35

    EEGAgentBench:短程与长程脑电分析的 LLM 智能体评测基准

    EEGAgentBench 是系统评测 LLM 智能体短程与长程脑电(EEG)分析能力的统一基准。该基准涵盖从知识问答到睡眠分期的 6 项代表性应用,跨越 2 秒至近 23 小时信号时长,并提供 10 种确定性分析工具供模型自主调用。对 15 个模型族的 29 款前沿 LLM 评测显示,现有智能体在长程 EEG 分析的持续证据积累与多步推理上仍存在显著局限。

9月28日周一
9月22日周二
  1. Simon Willison75

    Simon Willison 解读 TypeSafe AI 新型决策模型 Jev 与系统一架构

    TypeSafe AI 推出新型模型 Jev,主打输入非结构化文本并直接输出分类、评分与布尔判断等类型化浮点概率决策。该模型输出免费且输入价格为 $0.042 per M tokens,支持在上下文窗口内并行评估多个问题,适用于垃圾检测、标签推荐与搜索重排序等分类任务。Simon Willison 指出 Jev 带来了更彻底的黑盒特性与潜在偏见风险,当前社区已出现开源权重复现项目及评测基准。

    推荐理由:原文详细拆解了仅输出类型化浮点概率的决策模型机制与定价特点,有助于读者理解分类与重排序场景下降低成本的新架构路径。

9月20日周日
  1. 腾讯混元 公众号49

    腾讯混元等提出 WebCraftBench:面向 AI 网页生成的实测评测基准

    腾讯混元团队联合清华大学、北京大学提出 AI 网页生成评测基准 WebCraftBench,引入代码覆盖率引导智能体实际操作网页,并从美观度、易用性和需求符合度三个维度打分。该基准包含 369 条真实需求与 5,088 条验收标准,在 17 个前沿模型实测中 Claude-Opus-5 综合排名第一,且在 197 组对比中与人类偏好的判断一致率达 85.3%。

9月17日周四
  1. Apple Machine Learning Research39

    REVERSAL-BENCH:用于度量无重置强化学习断崖的可逆性轴与重置预言机

    研究人员推出强化学习基准 REVERSAL-BENCH,通过连续参数 ρ∈ [0, 1] 控制环境可逆性,并提供验证状态可恢复性的重置预言机。评测显示无重置智能体存在显著的可逆性断崖,会永久陷入不可恢复状态导致学习终止,证实该崩溃因果性地由不可逆性驱动。该基准套件涵盖 5 个物理引擎中的 8 种操作设置并开放数据集。

9月2日周三
  1. Hugging Face64

    AllenAI 推出 BenchMIRT:基于多维项目反应理论审计 LLM 基准测试

    AllenAI 推出 BenchMIRT 评估方法,利用多维项目反应理论在单题层级审计 LLM 基准测试实际衡量的潜在能力,并开源了代码、数据与技术报告。该方法分析了 100 个大模型在 16 个基准中超过 34K 道题目的表现,独立分离出安全性和通用推理两大主维度,发现 BBQ 与 WMDP 等传统安全基准的得分受通用推理能力影响更显著。

    推荐理由:该方法引入多维项目反应理论拆解评测题目实际测量的能力维度,有助于研究者诊断基准中的混杂信号并精简测试集。

8月28日周五
8月27日周四
  1. Google DeepMind64

    Google DeepMind 试点双盲 AI 评测以防止基准污染

    Google DeepMind 联合新加坡 AI 安全研究所、OpenMined、AVERI 及 MLCommons 试点双盲 AI 评测机制,旨在解决基准污染问题。该方案将外部评测置于密码学安全环境中,确保模型在测试前无法接触保密题目以人为刷高分数,本次试点已在隐私保护环境中对 Gemini Flash Lite 模型展开保密基准测试。

    推荐理由:原文介绍了用密码学安全环境隔离测试集以防止基准污染的机制,读者可以了解前沿模型第三方评测如何提升真实可信度。

8月21日周五
  1. Hugging Face73

    Hugging Face 评估语音识别模型基准过拟合现象

    Hugging Face 发布研究评估了 11 款主流开源 ASR 模型的基准过拟合现象,发现部分低 WER 高分模型会依据声学线索复现基准参考文本中的错误甚至补全被静音的数字。研究设计了参考文本不一致、掩码实体检索和正字法切换三项测试,并在 Open ASR Leaderboard 上线了基准拟合分析标签页与开源脚本。

    推荐理由:研究设计了量化 ASR 模型刷榜过拟合的具体探针方法,读者可据此审视公开基准分数的真实泛化能力。

8月13日周四
  1. Hugging Face78

    Hugging Face 总结 ICML 2026 论文大规模智能体复现挑战赛经验

    Hugging Face 总结了社区利用编码智能体对 ICML 2026 论文开展的大规模复现挑战赛,在 19 天内针对 2,226 篇论文完成了 6,816 份复现记录并裁决了 35,908 项科研主张。

    推荐理由:原文展示了利用编码智能体规模化复现学术论文的实测数据与局限,为自动化科研审计与人机协同评测提供了可参考的范式。

  2. Microsoft Research45

    MindTopo 揭示 VLM 的空间拓扑推理能力

    MindTopo 评测基准针对多模态模型(VLM)发布,旨在从连通性、分离、顺序、包围与绳结五个维度评估其空间拓扑推理与交互规划能力。测试显示,主流闭源与开源模型在静态识别上的表现普遍优于交互规划,但整体均远落后于人类水平。模型的失败主要集中在多步规划阶段,容易在动态变化中丢失结构追踪或违反物理约束。