跳到正文
今天9月30日周三
  1. arXiv 人工智能34

    GLIDE:面向异构 LLM 智能体的广义分层内在分布评估方法

    研究团队提出面向异构 LLM 智能体的轻量级步骤评估方法 GLIDE,无需外部验证器或特定任务监督即可提升任务性能与步骤排序质量。GLIDE 通过分层残差一致性提取内在步骤证据并完成分布校准,转化为悲观奖励用于 MCTS 分支选择,同时利用归一化预测不确定性指导自适应分支。多跳推理、序列决策与符号逻辑实验表明,该方法有效提升了计算效率。

  2. arXiv 人工智能33

    认证观测等价因果模型之间的干预一致性

    研究者提出干预分离选择(ISS)方法,可在观测等价因果模型中通过主动干预排除矛盾候选,认证幸存模型在成本限制内与真实系统的一致性。针对连续变量,该方法利用混合整数线性规划精确判定停止条件。在三位数彩色 MNIST 因果抽象任务中,ISS 平均每张图像仅需 13.6 次干预即可完成网络因果抽象的认证。

  3. arXiv 机器学习46

    理解大语言模型后训练中 SFT、RLVR 与 OPD 的协同效应

    一项针对 Qwen3 模型的研究揭示了大语言模型后训练中 SFT、RLVR 与在线策略蒸馏(OPD)的协同机制,指出各阶段的效果高度取决于师生兼容性。实验表明,结合教师 RLVR 适配与学生 SFT 预热,可将平均 OPD 准确率从 29.2% 提升至 43.8%(相对提升 50%)。此外,OPD 比 SFT 能为下游 RLVR 提供更优的初始化,且该优势随算力扩展而扩大。

  4. arXiv 人工智能35

    指令而非答案:在在线策略上下文蒸馏中使用指令特权

    研究提出在在线策略上下文蒸馏(OPCD)中使用针对常见错误的通用指令特权,以替代样本专用的标准答案。在基于 ProverQA、ProofWriter 与 ProntoQA 数据集以及 Qwen3-Thinking 和 Olmo3-Thinking 模型的 8 组实验中,匹配指令特权在 7 组中的 OOD 准确率领先标准答案 4 到 17 个百分点,且领域内表现相当。

  5. arXiv 机器学习34

    TemporalGraphLLM:融合时序图神经网络与大语言模型处理动态文本属性图

    研究团队提出 TemporalGraphLLM 框架,可将任意时序图神经网络(TGNN)与大语言模型(LLM)结合,以增强动态文本属性图的推理能力。该方法通过感知图时序的指令微调和新型 TGNN 注入机制,使用图嵌入向量替代专用 token。在真实动态图数据集评测中,该框架在边分类、链路预测及基于边的文本生成任务上均达到 SOTA 性能。

  6. arXiv 机器学习37

    Seq2Cause:用单一自回归骨干解决事件序列中的四项因果发现任务

    Seq2Cause 框架利用单个无需重训练的预训练自回归模型作为摊销条件独立性测试引擎,解决了事件序列中的四项因果发现任务。该研究证明模型的额外交叉熵可直接约束因果识别误差,令下一 token 预测的提升同步增强因果保证。在包含 29K 事件类型与 474 种故障结果的车辆诊断日志等场景中,其首次实现单冻结骨干的大规模因果发现。

  7. arXiv 人工智能44

    基于接收端条件化的潜空间通信实现 94% CacheBack

    研究提出无需训练的多智能体潜空间通信方法 CacheBack,通过接收端提供的信息需求描述来过滤并压缩发送端的 KV cache。在 FanOutQA 基准上,基于 Qwen 3 的 CacheBack 削减了 75% 的传输状态,相比文本通信将准确率提升 14.7 个百分点,任务完成延迟中位数降低 3.2x。该方案在稠密 Transformer、Mamba 混合架构等多种模型族上均实现类似优化。

  8. arXiv 人工智能63

    研究显示模型推理会集中错误且自洽性机制无法察觉

    最新论文在固定模型权重仅切换推理模式的实验中发现,推理过程会加剧模型错误答案的聚集效应,两次独立采样给出相同错误答案的概率在全部 10 组对比中均显著上升。在无界答案空间中,推理模式生成的不同答案数降至非推理模式的 0.43 至 0.65 倍,且在 8 个模型和 5 个基准的 280 种组合测试中,置信度加权投票均未能超越常规多数投票。

  9. arXiv 机器学习37

    ACDB 主动因果发现基准:评估预算干预下的 LLM 智能体

    研究团队推出基准 ACDB,用于评估 LLM 智能体在预算约束干预下恢复因果图结构的能力。在六级测试中,PC 算法以 42.7% 有向 F1 和 4.79 SHD 位列第一,优于 Claude Sonnet 4.6(31.7%、7.25)与 GPT-5.4(22.9%、9.27)。分析显示 LLM 存在低精确率的过度预测倾向,表明现有模型尚未解决主动因果发现。

  10. arXiv 机器学习36

    MaD-RL:通过强化学习匹配分布以校准大语言模型

    研究人员提出基于强化学习的分布匹配框架 MaD-RL,可将大语言模型输出的潜在分类属性分布与指定目标分布进行匹配。针对 GRPO 等主流后训练方案因策略概率过度集中而削弱输出多样性的问题,该框架引入了支持 KL 散度和 Jensen-Shannon 散度等的新奖励函数,并在数学推理与编程实验中验证了其有效性。

  11. arXiv 人工智能37

    利用嵌入式代码提升大语言模型的医学计算能力

    研究团队提出 MedCode 框架,通过训练大语言模型生成嵌入式可执行代码并由解释器运算,以提升临床医学计算的准确性。该框架基于 MedCalc 及 ICU 场景数据集构建,并引入加权直接偏好优化(wDPO)算法。在 LLaMA3-8B、Qwen2.5-7B 和 Mistral-7B 上的实验表明,该方法使模型计算准确率绝对提升了 20–30 个百分点。

  12. arXiv 人工智能44

    Choir:用于分布式多智能体自动形式化的开放协议

    研究人员推出开源协议 Choir,用于实现分布式多智能体定理自动形式化。Choir 将形式化项目分解为独立任务,支持各贡献者运行自带 LLM 订阅的 AI 智能体并通过 GitHub 协作,所有提交均由确定性门控检查后合并。该协议采用模块化设计且支持扩展,目前已兼容 Lean 4、Isabelle 和 Rocq。

  13. arXiv 自然语言处理40

    CoT-Pass@k 是否真正检验了思维链?一项多语言数学审计研究

    研究对评估模型推理的指标 CoT-Pass@k 进行了首个多语言数学基准审计,发现作为裁判的 LLM 均无法可靠检测出受损的推理链。评测显示 V4-Flash 和 Qwen3.6 等裁判主要依赖最终答案及链与答案的一致性做判定,接受损坏推理链的概率与正常链几乎相同。这导致 Pass@k 与 CoT-Pass@k 的平均差距在当前代求解模型上仅剩 4.1 分,且高度受 token 预算影响。

  14. arXiv 自然语言处理33

    局部合理却全局不足:多跳推理中的局部-全局差距

    多跳推理中普遍存在“局部-全局差距”(LGG),即单步推理合理却整体回答失败,在全局不足回复中占比近半且常规验证器极易漏检。为此提出的训练监督方法 E-Closure 强化了推理依赖关系,在测试中取得 92.8% 的最高平均准确率与 89.0% 的推理链可靠性,并将 LGG 率降至 6.2%。

  15. arXiv 自然语言处理29

    用词汇蕴涵解释文本蕴涵:利用 LLM 为形式化证明提供词汇关系

    研究人员评估了利用 LLM 提取结构化词汇蕴涵关系并辅助自然逻辑定理证明器 LangPro 进行推理证明的效果。实验结果显示,该任务即使对闭源专有 LLM 仍具挑战,对定理证明的贡献较为有限。LLM 生成的词汇关系往往仅具备部分可靠性,且多针对特定 NLI 问题生成,难以构成通用的有效词汇知识。

  16. arXiv 自然语言处理34

    面向任务自适应自我精炼流程的精简化反思演化

    研究提出 Workflow-Designing Agents(WDA)框架,通过反思演化自动构建任务自适应的自我精炼流程,并借助 SPLIT 机制将单提示词中的冗余指令重新分配至专用阶段。在涵盖知识与推理等 5 个基准评测中,WDA 在 Qwen3.5-9B 上取得 51.24% 的平均分(提升 8.63 个百分点),在 GPT-4.1-mini 上达到 49.00%(提升 5.62 个百分点)。

  17. arXiv 自然语言处理34

    DualGuard:面向保持逻辑数据增强的双模式质量控制框架

    研究团队提出保持逻辑的数据增强质量控制框架 DualGuard,通过单样本诊断与跨样本历史对比来决策候选数据的保留、过滤与修复。该框架结合语义验证与 Z3 符号验证,支持回溯性异常检查与定向回滚。在 Two-Stage Transfer 的 7 个下游任务评测中,DualGuard 在 5 个任务上取得最高 Accuracy,且全部优于无增强的 BERT 基线。

  18. arXiv 自然语言处理47

    LANTERN:挖掘语言模型中隐藏的数学知识

    研究人员提出 LANTERN 流水线,通过预训练模型激活值分类器对候选关系排序,并结合分阶段过滤、假设生成与可执行验证挖掘隐藏数学知识。在 OEIS 的 1 万个高频数列(5000 万对组合)测试中,该方法产出 62 个验证关联,包含 9 个具洞察力的关联及 4 个此前未见的新发现。包含训练与验证在内的端到端流程耗时不到 8 小时。

  19. AITNT · AI头条(网页)87

    OpenAI 推出 7x24 小时常驻智能体 dots 与 GPT-6.1 Sol,上线 ChatGPT Space 及 Pro 500 订阅

    OpenAI 在 DevDay 上发布全天候常驻 Agent dots,配备独立云端电脑和浏览器并支持接入超 4000 种工具,可在后台全天候自动化执行建站与代码重构等任务。

    推荐理由:原文汇总了常驻智能体与协作空间的架构变化及定价,读者可以据此评估全天候自动化工作流对团队协作模式的影响。

  20. AITNT · AI头条(网页)76

    北大团队完成庞加莱猜想Lean 4完整形式化验证

    北京大学AI for Math团队宣布独立完成庞加莱猜想在Lean 4中的完整形式化,将500多页专著转化为约320万行代码。该工作由开发者与学生借助商用大模型及智能体工作流协作完成,历时半个月、总花费不到3万美元,平均每行代码成本不足1美分。成果包含27203个Lean文件且无一处sorry标记,已同时通过Lean build与Comparator双重检验。

    推荐理由:该项目展示了多智能体协作完成复杂数学命题形式化的工程框架,为大模型落地严谨科学验证提供了成本与路径参考。

  21. 爱范儿 · AI 筛选84

    OpenAI 开发者大会发布智能体 Dot、ChatGPT Space 与高性价比模型 GPT-6.1 Sol 等全系新品

    OpenAI 在开发者大会上公布了全天候自主智能体 Dot、人机协作空间 ChatGPT Space 以及主力模型 GPT-6.1 Sol 等一系列新品。

    推荐理由:原文系统梳理了 OpenAI 构建智能体协作平台的多款新品细节与定价对比,有助于读者评估其对现有开发及企业工作流的综合影响。

  22. Cerebras 官方博客(网页)89

    OpenAI 与 Cerebras 达成合作,将部署 750 MW 晶圆级系统推进高速推理

    OpenAI 与 Cerebras 签署多年期协议,计划从 2026 年开始分阶段部署 750 MW 的 Cerebras 晶圆级系统,用于为其客户提供低延迟 AI 推理服务。Cerebras 表示其系统运行大语言模型时的响应速度比 GPU 系统快高达 15 倍。OpenAI 称该合作旨在构建多样化的算力架构组合,为编码智能体和语音交互等实时应用提供更专用的低延迟硬件支持。

    推荐理由:该协议展现了头部大模型厂商为应对大规模推理延迟与吞吐需求,开始在传统 GPU 架构之外规模化引入晶圆级专用硬件方案。

  23. Cerebras 官方博客(网页)38

    StackAI 接入 Cerebras 为企业级 AI 智能体提供极速推理

    企业级低代码智能体平台 StackAI 正式接入 Cerebras 推理服务,为其合规审查、理赔与信贷决策等多步工作流提供亚秒级响应,推理速度最高比 GPU 快 15 倍。在金融、医疗及政务等高合规场景中,该集成使多步工作流延迟降低最高达 50%,高峰期吞吐稳定性提升最高 10 倍,工作流级推理成本降低 20–35%。

  24. Cerebras 官方博客(网页)57

    Cerebras 谈 AI 延迟债务危机与科技巨头的硬件转型布局

    Cerebras 发文指出前沿大模型因参数规模扩大、长上下文普及以及推理思考 token 占比超 50% 积累了严重的延迟债务,正倒逼底层算力硬件从传统 GPU 转向专用低延迟推理架构。文章指出人机交互对超过 4 秒的延迟极度敏感,而谷歌研发 TPU、Anthropic 与 OpenAI 等大厂采购新型低延迟算力的动向表明行业正在重构推理基础设施。

  25. Cerebras 官方博客(网页)80

    OpenAI 联合 Cerebras 推出 GPT-5.3-Codex-Spark 代码模型

    OpenAI 联合 Cerebras 推出专为实时软件开发设计的 GPT-5.3-Codex-Spark 模型研究预览版,由 Cerebras 晶圆级引擎(Wafer-Scale Engine)驱动,推理速度超过 1,000 tokens/s。

    推荐理由:该模型通过晶圆级芯片实现超 1000 tokens/s 推理速度,展示了定制硬件对实时交互式编程工作流的加速效果。

  26. Cerebras 官方博客(网页)35

    Cerebras:为何更快的推理是通往更高准确率的新路径

    Cerebras 发文指出更快的推理速度已成为提升 AI 准确率的关键杠杆,能在相同延迟预算内为推理模型提供更多思考步骤。Cerebras 处理器面积是 NVIDIA B200 的 56 倍,通过将计算与片上 SRAM 紧密集成突破内存带宽瓶颈,在开源模型输出生成上实现最高达 NVIDIA GPU 15 倍的推理速度。

  27. Cerebras 官方博客(网页)72

    Cerebras 发布 Codex Spark 编码实践指南

    Cerebras 介绍了在 WSE 硬件上以超过 1,200 tokens/s 运行的 GPT-5.3-Codex-Spark 最佳编程实践。指南建议将 Spark 作为高频交互的结对编程者而非异步委托代理,通过高频测试验证、多方案快速探索以及保持单会话专注来避免代码质量退化。同时推荐将 Git 和 Markdown 文件作为持久化外部记忆,配合权限沙箱与文档自动化维护机制以降低长上下文漂移。

    推荐理由:文章系统梳理了高吞吐推理下的实时结对编程方法,为开发者提供了从单任务循环到上下文管理的完整实践模式。

  28. Cerebras 官方博客(网页)82

    Cerebras CS-3 接入 AWS 数据中心,联合推出 Trainium 分离式推理架构

    Cerebras 宣布 AWS 正在其数据中心部署 Cerebras CS-3 系统,后续将通过 AWS Bedrock 提供开源大语言模型与 Amazon Nova 系列的高速推理服务。

    推荐理由:双方通过将Prefill与Decode解耦至不同硬件,为大吞吐量智能体编码等高速推理场景提供了新的软硬件协同方案。

  29. Cerebras 官方博客(网页)77

    Cerebras 实测 Karpathy 的 autoresearch:如何防止 AI 自主研究闭环失控与偏离目标

    Cerebras 针对 Karpathy 提出的 autoresearch 框架开展了 71 次实测,开源了 codex-autoresearch-harness 和 reap-expert-swap 工具,并总结了防止智能体自主实验偏离目标的工程实践。

    推荐理由:原文通过两组真实任务实测了自主研究智能体的边界,给出了约束环境漂移和控制算力开销的具体方案。