指令而非答案:在在线策略上下文蒸馏中使用指令特权
研究提出在在线策略上下文蒸馏(OPCD)中使用针对常见错误的通用指令特权,以替代样本专用的标准答案。在基于 ProverQA、ProofWriter 与 ProntoQA 数据集以及 Qwen3-Thinking 和 Olmo3-Thinking 模型的 8 组实验中,匹配指令特权在 7 组中的 OOD 准确率领先标准答案 4 到 17 个百分点,且领域内表现相当。
研究提出在在线策略上下文蒸馏(OPCD)中使用针对常见错误的通用指令特权,以替代样本专用的标准答案。在基于 ProverQA、ProofWriter 与 ProntoQA 数据集以及 Qwen3-Thinking 和 Olmo3-Thinking 模型的 8 组实验中,匹配指令特权在 7 组中的 OOD 准确率领先标准答案 4 到 17 个百分点,且领域内表现相当。
研究团队提出 TemporalGraphLLM 框架,可将任意时序图神经网络(TGNN)与大语言模型(LLM)结合,以增强动态文本属性图的推理能力。该方法通过感知图时序的指令微调和新型 TGNN 注入机制,使用图嵌入向量替代专用 token。在真实动态图数据集评测中,该框架在边分类、链路预测及基于边的文本生成任务上均达到 SOTA 性能。
Seq2Cause 框架利用单个无需重训练的预训练自回归模型作为摊销条件独立性测试引擎,解决了事件序列中的四项因果发现任务。该研究证明模型的额外交叉熵可直接约束因果识别误差,令下一 token 预测的提升同步增强因果保证。在包含 29K 事件类型与 474 种故障结果的车辆诊断日志等场景中,其首次实现单冻结骨干的大规模因果发现。
一项针对 Llama-3.1-8B、Qwen3-8B 和 Gemma-3-4B 的研究表明,用于大语言模型部署监控的激活探针对推理批次大小和浮点精度的数值变动具有强稳定性。
研究提出无需训练的多智能体潜空间通信方法 CacheBack,通过接收端提供的信息需求描述来过滤并压缩发送端的 KV cache。在 FanOutQA 基准上,基于 Qwen 3 的 CacheBack 削减了 75% 的传输状态,相比文本通信将准确率提升 14.7 个百分点,任务完成延迟中位数降低 3.2x。该方案在稠密 Transformer、Mamba 混合架构等多种模型族上均实现类似优化。
最新论文在固定模型权重仅切换推理模式的实验中发现,推理过程会加剧模型错误答案的聚集效应,两次独立采样给出相同错误答案的概率在全部 10 组对比中均显著上升。在无界答案空间中,推理模式生成的不同答案数降至非推理模式的 0.43 至 0.65 倍,且在 8 个模型和 5 个基准的 280 种组合测试中,置信度加权投票均未能超越常规多数投票。
研究团队推出基准 ACDB,用于评估 LLM 智能体在预算约束干预下恢复因果图结构的能力。在六级测试中,PC 算法以 42.7% 有向 F1 和 4.79 SHD 位列第一,优于 Claude Sonnet 4.6(31.7%、7.25)与 GPT-5.4(22.9%、9.27)。分析显示 LLM 存在低精确率的过度预测倾向,表明现有模型尚未解决主动因果发现。
研究人员提出基于强化学习的分布匹配框架 MaD-RL,可将大语言模型输出的潜在分类属性分布与指定目标分布进行匹配。针对 GRPO 等主流后训练方案因策略概率过度集中而削弱输出多样性的问题,该框架引入了支持 KL 散度和 Jensen-Shannon 散度等的新奖励函数,并在数学推理与编程实验中验证了其有效性。
研究团队提出 MedCode 框架,通过训练大语言模型生成嵌入式可执行代码并由解释器运算,以提升临床医学计算的准确性。该框架基于 MedCalc 及 ICU 场景数据集构建,并引入加权直接偏好优化(wDPO)算法。在 LLaMA3-8B、Qwen2.5-7B 和 Mistral-7B 上的实验表明,该方法使模型计算准确率绝对提升了 20–30 个百分点。
研究人员推出开源协议 Choir,用于实现分布式多智能体定理自动形式化。Choir 将形式化项目分解为独立任务,支持各贡献者运行自带 LLM 订阅的 AI 智能体并通过 GitHub 协作,所有提交均由确定性门控检查后合并。该协议采用模块化设计且支持扩展,目前已兼容 Lean 4、Isabelle 和 Rocq。
研究提出在长周期任务中评估上下文学习(ICL)的稳态表现,并在 BIRD-SQL formula-1 数据集上测试其探索效率、任务奖励与交付成本。在 gpt-5.6-luna 上,后期 SQL 探针次数从 4.6-5.6 次降至 0.95 次,命中率仅小幅上升,但 ICL 上下文增至约 95k tokens 且 API 成本近乎翻倍。
研究对评估模型推理的指标 CoT-Pass@k 进行了首个多语言数学基准审计,发现作为裁判的 LLM 均无法可靠检测出受损的推理链。评测显示 V4-Flash 和 Qwen3.6 等裁判主要依赖最终答案及链与答案的一致性做判定,接受损坏推理链的概率与正常链几乎相同。这导致 Pass@k 与 CoT-Pass@k 的平均差距在当前代求解模型上仅剩 4.1 分,且高度受 token 预算影响。
KV-Lingo 提出了一种通过知识蒸馏训练跨模型 KV 缓存转换器的方法,利用轻量线性映射将源模型的 KV cache 转换为目标模型可用格式,消除了模型切换时的重复 prefill 开销。
多跳推理中普遍存在“局部-全局差距”(LGG),即单步推理合理却整体回答失败,在全局不足回复中占比近半且常规验证器极易漏检。为此提出的训练监督方法 E-Closure 强化了推理依赖关系,在测试中取得 92.8% 的最高平均准确率与 89.0% 的推理链可靠性,并将 LGG 率降至 6.2%。
研究人员评估了利用 LLM 提取结构化词汇蕴涵关系并辅助自然逻辑定理证明器 LangPro 进行推理证明的效果。实验结果显示,该任务即使对闭源专有 LLM 仍具挑战,对定理证明的贡献较为有限。LLM 生成的词汇关系往往仅具备部分可靠性,且多针对特定 NLI 问题生成,难以构成通用的有效词汇知识。
研究提出 Workflow-Designing Agents(WDA)框架,通过反思演化自动构建任务自适应的自我精炼流程,并借助 SPLIT 机制将单提示词中的冗余指令重新分配至专用阶段。在涵盖知识与推理等 5 个基准评测中,WDA 在 Qwen3.5-9B 上取得 51.24% 的平均分(提升 8.63 个百分点),在 GPT-4.1-mini 上达到 49.00%(提升 5.62 个百分点)。
研究团队提出保持逻辑的数据增强质量控制框架 DualGuard,通过单样本诊断与跨样本历史对比来决策候选数据的保留、过滤与修复。该框架结合语义验证与 Z3 符号验证,支持回溯性异常检查与定向回滚。在 Two-Stage Transfer 的 7 个下游任务评测中,DualGuard 在 5 个任务上取得最高 Accuracy,且全部优于无增强的 BERT 基线。
新研究指出通过删除段落构建记忆不足样本会泄露标签,并提出消除该捷径的等大小记忆构建方法与 MemSafe 评估器。MemSafe 在 MuSiQue 和 HotpotQA 数据集上分别取得 0.968 和 0.983 的 AUROC。将其作为 7B 阅读器的门控时,在 5% 覆盖率下将回答错误率从 0.850 降至 0.631。
研究人员提出 LANTERN 流水线,通过预训练模型激活值分类器对候选关系排序,并结合分阶段过滤、假设生成与可执行验证挖掘隐藏数学知识。在 OEIS 的 1 万个高频数列(5000 万对组合)测试中,该方法产出 62 个验证关联,包含 9 个具洞察力的关联及 4 个此前未见的新发现。包含训练与验证在内的端到端流程耗时不到 8 小时。
NeurIPS 2026 接收论文提出 OracleLadder 诊断评估框架,发现大语言模型即便能独立解决多步数学题的所有中间步骤且获得路线图与步骤答案,依然会在整题上失败,暴露出显著的组合差距(composition gap)。
OpenAI 在 DevDay 上发布全天候常驻 Agent dots,配备独立云端电脑和浏览器并支持接入超 4000 种工具,可在后台全天候自动化执行建站与代码重构等任务。
推荐理由:原文汇总了常驻智能体与协作空间的架构变化及定价,读者可以据此评估全天候自动化工作流对团队协作模式的影响。
北京大学AI for Math团队宣布独立完成庞加莱猜想在Lean 4中的完整形式化,将500多页专著转化为约320万行代码。该工作由开发者与学生借助商用大模型及智能体工作流协作完成,历时半个月、总花费不到3万美元,平均每行代码成本不足1美分。成果包含27203个Lean文件且无一处sorry标记,已同时通过Lean build与Comparator双重检验。
推荐理由:该项目展示了多智能体协作完成复杂数学命题形式化的工程框架,为大模型落地严谨科学验证提供了成本与路径参考。
研究提出 DRY-SFT 后训练方法,无需奖励模型、验证器或正确性过滤,通过多轮差异化生成与独立微调提升大语言模型的输出多样性与解题覆盖率。在 HumanEval+、MBPP+ 和 DS-1000 基准上,该方法将 pass@100 分别提升 10.8、12.5 和 12.4 个百分点。
OpenAI 在开发者大会上公布了全天候自主智能体 Dot、人机协作空间 ChatGPT Space 以及主力模型 GPT-6.1 Sol 等一系列新品。
推荐理由:原文系统梳理了 OpenAI 构建智能体协作平台的多款新品细节与定价对比,有助于读者评估其对现有开发及企业工作流的综合影响。
Cerebras 上线智谱 GLM-4.7 推理支持并发布迁移指南,依托晶圆级集群实现最高 1500+ tokens/s 的输出速度。
推荐理由:文章总结了 GLM-4.7 的行为特性与十条工程迁移规则,读者可以直接参考这些参数设置与 Prompt 技巧优化推理效率。
OpenAI 与 Cerebras 签署多年期协议,计划从 2026 年开始分阶段部署 750 MW 的 Cerebras 晶圆级系统,用于为其客户提供低延迟 AI 推理服务。Cerebras 表示其系统运行大语言模型时的响应速度比 GPU 系统快高达 15 倍。OpenAI 称该合作旨在构建多样化的算力架构组合,为编码智能体和语音交互等实时应用提供更专用的低延迟硬件支持。
推荐理由:该协议展现了头部大模型厂商为应对大规模推理延迟与吞吐需求,开始在传统 GPU 架构之外规模化引入晶圆级专用硬件方案。
企业级低代码智能体平台 StackAI 正式接入 Cerebras 推理服务,为其合规审查、理赔与信贷决策等多步工作流提供亚秒级响应,推理速度最高比 GPU 快 15 倍。在金融、医疗及政务等高合规场景中,该集成使多步工作流延迟降低最高达 50%,高峰期吞吐稳定性提升最高 10 倍,工作流级推理成本降低 20–35%。
Cerebras 发文指出前沿大模型因参数规模扩大、长上下文普及以及推理思考 token 占比超 50% 积累了严重的延迟债务,正倒逼底层算力硬件从传统 GPU 转向专用低延迟推理架构。文章指出人机交互对超过 4 秒的延迟极度敏感,而谷歌研发 TPU、Anthropic 与 OpenAI 等大厂采购新型低延迟算力的动向表明行业正在重构推理基础设施。
OpenAI 联合 Cerebras 推出专为实时软件开发设计的 GPT-5.3-Codex-Spark 模型研究预览版,由 Cerebras 晶圆级引擎(Wafer-Scale Engine)驱动,推理速度超过 1,000 tokens/s。
推荐理由:该模型通过晶圆级芯片实现超 1000 tokens/s 推理速度,展示了定制硬件对实时交互式编程工作流的加速效果。
Cerebras 发文指出更快的推理速度已成为提升 AI 准确率的关键杠杆,能在相同延迟预算内为推理模型提供更多思考步骤。Cerebras 处理器面积是 NVIDIA B200 的 56 倍,通过将计算与片上 SRAM 紧密集成突破内存带宽瓶颈,在开源模型输出生成上实现最高达 NVIDIA GPU 15 倍的推理速度。
Cerebras 介绍了在 WSE 硬件上以超过 1,200 tokens/s 运行的 GPT-5.3-Codex-Spark 最佳编程实践。指南建议将 Spark 作为高频交互的结对编程者而非异步委托代理,通过高频测试验证、多方案快速探索以及保持单会话专注来避免代码质量退化。同时推荐将 Git 和 Markdown 文件作为持久化外部记忆,配合权限沙箱与文档自动化维护机制以降低长上下文漂移。
推荐理由:文章系统梳理了高吞吐推理下的实时结对编程方法,为开发者提供了从单任务循环到上下文管理的完整实践模式。
Cerebras 宣布 AWS 正在其数据中心部署 Cerebras CS-3 系统,后续将通过 AWS Bedrock 提供开源大语言模型与 Amazon Nova 系列的高速推理服务。
推荐理由:双方通过将Prefill与Decode解耦至不同硬件,为大吞吐量智能体编码等高速推理场景提供了新的软硬件协同方案。
Cerebras 针对 Karpathy 提出的 autoresearch 框架开展了 71 次实测,开源了 codex-autoresearch-harness 和 reap-expert-swap 工具,并总结了防止智能体自主实验偏离目标的工程实践。
推荐理由:原文通过两组真实任务实测了自主研究智能体的边界,给出了约束环境漂移和控制算力开销的具体方案。
Cerebras 发文分析指出,前沿实验室的 AI 竞争焦点正从单纯提升模型智能转向极致推理速度,token 生成速率已直接决定模型迭代与软件构建效率。OpenAI 与 Anthropic 等头部厂商均已全面使用自身的高速编码模型来自举研发下一代模型和产品代码库,Anthropic 对 2.5 倍速版本的定价更是达到基础版的 6 倍。
推荐理由:梳理了前沿大厂从卷模型智能转向卷推理速度的逻辑,有助于理解高吞吐推理对智能体研发与模型自举迭代的核心价值。
Cerebras 阐述了大模型解耦推理架构,将算力密集的 Prefill 阶段与内存带宽受限的 Decode 阶段拆分至不同硬件独立运行。
推荐理由:文章系统阐述了将大模型推理的 Prefill 与 Decode 阶段解耦运行的技术原理,展示了异构硬件协同提升吞吐与降低尾部延迟的路径。
Cerebras 与 Armis 展开合作,将超低延迟 AI 推理与 Armis Centrix™ for Application Security 平台结合,以加速漏洞检测与修复。
针对 Perplexity 宣布从 MCP 回退至 API 和 CLI 引发的争议,Cerebras 撰文分析认为两者的核心分歧在于运行时速度与安全可审计性之间的权衡。
推荐理由:文章梳理了 MCP 与 CLI 在延迟和安全上的权衡,并指出通过低延迟推理与轻量执行环境可以缓解协议带来的性能开销。
Cerebras 官方博客总结了构建多智能体工作流的实战经验,提出将单智能体拆解为“主厨(调度器)与配菜工(子智能体)”协作架构,以解决单智能体容易触碰的上下文膨胀和失败率过高问题。
推荐理由:原文通过厨房主厨与配菜工的比喻系统梳理了 5 种多智能体设计模式,读者可以据此将复杂 AI 编码任务拆解为轻量上下文并行与验证工作流。
Cerebras 宣布全面扩展其超低延迟推理生态,基于晶圆级芯片架构提供最高达传统 GPU 系统 15 倍的推理速度。平台支持主流开源代码与推理模型,提供自服务 API 与云市场采购渠道,并深度集成了 LangChain、CrewAI、Cline、Windsurf 及 LiteLLM 等涵盖智能体、编程与可观测性的开发工具链。
Cognition 选用 Cerebras 推理平台为其软件工程模型 SWE-1.6 以及 SWE-grep 子智能体提供算力支持,在 Windsurf 的 Fast 档位中实现了最高 950 tokens/s 的生成速度。
推荐理由:文章展示了模型层与硬件推理层协同优化的落地数据,读者可借此了解高速推理对编程智能体交互体验的具体提升。