Google 推出基于冻结权重的端侧多 Token 预测架构,Pixel 上 Gemini Nano 推理加速超 50%
Google Research 提出一种在冻结权重基础上集成多 Token 预测(MTP)头的端侧推理加速架构,已部署于 Pixel 9 与 10 系列设备。
推荐理由:阐述了在不重训基座模型的前提下通过跨注意力复用缓存实现端侧投机解码,为移动设备内存与能耗受限场景提供了可落地的加速方案。
Google Research 提出一种在冻结权重基础上集成多 Token 预测(MTP)头的端侧推理加速架构,已部署于 Pixel 9 与 10 系列设备。
推荐理由:阐述了在不重训基座模型的前提下通过跨注意力复用缓存实现端侧投机解码,为移动设备内存与能耗受限场景提供了可落地的加速方案。
Google Research 发文揭示了大语言模型通过推理链(CoT)召回单跳事实类参数化知识的核心机制。在 Gemini-2.5 和 Qwen3-32B 等模型上的实验表明,即使面对无须逻辑拆解的简单事实问答,开启推理也能显著提升召回率,其动力来自额外 token 提供的计算缓冲效应以及生成相关背景事实的事实启动效应。
推荐理由:研究解构了思考过程辅助大模型召回参数化知识的机制,为理解推理模型的能力边界与中间步骤优化提供了实验依据。
AI 芯片初创公司 Tensordyne 公布了专为推理设计的 Napier 芯片及 Pareto 机柜级系统,核心是将矩阵乘法转换为底层对数加法以降低能耗。
Sebastian Raschka 发布了 2026 年 1 月至 5 月的精选大语言模型研究论文清单,重点关注混合架构、推理与强化学习等领域。文章指出今年架构设计不再局限于扩大 Transformer 规模,而是转向注意力层与 Mamba-2 或 Gated DeltaNet 交替的混合架构以提升长上下文效率。
推荐理由:作者整理了前五个月核心论文与架构趋势,读者可快速掌握混合架构与长上下文演进方向。
智谱联合 TileRT 团队推出 GLM-5.1 高速版 API(GLM-5.1-highspeed),输出速度达 400 tokens/s,在完整保留旗舰模型能力的同时实现低延迟。
推荐理由:智谱通过底层推理引擎重构将旗舰模型输出速度提升至400 tokens/s,为高频交互与长程编码场景提供了极低延迟的落地路径。
Google 宣布其实验研究辅助系统 ERA(Empirical Research Assistance)论文在 Nature 正式发表,并开始通过 Gemini for Science 逐步开放基于 ERA 和 AlphaEvolve 构建的实验工具 Computational Discovery。
推荐理由:原文展示了结合树搜索与大模型自动编写并优化科研代码的方法,为多学科计算实验的自动化提供了实测参考。
Sebastian Raschka 梳理了解读近期开源大语言模型在长上下文效率上的核心架构演进。文章重点分析了 Gemma 4 的跨层 KV 共享与分层嵌入(PLE)、Laguna XS.2 的逐层注意力预算、ZAYA1-8B 的压缩卷积注意力(CCA),以及 DeepSeek V4 采用的流形约束超连接(mHC)与 CSA/HCA 混合压缩注意力。
推荐理由:原文系统梳理了主流开源大模型在长上下文下的架构改进,读者可据此理解降低 KV 缓存与计算开销的设计取舍。
斯坦福大学医学院团队利用 Google DeepMind 的 Co-Scientist 从海量文献中筛选老药新用以治疗肝纤维化,相关成果发表于 Advanced Science。
推荐理由:斯坦福团队通过活体人类肝细胞实验验证了 Co-Scientist 筛选老药的能力,为 AI 辅助药物重定向提供了直接对比与实验数据。
结合 Nextflow 与 AWS Batch 对 Amazon EC2 GPU 算力进行水平扩展,可将 Oxford Nanopore Technologies 碱基识别成本降低最高 64%,并保持同等吞吐量。
Google Research 总结了其科研辅助系统 ERA 在流行病预测、宇宙学、气候监测与神经科学四个领域的实际应用进展。
DeepSeek 正式上线并开源全新系列模型 DeepSeek-V4 预览版,全系标配 1M 上下文,提供 DeepSeek-V4-Pro 与 DeepSeek-V4-Flash 两个版本。
推荐理由:原文给出了两个版本的性能定位、架构优化细节与接口迁移时间表,读者可以据此评估长上下文模型在编码与 Agent 场景下的接入成本。
Google Research 提出智能体记忆框架 ReasoningBank,通过同时从成功和失败经验中提炼高层结构化推理模式与防错规则,使 AI 智能体在部署后具备测试时持续自进化能力。结合记忆感知测试时扩展(MaTTS)机制,智能体在 WebArena 和 SWE-bench Verified 评测中任务成功率分别提升 8.3% 与 4.6%,同时显著降低了无效探索步骤。
推荐理由:该研究将测试时扩展与智能体记忆机制结合,为解决智能体重复犯错和缺乏长程自进化能力提供了可落地的闭环框架。
Google Research 提出免种子且具备智能体特性的合成数据生成框架 Simula,从第一性原理将数据生成拆解为全局多样性、局部多样性、复杂度控制与双审校质检四个正交维度。
Google DeepMind 推出专为机器人设计的 Gemini Robotics-ER 1.6 具身推理模型,重点增强了空间推理、多视角理解、任务规划与成功检测能力。
推荐理由:原文给出了空间推理、多视角理解和工业仪表读数等具体能力,读者可以据此了解高层推理模型如何接入机器人控制链路。
Google Research 推出向量压缩算法 TurboQuant,结合极坐标量化 PolarQuant 与 1-bit 误差修正技术 QJL,无需训练即可将大模型 KV cache 压缩至 3-bit 且保持原有精度。
Sebastian Raschka 系统梳理了现代主流开源大模型中应用的注意力机制变体与设计权衡。文章重点解析了标准多头注意力(MHA)、分组查询注意力(GQA)、多头潜在注意力(MLA)、滑动窗口注意力(SWA)以及 DeepSeek 稀疏注意力(DSA),展示了各机制在模型表现与 KV Cache 占用上的对比。
推荐理由:梳理了主流开源大模型中各类注意力变体的机制差异与权衡,便于读者系统理解长上下文下的 KV Cache 优化与混合架构演进。
Google 与 Beth Israel Deaconess Medical Center(BIDMC)合作完成了一项前瞻性单中心可行性研究,评估对话式医疗 AI 模型 AMIE 在门诊就诊前采集病史的实际表现。
推荐理由:该研究展示了对话式医疗模型从模拟环境走向真实门诊预诊的可行性与安全性数据。
Sebastian Raschka 梳理并对比了 2026 年 1 至 2 月发布的 10 余款代表性开源大模型的网络架构与基准表现。分析指出近期开源模型普遍强化了推理计算效率设计,包括广泛采用 MLA、DeepSeek 稀疏注意力、Gated DeltaNet 等线性注意力混合机制、多 Token 预测以及滑动窗口注意力。
推荐理由:原文横向对比了多款开源大模型的注意力机制与混合专家结构演进,读者可据此理清长上下文与推理效率优化的关键设计差异。
Sebastian Raschka 发布关于推理阶段扩展(Inference-Time Scaling)的技术综述,系统梳理了无需修改模型权重的推理期算力扩展方法。
推荐理由:作者梳理了主流免训练推理扩展方法的技术分类与实测路径,为提升模型推理能力提供了系统化的方案选择参考。
Adobe SDC 团队采用 AWS Batch 配合 GPU EC2 实例构建了大规模分布式 AI 推理架构,将 Adobe Stock 图像 embedding 计算时间从 30 天缩短至 20 小时内,综合成本降低超过 95%。
Sebastian Raschka 发布 2025 年大模型年度盘点与预测,指出大模型演进的核心驱动力已转向以 RLVR 与 GRPO 为代表的后训练推理以及推理时扩展。
推荐理由:系统梳理了推理模型、后训练强化学习与混合架构的演进,为读者研判大模型技术路线与工程落地提供了多维度参考。
Sebastian Raschka 发布了 2025 年 7 月至 12 月的 LLM 精选研究论文清单。该清单涵盖推理模型训练与推理策略、强化学习、推理时扩展(Inference-Time Scaling)、模型架构、高效训练、扩散语言模型及多模态等分类。作者同时发布了年度回顾文章《State of LLMs 2025: Progress, Problems, and Predictions》。
Sebastian Raschka 深入剖析了 DeepSeek 从 V3 到 V3.2 的技术演进,涵盖模型架构、稀疏注意力机制与强化学习优化。DeepSeek V3.2 引入了由 Lightning Indexer 驱动的 DeepSeek 稀疏注意力机制(DSA),将注意力计算复杂度从二次方降低至线性 O(Lk)。
推荐理由:梳理了稀疏注意力 DSA 与 GRPO 算法调优的技术演进脉络,有助于理解开源大模型在长上下文效率与强化学习稳定性上的工程实现细节。
DeepSeek 正式发布并开源 DeepSeek-V3.2 与长思考增强版 DeepSeek-V3.2-Speciale 两个正式版模型,网页端、App 和 API 已同步更新。DeepSeek-V3.2 首次支持在思考模式下进行多轮工具调用,并适配了 Claude Code;Speciale 版本专注于高难度数学与逻辑推理,目前以限时 API 服务形式开放给社区评测。
推荐理由:官方正式发布两款新模型并开源权重,重点实现了思考推理与工具调用的深度结合,并同步更新了服务接口。
文章盘点了超越传统自回归 Transformer 的四类新兴模型架构及其实践权衡。线性注意力混合架构(如 Qwen3-Next 与 Kimi Linear 的 Gated DeltaNet)通过结合全局注意力与线性层大幅缩减 KV cache 并支持超长上下文。
推荐理由:系统梳理了线性注意力混合、文本扩散及代码世界模型等非传统架构,为评估长文本效率与并行生成提供了清晰的权衡参照。
Sebastian Raschka 撰文详解并用代码实操了大模型评测的 4 大主流方法,将其归纳为基准测试与裁判评估两大类。内容涵盖 MMLU 多选题准确率评测、面向数学和代码领域的确定性验证器(Verifier)、LM Arena 风格的 Elo 偏好排行榜,以及通过 Ollama 调用大模型充当裁判(LLM-as-a-judge)的具体实现与优缺点权衡。
推荐理由:原文从零代码拆解了多选题、验证器、排行榜和 LLM 裁判四类评测机制,有助于读者厘清基准测试的局限与组合评估策略。
NVIDIA 推出专为大模型推理 Prefill 阶段设计的 Rubin CPX 加速器及配套机柜架构,通过强化算力并降低显存带宽成本重塑解耦推理服务。
推荐理由:文章深入剖析了面向 Prefill 阶段的专用硬件架构与机柜设计,为评估大模型解耦推理与算力 TCO 提供了清晰的参考视角。
Sebastian Raschka 深入解析了 OpenAI 开放权重的 gpt-oss-20b 与 gpt-oss-120b 架构,并对比了 GPT-2 与 Qwen3 的技术演进。
推荐理由:文章拆解了开源模型在网络结构与量化工程上的取舍,有助于开发者理解现代大模型的单卡运行原理与架构演进脉络。