跳到正文
7月18日周六
  1. Sebastian Raschka69

    大语言模型如何控制推理算力预算与思考模式

    Sebastian Raschka 撰文详解大语言模型中推理努力程度(Reasoning Effort)与思考开关的训练与推理机制。模型通常通过系统提示词结合特定长度惩罚的 RLVR、混合思考样本的 SFT 或不同预算专家蒸馏来实现多档推理控制。

    推荐理由:文章横向拆解了前沿模型控制推理预算的后训练方案与推理开关,为开发者理解和设计灵活的推理计算机制提供了清晰参考。

7月16日周四
  1. Hugging Face71

    IBM Research 解析智能体模型路由的设计挑战与系统优化方法

    IBM Research 发文指出智能体系统中的模型路由并非单纯的模型分类选择,而是需要综合平衡成本、质量与延迟的系统优化问题。实测显示由于上下文缓存大幅降低输入成本,名义单价更高的 Claude Sonnet 4.6 在 AppWorld 测试中总成本为 $79,显著低于 GPT-4.1 的 $155。

    推荐理由:原文通过具体测试数据揭示了缓存机制与系统开销对模型实际成本的影响,为智能体路由设计提供了可参考的系统优化视角。

7月15日周三
6月27日周六
  1. Google Research60

    Google 推出基于冻结权重的端侧多 Token 预测架构,Pixel 上 Gemini Nano 推理加速超 50%

    Google Research 提出一种在冻结权重基础上集成多 Token 预测(MTP)头的端侧推理加速架构,已部署于 Pixel 9 与 10 系列设备。

    推荐理由:阐述了在不重训基座模型的前提下通过跨注意力复用缓存实现端侧投机解码,为移动设备内存与能耗受限场景提供了可落地的加速方案。

6月25日周四
  1. Google Research67

    Google 研究揭示推理过程如何解锁大语言模型的参数化知识记忆

    Google Research 发文揭示了大语言模型通过推理链(CoT)召回单跳事实类参数化知识的核心机制。在 Gemini-2.5 和 Qwen3-32B 等模型上的实验表明,即使面对无须逻辑拆解的简单事实问答,开启推理也能显著提升召回率,其动力来自额外 token 提供的计算缓冲效应以及生成相关背景事实的事实启动效应。

    推荐理由:研究解构了思考过程辅助大模型召回参数化知识的机制,为理解推理模型的能力边界与中间步骤优化提供了实验依据。

6月17日周三
6月6日周六
  1. Sebastian Raschka62

    Sebastian Raschka 盘点 2026 年上半年大语言模型研究论文清单

    Sebastian Raschka 发布了 2026 年 1 月至 5 月的精选大语言模型研究论文清单,重点关注混合架构、推理与强化学习等领域。文章指出今年架构设计不再局限于扩大 Transformer 规模,而是转向注意力层与 Mamba-2 或 Gated DeltaNet 交替的混合架构以提升长上下文效率。

    推荐理由:作者整理了前五个月核心论文与架构趋势,读者可快速掌握混合架构与长上下文演进方向。

5月22日周五
5月20日周三
  1. Google Research75

    Google ERA 科研代码辅助系统登上 Nature 并通过 Gemini for Science 开放

    Google 宣布其实验研究辅助系统 ERA(Empirical Research Assistance)论文在 Nature 正式发表,并开始通过 Gemini for Science 逐步开放基于 ERA 和 AlphaEvolve 构建的实验工具 Computational Discovery。

    推荐理由:原文展示了结合树搜索与大模型自动编写并优化科研代码的方法,为多学科计算实验的自动化提供了实测参考。

5月16日周六
  1. Sebastian Raschka65

    大语言模型架构最新进展:KV 共享、mHC 与压缩注意力

    Sebastian Raschka 梳理了解读近期开源大语言模型在长上下文效率上的核心架构演进。文章重点分析了 Gemma 4 的跨层 KV 共享与分层嵌入(PLE)、Laguna XS.2 的逐层注意力预算、ZAYA1-8B 的压缩卷积注意力(CCA),以及 DeepSeek V4 采用的流形约束超连接(mHC)与 CSA/HCA 混合压缩注意力。

    推荐理由:原文系统梳理了主流开源大模型在长上下文下的架构改进,读者可据此理解降低 KV 缓存与计算开销的设计取舍。

  2. Google DeepMind62

    Google DeepMind 与斯坦福利用 Co-Scientist 筛选出肝纤维化候选药物

    斯坦福大学医学院团队利用 Google DeepMind 的 Co-Scientist 从海量文献中筛选老药新用以治疗肝纤维化,相关成果发表于 Advanced Science。

    推荐理由:斯坦福团队通过活体人类肝细胞实验验证了 Co-Scientist 筛选老药的能力,为 AI 辅助药物重定向提供了直接对比与实验数据。

5月1日周五
4月30日周四
4月24日周五
  1. DeepSeek 公众号93

    DeepSeek-V4 预览版上线并开源:标配 1M 上下文,推出 Pro 与 Flash 双版本

    DeepSeek 正式上线并开源全新系列模型 DeepSeek-V4 预览版,全系标配 1M 上下文,提供 DeepSeek-V4-Pro 与 DeepSeek-V4-Flash 两个版本。

    推荐理由:原文给出了两个版本的性能定位、架构优化细节与接口迁移时间表,读者可以据此评估长上下文模型在编码与 Agent 场景下的接入成本。

4月22日周三
  1. Google Research65

    Google 提出智能体记忆框架 ReasoningBank:从成败经验中提炼推理模式实现测试时自进化

    Google Research 提出智能体记忆框架 ReasoningBank,通过同时从成功和失败经验中提炼高层结构化推理模式与防错规则,使 AI 智能体在部署后具备测试时持续自进化能力。结合记忆感知测试时扩展(MaTTS)机制,智能体在 WebArena 和 SWE-bench Verified 评测中任务成功率分别提升 8.3% 与 4.6%,同时显著降低了无效探索步骤。

    推荐理由:该研究将测试时扩展与智能体记忆机制结合,为解决智能体重复犯错和缺乏长程自进化能力提供了可落地的闭环框架。

4月16日周四
4月13日周一
3月25日周三
3月22日周日
  1. Sebastian Raschka67

    现代大模型注意力机制变体全景图解:从 GQA、MLA 到混合架构

    Sebastian Raschka 系统梳理了现代主流开源大模型中应用的注意力机制变体与设计权衡。文章重点解析了标准多头注意力(MHA)、分组查询注意力(GQA)、多头潜在注意力(MLA)、滑动窗口注意力(SWA)以及 DeepSeek 稀疏注意力(DSA),展示了各机制在模型表现与 KV Cache 占用上的对比。

    推荐理由:梳理了主流开源大模型中各类注意力变体的机制差异与权衡,便于读者系统理解长上下文下的 KV Cache 优化与混合架构演进。

3月12日周四
2月25日周三
  1. Sebastian Raschka73

    2026 年初开源大模型架构横向对比:从注意力混合机制到长上下文推理优化

    Sebastian Raschka 梳理并对比了 2026 年 1 至 2 月发布的 10 余款代表性开源大模型的网络架构与基准表现。分析指出近期开源模型普遍强化了推理计算效率设计,包括广泛采用 MLA、DeepSeek 稀疏注意力、Gated DeltaNet 等线性注意力混合机制、多 Token 预测以及滑动窗口注意力。

    推荐理由:原文横向对比了多款开源大模型的注意力机制与混合专家结构演进,读者可据此理清长上下文与推理效率优化的关键设计差异。

1月24日周六
1月20日周二
12月30日周二
  1. Sebastian Raschka67

    Sebastian Raschka 发布 2025 年大语言模型年度综述与技术预测

    Sebastian Raschka 发布 2025 年大模型年度盘点与预测,指出大模型演进的核心驱动力已转向以 RLVR 与 GRPO 为代表的后训练推理以及推理时扩展。

    推荐理由:系统梳理了推理模型、后训练强化学习与混合架构的演进,为读者研判大模型技术路线与工程落地提供了多维度参考。

  2. Sebastian Raschka41

    LLM 研究论文清单:2025年7月至12月

    Sebastian Raschka 发布了 2025 年 7 月至 12 月的 LLM 精选研究论文清单。该清单涵盖推理模型训练与推理策略、强化学习、推理时扩展(Inference-Time Scaling)、模型架构、高效训练、扩散语言模型及多模态等分类。作者同时发布了年度回顾文章《State of LLMs 2025: Progress, Problems, and Predictions》。

12月3日周三
  1. Sebastian Raschka75

    从 DeepSeek V3 到 V3.2:架构、稀疏注意力与强化学习演进解析

    Sebastian Raschka 深入剖析了 DeepSeek 从 V3 到 V3.2 的技术演进,涵盖模型架构、稀疏注意力机制与强化学习优化。DeepSeek V3.2 引入了由 Lightning Indexer 驱动的 DeepSeek 稀疏注意力机制(DSA),将注意力计算复杂度从二次方降低至线性 O(Lk)。

    推荐理由:梳理了稀疏注意力 DSA 与 GRPO 算法调优的技术演进脉络,有助于理解开源大模型在长上下文效率与强化学习稳定性上的工程实现细节。

12月1日周一
  1. DeepSeek 公众号93

    DeepSeek 发布 V3.2 正式版与 V3.2-Speciale 模型并开源

    DeepSeek 正式发布并开源 DeepSeek-V3.2 与长思考增强版 DeepSeek-V3.2-Speciale 两个正式版模型,网页端、App 和 API 已同步更新。DeepSeek-V3.2 首次支持在思考模式下进行多轮工具调用,并适配了 Claude Code;Speciale 版本专注于高难度数学与逻辑推理,目前以限时 API 服务形式开放给社区评测。

    推荐理由:官方正式发布两款新模型并开源权重,重点实现了思考推理与工具调用的深度结合,并同步更新了服务接口。

11月4日周二
  1. Sebastian Raschka67

    超越标准 LLM:盘点混合注意力、文本扩散与递归等新兴模型架构

    文章盘点了超越传统自回归 Transformer 的四类新兴模型架构及其实践权衡。线性注意力混合架构(如 Qwen3-Next 与 Kimi Linear 的 Gated DeltaNet)通过结合全局注意力与线性层大幅缩减 KV cache 并支持超长上下文。

    推荐理由:系统梳理了线性注意力混合、文本扩散及代码世界模型等非传统架构,为评估长文本效率与并行生成提供了清晰的权衡参照。

10月5日周日
  1. Sebastian Raschka66

    从零理解大模型评测的 4 种主流方法

    Sebastian Raschka 撰文详解并用代码实操了大模型评测的 4 大主流方法,将其归纳为基准测试与裁判评估两大类。内容涵盖 MMLU 多选题准确率评测、面向数学和代码领域的确定性验证器(Verifier)、LM Arena 风格的 Elo 偏好排行榜,以及通过 Ollama 调用大模型充当裁判(LLM-as-a-judge)的具体实现与优缺点权衡。

    推荐理由:原文从零代码拆解了多选题、验证器、排行榜和 LLM 裁判四类评测机制,有助于读者厘清基准测试的局限与组合评估策略。

9月11日周四
  1. SemiAnalysis · 算力产业85

    SemiAnalysis 深度剖析 NVIDIA Rubin CPX 加速器与机柜架构:专用硬件重塑解耦推理

    NVIDIA 推出专为大模型推理 Prefill 阶段设计的 Rubin CPX 加速器及配套机柜架构,通过强化算力并降低显存带宽成本重塑解耦推理服务。

    推荐理由:文章深入剖析了面向 Prefill 阶段的专用硬件架构与机柜设计,为评估大模型解耦推理与算力 TCO 提供了清晰的参考视角。

8月9日周六