跳到正文
原文
Sebastian Raschka· Sebastian Raschka, PhD·· 2026-05-16精选AI 评分65

大语言模型架构最新进展:KV 共享、mHC 与压缩注意力

Recent Developments in LLM Architectures: KV Sharing, mHC, and Compressed Attention

AI 导读

Sebastian Raschka 梳理了解读近期开源大语言模型在长上下文效率上的核心架构演进。文章重点分析了 Gemma 4 的跨层 KV 共享与分层嵌入(PLE)、Laguna XS.2 的逐层注意力预算、ZAYA1-8B 的压缩卷积注意力(CCA),以及 DeepSeek V4 采用的流形约束超连接(mHC)与 CSA/HCA 混合压缩注意力。

推荐理由

原文系统梳理了主流开源大模型在长上下文下的架构改进,读者可据此理解降低 KV 缓存与计算开销的设计取舍。

来源:Sebastian Raschka · magazine.sebastianraschka.com