跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

168条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 161–168 条 · 共 168 条
5月16日周六
  1. Sebastian Raschka65

    大语言模型架构最新进展:KV 共享、mHC 与压缩注意力

    Sebastian Raschka 梳理了解读近期开源大语言模型在长上下文效率上的核心架构演进。文章重点分析了 Gemma 4 的跨层 KV 共享与分层嵌入(PLE)、Laguna XS.2 的逐层注意力预算、ZAYA1-8B 的压缩卷积注意力(CCA),以及 DeepSeek V4 采用的流形约束超连接(mHC)与 CSA/HCA 混合压缩注意力。

    推荐理由:原文系统梳理了主流开源大模型在长上下文下的架构改进,读者可据此理解降低 KV 缓存与计算开销的设计取舍。

5月14日周四
  1. Kubernetes Blog74

    Kubernetes v1.36 演进工作负载感知调度

    Kubernetes v1.36 升级工作负载感知调度架构,将 Workload API 拆分为静态模板与管理运行时状态的 PodGroup API,并为 kube-scheduler 增加原子化 PodGroup 调度周期以支持成组调度(gang scheduling)。

    推荐理由:原生拆分静态模板与运行时分组状态,并联合调度周期与抢占机制,使分布式训练等紧耦合任务摆脱了复杂外挂调度系统的依赖。

5月8日周五
  1. Kubernetes Blog71

    Kubernetes v1.36 升级动态资源分配 DRA

    Kubernetes 在 v1.36 版本中推进动态资源分配(DRA)架构升级,使设备优先级回退列表功能进入稳定版,并新增对大规模工作负载共享 ResourceClaim 的支持。该版本还将可分区设备、设备污点、绑定条件与健康状态暴露等特性推进至 Beta,同时在 Alpha 阶段支持使用 DRA 统一管理 CPU 和内存等节点资源,并规范了容器内设备元数据的标准发现协议。

    推荐理由:原文展示了 DRA 从专用加速器扩展到通用算力与工作负载级调度的演进细节,为 AI 集群资源管理与平滑迁移提供了落地参考。

5月2日周六
4月28日周二
11月4日周二
  1. Sebastian Raschka67

    超越标准 LLM:盘点混合注意力、文本扩散与递归等新兴模型架构

    文章盘点了超越传统自回归 Transformer 的四类新兴模型架构及其实践权衡。线性注意力混合架构(如 Qwen3-Next 与 Kimi Linear 的 Gated DeltaNet)通过结合全局注意力与线性层大幅缩减 KV cache 并支持超长上下文。

    推荐理由:系统梳理了线性注意力混合、文本扩散及代码世界模型等非传统架构,为评估长文本效率与并行生成提供了清晰的权衡参照。

9月11日周四
  1. SemiAnalysis · 算力产业85

    SemiAnalysis 深度剖析 NVIDIA Rubin CPX 加速器与机柜架构:专用硬件重塑解耦推理

    NVIDIA 推出专为大模型推理 Prefill 阶段设计的 Rubin CPX 加速器及配套机柜架构,通过强化算力并降低显存带宽成本重塑解耦推理服务。

    推荐理由:文章深入剖析了面向 Prefill 阶段的专用硬件架构与机柜设计,为评估大模型解耦推理与算力 TCO 提供了清晰的参考视角。

8月12日周二
  1. SemiAnalysis · 算力产业72

    SemiAnalysis 深度解析 HBM 路线图与内存墙挑战

    SemiAnalysis 梳理了 HBM 在 AI 加速器中的演进路径、制造工艺与供应链格局。报告指出,随着长上下文推理与强化学习需求激增,系统受限于显存带宽与容量瓶颈,推动英伟达等厂商向单卡 1TB HBM4E 演进;同时 TSV 与先进封装良率成为关键约束,JEDEC 放宽 775 微米堆叠高度推迟了混合键合的落地,促使产业通过 KVCache 卸载等分层内存架构缓解瓶颈。

    推荐理由:报告系统梳理了从封装制造到模型推理各层级的 HBM 瓶颈与路线演进,适合读者理解 AI 硬件与模型协同扩展的物理制约。