最新精选
第 161–168 条 · 共 168 条- Sebastian Raschka精选AI 评分6565
Sebastian Raschka 梳理了解读近期开源大语言模型在长上下文效率上的核心架构演进。文章重点分析了 Gemma 4 的跨层 KV 共享与分层嵌入(PLE)、Laguna XS.2 的逐层注意力预算、ZAYA1-8B 的压缩卷积注意力(CCA),以及 DeepSeek V4 采用的流形约束超连接(mHC)与 CSA/HCA 混合压缩注意力。
推荐理由:原文系统梳理了主流开源大模型在长上下文下的架构改进,读者可据此理解降低 KV 缓存与计算开销的设计取舍。
- Kubernetes Blog精选AI 评分7474
Kubernetes v1.36 升级工作负载感知调度架构,将 Workload API 拆分为静态模板与管理运行时状态的 PodGroup API,并为 kube-scheduler 增加原子化 PodGroup 调度周期以支持成组调度(gang scheduling)。
推荐理由:原生拆分静态模板与运行时分组状态,并联合调度周期与抢占机制,使分布式训练等紧耦合任务摆脱了复杂外挂调度系统的依赖。
- Kubernetes Blog精选AI 评分7171
Kubernetes 在 v1.36 版本中推进动态资源分配(DRA)架构升级,使设备优先级回退列表功能进入稳定版,并新增对大规模工作负载共享 ResourceClaim 的支持。该版本还将可分区设备、设备污点、绑定条件与健康状态暴露等特性推进至 Beta,同时在 Alpha 阶段支持使用 DRA 统一管理 CPU 和内存等节点资源,并规范了容器内设备元数据的标准发现协议。
推荐理由:原文展示了 DRA 从专用加速器扩展到通用算力与工作负载级调度的演进细节,为 AI 集群资源管理与平滑迁移提供了落地参考。
- Kubernetes Blog精选AI 评分6565
Kubernetes v1.36 引入 Pod 级资源管理器作为 Alpha 特性,将 kubelet 的拓扑、CPU 和内存管理器从单容器扩展至 Pod 级别。
推荐理由:该特性解决了机器学习等高性能场景下主容器与辅助容器共享资源的权衡难题,为混部调度提供了清晰的拓扑隔离路径。
- Kubernetes Blog精选AI 评分6161
Kubernetes 在 v1.36 版本中将挂起 Job 的 Pod 资源修改功能推进至 Beta 阶段,并默认开启相关特性门控。
推荐理由:原文展示了调度器在不重建 Job 的前提下动态调整批量任务算力配置的方法,有助于优化大集群与机器学习训练的调度流。
- Sebastian Raschka精选AI 评分6767
文章盘点了超越传统自回归 Transformer 的四类新兴模型架构及其实践权衡。线性注意力混合架构(如 Qwen3-Next 与 Kimi Linear 的 Gated DeltaNet)通过结合全局注意力与线性层大幅缩减 KV cache 并支持超长上下文。
推荐理由:系统梳理了线性注意力混合、文本扩散及代码世界模型等非传统架构,为评估长文本效率与并行生成提供了清晰的权衡参照。
- SemiAnalysis · 算力产业精选AI 评分8585
NVIDIA 推出专为大模型推理 Prefill 阶段设计的 Rubin CPX 加速器及配套机柜架构,通过强化算力并降低显存带宽成本重塑解耦推理服务。
推荐理由:文章深入剖析了面向 Prefill 阶段的专用硬件架构与机柜设计,为评估大模型解耦推理与算力 TCO 提供了清晰的参考视角。
- SemiAnalysis · 算力产业精选AI 评分7272
SemiAnalysis 梳理了 HBM 在 AI 加速器中的演进路径、制造工艺与供应链格局。报告指出,随着长上下文推理与强化学习需求激增,系统受限于显存带宽与容量瓶颈,推动英伟达等厂商向单卡 1TB HBM4E 演进;同时 TSV 与先进封装良率成为关键约束,JEDEC 放宽 775 微米堆叠高度推迟了混合键合的落地,促使产业通过 KVCache 卸载等分层内存架构缓解瓶颈。
推荐理由:报告系统梳理了从封装制造到模型推理各层级的 HBM 瓶颈与路线演进,适合读者理解 AI 硬件与模型协同扩展的物理制约。