数据中心行业:越快倾听,行动越快
数据中心行业面临的核心挑战并非许可审批或沟通问题,而是信任问题。行业需要通过更快倾听来建立信任,从而加快整体行动与推进步伐。
数据中心行业面临的核心挑战并非许可审批或沟通问题,而是信任问题。行业需要通过更快倾听来建立信任,从而加快整体行动与推进步伐。
Meta 已签约使用 Firmus 位于东南亚数据中心的 AI 算力容量。该合作进一步拓展了双方此前在澳大利亚达成的既有协议。
Google Cloud 针对千问 Qwen3 嵌入模型在 Cloud TPU 上的 vLLM 推理进行了深度优化,实现高精度长上下文多模态嵌入生成。团队通过硬件级词表填充对齐张量、优化延迟加载与编译预热,并构建混合 StepPool 架构支持 Chunked Prefill,确保在 16K 序列长度下输出与基准保持严格的数值对齐。
施耐德电气发布 800V 直流弧闪分析实践研究,指出 800V 直流的弧闪风险主要由系统架构对故障能量的管理能力决定,而非电压等级本身。传统基于交流系统的稳态短路电流计算难以准确反映电力电子系统的动态特征,容易导致风险评估偏保守。该研究提出安全评估需转向瞬态分析与数字建模,并在架构设计阶段通过机柜级优化等手段从源头约束故障能量。
锐捷网络在CIOE 2026上展示了光电融合、超节点和AIDC三大方向的创新方案,涵盖800G/1.6T光互联、NPO交换机、超节点RG-ETH 128及ScaleUp交换机、AI-Fabric等产品。该系列方案针对AI算力规模增长带来的带宽、功耗、时延及运维挑战,旨在实现低时延、高可靠与低能耗连接,简化大规模AI网络的部署与管理。
Cerebras 在 HOT CHIPS 2026 上详细解析了基于 Nexus 机架平台的 CS-4 系统架构,并公布了 CS-5 与 CS-6 的技术演进路线。
推荐理由:Cerebras 披露了 CS-4 机架级供电与散热架构细节,并展示了通过 3D 堆叠 DRAM 突破晶圆级内存瓶颈的技术演进路径。
VeRL-Omni 正式发布 v0.2.0 版本,重点提升扩散模型与全模态强化学习的训练吞吐与系统稳定性。
推荐理由:该版本通过请求级批处理和标准化适配器,解决了扩散模型与全模态大模型强化学习中高延迟和架构耦合的问题。
SkyRL 引入跨框架统一执行抽象 IsoExec,通过统一执行契约与对齐的批次无关算子,消除 vLLM 推理引擎与 Megatron 训练引擎之间的数值执行不一致。在单台 8×H100 节点运行 Qwen3.5-35B-A3B 同步 DAPO 训练时,IsoExec 将采样与训练间的平均 logprob 差异降至 1e-6 以下,50 步内的额外开销为 25%。
vLLM 官方发布在 AMD Instinct MI300X 与 MI355X GPU 上实现投机解码的实践指南与评测结果,系统评估了单次目标模型前向验证多个草稿 token 的加速效果。
推荐理由:文章详细对比了五种投机解码机制在不同模型与负载下的吞吐表现,为大模型推理加速与参数调优提供了可迁移的工程参考。
vLLM-Omni 宣布完成对 MiniMax H3 的全栈推理优化并集成 FastVideo 的 4 步蒸馏方案 FastH3,实现了生成速度快于播放时长的端到端实时服务。
推荐理由:文章拆解了音视频联合生成从 DiT 到 VAE 及视频封装的全链路瓶颈,为多模态大模型的低延迟部署提供了系统级参考。
vLLM 正式推出 vLLM TT Plugin,通过树外平台插件机制将 Tenstorrent 硬件接入 vLLM 推理生态,对外保持兼容 OpenAI 格式 API。
推荐理由:文章详细展示了非 GPU 网格架构适配 vLLM 的工程实践,为异构芯片接入主流推理框架提供了调度与并行设计参考。
vLLM 针对多轮会话、长上下文及高前缀复用的 Agent 工作负载推出全栈推理优化方案,涵盖统一内存页混合 KV cache 管理、分层离线卸载、模型自适应并行及防队头阻塞调度。
推荐理由:原文梳理了长上下文与高前缀复用负载下的全栈推理优化方案,为大模型智能体部署和算力选型提供了实测参考。
vLLM 针对 GLM 5.3 推出 Hybrid HiSparse 混合稀疏卸载优化机制,使单个 8× H200 节点即可运行 100 万全长上下文并显著提升并发能力。
推荐理由:文章给出了混合稀疏卸载机制在单节点上的显存管理设计,为长上下文大模型推理的高并发部署提供了实用方案。
vLLM 正式推出分层 KV Cache 卸载框架(Tiered KV Cache Offloading),支持将加速卡显存中逐出的 KV 数据下沉至主机内存、文件系统、对象存储或远端节点以避免重复计算。
推荐理由:框架通过主机内存统筹多级存储与节点间共享,为长上下文和大并发下的显存瓶颈提供了低成本扩展方案。
vime、RL-Kernel 与 AMD 合作在 ROCm 上实现了 Megatron 训练与 vLLM rollout 的逐比特数值一致性。在 8× AMD Instinct MI300X 运行的 Qwen3-8B GRPO 端到端实验中,系统连续 200 步实现 mismatch_count = 0 且 max_abs_diff = 0。
Google 宣布即日起将 Google Colab 高级权益纳入 Google AI 订阅方案,订阅用户可优先访问更快的加速器与更强算力机型。其中 Google AI Ultra 订阅者还可解锁高级 GPU 访问以及不中断的后台执行能力,长时间训练无需保持浏览器标签页打开。已有 Colab 订阅的用户权益不受影响且支持权益叠加,相关更新将在接下来数周内逐步推送。
推荐理由:原文明确了不同订阅档位新增的硬件与后台运行权限,开发者可据此评估打包订阅的算力性价比。
Google 团队使用基于 JAX 的 MaxText 框架与 Cloud TPU,从头完整复现了 Ai2 的 Olmo 3 7B 第一阶段约 5.9T token 预训练与第二阶段 mid-training 退火训练。
推荐理由:原文系统复盘了在 TPU 上复现 PyTorch 大模型预训练的工程细节与性能调优,读者可据此参考跨框架对齐与断点续训的验证方法。
MagPro 推出 AeroLev 1850 冷却方案,旨在推进 AI 数据中心的节水冷却。该方案通过消除蒸发冷却用水,解决了干旱和缺水地区数据中心面临的关键运营限制。
英飞凌与伊顿达成合作,共同开发基于碳化硅(SiC)的固态变压器以支持800VDC电源架构。英飞凌的碳化硅功率器件将部署在伊顿的 MVSST 2.0 平台中。
阿里云计划在土耳其、芬兰和荷兰新建云地域(Cloud Regions)。同时,阿里云还将进一步扩建在马来西亚、德国、阿联酋等地的现有算力基础设施布局。
Google 已获得爱尔兰规划委员会(An Coimisiún Pleanála)的规划许可,获准扩建其位于爱尔兰都柏林的数据中心。该扩建方案已正式获批通过。
AI 高密度动态负载正促使数据中心从单纯扩充容量转向系统级能效设计,强调供电、冷却、算力与运营的跨系统协同。行业平均 PUE 从 2007 年的 2.50 降至 2026 年的 1.52,新设施已常规达 1.3 或更低,评估体系正向涵盖 WUE、CUE、ERE、CPE 及电网感知运营(GAE)的多维框架演进。从设计初期兼顾全系统协同有助于降低运营成本并提升基础设施韧性。
AI 算力负载引起的瞬时电力激增促使数据中心测试超级电容器作为电池与 UPS 的补充,用于电压稳定、削峰及毫秒至秒级的短期备电。IDTechEx 报告预测数据中心超级电容器市场将在 2037 年达到 9.5 亿美元(复合年增长率 40.9%),主要涵盖双电层电容器(EDLC)、混合电容器和准电容器三种技术路线。
华为在全联接大会期间发布源网荷储AIDC 1.0解决方案,并展示了泰山UPS、恒山直流UPS、SmartLi 5.0以及原生适配昇腾服务器的TMU液冷系统。方案从供电链路、热管理、数字化运营与工厂预制化建设四个维度重构AIDC架构,推动智算中心从传统PUE能效管理转向以每瓦Token产出(TPW)为核心的算电协同全链路优化。
推荐理由:原文梳理了华为源网荷储AIDC方案在供电、液冷与工程交付上的演进路径,为理解智算中心算电协同提供了参考。
NVIDIA DSX MaxLPS 采用受策略管控的功率共享机制,在参与资源间动态分配电力以最大化 AI 工厂的吞吐量与能效。传统 AI 工厂通常按照所有 GPU 达到峰值功耗的极端场景进行供电配置,导致正常运行期间存在大量未充分利用的保护性冗余;该方案旨在释放闲置电量并支持部署更多算力资源。
华硕在首尔举办的 ASUS AI Tech 2026 活动上展示了多款新型 AI 服务器与机架解决方案。其 HGX Rubin NVL8 液冷节点通过翻转基板上的 GPU 朝向优化液冷散热,将 8 颗 Rubin GPU 压缩进 1U 空间并集成新一代板载 NVLink Switch。
推荐理由:华硕展示的液冷架构通过翻转 GPU 方向将 8 卡 HGX Rubin 压缩至 1U 空间,展现了高密度算力机架在散热设计上的演进路径。
美国公用事业机构与监管部门正收紧接入审查以遏制投机性数据中心申请,社区反对与电力短缺成为算力基建扩张的主要障碍。能源咨询机构 Relae 统计显示,自 2024 年 1 月以来已有超过 1700 亿美元的 AI 数据中心容量因社区反对被阻断、撤回或搁置。尽管高盛预计科技巨头今年在美 AI 基础设施支出达 5810 亿美元,但劳动力短缺与关键电气设备漫长的交付周期仍在持续制约落地速度。
Google 在 Data Center World 会议上阐述了其电网互动型 AI 数据中心演进方案,推动数据中心从备用电源用户转向电网稳定性合作伙伴。目前 Google 每月处理超过 3000 万亿 AI token,为应对单机架接近 1MW 的密度挑战,其供电架构正从机柜级 54VDC 向 800VDC 演进,并采用相邻 sidecar 机柜布线以节省空间。
推荐理由:原文解析了吉瓦级算力园区如何通过机架直流供电与储能削峰协同电网,为超高密度智算基建提供了系统性演进参考。
AWS 介绍了在 Amazon EKS 上结合 Elastic Fabric Adapter(EFA)与 DeepEP 扩展 MoE 模型强化学习(RLHF 与 GRPO)训练的架构设计,实测将总 rollout 吞吐量提升了 40%。
AWS 联合 Qumulo 推出基于 Amazon SageMaker HyperPod 与 Cloud Native Qumulo(CNQ)的跨区域模型训练架构,无需全量复制数据即可让异地算力集群直接挂载读取单一数据集。
ASRock Rack 推出 SORANOD8-2L2T 主板,专为中端 SP6 平台的 AMD EPYC 8005“Sorano”处理器设计。该板采用 12 英寸 x 10 英寸的“ATX-like”板型,提供 8 个 DDR5 RDIMM 插槽,最高支持 2TB 内存与 DDR5-5200 速率。
随着 AI 数据中心波分复用通道从 4 个增至 8 到 32 个,光学频率梳发生器通过单一光源产生多个均匀波长,打破了传统激光器阵列随通道增加而硬件膨胀的瓶颈。该技术可将光链路总功耗降低 2 至 3 倍并提升可靠性,主要面向 30 至 100 米的机柜内及行间互连。目前 Solinide 等厂商已开始交付或送样,标准化共封装光学外置光源预计将在 2028 年实现量产。
Vertiv 宣布达成协议收购欧洲流体管理、调试及负载测试服务商 King Environmental Services Ltd.(KES),将高密度液冷数据中心热管理服务能力扩展至欧洲、中东和非洲(EMEA)地区。KES 业务涵盖管路冲洗、水处理、系统平衡验证以及液冷与电力系统的大规模负载测试,为 AI 高密计算设施提供全生命周期保障。交易预计于 2026 年第四季度完成,具体财务条款未披露。
推荐理由:Vertiv 继收购北美 PurgeRite 后再购欧洲 KES,将高密度液冷数据中心的流体管理与负载测试服务扩展至 EMEA 区域。
随着高密 GPU 算力推高散热负荷,水资源已成为与电力同等重要的数据中心选址与运营硬约束,行业评估正从单一平均 WUE 指标转向极端高温与缺水场景下的综合韧性。
GPU 集群即使通过常规健康检查,在承载实际 AI 工作负载时仍可能出现性能下降或运行失败。在 512-GPU 训练任务中,单颗慢速 GPU、高负载下劣化的网络链路或走慢速路径的异常配置,往往导致运维人员在运行数小时后才发现问题,因此在 AI 负载正式运行前验证集群就绪状态至关重要。
NodeWright 提供了一套管理 Kubernetes 节点集群的方案,旨在解决节点底层的运维难题。虽然 Kubernetes 负责管理容器负载,但内核设置、系统软件包、存储布局、安全 agent 及 GPU 工作负载所需的宿主机调优通常依赖 Ansible 与手动脚本,容易在跨区域部署或内核升级破坏 RDMA 时失效。
Google 宣布为其 Private AI Compute 平台升级安全服务端记忆能力,使 AI 助手在保持设备端隐私标准的同时具备跨设备的持久上下文。该方案将解密密钥完全保留在用户设备端,云端安全隔离区仅在处理请求时于隔离内存中临时解密数据,完成计算后立即重新加密存储。Google 同步公开了服务端软件的防篡改记录与第三方独立审计结果以供外部验证。
推荐理由:该架构通过设备端掌握密钥与云端安全隔离区结合,解决了跨设备长期记忆与隐私保护难以兼顾的工程矛盾。
vLLM 发布 v0.30.1rc0 预发布版本。该更新主要在 ROCm CI 中新增了针对 MI355 的 dense NVFP4 以及 MoRI 算子镜像(kernel mirrors)支持。
数据中心内部因 UPS 电池、冷水机组、备用发电机、开关柜及水处理等设备,潜藏着近 10 种气体与化学安全隐患。铅酸电池析氢与锂电池热失控容易引发火灾与有毒气体释放,制冷剂泄漏、发电机废气及 SF6 分解物还会导致窒息风险,高密闭建筑与液冷管路增加进一步加剧了积聚隐患。运维团队应统一化学品与危险源清单,按气体特性合理设定探测器安装高度,并确保传感器易于校准维护。
NVIDIA Topograph 聚焦于受电力限制的 AI 工厂场景,通过拓扑感知优化 GPU 工作负载调度与放置。不合理的工作负载放置会割裂拓扑域并迫使网络流量经过共享链路,从而降低系统吞吐量并推高作业成本。这还会导致 GPU 在等待数据交互时持续消耗预留电力,无法有效推进计算负载。