跳到正文
今天9月30日周三
  1. Google Developers · AI 筛选57

    Google Cloud 推出基于 Cloud TPU 与 vLLM 的长上下文多模态嵌入推理优化方案

    Google Cloud 针对千问 Qwen3 嵌入模型在 Cloud TPU 上的 vLLM 推理进行了深度优化,实现高精度长上下文多模态嵌入生成。团队通过硬件级词表填充对齐张量、优化延迟加载与编译预热,并构建混合 StepPool 架构支持 Chunked Prefill,确保在 16K 序列长度下输出与基准保持严格的数值对齐。

  2. IT168 服务器存储 · AI与算力(网页)58

    施耐德电气解析 800V 直流进 AI 数据中心的安全挑战与架构解法

    施耐德电气发布 800V 直流弧闪分析实践研究,指出 800V 直流的弧闪风险主要由系统架构对故障能量的管理能力决定,而非电压等级本身。传统基于交流系统的稳态短路电流计算难以准确反映电力电子系统的动态特征,容易导致风险评估偏保守。该研究提出安全评估需转向瞬态分析与数字建模,并在架构设计阶段通过机柜级优化等手段从源头约束故障能量。

  3. IT168 服务器存储 · AI与算力(网页)26

    锐捷网络在CIOE 2026展示光电融合、超节点与AIDC等创新方案

    锐捷网络在CIOE 2026上展示了光电融合、超节点和AIDC三大方向的创新方案,涵盖800G/1.6T光互联、NPO交换机、超节点RG-ETH 128及ScaleUp交换机、AI-Fabric等产品。该系列方案针对AI算力规模增长带来的带宽、功耗、时延及运维挑战,旨在实现低时延、高可靠与低能耗连接,简化大规模AI网络的部署与管理。

  4. vLLM 官方博客(网页)42

    IsoExec:通过统一执行消除 SkyRL 训练与推理不一致

    SkyRL 引入跨框架统一执行抽象 IsoExec,通过统一执行契约与对齐的批次无关算子,消除 vLLM 推理引擎与 Megatron 训练引擎之间的数值执行不一致。在单台 8×H100 节点运行 Qwen3.5-35B-A3B 同步 DAPO 训练时,IsoExec 将采样与训练间的平均 logprob 差异降至 1e-6 以下,50 步内的额外开销为 25%。

  5. vLLM 官方博客(网页)69

    vLLM 在 AMD GPU 上的投机解码实践指南与性能实测

    vLLM 官方发布在 AMD Instinct MI300X 与 MI355X GPU 上实现投机解码的实践指南与评测结果,系统评估了单次目标模型前向验证多个草稿 token 的加速效果。

    推荐理由:文章详细对比了五种投机解码机制在不同模型与负载下的吞吐表现,为大模型推理加速与参数调优提供了可迁移的工程参考。

  6. vLLM 官方博客(网页)75

    vLLM-Omni 支持 MiniMax H3 系统级优化与 FastH3 实时推理

    vLLM-Omni 宣布完成对 MiniMax H3 的全栈推理优化并集成 FastVideo 的 4 步蒸馏方案 FastH3,实现了生成速度快于播放时长的端到端实时服务。

    推荐理由:文章拆解了音视频联合生成从 DiT 到 VAE 及视频封装的全链路瓶颈,为多模态大模型的低延迟部署提供了系统级参考。

  7. vLLM 官方博客(网页)77

    vLLM 针对真实 Agent 工作负载推出全栈推理服务优化

    vLLM 针对多轮会话、长上下文及高前缀复用的 Agent 工作负载推出全栈推理优化方案,涵盖统一内存页混合 KV cache 管理、分层离线卸载、模型自适应并行及防队头阻塞调度。

    推荐理由:原文梳理了长上下文与高前缀复用负载下的全栈推理优化方案,为大模型智能体部署和算力选型提供了实测参考。

  8. vLLM 官方博客(网页)72

    vLLM 引入 Hybrid HiSparse 混合稀疏卸载优化,支持 GLM 5.3 单机长上下文高并发推理

    vLLM 针对 GLM 5.3 推出 Hybrid HiSparse 混合稀疏卸载优化机制,使单个 8× H200 节点即可运行 100 万全长上下文并显著提升并发能力。

    推荐理由:文章给出了混合稀疏卸载机制在单节点上的显存管理设计,为长上下文大模型推理的高并发部署提供了实用方案。

  9. vLLM 官方博客(网页)73

    vLLM 推出分层 KV Cache 卸载框架

    vLLM 正式推出分层 KV Cache 卸载框架(Tiered KV Cache Offloading),支持将加速卡显存中逐出的 KV 数据下沉至主机内存、文件系统、对象存储或远端节点以避免重复计算。

    推荐理由:框架通过主机内存统筹多级存储与节点间共享,为长上下文和大并发下的显存瓶颈提供了低成本扩展方案。

  10. Google Developers · AI 筛选67

    Google AI 订阅正式整合 Google Colab 高级权益

    Google 宣布即日起将 Google Colab 高级权益纳入 Google AI 订阅方案,订阅用户可优先访问更快的加速器与更强算力机型。其中 Google AI Ultra 订阅者还可解锁高级 GPU 访问以及不中断的后台执行能力,长时间训练无需保持浏览器标签页打开。已有 Colab 订阅的用户权益不受影响且支持权益叠加,相关更新将在接下来数周内逐步推送。

    推荐理由:原文明确了不同订阅档位新增的硬件与后台运行权限,开发者可据此评估打包订阅的算力性价比。

  11. Google Developers · AI 筛选63

    Google 基于 MaxText 与 TPU 完整复现 Olmo 3 7B 预训练流程

    Google 团队使用基于 JAX 的 MaxText 框架与 Cloud TPU,从头完整复现了 Ai2 的 Olmo 3 7B 第一阶段约 5.9T token 预训练与第二阶段 mid-training 退火训练。

    推荐理由:原文系统复盘了在 TPU 上复现 PyTorch 大模型预训练的工程细节与性能调优,读者可据此参考跨框架对齐与断点续训的验证方法。

9月29日周二
  1. Data Center Knowledge33

    下一代 AI 基础设施设计始于能效

    AI 高密度动态负载正促使数据中心从单纯扩充容量转向系统级能效设计,强调供电、冷却、算力与运营的跨系统协同。行业平均 PUE 从 2007 年的 2.50 降至 2026 年的 1.52,新设施已常规达 1.3 或更低,评估体系正向涵盖 WUE、CUE、ERE、CPE 及电网感知运营(GAE)的多维框架演进。从设计初期兼顾全系统协同有助于降低运营成本并提升基础设施韧性。

9月28日周一
  1. Data Center Knowledge54

    超级电容器能否平抑 AI 算力引起的电力尖峰波动

    AI 算力负载引起的瞬时电力激增促使数据中心测试超级电容器作为电池与 UPS 的补充,用于电压稳定、削峰及毫秒至秒级的短期备电。IDTechEx 报告预测数据中心超级电容器市场将在 2037 年达到 9.5 亿美元(复合年增长率 40.9%),主要涵盖双电层电容器(EDLC)、混合电容器和准电容器三种技术路线。

  2. 量子位72

    华为发布源网荷储AIDC 1.0解决方案及供电液冷新进展

    华为在全联接大会期间发布源网荷储AIDC 1.0解决方案,并展示了泰山UPS、恒山直流UPS、SmartLi 5.0以及原生适配昇腾服务器的TMU液冷系统。方案从供电链路、热管理、数字化运营与工厂预制化建设四个维度重构AIDC架构,推动智算中心从传统PUE能效管理转向以每瓦Token产出(TPW)为核心的算电协同全链路优化。

    推荐理由:原文梳理了华为源网荷储AIDC方案在供电、液冷与工程交付上的演进路径,为理解智算中心算电协同提供了参考。

  3. NVIDIA Developer Blog54

    NVIDIA DSX MaxLPS 如何提升 AI 工厂吞吐量与能效

    NVIDIA DSX MaxLPS 采用受策略管控的功率共享机制,在参与资源间动态分配电力以最大化 AI 工厂的吞吐量与能效。传统 AI 工厂通常按照所有 GPU 达到峰值功耗的极端场景进行供电配置,导致正常运行期间存在大量未充分利用的保护性冗余;该方案旨在释放闲置电量并支持部署更多算力资源。

  4. ServeTheHome62

    华硕展示液冷 HGX Rubin NVL8 与 Vera Rubin NVL72 AI 服务器方案

    华硕在首尔举办的 ASUS AI Tech 2026 活动上展示了多款新型 AI 服务器与机架解决方案。其 HGX Rubin NVL8 液冷节点通过翻转基板上的 GPU 朝向优化液冷散热,将 8 颗 Rubin GPU 压缩进 1U 空间并集成新一代板载 NVLink Switch。

    推荐理由:华硕展示的液冷架构通过翻转 GPU 方向将 8 卡 HGX Rubin 压缩至 1U 空间,展现了高密度算力机架在散热设计上的演进路径。

9月26日周六
  1. Data Center Knowledge57

    美国多地加强遏制数据中心投机建设,超1700亿美元AI设施受阻

    美国公用事业机构与监管部门正收紧接入审查以遏制投机性数据中心申请,社区反对与电力短缺成为算力基建扩张的主要障碍。能源咨询机构 Relae 统计显示,自 2024 年 1 月以来已有超过 1700 亿美元的 AI 数据中心容量因社区反对被阻断、撤回或搁置。尽管高盛预计科技巨头今年在美 AI 基础设施支出达 5810 亿美元,但劳动力短缺与关键电气设备漫长的交付周期仍在持续制约落地速度。

  2. Data Center Knowledge74

    Google 推进电网互动型 AI 数据中心架构与供电演进

    Google 在 Data Center World 会议上阐述了其电网互动型 AI 数据中心演进方案,推动数据中心从备用电源用户转向电网稳定性合作伙伴。目前 Google 每月处理超过 3000 万亿 AI token,为应对单机架接近 1MW 的密度挑战,其供电架构正从机柜级 54VDC 向 800VDC 演进,并采用相邻 sidecar 机柜布线以节省空间。

    推荐理由:原文解析了吉瓦级算力园区如何通过机架直流供电与储能削峰协同电网,为超高密度智算基建提供了系统性演进参考。

9月25日周五
9月24日周四
  1. Data Center Knowledge45

    光频梳发生器在 AI 数据中心中的作用

    随着 AI 数据中心波分复用通道从 4 个增至 8 到 32 个,光学频率梳发生器通过单一光源产生多个均匀波长,打破了传统激光器阵列随通道增加而硬件膨胀的瓶颈。该技术可将光链路总功耗降低 2 至 3 倍并提升可靠性,主要面向 30 至 100 米的机柜内及行间互连。目前 Solinide 等厂商已开始交付或送样,标准化共封装光学外置光源预计将在 2028 年实现量产。

  2. Vertiv 官方新闻62

    Vertiv 宣布收购 King Environmental Services,拓展全球高密度液冷数据中心流体管理服务

    Vertiv 宣布达成协议收购欧洲流体管理、调试及负载测试服务商 King Environmental Services Ltd.(KES),将高密度液冷数据中心热管理服务能力扩展至欧洲、中东和非洲(EMEA)地区。KES 业务涵盖管路冲洗、水处理、系统平衡验证以及液冷与电力系统的大规模负载测试,为 AI 高密计算设施提供全生命周期保障。交易预计于 2026 年第四季度完成,具体财务条款未披露。

    推荐理由:Vertiv 继收购北美 PurgeRite 后再购欧洲 KES,将高密度液冷数据中心的流体管理与负载测试服务扩展至 EMEA 区域。

  3. NVIDIA Developer Blog34

    在 AI 工作负载上线前验证 GPU 集群就绪性

    GPU 集群即使通过常规健康检查,在承载实际 AI 工作负载时仍可能出现性能下降或运行失败。在 512-GPU 训练任务中,单颗慢速 GPU、高负载下劣化的网络链路或走慢速路径的异常配置,往往导致运维人员在运行数小时后才发现问题,因此在 AI 负载正式运行前验证集群就绪状态至关重要。

  4. NVIDIA Developer Blog38

    用 NodeWright 管理 Kubernetes 节点集群

    NodeWright 提供了一套管理 Kubernetes 节点集群的方案,旨在解决节点底层的运维难题。虽然 Kubernetes 负责管理容器负载,但内核设置、系统软件包、存储布局、安全 agent 及 GPU 工作负载所需的宿主机调优通常依赖 Ansible 与手动脚本,容易在跨区域部署或内核升级破坏 RDMA 时失效。

  5. Google DeepMind62

    Google 为 Private AI Compute 引入服务端安全记忆架构

    Google 宣布为其 Private AI Compute 平台升级安全服务端记忆能力,使 AI 助手在保持设备端隐私标准的同时具备跨设备的持久上下文。该方案将解密密钥完全保留在用户设备端,云端安全隔离区仅在处理请求时于隔离内存中临时解密数据,完成计算后立即重新加密存储。Google 同步公开了服务端软件的防篡改记录与第三方独立审计结果以供外部验证。

    推荐理由:该架构通过设备端掌握密钥与云端安全隔离区结合,解决了跨设备长期记忆与隐私保护难以兼顾的工程矛盾。

9月23日周三
  1. Data Center Knowledge52

    数据中心内部潜藏的十种气体危害与安全排查指南

    数据中心内部因 UPS 电池、冷水机组、备用发电机、开关柜及水处理等设备,潜藏着近 10 种气体与化学安全隐患。铅酸电池析氢与锂电池热失控容易引发火灾与有毒气体释放,制冷剂泄漏、发电机废气及 SF6 分解物还会导致窒息风险,高密闭建筑与液冷管路增加进一步加剧了积聚隐患。运维团队应统一化学品与危险源清单,按气体特性合理设定探测器安装高度,并确保传感器易于校准维护。

  2. NVIDIA Developer Blog47

    基于 NVIDIA Topograph 实现拓扑感知工作负载调度

    NVIDIA Topograph 聚焦于受电力限制的 AI 工厂场景,通过拓扑感知优化 GPU 工作负载调度与放置。不合理的工作负载放置会割裂拓扑域并迫使网络流量经过共享链路,从而降低系统吞吐量并推高作业成本。这还会导致 GPU 在等待数据交互时持续消耗预留电力,无法有效推进计算负载。