跳到正文
9月22日周二
  1. NVIDIA Developer Blog65

    NVIDIA Dynamo-Triton 集成 TensorRT 多设备推理以简化多 GPU 模型服务

    NVIDIA 推出 TensorRT 多设备推理能力并在 Dynamo-Triton 中完成集成,旨在简化多 GPU 场景下的模型服务。该能力基于 NCCL 分布式通信集合,允许单个 TensorRT 网络跨多张 GPU 执行,同时保留 TensorRT 的推理优化性能,已自 TensorRT 11.0 起获得完整支持。

    推荐理由:原文介绍了基于 NCCL 的多 GPU 分布式推理新特性,读者可据此了解 TensorRT 11.0 的多卡部署优化机制。

  2. NVIDIA · AI 筛选78

    NVIDIA 推出 DSX Ready 认证计划,涵盖 AI 数据中心供电与液冷散热产品

    NVIDIA 正式推出 DSX Ready 认证计划,用于验证符合其 DSX AI 工厂参考设计要求的合作伙伴供电与散热解决方案。该项目首批设立电池储能系统(BESS)与冷量分配单元(CDU)两个类别,首批认证方案来自 Hitachi Energy、LG Energy Solution、Tesla、LG Electronics、LiquidStack 和 Vertiv。

    推荐理由:该计划为液冷与储能设备建立了统一的参考设计规范,有助于建设方降低 AI 数据中心的供电与散热系统集成风险。

  3. Data Center Knowledge38

    企业采用托管数据中心推进 AI 与混合云布局

    企业正加速采用托管数据中心承载 AI 推理计算与混合云架构,以解决传统机房高密供电不足及公有云成本高企等问题。现代托管设施支持 35kW 风冷与 70-150kW 液冷机柜,提供按需升级能力及超低网络延迟。报告显示 83% 的企业已完成或计划从公有云迁回工作负载,托管模式凭借成本确定性与安全隔离成为关键承载平台。

9月21日周一
  1. Data Center Knowledge62

    电网容量限制推动荷兰数据中心向阿姆斯特丹以外地区转移

    受电网拥堵与供电配额限制影响,荷兰新建数据中心正在从阿姆斯特丹向鹿特丹、格罗宁根和埃因霍温等周边区域分散。JLL 与 IDC 等机构指出,可交付电力已超越地价和光纤成为选址核心指标,单站点电力需求已从过去的 30MW 至 60MW 激增至最高 300MW,变压器交期延长至 3 年。

    推荐理由:原文梳理了供电交付周期取代土地和光纤成为欧洲算力选址第一考量的实际现状,为基础设施布局提供了区域参考。

9月20日周日
  1. The Next Platform66

    生成式 AI 繁荣加速以太网交换机变革:Q2 数据中心交换机营收同比增长 64.5%

    受生成式 AI 算力需求拉动,IDC 数据显示 2026 年 Q2 全球以太网交换机营收同比增长 43.4% 达到 189.1 亿美元,其中数据中心以太网交换机营收达 123 亿美元,同比增长 64.5%。

    推荐理由:文章通过拆解数据中心交换机市场与端口速率变化,展现了生成式 AI 算力集群对高速以太网架构的强劲拉动。

9月18日周五
  1. Data Center Knowledge49

    机柜功率快速攀升对数据中心意味着什么

    受 AI 工作负载与空间受限推动,数据中心平均机柜功率从 2024 年的 12 kW 翻倍增至 2026 年的 26 kW,部分设计甚至向 1 MW 逼近。单设备功耗达 700 W 的 GPU 与算力高密化,正加速芯片直接液冷和浸没式冷却技术的应用。更高单柜功率同时对数据中心的供配电冗余架构、冷却运维及地面承重提出了全面改造要求。

  2. AWS News · 云基础设施64

    Amazon EC2 T8i 突发性能实例正式上线

    AWS 宣布 Amazon EC2 T8i 突发性能实例正式可用,搭载定制第六代 Intel Xeon 可扩展处理器(Granite Rapids),相比上一代 T3 实例性价比最高提升 30%。

    推荐理由:原文给出了 T8i 实例的详细规格与性能对比,开发者可以据此评估低负载工作流向新一代突发实例迁移的性价比。

  3. The Next Platform70

    Bull 击败 HPE 赢得欧洲下一代 Lumi-AI 超算合同

    欧洲 EuroHPC 联合机构选定 Bull 击败 HPE 作为主要承包商,斥资 3.878 亿欧元(约 4.451 亿美元)在芬兰卡亚尼建设下一代 Lumi-AI 超算。

    推荐理由:给出欧洲新一代超算 Lumi-AI 招标细节与架构推演,读者可据此了解欧洲算力基建的技术选型与算力成本变化。

9月17日周四
  1. Data Center Knowledge51

    僵尸工作负载困扰数据中心能效提升:GPU 时代闲置算力浪费加剧

    GPU 时代的生成式与 Agent AI 显著推高了算力闲置成本,被遗弃或闲置的僵尸工作负载正持续消耗数据中心稀缺的电力与机柜容量。IDCA 调研显示约 13% 的美国云用量属于此类僵尸任务,FinOps 厂商预估整体云资源浪费甚至达 25% 至 30% 以上。业界正通过 Kubernetes 动态调度、芯片级可观测性工具及 OpenTelemetry 标准,解决假繁忙与跨服务闲置资源的排查难题。

  2. AWS News · 云基础设施77

    AWS 重塑开发者起步体验:支持第三方登录并适配编码智能体

    AWS 推出面向 AI 开发者的全新简化入门体验,支持使用 Google、GitHub 或 Apple 账号免信用卡直接注册,并提供 100 美元免费额度。系统以项目方式自动隔离权限与成员协作,开发者可直接将配置提示词接入编码智能体,由其自动部署资源并管理底层权限,当业务扩展时可无缝激活完整 AWS 高级功能。

    推荐理由:AWS通过免信用卡登录、自动分配权限以及与编码智能体对接,大幅降低了云端部署基础设施的起步门槛。

  3. Azure Blog · 云基础设施30

    微软入选 2026 年 Gartner 分布式混合基础设施魔力象限领导者

    微软在 2026 年 Gartner 分布式混合基础设施魔力象限中连续第四年获评领导者,并在执行能力维度排名最高。依托 Azure Arc 与 Azure Local,企业可跨数据中心、边缘、多云及主权环境实现统一治理与断网运行支持。此外,Foundry Local 可将 AI 推理延伸至本地环境,支持以 Kubernetes 原生方式运行模型。

9月16日周三
  1. NVIDIA · AI 筛选76

    NVIDIA Vera Rubin NVL72 首度亮相 MLPerf Inference v6.1 评测

    NVIDIA 在 MLPerf Inference v6.1 预览评测中展示了 Vera Rubin NVL72 系统,在 Qwen3-VL 任务上的吞吐量达到 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上的吞吐量最高达到 2.5 倍。

    推荐理由:原文通过实测基准数据对比了新一代架构在长上下文与多模态模型上的吞吐与扩展效率,便于评估大模型推理基础设施的代际演进。

  2. NVIDIA · AI 筛选67

    Emerald AI、Google 与 NVIDIA 联合发起 AI 能源管理联盟(AEMA)

    Emerald AI、Google 和 NVIDIA 宣布联合发起 AI 能源管理联盟(AEMA),旨在推动能够根据电网状况动态调节用电的柔性 AI 数据中心建设。

    推荐理由:原文介绍了科技巨头联合推动柔性用电数据中心的技术与并网准则,读者可据此了解 AI 算力扩张应对电力瓶颈的协同路径。

  3. Data Center Knowledge58

    调查显示数据中心行业薪资上涨但员工流失率居高不下

    DataX Connect 发布的 2026 年数据中心薪酬调查显示,欧美地区近四成从业人员计划在未来一年内跳槽,尽管过去一年欧洲有 65%、美国有 71% 的员工获得了加薪。调查指出,熟练电工、机电管道(MEP)工程师和超大规模项目经理极度短缺,正成为数据中心工程交付的主要阻碍。目前行业正加快从能源、军工及半导体等相邻关键行业引入具备可迁移技能的工程人才。

  4. Data Center Knowledge65

    数据中心项目取消与延期的连锁反应剖析

    凯捷研究院 2026 年报告显示约 19% 的数据中心电网互连申请从未转化为实际用电负荷,67% 的电力企业高管将其视为虚报负荷。当项目停滞或取消时,电网公司提前建设变电站和输电线的沉没成本极易转嫁给普通电力用户,且后置排队项目无法直接顺延,重新进行互连研究需耗费 6 个月至 1 年以上时间。

    推荐理由:文章拆解了数据中心取消后并网重审与电网投资搁浅的分摊机制,有助于理解算力电力交付中的隐形成本。

  5. NVIDIA · AI 筛选80

    NVIDIA 详解 AI 工厂能效平台 DSX,实测相同电力预算下 Token 吞吐量提升 24%

    NVIDIA 详细阐述了面向 AI 工厂的 DSX 能效管理架构,涵盖动态电力分配软件 DSX MaxLPS、电网柔性调度 DSX Flex 以及 800V DC 供电设计。

    推荐理由:原文给出了 AI 工厂在固定电力预算下的动态调优与电网响应实测数据,读者可以据此评估算力中心的能效瓶颈与扩展方案。

  6. NVIDIA · AI 筛选78

    NVIDIA 展示 Vera Rubin 与 DSX 平台能效进展,聚焦每兆瓦 Token 产出优化

    NVIDIA 在 AI Infra Summit 上公布了 Vera Rubin 系统与 DSX 平台的最新能效进展,推动 AI 基础设施评估从峰值性能转向每兆瓦有效 Token 产出。

    推荐理由:材料展现了从单卡峰值算力转向每兆瓦可用生成量的指标变化,为评估智算集群的电力与能效经济性提供了参考数据。

  7. Google Infrastructure30

    Google 承诺投入 $10 million 助力内华达州清洁与普惠能源未来

    Google 宣布设立 $10 million 的能源影响基金(EIF),以支持内华达州的能源创新与可负担性。其中 $5 million 将提供给内华达清洁能源基金(NCEF),用于支持其住宅能源升级计划(RE-UP)。该计划为内华达北部和南部数据中心周边的家庭免费提供能效提升与耐候化改造,帮助居民降低电费并增强电网韧性。

9月15日周二
  1. Data Center Knowledge65

    速度即容量:AI 算力基础设施为何亟需重构供电策略

    AI 算力基础设施的核心衡量指标正从规划总容量转向按期通电的实际交付速度。受制于电网并网排队、审批和发电设备制造周期,欧洲 2026 至 2028 年计划投产的 AI 数据中心选址距离大城市平均已达 175 公里,远高于此前的 46 公里。面对供应瓶颈,开发商正转向现场发电、双边协议以及按阶段接入的分期能源组合,将电力规划全面前置到选址首要环节。

    推荐理由:分析了 AI 数据中心通电速度取代总容量成为核心瓶颈的行业趋势,为算力基建的供电规划与分期交付提供了参考思路。

  2. The Next Platform80

    巨额资本开支下甲骨文云业务迎来回报,IaaS营收实现翻倍

    甲骨文最新财季实现营收191.8亿美元,其中云基础设施(IaaS)营收同比增长1倍至74亿美元,展现出巨额算力投入正加速转化为实际收入。该季度甲骨文新增850兆瓦基础设施容量并部署超30万颗GPU,已向OpenAI阿比林数据中心交付618兆瓦容量以支撑前沿模型训练。

    推荐理由:文章通过拆解甲骨文云基础设施与算力交付数据,展现了超大规模算力投入如何通过AI积压订单逐步转化为营收回报。

9月14日周一
9月12日周六
  1. Data Center Knowledge41

    房产税:AI 数据中心容易忽视的价值驱动因素

    美国 AI 数据中心建设中,从价财产税(Property Tax)作为核心持有成本常被忽视,需贯穿设施设计到运营全生命周期进行估值管理。AI 基础设施中服务器与高密度机柜组件的技术更替极快、经济寿命短,且软件等无形资产在多州不属于应税范围。通过成本分拆区分应税与免税项目并准确反映快速折旧,可确保评估价值符合资产真实价值。

9月11日周五
  1. Data Center Knowledge37

    城市数据中心:谁需要它们以及去哪里寻找

    城市数据中心位于人口稠密的大都市核心区,容量通常在 10MW 或以下,通过贴近用户与密集网络互联点来换取超低延迟和网络密度。这类设施能为高频交易、游戏、流媒体及电信边缘计算等延迟敏感型业务提供极低的网络往返时间与丰富的光纤直连。但其同时也面临更高的地产租税成本、空间与电力限制,以及旧建筑改造复杂等权衡难题。

  2. Data Center Knowledge48

    AI 如何重塑海底与陆地网络

    AI 训练与推理需求推动数据中心互联激增,促使超大规模云厂商推动海底光缆与陆地网络走向端到端一体化。网络架构正转向 24 纤对以上的空分复用(SDM)海缆,并通过在海缆登陆站部署 ROADM 实现光穿通直接接入目标数据中心。800G 相干可插拔光模块结合陆地 C+L 波段 WDM 技术,显著降低了设备功耗、空间占用与回传租赁成本。

9月10日周四
  1. NVIDIA Developer Blog35

    从晶圆出厂到首次 Token:借助 Nemotron 与 Palantir Foundry 将供应链经验代码化

    NVIDIA 借助 Nemotron 与 Palantir Foundry 将其复杂供应链的专业知识代码化,并以“从晶圆出厂到首次 Token”衡量全流程性能。该区间划分为两大阶段:Time-to-rack 涵盖从芯片离开晶圆厂到组装系统进入数据中心机房,Time-to-token 则涵盖后续的供电、冷却、网络连接及软件栈部署。

  2. Hugging Face70

    Hugging Face 展示基于 Storage Bucket 与代理的跨节点 LoRA 异步 GRPO 训练实践

    Hugging Face 在 TRL v1.14 中为 AsyncGRPOTrainer 增加了 LoRA 适配器同步支持,使训练节点与 vLLM 推理副本无需跨机 NCCL 即可跨节点独立运行。

    推荐理由:原文展示了无需 NCCL 跨机通信的异步 GRPO 架构实现与调优细节,读者可据此排查强化学习训练与推理流水线的吞吐瓶颈。