NVIDIA Vera Rubin NVL72 首度亮相 MLPerf Inference v6.1 评测
NVIDIA 在 MLPerf Inference v6.1 预览评测中展示了 Vera Rubin NVL72 系统,在 Qwen3-VL 任务上的吞吐量达到 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上的吞吐量最高达到 2.5 倍。
推荐理由:原文通过实测基准数据对比了新一代架构在长上下文与多模态模型上的吞吐与扩展效率,便于评估大模型推理基础设施的代际演进。
英伟达的 AI 芯片与生态动态:GPU 新品、CUDA 生态、机器人平台与 AI 算力市场的风向。
NVIDIA 在 MLPerf Inference v6.1 预览评测中展示了 Vera Rubin NVL72 系统,在 Qwen3-VL 任务上的吞吐量达到 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上的吞吐量最高达到 2.5 倍。
推荐理由:原文通过实测基准数据对比了新一代架构在长上下文与多模态模型上的吞吐与扩展效率,便于评估大模型推理基础设施的代际演进。
Emerald AI、Google 和 NVIDIA 宣布联合发起 AI 能源管理联盟(AEMA),旨在推动能够根据电网状况动态调节用电的柔性 AI 数据中心建设。
推荐理由:原文介绍了科技巨头联合推动柔性用电数据中心的技术与并网准则,读者可据此了解 AI 算力扩张应对电力瓶颈的协同路径。
黄仁勋在 Salesforce Dreamforce 大会上发表演讲,强调 AI 已成为全球基础设施层,同时 Salesforce 宣布推出基于 NVIDIA Nemotron 3 Super 构建的首个 CRM 推理模型 Koa。
推荐理由:黄仁勋在对话中阐明了企业级推理模型与安全工程的边界,有助于理解开源基础模型在垂直领域落地的技术路径。
NVIDIA 详细阐述了面向 AI 工厂的 DSX 能效管理架构,涵盖动态电力分配软件 DSX MaxLPS、电网柔性调度 DSX Flex 以及 800V DC 供电设计。
推荐理由:原文给出了 AI 工厂在固定电力预算下的动态调优与电网响应实测数据,读者可以据此评估算力中心的能效瓶颈与扩展方案。
NVIDIA 在 AI Infra Summit 上公布了 Vera Rubin 系统与 DSX 平台的最新能效进展,推动 AI 基础设施评估从峰值性能转向每兆瓦有效 Token 产出。
推荐理由:材料展现了从单卡峰值算力转向每兆瓦可用生成量的指标变化,为评估智算集群的电力与能效经济性提供了参考数据。
甲骨文最新财季实现营收191.8亿美元,其中云基础设施(IaaS)营收同比增长1倍至74亿美元,展现出巨额算力投入正加速转化为实际收入。该季度甲骨文新增850兆瓦基础设施容量并部署超30万颗GPU,已向OpenAI阿比林数据中心交付618兆瓦容量以支撑前沿模型训练。
推荐理由:文章通过拆解甲骨文云基础设施与算力交付数据,展现了超大规模算力投入如何通过AI积压订单逐步转化为营收回报。
AI 推理芯片初创公司 d-Matrix 宣布与 Nvidia 达成合作,将其基于 3D-RAM 的下一代推理芯片 Raptor XPU 接入 Nvidia MGX 架构与 NVL144 液冷机架。
推荐理由:存算一体芯片通过接入主流机架与高速互连架构降低落地门槛,为高并发低延迟的生成式推理提供了机架级异构部署参考。
NVIDIA 宣布推出 CUDA Rust,正式支持使用 Rust 语言进行原生 GPU 内核编程。继 CUDA C++ 与 CUDA Python 之后,NVIDIA 计划在 2027 年及未来持续完善 CUDA Rust 工具链,以支持推理引擎、服务基建与智能体运行时等 AI 系统层软件的开发。
推荐理由:NVIDIA 将 GPU 内核编程拓展至 Rust 生态,为 AI 系统层与推理基础设施开发提供了新的工具选择。
Nvidia 宣布将斥资 129 亿美元收购开源 AI 社区与平台 Hugging Face,该交易预计在 2027 年上半年完成并需等待监管部门批准。Hugging Face 平台目前拥有超过 1800 万名开发者、20 万家企业用户以及 300 万个模型,平台随开源生态扩张而面临的巨大计算与审核成本是促成此次交易的重要原因。
推荐理由:原文梳理了交易背后的算力成本与生态诉求,读者可以据此了解芯片巨头整合开源社区对开发者生态的深远影响。
随着 Ultra Ethernet、UALink 和 ESUN 等开放标准推进,以太网正在水平和垂直扩展互联中蚕食专用协议市场,但 Nvidia 的 NVLink 与 NVSwitch 仍将在短期内主导 AI 纵向扩展网络。
推荐理由:原文通过梳理网络技术演进历史,对比了 NVSwitch 与 UALink 等开放协议在 AI 纵向扩展互联中的博弈路径。
Nvidia 宣布与联发科扩大合作,向超大规模云厂商等客户的定制 AI 加速芯片(XPU)开放机柜级 AI 基础设施,并向联发科投资 35 亿美元可转换债券。客户可在预验证的 NVLink Fusion 平台上设计芯片并接入基于 MGX 生态的 Nvidia AI 工厂,联发科将提供 SoC 设计和先进封装支持。
推荐理由:Nvidia 试图通过开放互连将自研定制芯片纳入其机柜架构,读者可借此观察 AI 工厂在异构互连上的竞争走向。
制约 AI 算力机柜功率密度上限的核心因素并非单纯的芯片数量或风扇散热,而是配电架构、芯片级散热与故障容错设计的物理极限。风冷在单机柜功耗超过 50 kW 后基本失效,直接芯片液冷虽已成为处理 100 kW 至 150 kW 负载的主流方案,但传统 54 VDC 配电在 200 kW 以上面临严重的铜排物理限制,促使行业转向 800 VDC 与算电解耦架构。
推荐理由:原文从散热极限、直流供电与故障冗余等工程维度拆解了超高密度机柜的物理瓶颈,有助于判断算力基础设施的演进边界。
The Next Platform 对 Nvidia 最新财报与供应链数据进行了深度拆解,指出网络业务已占其数据中心总营收的近 20%,成为构建机柜级统一虚拟 GPU 的核心支柱。
推荐理由:通过拆解财报数据与网络营收占比,展示了机柜级互联架构在现代大算力集群中的结构性地位。
NVIDIA 推出 NVLink Fusion,将 NVHBM 引入下一代 AI 基础设施。该方案主要应对超大规模计算中心与定制 AI 加速器在运行超大模型及复杂推理任务时对高带宽内存的需求,以保障大规模扩展下的算力供给与互连效率。
推荐理由:原文介绍了面向下一代 AI 基础设施的内存互连方案,有助于了解大模型与定制加速器在带宽扩展上的架构演进。
NVIDIA Developer Blog 介绍了在 NVIDIA GB300 NVL72 上运行阿里 Qwen3.8-Flash-Next 进行智能体编码的实践。
推荐理由:文章解析了在 GB300 NVL72 上运行 Qwen4 预览版模型的架构参数与长上下文特性,为开发者构建智能体编码工作流提供了参考。
Hot Chips 2026 会议分析指出,受云巨头对生成式 AI 与 Agent 基础设施资本支出激增影响,DRAM、HBM 与 Flash 存储现货价格暴涨高达约 7 倍,且产能短缺预计将至少持续至 2030 年。
推荐理由:文章结合存储共线制造与云巨头资本支出激增的事实,清晰揭示了存储产能短缺传导至整机算力涨价的供应链机制。
NVIDIA 发布 CUDA Python 1.0,提供稳定的 API、统一基础架构以及对 CUDA 平台的完整访问能力。该版本旨在解决 Python 开发者此前要么手写 CUDA C++ 扩展、要么完全依赖 PyTorch 或 CuPy 等上层库的局限。
推荐理由:原文阐述了 CUDA Python 1.0 提供的稳定 API 与平台访问能力,有助于开发者评估如何降低 Python 调用底层 GPU 的开发门槛。
CoreWeave 与 Nebius 等新兴 AI 算力云厂商正通过数十亿美元级长期大单快速积累积压收入与现金,以全力支撑数据中心电力与硬件扩张。
推荐理由:文章通过 CoreWeave 与 Nebius 的财务和签约电力数据,解析了新兴算力云在大模型需求下的扩张逻辑与资本布局。
超微在 2026 财年实现营收 390.6 亿美元,同比增长 77.8%,其中 AI 系统业务占总营收的 60% 至 70%。公司目前月产超过 3000 个单机架功率最高 240kW 的直接液冷机柜,并正研发 500kW 规格机架,预计 2027 财年营收中位数为 685 亿美元。
推荐理由:文章梳理了超微在算力架构迭代期的营收构成与液冷产能,便于读者了解头部服务器厂商在 GPU 供给下的竞争态势。
NVIDIA 发布面向常驻 AI 智能体工作流的开源模型 Nemotron 3.5 Lightning,以及用于动态调度多模型的 NeMo Switchyard 路由库。
推荐理由:原文对比了新模型与前代规格的性能和延迟差异,并展示了如何通过配套路由库在复杂智能体工作流中平衡成本与响应速度。