AIDC
DC AI 热点

全部 AI 动态

9月23日2026-09-23
NVIDIA Developer Blog✦ 精选AI 评分 75/10001:27

英伟达推出机密计算方案,助力实现私有高性能生产级AI推理

随着大语言模型(LLM)推理在个人、企业及受监管行业中日益广泛地处理敏感数据和专有模型上下文,隐私与安全防护变得至关重要。英伟达通过其机密计算(Confidential Computing)技术,致力于在保护数据隐私和知识产权的同时,提供生产级的高性能AI推理能力,确保大模型在云端及基础设施中的安全可靠运行。

阅读原文 ↗推荐理由:介绍了英伟达利用硬件机密计算保护大模型推理敏感数据的安全解决方案。# 英伟达# 安全# 推理# 隐私计算# 大模型
9月22日2026-09-22
NVIDIA Developer Blog✦ 精选AI 评分 72/10005:51

英伟达在Dynamo-Triton中集成TensorRT多设备推理,简化多GPU模型部署服务

随着生成式AI对计算与显存的需求不断超出单卡上限,英伟达推出TensorRT多设备推理新功能,并将其集成至NVIDIA Dynamo-Triton中。该方案旨在简化跨多个GPU的大模型推理服务部署流程,有效降低多卡分布式推理的工程复杂度,提升大规模生成式AI模型在多GPU环境下的服务效率与吞吐能力。

阅读原文 ↗推荐理由:英伟达针对多卡推理服务集成新功能,有助于降低大模型分布式推理部署的工程门槛。# 英伟达# 推理# 算力# 大模型
9月19日2026-09-19
NVIDIA Developer Blog✦ 精选AI 评分 68/10003:04

使用 AIPerf 对大规模大语言模型推理进行基准评测

在系统上部署大语言模型后,评估其实际推理速度与性能表现是关键难题。本文介绍了用于大规模大模型推理评测的工具 AIPerf,旨在帮助开发者和工程师摆脱直觉猜测,建立系统化、规模化的性能基准测试方法,准确衡量模型在不同负载下的响应速度与吞吐能力。

阅读原文 ↗推荐理由:介绍了大语言模型规模化推理基准测试工具 AIPerf,对模型部署与性能调优具备实用参考价值。# 大模型# 推理# 评测# 算力
9月17日2026-09-17
NVIDIA Developer Blog✦ 精选AI 评分 78/10004:37

英伟达 TensorRT Edge-LLM 在 Jetson AGX Thor 上实现 MLPerf 边缘智能体基准 6.4 倍加速

英伟达公布最新测试结果,TensorRT Edge-LLM 在 Jetson AGX Thor 平台上运行 MLPerf 边缘智能体基准测试时实现了 6.4 倍的速度提升。随着 AI 智能体逐步从云端数据中心迁移至汽车、机器人及其他边缘硬件,该技术针对需要多步骤推理的智能体工作流进行了优化,显著提升了端侧设备本地处理复杂任务的能力与能效表现。

阅读原文 ↗推荐理由:展示了英伟达下一代 Jetson Thor 平台在边缘端与具身硬件上加速运行 AI 智能体的性能突破。# 英伟达# 端侧AI# 智能体# 推理# 具身智能
9月16日2026-09-16
NVIDIA Developer Blog✦ 精选AI 评分 75/10001:00

稠密模型与MoE架构对比:激活参数、吞吐量与选型策略解析

文章深入探讨了稠密(Dense)模型与混合专家(MoE)模型的核心差异,重点解析了激活参数量、推理吞吐量以及不同应用场景下的选型策略。文中以 Nemotron 3.5 Lightning 为例,剖析了总参数量达 30B 的模型如何通过每个 Token 仅激活 3B 参数,既保持了大模型的表征能力又大幅提升了计算效率,为开发者在算力受限下权衡推理成本与模型表现提供了系统指导。

阅读原文 ↗推荐理由:系统对比了 Dense 与 MoE 架构的运行机制与吞吐性能,为大模型推理优化与架构选型提供实用参考。# 大模型# 推理# 算力# 英伟达
NVIDIA Developer Blog✦ 精选AI 评分 68/10000:55

英伟达探讨 Groq 3 LPX 确定性执行如何驱动 Vera Rubin 架构实现高效低延迟推理

功耗已成为 AI 数据中心的关键制约因素。随着 AI 工作负载对全栈计算平台提出更高要求,计算平台的各个组件都必须最大化能效。文章探讨了在英伟达下一代 Vera Rubin 平台上,如何通过 Groq 3 LPX 风格的确定性执行机制来优化高交互性推理任务,从而在严苛的功耗限制下实现极低延迟和高能效表现。

阅读原文 ↗推荐理由:探讨了英伟达 Vera Rubin 架构下结合确定性执行技术提升高交互性 AI 推理能效的方案。# 英伟达# 算力# 芯片# 推理# 数据中心