跳到正文
原文
NVIDIA Developer Blog· Elizabeth Goodman·· 20 天前AI 评分34

全栈 NIM 优化如何让 Nemotron 3 Ultra 承载 2.5 倍并发用户

How Full-Stack NIM Optimizations Deliver 2.5x More Users on Nemotron 3 Ultra

AI 导读

NVIDIA 通过全栈 NIM 优化,使 Nemotron 3 Ultra 模型在现有 GPU 基础设施上支持的用户并发量提升至 2.5 倍。该方案在保障应用交互响应速度的同时最大化并发承载能力,重点针对长提示词以及跨步骤复用上下文的 AI 智能体工作负载。

来源:NVIDIA Developer Blog · developer.nvidia.com