跳到正文
原文
vLLM 官方博客(网页)·· 12 小时前精选AI 评分82

vLLM 宣布首发支持 NVIDIA Nemotron 3 Ultra 推理

Announcing Day-0 Support for NVIDIA Nemotron 3 Ultra on vLLMJun 4, 2026·7 min readHow to serve NVIDIA Nemotron 3 Ultra with vLLM for long-running agentic reasoning, including BF16 and NVFP4 checkpoints, supported GPU configurations, OpenAI-compatible deployment, and NeMo RL integration.

AI 导读

vLLM 正式宣布为开源模型 NVIDIA Nemotron 3 Ultra 提供首发推理支持,支持通过 OpenAI 兼容 API 提供服务。Nemotron 3 Ultra 拥有 550B 总参数量与 55B 激活参数,采用 Transformer-Mamba 混合 MoE 架构,支持最高 1M tokens 上下文及 NVFP4 与 BF16 精度。

推荐理由

原文提供了模型规格与完整的服务启动配置,开发者可以据此在多卡集群上快速部署该长程推理模型。

来源:vLLM 官方博客(网页) · vllm.ai