跳到正文
vLLM Blog· NVIDIA Nemotron Team·· 2026-06-04精选AI 评分73

NVIDIA Nemotron 3 Ultra 发布并在 vLLM 首日支持

Announcing Day-0 Support for NVIDIA Nemotron 3 Ultra on vLLM

AI 导读

NVIDIA 发布开源模型 Nemotron 3 Ultra,vLLM 同步提供 Day-0 支持。该模型采用 Hybrid Transformer-Mamba MoE 架构,总参数 550B、激活参数 55B,上下文长度最高 1M tokens,支持 NVFP4 与 BF16,面向长时自主智能体、工具调用、编码与深度研究。

推荐理由

原文给出 Nemotron 3 Ultra 的架构、参数与部署配置,读者可据此判断它在长时智能体工作流中的定位。

正文 · AI 翻译

我们很高兴地宣布,在 vLLM 上为最新发布的 NVIDIA Nemotron 3 Ultra 提供 Day-0 支持。

Nemotron 3 Ultra 属于 Nemotron 开放模型系列,专为长时间运行的自主智能体工作流中的前沿级推理而构建。它面向复杂编排、编码、深度研究、企业自动化,以及其他需要智能体进行规划、调用工具、从错误中恢复并在扩展上下文中推理的任务。

现代智能体系统正变得越来越持久。它们不只是回答单个提示;它们会搜索、编写代码、运行测试、检查失败、协调工具、评估证据,并在长任务周期中持续工作。这些工作流要求模型既能保持推理深度,又能让推理速度足够快,以满足实际部署需求。

Nemotron 3 Ultra 满足了高级智能体 AI 的两大主要需求:

快速完成任务:

长时间运行的智能体需要的不仅仅是原始模型智能。它们需要吞吐量,以便在相同的时间预算内完成更多推理步骤。Nemotron 3 Ultra 结合了混合 Transformer-Mamba MoE 架构、多 token 预测和 NVIDIA 优化的推理精度,为高要求的智能体工作负载提供高吞吐量。

高级智能体推理:

智能体工作流通常需要架构规划、多步调试、来源评估、监管审查或设计验证。Nemotron 3 Ultra 针对智能体环境中的推理、工具使用和指令遵循进行了后训练,帮助智能体在复杂任务中取得进展,同时不牺牲准确性。

使用该模型,智能体系统可以更快完成高难度推理工作流,同时在编码、工具调用、研究综合和企业自动化方面保持强劲性能。

vLLM 是 Nemotron 3 Ultra 训练工作流的重要组成部分,在整个训练过程中为 rollout 和模型评估提供高吞吐量多节点推理支持。在 NeMo RL 中,vLLM 作为强化学习 rollout 的生成后端,实现高效采样、可扩展推理,并与 NeMo Gym 集成以支持多步和多轮训练环境。

Nemotron 团队还将 vLLM 用作评估循环的一部分,帮助我们跟踪进展、验证改进,并了解每个训练阶段是否正在推动模型朝正确方向发展。

TL;DR:关于 Nemotron 3 Ultra

  • Architecture: Mixture of Experts with Hybrid Transformer-Mamba Architecture
    • 模型规模:550B 总参数,55B 激活参数
    • 上下文长度:最高 1M tokens
    • 模态:文本输入,文本输出
  • 效率:通过 NVFP4 和 BF16 支持实现高吞吐量推理。NVFP4 checkpoint 可在 Blackwell GPU 上运行。
  • 推理:针对长时间运行的自主智能体、工具调用、编码、深度研究和编排进行了优化
  • 训练:通过多环境强化学习进行后训练,以实现稳健推理和智能体行为
  • 部署:开放权重、开放数据和开放配方,可跨基础设施进行定制和部署
  • Supported GPUs:
    • BF16:8x GB200/B200/GB300/B300,16x H100,8x H200,
    • NVFP4:4x GB200/B200/GB300/B300,8x H100
  • Get Started

使用 vLLM 运行优化的智能体推理

Nemotron 3 Ultra 专为跨 BF16 和 NVFP4 精度模式的高吞吐智能体推理而设计。借助 vLLM,开发者可以通过 OpenAI 兼容 API 提供模型服务,并将其集成到现有的智能体框架、编码系统、研究流程和企业自动化工作流中。

如需更简便地使用 vLLM 进行设置,请参阅 Nemotron 3 Ultra 入门 cookbook,或使用 NVIDIA Brev launchable 获取 NVFP4。

安装 vLLM

docker pull vllm/vllm-openai:v0.22.0
 
docker run --rm -it --gpus all --ipc=host --network=host \
  -v ~/.cache/huggingface:/root/.cache/huggingface \
  --entrypoint /bin/bash \
  vllm/vllm-openai:v0.22.0

部署模型

以下命令针对 8x B200 配置。如果您的硬件不同,请根据您的环境调整并行标志和相关设置。

export VLLM_USE_FLASHINFER_MOE_FP4=1
export VLLM_MEMORY_PROFILER_ESTIMATE_CUDAGRAPHS=1
 
vllm serve nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4 \
  --served-model-name nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B \
  --host 0.0.0.0 \
  --port 8000 \
  --trust-remote-code \
  --tensor-parallel-size 8 \
  --kv-cache-dtype fp8 \
  --max-num-seqs 16 \
  --max-model-len 262144 \
  --gpu-memory-utilization 0.90 \
  --max-num-batched-tokens 32768 \
  --enable-flashinfer-autotune \
  --async-scheduling \
  --speculative_config.method mtp \
  --speculative_config.num_speculative_tokens 5 \
  --mamba-backend triton \
  --mamba-ssm-cache-dtype float32 \
  --reasoning-parser nemotron_v3 \
  --enable-auto-tool-choice \
  --tool-call-parser qwen3_coder
 

服务器运行后,使用 OpenAI 兼容客户端发送提示:

from openai import OpenAI
 
client = OpenAI(
    base_url="http://127.0.0.1:8000/v1",
    api_key="EMPTY",
)
 
resp = client.chat.completions.create(
    model="nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B",
    messages=[
        {"role": "system", "content": "You are a helpful assistant."},
        {"role": "user", "content": "Give me 3 bullet points about vLLM"},
    ],
    temperature=1.0,
    top_p=0.95,
    max_tokens=1024,
)
 
msg = resp.choices[0].message
print("Reasoning:", getattr(msg, "reasoning", None))
print("Content:", msg.content)

有关 NVFP4 部署指南,请参阅 Nemotron 3 Ultra vLLM cookbook。

面向长时间运行智能体的高吞吐推理

Nemotron 3 Ultra 针对需要在多步骤中进行持续推理的智能体系统进行了优化。

如图 1、图 2 和图 3 所示,Nemotron 3 Ultra 在智能体生产力、指令遵循和长上下文任务上准确率领先,并提供领先的吞吐量,与其他领先的开源模型相比节省 30% 的成本。

图 1:Nemotron 3 Ultra 在智能体生产力、编码和指令遵循的智能体基准测试中领先于开源模型。

图 2:Nemotron 3 Ultra 处于最具吸引力的象限,在开源模型中具有领先的准确率和领先的吞吐量。配置 - vLLM,10k/2k ISL/OSL,BS 1。

图 3:Nemotron 3 Ultra 最多节省 30% 的成本,并在成本效率前沿上领先。

为缓解高容量推理模型典型的效率与准确率权衡,Nemotron 模型引入了深远的架构创新:

  • 面向智能体框架的后训练: Nemotron 模型使用 NVIDIA NeMo RL 和 Gym 在众多智能体框架上进行后训练。它们针对领先的开源智能体框架进行了优化,而不仅仅是单轮聊天,并专门优化以在智能体规划、调用工具、读取观察结果、委派给子智能体、验证输出以及在多轮中从错误中恢复的工作流中运行。
  • 混合 Mamba-Transformer: Mamba 层提高了长上下文工作负载的序列效率,而 Transformer 层在智能体需要从大上下文窗口中检索特定事实时保持精确召回。
  • Latent MoE: Latent MoE 支持更高效的专家路由,帮助模型处理跨越推理、代码生成、工具调用和领域特定逻辑的工作流。
  • 多 Token 预测(MTP): MTP 通过在单次前向传递中预测多个未来 Token 来帮助减少生成时间,提高长输出和多轮工作流的吞吐量。
  • NVFP4 精度: 相同的 NVFP4 检查点可在 NVIDIA Hopper 和 Blackwell GPU 上运行,因此得益于专门的 NVFP4 量化内核,开发者可以在两种架构之间无缝使用同一个检查点。

总结

NVIDIA Nemotron 3 Ultra 是一款面向长时间运行自主智能体的开放前沿推理模型。它为构建高级智能体 AI 系统的开发者和企业结合了高吞吐推理、长上下文推理、工具使用能力和开放部署灵活性。

准备好构建更快、更强大的智能体工作流了吗?

订阅 NVIDIA 新闻并在 LinkedIn、X、YouTube 上关注 NVIDIA AI,以及 Discord 上的 Nemotron 频道,随时了解 NVIDIA Nemotron 的最新动态。

致谢

感谢所有为将 NVIDIA Nemotron 3 Ultra 引入 vLLM 做出贡献的人。

NVIDIA:Nirmal Kumar Juluru、Anusha Pant、Alex Steiner、Tomer Asida、Daniel Afrimi、Shaun Kotek、Roi Koren、Daniel Serebrenik、Amir Klein、Omer Ullman Argov、Netanel Haber、Amit Zuker、Shahar Mor、Tomer Bar Natan
vLLM 团队与社区:Michael Goin、Kaichao You、Yongye Zhu、Roger Wang、Simon Mo、Woosuk Kwon、Yasong Wang、Nick Hill、Zachary Xi

来源:vLLM Blog · vllm.ai