跳到正文
vLLM Blog· NVIDIA Nemotron Team and vLLM Team·· 2026-08-10精选AI 评分65

NVIDIA Nemotron 3.5 Lightning 发布,vLLM 提供 Day-0 支持

Announcing Day-0 Support for NVIDIA Nemotron 3.5 Lightning on vLLM

AI 导读

NVIDIA 发布 Nemotron 3.5 Lightning,这是一个面向常驻智能体的可定制开源模型,采用混合 MoE 架构,总参数 30B、每 token 激活 3B,上下文窗口最高 100 万 token,由 Nemotron 3 Ultra 蒸馏而来。

推荐理由

NVIDIA 与 vLLM 团队给出 30B/3B 混合 MoE 模型的 Day-0 部署配置,可据此评估小模型承接高频智能体步骤的可行性。

正文 · AI 翻译

我们很高兴地宣布,vLLM 已实现对 NVIDIA Nemotron 3.5 Lightning 的 Day-0 支持。

Nemotron 3.5 Lightning 是一款可定制的开放模型,专为常驻智能体打造,既适用于本地运行的个人助理,也适用于数据中心和云端的高并发智能体任务。它在编码、工具使用、指令遵循和多轮智能方面表现出色,采用紧凑的混合专家(MoE)架构,总参数量为 300 亿,每次仅激活 30 亿参数。

该模型从 NVIDIA Nemotron 3 Ultra 蒸馏而来,并与 Nemotron Coalition 合作开发。现代智能体平台越来越多地将工作拆分到多个模型上。前沿模型可以负责困难的规划与编排,而较小的模型则处理频繁、范围明确的步骤。Nemotron 3.5 Lightning 正是为后一种角色而构建,同时不牺牲真实智能体工作流所需的能力。

它满足了常驻智能体的两项实际需求:

  • 大规模快速执行: 智能体系统通常将大部分时间花在完成大量细小步骤上。Nemotron 3.5 Lightning 结合了混合 MoE 设计(每 token 激活 300 亿参数中的 30 亿)与多 token 预测,以减少计算并加速生成。这些优化带来了比同等规模开放模型最高 4 倍的吞吐量。
  • 可适配的智能体智能: 生产级智能体需要理解组织特有的术语、遵循策略、正确使用工具,并在多轮对话中保持上下文。Nemotron 3.5 Lightning 针对流行的智能体框架进行了训练,并支持后训练,因此适用于金融与风险自动化、网络安全调查、电信运营、零售体验以及本地个人助理等应用中的专门任务。

借助 vLLM,开发者可以通过 OpenAI 兼容 API 暴露该模型,并将其连接到现有的智能体框架、本地应用和企业自动化系统。

TL;DR:关于 Nemotron 3.5 Lightning

  • 架构: 混合专家架构
  • 模型规模: 总参数量 300 亿,激活参数 30 亿
  • 上下文长度: 最高 100 万 token
  • 模态: 文本输入与文本输出
  • 投机解码: 多 token 预测、DFlash 和 DSpark
  • 推理: 可按请求启用或禁用推理,并支持可配置的推理 token 预算
  • 训练: 从 NVIDIA Nemotron 3 Ultra 蒸馏,并针对流行的智能体框架进行训练
  • 定制: 使用开放数据集训练的开放模型,支持在专门工作流上进行后训练
  • 发布时可用格式: BF16 和 NVFP4
  • 部署目标: NVIDIA DGX Spark、DGX Station、RTX PRO、RTX、NVIDIA Jetson、H100、H200、A100、L40S、B200/GB200 和 B300/GB300
  • Get started:
    • 从 Hugging Face 下载模型权重:BF16 和 NVFP4。
    • 使用入门 cookbook 通过 vLLM 运行 Nemotron 3.5 Lightning。

使用 vLLM 运行高吞吐推理

Nemotron 3.5 Lightning 旨在广泛运行于各类 NVIDIA 平台。vLLM 提供了将模型引入生产工作流所需的服务层,包括连续批处理、前缀缓存、投机解码以及 OpenAI 兼容 API。

BF16 检查点提供了直接的部署基线。NVFP4 也在发布时提供,适用于能够利用更低精度推理的环境。

安装 vLLM

docker pull vllm/vllm-openai:v0.27.1
 
docker run --rm -it \
  --gpus all \
  --ipc=host \
  --network=host \
  --entrypoint /bin/bash \
  vllm/vllm-openai:v0.27.1

部署模型

此命令假设使用 1 x H100 配置。

vllm serve nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16 \
  --max-num-seqs 256 \
  --max-num-batched-tokens 32768 \
  --enable-prefix-caching \
  --async-scheduling \
  --mamba-backend flashinfer \
  --moe-backend humming \
  --linear-backend humming \
  --mamba-ssu-algorithm horizontal \
  --mamba-cache-mode align \
  --mamba-ssm-cache-dtype float16 \
  --enable-mamba-cache-stochastic-rounding \
  --mamba-cache-philox-rounds 5 \
  --reasoning-parser nemotron_v3 \
  --tool-call-parser qwen3_coder \
  --enable-auto-tool-choice \
  --host 0.0.0.0 \
  --port 8000

服务器运行后,应用程序可以通过 OpenAI 兼容客户端发送提示:

from openai import OpenAI
 
client = OpenAI(
    base_url="http://127.0.0.1:8000/v1",
    api_key="null",
)
 
response = client.chat.completions.create(
    model="nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16",
    messages=[
        {"role": "system", "content": "You are a helpful assistant."},
        {"role": "user", "content": "Briefly explain: what is vLLM?"},
    ],
    temperature=1.0,
    top_p=0.95,
    max_tokens=1024,
)
 
choice = response.choices[0]
print("Reasoning:", choice.message.reasoning)
print("Content:", choice.message.content)

使用推测解码加速长时间运行的智能体工作流

Nemotron 3.5 Lightning 支持三种推测解码技术:多令牌预测(MTP)、DFlash 和 DSpark。这些技术可加速令牌生成,同时保持目标模型的输出质量。

MTP 使用轻量级、模型集成的预测头来提议多个未来令牌。DFlash 使用基于扩散的草稿器并行生成整个候选块。DSpark 增加了置信度感知的半自回归草稿,以平衡速度与令牌接受质量。三者结合,让团队能够为其推理工作负载选择最佳的延迟、吞吐量和部署权衡。

Nemotron 3.5 Lightning 在架构上与 Nemotron 3 完全相同,区别仅在于权重和推测解码栈,因此大部分性能工作都落在运行时本身。以下是我们向上游 vLLM 贡献的内容:

  • DSpark 集成:我们将 DSpark(一种融合自回归和扩散式草稿的混合推测器)接入 vLLM 和 Nemotron 模型定义,为您提供除 MTP 和 DFlash 之外的第三种推测器选择。
  • 量化 DSpark 草稿头:将草稿头量化为 W4A16 可减少其内存占用和每步延迟,且不影响接受率,这在 DGX Spark 等内存受限的设备上尤为重要。
  • 移除同步与异步调度:我们消除了草稿-验证循环中的主机-设备同步,并启用了异步调度,使得当前批次仍在执行时即可准备下一批次。
  • 面向 W4A16 的 MoE 和线性后端:我们将 vLLM 默认的 Marlin 后端替换为针对 Hopper 优化的 Humming 后端,对 Nemotron 的非门控 ReLU2 MoE 使用 W4A16 GEMM 内核,带来约 20% 的吞吐量提升,并将同样的方案扩展到密集线性层。
  • 面向 Mamba2 的 ReplaySSM 集成:我们为 Mamba2 状态空间层集成了 ReplaySSM,以减少混合架构循环路径中的每步开销。

对于低延迟服务,请在 H100、H200 和 DGX Spark 上使用 DSpark。对于当前的最大吞吐量,我们建议在不使用推测解码的情况下运行。

多令牌预测

Nemotron 3.5 Lightning 包含内置的多令牌预测头。在解码过程中,这些头会提议未来令牌,并由目标模型进行验证,从而减少较长响应所需的顺序生成步骤数。

vLLM 启动配置可以通过推测解码启用模型的 MTP 路径:

vllm serve --model nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 \
  --moe-backend marlin \
  --kv-cache-dtype fp8 \
  --max-num-batched-tokens 16384 \
  --enable-prefix-caching \
  --mamba-backend flashinfer \
  --mamba-cache-mode align \
  --reasoning-parser nemotron_v3 \
  --speculative_config.method mtp \
  --speculative_config.num_speculative_tokens 3 \
  --speculative_config.moe_backend flashinfer_cutlass \
  --tool-call-parser qwen3_coder \
  --enable-auto-tool-choice

DFlash

DFlash 采用了不同的方法。它使用专用的扩散草稿模型来提议一个线性令牌块,目标模型并行验证该块。DFlash 需要兼容的草稿检查点,并与 MTP 分开配置。

vllm serve --model nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 \
  --moe-backend marlin \
  --kv-cache-dtype fp8 \
  --max-num-batched-tokens 16384 \
  --enable-prefix-caching \
  --speculative_config.num_speculative_tokens 3 \
  --mamba-backend flashinfer \
  --mamba-cache-mode align \
  --reasoning-parser nemotron_v3 \
  --speculative_config.model nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4-DFlash \
  --tool-call-parser qwen3_coder \
  --enable-auto-tool-choice

DFlash 草稿检查点:nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4-DFlash。

DSpark

DSpark 是一种混合推测器,结合了自回归和并行扩散式草稿生成,介于 MTP 的完全自回归方法和 DFlash 的完全基于扩散的方法之间,并在 DGX Spark 上提供了三者中最佳的性能。

vllm serve --model nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 \
  --moe-backend marlin \
  --kv-cache-dtype fp8 \
  --max-num-batched-tokens 16384 \
  --enable-prefix-caching \
  --speculative_config.num_speculative_tokens 3 \
  --mamba-backend flashinfer \
  --mamba-cache-mode align \
  --reasoning-parser nemotron_v3 \
  --speculative_config.model nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4-DSpark \
  --tool-call-parser qwen3_coder \
  --enable-auto-tool-choice

DSpark 草稿检查点:nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4-DSpark。

在 NVIDIA DGX Spark 上本地部署

如果你在 DGX Spark 上本地运行,以下内容应能提供单用户本地开发的起始配置:

vllm serve --model nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 \
  --moe-backend marlin \
  --kv-cache-dtype fp8 \
  --trust-remote-code \
  --max-num-batched-tokens 16384 \
  --enable-prefix-caching \
  --compilation_config.cudagraph_capture_sizes '[1, 2, 4, 8, 16, 24, 32, 40, 48, 56, 64, 72, 80, 88, 96, 104, 112, 120, 128, 136, 144, 152, 160, 168, 176, 184, 192, 200, 208, 216, 224, 232, 240, 248, 256, 1024, 2048, 4096, 8192]' \
  --speculative_config.num_speculative_tokens 3 \
  --mamba-backend flashinfer \
  --mamba-ssm-cache-dtype float16 \
  --enable-mamba-cache-stochastic-rounding \
  --mamba-cache-philox-rounds 5 \
  --mamba-cache-mode align \
  --reasoning-parser nemotron_v3 \
  --speculative_config.method dspark \
  --speculative_config.model nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4-DSpark
Pareto chart comparing inference performance of Nemotron 3.5 Lightning using various speculative decoding techniques on NVIDIA DGX Spark.
帕累托图,比较在 NVIDIA DGX Spark 上使用各种推测解码技术的 Nemotron 3.5 Lightning 推理性能。

图 1:帕累托图,比较在 NVIDIA DGX Spark 上使用各种推测解码技术的 Nemotron 3.5 Lightning 推理性能。配置 - 前缀 - 32K,然后进行 10 轮 2k 输入和 1k 输出。

在 NVIDIA H100 上部署

如果你在 NVIDIA H100 上运行,以下内容应能提供单用户本地开发的起始配置:

vllm serve --model nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 \
  --moe-backend humming \
  --linear-backend humming \
  --max-num-seqs 256 \
  --trust-remote-code \
  --max-num-batched-tokens 32768 \
  --enable-prefix-caching \
  --async-scheduling \
  --mamba-backend flashinfer \
  --mamba-ssm-cache-dtype float16 \
  --enable-mamba-cache-stochastic-rounding \
  --mamba-cache-philox-rounds 5 \
  --mamba-cache-mode align \
  --mamba-ssu-algorithm horizontal \
  --reasoning-parser nemotron_v3
Pareto chart comparing inference performance of Nemotron 3.5 Lightning using various speculative decoding techniques on NVIDIA H100 GPUs.
帕累托图,比较在 NVIDIA H100 GPU 上使用各种推测解码技术的 Nemotron 3.5 Lightning 推理性能。

图 2:帕累托图,比较在 NVIDIA H100 GPU 上使用各种推测解码技术的 Nemotron 3.5 Lightning 推理性能。配置 - 前缀 - 32K,然后进行 10 轮 2k 输入和 1k 输出。

在 NVIDIA Jetson 上本地部署

如果你在 NVIDIA Jetson 上本地运行,以下内容应能提供单用户本地开发的起始配置:

vllm serve nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 \
  --reasoning-parser nemotron_v3 \
  --kv-cache-dtype fp8 \
  --trust-remote-code \
  --max-num-batched-tokens 16384 \
  --enable-prefix-caching \
  --mamba-backend flashinfer \
  --mamba-ssm-cache-dtype float16 \
  --enable-mamba-cache-stochastic-rounding \
  --mamba-cache-philox-rounds 5 \
  --mamba-cache-mode align

为专用智能体任务带来领先的准确性和效率

Nemotron 3.5 Lightning 旨在让专用智能体既具备能力又经济高效地运行。其混合 MoE 架构每个 token 仅激活 30B 参数中的 3B,而多 token 预测减少了生成过程中所需的顺序工作。这些特性共同实现了比同等规模开源模型高达 4 倍的吞吐量。

Nemotron 3.5 Lightning 为智能体任务提供了领先的准确性。通过从 Nemotron 3 Ultra 蒸馏能力,并在流行的智能体框架上进行训练,Nemotron 3.5 Lightning 在智能体生产力、编码、工具使用、指令遵循和长上下文推理基准测试中带来了强劲的性能。

如图 3 所示,更高的推理吞吐量和 token 效率使 Nemotron 3.5 Lightning 处于效率前沿,帮助始终在线的智能体更快完成高负载工作。

Line chart comparing PinchBench accuracy with time to complete 10,000 tasks.
折线图,比较 PinchBench 准确性与完成 10,000 个任务所需时间。

图 3:Nemotron 3.5 Lightning 在相当准确度下完成智能体任务的速度最高快 30%,从而引领效率前沿。

总结

NVIDIA Nemotron 3.5 Lightning 将可定制的智能体智能带到本地系统、边缘、数据中心和云端。它结合了 30B 参数的混合 MoE 架构与 3B 激活参数、高达 100 万 token 的上下文窗口、可控推理,以及通过 MTP 或 DFlash 进行的推测生成。

借助 vLLM 中的 Day-0 支持,开发者可以通过 OpenAI 兼容栈提供该模型,并将其集成到本地助手、智能体框架和专用企业工作流中。

准备好使用 Nemotron 3.5 Lightning 构建更快、更高效的智能体系统了吗?

  • 从 Hugging Face 下载模型权重:BF16 和 NVFP4。
  • 使用入门 cookbook 通过 vLLM 运行 Nemotron 3.5 Lightning。

订阅 NVIDIA 新闻,并在 LinkedIn、X、YouTube 以及 Discord 上的 Nemotron 频道关注 NVIDIA AI,随时了解 NVIDIA Nemotron 的最新动态。

致谢

NVIDIA:Nirmal Kumar Juluru、Anusha Pant、Amir Klein、Faradawn Yang、Nave Assaf、Ryan Stewart、Alex Steiner、Bita Rouhani

常见问题

与 Nemotron 3 Nano 相比有什么新变化?

Nemotron 3 Nano 确立了高效的混合 Mamba-Transformer MoE 设计,总参数量 30B,激活参数量 3B,上下文窗口 1M token,并具备可控推理能力。Nemotron 3.5 Lightning 在此基础上从四个方面进行了重要扩展:

  • 前沿模型蒸馏:Nemotron 3.5 Lightning 从 Nemotron 3 Ultra 蒸馏而来,将 NVIDIA 前沿智能体模型的能力迁移到更小的部署规模中。
  • 智能体框架优化:Nemotron 3.5 Lightning 针对主流智能体框架和多轮工作流进行训练,重点强化编码、工具使用、指令遵循和专项任务完成能力。
  • 投机解码:Nemotron 3.5 Lightning 支持多 token 预测(MTP)、DFlash 和 DSpark,通过并行起草和验证多个 token 来加速生成。

最终打造出的模型能够以更少时间更准确地完成更多智能体任务。

来源:vLLM Blog · vllm.ai