跳到正文
Prime Intellect Blog·· 4 小时前AI 评分65

Prime Intellect Lab 上线 Nemotron 3 Ultra 后训练支持

Post-Training Nemotron 3 on Lab

AI 导读

Prime Intellect 宣布其托管后训练平台 Lab 对 NVIDIA Nemotron 3 Ultra 提供 day-0 支持,可在 Blackwell B200/B300 上做托管 RL 训练,并调用 Environments Hub 中 2500+ 开源 RL 环境与 SWE-bench Verified、BrowseComp、GPQA Diamond 等评测。

正文 · AI 翻译

在 Lab 上对 Nemotron 3 进行后训练

AI 已从模型转向智能体,这些智能体不再局限于解决单个问题,而是能够通过工具调用、子智能体委派以及长周期迭代来执行完整的广泛范围项目。

NVIDIA 的 Nemotron 系列正是为这一范式而构建。Nemotron 3 Ultra——一个拥有 550B 参数、55B 激活参数的混合专家模型——专为前沿推理与编排而打造,并配有用于语音的 Nemotron 3.5 ASR 和用于护栏的 Nemotron 3.5 Content Safety。Ultra 开箱即处于开放前沿水平:在 RULER@1M 上达到 95%,在 IFBench 上达到 82%,在 SWE-bench Verified 上达到 65–70.4%,并在 Pi、OpenHands、Hermes、OpenCode 和 Mini SWE Agent 上保持一致。

Benchmark comparison table for Nemotron 3 Ultra, GLM 5.1, Kimi K2.6, and Qwen3.5

一个强大的开放模型只是智能体的起点。要让 Nemotron 3 Ultra 针对你的特定工作流和数据实现专业化,你需要一个可重复的后训练循环。定义任务、构建环境、运行强化学习(RL)、评估、部署、将生产轨迹反馈回来,然后重复。

NVIDIA 正是按照这一循环构建了 Ultra——它使用多教师同策略蒸馏(Multi-Teacher On-Policy Distillation)在 NVIDIA 开放的 NeMo RL 和 Gym 库中进行了后训练。Lab 让你能够进行自己的后训练——带上你的工作流、你的环境、你的轨迹,持续对 Nemotron 进行专业化。

团队已经在使用 Prime Intellect Lab 对开放模型进行后训练,使其在自己的工作流上超越闭源前沿系统,而现在同样的托管循环也已开放,可使用 Prime Intellect Hosted Training 对 Nemotron 进行后训练。

在 Prime Intellect Lab 上对 Nemotron 进行后训练的 Day-0 支持

NVIDIA Nemotron 3 Ultra 已在 Prime Intellect Lab(我们的托管后训练平台)上获得全面支持,并提供以下 Day-0 支持:

  • 在 Blackwell B200/B300(以及可用的 NVL72)上进行托管 RL 训练,具备原生 vLLM 推理、NCCL 权重广播以及 Prime-RL 训练器。
  • Environments Hub 中的 2,500+ 个开放 RL 环境,涵盖 SWE、智能体搜索、工具使用、数学、科学、网络安全、机器人仿真等,均封装在我们的 verifiers 框架中,并可在 Prime Sandbox 中运行。
  • 在 Nemotron 所针对的基准上进行托管评估,包括 SWE-bench Verified、BrowseComp、τ²-Bench Telecom、Terminal-Bench Hard、IFBench、AA-LCR、GPQA Diamond、RULER-1M。你可以在数十个相关基准上评估 Nemotron 和你的训练运行。
  • 通过 LoRA 和全权重适配器实现一键推理,经由 NVIDIA Dynamo 提供服务,以实现高效路由、自动扩缩容和 KV 卸载。
  • 持续改进循环,利用生产轨迹回流到下一次 RL 运行中,使你基于 Nemotron 的智能体能够借助新数据持续改进。

在最简单的情况下:

# Set up a Lab workspace with starter configs
prime lab setup

# Install an env from the Hub
prime env install primeintellect/opencode-swe

# Evaluate the new Nemotron Ultra on it
prime eval run opencode-swe -m nvidia/nemotron-3-ultra-550b-a55b --hosted

就是这样。无需搭建集群,无需配置推理服务器,无需接通评估工具链。

更多文档:https://docs.primeintellect.ai/hosted-training/getting-started

在开放环境上进行 RL 的效果

一年多来,我们一直在我们的环境库上训练和消融开放前沿模型。以下数字是在 INTELLECT-3.1 及我们技术栈上的类似开放模型上测得的

  • SWE-bench Verified。在我们极简的 bash + edit 工具链中,对 R2E-Gym-Subset-Validated(4.5k 任务)进行训练,可为 30B 级 MoE 模型带来干净、单调的提升。
  • BrowseComp。在 DeepDive 环境上训练 INTELLECT-3.1,将 BrowseComp 从 7.8% 提升至 14.2% —— 这是饱和度最低的基准之一
  • τ²-Bench Telecom。我们的合成 tau2-synth 环境高度还原真实的 Telecom 领域物理特性,并能稳定提升 Telecom 分数;同一套工厂方法可泛化到企业级工具调用。
  • 推理 RL 阶段。opencode-math、opencode-science、opencode-cp 和 opencode-lean 构成了每个 INTELLECT 模型的推理阶段,并能干净地迁移到 Nemotron 形态的架构上。

面向企业的开箱即用路径

Nemotron 系列开放模型速度快,专为智能体打造。企业应当能够直接交付智能体,而无需组建庞大的内部 RL 基础设施团队。这正是 Prime Intellect Lab 的用途所在。

借助 Lab,企业可以:

  • 开箱即用地从 Nemotron 3 Ultra 起步(已在 Prime Intellect Lab 上完全集成)
  • 带入自己的任务(工作流、评估、模拟或真实数据)
  • 构建或挑选环境 —— 你可以从 2,500+ 个开放环境中选择,也可以与应用研究团队合作共同设计一个新环境(使用 verifiers,可在 Prime Sandbox 中运行)
  • 运行托管 RL —— Lab 在 Blackwell 上处理训练器、推理、权重同步、检查点和在线评估
  • 一键部署 —— 我们提供专用或无服务器推理、原生 LoRA 适配器,通过 NVIDIA Dynamo 提供服务
  • 闭环 —— 记录生产轨迹,之后反馈到下一轮训练中,实现持续学习

这一模式已投入生产:

  • Ramp 使用 Lab 对 FastAsk 进行后训练,FastAsk 是一个 35B 检索子智能体(Qwen3.5-35B-A3B),针对其自身的财务电子表格工作流,达到 66.25% 的精确匹配准确率,而 Claude Opus 4.6 为 61.88%(高出约 4 个百分点),延迟为 Haiku 级别(比 Opus 快约 27%),并且在 RL 数小时内比其基础模型提升 +10 个百分点。如今向 Nemotron 开放的正是同一套托管闭环。
  • Zapier 在 Lab 上构建了 AutomationBench,并将其从静态记分卡转变为实时 RL 训练环境,能够捕获奖励黑客行为并实时修复。

同一套打法现在也适用于 Nemotron。

为什么这对开放生态很重要

这是第一次,封闭实验室内部运行的完整后训练闭环 —— 环境、RL 训练器、评估、推理、持续学习 —— 在 Blackwell 上、在一个已处于开放前沿的模型家族上公开可用。这改变了谁能构建出制胜的智能体:

  • 一家 AI 原生初创公司可以拿 Nemotron 3.5,在自己的生产轨迹上进行后训练,为其工作流打造前沿智能体模型。
  • 一家大型企业可以将从模型权重到训练数据再到环境定义的一切,全部保留在自己的主权部署之内。
  • 一个学术实验室可以开展后训练实验,而不必花费巨资

每家公司都在成为 AI 公司,而赢家将拥有这个闭环:交付、学习、训练、重复。Nemotron 为开放生态提供了一个专为智能体打造的前沿模型。Prime Intellect 为每个团队提供了让它为己所用的技术栈 —— 在 Blackwell 上,在开放环境中,只需数天

开始使用

来源:Prime Intellect Blog · primeintellect.ai