Prime Intellect 发布 INTELLECT-3:106B MoE 经大规模 RL 训练并开源全流程
INTELLECT-3: A 100B+ MoE trained with large-scale RL
Prime Intellect 发布 INTELLECT-3,一个 106B 参数的 Mixture-of-Experts 模型,在 GLM-4.5-Air 基座上进行 SFT 和大规模 RL 训练,在数学、代码、科学和推理基准上取得同规模 SOTA,并超过许多更大的前沿模型。
INTELLECT-3:一个通过大规模强化学习训练的 100B+ MoE 模型
今天,我们发布 INTELLECT-3,这是一个 100B+ 参数的混合专家(Mixture-of-Experts)模型,在我们的强化学习技术栈上训练完成,在数学、代码、科学和推理基准测试中,于同规模模型中取得了最先进的性能,超越了许多更大的前沿模型。
我们的完整方案——从模型权重和训练框架,到我们的数据集、强化学习环境和评估——均已开源,旨在鼓励更多关于大规模强化学习的开放研究。
INTELLECT-3 是在我们开源并在 Prime Intellect 平台上提供的相同软件和基础设施上训练的,让每个人都能拥有工具来后训练自己的最先进模型,并推动我们迈向一个每家公司都能成为 AI 公司的未来。
在 chat.primeintellect.ai 与 INTELLECT-3 对话
基准测试
INTELLECT-3 是一个 106B 参数的混合专家模型,在 GLM 4.5 Air 基础模型之上通过 SFT 和 RL 训练而成。它在数学、代码、科学和推理基准测试中,于同规模模型中取得了最先进的性能。

训练基础设施
我们利用以下基础设施组件进行训练:
- PRIME-RL:我们的自定义异步强化学习框架,为混合专家模型的监督微调和大规模强化学习提供支持。
- Verifiers 与 Environments Hub:一个统一的环境接口和生态系统,用于智能体强化学习训练环境和评估。
- Prime Sandboxes:为智能体编码环境提供高吞吐量、安全的代码执行。
- 计算编排:编排并管理了跨 64 个互连节点的 512 块 NVIDIA H200 GPU。
PRIME-RL
INTELLECT-3 使用 prime-rl 进行了端到端训练,这是我们生产规模的后训练框架。prime-rl 提供了与 verifiers 环境的原生集成,支撑了我们整个后训练技术栈,从合成数据生成、监督微调、强化学习到评估。通过与 Environments Hub 的紧密连接,整个训练技术栈可以无缝访问快速扩展的训练和评估环境生态系统。
prime-rl 与许多其他 RL 训练器之间最鲜明的区别在于它是仅异步的——我们相当早就认识到(对于我们之前的 INTELLECT-2 模型),RL 的未来是异步的;也就是说,始终有几步是离策略的。异步训练是唯一可行的方法,能够高效地将 RL 扩展到长时程智能体 rollout,而不会因每步中最慢的 rollout 而产生瓶颈。

在过去六个月里,我们重点进行了大规模下性能、稳定性和效率的消融实验。INTELLECT-3 是我们工作的结晶,将 RL 扩展到在 512 块 NVIDIA H200 GPU 上训练一个 100B+ 参数的混合专家模型。有关我们训练器工作原理的更多细节,请参阅我们的技术报告。
我们将很快发布 prime-rl 的托管入口,作为我们即将推出的 Lab 平台的一部分,从而无需基础设施开销即可进行大规模 RL 训练。
Verifiers 与 Environments Hub
我们使用由我们的 verifiers 库构建、并托管在 Environments Hub(我们面向 RL 环境和评估的社区中心)上的环境来训练 INTELLECT-3。
verifiers 是领先的开源工具包,用于为 LLM 创建 RL 环境和评估。它提供了一套模块化且可扩展的组件,能够简洁地表达复杂的环境逻辑,同时保持高度可扩展的性能。
大多数 RL 框架将环境紧密耦合在训练仓库中,导致版本管理、消融实验和外部贡献变得繁琐。Environments Hub 通过将基于 verifier 的环境发布为独立的、可固定版本的 Python 模块,并配有统一的入口点,从而解耦了这一问题。这使得任务可以独立地进行版本管理、共享和迭代。

用于 INTELLECT-3 的所有环境和评估都在 Environments Hub 上公开可用,供他人使用。有关具体环境以及它们如何与我们的训练器集成的更多细节,请参阅我们的技术报告。
Prime Sandboxes
我们专门为智能体 RL 扩展并升级了我们的自定义 Sandboxes 基础设施。
为数千个并发 rollout 执行不受信任的代码,需要一个能够实现亚秒级配置和毫秒级执行延迟的容器编排层。虽然 Kubernetes 提供了容器管理的原语,但标准架构模式不足以满足高速训练所需的吞吐量。
为克服这些限制,我们构建了 Prime Sandboxes:一个完全重新设计的高性能执行层,它绕过 Kubernetes 控制平面,通过直接的 Rust 到 pod 执行路径提供接近本地进程的延迟,在大规模并发下实现 10 秒以内的启动时间,并可扩展到每节点数百个隔离沙箱。
在 verifiers 中,我们将沙箱配置与首轮模型推理重叠,从而在需要执行代码之前完全隐藏启动时间。
有关我们如何为训练 INTELLECT-3 构建和优化沙箱的完整细节,请参阅我们的技术报告。
计算编排
我们在 64 个互连节点上部署了 512 块 NVIDIA H200 GPU。主要的工程挑战在于,在一个容易发生硬件故障的分布式系统中保持确定性和同步。
- 配置:通过 Ansible 实现基础设施即代码、自动硬件发现,以及运行前的 InfiniBand 检查,以隔离缓慢或故障节点。
- 编排:Slurm + Cgroup v2 确保作业干净拆除,并防止残留进程阻塞 GPU 内存。
- 存储:Lustre 用于高吞吐量训练 I/O,NVMe 支持的 NFS 用于快速元数据和无缝 SSH 访问。
- 可观测性:DCGM + Prometheus 监控让我们能够及早发现错误,并在不稳定节点影响训练之前将其排空。
INTELLECT-3 训练配方
INTELLECT-3 分两个主要阶段训练:在 GLM-4.5-Air 基础模型之上进行监督微调阶段,以及大规模 RL 阶段。这两个阶段(包括多次消融实验)均在两个月内于一个 512-GPU 的 H200 集群上完成。
我们在多样化且具有挑战性的强化学习环境组合上进行训练,这些环境旨在增强我们模型的推理和智能体能力。我们使用的所有强化学习环境都在 Environments Hub 上公开可用。我们包含以下类别:数学、代码、科学、逻辑、深度研究和软件工程。

所有基准的标准化且经过验证的实现均可在 Environments Hub 上获取。关于我们训练配方的完整细节可在我们的技术报告中找到。
资源
我们开源了 INTELLECT-3、我们的训练框架 RL prime-rl,以及用于合成数据生成、训练和评估的所有环境。
- 技术报告:storage.googleapis.com/intellect-3-paper/INTELLECT_3_Technical_Report.pdf
- 模型权重: huggingface.co/PrimeIntellect/INTELLECT-3
- PRIME-RL: github.com/PrimeIntellect-ai/prime-rl
- Verifiers: github.com/PrimeIntellect-ai/verifiers
- 环境: hub.primeintellect.ai
未来工作
我们期待将这项工作扩展到:
- 扩展智能体强化学习:对于我们发布的 INTELLECT-3 检查点,奖励和评估持续上升,训练保持稳定。我们正在继续训练,并在强化学习组合中更加侧重智能体环境,我们预计在后续版本中会在更广泛的任务上观察到额外收益。
- 更丰富的强化学习环境:Environments Hub 目前拥有 500 多个任务,涵盖研究、计算机使用、定理证明、自动化和专业领域。INTELLECT-3 仅使用了其中一小部分;下一步是在更广泛、更高质量的社区环境集合上扩展强化学习。
- 长时程智能体:我们正在通过允许模型管理自己的上下文——裁剪上下文、分支以及维护轻量级外部记忆——使长时程行为可通过强化学习训练,从而让它能够学习端到端的上下文处理。因此,我们也在关注能够直接奖励长时程推理的环境。
与 INTELLECT-3 对话
在 chat.primeintellect.ai 或通过我们的 Inference API 与该模型对话。
感谢 Parasail 和 Nebius 担任该模型的推理提供商。
迈向开放超级智能
我们相信这样一个未来:每家公司都可以成为 AI 公司。
在那里,我们可以拥有一个蓬勃发展的初创公司和公司生态系统,构建自己的模型。在那里,我们可以民主化对智能时代红利的获取和所有权,而不是依赖于隐藏在那些明确想要赢得并拥有这一切的公司的 API 背后的一组晦涩模型。
Prime Intellect 正在构建开放超级智能栈,将训练前沿模型的工具交到你手中。INTELLECT-3 就是一个例子,表明你不需要来自大型实验室也能训练出在大联盟中竞争的模型。
我们很期待看到你用 INTELLECT-3 构建出什么。
来源:Prime Intellect Blog · primeintellect.ai