Prime Intellect 发布 INTELLECT-2:首个通过全球分布式强化学习训练的 32B 模型
INTELLECT-2 Release: The First 32B Parameter Model Trained Through Globally Distributed Reinforcement Learning
Prime Intellect 发布 INTELLECT-2,称其为首个通过全球分布式强化学习训练的 32B 参数模型,在动态异构的算力贡献者集群上以完全异步 RL 训练推理语言模型。
INTELLECT-2 发布:首个通过全球分布式强化学习训练的 32B 参数模型
我们很高兴发布 INTELLECT-2,这是首个通过全球分布式强化学习训练的 32B 参数模型。与传统的集中式训练方式不同,INTELLECT-2 使用完全异步的强化学习,在一个动态、异构的计算贡献者集群上训练一个推理语言模型。
为了在这种独特的基础设施上进行训练,我们从零构建了多个组件:我们推出了 PRIME-RL,这是我们专为分布式异步强化学习打造的训练框架,它建立在若干新颖组件之上,例如 TOPLOC(用于验证推理工作节点的 rollout)和 SHARDCAST(用于将策略权重从训练节点高效广播到推理工作节点)。
除了基础设施组件之外,我们还对标准 GRPO 训练配方和数据过滤技术提出了修改,这些修改对于实现训练稳定性、确保模型成功学习其训练目标至关重要,从而超越了 QwQ-32B。
我们开源了 INTELLECT-2 及其代码和数据,希望推动全球分布式训练领域更多开放研究
- 详细技术报告: primeintellect.ai/intellect-2
- INTELLECT-2 on Hugging Face
- 试用聊天界面:chat.primeintellect.ai
- prime-rl:——我们的异步 RL 框架
.png&mode=full&exp=1791590400&sig=57724852fe20b1b7)
分布式训练的范式转变
利用强化学习扩展测试时计算已成为大语言模型(LLM)的新扩展轴,通过让模型花更多时间进行推理来提升性能。
然而,强化学习训练通常是集中式的,需要大规模同地部署的 GPU 集群和高速互连。借助 INTELLECT-2,我们展示了一种范式转变:强化学习本质上更具异步性,非常适合全球分布式计算。
训练基础设施
我们为训练 INTELLECT-2 引入了以下关键开源基础设施组件:
- PRIME-RL:
- 专为多数据中心训练设计的完全异步强化学习框架。解耦了 rollout 生成、模型训练和权重广播。它支持在异构、不可靠的网络中进行训练。
- 训练器实现使用 PyTorch FSDP2,推理使用 vLLM,验证器使用 GENESYS schema,该 schema 在 SYNTHETIC-1 中引入。
- SHARDCAST:一个通过基于 HTTP 的树形拓扑网络分发大文件的库,可高效地将更新后的模型权重传播到推理工作节点。

- TOPLOC:
- 一种用于高效可验证推理的局部敏感哈希方案。它可检测模型推理中的篡改或精度变化,并在非确定性 GPU 硬件上可靠运行。
- 推理工作节点生成 rollout,这些 rollout 文件通过签名 URL 上传,链上事件触发 TOPLOC 验证器对其进行检查;被接受的文件送入训练器,而无效文件则将提交节点从池中移除。

训练配方
- Training Data & Rewards:
- 来自 NuminaMath-1.5、Deepscaler 和 SYNTHETIC-1 的 285k 个可验证任务(数学与编程)。
- 二元任务奖励 + 长度奖励让用户可以在推理时预算思考 token。
- 两步异步强化学习:新策略权重的广播与正在进行的推理和训练完全重叠——消除了通信瓶颈

- 双侧 GRPO 裁剪:通过双侧 token 概率比裁剪缓解梯度尖峰,从而稳定训练。

- 高级数据过滤:结合离线和在线过滤来挑选具有挑战性的任务,显著提升模型学习效率。

- 激进梯度裁剪:应对规模扩大时不断攀升的梯度范数,提供更好的训练稳定性。
实验
我们报告两个主要实验的结果:TARGET-SHORT,一个使用短目标长度的实验性运行,用于训练高效推理模型;以及 TARGET-LONG,我们使用较长目标长度的主要运行。
- 计算利用率:在两个主要实验期间,我们通过两步异步强化学习成功地将通信与计算重叠。
- Reward Trajectories:
- 在整个训练过程中,我们看到任务奖励有显著提升,表明模型在数学和编码问题上的表现有所改善。我们还看到长度惩罚的减少,但比在消融实验期间慢得多
- 基准性能:我们成功提升了 QwQ-32B 在数学和编码基准上的性能。

- 总体而言,由于 QwQ-32B 已经通过 RL 进行了广泛训练,除了在训练数据集上的改进之外,很难在基准上获得大量泛化提升。要看到更强的改进,可能需要更好的基础模型,例如现已可用的 Qwen3,或更高质量的数据集和 RL 环境。
未来工作
INTELLECT-2 是迈向以全球分布式方式训练的开放前沿推理模型的第一步。在接下来的几个月里,我们将致力于:
- Increasing the Ratio of Inference to Training Compute
- 推理是高度并行且无通信的,因此将更多 FLOPs 投入到推理中的更复杂 RL 环境,天然适合低通信训练。
- Tool Calls & Multi-Turn RL
- 为了充分利用推理时计算来推动科学和研究进展,我们需要在模型的推理链中赋予其内置工具——网络搜索、Python 解释器等。
- Crowdsourcing RL Tasks & Environments
- 我们相信开源在这方面具有独特优势。分布式 RL 仍处于早期阶段,有了合适的社区和贡献,开源 AI 可以超越闭源实验室。
- Model Merging & DiLoCo
- 融合独立训练的 RL 模型——无论是在最后,还是通过 DiLoCo 持续进行——以创建一个单一的统一模型,将分布式 RL 扩展到更多计算。
查看技术报告了解更多详情:primeintellect.ai/intellect-2
加入我们
INTELLECT-2 证明了全球分布式 RL 是可行的。现在,我们专注于工具辅助推理、众包更高质量的数据,以及优化我们的基础设施和训练配方,以构建前沿开放模型。
如果你想与我们一起构建开源且民主化的 AGI,请加入我们。
来源:Prime Intellect Blog · primeintellect.ai