跳到正文
Prime Intellect Blog·· 4 小时前AI 评分70

Prime Intellect 发布 INTELLECT-2:首个通过全球分布式强化学习训练的 32B 模型

INTELLECT-2 Release: The First 32B Parameter Model Trained Through Globally Distributed Reinforcement Learning

AI 导读

Prime Intellect 发布 INTELLECT-2,称其为首个通过全球分布式强化学习训练的 32B 参数模型,在动态异构的算力贡献者集群上以完全异步 RL 训练推理语言模型。

正文 · AI 翻译

INTELLECT-2 发布:首个通过全球分布式强化学习训练的 32B 参数模型

我们很高兴发布 INTELLECT-2,这是首个通过全球分布式强化学习训练的 32B 参数模型。与传统的集中式训练方式不同,INTELLECT-2 使用完全异步的强化学习,在一个动态、异构的计算贡献者集群上训练一个推理语言模型。

为了在这种独特的基础设施上进行训练,我们从零构建了多个组件:我们推出了 PRIME-RL,这是我们专为分布式异步强化学习打造的训练框架,它建立在若干新颖组件之上,例如 TOPLOC(用于验证推理工作节点的 rollout)和 SHARDCAST(用于将策略权重从训练节点高效广播到推理工作节点)。

除了基础设施组件之外,我们还对标准 GRPO 训练配方和数据过滤技术提出了修改,这些修改对于实现训练稳定性、确保模型成功学习其训练目标至关重要,从而超越了 QwQ-32B。

我们开源了 INTELLECT-2 及其代码和数据,希望推动全球分布式训练领域更多开放研究

Image

分布式训练的范式转变

利用强化学习扩展测试时计算已成为大语言模型(LLM)的新扩展轴,通过让模型花更多时间进行推理来提升性能。

然而,强化学习训练通常是集中式的,需要大规模同地部署的 GPU 集群和高速互连。借助 INTELLECT-2,我们展示了一种范式转变:强化学习本质上更具异步性,非常适合全球分布式计算。

训练基础设施

我们为训练 INTELLECT-2 引入了以下关键开源基础设施组件:

  • PRIME-RL:
    • 专为多数据中心训练设计的完全异步强化学习框架。解耦了 rollout 生成、模型训练和权重广播。它支持在异构、不可靠的网络中进行训练。
    • 训练器实现使用 PyTorch FSDP2,推理使用 vLLM,验证器使用 GENESYS schema,该 schema 在 SYNTHETIC-1 中引入。
  • SHARDCAST:一个通过基于 HTTP 的树形拓扑网络分发大文件的库,可高效地将更新后的模型权重传播到推理工作节点。

‍ Image

  • TOPLOC:
    • 一种用于高效可验证推理的局部敏感哈希方案。它可检测模型推理中的篡改或精度变化,并在非确定性 GPU 硬件上可靠运行。
    • 推理工作节点生成 rollout,这些 rollout 文件通过签名 URL 上传,链上事件触发 TOPLOC 验证器对其进行检查;被接受的文件送入训练器,而无效文件则将提交节点从池中移除。

Image

训练配方

  • Training Data & Rewards:
    • 来自 NuminaMath-1.5、Deepscaler 和 SYNTHETIC-1 的 285k 个可验证任务(数学与编程)。
    • 二元任务奖励 + 长度奖励让用户可以在推理时预算思考 token。
  • 两步异步强化学习:新策略权重的广播与正在进行的推理和训练完全重叠——消除了通信瓶颈

Image

  • 双侧 GRPO 裁剪:通过双侧 token 概率比裁剪缓解梯度尖峰,从而稳定训练。

Image

  • 高级数据过滤:结合离线和在线过滤来挑选具有挑战性的任务,显著提升模型学习效率。

Image

  • 激进梯度裁剪:应对规模扩大时不断攀升的梯度范数,提供更好的训练稳定性。

实验

我们报告两个主要实验的结果:TARGET-SHORT,一个使用短目标长度的实验性运行,用于训练高效推理模型;以及 TARGET-LONG,我们使用较长目标长度的主要运行。

  • 计算利用率:在两个主要实验期间,我们通过两步异步强化学习成功地将通信与计算重叠。
  • Reward Trajectories:
    • 在整个训练过程中,我们看到任务奖励有显著提升,表明模型在数学和编码问题上的表现有所改善。我们还看到长度惩罚的减少,但比在消融实验期间慢得多

‍

  • 基准性能:我们成功提升了 QwQ-32B 在数学和编码基准上的性能。

Image

  • 总体而言,由于 QwQ-32B 已经通过 RL 进行了广泛训练,除了在训练数据集上的改进之外,很难在基准上获得大量泛化提升。要看到更强的改进,可能需要更好的基础模型,例如现已可用的 Qwen3,或更高质量的数据集和 RL 环境。

未来工作

INTELLECT-2 是迈向以全球分布式方式训练的开放前沿推理模型的第一步。在接下来的几个月里,我们将致力于:

  • Increasing the Ratio of Inference to Training Compute
    • 推理是高度并行且无通信的,因此将更多 FLOPs 投入到推理中的更复杂 RL 环境,天然适合低通信训练。
  • Tool Calls & Multi-Turn RL
    • 为了充分利用推理时计算来推动科学和研究进展,我们需要在模型的推理链中赋予其内置工具——网络搜索、Python 解释器等。
  • Crowdsourcing RL Tasks & Environments
    • 我们相信开源在这方面具有独特优势。分布式 RL 仍处于早期阶段,有了合适的社区和贡献,开源 AI 可以超越闭源实验室。
  • Model Merging & DiLoCo
    • 融合独立训练的 RL 模型——无论是在最后,还是通过 DiLoCo 持续进行——以创建一个单一的统一模型,将分布式 RL 扩展到更多计算。

查看技术报告了解更多详情:primeintellect.ai/intellect-2

加入我们

INTELLECT-2 证明了全球分布式 RL 是可行的。现在,我们专注于工具辅助推理、众包更高质量的数据,以及优化我们的基础设施和训练配方,以构建前沿开放模型。

如果你想与我们一起构建开源且民主化的 AGI,请加入我们。

来源:Prime Intellect Blog · primeintellect.ai