Prime Intellect 发布 INTELLECT-2:首个全球分布式 32B 参数强化学习训练
INTELLECT-2: The First Globally Distributed Reinforcement Learning Training of a 32B Parameter Model
Prime Intellect 发布 INTELLECT-2,称这是首个 32B 参数、全球去中心化的强化学习训练,任何人都可无许可贡献异构算力。
INTELLECT-2:启动首个全球分布式 32B 参数模型的强化学习训练
今天我们推出 INTELLECT-2:首个 32B 参数的全球去中心化强化学习训练运行,任何人都可以无需许可地贡献其异构计算资源。
这种新的测试时扩展范式首次为去中心化训练提供了达到最先进性能的可能性。
去中心化训练的范式转变
随着 OpenAI 的 O1 和 DeepSeek 的 R1 的发布,去年出现了超越预训练的第二种扩展范式——一种允许模型花更多时间进行推理、并通过强化学习进行优化的范式。在我们之前的发布中,我们论证了为什么我们认为这些通过强化学习训练的推理模型比标准的 LLM 预训练更适合去中心化训练方法。今天,我们通过 INTELLECT-2 证明了这一点。
INTELLECT-2
在过去的一年里,我们一直在构建所有关键的开放源代码组件,以将 INTELLECT-2 扩展到分布式 32B 参数的强化学习训练运行——具备前沿推理性能、异构计算节点和无需许可的贡献:
- prime-RL:我们新的开放源代码库,用于完全异步的分布式强化学习,构建在我们容错的去中心化训练框架 prime 之上。
- SYNTHETIC-1 & GENESYS:我们用于众包 RL 任务和验证器环境的库。
- TOPLOC:我们实现高效、可验证推理的方法——用于验证 INTELLECT-2 中所有去中心化 rollout worker 的计算。

Prime-RL:我们的去中心化训练框架
我们的 INTELLECT-2 基础设施主要由三个组件组成:
- 推理 Rollout Worker:一个去中心化的节点集群,使用最新的策略模型从其环境中收集推理 rollout 并计算相应的奖励。
- TOPLOC 验证器:高效验证我们无需许可的 rollout worker 的推理计算。
- GRPO 训练 Worker:一旦我们从去中心化的 rollout worker 收集到新生成的数据,我们就使用 DeepSeek 的 GRPO 训练方法对其进行训练。训练后,这些训练节点通过我们的 shardcast 库将更新后的权重广播给所有推理 worker,以启用下一轮数据收集。
该基础设施实现了具有以下前所未有的特性的去中心化训练设置:
- 完全消除通信开销:通过利用异步强化学习,新策略模型的广播与正在进行的推理和训练完全重叠——消除了通信瓶颈。
- 支持异构推理节点:任何人都可以按照自己的节奏生成推理轨迹——不要求节点之间具有统一的处理速度。
- 低资源需求:推理 worker 在此设置中构成了大部分计算,可以在消费级 GPU 上运行;例如,一台配备 4×RTX 3090 GPU 的机器就足以为 32B 参数模型的训练运行做出贡献。
- 实现高效验证:推理计算可以被验证,而不会引入训练瓶颈。
异步强化学习
强化学习本质上比传统的大语言模型预训练更加异步。在分布式强化学习中,数据收集可以与网络训练解耦。多个工作节点在并行环境中运行,各自异步地收集经验,而一个中心学习器接收并处理这些经验。由于经验在不同时间、从状态空间的不同部分到达,每一步都可以以不同的速率发生。
异步强化学习的成功应用可见于 Tulu 3 或 Llama 4,其中使用了单步异步强化学习方法来提升训练效率。
我们自己的消融实验表明,我们可以复现 DeepScaleR 的结果而不会出现模型退化——即使以四步异步运行(即推理工作节点使用的策略模型落后四步)。这种程度的异步性使我们能够将通信完全隐藏在计算之下,即使在我们去中心化强化学习训练设置中相对较弱的全局互连条件下也是如此。

此外,除了支持去中心化训练设置之外,异步强化学习方法还通过允许分别优化训练和推理引擎来提供额外的效率提升。例如,在我们的 prime-rl 库中,rollout 工作节点可以利用 vLLM 及其全套推理优化。
我们的全异步在线强化学习训练框架 prime-rl 是开源的,允许任何人启动全球分布式强化学习运行。
Shardcast
我们基础设施的一个关键组件是将新策略模型从训练工作节点尽快广播到所有去中心化推理工作节点的机制。为此,我们构建了 Shardcast——一个通过基于 HTTP 的树形拓扑网络分发大文件的库。它由以下组件构成:
- 源服务器:根节点,将大文件分片并通过 HTTP 提供这些分片。
- 中间节点:中间服务器,从上游服务器下载分片并以流水线方式重新提供它们。
- 客户端节点:叶节点,下载分片并将其重新组装成原始文件。

TOPLOC 验证
几周前,我们发布了 TOPLOC:一种用于可验证推理的局部敏感哈希方案,旨在检测推理过程中的恶意修改。它使我们能够:
- 检测推理过程中对模型、提示或精度的修改。
- 对 GPU 硬件非确定性保持稳健——这是可验证计算的主要挑战之一,因为 GPU 操作通常是非确定性的。TOPLOC 可跨 GPU 类型、张量并行配置和注意力内核可靠工作。
- 执行验证的速度显著快于生成。
我们非常期待在生产环境中使用 INTELLECT-2 测试 TOPLOC。这使我们能够真正开放参与——让世界上任何人都能以完全无需许可的方式贡献 GPU 资源。
.png&mode=full&exp=1791590400&sig=0cec891895ed74d2)
INTELLECT-2 模型与训练细节
INTELLECT-2 的目标是训练一个具有可控思考预算的最先进推理模型。这意味着用户和开发者可以通过其系统提示词,指定模型在得出最终答案之前应思考多少 token。
这种方法使得在生产环境中部署所得模型更加高效:近期的工作如 ThinkPrune、L1 和 Deepscaler 已经证明,专门训练在严格约束下进行推理的模型几乎可以解决无约束推理模型能解决的所有问题,但速度更快,推理成本大幅降低。通过提示词控制推理预算,用户可以从中受益,同时还能选择性地为极具挑战性的问题启用更长的推理时间。
.png&mode=full&exp=1791590400&sig=d9a37423d32e5299)
为了训练出具备这种能力的模型,我们使用 QwQ-32B 作为基础模型,并遵循 Deepseek-R1 的方法,应用 GRPO 以及来自数学和编程领域的可验证奖励。在我们的初步实验中,以下组件对于在控制模型思考预算的同时取得良好性能至关重要:
通过长度奖励实现可控思考预算
在根据模型回答正确性对其输出进行评分的任务奖励之上,我们加入了长度奖励,以教会模型遵守用户提示词中指定的思考预算。我们大体上遵循 L1 的工作,即从指定范围中采样目标长度,将其注入提示词,然后根据目标长度与实际响应长度之间的差异分配奖励。与 L1 不同的是,我们不是从一系列值中采样目标长度,而是从一小组预定义的目标长度中采样,因为我们观察到这对模型来说是一个更容易学习的目标。
除了让模型更有用之外,使用长度控制进行训练还让我们能够更高效地使用异构推理硬件:对于每次 rollout,我们为在 GPU 内存和计算能力较低的推理工作节点上处理的问题分配较小的思考预算,而为在更高容量推理工作节点上处理的问题分配较大的思考预算。这样,我们可以在较慢的节点上设置较低的最大生成长度,从而在使用异构硬件的情况下仍能让 rollout 获得相同的处理时间。
离线数据过滤:
在我们的实验中,我们发现仔细的数据过滤对模型性能至关重要。我们发现,使用原始 Deepscaler 数据集和配方训练 DeepSeek-R1-Distill-Qwen-7B 时,模型没有提升。通过针对难度进行大量过滤——只保留模型并非 100% 都能解决的训练数据集中的问题——奖励在训练期间得到改善,所得模型在数学基准上也取得了提升。

为了为 INTELLECT-2 过滤训练数据集,我们使用 DeepSeek-R1-Distill-Qwen-7B 对所有问题采样了八个回答,以估计其难度。为了确保我们只保留具有挑战性的问题用于训练,我们只使用解决率为 75% 或更低的问题。
在线优势过滤: 在训练过程中,所有补全都获得相同奖励的问题不携带训练信号,因为它们的优势(以及因此的损失)为零。我们过滤掉这些问题,并继续运行推理,直到我们拥有一个具有非零优势的完整批次。这使得训练更高效,因为我们不会在无意义的样本上浪费训练计算,并且进一步要求我们在推理上花费比训练更多的时间,使其非常适合利用去中心化推理工作者。
训练任务与验证器:
对于 INTELLECT-2,我们主要关注可验证的数学和编码问题。正如在先前工作如 DeepCoder 中所证明的有效性,我们使用来自 SYNTHETIC-1 的任务子集,该子集在质量和难度上经过了高度过滤。我们的完整训练数据集可以在 Huggingface 上找到。
下一步
INTELLECT-2 的发布标志着大规模去中心化强化学习的开始。现在基础基础设施已经就位,接下来就靠我们所有人将其扩展到最具影响力的领域。
在接下来的几个月里,我们将:
- 使用 RL 端到端训练智能体: 为了充分利用推理时计算来推动科学和研究进展,我们需要教推理模型使用代码解释器和其他软件等工具。强化学习提供了一个强大的框架,以端到端的方式优化智能体工具使用。
- 众包任务与验证器环境: 我们相信开源在这方面具有独特优势。分布式 RL 仍处于早期阶段,有了正确的社区和贡献,开源 AI 可以超越闭源实验室。
查看我们在旧金山举办的去中心化 AI 日上 我们团队的演示,以了解更多关于我们下一步方向的细节。
加入我们
真正开放的超级智能的未来需要共同努力。让我们一起构建它。
来源:Prime Intellect Blog · primeintellect.ai