Prime Intellect 发布 SYNTHETIC-2 开源推理数据集与流水线并行分布式推理
SYNTHETIC-2
Prime Intellect 发布 SYNTHETIC-2,一个开源推理数据集,并基于 DeepSeek-R1-0528 完成行星级流水线并行分布式推理运行,生成经过验证的推理轨迹。
SYNTHETIC-2:面向可验证推理的行星级流水线并行推理
今天,我们非常激动地推出 SYNTHETIC-2,这是我们下一代的开源推理数据集,以及行星级、流水线并行的分布式推理运行。
它构建在我们全球分布式推理栈之上,并由全新的 DeepSeek-R1-0528 模型驱动,SYNTHETIC-2 生成了经过验证的推理轨迹,覆盖了迄今为止发布的最全面的复杂强化学习任务和验证器集合。
该运行支持异构计算——让从消费级 GPU 到超大规模 NVIDIA 和 AMD 集群的每个人,都能为前沿级 AGI 研究做出贡献。只需启动你的 GPU,开始帮助我们迈向开源超级智能。
行星级推理:为公共互联网构建分布式推理引擎
几周前,我们预览了我们的全球分布式推理栈。今天,该栈进入生产环境——完全集成了:
- prime-rl – 我们容错的异步分布式 RL 库
- TOPLOC 用于流水线并行推理的可验证计算证明(+ v2,见下文)
像 DeepSeek-R1 这样拥有数千亿参数的前沿模型无法放入单个 GPU 的显存中。通过流水线并行,我们不再将整个模型保留在每个 GPU 上,而是将其划分为顺序阶段。每个设备——无论是数据中心的 H100 还是消费级 RTX 4090 显卡——只存储其阶段,处理其前向传播的切片,并将激活流式传输给下一个工作节点。这使我们能够在消费级设备上运行大型模型。


TOPLOC v2
为了信任来自数千个节点的结果,我们必须廉价地验证它们的生成。我们的 TOPLOC 可验证推理工作采用了一种紧凑的局部敏感哈希方案来处理中间激活,该方案能够检测对模型、提示或精度的未经授权修改。
TOPLOC v2 将此方案扩展到流水线并行推理设置中:
- 组级奖励: 如果最终输出正确,我们将其视为所有流水线阶段诚实行为的证据。
- 失败时的责任分配: 如果结果验证失败,我们逐阶段重放证明,定位第一个故障工作节点,拒绝输出,并移除该节点。
此外,我们最初的 TOPLOC 方法能够验证直到最后一个隐藏状态的计算是否正确完成,但尚无法检测采样行为的变化,例如推测解码或在前向传播期间输入任意 token 序列。
TOPLOC v2 引入了一种新颖的方法,可有效解决完全可验证推理中的最后一个问题。TOPLOC v2 利用可复现的 Gumbel 噪声进行分类采样,使验证者能够对原始 token 采样进行并行估计,速度显著快于原始推理,且具有可量化的误差范围。该方法在多种模型并行配置、GPU 类型和内核实现中均表现稳健,为推理和验证的硬件选择与部署提供了灵活性。
我们关于 TOPLOC v2 采样证明方法的完整 arXiv 论文将在未来几周内发布。
SYNTHETIC-2 数据集
SYNTHETIC-2 由大量可验证推理任务以及从多个模型获得的推理轨迹组成。这一设计有两个目的:
- 监督训练数据: 高质量的推理轨迹对于推理模型的冷启动 SFT 数据以及基础模型的中期训练数据至关重要。使用 DeepSeek-R1-0528——最强的开源推理模型——我们生成了大量此类数据,并对其正确性进行了验证。
- 难度标注的 RL 数据: 先前的工作表明,RL 数据集必须根据基础模型的通过率仔细筛选难度,才能获得性能提升。我们使用多种较小的模型,以 pass@k 率作为难度的代理指标,为我们的 RL 任务进行标注。
除了传统的数学和编程问题外,SYNTHETIC-2 旨在覆盖高度多样化的任务,以教会模型能够更好地泛化到数学和编程之外的推理技能。通过聚合公开可用的数据集、使用现有研究仓库,以及自行设计若干可通过程序化方式生成的推理任务,我们收集了 20 多个困难的推理任务,并在我们的框架 prime-rl 中为它们实现了验证器。这些任务涵盖从 reasoning-gym 中的益智游戏,到内核工程,再到精确的 JSON 格式遵循。
除了可验证任务外,我们还收集了那些响应并非以基于规则的方式验证、而仅能通过奖励模型验证的任务。这些提示专门用于生成多样化的 SFT 数据,以避免在过于狭窄的任务分布上进行训练。这些不可验证任务包括批评微调等问题,或来自 Reddit 或 Stack Exchange 等公共论坛的问题。


我们使用 DeepSeek-R1-0528 为所有任务生成推理轨迹。此外,对于所有可通过程序化方式验证的任务,我们从以下模型生成推理数据,以标注数据集的难度:
我们完整的 SYNTHETIC-2 任务数据集可在 HuggingFace 上获取。
如何贡献算力
您可以通过任一方法贡献算力,只需在 SYNTHETIC-2 仪表板上点击“Contribute Compute”。
一旦您的节点加入算力池,它将自动开始与其他节点组成的小组一起处理吞吐量最高的模型,并且它还会显示在地图和排行榜上——您的贡献将在那里被追踪。

后续步骤
在 SYNTHETIC-2 发布的基础上,我们的下一步是以 SYNTHETIC-2 任务数据集为基础,开展下一轮分布式强化学习。INTELLECT-2 已经证明全球分布式强化学习是可行的——现在是时候展示其作为一种新型扩展范式的潜力,释放更多算力并实现最先进的模型性能。自 INTELLECT-2 发布以来,我们在大规模异步强化学习的稳定性方面取得了显著改进,并相信这些改进将带来以全球分布式方式训练的最先进推理模型。
为扩展我们强化学习环境生态系统的多样性,我们将集成 verifiers 仓库,作为从开源社区众包复杂强化学习环境的核心库。更多细节即将公布!
我们的目标是引入更多多轮和工具使用环境——尤其是针对编程和自主研究任务——以借助我们的 INTELLECT-3 模型释放最先进的编程智能体能力。
来源:Prime Intellect Blog · primeintellect.ai