Prime Intellect 发布 SYNTHETIC-2:400 万条协作生成的推理轨迹数据集
SYNTHETIC-2 Release: Four Million Collaboratively Generated Reasoning Traces
Prime Intellect 发布 SYNTHETIC-2,一个包含 400 万条已验证推理轨迹的开放数据集,覆盖数学、编码以及谜题、指令遵循等此前较少涉及的推理任务。
我们发布 SYNTHETIC-2,这是一个包含四百万条经过验证的推理轨迹的开放数据集,涵盖了迄今为止发布的最全面的复杂强化学习任务和验证器集合。该数据集由全球的计算贡献者通过我们的流水线并行分布式推理协作生成。超过 1,250 块 GPU 在 3 天内加入——从 4090 到 H200——为复杂 RL 任务创建数据。
行星级推理
像 DeepSeek‑R1‑0528 这样的前沿规模模型已无法容纳在单个节点上。因此在 SYNTHETIC‑2 中,我们通过流水线并行将模型分片到分布式计算工作节点上。每个设备只存储一个阶段,并将激活流式传输给下一个对等节点。Prime Intellect 会即时将吞吐量和地理位置相似的 GPU 分组,以最大化利用率。

TOPLOC
TOPLOC v2 通过生成可验证的计算证明,确保了本次运行中分布式推理工作节点的诚实计算。对于 SYNTHETIC-2,我们通过三项关键增强扩展了我们的局部敏感哈希证明:
- 组级接受/拒绝:最终流水线阶段的成功意味着所有阶段的完整性。
- 失败时逐阶段重放:能够精确识别并罚没导致完整性丧失的第一个故障节点。
- 可复现的 Gumbel 采样证明:检测对采样逻辑的篡改(论文即将发布)。
在 4M 样本的 SYNTHETIC-2 运行期间,TOPLOC 的误报率仅为 0.000925 %(37 次罚没)。在所有模型中,证明验证成本的中位数平均比重新执行原始推理便宜 25 倍。
全局编排
我们的基础设施在全球范围内编排 GPU 节点——每个节点在验证后加入,发送带有系统指标的心跳,并接收任务分配。系统跟踪所有活跃节点及其工作提交,确保透明度和可问责性。我们的编排器 API 支持在全球计算网络上无缝部署多样化工作负载。
任务根据计算需求匹配到节点组——从消费级 GPU 到具有数百 GB GPU 内存的多节点设置。在组建多节点组时,系统会优化地理邻近性,以最小化协作节点之间的延迟。系统通过解散受影响的组并重新调度工作来自动处理节点故障,同时机会主义调度算法通过识别将兼容节点合并为更高效配置的机会,持续优化资源利用率。例如,以下 POST 请求将 DeepSeek-R1-0528 推理部署在两种拓扑上:1×1128GB(单个 8×H200 节点)和 2×640GB(跨两个 8×A/H100 节点的流水线并行推理):
{
"name": "DeepSeek-R1-0528:R1-SFT",
"image": "primeintellect/prime-rl:commit-df75e4c",
"env_vars": {
"HF_HUB_CACHE": "/shared/hf_hub",
"HF_HUB_ETAG_TIMEOUT": "500"
},
"cmd": [
"@configs/inference/synthetic-2/base.toml",
"@configs/inference/synthetic-2/deepseek-r1-0528.toml",
"--data.name",
"PrimeIntellect/SYNTHETIC-2-Base-R1-SFT",
"--parallel.pp.rank",
"${GROUP_INDEX}",
"--parallel.pp.world-size",
"${GROUP_SIZE}",
"--parallel.pp.iroh-seed",
"${WORKER_P2P_SEED}",
"--parallel.pp.iroh-peer-id",
"${NEXT_P2P_ADDRESS}",
"--group-id",
"${GROUP_ID}",
"--task-id",
"${TASK_ID}",
],
"metadata": {
"labels": {
"model": "DeepSeek-R1-0528",
"data": "R1-SFT"
}
},
"scheduling_config": {
"plugins": {
"node_groups": {
"allowed_topologies": ["1x1128GB"]
}
}
},
"storage_config": {
"file_name_template": "deepseek-ai/DeepSeek-R1-0528/PrimeIntellect/SYNTHETIC-2-Base-R1-SFT/1-${NODE_GROUP_ID}-${NODE_GROUP_SIZE}-${CURRENT_FILE_INDEX}-${NODE_GROUP_INDEX}.parquet"
},
"volume_mounts": [
{
"host_path": "/group-${GROUP_ID}-state",
"container_path": "/state"
}
]
}编排器处理从 Docker 容器管理到安全 P2P 连接(通过 mTLS)的一切事务,而我们的验证框架通过持续监控和针对特定模型验证的专用 TOPLOC 服务器来确保计算完整性。
计算贡献
共有来自世界各地的 1,253 块 GPU 参与了此次运行,包括 49 个配备 8xH200 GPU 的节点、43 个配备 8xH100 GPU 的节点,以及众多消费级 3090 和 4090 GPU。

SYNTHETIC-2 数据集
为了生成 SYNTHETIC-2,我们收集了涵盖数学、编程以及非传统和此前代表性不足的推理任务(如谜题或测试精确指令遵循能力的问题)的多样化挑战性推理任务。这些任务来自公开数据集如 Skywork Math、开源库如 reasoning-gym,并且大部分由内部研究生成。
具体来说,我们提出了以下新的可验证推理任务:
- 代码输出预测(v2): 该任务要求 LLM 预测一段复杂的 LLM 生成代码的输出。与 SYNTHETIC-1 中的 v1 不同,v2 包含真实世界的库和代码,更准确地模拟了真实世界的用例
- Pydantic 遵循: 我们要求 LLM 生成一个符合复杂(LLM 生成的)pydantic 模型的 JSON 对象
- 复杂 JSON 格式化: 该任务测试 LLM 遵循复杂 JSON 格式化指令的能力。其提示包含一些简单的推理问题,以及关于结果应如何以 JSON 格式呈现的复杂指令
- 句子解扰:要求模型将随机排序的文本块重新排列为其原始的时间/逻辑顺序,同时保持块编号。
- ASCII 树格式化: 通过将生成的输出与真实树表示进行比较,评估 ASCII 树结构生成(用于文件系统目录)。
- Formatask:旨在帮助从具有特定格式要求的自然文本序列中精确提取特定部分,基于要提取的特定部分的自然描述(“只返回提到 X 主题… 的部分”)
任务的完整分布如下所示。


SYNTHETIC-2 旨在同时提供高质量的 SFT 和 RL 数据。因此,我们将任务分为两个子集:
我们的 SFT 子集包含一组较小的更困难的任务。对于这些任务,我们从 Deepseek-R1-0528(可用的最佳开源推理模型)生成响应,使开发者能够将其推理能力蒸馏到更小的模型中
我们的 RL 子集包含所有可以使用 prime-rl 验证的任务。由于难度过滤已被证明对 RL 训练性能至关重要,我们通过计算三个较小模型 Qwen3-32B、Qwen3-4B 和 DeepSeek-R1-0528-Qwen3-8B 在每个任务上的通过率,为所有任务生成难度注释。

我们在 Huggingface 上发布了以下最终数据集拆分:
- SYNTHETIC-2:完整的 SYNTHETIC-2 数据集,包含所有提示和补全以及奖励
- SYNTHETIC-2-SFT-verified:SYNTHETIC-2 的 SFT 拆分,包含来自 Deepseek-R1-0528 的响应,并验证为正确(二元奖励为 1,非二元奖励超过 0.7)
- SYNTHETIC-2-SFT-unverified:SYNTHETIC-2 的 SFT 拆分,包含所有响应,包括未验证为正确的响应
- SYNTHETIC-2-RL:SYNTHETIC-2 的 RL 子集,包含来自 Qwen3-32B、Qwen3-4B 和 DeepSeek-R1-0528-Qwen3-8B 的难度注释
后续步骤
在 SYNTHETIC-2 发布的基础上,我们的下一步是利用 SYNTHETIC-2 的任务以及数据集作为下一次分布式 RL 运行的基础。INTELLECT-2 已经证明全球分布式强化学习是可行的——现在是时候展示其作为一种新型扩展范式的潜力,解锁更多算力并实现最先进的模型性能。自 INTELLECT-2 发布以来,我们在大规模异步 RL 的稳定性方面取得了重大改进,并相信这些改进将带来以全球分布式方式训练的最先进推理模型。
为了扩展 prime-rl 中 RL 环境生态系统的多样性,我们将 verifiers 仓库集成为核心库,用于从开源社区众包复杂的 RL 环境。更多细节即将公布!
我们的目标是引入更多多轮和工具使用环境——尤其是针对编码和自主研究任务——以通过我们的 INTELLECT-3 模型解锁 SOTA 编码智能体能力。
来源:Prime Intellect Blog · primeintellect.ai