Prime Intellect 发布 SYNTHETIC-1 验证推理数据集与 GENESYS 框架
SYNTHETIC-1: Scaling Distributed Synthetic Data Generation for Verified Reasoning
Prime Intellect 发布 SYNTHETIC-1,一个基于 DeepSeek-R1 生成的验证推理轨迹数据集,包含 140 万条任务与验证器,覆盖数学、编码和科学领域。
SYNTHETIC-1:为可验证推理扩展分布式合成数据生成
今天,我们非常兴奋地推出 SYNTHETIC-1,这是一项合作成果,旨在利用 DeepSeek-R1 创建最大的开源可验证推理轨迹数据集,涵盖数学、编程和科学领域。我们的数据集包含 140 万个高质量任务和验证器,旨在推动推理模型的训练。
我们邀请所有人贡献算力,加入我们,共同将分布式强化学习扩展到 o3 规模乃至更大。
在我们最近的文章 推理时计算范式下的分布式训练 中,我们探讨了这一范式转变将如何从根本上重塑计算基础设施,使全球分布式训练成为未来的方向。
DeepSeek-R1 论文强调了为强化学习生成冷启动合成数据的重要性。作为迈向最先进推理模型的第一步,SYNTHETIC-1 使用 DeepSeek-R1 生成了涵盖数学、编程和科学的可验证推理轨迹。
我们的贡献
-
SYNTHETIC-1:推理数据集 与公开运行:我们发布了包含 140 万个高质量任务和验证器 的数据集,并允许任何人贡献算力参与我们的合成数据生成运行。
-
GENESYS:合成数据生成框架 易于扩展的开源库,用于合成数据生成和验证,并呼吁众包任务与验证器。
通往完全开源推理模型之路
随着 Deepseek-R1 和我们自己的 INTELLECT-MATH 模型的发布,我们对训练 o1 等最先进推理模型有了新的见解。
DeepSeek 团队首先完全通过强化学习训练了 DeepSeek-R1-Zero,使用了 DeepSeek v3 的组相对策略优化(GRPO)。然后,他们使用 R1-Zero 生成冷启动长思维链推理数据,以微调 DeepSeek v3。最后,他们对得到的 SFT 模型再次应用 GRPO 训练,产生了更强的 DeepSeek-R1 模型。
DeepSeek-R1 的关键发现:
- 用于 SFT 的冷启动数据显著提高了模型性能,使 R1 比 R1-Zero 强大得多。
- 从强大的教师模型进行蒸馏非常有效,即使没有额外的强化学习。而依赖本文提到的大规模强化学习的小型模型需要巨大的计算能力,甚至可能无法达到蒸馏的性能。
我们的下一步:
因此,我们对 R1 的开放复现和扩展将分两步进行,紧密模仿 DeepSeek-R1 的方法:
-
生成可验证推理数据
- 创建涵盖数学、编程和科学的最大可验证推理轨迹数据集。
- 开源这些数据集,以实现更强、更小的推理模型。
📌 DeepSeek 仅用 80 万个样本进行蒸馏训练;通过扩展可验证推理链,我们很可能实现更好的模型。
-
具有可验证奖励的全球分布式强化学习
- 使用具有可验证奖励的强化学习进一步训练 SFT 模型。
- 在全球分布式环境中进行此训练,允许任何人贡献算力。

SYNTHETIC-1 任务与验证器
SYNTHETIC-1 包含 140 万个精心整理的任务,涵盖数学、编程、软件工程、STEM 以及合成代码理解。它既包括可通过程序验证的问题(例如带有单元测试的编程任务),也包括使用 LLM 评判员验证的开放式推理挑战。我们还引入了一种新颖的方法,用于生成对当前最先进 LLM 极具挑战性的合成代码理解任务。
77.7 万个可验证数学问题:
为了收集可验证的数学问题,我们使用了 NuminaMath 数据集,其中主要包含高中竞赛级别的数学题。我们在数据之上应用基于 LLM 的过滤,以移除无法自动验证的问题(例如要求证明的问题),并将多项选择题改写为直接问答格式。
14.4 万个可验证编程问题
我们从公开可用的 Apps、Codecontests、Codeforces 和 TACO 数据集中汇总了编程问题及其单元测试。由于大多数问题仅适用于 Python,我们将它们改写为 JavaScript、Rust 和 C++,从而从约 3.6 万个问题增加到约 14.4 万个。为了验证 LLM 的响应,我们使用在我们的库 genesys 中实现的容器化执行环境。
7 万个真实世界软件工程问题
我们处理 CommitPack——一个真实世界 GitHub 提交的数据集,以整理出 7 万个开放式软件工程问题。单个任务指令由提交前的代码文件和 LLM 生成的修改代码指令组成——该指令由一个能够访问原始提交消息和文件提交后状态的 LLM 合成。为了给解决方案评分,我们使用一个 LLM 评判员,将给定解决方案与提交后文件的实际状态进行比较。
31.3 万个开放式 STEM 问题
我们使用 StackExchange 数据集 从广泛的技术与科学领域收集问题。我们应用基于 LLM 的过滤,仅选择具有客观正确答案的问题(例如,我们过滤掉明确要求观点的问题),并且需要推理而不仅仅是检索信息的问题。与我们的软件工程问题类似,我们通过使用一个能够访问问题最高赞回答的 LLM 评判员来给响应评分。
6.1 万个合成代码理解任务
我们提出合成代码理解,这是一项对当前最先进 LLM 极具挑战性且可以在无需人工标注者的情况下全自动生成的任务。该任务的目标是预测代码的输出,这些代码在给定某些测试输入的情况下对字符串应用任意变换。为了生成任务数据,我们提示 LLM 生成任意字符串处理函数,并使用类似于 evol-instruct 的提示方案递归地使它们变得更复杂。
为了获得输入,我们既生成随机字符串,也从新闻文章中选取片段,并将它们输入 LLM 生成的代码以获得真实输出。为了验证预测输出,我们只需检查预测的输出字符串是否与真实字符串匹配。
对于长输入字符串和多次使代码更复杂的迭代,即使是 o1 在这项任务上的解决率也接近 0%。我们的最终数据集包含 6.1 万个不同复杂度的问题,适用于 Python、JavaScript、Rust 和 C++。

GENESYS
Genesys 是我们的开源库,用于合成数据生成和验证,为 SYNTHETIC-1 的发布提供支持。它包含验证器的高效实现,例如 LLM 评判器和异步运行的容器化代码执行环境,使其非常适合合成数据生成,尤其是强化学习。
Genesys 设计为易于扩展:您可以使用 Hugging Face 数据集和我们灵活的 schema 为您自己的任务生成响应,并以最少的实现工作添加您自己的验证器。相关说明可在我们的 README 中找到。
我们同意 Karpathy 的观点:开源社区能做的最有影响力的事情之一就是众包任务和验证器环境。此类环境的优秀示例包括 KernelBench,它评估 LLM 编写高效 GPU 内核的能力,以及 SWE-Gym,它在真实世界的软件工程任务上测试 LLM。
参与其中:为我们的开源代码库做出贡献,如果您想为我们正在进行的 SYNTHETIC-1 运行添加高质量的任务和验证器,请在 Discord 上联系我们。
如何贡献算力
现在任何人都可以通过我们的平台贡献资源来推进开源 AI,之后还可以用自己的硬件以分布式方式贡献。
仪表盘:https://app.primeintellect.ai/intelligence(查看运行并贡献算力)
我们最近关于 TOPLOC 的工作通过局部敏感哈希方案实现可验证推理,将作为分布式算力贡献的基础。

结论与下一步:扩展至前沿
SYNTHETIC-1 只是迈向扩展至最先进开源推理模型的第一步。
我们期待社区以算力、代码或数据的形式做出贡献,以创建迄今为止最大的开源推理数据集。
此外,我们目前正在扩展我们的训练框架 prime,以支持全球分布式强化学习,作为我们计划的下一步。
如果这听起来令您兴奋,加入我们。我们是一个小而精、人才密集且雄心勃勃的团队,正在寻找工程师和研究人员来帮助我们构建开源 AGI。
来源:Prime Intellect Blog · primeintellect.ai