跳到正文
Prime Intellect Blog·· 7 小时前AI 评分65

Prime Intellect 发布 SYNTHETIC-1 验证推理数据集与 GENESYS 框架

SYNTHETIC-1: Scaling Distributed Synthetic Data Generation for Verified Reasoning

AI 导读

Prime Intellect 发布 SYNTHETIC-1,一个基于 DeepSeek-R1 生成的验证推理轨迹数据集,包含 140 万条任务与验证器,覆盖数学、编码和科学领域。

正文 · AI 翻译

SYNTHETIC-1:为可验证推理扩展分布式合成数据生成

今天,我们非常兴奋地推出 SYNTHETIC-1,这是一项合作成果,旨在利用 DeepSeek-R1 创建最大的开源可验证推理轨迹数据集,涵盖数学、编程和科学领域。我们的数据集包含 140 万个高质量任务和验证器,旨在推动推理模型的训练。

我们邀请所有人贡献算力,加入我们,共同将分布式强化学习扩展到 o3 规模乃至更大。

在我们最近的文章 推理时计算范式下的分布式训练 中,我们探讨了这一范式转变将如何从根本上重塑计算基础设施,使全球分布式训练成为未来的方向。

DeepSeek-R1 论文强调了为强化学习生成冷启动合成数据的重要性。作为迈向最先进推理模型的第一步,SYNTHETIC-1 使用 DeepSeek-R1 生成了涵盖数学、编程和科学的可验证推理轨迹。

我们的贡献

  1. SYNTHETIC-1:推理数据集 与公开运行:我们发布了包含 140 万个高质量任务和验证器 的数据集,并允许任何人贡献算力参与我们的合成数据生成运行。

  2. GENESYS:合成数据生成框架 易于扩展的开源库,用于合成数据生成和验证,并呼吁众包任务与验证器。

贡献算力

通往完全开源推理模型之路

随着 Deepseek-R1 和我们自己的 INTELLECT-MATH 模型的发布,我们对训练 o1 等最先进推理模型有了新的见解。

DeepSeek 团队首先完全通过强化学习训练了 DeepSeek-R1-Zero,使用了 DeepSeek v3 的组相对策略优化(GRPO)。然后,他们使用 R1-Zero 生成冷启动长思维链推理数据,以微调 DeepSeek v3。最后,他们对得到的 SFT 模型再次应用 GRPO 训练,产生了更强的 DeepSeek-R1 模型。

DeepSeek-R1 的关键发现:

  • 用于 SFT 的冷启动数据显著提高了模型性能,使 R1 比 R1-Zero 强大得多。
  • 从强大的教师模型进行蒸馏非常有效,即使没有额外的强化学习。而依赖本文提到的大规模强化学习的小型模型需要巨大的计算能力,甚至可能无法达到蒸馏的性能。

我们的下一步:

因此,我们对 R1 的开放复现和扩展将分两步进行,紧密模仿 DeepSeek-R1 的方法:

  1. 生成可验证推理数据

    • 创建涵盖数学、编程和科学的最大可验证推理轨迹数据集。
    • 开源这些数据集,以实现更强、更小的推理模型。

    📌 DeepSeek 仅用 80 万个样本进行蒸馏训练;通过扩展可验证推理链,我们很可能实现更好的模型。

  2. 具有可验证奖励的全球分布式强化学习

    • 使用具有可验证奖励的强化学习进一步训练 SFT 模型。
    • 在全球分布式环境中进行此训练,允许任何人贡献算力。

Image

‍

SYNTHETIC-1 任务与验证器

SYNTHETIC-1 包含 140 万个精心整理的任务,涵盖数学、编程、软件工程、STEM 以及合成代码理解。它既包括可通过程序验证的问题(例如带有单元测试的编程任务),也包括使用 LLM 评判员验证的开放式推理挑战。我们还引入了一种新颖的方法,用于生成对当前最先进 LLM 极具挑战性的合成代码理解任务。

77.7 万个可验证数学问题:

为了收集可验证的数学问题,我们使用了 NuminaMath 数据集,其中主要包含高中竞赛级别的数学题。我们在数据之上应用基于 LLM 的过滤,以移除无法自动验证的问题(例如要求证明的问题),并将多项选择题改写为直接问答格式。

14.4 万个可验证编程问题

我们从公开可用的 Apps、Codecontests、Codeforces 和 TACO 数据集中汇总了编程问题及其单元测试。由于大多数问题仅适用于 Python,我们将它们改写为 JavaScript、Rust 和 C++,从而从约 3.6 万个问题增加到约 14.4 万个。为了验证 LLM 的响应,我们使用在我们的库 genesys 中实现的容器化执行环境。

7 万个真实世界软件工程问题

我们处理 CommitPack——一个真实世界 GitHub 提交的数据集,以整理出 7 万个开放式软件工程问题。单个任务指令由提交前的代码文件和 LLM 生成的修改代码指令组成——该指令由一个能够访问原始提交消息和文件提交后状态的 LLM 合成。为了给解决方案评分,我们使用一个 LLM 评判员,将给定解决方案与提交后文件的实际状态进行比较。

31.3 万个开放式 STEM 问题

我们使用 StackExchange 数据集 从广泛的技术与科学领域收集问题。我们应用基于 LLM 的过滤,仅选择具有客观正确答案的问题(例如,我们过滤掉明确要求观点的问题),并且需要推理而不仅仅是检索信息的问题。与我们的软件工程问题类似,我们通过使用一个能够访问问题最高赞回答的 LLM 评判员来给响应评分。

6.1 万个合成代码理解任务

我们提出合成代码理解,这是一项对当前最先进 LLM 极具挑战性且可以在无需人工标注者的情况下全自动生成的任务。该任务的目标是预测代码的输出,这些代码在给定某些测试输入的情况下对字符串应用任意变换。为了生成任务数据,我们提示 LLM 生成任意字符串处理函数,并使用类似于 evol-instruct 的提示方案递归地使它们变得更复杂。

为了获得输入,我们既生成随机字符串,也从新闻文章中选取片段,并将它们输入 LLM 生成的代码以获得真实输出。为了验证预测输出,我们只需检查预测的输出字符串是否与真实字符串匹配。

对于长输入字符串和多次使代码更复杂的迭代,即使是 o1 在这项任务上的解决率也接近 0%。我们的最终数据集包含 6.1 万个不同复杂度的问题,适用于 Python、JavaScript、Rust 和 C++。

Image

‍

GENESYS

Genesys 是我们的开源库,用于合成数据生成和验证,为 SYNTHETIC-1 的发布提供支持。它包含验证器的高效实现,例如 LLM 评判器和异步运行的容器化代码执行环境,使其非常适合合成数据生成,尤其是强化学习。

Genesys 设计为易于扩展:您可以使用 Hugging Face 数据集和我们灵活的 schema 为您自己的任务生成响应,并以最少的实现工作添加您自己的验证器。相关说明可在我们的 README 中找到。

我们同意 Karpathy 的观点:开源社区能做的最有影响力的事情之一就是众包任务和验证器环境。此类环境的优秀示例包括 KernelBench,它评估 LLM 编写高效 GPU 内核的能力,以及 SWE-Gym,它在真实世界的软件工程任务上测试 LLM。

‍参与其中:为我们的开源代码库做出贡献,如果您想为我们正在进行的 SYNTHETIC-1 运行添加高质量的任务和验证器,请在 Discord 上联系我们。

‍

如何贡献算力

现在任何人都可以通过我们的平台贡献资源来推进开源 AI,之后还可以用自己的硬件以分布式方式贡献。

仪表盘:https://app.primeintellect.ai/intelligence(查看运行并贡献算力)

我们最近关于 TOPLOC 的工作通过局部敏感哈希方案实现可验证推理,将作为分布式算力贡献的基础。

‍

Image

Prime Intellect Worker 加入 SYNTHETIC-1 算力池:验证器向 Worker 发送挑战以确认硬件配置。验证器接受 Worker 加入算力池并分配任务。Worker 执行 GENESYS 容器以生成合成数据。
‍

结论与下一步:扩展至前沿

SYNTHETIC-1 只是迈向扩展至最先进开源推理模型的第一步。

我们期待社区以算力、代码或数据的形式做出贡献,以创建迄今为止最大的开源推理数据集。

此外,我们目前正在扩展我们的训练框架 prime,以支持全球分布式强化学习,作为我们计划的下一步。

如果这听起来令您兴奋,加入我们。我们是一个小而精、人才密集且雄心勃勃的团队,正在寻找工程师和研究人员来帮助我们构建开源 AGI。

来源:Prime Intellect Blog · primeintellect.ai