跳到正文
Prime Intellect Blog·· 3 小时前AI 评分69

Prime Intellect 发布 INTELLECT-1:全球分布式训练的 10B 参数模型

INTELLECT-1 Release The First Globally Trained 10B Parameter Model

AI 导读

Prime Intellect 发布 INTELLECT-1,称其为首个在全球范围内协作训练的 10B 参数语言模型,规模是此前研究的 10 倍。模型基于 Llama-3 架构,在 1T token 数据集上训练 42 天,横跨五个国家、三大洲,最多同时使用 112 张 H100 GPU,全球分布式训练算力利用率达 83%,全美范围内达 96%。

正文 · AI 翻译

INTELLECT-1 发布:首个全球协同训练的 10B 参数模型

我们很高兴发布 INTELLECT-1,这是首个在全球范围内协同训练的 10B 参数语言模型。这代表了我们此前研究 10 倍的规模扩展,并表明大规模模型训练不再局限于大型企业,而是可以通过分布式、社区驱动的方式实现。下一步是将其进一步扩展到前沿模型规模,并最终实现开源 AGI。

今天,我们发布:

Image

扩展全球分布式训练

我们展示了首个大规模实验,在横跨五大洲、三个国家、最多同时使用 112 块 H100 GPU 的情况下,协同训练了一个 10 亿参数模型,处理了 1 万亿个 token。我们在跨洲训练中实现了 83% 的整体计算利用率,在仅使用分布在美国全境的节点训练时达到 96%,与集中式训练方法相比,引入的开销极小。

我们的结果表明,尽管存在严重的带宽限制和节点波动,INTELLECT-1 仍能保持训练收敛和高计算利用率,为前沿基础模型的分布式、社区驱动训练开辟了新的可能性。

技术进展

我们在 PRIME 上的研究和工程工作帮助我们实现了这一里程碑。

PRIME 的关键创新包括 ElasticDeviceMesh,它管理用于跨互联网容错通信的动态全局进程组和用于节点内通信的本地进程组、实时检查点恢复、内核,以及混合 DiLoCo-FSDP2 实现。

将 PRIME 与 DiLoCo 及我们定制的 int8 all-reduce 结合使用,我们在 10B 规模下实现了与传统数据并行训练设置相比整体通信带宽减少 400 倍,同时提供相当的性能。

Image

训练细节与数据集

INTELLECT-1 基于 Llama-3 架构,包括:

  • 42 层,隐藏维度 4,096
  • 32 个注意力头
  • 序列长度 8,192
  • 词表大小 128,256

该模型在精心策划的 1T token 数据集混合上训练(Huggingface 链接)

  • 55% FineWeb-Edu
  • 20% Stack v2
  • 10% FineWeb
  • 10% DCLM-baseline
  • 5% OpenWebMath

Image

训练历时 42 天,使用:

  • WSD 学习率调度器
  • 7.5e-5 内部学习率
  • 用于稳定性的辅助 max-z-loss
  • Nesterov 动量外部优化器
  • 计算资源的动态加入/退出,最多 14 个节点

Active training nodes over steps

训练步骤中活跃训练节点的数量。该图展示了 PRIME 处理动态节点参与的能力,从 4 个节点开始,扩展到 14 个节点,同时在频繁节点波动下保持训练稳定性。

‍

Training dynamics over steps

训练动态显示模型困惑度和学习率随训练步骤的变化,包括预热、稳定和退火阶段。

‍

计算效率

系统在不同地理设置下实现了出色的训练效率:

  • 在美国全境训练的计算利用率为 96%(中位同步时间 103 秒)
  • 跨大西洋训练的计算利用率为 85.6%(中位同步时间 382 秒)
  • 全球分布式训练的计算利用率为 83%(中位同步时间 469 秒)

Training efficiency across geographies

不同地理配置下训练的性能指标。

后训练

在完成全球分布式预训练阶段后,我们与 Arcee AI 合作应用了多项后训练技术,以增强 INTELLECT-1s 的能力和特定任务表现。我们的后训练方法包含三个主要阶段,包括大规模 SFT(16 次运行)、DPO(8 次运行)以及使用 MergeKit 进行策略性模型合并。

Image

更多信息请查看我们的详细技术报告。

结论与下一步:扩展至前沿

INTELLECT-1 的成功训练展示了在实现更开放、更民主化的 AI 生态方面的关键技术进步,对先进人工智能系统的未来发展和治理具有重大意义。

通过我们的开源 PRIME 框架,我们为分布式 AI 开发奠定了基础,使其能够与集中式训练设施相媲美。

展望未来,我们设想通过以下方式将这一方法扩展至前沿模型规模:

  • 扩展我们的全球计算网络
  • 实施新的经济激励机制以推动社区参与
  • 进一步优化我们的分布式训练架构,以支持更大规模的模型

这项工作代表着朝着 AI 开发民主化、防止 AI 能力集中于少数组织迈出的关键一步。通过开源 INTELLECT-1 的模型、检查点和训练框架,我们邀请全球 AI 社区与我们一道,共同推动分布式训练的边界。

如需参与,请访问我们的 GitHub 仓库或加入我们的 Discord 社区。 携手共建一个更开放、更协作的 AI 开发未来。

‍

来源:Prime Intellect Blog · primeintellect.ai