Prime Intellect 发布 Lab:训练自有模型的全栈平台
Introducing Lab: The Full-Stack Platform for Training your Own Models
Prime Intellect 发布 Lab,将 Environments Hub 与托管训练、托管评测整合为面向智能体后训练的全栈平台,支持大规模智能体 RL 与推理评测。
推出 Lab:训练自有模型的全栈平台
今天,我们正式推出 Lab。
Lab 从底层开始专为智能体后训练而构建,将 Environments Hub 与托管训练和托管评估统一为一个用于研究和模型优化的全栈平台。
我们的平台支持后训练研究的整个生命周期——从大规模智能体强化学习,到推理和评估——无需担心大规模 GPU 集群的成本,也无需为底层算法细节头疼。
让每个人都能拥有自己的前沿 AI 实验室。
去年,我们推出了 Environments Hub,一个供任何人构建和分享强化学习环境与评估的平台。自那时起,250 多位创作者已创建了 1000 多个独特环境,环境总下载量超过 10 万次。
今天,我们朝着使命迈出下一步:让目前被大实验室高墙锁住的前沿基础设施,能够为任何研究者、工程师或公司所用。
在过去几周的私测中,来自世界各地的个人和公司完成了 3000 多次强化学习运行。从今天起,我们向所有人开放。
如果你是一家 AI 公司,现在你可以成为自己的 AI 实验室。
如果你是一名 AI 工程师,现在你可以成为一名 AI 研究者。
为何重要:模型 ↔ 产品优化循环
当前的主流观点认为,少数几个大实验室将自动化所有知识工作,拥有智能层,并控制 AI 的未来方向。
我们不觉得这样的未来令人振奋,也不认为它是不可避免的。
我们相信智能体的十年,将模型推向经济各垂直领域的“最后一英里”将是一个非常艰巨的过程,需要现实世界与模型之间持续的反馈循环;特斯拉自动驾驶就是一个很好的类比,其部署与模型改进之间的迭代周期花了数年才为完全自动驾驶做好准备。
同样的故事也将在智能体模型上上演。

大实验室意识到了这一点,他们需要你来教他们的模型如何融入你的劳动力和工作流程。他们需要你用技能、脚手架和提示词来完成最后一英里的工作。但他们没有给你所需的工具。他们执意要拥有智能层、拥有优化循环,并将他们的模型封闭在黑箱之中。
只要你依赖他们的封闭 API 和封闭模型,你就无法拥有对自己智能的主权。他们一边竭尽全力说服你在他们的模型上构建,一边告诉所有人他们会碾压对手,并想完全掌控 AI 的未来,而我们采取完全相反的做法。
我们赋予你对自己模型的完全控制和所有权。我们不希望你被锁定在我们的 API 中,我们不要求你分享你的推理轨迹,我们也不想积累所有的资金和算力。我们希望你能构建自己的模型,掌控自己的智能,并在超级智能的建设中占有一席之地——这样我们就能共同塑造我们希望存在的 AI 未来。
我们希望一个由创作者、初创公司和公司组成的自由开放市场,能在每个垂直领域超越大实验室,并在这一过程中充分拥有上行收益。这不仅是一个传教式的计划,也是一个制胜策略。

如果你把模型仅仅看作一种软件,那么将你的软件集成到尽可能多的系统中的最佳方式就是通过开源。这样的故事已经上演了无数次,Linux 或许是最典型的例子——它的适应性、可扩展性和安全性使其嵌入到整个软件栈中。开放模型,以及用于构建和部署智能体的开放框架,也将取得同样的成就。
同样的故事也发生在 AOL 与开放互联网之间。AOL 严格控制你可以通过其平台访问哪些应用。随后浏览器创造了一个开放平台,任何人都可以在上面构建任何东西。开放生态系统的集体创造力创造出了比 AOL 所能创造的更好的应用,迅速赢得了用户,并最终成就了当今一些最有价值的公司。
—
我们相信,将模型的完全控制权授予产品优化闭环,能够为 AI 带来类似的结果。
ChatGPT 和 Claude Code 这样的突破性产品由实验室自己创造出来是有原因的——他们能够访问完整的模型优化闭环,而纯粹基于 API 构建的团队则无法做到这一点。
如果每家公司都能同样地访问前沿训练基础设施,市场的集体创造力将释放出更多的突破。
我们已经开始看到企业和应用层 AI 初创公司意识到这一点。Cursor 正开始后训练他们自己的模型,直接以 Cursor 本身作为 RL 环境进行优化,以便对其产品栈拥有更多自主权。
我们希望更多应用层公司进入训练领域,覆盖经济的各个垂直行业。
我们是集市,而大型实验室是大教堂。

Lab 是我们尝试铺就一条通往不同于你所被兜售的那种未来的道路。
一个塑造智能的技能对所有人开放,而非局限于少数人的未来。
一个每家公司都能成为自己的 AI 实验室,每位 AI 工程师都能成为 AI 研究者的未来。
一个自由开放的市场共同塑造 AI 未来方向的未来。
一个 AI 开放且去中心化的未来。
产品 — Prime Intellect Lab
Prime Intellect Lab 支持后训练研究的整个生命周期;从大规模智能体 RL,到推理和评估,无需担心大规模 GPU 集群的成本或底层算法细节的麻烦。它将Environments Hub与托管训练和托管评估统一为一个用于研究和优化的全栈平台。
Lab 围绕环境构建,环境包含在您的任务上运行模型所需的一切:
- 一个任务的数据集
- 一个用于模型的执行框架(工具、沙箱、上下文管理等)
- 一个用于给模型表现打分的评分标准
使用环境来通过强化学习训练模型、评估能力、生成合成数据、优化提示词、试验智能体执行框架等等。

Lab 入门
prime lab setup
与许多 Web 应用框架类似——运行一条安装命令就能准备好一个带有既定结构的项目——你可以运行 prime lab setup,然后就可以开始打造你自己的 AI 实验室了,一个完整的工作区已经为你准备好,让你能够启动你选择的编码智能体,提出任何问题,获得正确的答案,并遵循开发和研究实验的最佳实践。

工作区设置完成后,你就可以启动第一次训练运行了
托管训练
托管训练让你可以在自己的环境中运行大规模训练实验,而无需担心基础设施。我们推出时支持基于 LoRA 的智能体 RL,构建在我们的 prime-rl 训练库之上。我们将在不久的将来添加对 SFT 和其他算法(例如 GEPA、GKD、DPO)的支持。
配置运行
要查看当前可用于托管训练的模型列表,请执行:

除了我们自己的 INTELLECT-3 模型之外,来自 NVIDIA、Arcee、Hugging Face、Allen AI、Z.AI、Alibaba Qwen 等组织的许多优秀的小型和大型模型也可用,还有更多即将推出。
我们还添加了实验性的多模态支持,并部署了我们的首批模型,用于在带图像输入的环境中进行训练。
运行通过一个简单的 .toml 文件进行配置:
# configs/lab/alphabet-sort.toml
model = "Qwen/Qwen3-30B-A3B-Instruct-2507"
max_steps = 100
batch_size = 512
rollouts_per_example = 16
[sampling]
max_tokens = 512
[[env]]
id = "primeintellect/alphabet-sort" # Environments Hub ID要开始训练,请运行:
prime rl run configs/alphabet-sort.toml
然后你可以通过 Lab 平台查看日志、训练结果和 rollout,或者完全以智能体原生方式在终端中查看。

完整的 Lab 文档,我们的托管训练平台,包括运行评估、部署模型用于生产等,请前往这里。
基础设施
Lab 使用了我们为训练开放前沿模型所构建的同一套底层基础设施。这包括我们的异步 RL 训练器 prime-rl、verifiers、Environments Hub、用于安全代码执行的 sandboxes,以及 hosted evaluations。
托管训练
托管训练构建于 prime-rl 之上——这是我们用于大规模异步强化学习的框架。
工作原理
prime-rl 架构的 3 个关键组件是 Trainer、Inference 和 Orchestrator。
对于托管训练,每次运行都会分配一个专用的 Orchestrator 来管理环境逻辑,而我们为 Trainer 和 Inference 管理多租户 LoRA 部署。这允许跨运行共享硬件,从而实现高效率和按 token 定价。

部署
最有趣的 AI 用例需要具备最先进能力的模型。然而,为每个客户运行专用的、经过微调的大型 Mixture of Experts 模型部署是不可行且浪费的。相反,对于我们的 Lab 平台上的生产推理,我们使用多租户 LoRA 推理部署,其定制模型构建在 NVIDIA Dynamo stack 之上。
在文档中了解更多关于如何为你的微调模型部署生产推理的信息。

下一步
这仅仅是开始。Lab 将作为我们的平台,把我们所有的研究计划产品化,并让任何人都能使用它们。我们希望 Lab 成为进行 AI 研究的默认平台,并拓宽对优化模型工具的访问。
在接下来的几周和几个月里,我们将推出 SFT 支持、用于全量微调的专用部署、在线蒸馏等等。
除此之外,我们将在冰球去向的前沿下雄心勃勃的赌注,并为我们认为最重要的问题构建基础设施,例如:
- 长时程智能体以及我们在递归语言模型(RLMs)方面的工作
- 在线强化学习与持续学习——未来属于在生产环境中学习的模型。训练和推理融合为一个单一的、连续的循环——这从根本上改变了基础设施需求。我们的技术栈通过 rollout、训练和 serving 之间的紧密集成,为这个世界而设计。
- 专业化与行为塑造
- 自动化 AI 研究与科学
问答
加入 PI discord 参与讨论、分享反馈并提出任何问题
来源:Prime Intellect Blog · primeintellect.ai