Prime Intellect 发布 Lab 训练平台,面向自我改进智能体正式开放
Releasing Lab: the training platform for self-improving agents
Prime Intellect 的 Lab 训练平台结束 beta 正式开放,把任务定义、harness、评测、强化学习训练、rollout 检查和 adapter 部署整合到一处。
发布 Lab:面向自我改进智能体的训练平台
今天,Lab 结束测试阶段,正式向所有人开放。
Lab 是我们面向自我改进智能体的训练平台。它将智能体模型改进的完整闭环汇聚于一处:指定任务、定义执行框架、评估模型、基于奖励信号训练、检查 rollout、部署适配器,以及运行推理。
你提供任务。Lab 负责训练栈。

该平台包括:
我们今年早些时候以测试版推出 Lab,基于一个前提:每家人工智能公司都应能拥有自己的从模型到产品的优化闭环。自那以后,数百名研究人员、初创公司和前沿团队已在该平台上运行了超过 10,000 个训练任务——涵盖数学、代码、浏览器、游戏、客户支持、长时程智能体,以及一些我们此前未曾见过的企业工作流。他们构建了我们未曾想到的环境,训练了我们不知如何定义规格的模型。
今天,它正式上线。
环境是改进的基本单元
Lab 围绕环境构建。一个环境打包了在任务上运行模型并评估其性能所需的一切:
- 一组任务,包括数据、工具和模拟器
- 模型的执行框架,包含沙箱、上下文管理和自定义程序
- 定义成功标准的奖励指标
这是 Lab 背后的关键抽象。环境可以互换地用于本地开发、托管评估、合成数据生成、提示优化和强化学习。
一个环境可以是数学基准、代码修复任务、浏览器工作流、游戏、客户支持模拟、内部业务流程或长时程研究智能体。
自带执行框架。将你的数据转化为训练任务。定义你自己的成功标准。部署自我改进的智能体。
托管训练
托管训练在你的环境中运行大规模强化学习。我们管理训练节点、rollout 推理、编排、调度、自动扩缩容和权重同步。
一次运行通过一个小型 TOML 文件进行配置:
model = "Qwen/Qwen3.5-0.8B"
max_steps = 100
batch_size = 128
rollouts_per_example = 8
[sampling]
max_tokens = 2048
[[env]]
id = "primeintellect/reverse-text"然后从 CLI 启动它:
prime train configs/rl/reverse-text.tomlLab 为你的运行启动一个专用编排器,通过你的环境驱动 rollout,用你的评分标准对轨迹打分,并使用我们的开源 prime-rl 训练器训练一个 LoRA 适配器。推理工作节点随训练进展而更新,因此 rollout 始终来自最新权重。
该架构在训练和推理上均为多租户,这使我们能够按 token 而非按集群小时为运行定价。你为实际推动模型的 token 付费——而不是为你预留却未使用的 GPU 时间付费。
在正式版中,托管训练推出时支持来自 NVIDIA、OpenAI、Meta 和 Qwen 的 14 个模型,参数量在 1B 到 70B 之间。该阵容涵盖稠密和 MoE 架构、推理和非推理模式、文本和图像模态。未来几周将有更多提供商和更大的模型上线。

评估、训练、检查、部署
训练只有融入迭代循环才有用。Lab 连接每个阶段。
从基线评估开始。使用 Prime 推理或任何 OpenAI 兼容端点,针对基础模型运行你的环境。检查每个样本的输出、奖励曲线和评分标准细分。
然后开始训练。Hosted Training 会将日志、指标、奖励分布、rollout 样本、检查点和适配器状态流式传回平台。你可以从仪表盘或终端进行监控:
prime train logs <run-id> -f
prime train metrics <run-id>
prime train rollouts <run-id>当运行完成后,通过 Prime Inference 部署训练好的 LoRA 适配器:
prime deployments create <adapter-id>你的适配器将通过 OpenAI 兼容的 API 提供,使用你已经在用的相同应用代码和 SDK。
这就是 Lab 所构建的循环:评估当前模型,从真实任务中收集奖励信号,训练更好的适配器,部署它,然后重复。
从 Beta 到 GA
在 beta 期间,数百名用户测试了 Lab,并在研究、基准测试、游戏、编码环境、浏览器任务和企业工作流中运行了超过 10,000 次训练。
我们还与领先的企业和科技公司直接合作,探讨同一个问题:如何将生产工作转化为自我改进的飞轮?
答案不是通用的微调任务。而是一个围绕你自己的数据、工具、任务和奖励信号的可重复循环。Lab 为团队提供了运行该循环的基础设施,而无需先重建平台栈。
接下来是什么
在接下来的几周里,我们将展示 Lab 所解锁的训练工作流、研究方向和实际应用:浏览器和计算机使用代理、长时程编码任务、在线评估、多模态环境、提示优化、模型蒸馏和企业生产循环。
我们还将邀请社区直接参与平台上的协作研究工作。Lab 是我们构建 Open Superintelligence Stack 更广泛使命的一部分:开放基础设施、开放环境、开放模型,以及为使用它们构建的人们提供可访问的训练系统。
如果你想今天就试用 Lab,从这里开始:
Lab 现已正式可用。开始训练自我改进的代理。
来源:Prime Intellect Blog · primeintellect.ai