Prime Intellect 发布 Environments Hub,开放 RL 环境共享平台
Environments Hub: A Community Hub To Scale RL To Open AGI
Prime Intellect 推出 Environments Hub,一个面向强化学习环境的开放社区平台,用于创建、管理和共享 RL 环境与评测报告。上周私测已有 30 多位研究者和公司贡献环境,即日起向所有人开放,并提供原生支持该平台的 prime-rl 训练器以及测试版沙箱用于安全代码执行。
RL 环境是智能体学习的游乐场。到目前为止,它们一直碎片化、封闭且难以共享。我们推出 Environments Hub 来改变这一现状:一个开放的、由社区驱动的平台,为环境提供一个真正的家。
环境定义了状态、动作和奖励的世界、规则与反馈循环。从游戏到编码任务再到对话,它们是 AI 学习的语境,没有它们,RL 只是一个无处施展的算法。
环境处于当前 AI 进步的中心。每一个新环境都扩展了我们能够训练、研究和评估的范围,使开放模型更具竞争力。通过降低构建、共享和复用环境的门槛,Hub 让世界上任何人都能直接为开源 AGI 的进步做出贡献。
在上周的私测中,超过 30 位研究人员和公司向 Hub 贡献了环境。从今天起,我们向所有人开放——打造大型实验室封闭研究工具的开放替代方案,提供 RL、强化微调(RFT)、算力和推理的基础设施。我们希望确保下一波初创公司、AI 进步和采用都建立在开放轨道和开放模型之上,而不是被喂入大型实验室的围墙花园,最终巩固它们的领先地位。
动机
当前围绕 RL 环境的大多数讨论都集中在一波初创公司上,它们的商业模式是构建环境并专门出售给少数几家大型封闭实验室。
这一趋势既带来了严重的风险,也带来了机遇。如果高质量环境仍然昂贵且封闭,开源模型将进一步落后。但如果一个强大的开源环境和训练工具生态系统出现,开源就能引领最先进水平。
目前,开放研究缺乏工具来研究大型实验室认为最关键的那些问题。通过这次发布,我们旨在改变这一点。Environment Hub 以及我们围绕它构建的 RL 基础设施,旨在让下一波初创公司和 AI 进步建立在开放轨道和开放模型之上。
快速链接
功能
开发与共享环境
在 Environments Hub 上创建、管理和共享用于强化学习和评估的环境:

评估
为各种模型的环境创建和探索评估报告。

RL 训练
环境在我们的可扩展 https://github.com/PrimeIntellect-ai/prime-rl 训练器中得到原生支持。

沙箱
我们还在测试版中推出沙箱,可直接接入 Verifier Environments 以实现安全的代码执行。

贡献者
非常感谢上周测试期间的所有贡献者。特别感谢 Arcee AI、Hud.so、WhyPhy Labs、Groq,以及许多向 Hub 贡献了首个环境的个人!

随着这次发布,我们还在这里公开了一份开放和进行中的 RFC 与赏金任务列表。我们征集的任务是有意为之的。我们希望共同朝着在智能体和编码任务上构建最先进的开放 INTELLECT-3 模型而努力。
如果你想锁定其中一项任务(通过初始草稿 PR / 设计文档),请在 X 上给 Will 或 Johannes 发消息,或向 https://github.com/PrimeIntellect-ai/prime-environments 提交 PR,让我们知道。
如果你对尚未列出赏金数额的 RL 环境感兴趣,只需开口询问,我们会根据所使用的难度等级来商定方案。
我们同时开放了针对新颖环境和评估的申请。被该项目录取的研究人员将获得用于运行实验的算力、津贴以及我们内部研究团队的支持。我们尤其期待看到以下这些环境和评估的登月级示例:
- 面向智能体软件工程的稳健代码质量评估
- 评估长时间运行任务中对文件系统和内存的使用
- 面向真实多轮交互的自适应连贯指令遵循
- 高质量创意写作与风格遵循
- 带有过程批判的生成式通用奖励模型
- Harness and task design for interactive data science + machine learning, such as:
- 用于 NanoGPT 速度优化竞赛的环境
- 终端友好的数据可视化
- 研究计划生成,以近期知名论文为黄金目标
下一步:提供全栈 AGI 基础设施
在过去几个月里,我们在将智能体 RL 训练扩展到最大开源模型规模方面取得了重大进展。随着众多众包环境汇入 INTELLECT-3,我们有信心训练出一个完全开放、最先进的智能体模型。
在 INTELLECT-3 之外,我们通过 Environments Hub 的重点是让这一基础设施对所有人开放:使研究人员和初创公司都能为自己的任务训练模型、集成工具、运行强化微调(RFT),并优化智能体脚手架。我们的整个技术栈都是开源的(prime-rl),并且我们正在扩展它,使其能在我们的全球算力供应之上无缝运行。
我们相信 RL 不仅是通往 AGI 的道路,也是构建 AI 原生产品的基石。未来最成功的初创公司将通过打造契合自身需求的新颖且差异化的环境而崛起。如今,最大的障碍不是获取模型——万亿参数的智能体模型已经存在——而是大规模训练和部署它们所需的基础设施与成本。通过降低这一障碍,我们旨在让任何 AI 构建者都能以低廉、无缝的方式获得算力、推理、训练以及全栈 RL 基础设施,从而释放更多全栈 AI 初创公司和构建者的潜力。
我们的目标是为每一位研究人员和公司提供对开放 RL 基础设施技术栈的访问——而这一技术栈目前仍被封闭实验室的高墙所锁住。
如果你热衷于帮助塑造一个真正自主的开源 AI 生态系统的未来,我们很乐意听到你的声音,并邀请研究人员和公司:
问答
加入 PI discord 参与讨论、分享反馈并提出任何问题 :)
来源:Prime Intellect Blog · primeintellect.ai