vLLM 社区发布 RL 后训练框架 vime
Announcing vime: A Simple, Stable, and Efficient RL Framework for LLMs
vLLM 社区发布 LLM 后训练框架 vime,基于 slime 训练栈,把 Megatron 训练与 vLLM 推理接入同一条 RL 流水线,采用训练、rollout、数据缓冲三段解耦设计。
vLLM 生态新增 RL 后训练框架,给出架构、硬件对比数据和路线图,便于评估训练与推理一体的落地路径。
我们很高兴推出 vime,这是 vLLM 生态系统中的一个 LLM 后训练框架。基于 slime 的训练栈和数据生成设计,vime 将 Megatron 和 vLLM 连接成一个统一的 RL 流水线,使分布式训练和推理能够在同一架构下可靠运行。
slime 已证明自己是 RL 后训练的强大工程范式:开放、轻量且高效。vime 将 vLLM 生态系统引入 slime,把 slime 的训练栈与 vLLM 的推理优势结合成一条简单、稳定且高效的主流水线——提供稳定的训推对齐、灵活的部署模式和全栈 GPU 支持。
我们的愿景
兼具久经考验的可信度与开源基因的 RL 框架一直很稀缺。slime 在 GLM 等模型上得到验证,是其中的代表:开放、轻量、简洁且高效。但它并未原生集成 vLLM 后端。与此同时,vLLM 是社区中最活跃的推理引擎,将前沿技术与多平台生态和快速迭代结合在一起。
vime 的使命是将 slime 的训练设计与 vLLM 的推理优势连接成一条简单、稳定且高效的流水线。开发者不应在单一硬件栈、训练稳定性和推理性能之间做取舍。
定位
vLLM 社区支持广泛的 LLM 后训练框架,包括(按字母顺序)NeMo RL、OpenRLHF、verl 等。我们构建 vime,是为了将 slime 经过验证的训练范式无缝引入 vLLM 生态系统,提供一个生产就绪的桥梁,使两个项目的快速发布周期保持一致。
我们希望不同需求的用户都能为自己的工作流找到合适的 vLLM 生态选择。vLLM 社区将继续支持更广泛后训练生态系统中的 vLLM 集成。
架构概览
vime 采用 slime 的三阶段解耦训推设计,关键区别在于 rollout 后端被替换为 vLLM:
- 训练(Megatron):主训练循环,负责参数更新并将权重同步到 rollout 侧。
- Rollout(vLLM + Router):推理采样,生成带有奖励或验证器信号的训练样本。
- 数据缓冲区:连接训练侧和 rollout 侧,管理提示注入和自定义 rollout 逻辑。

关键能力
- 易于使用:参数系统继承 slime 和 Megatron 的约定,vLLM 侧参数通过
--vllm-前缀传入。默认 rollout 入口点是vime.rollout.vllm_rollout。 - 稳定的训推对齐:在典型的 Dense 和 MoE 场景中,
train_rollout_logprob_abs_diff在长时间运行中保持在可控范围内。对于 MoE,R3(路由重放)进一步减少训推不匹配。 - 算法与模型覆盖:GRPO 和 PPO 等 RL 算法,以及 Qwen3 Dense/MoE 和 GLM-4.5 等模型,均附带端到端示例和 CI 验证路径。
- 多硬件支持:在框架层面,训练资源、rollout 资源和集群拓扑被统一抽象,使得随着 vLLM 生态支持的发展,更容易在不同硬件后端上复用同一套 RL 流水线。
验证与基准测试
对于 Qwen3-30B-A3B 在 8-GPU colocate、dapo-math-17k 和 GRPO 下,GB200 的平均步时间约为 147 秒,而 H200 的平均步时间约为 252 秒。在同一框架下,GB200 的端到端步速约为 H200 的 1.72 倍。

我们还在跨硬件的代表性工作负载上验证了训练-推理一致性和端到端功能。
A100 上的 Qwen3-4B
对于 A100 上的 Qwen3-4B,在 GRPO、4 训练 + 4 推理非 colocate 和 gsm8k 下,vime 的 train_rollout_logprob_abs_diff 在整个训练过程中稳定在 0.011 左右。基线随着训练推进持续漂移到约 0.77,而 vime 提供了更稳定的训练-推理对齐。

带 R3 的 Qwen3-30B-A3B MoE
对于 A100 上的 Qwen3-30B-A3B MoE,使用 4 个训练 GPU、4 个推理 GPU、dapo-math-17k 和 EP=4,启用 vime 的 R3 路由重放将 logprob diff 从约 0.019 降低到约 0.013,显著减少了 MoE 训练-推理不匹配。

GB200 上的 Qwen3-30B-A3B MoE
对于 GB200 上的 Qwen3-30B-A3B MoE,使用 8-GPU colocate 和 dapo-math-17k,vime 和基线的 raw_reward 曲线紧密对齐。两者都将 train_rollout_logprob_abs_diff 稳定在 0.018 左右,没有持续的基线侧漂移。

GB200 上的 GLM-4.5-Air
对于 GB200 上的 GLM-4.5-Air,使用 GRPO、8-GPU colocate 和 dapo-math-17k,raw_reward 在 100 步内呈上升趋势,均值约为 0.56。train_rollout_logprob_abs_diff 保持在 0.02-0.03 范围内,均值约为 0.028,表明训练-推理对齐良好。

路线图
vime 仍在快速发展,路线图聚焦于三个领域:
- 更深入的 vLLM 集成:持续采用新的 vLLM 能力,如 Router、PD 分离、FP8 和多模型服务。
- 多硬件扩展:沿 vLLM 的硬件插件系统扩展后端,使 vime 能在更多加速器和集群配置上高效运行。
- 训练效率与算法:全异步流水线、训练-推理不匹配校正、用于多轮工具调用和多智能体设置的 Agentic RL,以及快速跟进 MoE 和 VLM 等新架构。
快速开始
入门路径与 slime 类似:配置 Megatron 训练资源和 vLLM rollout 资源,准备检查点和数据,然后启动 train.py 或 train_async.py。
- 文档:快速开始
- 示例:
scripts/和examples/目录涵盖 Qwen3-4B、Qwen3-30B-A3B MoE 和 GLM-4.5-Air 等场景。
vime 由 vLLM 社区维护,在 Apache 2.0 下开源,并建立在 slime、Megatron-LM 和 vLLM 等项目的肩膀上。
- 代码和文档:github.com/vllm-project/vime
- 贡献:欢迎提交 Issue 和 PR。Pre-commit 可保持代码风格一致。
- 反馈:在 GitHub 上分享你的使用体验、性能数据和功能建议。
简洁的架构、稳定的行为、高效的性能:vime 旨在为更多开发者铺就 RL 后训练的主流程。加入我们,帮助将这一流程带到更多场景。
致谢
贡献者:Ao Shen、kaiyuan、princepride、Dakai An、knlnguyen1802、gcanlin、SamitHuang 和 Meihan-chen。
我们感谢 slime、Megatron-LM 和 vLLM 项目的维护者所做的开创性工作。我们还要感谢 Kaichao You、Roger Wang、Hongsheng Liu 和 Xiyuan Wang 对 vime 项目的支持以及为组织该项目所做的贡献。
来源:vLLM Blog · vllm.ai