跳到正文
vLLM Blog· vime Contributors and the vLLM Team·· 2026-06-09精选AI 评分62

vLLM 社区发布 RL 后训练框架 vime

Announcing vime: A Simple, Stable, and Efficient RL Framework for LLMs

AI 导读

vLLM 社区发布 LLM 后训练框架 vime,基于 slime 训练栈,把 Megatron 训练与 vLLM 推理接入同一条 RL 流水线,采用训练、rollout、数据缓冲三段解耦设计。

推荐理由

vLLM 生态新增 RL 后训练框架,给出架构、硬件对比数据和路线图,便于评估训练与推理一体的落地路径。

正文 · AI 翻译

我们很高兴推出 vime,这是 vLLM 生态系统中的一个 LLM 后训练框架。基于 slime 的训练栈和数据生成设计,vime 将 Megatron 和 vLLM 连接成一个统一的 RL 流水线,使分布式训练和推理能够在同一架构下可靠运行。

slime 已证明自己是 RL 后训练的强大工程范式:开放、轻量且高效。vime 将 vLLM 生态系统引入 slime,把 slime 的训练栈与 vLLM 的推理优势结合成一条简单、稳定且高效的主流水线——提供稳定的训推对齐、灵活的部署模式和全栈 GPU 支持。

我们的愿景

兼具久经考验的可信度与开源基因的 RL 框架一直很稀缺。slime 在 GLM 等模型上得到验证,是其中的代表:开放、轻量、简洁且高效。但它并未原生集成 vLLM 后端。与此同时,vLLM 是社区中最活跃的推理引擎,将前沿技术与多平台生态和快速迭代结合在一起。

vime 的使命是将 slime 的训练设计与 vLLM 的推理优势连接成一条简单、稳定且高效的流水线。开发者不应在单一硬件栈、训练稳定性和推理性能之间做取舍。

定位

vLLM 社区支持广泛的 LLM 后训练框架,包括(按字母顺序)NeMo RL、OpenRLHF、verl 等。我们构建 vime,是为了将 slime 经过验证的训练范式无缝引入 vLLM 生态系统,提供一个生产就绪的桥梁,使两个项目的快速发布周期保持一致。

我们希望不同需求的用户都能为自己的工作流找到合适的 vLLM 生态选择。vLLM 社区将继续支持更广泛后训练生态系统中的 vLLM 集成。

架构概览

vime 采用 slime 的三阶段解耦训推设计,关键区别在于 rollout 后端被替换为 vLLM:

  • 训练(Megatron):主训练循环,负责参数更新并将权重同步到 rollout 侧。
  • Rollout(vLLM + Router):推理采样,生成带有奖励或验证器信号的训练样本。
  • 数据缓冲区:连接训练侧和 rollout 侧,管理提示注入和自定义 rollout 逻辑。
vime connects Megatron training with vLLM-powered rollout through a decoupled data buffer.
vime 通过解耦的数据缓冲区将 Megatron 训练与 vLLM 驱动的 rollout 连接起来。

关键能力

  • 易于使用:参数系统继承 slime 和 Megatron 的约定,vLLM 侧参数通过 --vllm- 前缀传入。默认 rollout 入口点是 vime.rollout.vllm_rollout。
  • 稳定的训推对齐:在典型的 Dense 和 MoE 场景中,train_rollout_logprob_abs_diff 在长时间运行中保持在可控范围内。对于 MoE,R3(路由重放)进一步减少训推不匹配。
  • 算法与模型覆盖:GRPO 和 PPO 等 RL 算法,以及 Qwen3 Dense/MoE 和 GLM-4.5 等模型,均附带端到端示例和 CI 验证路径。
  • 多硬件支持:在框架层面,训练资源、rollout 资源和集群拓扑被统一抽象,使得随着 vLLM 生态支持的发展,更容易在不同硬件后端上复用同一套 RL 流水线。

验证与基准测试

对于 Qwen3-30B-A3B 在 8-GPU colocate、dapo-math-17k 和 GRPO 下,GB200 的平均步时间约为 147 秒,而 H200 的平均步时间约为 252 秒。在同一框架下,GB200 的端到端步速约为 H200 的 1.72 倍。

Qwen3-30B-A3B vime step speed on GB200 and H200.
Qwen3-30B-A3B vime 在 GB200 和 H200 上的步速。

我们还在跨硬件的代表性工作负载上验证了训练-推理一致性和端到端功能。

A100 上的 Qwen3-4B

对于 A100 上的 Qwen3-4B,在 GRPO、4 训练 + 4 推理非 colocate 和 gsm8k 下,vime 的 train_rollout_logprob_abs_diff 在整个训练过程中稳定在 0.011 左右。基线随着训练推进持续漂移到约 0.77,而 vime 提供了更稳定的训练-推理对齐。

Qwen3-4B vime versus baseline training behavior.
Qwen3-4B vime 与基线的训练行为对比。

带 R3 的 Qwen3-30B-A3B MoE

对于 A100 上的 Qwen3-30B-A3B MoE,使用 4 个训练 GPU、4 个推理 GPU、dapo-math-17k 和 EP=4,启用 vime 的 R3 路由重放将 logprob diff 从约 0.019 降低到约 0.013,显著减少了 MoE 训练-推理不匹配。

R3 routing replay reduces train-inference mismatch for Qwen3-30B-A3B MoE.
R3 路由重放减少了 Qwen3-30B-A3B MoE 的训练-推理不匹配。

GB200 上的 Qwen3-30B-A3B MoE

对于 GB200 上的 Qwen3-30B-A3B MoE,使用 8-GPU colocate 和 dapo-math-17k,vime 和基线的 raw_reward 曲线紧密对齐。两者都将 train_rollout_logprob_abs_diff 稳定在 0.018 左右,没有持续的基线侧漂移。

Qwen3-30B-A3B MoE on GB200 shows stable alignment in colocated training and rollout.
GB200 上的 Qwen3-30B-A3B MoE 在 colocate 训练和 rollout 中显示出稳定的对齐。

GB200 上的 GLM-4.5-Air

对于 GB200 上的 GLM-4.5-Air,使用 GRPO、8-GPU colocate 和 dapo-math-17k,raw_reward 在 100 步内呈上升趋势,均值约为 0.56。train_rollout_logprob_abs_diff 保持在 0.02-0.03 范围内,均值约为 0.028,表明训练-推理对齐良好。

GLM-4.5-Air on GB200 maintains stable logprob alignment while reward improves.
GB200 上的 GLM-4.5-Air 在奖励提升的同时保持稳定的 logprob 对齐。

路线图

vime 仍在快速发展,路线图聚焦于三个领域:

  • 更深入的 vLLM 集成:持续采用新的 vLLM 能力,如 Router、PD 分离、FP8 和多模型服务。
  • 多硬件扩展:沿 vLLM 的硬件插件系统扩展后端,使 vime 能在更多加速器和集群配置上高效运行。
  • 训练效率与算法:全异步流水线、训练-推理不匹配校正、用于多轮工具调用和多智能体设置的 Agentic RL,以及快速跟进 MoE 和 VLM 等新架构。

快速开始

入门路径与 slime 类似:配置 Megatron 训练资源和 vLLM rollout 资源,准备检查点和数据,然后启动 train.py 或 train_async.py。

  • 文档:快速开始
  • 示例:scripts/ 和 examples/ 目录涵盖 Qwen3-4B、Qwen3-30B-A3B MoE 和 GLM-4.5-Air 等场景。

vime 由 vLLM 社区维护,在 Apache 2.0 下开源,并建立在 slime、Megatron-LM 和 vLLM 等项目的肩膀上。

  • 代码和文档:github.com/vllm-project/vime
  • 贡献:欢迎提交 Issue 和 PR。Pre-commit 可保持代码风格一致。
  • 反馈:在 GitHub 上分享你的使用体验、性能数据和功能建议。

简洁的架构、稳定的行为、高效的性能:vime 旨在为更多开发者铺就 RL 后训练的主流程。加入我们,帮助将这一流程带到更多场景。

致谢

贡献者:Ao Shen、kaiyuan、princepride、Dakai An、knlnguyen1802、gcanlin、SamitHuang 和 Meihan-chen。

我们感谢 slime、Megatron-LM 和 vLLM 项目的维护者所做的开创性工作。我们还要感谢 Kaichao You、Roger Wang、Hongsheng Liu 和 Xiyuan Wang 对 vime 项目的支持以及为组织该项目所做的贡献。

来源:vLLM Blog · vllm.ai