Hugging Face Blog·· 2025-04-26精选AI 评分62
ServiceNow 开源 PipelineRL:用 inflight 权重更新兼顾推理吞吐与 on-policy 训练
PipelineRL
AI 导读
ServiceNow 开源实验性 RL 实现 PipelineRL,核心是在 RL 训练中做 inflight 权重更新,推理不中断即可接收新权重,从而维持高推理吞吐并减少 rollout 权重与最新模型权重之间的滞后。
推荐理由
原文给出开源仓库与训练契约设计,读者可据此判断大规模 RL 训练中吞吐与 on-policy 数据如何兼顾。
来源:Hugging Face Blog · huggingface.co