Hugging Face Blog·· 2025-08-07精选AI 评分60
TRL 为视觉语言模型加入 MPO、GRPO、GSPO 对齐支持
Vision Language Model Alignment in TRL ⚡️
AI 导读
Hugging Face 的 TRL 新增面向视觉语言模型的对齐能力,包括混合偏好优化 MPO、多模态 GRPO 以及 Qwen 提出的 GSPO,并扩展 RLOO 与 Online DPO 支持 VLM。
推荐理由
TRL 把 MPO、GRPO、GSPO 等对齐方法扩展到视觉语言模型,并给出可直接运行的训练脚本与 notebook。
来源:Hugging Face Blog · huggingface.co