跳到正文
Hugging Face Blog·· 2023-08-08精选AI 评分62

用 DPO 微调 Llama 2:TRL 库实践指南

Fine-tune Llama 2 with DPO

AI 导读

Hugging Face 在 TRL 库中上线 Direct Preference Optimization(DPO)方法,并演示如何用它在 stack-exchange 偏好数据上微调 Llama v2 7B 模型。

推荐理由

Hugging Face 官方给出 DPO 在 TRL 中的完整训练流程与代码,读者可据此在自有偏好数据上复现对齐训练。

来源:Hugging Face Blog · huggingface.co