跳到正文
  1. Hugging Face Blog62

    OpenEnv 实践:在真实环境中评测工具型智能体

    Meta 与 Hugging Face 联合推出开源框架 OpenEnv,用于让智能体连接真实工具与 API 而非模拟环境,采用 Gym 风格 API 和标准 MCP 工具调用接口。

    推荐理由:Meta 与 Hugging Face 的 OpenEnv 框架及 Turing 日历环境给出了工具型智能体在权限与多步流程下的实测数据,可据此判断真实环境评测的难点。

  1. Hugging Face Blog62

    用 DPO 微调 Llama 2:TRL 库实践指南

    Hugging Face 在 TRL 库中上线 Direct Preference Optimization(DPO)方法,并演示如何用它在 stack-exchange 偏好数据上微调 Llama v2 7B 模型。

    推荐理由:Hugging Face 官方给出 DPO 在 TRL 中的完整训练流程与代码,读者可据此在自有偏好数据上复现对齐训练。

  1. Hugging Face Blog62

    StackLLaMA:用 RLHF 训练 LLaMA 的实操指南

    Hugging Face 发布 StackLLaMA 模型及完整 RLHF 训练流程,用 LLaMA 7B 在 Stack Exchange 问答数据上依次完成监督微调、奖励建模和 PPO 强化学习,训练管线已集成到 TRL 库。

    推荐理由:Hugging Face 公开了用 RLHF 训练 LLaMA 的完整流程与代码,读者可据此复现或迁移到自己的模型对齐任务。

已经到底了