跳到正文
Hugging Face Blog·· 2025-01-31精选AI 评分62

Mini-R1:用 GRPO 和 Countdown Game 复现 DeepSeek R1 的 aha moment

Mini-R1: Reproduce Deepseek R1 „aha moment“ a RL tutorial

AI 导读

这篇教程用 GRPO 和 Countdown Game 复现 DeepSeek R1 的 aha moment,基于 Qwen2.5-3B-Instruct 在 4x H100 上训练,450 步后解题成功率达 50%。

推荐理由

完整复现流程与训练观察记录,可看到小模型在 RL 下从文字推理转向程序化求解的过程。

来源:Hugging Face Blog · huggingface.co