跳到正文
Hugging Face Blog·· 2025-02-02精选AI 评分66

Open-R1 更新:复现 DeepSeek-R1 评测与训练管线进展

Open-R1: Update #1

AI 导读

Hugging Face 的 Open-R1 项目发布首周进展,在 MATH-500 上复现了 DeepSeek-R1 蒸馏系列模型的评测分数,例如 DeepSeek-R1-Distill-Qwen-32B 得 95.0、DeepSeek-R1-Distill-Llama-70B 得 93.4。

推荐理由

Open-R1 一周内复现了 DeepSeek-R1 蒸馏模型的 MATH-500 评测分数,并公开了合成数据生成与 GRPO 训练的工程细节。

来源:Hugging Face Blog · huggingface.co