跳到正文
原文
Hugging Face Blog·· 2025-01-31精选AI 评分77

Mini-R1:用GRPO复现DeepSeek R1的“顿悟时刻”强化学习教程

Mini-R1: Reproduce Deepseek R1 „aha moment“ a RL tutorial

AI 导读

Hugging Face 发布教程,使用 GRPO 算法和 Countdown Game 复现 DeepSeek R1 的推理能力。在 4x H100 上训练 Qwen2.5-3B-Instruct 模型 450 步,成功率从 25% 提升至 50%,模型从自然语言推理转向程序化执行。

推荐理由

文章提供了基于GRPO和Countdown Game复现DeepSeek R1推理能力的完整代码与训练细节,可直接迁移用于探索强化学习对齐。

来源:Hugging Face Blog · huggingface.co