Mini-R1: Reproduce Deepseek R1 „aha moment“ a RL tutorial★ 85
Hugging Face Blog·487d ago·Tutorial
Hugging Face 的 open-r1 專案推出全新實作教學,旨在重現 DeepSeek-R1 最著名的「頓悟時刻」(自我糾錯能力)。本教學以經典的「倒數遊戲」(Countdown Game)為任務,引導讀者使用強化學習(RL)訓練小模型。透過設計精準的規則與格式獎勵,開發者能親眼見證模型在思考過程中自動發現錯誤並進行修正,是理解 R1 推理機制與 GRPO 演算法絕佳的低成本實作教材。