タグ
#推論モデルの記事一覧
1件の記事があります。
学習・ファインチューニング
DeepSeek-R1とは?正解で検証できる報酬からLLMの推論能力を伸ばす強化学習技術
DeepSeek-R1は、人手で書かれた思考過程を大量に模倣するのではなく、数学・コード・論理のように正解を検証できるタスクの報酬でLLMの推論能力を伸ばす技術です。GRPO、ルールベース報酬、多段階学習、蒸留、実験結果、開発への応用を解説します。
参照論文:DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning