タグ
#DeepSeekMathの記事一覧
1件の記事があります。
学習・ファインチューニング
GRPOとは?報酬比較だけでLLMを強化学習しやすくする省メモリ学習手法
GRPOは、PPOのような価値モデルを持たずに、同じ質問に対する複数回答の相対評価からLLMを強化学習する手法です。仕組み、実験結果、実務での使い道を日本語で解説します。
参照論文:DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models