タグ

#GRPOの記事一覧

1件の記事があります。

学習・ファインチューニング

GRPOとは?報酬比較だけでLLMを強化学習しやすくする省メモリ学習手法

GRPOは、PPOのような価値モデルを持たずに、同じ質問に対する複数回答の相対評価からLLMを強化学習する手法です。仕組み、実験結果、実務での使い道を日本語で解説します。

参照論文:DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models