タグ

#強化学習の記事一覧

2件の記事があります。

学習・ファインチューニング

DeepSeek-R1とは?正解で検証できる報酬からLLMの推論能力を伸ばす強化学習技術

DeepSeek-R1は、人手で書かれた思考過程を大量に模倣するのではなく、数学・コード・論理のように正解を検証できるタスクの報酬でLLMの推論能力を伸ばす技術です。GRPO、ルールベース報酬、多段階学習、蒸留、実験結果、開発への応用を解説します。

参照論文:DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

AIエージェント

Agent Lightning v1.0とは?実運用のAIエージェントをハーネスごと強化学習で改善する技術

Agent Lightning v1.0は、AIエージェントの実行ハーネスを訓練フレームワークへ作り直さず、LLM API境界で観測したリクエストと応答から強化学習するための軽量フレームワークです。仕組み、課題、実験結果、開発への応用を解説します。

参照論文:Agent Lightning v1.0: Towards Harnessed Agentic RL