タグ
#LLMアラインメントの記事一覧
1件の記事があります。
学習・ファインチューニング
ORPOとは?参照モデルなしで選好学習を一段で進めるLLMアラインメント技術
ORPOは、参照モデルや別段のDPO工程を使わず、教師あり学習と選好最適化を一体化するLLM向け学習手法です。仕組み、実験結果、実務での使い道を日本語で解説します。
参照論文:ORPO: Monolithic Preference Optimization without Reference Model
タグ
1件の記事があります。
ORPOは、参照モデルや別段のDPO工程を使わず、教師あり学習と選好最適化を一体化するLLM向け学習手法です。仕組み、実験結果、実務での使い道を日本語で解説します。
参照論文:ORPO: Monolithic Preference Optimization without Reference Model