タグ

#LLMアラインメントの記事一覧

1件の記事があります。

学習・ファインチューニング

ORPOとは?参照モデルなしで選好学習を一段で進めるLLMアラインメント技術

ORPOは、参照モデルや別段のDPO工程を使わず、教師あり学習と選好最適化を一体化するLLM向け学習手法です。仕組み、実験結果、実務での使い道を日本語で解説します。

参照論文:ORPO: Monolithic Preference Optimization without Reference Model