タグ
#推論最適化の記事一覧
1件の記事があります。
推論最適化
Mixture-of-Recursionsとは?共有レイヤーと動的再帰でLLMの計算量を減らす仕組み
Mixture-of-Recursionsは、LLMの重み共有とトークンごとの可変計算を組み合わせて、少ないパラメータと計算資源で高い性能を狙う技術です。再帰的に同じブロックを使い回しつつ、難しいトークンだけ深く処理する仕組み、実験結果、開発への活かし方を日本語で解説します。
参照論文:Mixture-of-Recursions: Learning Dynamic Recursive Depths for Adaptive Token-Level Computation