タグ
#推論最適化の記事一覧
3件の記事があります。
推論最適化
テスト時スケーリングとは?小さいLLMでも追加推論で性能を伸ばす考え方と使いどころ
テスト時スケーリングは、モデルを大きくする代わりに推論時の計算を賢く増やして回答品質を高める考え方です。難しい問題にだけ追加計算を配分する仕組み、検証器や自己修正の役割、開発への応用ポイントを日本語で解説します。
参照論文:Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters
推論最適化
Chain of Draftとは?推論の途中メモを短くしてLLMの精度を保ちながらコストと遅延を下げる技術
Chain of Draftは、LLMに長い思考文を書かせる代わりに、短い下書きだけで推論させる手法です。Chain-of-Thoughtの精度をなるべく保ちながら、推論トークン数と応答遅延を大きく減らす仕組みと使い道を解説します。
参照論文:Chain of Draft: Thinking Faster by Writing Less
推論最適化
Mixture-of-Recursionsとは?共有レイヤーと動的再帰でLLMの計算量を減らす仕組み
Mixture-of-Recursionsは、LLMの重み共有とトークンごとの可変計算を組み合わせて、少ないパラメータと計算資源で高い性能を狙う技術です。再帰的に同じブロックを使い回しつつ、難しいトークンだけ深く処理する仕組み、実験結果、開発への活かし方を日本語で解説します。
参照論文:Mixture-of-Recursions: Learning Dynamic Recursive Depths for Adaptive Token-Level Computation