タグ
#トークンプルーニングの記事一覧
1件の記事があります。
推論最適化
LazyLLMとは?長文LLMの入力を動的に間引いて初回応答を速くする技術
LazyLLMは、長い入力の全トークンを最初から最後まで一律に処理せず、次の出力に効くトークンだけを段階的に残す推論最適化技術です。仕組み、実験結果、RAGや社内AIへの使い道を日本語で解説します。
参照論文:LazyLLM: Dynamic Token Pruning for Efficient Long Context LLM Inference