タグ

#トークンプルーニングの記事一覧

1件の記事があります。

推論最適化

LazyLLMとは?長文LLMの入力を動的に間引いて初回応答を速くする技術

LazyLLMは、長い入力の全トークンを最初から最後まで一律に処理せず、次の出力に効くトークンだけを段階的に残す推論最適化技術です。仕組み、実験結果、RAGや社内AIへの使い道を日本語で解説します。

参照論文:LazyLLM: Dynamic Token Pruning for Efficient Long Context LLM Inference