タグ
#長文推論の記事一覧
2件の記事があります。
推論最適化
LazyLLMとは?長文LLMの入力を動的に間引いて初回応答を速くする技術
LazyLLMは、長い入力の全トークンを最初から最後まで一律に処理せず、次の出力に効くトークンだけを段階的に残す推論最適化技術です。仕組み、実験結果、RAGや社内AIへの使い道を日本語で解説します。
参照論文:LazyLLM: Dynamic Token Pruning for Efficient Long Context LLM Inference
推論最適化
SnapKVとは?長文LLMのKVキャッシュを圧縮して高速化する技術
SnapKVは、長文入力で肥大化するKVキャッシュを、観測ウィンドウから重要トークンを選んで圧縮する推論最適化技術です。仕組み、実験結果、RAGや長文エージェントへの使い道を日本語で解説します。
参照論文:SnapKV: LLM Knows What You are Looking for Before Generation