タグ

#LLM推論最適化の記事一覧

5件の記事があります。

推論最適化

MARLINとは?4bit量子化をバッチ推論でも高速に活かすLLM推論カーネル技術

MARLINは、4bit重み量子化の利点を単発推論だけでなく複数リクエストの同時推論でも維持するGPUカーネル技術です。なぜ既存量子化カーネルがバッチで失速するのか、仕組み、結果、実務での使い道まで日本語で整理します。

参照論文:MARLIN: Mixed-Precision Auto-Regressive Parallel Inference on Large Language Models

推論最適化

FlashDecoding++とは?LLM推論のsoftmax同期とFlat GEMMの無駄を減らしてGPU推論を速くする技術

FlashDecoding++は、LLM推論で発生するsoftmax同期、Flat GEMMの計算浪費、静的データフローの非効率をまとめて改善する推論エンジンです。どこが遅いのか、どう直すのか、実運用で何に効くのかを技術的に整理します。

参照論文:FlashDecoding++: Faster Large Language Model Inference on GPUs

推論最適化

Sequoiaとは?ハードウェアに合わせてドラフト木を最適化しLLM推論を速くする技術

Sequoiaは、speculative decodingのドラフト木をモデルやGPUに合わせて最適化し、LLM推論を高速化する手法です。なぜ従来法が伸びにくかったのか、木構造の設計、検証アルゴリズム、実運用での使い道まで日本語で整理します。

参照論文:Sequoia: Scalable, Robust, and Hardware-aware Speculative Decoding

推論最適化

Multi-Head Latent Attentionとは?KVキャッシュを大幅圧縮して長文推論を軽くする注意機構

Multi-Head Latent Attentionは、TransformerのKVキャッシュを低ランク潜在表現に圧縮し、推論メモリを大きく減らしながら性能も維持しやすくした注意機構です。DeepSeek-V2論文をもとに、仕組み、結果、実装上の意味を日本語で解説します。

参照論文:DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model

推論最適化

H2Oとは?KVキャッシュを圧縮して長文LLM推論を高速化するHeavy-Hitter保持手法

H2Oは、LLM推論で増え続けるKVキャッシュの中から重要トークンと直近トークンを残すことで、精度を保ちながらメモリ使用量とレイテンシを抑える推論最適化手法です。仕組み、実験結果、実務での使い道を日本語で解説します。

参照論文:H2O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models