タグ
#Multi-Head Latent Attentionの記事一覧
1件の記事があります。
推論最適化
Multi-Head Latent Attentionとは?KVキャッシュを大幅圧縮して長文推論を軽くする注意機構
Multi-Head Latent Attentionは、TransformerのKVキャッシュを低ランク潜在表現に圧縮し、推論メモリを大きく減らしながら性能も維持しやすくした注意機構です。DeepSeek-V2論文をもとに、仕組み、結果、実装上の意味を日本語で解説します。
参照論文:DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model