タグ
#CacheGenの記事一覧
1件の記事があります。
推論最適化
CacheGenとは?KVキャッシュを圧縮して長文LLMを速くする技術
CacheGenは、長文入力で再利用するKVキャッシュを圧縮・分割配信して、LLMの文脈読み込み遅延を減らす技術です。仕組み、実験結果、RAGや社内AIへの使い道を日本語で解説します。
参照論文:CacheGen: KV Cache Compression and Streaming for Fast Large Language Model Serving