タグ

#LLMサービングの記事一覧

1件の記事があります。

推論最適化

CacheGenとは?KVキャッシュを圧縮して長文LLMを速くする技術

CacheGenは、長文入力で再利用するKVキャッシュを圧縮・分割配信して、LLMの文脈読み込み遅延を減らす技術です。仕組み、実験結果、RAGや社内AIへの使い道を日本語で解説します。

参照論文:CacheGen: KV Cache Compression and Streaming for Fast Large Language Model Serving