タグ
#MARLINの記事一覧
1件の記事があります。
推論最適化
MARLINとは?4bit量子化をバッチ推論でも高速に活かすLLM推論カーネル技術
MARLINは、4bit重み量子化の利点を単発推論だけでなく複数リクエストの同時推論でも維持するGPUカーネル技術です。なぜ既存量子化カーネルがバッチで失速するのか、仕組み、結果、実務での使い道まで日本語で整理します。
参照論文:MARLIN: Mixed-Precision Auto-Regressive Parallel Inference on Large Language Models