タグ
#SpecInferの記事一覧
1件の記事があります。
推論最適化
SpecInferとは?トークン木でLLM推論を高速化する投機的デコーディング手法
SpecInferは、小さな補助モデルが作る候補列をトークン木としてまとめ、大規模LLMでまとめて検証する推論高速化手法です。通常の speculative decoding との違い、仕組み、実験結果、使い道を日本語で整理します。
参照論文:SpecInfer: Accelerating Generative Large Language Model Serving with Tree-based Speculative Inference and Verification