タグ

#SpecInferの記事一覧

1件の記事があります。

推論最適化

SpecInferとは?トークン木でLLM推論を高速化する投機的デコーディング手法

SpecInferは、小さな補助モデルが作る候補列をトークン木としてまとめ、大規模LLMでまとめて検証する推論高速化手法です。通常の speculative decoding との違い、仕組み、実験結果、使い道を日本語で整理します。

参照論文:SpecInfer: Accelerating Generative Large Language Model Serving with Tree-based Speculative Inference and Verification