タグ

#LLM推論高速化の記事一覧

1件の記事があります。

推論最適化

EAGLEとは?LLM推論を高速化する特徴予測ベースのSpeculative Sampling

EAGLEは、トークンではなく中間特徴を先読みし、元のLLMが検証することで高速化する推論最適化技術です。Speculative Samplingとの違い、仕組み、実験結果、実務での使い道を日本語で解説します。

参照論文:EAGLE: Speculative Sampling Requires Rethinking Feature Uncertainty