タグ
#Sequoiaの記事一覧
1件の記事があります。
推論最適化
Sequoiaとは?ハードウェアに合わせてドラフト木を最適化しLLM推論を速くする技術
Sequoiaは、speculative decodingのドラフト木をモデルやGPUに合わせて最適化し、LLM推論を高速化する手法です。なぜ従来法が伸びにくかったのか、木構造の設計、検証アルゴリズム、実運用での使い道まで日本語で整理します。
参照論文:Sequoia: Scalable, Robust, and Hardware-aware Speculative Decoding