タグ

#Sequoiaの記事一覧

1件の記事があります。

推論最適化

Sequoiaとは?ハードウェアに合わせてドラフト木を最適化しLLM推論を速くする技術

Sequoiaは、speculative decodingのドラフト木をモデルやGPUに合わせて最適化し、LLM推論を高速化する手法です。なぜ従来法が伸びにくかったのか、木構造の設計、検証アルゴリズム、実運用での使い道まで日本語で整理します。

参照論文:Sequoia: Scalable, Robust, and Hardware-aware Speculative Decoding