タグ
#RAPIDの記事一覧
1件の記事があります。
推論最適化
RAPIDとは?長文LLM推論をRAGとSpeculative Decodingで高速化する技術
RAPIDは、長文コンテキストLLMの推論をRAGベースのドラフト生成と推論時知識転移で高速化しつつ、応答品質まで引き上げる手法です。長文推論がなぜ遅いのか、どこでRAGが効くのか、実装の勘所まで技術的に解説します。
参照論文:RAPID: Long-Context Inference with Retrieval-Augmented Speculative Decoding