タグ

#RAPIDの記事一覧

1件の記事があります。

推論最適化

RAPIDとは?長文LLM推論をRAGとSpeculative Decodingで高速化する技術

RAPIDは、長文コンテキストLLMの推論をRAGベースのドラフト生成と推論時知識転移で高速化しつつ、応答品質まで引き上げる手法です。長文推論がなぜ遅いのか、どこでRAGが効くのか、実装の勘所まで技術的に解説します。

参照論文:RAPID: Long-Context Inference with Retrieval-Augmented Speculative Decoding