タグ
#RAG高速化の記事一覧
1件の記事があります。
推論最適化
LLMAとは?参照文を使ってLLM推論を無損失で高速化する仕組み
LLMAは、RAGの検索文書や過去の会話ログといった参照文を利用し、LLMの出力と重なる部分をまとめて検証することで推論を高速化する手法です。追加のドラフトモデルなしで2倍超の高速化を狙う考え方を、論文ベースで日本語解説します。
参照論文:Inference with Reference: Lossless Acceleration of Large Language Models