タグ
#Long Contextの記事一覧
4件の記事があります。
YaRNとは?RoPEでLLMのコンテキスト長を低コストに拡張する技術
YaRNは、RoPEベースの大規模言語モデルのコンテキスト長を少ない追加学習で大きく伸ばす手法です。なぜ長文で崩れるのか、Position Interpolationとの違い、実装上の工夫、実務での使い道まで技術的に解説します。
参照論文:YaRN: Efficient Context Window Extension of Large Language Models
RAPIDとは?長文LLM推論をRAGとSpeculative Decodingで高速化する技術
RAPIDは、長文コンテキストLLMの推論をRAGベースのドラフト生成と推論時知識転移で高速化しつつ、応答品質まで引き上げる手法です。長文推論がなぜ遅いのか、どこでRAGが効くのか、実装の勘所まで技術的に解説します。
参照論文:RAPID: Long-Context Inference with Retrieval-Augmented Speculative Decoding
MInferenceとは?長文LLMのprefillを最大10倍高速化する動的疎Attention技術
MInferenceは、長文LLMのprefillで支配的になるAttention計算を、ヘッドごとの動的疎パターンで削減する推論最適化技術です。3種類の疎パターン、仕組み、実験結果、RAGやエージェント開発への応用ポイントを日本語で解説します。
参照論文:MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention
LongLLMLinguaとは?長文プロンプトを圧縮してLLMの精度・速度・コストを同時に改善する技術
LongLLMLinguaは、質問に関係する情報を残しながら長文プロンプトを段階的に圧縮し、LLMの長文処理を安く速くしつつ精度低下も抑える技術です。RAGや長文QA、要約で効く仕組みと実務での使い道を解説します。
参照論文:LongLLMLingua: Accelerating and Enhancing LLMs in Long Context Scenarios via Prompt Compression