タグ
#Sparse Attentionの記事一覧
2件の記事があります。
推論最適化
Native Sparse Attentionとは?長文LLMを高速化しながら精度も落としにくい学習可能スパース注意
Native Sparse Attentionは、圧縮・選択・局所窓の3経路で長文コンテキストを効率よく扱うスパースattentionです。仕組み、従来法との違い、実験結果、RAGや長文エージェントへの使い道を日本語で整理します。
参照論文:Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention
推論最適化
MInferenceとは?長文LLMのprefillを最大10倍高速化する動的疎Attention技術
MInferenceは、長文LLMのprefillで支配的になるAttention計算を、ヘッドごとの動的疎パターンで削減する推論最適化技術です。3種類の疎パターン、仕組み、実験結果、RAGやエージェント開発への応用ポイントを日本語で解説します。
参照論文:MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention