タグ
#Dual Chunk Attentionの記事一覧
1件の記事があります。
LLM・基盤モデル
Dual Chunk Attentionとは?追加学習なしでLLMの長文処理を伸ばす長コンテキスト技術
Dual Chunk Attention(DCA)は、追加学習なしでLLMのコンテキスト長を大きく伸ばすための長文処理技術です。RoPEの限界をどう回避するのか、3種類のチャンク注意の仕組み、実験結果、RAGや長文QAへの使い道まで日本語で整理します。
参照論文:Training-Free Long-Context Scaling of Large Language Models