タグ
#FlashAttention-2の記事一覧
1件の記事があります。
推論最適化
FlashAttention-2とは?GPUの並列化とワーク分割でTransformerのAttentionをさらに高速化する技術
FlashAttention-2は、Attention計算のIO削減に加えて、GPU上の並列化、ワープ間のワーク分割、non-matmul FLOPs削減を見直すことで、長文Transformerの学習・推論を高速化する技術です。仕組み、実験結果、AI開発への応用を解説します。
参照論文:FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning