タグ

#FlashAttention-2の記事一覧

1件の記事があります。

推論最適化

FlashAttention-2とは?GPUの並列化とワーク分割でTransformerのAttentionをさらに高速化する技術

FlashAttention-2は、Attention計算のIO削減に加えて、GPU上の並列化、ワープ間のワーク分割、non-matmul FLOPs削減を見直すことで、長文Transformerの学習・推論を高速化する技術です。仕組み、実験結果、AI開発への応用を解説します。

参照論文:FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning