タグ
#GPUサービングの記事一覧
1件の記事があります。
推論最適化
FlashDecoding++とは?LLM推論のsoftmax同期とFlat GEMMの無駄を減らしてGPU推論を速くする技術
FlashDecoding++は、LLM推論で発生するsoftmax同期、Flat GEMMの計算浪費、静的データフローの非効率をまとめて改善する推論エンジンです。どこが遅いのか、どう直すのか、実運用で何に効くのかを技術的に整理します。
参照論文:FlashDecoding++: Faster Large Language Model Inference on GPUs