タグ

#GPUサービングの記事一覧

1件の記事があります。

推論最適化

FlashDecoding++とは?LLM推論のsoftmax同期とFlat GEMMの無駄を減らしてGPU推論を速くする技術

FlashDecoding++は、LLM推論で発生するsoftmax同期、Flat GEMMの計算浪費、静的データフローの非効率をまとめて改善する推論エンジンです。どこが遅いのか、どう直すのか、実運用で何に効くのかを技術的に整理します。

参照論文:FlashDecoding++: Faster Large Language Model Inference on GPUs