タグ
#LoongServeの記事一覧
1件の記事があります。
推論最適化
LoongServeとは?長文LLMの推論を高速化するElastic Sequence Parallelismの仕組みと使い道
LoongServeは、長文LLMのprefillとdecodeで必要なGPU並列度を動的に切り替える推論サービング技術です。Elastic Sequence Parallelismの考え方、仕組み、評価結果、RAGやAIエージェントへの応用可能性を日本語で整理します。
参照論文:LoongServe: Efficiently Serving Long-Context Large Language Models with Elastic Sequence Parallelism