タグ

#Elastic Sequence Parallelismの記事一覧

1件の記事があります。

推論最適化

LoongServeとは?長文LLMの推論を高速化するElastic Sequence Parallelismの仕組みと使い道

LoongServeは、長文LLMのprefillとdecodeで必要なGPU並列度を動的に切り替える推論サービング技術です。Elastic Sequence Parallelismの考え方、仕組み、評価結果、RAGやAIエージェントへの応用可能性を日本語で整理します。

参照論文:LoongServe: Efficiently Serving Long-Context Large Language Models with Elastic Sequence Parallelism