タグ

#SWIFTの記事一覧

1件の記事があります。

推論最適化

SWIFTとは?追加モデルなしでLLM推論を高速化する自己スペキュレーティブデコーディング

SWIFTは、同じLLMの一部の層をスキップして軽量なドラフトモデルをその場で作り、追加学習なしで推論を1.3〜1.6倍高速化する手法です。自己スペキュレーティブデコーディングの考え方、仕組み、使い道を論文ベースで解説します。

参照論文:SWIFT: On-the-Fly Self-Speculative Decoding for LLM Inference Acceleration