32:07vLLMとPagedAttentionによる高速なLLM推論配信動画ページを開く
Anyscale
単純なLLMサービングがGPUメモリの60~80%を無駄にする理由、PagedAttentionがOSのようなページングを応用してそれを解決する仕組み、継続的バッチ処理によって記事の計算で使う24倍のスループットが実現する理由を解説します。視聴後は、記事にある「稼働率が50%に達すれば幸運」という一節が抽象的な話ではなくなります。
このセクションから得られるもの: サービングエンジン、バッチ処理、KVキャッシュのメモリが、自社運用推論の経済性を左右する理由を理解できます。
視聴または事前に知っておくべきもの: Transformerの推論、GPUメモリの制約、API利用と自社運用のトレードオフに関する基礎知識が必要です。
AI Expertの注記: PagedAttentionのメンタルモデルは今も重要ですが、スループットの数値やサービングエンジンのデフォルト設定はすぐ古くなります。基礎を学ぶために活用し、ホスティング方式を決める前に、実際のモデル、ハードウェア、バッチ構成、稼働時間の要件でベンチマークを実施してください。