関連動画

自社運用推論とホステッド推論:vLLM、TGI、損益分岐点の計算 — 関連動画

この記事では、APIプロバイダーと自社運用のvLLM/TGIについて、実際の損益分岐点を計算します。稼働率、KVキャッシュのメモリ、GPUの経済性、オンコール対応の負担を考慮し、「自社運用すればコストを削減できる」という思考停止した判断を退けることを目指します。vLLM開発者自身による講演は、そもそもサービングエンジンが重要である理由を理解するうえで、最も明快な技術的基礎となります。

主な選択肢

32:07
vLLMとPagedAttentionによる高速なLLM推論配信

Anyscale

単純なLLMサービングがGPUメモリの60~80%を無駄にする理由、PagedAttentionがOSのようなページングを応用してそれを解決する仕組み、継続的バッチ処理によって記事の計算で使う24倍のスループットが実現する理由を解説します。視聴後は、記事にある「稼働率が50%に達すれば幸運」という一節が抽象的な話ではなくなります。

このセクションから得られるもの: サービングエンジン、バッチ処理、KVキャッシュのメモリが、自社運用推論の経済性を左右する理由を理解できます。

視聴または事前に知っておくべきもの: Transformerの推論、GPUメモリの制約、API利用と自社運用のトレードオフに関する基礎知識が必要です。

AI Expertの注記: PagedAttentionのメンタルモデルは今も重要ですが、スループットの数値やサービングエンジンのデフォルト設定はすぐ古くなります。基礎を学ぶために活用し、ホスティング方式を決める前に、実際のモデル、ハードウェア、バッチ構成、稼働時間の要件でベンチマークを実施してください。

動画ページを開く