34 分AIがソフトウェアのビジネスモデルを再発明する方法-SierraのBret Taylor
AIプロダクトの価格設定と専門化を、ユーザー数ではなく測定可能な成果を軸に評価できるようになります。
上級者ビジネス向けAI
Anyscale. 単純なLLMサービングがGPUメモリの60~80%を無駄にする理由、PagedAttentionがOSのようなページングを応用してそれを解決する仕組み、継続的バッチ処理によって記事の計算で使う24倍のスループットが実現する理由を解説します。視聴後は、記事にある「稼働率が50%に達すれば幸運」という一節が抽象的な話ではなくなります。
PagedAttentionのメンタルモデルは今も重要ですが、スループットの数値やサービングエンジンのデフォルト設定はすぐ古くなります。基礎を学ぶために活用し、ホスティング方式を決める前に、実際のモデル、ハードウェア、バッチ構成、稼働時間の要件でベンチマークを実施してください。
サービングエンジン、バッチ処理、KVキャッシュのメモリが、自社運用推論の経済性を左右する理由を理解できます。
Transformerの推論、GPUメモリの制約、API利用と自社運用のトレードオフに関する基礎知識が必要です。
最終確認日:2026年5月18日
同じ学習パスで次のキュレーション済みの補完動画を続けて視聴してください。
34 分AIプロダクトの価格設定と専門化を、ユーザー数ではなく測定可能な成果を軸に評価できるようになります。
6 分音声エージェントの中核アーキテクチャと、実際の通話で顧客の信頼に影響する障害点を把握できます。
37 分直感だけでSaaSか自社運用かを選ぶのではなく、プライベートAIをインフラとガバナンスの意思決定として評価できます。