32 分vLLMとPagedAttentionによる高速なLLM推論配信
サービングエンジン、バッチ処理、KVキャッシュのメモリが、自社運用推論の経済性を左右する理由を理解できます。
OpenAI. OpenAI自身によるプロンプトキャッシュのBuild Hourです。1024トークンのしきい値、プレフィックスを安定させる要件、リアルタイム処理における音声キャッシュの大幅な割引(正確な割引率は最新の料金ページを確認してください)、長い入力が最初のトークンを得るまでの時間に与える影響を扱います。本番環境のプロンプトで確実にキャッシュを利用するための工数を見積もる際に役立ちます。
当サイトの視聴回数基準を大きく下回りますが、公式の詳細解説であるため掲載しています。1024トークンのしきい値とプレフィックスの安定性に関するルールによって、キャッシュが機能するかどうかが決まります。最新の料金は料金ページで確認してください。
安定したプレフィックス、レイテンシー、コストの挙動がワークロードに合う場合に限り、プロンプトキャッシュを利用できるようになります。
OpenAI APIを使ったプロンプトをすでに本番提供していることを想定しています。このセッションの主題は、本番環境で確実にキャッシュを利用する方法です。
最終確認日:2026年5月18日
同じ学習パスで次のキュレーション済みの補完動画を続けて視聴してください。
このトピックについてさらに詳しく学べる、厳選された外部コースです。
Emory University Goizueta Business School faculty
The deeper, university-level counterpart to our beginner HubSpot marketing pick — Emory's business-school treatment goes past 'how to prompt' into training generative models for brand-specific output, the purchase-funnel economics of AI-generated content, and a full module of genuine skepticism about when generative AI is and isn't worth using in marketing.
IBM AI Academy
生成AI時代の経営戦略という問いに答える講座です。技術知識を必要とせず、生成AIが価値を生む領域、責任あるガバナンスの方法、漠然とした「AIを活用すべき」という考えを具体的で説明可能なユースケースへ変える方法を、経営層向けの3つの短期講座で学びます。約700件のレビューで評価は4.6です。次のAI予算を決める前の受講をおすすめします。