32 分vLLMとPagedAttentionによる高速なLLM推論配信
サービングエンジン、バッチ処理、KVキャッシュのメモリが、自社運用推論の経済性を左右する理由を理解できます。
Prompt Engineering. AnthropicのプロンプトキャッシュとGeminiのコンテキストキャッシュを、ユースケースごとの具体的なレイテンシーとコストの削減効果(長文ドキュメントのチャット、few-shot、複数ターン)を示しながら解説します。キャッシュ書き込み時の追加料金とキャッシュ読み取り時の割引を分けて考える説明は、記事がキャッシュの採算性を論じる際に前提としている内容そのものです。
2024年8月収録のため、モデル名とトークン単価は古くなっています。キャッシュ書き込み時の追加料金と読み取り時の割引という仕組みは現在も変わりません。ワークロードの数値を計算する前に、各プロバイダーの最新料金ページを確認してください。
実際のワークロードについて、キャッシュ書き込みの追加料金と読み取りによる節約額を比較し、プロンプトキャッシュが採算に合う場面を見積もれるようになります。
LLM APIの料金体系と長いプロンプトを扱うワークロードについて、実務的な知識が必要です。
最終確認日:2026年5月18日
同じ学習パスで次のキュレーション済みの補完動画を続けて視聴してください。
このトピックについてさらに詳しく学べる、厳選された外部コースです。
Emory University Goizueta Business School faculty
The deeper, university-level counterpart to our beginner HubSpot marketing pick — Emory's business-school treatment goes past 'how to prompt' into training generative models for brand-specific output, the purchase-funnel economics of AI-generated content, and a full module of genuine skepticism about when generative AI is and isn't worth using in marketing.
IBM AI Academy
生成AI時代の経営戦略という問いに答える講座です。技術知識を必要とせず、生成AIが価値を生む領域、責任あるガバナンスの方法、漠然とした「AIを活用すべき」という考えを具体的で説明可能なユースケースへ変える方法を、経営層向けの3つの短期講座で学びます。約700件のレビューで評価は4.6です。次のAI予算を決める前の受講をおすすめします。