関連動画

推論コストの最適化:プロンプトキャッシュ、ルーティング、出力制御 — 関連動画

この記事では、LLMの請求額を実際に左右する少数の手法、すなわちプロンプトキャッシュ、モデルルーティング、出力長の制御、バッチ処理を扱い、品質を気付かないうちに損なうことなく組み合わせる方法を解説します。YouTubeにあるコスト最適化の講演は製品デモが大半ですが、以下の2本は、中核となる仕組みであるプロンプトキャッシュと、利用できる施策全体を、本番環境のレビューに役立つだけの技術的な深さで扱っています。

主な選択肢

18:50
RAGは終わるのか?Anthropicの新しいプロンプトキャッシュ

Prompt Engineering

AnthropicのプロンプトキャッシュとGeminiのコンテキストキャッシュを、ユースケースごとの具体的なレイテンシーとコストの削減効果(長文ドキュメントのチャット、few-shot、複数ターン)を示しながら解説します。キャッシュ書き込み時の追加料金とキャッシュ読み取り時の割引を分けて考える説明は、記事がキャッシュの採算性を論じる際に前提としている内容そのものです。

このセクションから得られるもの: 実際のワークロードについて、キャッシュ書き込みの追加料金と読み取りによる節約額を比較し、プロンプトキャッシュが採算に合う場面を見積もれるようになります。

視聴または事前に知っておくべきもの: LLM APIの料金体系と長いプロンプトを扱うワークロードについて、実務的な知識が必要です。

AI Expertの注記: 2024年8月収録のため、モデル名とトークン単価は古くなっています。キャッシュ書き込み時の追加料金と読み取り時の割引という仕組みは現在も変わりません。ワークロードの数値を計算する前に、各プロバイダーの最新料金ページを確認してください。

動画ページを開く

あわせて見たい動画

56:03
Build Hour:プロンプトキャッシュ

OpenAI

OpenAI自身によるプロンプトキャッシュのBuild Hourです。1024トークンのしきい値、プレフィックスを安定させる要件、リアルタイム処理における音声キャッシュの大幅な割引(正確な割引率は最新の料金ページを確認してください)、長い入力が最初のトークンを得るまでの時間に与える影響を扱います。本番環境のプロンプトで確実にキャッシュを利用するための工数を見積もる際に役立ちます。

このセクションから得られるもの: 安定したプレフィックス、レイテンシー、コストの挙動がワークロードに合う場合に限り、プロンプトキャッシュを利用できるようになります。

視聴または事前に知っておくべきもの: OpenAI APIを使ったプロンプトをすでに本番提供していることを想定しています。このセッションの主題は、本番環境で確実にキャッシュを利用する方法です。

AI Expertの注記: 当サイトの視聴回数基準を大きく下回りますが、公式の詳細解説であるため掲載しています。1024トークンのしきい値とプレフィックスの安定性に関するルールによって、キャッシュが機能するかどうかが決まります。最新の料金は料金ページで確認してください。

動画ページを開く