トピック

コストとモデル運用

推論コストを管理し、ホスティング方式を選び、モデルをルーティングし、運用上のトレードオフを理解します。

13件のコンテンツ (記事6件 · 動画7件)

ここから開始

一覧を見る前に、まずおすすめのコンテンツをいくつかご覧ください。

このトピックの他の記事

13 分の読書
記事

2026年のLLMスタック:モデル、推論、ツール、トレードオフ

2026年のLLMスタックを、実務に携わるアーキテクトの視点から解説します。本番AIの提供時に実際に重要となるモデル階層、推論プロバイダー、オーケストレーション層、評価ツール、トレードオフを扱います。着手前に誰かに整理してほしかった情報のすべてです。

上級者
6 分の読書
記事

無料版と有料版のChatGPT:アップグレードで実際に得られるもの

無料版ChatGPT、ChatGPT Plus、ChatGPT Proを専門用語なしで比較します。アップグレードで何が変わり、本当に必要かどうかを見極める方法を解説します。

AI初心者
10 分の読書
記事

Macで動かすローカルAI:Ollama、LM Studio、そして7Bモデルで本当にできること

ローカルでのAI実行は成熟しました。OllamaまたはLM Studioと最新のMacがあれば、高性能なモデルをオフラインで、無料かつプライベートに実行できます。何ができ、何ができないのか、そして実際に恩恵を受けるユースケースを解説します。

中級者
211 分
動画

ChatGPTのようなLLMを徹底解説

Andrej Karpathy. LLMの実体を、事前学習、トークン化、SFT、RLHF、推論RL、ツール利用、ハルシネーションまで、モデルのトレードオフを判断するためにエンジニアが必要とする詳しさで一貫して説明した、YouTube上で最も明快な動画です。一度視聴すれば、記事で扱う「GPTクラスか、オープンウェイトか、推論モデルか」という判断を、ブランド選びではなく学習レシピの選択として捉えられるようになります。

上級者
40 分
動画

Andrej Karpathy:ソフトウェアは再び変わる

Y Combinator. KarpathyはAI Startup Schoolの基調講演で、LLMをユーティリティ、製造工場、OSが一体化した新しい種類のコンピューターとして位置づけ、人間が手綱を握る「部分的自律性」のある製品を提唱しています。これは、記事が前提とするスタックレベルのメンタルモデルを最も明快に表現したものです。つまり、チャットボットのためではなく、プログラム可能な基盤のために推論ベンダーやツールを選ぶという考え方です。

上級者
19 分
動画

RAGは終わるのか?Anthropicの新しいプロンプトキャッシュ

Prompt Engineering. AnthropicのプロンプトキャッシュとGeminiのコンテキストキャッシュを、ユースケースごとの具体的なレイテンシーとコストの削減効果(長文ドキュメントのチャット、few-shot、複数ターン)を示しながら解説します。キャッシュ書き込み時の追加料金とキャッシュ読み取り時の割引を分けて考える説明は、記事がキャッシュの採算性を論じる際に前提としている内容そのものです。

上級者
56 分
動画

Build Hour:プロンプトキャッシュ

OpenAI. OpenAI自身によるプロンプトキャッシュのBuild Hourです。1024トークンのしきい値、プレフィックスを安定させる要件、リアルタイム処理における音声キャッシュの大幅な割引(正確な割引率は最新の料金ページを確認してください)、長い入力が最初のトークンを得るまでの時間に与える影響を扱います。本番環境のプロンプトで確実にキャッシュを利用するための工数を見積もる際に役立ちます。

上級者
19 分
動画

すべてのAIモデルを解説

Tina Huang. 現在のモデルをフラッグシップ、軽量、中間、特化型という階層に分け、各階層が実際に得意とする用途を具体的に紹介しています。記事の前半にあたる「ルーティングの前に選択肢を知る」ための動画です。Huangはベンチマークの誇張に頼らず、記事と同じ視点からコストと能力のバランスを説明しています。

中級者
9 分
動画

RouteLLM:GPT-4oの90%の品質を80%低いコストで実現

Matthew Berman. LMSYSのRouteLLM論文とコードを解説します。高性能モデルと低性能モデルの組み合わせの前段に小さな分類器を置き、どちらを呼び出すか決定することで、わずかなコストで高性能モデルのおよそ95%の品質を達成します。視聴回数は通常の基準である100Kを下回りますが、「モデル比較だけでなく実際のモデルルーティングを見たい」というニッチな要望に対してYouTubeで最も分かりやすい解説であり、記事の品質とコストのトレードオフに直接対応しています。

中級者
32 分
動画

vLLMとPagedAttentionによる高速なLLM推論配信

Anyscale. 単純なLLMサービングがGPUメモリの60~80%を無駄にする理由、PagedAttentionがOSのようなページングを応用してそれを解決する仕組み、継続的バッチ処理によって記事の計算で使う24倍のスループットが実現する理由を解説します。視聴後は、記事にある「稼働率が50%に達すれば幸運」という一節が抽象的な話ではなくなります。

上級者