トピック

モデルとツールの選択

ChatGPT、Claude、Gemini、Copilot、推論モデル、ホスト型またはローカル推論から選びます。

27件のコンテンツ (記事12件 · 動画15件)

ここから開始

一覧を見る前に、まずおすすめのコンテンツをいくつかご覧ください。

このトピックの他の記事

13 分の読書
記事

2026年のLLMスタック:モデル、推論、ツール、トレードオフ

2026年のLLMスタックを、実務に携わるアーキテクトの視点から解説します。本番AIの提供時に実際に重要となるモデル階層、推論プロバイダー、オーケストレーション層、評価ツール、トレードオフを扱います。着手前に誰かに整理してほしかった情報のすべてです。

上級者
10 分の読書
記事

思考の連鎖、自己批評、思考の木 — それぞれを使う場面

難しい問題でAIの出力を実際に改善する3つの推論手法と、それらを使う際の費用対効果を解説します。具体的なプロンプト、並列比較、最新の推論モデル特有の注意点も紹介します。

中級者
12 分の読書
記事

推論コストの最適化:プロンプトキャッシュ、ルーティング、出力制御

LLMの推論コストは、適切な手法を使えば60~90%削減できます。プロンプトキャッシュ、モデルルーティング、出力制御、バッチ処理、そしてあまり知られていないいくつかのパターンを取り上げます。適切に管理された推論と膨れ上がる請求額を分ける数値、パターン、本番環境での規律を解説します。

上級者
13 分の読書
記事

2026年のファインチューニング:LoRAがRAGを上回る場面と、クラスターなしで実践する方法

LoRAファインチューニングは身近なものになりました。実用的なファインチューニングをノートパソコンで実行したり、GPUを1時間借りて行ったりできます。効果的なパターン、ファインチューニングがRAGを上回るケース、データ準備からデプロイまでの実践的なエンドツーエンドのワークフローを解説します。

上級者
6 分の読書
記事

無料版と有料版のChatGPT:アップグレードで実際に得られるもの

無料版ChatGPT、ChatGPT Plus、ChatGPT Proを専門用語なしで比較します。アップグレードで何が変わり、本当に必要かどうかを見極める方法を解説します。

AI初心者
10 分の読書
記事

Macで動かすローカルAI:Ollama、LM Studio、そして7Bモデルで本当にできること

ローカルでのAI実行は成熟しました。OllamaまたはLM Studioと最新のMacがあれば、高性能なモデルをオフラインで、無料かつプライベートに実行できます。何ができ、何ができないのか、そして実際に恩恵を受けるユースケースを解説します。

中級者
10 分の読書
記事

推論モデル向けプロンプトエンジニアリング(o3、R1、Claude extended thinking)

推論モデルは、単に手順を追加した高速モデルではありません。異なる指示方法で力を発揮し、従来のパターンの一部は無視され、独自の落とし穴もあります。推論モデルを効果的に使うための実践ガイドです。

中級者
12 分の読書
記事

プロンプティング、RAG、ファインチューニングの選び方(および組み合わせるべき場面)

プロンプティング、RAG、ファインチューニングは、LLMを課題に適応させるための3つの大きな手段です。それぞれに適した課題と適さない課題があります。選択のためのフレームワーク、各手法の現実的なコスト、そして組み合わせることで効果を発揮する本番パターンを解説します。

上級者
11 分の読書
記事

自社運用推論とホステッド推論:vLLM、TGI、損益分岐点の計算

どの程度の規模になると、自社運用はAPI呼び出しより有利になるのでしょうか。実際の計算、運用の現実、そして自社運用すべきチームとマネージド推論を利用し続けるべきチームを分ける特徴を解説します。

上級者
211 分
動画

ChatGPTのようなLLMを徹底解説

Andrej Karpathy. LLMの実体を、事前学習、トークン化、SFT、RLHF、推論RL、ツール利用、ハルシネーションまで、モデルのトレードオフを判断するためにエンジニアが必要とする詳しさで一貫して説明した、YouTube上で最も明快な動画です。一度視聴すれば、記事で扱う「GPTクラスか、オープンウェイトか、推論モデルか」という判断を、ブランド選びではなく学習レシピの選択として捉えられるようになります。

上級者
40 分
動画

Andrej Karpathy:ソフトウェアは再び変わる

Y Combinator. KarpathyはAI Startup Schoolの基調講演で、LLMをユーティリティ、製造工場、OSが一体化した新しい種類のコンピューターとして位置づけ、人間が手綱を握る「部分的自律性」のある製品を提唱しています。これは、記事が前提とするスタックレベルのメンタルモデルを最も明快に表現したものです。つまり、チャットボットのためではなく、プログラム可能な基盤のために推論ベンダーやツールを選ぶという考え方です。

上級者
19 分
動画

RAGは終わるのか?Anthropicの新しいプロンプトキャッシュ

Prompt Engineering. AnthropicのプロンプトキャッシュとGeminiのコンテキストキャッシュを、ユースケースごとの具体的なレイテンシーとコストの削減効果(長文ドキュメントのチャット、few-shot、複数ターン)を示しながら解説します。キャッシュ書き込み時の追加料金とキャッシュ読み取り時の割引を分けて考える説明は、記事がキャッシュの採算性を論じる際に前提としている内容そのものです。

上級者
56 分
動画

Build Hour:プロンプトキャッシュ

OpenAI. OpenAI自身によるプロンプトキャッシュのBuild Hourです。1024トークンのしきい値、プレフィックスを安定させる要件、リアルタイム処理における音声キャッシュの大幅な割引(正確な割引率は最新の料金ページを確認してください)、長い入力が最初のトークンを得るまでの時間に与える影響を扱います。本番環境のプロンプトで確実にキャッシュを利用するための工数を見積もる際に役立ちます。

上級者
157 分
動画

LLMのファインチューニング:生成AI講座

freeCodeCamp.org. 量子化、LoRA、QLoRA、包括的なPEFTをLlama 2とGemmaで扱う、理論からコードへ進む長編コースです。しかも、ほとんどの開発者が実際に所有するハードウェアを使用します。YouTube上で「経験者の仕事をそばで見ながら学ぶ」体験に最も近く、具体的なVRAM要件を通じて、記事の「クラスターは不要」という主張を裏付けています。

上級者
59 分
動画

LLMの開発:構築、学習、ファインチューニング

Sebastian Raschka. Sebastian Raschkaが、LLMの学習パイプライン全体におけるファインチューニングの位置付けをじっくり解説します。インストラクションチューニング、分類タスク向けファインチューニング、パラメーター効率の高い手法、そして記事がLoRAを推奨する前に取り上げるトレードオフを扱います。着手前に判断軸を整えるのに適しており、ファインチューニングが本当に正しい選択なのかをチームで検討している場合には特に有用です。

上級者
15 分
動画

ChatGPT Plusに価値はある?2025年版レビュー

Ryan Doser. Ryanは、$20のプランで実際に制限が解除される各機能、つまり使用量の上限、高度な音声モード、画像とSoraの制限、カスタムGPT、推論モデルの利用枠を一つずつ説明し、Claude、Gemini、Perplexityなど現在の無料の代替サービスと比較しています。テーマが限定的なため視聴回数はやや少なめですが、誇大な表現に流れない現在最も明快な比較動画です。そのため、派手な「Plusで人生が変わった」という動画ではなく、こちらを選びました。

AI初心者
19 分
動画

すべてのAIモデルを解説

Tina Huang. 現在のモデルをフラッグシップ、軽量、中間、特化型という階層に分け、各階層が実際に得意とする用途を具体的に紹介しています。記事の前半にあたる「ルーティングの前に選択肢を知る」ための動画です。Huangはベンチマークの誇張に頼らず、記事と同じ視点からコストと能力のバランスを説明しています。

中級者
9 分
動画

RouteLLM:GPT-4oの90%の品質を80%低いコストで実現

Matthew Berman. LMSYSのRouteLLM論文とコードを解説します。高性能モデルと低性能モデルの組み合わせの前段に小さな分類器を置き、どちらを呼び出すか決定することで、わずかなコストで高性能モデルのおよそ95%の品質を達成します。視聴回数は通常の基準である100Kを下回りますが、「モデル比較だけでなく実際のモデルルーティングを見たい」というニッチな要望に対してYouTubeで最も分かりやすい解説であり、記事の品質とコストのトレードオフに直接対応しています。

中級者
9 分
動画

RAGとファインチューニングの比較

IBM Technology. チームが最も混同しやすい2つの手法に、より焦点を絞っています。データの鮮度、出典の帰属、ファインチューニングによる推論時の速度向上を詳しく説明します。不要なファインチューニングのプロジェクトに反対する根拠を示したい場合に、視聴する価値があります。

上級者
13 分
動画

RAG・ファインチューニング・プロンプト技術:AIモデルを最適化する

IBM Technology. 3つの手法と、それぞれのコストをホワイトボードで明快に説明します。検索のレイテンシー、学習の計算コストと破滅的忘却、プロンプトだけによる解決策の限界に加え、本番環境で実際に有効な組み合わせを扱います。最後に紹介される3つすべてを使用した法務AIシステムの例は、記事の「組み合わせるタイミング」という主張とほぼ完全に一致します。

上級者
131 分
動画

私のLLM活用法

Andrej Karpathy. Karpathyは「使用中のモデルと料金プランを把握する」と「思考モデルとその使いどころ」にそれぞれ章を割き、その後の解説でもChatGPT、Claude、Gemini、Grok、Perplexityを切り替え続けます。どの利用枠がどの場面でコストに見合うかについて明確な考えを持つ人物が、記事の早見表を実際に適用する様子を観察できる動画として、これほど近いものはありません。

初心者
17 分
動画

新たな最先端AI、Claude 3:Gemini 1.5とGPT-4との比較検証

AI Explained. 記事より古い2024年3月の動画ですが、役立つのは比較手法です。1人の慎重なレビュアーが、OCR、心の理論、指示への追従、数学という同じ難しいタスクを3つの最先端モデルに並行して実行し、それぞれがどこで破綻するかを明確に示しています。モデル名は古くなっていますが、モデルを比較する枠組みは今も有効です。

初心者
32 分
動画

vLLMとPagedAttentionによる高速なLLM推論配信

Anyscale. 単純なLLMサービングがGPUメモリの60~80%を無駄にする理由、PagedAttentionがOSのようなページングを応用してそれを解決する仕組み、継続的バッチ処理によって記事の計算で使う24倍のスループットが実現する理由を解説します。視聴後は、記事にある「稼働率が50%に達すれば幸運」という一節が抽象的な話ではなくなります。

上級者
19 分
動画

すべてのAIモデルを解説

Tina Huang. OpenAIのGPTシリーズ、AnthropicのClaude、GoogleのGemini、さらにオープンソースの主要モデルなど、主なモデルファミリーと、各ファミリー内で時間をかけて試す価値のあるモデル階層を、19分間で落ち着いて案内します。記事では「1つを選び、1か月間使い続ける」よう勧めていますが、この動画では、その1つのサービス内にあるドロップダウンメニューが実際に何を提示しているのかを説明します。率直に見解を示しつつも、過激な主張にはなっていません。

AI初心者