トピック

本番LLMアプリ

デモ段階を終えたLLMアプリケーションの設計、リリース、監視、運用。

31件のコンテンツ (記事20件 · 動画11件)

ここから開始

一覧を見る前に、まずおすすめのコンテンツをいくつかご覧ください。

このトピックの他の記事

69 分
動画

AIエージェントの現状:本番導入から得た教訓

MLOps.community. ProsusのAI担当VPとAIエンジニアが、グループの投資先企業にエージェントを導入した際、実際に何が壊れたかを報告します。本番前のプロンプトインジェクション侵入テスト、人間特有の略記をJiraエージェントが処理できずに発生した危険な書き込み、エージェント自身に前提を明示させて対処した古いコンテキスト、認知負荷を増やすエージェントを統合または停止するフォールバック設計を扱います。記事の障害モード台帳を、実際の事後検証として再現したような内容です。

上級者
11 分の読書
記事

LangGraph vs CrewAI vs直接API:2026年のエージェントフレームワークの選び方

2026年のエージェントフレームワークを取り巻く環境は成熟しましたが、選択が明快になったわけではありません。LangGraph、CrewAI、Pydantic AI、OpenAI Agents SDK、直接APIは、それぞれ特定のチームやプロジェクトに適していますが、万能なものはありません。率直な比較と意思決定のフレームワークを紹介します。

上級者
13 分の読書
記事

無限ループしないエージェントの設計

本番エージェントで最も一般的な失敗は、無限または擬似的な無限ループです。進展がないまま、エージェントが再試行や分岐を繰り返してトークンを浪費します。これを防ぎ、難しいタスクでも完了できるエージェントを生み出すアーキテクチャパターンを解説します。

上級者
12 分の読書
記事

本番環境におけるコンピューター操作エージェントとブラウザエージェント

コンピューター操作エージェントやブラウザエージェントのデモは、たびたび大きな話題になります。しかし、大規模な本番導入の姿は異なります。対象範囲を狭く絞り、厳重なガードレールを設け、UXを慎重に設計します。実際に機能するパターン、繰り返し見られる失敗、そして現実的な経済性を解説します。

上級者
12 分の読書
記事

コンテキストエンジニアリング:コンテキスト劣化を避けて100万トークンのウィンドウを管理する

100万トークンのコンテキストウィンドウは実現していますが、品質は上限に達するはるか前から低下します。コンテキストエンジニアリングとは、何を含め、何を要約し、何を新たに検索するかを決め、コンテキストが増えても高い品質を維持するパターンを適用することで、コンテキストウィンドウを効果的に使うための規律です。

上級者
12 分の読書
記事

推論コストの最適化:プロンプトキャッシュ、ルーティング、出力制御

LLMの推論コストは、適切な手法を使えば60~90%削減できます。プロンプトキャッシュ、モデルルーティング、出力制御、バッチ処理、そしてあまり知られていないいくつかのパターンを取り上げます。適切に管理された推論と膨れ上がる請求額を分ける数値、パターン、本番環境での規律を解説します。

上級者
13 分の読書
記事

実際にリグレッションを検出できる評価の構築

多くの評価スイートは見栄えこそ立派ですが、実際のリグレッションを見逃します。重要な問題を検出できる評価を構築するには、慎重なデータセット構築、変化に敏感なメトリクス、ジャッジのキャリブレーション、そして信頼を重んじる文化が必要です。これを正しく実践しているチームから得られたパターンを紹介します。

上級者
13 分の読書
記事

2026年のファインチューニング:LoRAがRAGを上回る場面と、クラスターなしで実践する方法

LoRAファインチューニングは身近なものになりました。実用的なファインチューニングをノートパソコンで実行したり、GPUを1時間借りて行ったりできます。効果的なパターン、ファインチューニングがRAGを上回るケース、データ準備からデプロイまでの実践的なエンドツーエンドのワークフローを解説します。

上級者
14 分の読書
記事

MCPをゼロから構築する:TypeScriptで本番対応サーバーを作る

本番環境で使えるModel Context Protocolサーバーを構築するには、いくつかのツールを接続するだけでは不十分です。スキーマ設計、認証、エラー処理、ストリーミング、可観測性に関するパターンと、MCPサーバーを大規模環境で実用的なものにする本番運用の現実を解説します。

上級者
12 分の読書
記事

LLMが実際に正しく使えるMCPツールの設計

私たちが目にするMCPツールの多くは、技術的には正しくても実用上は役に立ちません。LLMはツールを無視したり、誤用したり、役に立たない方法で呼び出したりします。LLMが自然に採用できるツールを設計する原則を、よくある失敗と修正の例を交えて説明します。

上級者
12 分の読書
記事

長時間稼働するエージェントのメモリを構築する

エージェントには、コンテキストウィンドウを超えるメモリが必要です。何を保存し、いつ検索し、どのように忘れるかを定める長期メモリのアーキテクチャによって、エージェントがユーザーを「知っている」ように感じられるか、会話のたびに最初からやり直すかが決まります。そのパターンと本番環境でのトレードオフを解説します。

上級者
10 分の読書
記事

マルチモデル・オーケストレーション:コスト、レイテンシ、品質に基づくルーティング

あらゆる用途に1つのモデルを使うのは、初心者が陥る選択です。本番AIシステムでは、リクエストごとに異なるモデルへ振り分けることで、品質を向上させながらコストを60~90%削減できます。そのパターン、ルーティングロジック、トレードオフを解説します。

中級者
12 分の読書
記事

LLMアプリの可観測性:トレーシング、コスト、レイテンシー、品質ドリフト

LLMアプリケーションには、従来の可観測性では捉えられない固有の失敗があります。複数ステップのフローをトレースし、呼び出しごとに最大100倍変動するコストを追跡し、品質ドリフトを監視し、本番規模でハルシネーションをデバッグするためのパターンを解説します。

上級者
12 分の読書
記事

本番環境向けRAGの構築:取り込み、埋め込み、検索、再ランキング、評価

本番環境向けRAGパイプラインは6つの段階で構成され、各段階の具体的なパターンが品質を左右します。アーキテクチャ、各段階での選択、そして機能するRAGと期待外れのRAGを分ける反復的な評価の規律を解説します。

上級者
14 分の読書
記事

プロンプトインジェクションとLLMセキュリティ:脅威モデルと多層防御

プロンプトインジェクションは恒久的に存在するLLMセキュリティ上の脅威であり、プロンプトの書き方の誤りではありません。脅威モデル、データ境界、ツール権限、回帰テスト、監視、インシデント対応について解説する本番環境向けガイドです。

上級者
12 分の読書
記事

プロンプティング、RAG、ファインチューニングの選び方(および組み合わせるべき場面)

プロンプティング、RAG、ファインチューニングは、LLMを課題に適応させるための3つの大きな手段です。それぞれに適した課題と適さない課題があります。選択のためのフレームワーク、各手法の現実的なコスト、そして組み合わせることで効果を発揮する本番パターンを解説します。

上級者
13 分の読書
記事

LLM製品を市場に出す:価格設定、利益率、反モートの罠

LLM搭載製品の経済性は、従来のSaaSより厳しいものです。利用量に応じて増える変動費、推論費用に圧迫される利益率、コモディティ化のリスク、同じ基盤モデルを使う競合他社。実際に防御力のある製品を構築する方法と、LLMスタートアップを消滅へ導くパターンを解説します。

上級者
13 分の読書
記事

構造化出力と関数呼び出し:本番運用のパターン

構造化出力と関数呼び出しは、「テキストを生成するLLM」から「作業を実行するシステム」への橋渡しとなります。本番環境で重要なのは、JSONモードだけではなく、スキーマ、エラー処理、冪等性、グレースフルデグラデーションのパターンです。

上級者
211 分
動画

ChatGPTのようなLLMを徹底解説

Andrej Karpathy. LLMの実体を、事前学習、トークン化、SFT、RLHF、推論RL、ツール利用、ハルシネーションまで、モデルのトレードオフを判断するためにエンジニアが必要とする詳しさで一貫して説明した、YouTube上で最も明快な動画です。一度視聴すれば、記事で扱う「GPTクラスか、オープンウェイトか、推論モデルか」という判断を、ブランド選びではなく学習レシピの選択として捉えられるようになります。

上級者
40 分
動画

Andrej Karpathy:ソフトウェアは再び変わる

Y Combinator. KarpathyはAI Startup Schoolの基調講演で、LLMをユーティリティ、製造工場、OSが一体化した新しい種類のコンピューターとして位置づけ、人間が手綱を握る「部分的自律性」のある製品を提唱しています。これは、記事が前提とするスタックレベルのメンタルモデルを最も明快に表現したものです。つまり、チャットボットのためではなく、プログラム可能な基盤のために推論ベンダーやツールを選ぶという考え方です。

上級者
9 分
動画

LangSmithを10分で学ぶ

LangChain. LangChainの共同創業者が、LLMのトレース、プロジェクト、データセットを案内します。トークンコスト、レイテンシー、エラー率、フィードバックの集約、単一の検索ステップのスパンを掘り下げる方法を扱います。「すべての呼び出しが1つのスパンである」という記事の説明と、構造化トレースがprint文によるログより優れている理由を、視覚的に最も近い形で確認できます。

上級者
154 分
動画

LLMの計測と評価

Hamel Husain. Hamel Husain、Eugene Yan、Brian Bischof、Harrison Chase、Shreya Shankarが、トレース、ログ分析、LLM-as-a-Judge、実際の本番データを確認するためのワークフローに取り組みます。長時間のポッドキャストと同じように、腰を据えて視聴してください。記事の「トレースを確認する」という主張をYouTube上で最も深く掘り下げた動画です。

上級者
77 分
動画

AIプロンプト技術を徹底解説

Anthropic. 研究、アラインメント、応用、開発者向け広報を担当するAnthropicの4人のプロンプトエンジニアが、日々の実務について詳しく語ります。切迫した状況でプロンプトをどう修正するか、指示の「正直さ」をどう考えるか、XMLによる足場作りが役立つ場合と役立たない場合などを扱います。記事のレイヤーモデルは、登壇者が説明する実務にきれいに対応しています。そのメンタルモデルを当事者の言葉で理解する最良の方法です。

上級者
25 分
動画

プロンプト入門|Code with Claude

Anthropic. AnthropicのApplied AIチームが保険金請求用プロンプトをライブで構築するセッションです。曖昧な指示から始めて、開発者が実際に提供できる形まで反復改善し、記事で説明しているシステムレイヤーと開発者レイヤーの修正を実演します。記事にある例、出力構造、拒否の処理に関するチェックリストを読み直す前に視聴してください。

上級者
42 分
動画

業界特化型AIエージェントはSaaSの10倍の市場になり得る

Y Combinator. Lightconeの司会者が、水平型のラッパーではなく、業界特化型AIエージェントこそがアプリケーション層の企業に防御可能な事業基盤をもたらす理由を、具体例とともに解説します。さらに、モデルプロバイダーに取り込まれる分野を冷静に論じます。これは記事が警告する「競争優位にならない罠」を、前向きな実践指針として表現したものです。

上級者
34 分
動画

AIがソフトウェアのビジネスモデルを再発明する方法-SierraのBret Taylor

Sequoia Capital. Bret Taylorが、ユーザー数に基づくSaaSから成果ベースの価格設定への移行を解説します。価格の基準とすべき指標(問題解決、CSAT、NPS)、既存企業が追随しにくい理由、業界特化によって価格決定力が生まれる仕組みを扱います。記事の価格設定と利益率に関するセクションを直接反映した内容です。

上級者
41 分
動画

OpenAI DevDay 2024|信頼性の高いアプリケーションのための構造化出力

OpenAI. `strict: true`、従来のJSONモードとの違い、拒否の処理、関数呼び出しとレスポンス形式のスキーマを組み合わせる方法を順に解説しています。APIが提供する契約を説明しており、記事の本番パターンはその契約の上に構築されているため、特に有用です。

上級者
18 分
動画

必要なのはPydanticだけ:Jason Liu

AI Engineer. 「Pydanticモデルを定義してLLMに渡し、残りは検証に任せる」という現代的なパターンを確立した講演です。ネストしたオブジェクト、ハルシネーションによるURLを検出するバリデーター、型付きフィールドとしての思考の連鎖など、具体例を紹介しています。記事のバリデーターに関する節を読み直す前に視聴すれば、再試行と拒否のルールがどこから来たのかを理解できます。

上級者