トピック

本番LLMアプリ

デモ段階を終えたLLMアプリケーションの設計、リリース、監視、運用。

34件のコンテンツ (記事23件 · 動画11件)

ここから開始

一覧を見る前に、まずおすすめのコンテンツをいくつかご覧ください。

このトピックの他の記事

8 分の読書
記事

Hermesとn8nの比較:仕事に合わせた選び方(併用すべき場合も)

Hermes Agentとn8nを選ぶための判断基準を解説します。手順が明確な連携処理はn8nに残し、範囲を限定したエージェント処理にはBearer認証付きHermes APIステップか、独立したイベントwebhook経路を使います。

中級者
8 分の読書
記事

OpenClawとHermes:ブランドではなく用途で選ぶ

OpenClawとHermesは、機能が重なる一方で運用上の強みが異なるセルフホスト型エージェントシステムです。どちらか一方、または両方を選ぶ前に、チャネルルーティング、webhook、ツール、自動化の境界を比較します。

中級者
10 分の読書
記事

実験的なデュアルDGX Spark+DeepSeek-V4-Flash+n8n+Hermesスタック

DeepSeek-V4-Flashを2台のDGX Sparkで動かす実験的なコミュニティ経路を評価する方法です。決定論的な処理をn8nに、判断が必要な処理をHermesに担当させます。

上級者
69 分
動画

AIエージェントの現状:本番導入から得た教訓

MLOps.community. ProsusのAI担当VPとAIエンジニアが、グループの投資先企業にエージェントを導入した際、実際に何が壊れたかを報告します。本番前のプロンプトインジェクション侵入テスト、人間特有の略記をJiraエージェントが処理できずに発生した危険な書き込み、エージェント自身に前提を明示させて対処した古いコンテキスト、認知負荷を増やすエージェントを統合または停止するフォールバック設計を扱います。記事の障害モード台帳を、実際の事後検証として再現したような内容です。

上級者
11 分の読書
記事

LangGraph vs CrewAI vs直接API:2026年のエージェントフレームワークの選び方

2026年のエージェントフレームワークを取り巻く環境は成熟しましたが、選択が明快になったわけではありません。LangGraph、CrewAI、Pydantic AI、OpenAI Agents SDK、直接APIは、それぞれ特定のチームやプロジェクトに適していますが、万能なものはありません。率直な比較と意思決定のフレームワークを紹介します。

上級者
13 分の読書
記事

無限ループしないエージェントの設計

本番エージェントで最も一般的な失敗は、無限または擬似的な無限ループです。進展がないまま、エージェントが再試行や分岐を繰り返してトークンを浪費します。これを防ぎ、難しいタスクでも完了できるエージェントを生み出すアーキテクチャパターンを解説します。

上級者
12 分の読書
記事

本番環境におけるコンピューター操作エージェントとブラウザエージェント

コンピューター操作エージェントやブラウザエージェントのデモは、たびたび大きな話題になります。しかし、大規模な本番導入の姿は異なります。対象範囲を狭く絞り、厳重なガードレールを設け、UXを慎重に設計します。実際に機能するパターン、繰り返し見られる失敗、そして現実的な経済性を解説します。

上級者
12 分の読書
記事

コンテキストエンジニアリング:コンテキスト劣化を避けて100万トークンのウィンドウを管理する

100万トークンのコンテキストウィンドウは実現していますが、品質は上限に達するはるか前から低下します。コンテキストエンジニアリングとは、何を含め、何を要約し、何を新たに検索するかを決め、コンテキストが増えても高い品質を維持するパターンを適用することで、コンテキストウィンドウを効果的に使うための規律です。

上級者
12 分の読書
記事

推論コストを最適化する:プロンプトキャッシング、ルーティング、出力制御

トレースに基づく推論コストモデルを構築し、実測で最大の費用要因を最適化し、各変更がタスク品質を維持していることを示します。

上級者
13 分の読書
記事

実際にリグレッションを検出できる評価の構築

多くの評価スイートは見栄えこそ立派ですが、実際のリグレッションを見逃します。重要な問題を検出できる評価を構築するには、慎重なデータセット構築、変化に敏感なメトリクス、ジャッジのキャリブレーション、そして信頼を重んじる文化が必要です。これを正しく実践しているチームから得られたパターンを紹介します。

上級者
13 分の読書
記事

2026年のファインチューニング:根拠を先に置くLoRA・QLoRA実験

パラメーター効率の高いチューニングが妥当かを判断し、データを統制し、再現可能な実験を固定し、ホールドアウトと安全性の結果を比較し、導入前に推論提供を測定します。

上級者
14 分の読書
記事

MCPをゼロから構築する:TypeScriptで本番対応サーバーを作る

本番環境で使えるModel Context Protocolサーバーを構築するには、いくつかのツールを接続するだけでは不十分です。スキーマ設計、認証、エラー処理、ストリーミング、可観測性に関するパターンと、MCPサーバーを大規模環境で実用的なものにする本番運用の現実を解説します。

上級者
12 分の読書
記事

LLMが実際に正しく使えるMCPツールの設計

私たちが目にするMCPツールの多くは、技術的には正しくても実用上は役に立ちません。LLMはツールを無視したり、誤用したり、役に立たない方法で呼び出したりします。LLMが自然に採用できるツールを設計する原則を、よくある失敗と修正の例を交えて説明します。

上級者
12 分の読書
記事

長期実行エージェントのためのメモリ構築

長期実行エージェントには、自ら責任を持つ永続化設計が必要です。出所、確認、テナント分離、検索テスト、保持、修正、検証可能な削除までを設計します。

上級者
10 分の読書
記事

マルチモデルオーケストレーション:コスト、レイテンシ、品質で振り分ける

タスクごとにモデルを使い分けると、コストやレイテンシを抑えられる場合があります。ただし、複雑な仕組みに見合う効果があるかは、実際のワークロードに即した評価でしか判断できません。設計パターン、測定方法、障害時の挙動を解説します。

中級者
12 分の読書
記事

LLMアプリの可観測性:トレース、コスト、レイテンシー、品質ドリフト

複数ステップのトレース、帰属可能なコスト、プロンプトとモデルのバージョン、評価に基づく品質シグナル、プライバシー管理、ワークロード実績に基づくアラートによって、通常の可観測性をLLM向けに拡張します。

上級者
12 分の読書
記事

本番環境向けRAGの構築:取り込み、埋め込み、検索、再ランキング、評価

本番環境向けRAGパイプラインは6つの段階で構成され、各段階の具体的なパターンが品質を左右します。アーキテクチャ、各段階での選択、そして機能するRAGと期待外れのRAGを分ける反復的な評価の規律を解説します。

上級者
14 分の読書
記事

プロンプトインジェクションとLLMセキュリティ:脅威モデルと多層防御

プロンプトインジェクションは恒久的に存在するLLMセキュリティ上の脅威であり、プロンプトの書き方の誤りではありません。脅威モデル、データ境界、ツール権限、回帰テスト、監視、インシデント対応について解説する本番環境向けガイドです。

上級者
12 分の読書
記事

プロンプティング、RAG、ファインチューニングの選び方(および組み合わせるべき場面)

プロンプティング、RAG、ファインチューニングは、LLMを課題に適応させるための3つの大きな手段です。それぞれに適した課題と適さない課題があります。選択のためのフレームワーク、各手法の現実的なコスト、そして組み合わせることで効果を発揮する本番パターンを解説します。

上級者
13 分の読書
記事

LLM製品のユニットエコノミクス:根拠に基づく価格設計ワークシート

価格を決める前に、モデル利用量の分布、貢献利益率、障害対応、サポート、継続利用を検討します。このワークシートでは、根拠のない市場相場ではなく、監査可能な入力値を使います。

上級者
13 分の読書
記事

構造化出力と関数呼び出し:本番運用のパターン

構造化出力と関数呼び出しは、「テキストを生成するLLM」から「作業を実行するシステム」への橋渡しとなります。本番環境で重要なのは、JSONモードだけではなく、スキーマ、エラー処理、冪等性、グレースフルデグラデーションのパターンです。

上級者
211 分
動画

ChatGPTのようなLLMを徹底解説

Andrej Karpathy. LLMの実体を、事前学習、トークン化、SFT、RLHF、推論RL、ツール利用、ハルシネーションまで、モデルのトレードオフを判断するためにエンジニアが必要とする詳しさで一貫して説明した、YouTube上で最も明快な動画です。一度視聴すれば、記事で扱う「GPTクラスか、オープンウェイトか、推論モデルか」という判断を、ブランド選びではなく学習レシピの選択として捉えられるようになります。

上級者
40 分
動画

Andrej Karpathy:ソフトウェアは再び変わる

Y Combinator. KarpathyはAI Startup Schoolの基調講演で、LLMをユーティリティ、製造工場、OSが一体化した新しい種類のコンピューターとして位置づけ、人間が手綱を握る「部分的自律性」のある製品を提唱しています。これは、記事が前提とするスタックレベルのメンタルモデルを最も明快に表現したものです。つまり、チャットボットのためではなく、プログラム可能な基盤のために推論ベンダーやツールを選ぶという考え方です。

上級者
9 分
動画

LangSmithを10分で学ぶ

LangChain. LangChainの共同創業者が、LLMのトレース、プロジェクト、データセットを案内します。トークンコスト、レイテンシー、エラー率、フィードバックの集約、単一の検索ステップのスパンを掘り下げる方法を扱います。「すべての呼び出しが1つのスパンである」という記事の説明と、構造化トレースがprint文によるログより優れている理由を、視覚的に最も近い形で確認できます。

上級者
154 分
動画

LLMの計測と評価

Hamel Husain. Hamel Husain、Eugene Yan、Brian Bischof、Harrison Chase、Shreya Shankarが、トレース、ログ分析、LLM-as-a-Judge、実際の本番データを確認するためのワークフローに取り組みます。長時間のポッドキャストと同じように、腰を据えて視聴してください。記事の「トレースを確認する」という主張をYouTube上で最も深く掘り下げた動画です。

上級者
77 分
動画

AIプロンプト技術を徹底解説

Anthropic. 研究、アラインメント、応用、開発者向け広報を担当するAnthropicの4人のプロンプトエンジニアが、日々の実務について詳しく語ります。切迫した状況でプロンプトをどう修正するか、指示の「正直さ」をどう考えるか、XMLによる足場作りが役立つ場合と役立たない場合などを扱います。記事のレイヤーモデルは、登壇者が説明する実務にきれいに対応しています。そのメンタルモデルを当事者の言葉で理解する最良の方法です。

上級者
25 分
動画

プロンプト入門|Code with Claude

Anthropic. AnthropicのApplied AIチームが保険金請求用プロンプトをライブで構築するセッションです。曖昧な指示から始めて、開発者が実際に提供できる形まで反復改善し、記事で説明しているシステムレイヤーと開発者レイヤーの修正を実演します。記事にある例、出力構造、拒否の処理に関するチェックリストを読み直す前に視聴してください。

上級者
42 分
動画

業界特化型AIエージェントはSaaSの10倍の市場になり得る

Y Combinator. Lightconeの司会者が、水平型のラッパーではなく、業界特化型AIエージェントこそがアプリケーション層の企業に防御可能な事業基盤をもたらす理由を、具体例とともに解説します。さらに、モデルプロバイダーに取り込まれる分野を冷静に論じます。これは記事が警告する「競争優位にならない罠」を、前向きな実践指針として表現したものです。

上級者
34 分
動画

AIがソフトウェアのビジネスモデルを再発明する方法-SierraのBret Taylor

Sequoia Capital. Bret Taylorが、ユーザー数に基づくSaaSから成果ベースの価格設定への移行を解説します。価格の基準とすべき指標(問題解決、CSAT、NPS)、既存企業が追随しにくい理由、業界特化によって価格決定力が生まれる仕組みを扱います。記事の価格設定と利益率に関するセクションを直接反映した内容です。

上級者
41 分
動画

OpenAI DevDay 2024|信頼性の高いアプリケーションのための構造化出力

OpenAI. `strict: true`、従来のJSONモードとの違い、拒否の処理、関数呼び出しとレスポンス形式のスキーマを組み合わせる方法を順に解説しています。APIが提供する契約を説明しており、記事の本番パターンはその契約の上に構築されているため、特に有用です。

上級者
18 分
動画

必要なのはPydanticだけ:Jason Liu

AI Engineer. 「Pydanticモデルを定義してLLMに渡し、残りは検証に任せる」という現代的なパターンを確立した講演です。ネストしたオブジェクト、ハルシネーションによるURLを検出するバリデーター、型付きフィールドとしての思考の連鎖など、具体例を紹介しています。記事のバリデーターに関する節を読み直す前に視聴すれば、再試行と拒否のルールがどこから来たのかを理解できます。

上級者