トピック

評価、可観測性、品質

AIの挙動を測定し、リグレッションを検出し、コストとレイテンシーを追跡して、ワークフローを改善し続けます。

12件のコンテンツ (記事5件 · 動画7件)

ここから開始

一覧を見る前に、まずおすすめのコンテンツをいくつかご覧ください。

このトピックの他の記事

69 分
動画

AIエージェントの現状:本番導入から得た教訓

MLOps.community. ProsusのAI担当VPとAIエンジニアが、グループの投資先企業にエージェントを導入した際、実際に何が壊れたかを報告します。本番前のプロンプトインジェクション侵入テスト、人間特有の略記をJiraエージェントが処理できずに発生した危険な書き込み、エージェント自身に前提を明示させて対処した古いコンテキスト、認知負荷を増やすエージェントを統合または停止するフォールバック設計を扱います。記事の障害モード台帳を、実際の事後検証として再現したような内容です。

上級者
10 分の読書
記事

本番AIの失敗モード:デモの後に何が壊れるのか

AIシステムの失敗には、ハルシネーション、古いコンテキスト、過度な迎合、プロンプトインジェクション、危険なツール実行、スキーマドリフト、弱いフォールバックなど、予測可能なパターンがあります。実運用のワークフローを提供するチームのための失敗モード台帳です。

上級者
11 分の読書
記事

チャンク分割、リランキング、ハイブリッド検索:RAGを実用レベルにする

多くのRAG実装がうまく機能しない原因は、3つの点を誤っていることです。検索エンジニアにならなくても実践できる、文書のチャンク分割、結果のリランキング、キーワード検索とセマンティック検索の組み合わせ方を解説します。

中級者
107 分
動画

AI評価がプロダクト開発者の注目スキルである理由|Hamel Husain、Shreya Shankar

Lenny's Podcast. Hamel HusainとShreya Shankarが、実際の不動産管理AIアシスタントを使って評価ワークフロー全体を解説します。トレースの確認、エラーのオープンコーディングとアキシャルコーディング、作業を終了するタイミングの判断、LLM-as-a-judgeの構築、人間の判断に照らした検証まで扱います。MLエンジニアではなく、プロダクトマネージャーやチームリーダーを真に対象とする貴重な長編対談であり、記事が推奨する「セットアップ後は週30分」という進め方にも対応しています。

中級者
3 分
動画

Anthropic Consoleでプロンプトを評価する

Anthropic. Workbench内で実際の評価を行う方法をAnthropicが3分で解説します。現実的なテストケースの自動生成、出力の採点、プロンプトの調整、同じテスト一式の再実行と並列比較を扱います。視聴回数は通常の基準を下回りますが、「コードを書かずに実際にどう評価するのか」を示す最も分かりやすい公式デモです。より戦略的なHusainとShankarの対談を適切に補完します。

中級者
55 分
動画

LLM評価を体系的に構築する方法(指標、単体テスト、LLM-as-a-Judge)

Dave Ebbelaar. 現役のAIエンジニアが、実際に使用している評価の段階構成を説明します。アサーション形式の単体テスト、参照答案を必要としない指標、人間の判断と整合させたLLM-as-a-Judge、分析・測定・改善のループを扱います。この構成は、評価をランキングではなくリグレッション検出システムとして捉える記事の主張に、動画として最も近いものです。

上級者
19 分
動画

ドメイン固有のLLM評価システムを構築する方法:Hamel Husain、Emil Sedgh

AI Engineer. Hamel HusainとRechatのCTOが、実際のAI製品を支える評価システムを解説します。汎用の既製評価が失敗する理由、アサーション、人間がレビューするログ済みトレース、ドメイン専門家と整合性を保つLLM判定を重ねた構成、さらに機能する評価システムがデータの選別とファインチューニングをどう可能にするかを説明しています。評価はランキングではなくリグレッションを検出する仕組みだという記事の主張を裏づける、本番環境のケーススタディです。

上級者
9 分
動画

LangSmithを10分で学ぶ

LangChain. LangChainの共同創業者が、LLMのトレース、プロジェクト、データセットを案内します。トークンコスト、レイテンシー、エラー率、フィードバックの集約、単一の検索ステップのスパンを掘り下げる方法を扱います。「すべての呼び出しが1つのスパンである」という記事の説明と、構造化トレースがprint文によるログより優れている理由を、視覚的に最も近い形で確認できます。

上級者
154 分
動画

LLMの計測と評価

Hamel Husain. Hamel Husain、Eugene Yan、Brian Bischof、Harrison Chase、Shreya Shankarが、トレース、ログ分析、LLM-as-a-Judge、実際の本番データを確認するためのワークフローに取り組みます。長時間のポッドキャストと同じように、腰を据えて視聴してください。記事の「トレースを確認する」という主張をYouTube上で最も深く掘り下げた動画です。

上級者