9 分LangSmithを10分で学ぶ
LangSmithでトレース、プロジェクト、データセットを操作し、トークンコスト、レイテンシー、エラー率、スパンごとの詳細を読み取れます。
AI Engineer. Hamel HusainとRechatのCTOが、実際のAI製品を支える評価システムを解説します。汎用の既製評価が失敗する理由、アサーション、人間がレビューするログ済みトレース、ドメイン専門家と整合性を保つLLM判定を重ねた構成、さらに機能する評価システムがデータの選別とファインチューニングをどう可能にするかを説明しています。評価はランキングではなくリグレッションを検出する仕組みだという記事の主張を裏づける、本番環境のケーススタディです。
2024年半ばに収録された動画です。個々のツールは進化していますが、システム設計は変わっていません。ベンダーガイドではなくアーキテクチャの参考資料として扱い、講演が強調するように、ドメイン専門家を必ずプロセスに参加させてください。
本番チームがアサーション、人による確認、LLM判定をどう重ね、リリース前にリグレッションを表面化させているかを確認できます。
LLM評価の基本用語と、記事で説明する段階的な評価の考え方を理解していること。
最終確認日:2026年7月15日
同じ学習パスで次のキュレーション済みの補完動画を続けて視聴してください。
このトピックについてさらに詳しく学べる、厳選された外部コースです。
Emory University Goizueta Business School faculty
The deeper, university-level counterpart to our beginner HubSpot marketing pick — Emory's business-school treatment goes past 'how to prompt' into training generative models for brand-specific output, the purchase-funnel economics of AI-generated content, and a full module of genuine skepticism about when generative AI is and isn't worth using in marketing.
IBM AI Academy
生成AI時代の経営戦略という問いに答える講座です。技術知識を必要とせず、生成AIが価値を生む領域、責任あるガバナンスの方法、漠然とした「AIを活用すべき」という考えを具体的で説明可能なユースケースへ変える方法を、経営層向けの3つの短期講座で学びます。約700件のレビューで評価は4.6です。次のAI予算を決める前の受講をおすすめします。