55:02Dave Ebbelaar
現役のAIエンジニアが、実際に使用している評価の段階構成を説明します。アサーション形式の単体テスト、参照答案を必要としない指標、人間の判断と整合させたLLM-as-a-Judge、分析・測定・改善のループを扱います。この構成は、評価をランキングではなくリグレッション検出システムとして捉える記事の主張に、動画として最も近いものです。
このセクションから得られるもの: プロンプトやモデルの変更がユーザーに届く前にリグレッションを検出する、段階的な評価を設計できます。
視聴または事前に知っておくべきもの: 既知の失敗例があるAIワークフローを提供または保守した経験。
AI Expertの注記: ツールの選択には古くなるものもありますが、段階構成は堅実です。まず決定論的なチェックを行い、次に人間の判断で検証したモデル採点を行います。LLMによる判定を簡単に追加できるからといって、キャリブレーションを省略しないでください。
