55 分LLM評価を体系的に構築する方法(指標、単体テスト、LLM-as-a-Judge)
プロンプトやモデルの変更がユーザーに届く前にリグレッションを検出する、段階的な評価を設計できます。
Anthropic. AnthropicのApplied AIチームが保険金請求用プロンプトをライブで構築するセッションです。曖昧な指示から始めて、開発者が実際に提供できる形まで反復改善し、記事で説明しているシステムレイヤーと開発者レイヤーの修正を実演します。記事にある例、出力構造、拒否の処理に関するチェックリストを読み直す前に視聴してください。
完成したプロンプトではなく、反復改善の過程に注目してください。保険金請求の構築例は、記事のチェックリストに体系化されたシステムレイヤーと開発者レイヤーの修正を示しています。
曖昧な保険金請求用プロンプトが、より明確な例、出力ルール、拒否時の振る舞いを備えた、構造化されテスト可能なプロンプトへ変わる過程を確認できます。
プロンプティングの基礎を身につけていること。記事のレイヤーモデルが、適切な見方を与えてくれます。
最終確認日:2026年5月18日
同じ学習パスで次のキュレーション済みの補完動画を続けて視聴してください。
このトピックについてさらに詳しく学べる、厳選された外部コースです。
Isa Fulford · Andrew Ng
90分で1年分の勘所を学べます。LLMを呼び出すコードを書き始めた人、またはこれから書こうとしている人にとって、「ChatGPTを試す」段階と「LLMを呼び出す機能をリリースする」段階の差を埋める、オンラインで最も効率的な講座です。
Microsoft Learn
Prompt engineering, but for the tool most office workers will actually touch first. Microsoft's own four-part prompting framework (goal, context, source, expectation) is a genuinely useful mental model, and unlike the generic ChatGPT prompting courses already in our catalog, this one is grounded entirely in Microsoft 365 Copilot's specific quirks and grounding behavior.