55 分LLM評価を体系的に構築する方法(指標、単体テスト、LLM-as-a-Judge)
プロンプトやモデルの変更がユーザーに届く前にリグレッションを検出する、段階的な評価を設計できます。
Anthropic. 研究、アラインメント、応用、開発者向け広報を担当するAnthropicの4人のプロンプトエンジニアが、日々の実務について詳しく語ります。切迫した状況でプロンプトをどう修正するか、指示の「正直さ」をどう考えるか、XMLによる足場作りが役立つ場合と役立たない場合などを扱います。記事のレイヤーモデルは、登壇者が説明する実務にきれいに対応しています。そのメンタルモデルを当事者の言葉で理解する最良の方法です。
長時間のポッドキャストのように視聴してください。実際にプレッシャーの中でプロンプトを修正する人々の言葉で、記事のレイヤー型メンタルモデルを聞けることに価値があります。
プロンプトを単発の文章として扱うのではなく、本番環境のプロンプトエンジニアが現実のプレッシャーの中で指示、例、振る舞いの制約をどう改訂するかを学べます。
すでに何らかの環境でプロンプトを提供していること。講座ではなく、実務家による座談会です。
最終確認日:2026年5月18日
同じ学習パスで次のキュレーション済みの補完動画を続けて視聴してください。
このトピックについてさらに詳しく学べる、厳選された外部コースです。
Isa Fulford · Andrew Ng
90分で1年分の勘所を学べます。LLMを呼び出すコードを書き始めた人、またはこれから書こうとしている人にとって、「ChatGPTを試す」段階と「LLMを呼び出す機能をリリースする」段階の差を埋める、オンラインで最も効率的な講座です。
Microsoft Learn
Prompt engineering, but for the tool most office workers will actually touch first. Microsoft's own four-part prompting framework (goal, context, source, expectation) is a genuinely useful mental model, and unlike the generic ChatGPT prompting courses already in our catalog, this one is grounded entirely in Microsoft 365 Copilot's specific quirks and grounding behavior.