55 分钟如何系统构建LLM评估(指标、单元测试、LLM裁判)
设计一套评估阶梯,在提示或模型变更触达用户之前捕获回归。
Anthropic. Anthropic应用AI团队围绕保险理赔提示开展实时构建:他们从一条模糊指令开始,逐步迭代为开发者真正可以发布的内容,展示文章所述系统层和开发者层的修改方式。建议先观看本视频,再重读文章中有关示例、输出结构和拒绝处理的检查清单。
重点关注迭代过程,而不是最终提示——保险理赔示例展示了文章检查清单所编码的系统层和开发者层修改。
观察一条模糊的保险理赔提示如何转变为结构化、可测试的提示,并获得更清晰的示例、输出规则和拒绝行为。
具备基本的提示编写能力;文章中的分层模型会为你提供合适的观察视角。
最后审核:2026年5月18日
通过相同的视频学习路径,继续观看下一个精选配套视频。
精选的外部课程,帮助您更深入地了解该主题。
Isa Fulford · Andrew Ng
用90分钟获得相当于一年实践积累的直觉。如果你已经开始编写调用LLM的代码,或正准备这样做,这是目前网上最高效的课程,能帮你弥合“试用ChatGPT”和“交付一项调用LLM的功能”之间的差距。
Microsoft Learn
Prompt engineering, but for the tool most office workers will actually touch first. Microsoft's own four-part prompting framework (goal, context, source, expectation) is a genuinely useful mental model, and unlike the generic ChatGPT prompting courses already in our catalog, this one is grounded entirely in Microsoft 365 Copilot's specific quirks and grounding behavior.