55 分钟如何系统构建LLM评估(指标、单元测试、LLM裁判)
设计一套评估阶梯,在提示或模型变更触达用户之前捕获回归。
Anthropic. 四位来自研究、对齐、应用和开发者关系领域的Anthropic提示工程师深入讨论实际的日常工作:如何在压力下修改提示,如何理解指令中的“诚实”,XML脚手架何时有用、何时无用。文章的分层模型与他们描述的工作方式高度吻合;这也是以口头讲解方式理解该思维模型的最佳材料。
可以把它当成长篇播客来听——它的价值在于,让你听到那些在真实压力下修改提示的人亲口阐释文章中的分层思维模型。
了解生产环境提示工程师如何在真实压力下修改指令、示例和行为约束,而不是把提示当作一次性文本。
你应该已经在某处发布并维护提示——这是从业者圆桌讨论,不是一门课程。
最后审核:2026年5月18日
通过相同的视频学习路径,继续观看下一个精选配套视频。
精选的外部课程,帮助您更深入地了解该主题。
Isa Fulford · Andrew Ng
用90分钟获得相当于一年实践积累的直觉。如果你已经开始编写调用LLM的代码,或正准备这样做,这是目前网上最高效的课程,能帮你弥合“试用ChatGPT”和“交付一项调用LLM的功能”之间的差距。
Microsoft Learn
Prompt engineering, but for the tool most office workers will actually touch first. Microsoft's own four-part prompting framework (goal, context, source, expectation) is a genuinely useful mental model, and unlike the generic ChatGPT prompting courses already in our catalog, this one is grounded entirely in Microsoft 365 Copilot's specific quirks and grounding behavior.