9 分钟10分钟了解LangSmith
你将能够在LangSmith中浏览追踪、项目和数据集,并读取token成本、延迟、错误率和每个Span的详细信息。
Dave Ebbelaar. 一位一线AI工程师演示他实际采用的评估阶梯——断言式单元测试、无参考指标、让大语言模型评判与人类判断对齐,以及分析/衡量/改进循环。其结构与文章的主张最为接近:评估是用于捕获回归的系统,而不是排行榜。
有些工具选择会过时,但这一阶梯依然可靠:先进行确定性检查,再进行与人类判断校准过的模型评分检查。不要仅仅因为添加大语言模型评判很容易,就跳过校准。
设计一套评估阶梯,在提示或模型变更触达用户之前捕获回归。
有发布或维护AI工作流的经验,并掌握已知的故障示例。
最后审核:2026年5月18日
通过相同的视频学习路径,继续观看下一个精选配套视频。
精选的外部课程,帮助您更深入地了解该主题。
Emory University Goizueta Business School faculty
The deeper, university-level counterpart to our beginner HubSpot marketing pick — Emory's business-school treatment goes past 'how to prompt' into training generative models for brand-specific output, the purchase-funnel economics of AI-generated content, and a full module of genuine skepticism about when generative AI is and isn't worth using in marketing.
IBM AI Academy
这是生成式AI时代对高管战略问题的解答。三门短课直接面向企业领导者,无需技术背景,内容涵盖生成式AI在何处创造价值、如何负责任地治理它,以及如何把模糊的“我们应该使用AI”转化为具体且站得住脚的用例。约700条评价的综合评分为4.6分。最适合在你下一次作出AI预算决策前学习。