55:02Dave Ebbelaar
一位一线AI工程师演示他实际采用的评估阶梯——断言式单元测试、无参考指标、让大语言模型评判与人类判断对齐,以及分析/衡量/改进循环。其结构与文章的主张最为接近:评估是用于捕获回归的系统,而不是排行榜。
您应该从中获得什么: 设计一套评估阶梯,在提示或模型变更触达用户之前捕获回归。
先观看或了解: 有发布或维护AI工作流的经验,并掌握已知的故障示例。
AI Expert 注释: 有些工具选择会过时,但这一阶梯依然可靠:先进行确定性检查,再进行与人类判断校准过的模型评分检查。不要仅仅因为添加大语言模型评判很容易,就跳过校准。
