1:46:33Lenny's Podcast
Hamel Husain和Shreya Shankar以一个真实的物业管理AI助手为例,完整讲解评估工作流:查看追踪记录,对错误进行开放式编码和轴心编码,判断何时停止,构建“LLM充当评审”,并依据人工判断验证它。这类真正面向产品经理和团队负责人(而非机器学习工程师)的长篇对谈非常少见,它还涵盖了文章建议的“设置完成后每周投入30分钟”节奏。
您应该从中获得什么: 掌握面向产品构建者的评估闭环:检查追踪记录、标注故障、定义标准、测试改动,并与人工判断进行比较。
先观看或了解: 至少有一个质量可能随时间改善或下降的AI工作流。
AI Expert 注释: 这仍是最适合非工程师的AI评估讲解之一,因为它关注的是工作流纪律,而不是特定工具。保留这套方法,再根据你的隐私和可观测性约束选择工具。
