配套视频

构建真正能捕获回归的评估——配套视频

在大语言模型工作中,评估设计是YouTube上优质资料相对匮乏的领域——热门内容大多在讨论“哪个基准测试最好”,而不是“如何防止产品质量悄然下降”。两项推荐的观看次数都低于我们通常的门槛,因为这一细分领域的现状确实如此;它们是目前最清晰的两份资料——一份是动手实践式的个人构建演示,另一份是生产案例研究——两者结合,可以让你从不同角度审视同一个问题。

首选视频

55:02
如何系统构建LLM评估(指标、单元测试、LLM裁判)

Dave Ebbelaar

一位一线AI工程师演示他实际采用的评估阶梯——断言式单元测试、无参考指标、让大语言模型评判与人类判断对齐,以及分析/衡量/改进循环。其结构与文章的主张最为接近:评估是用于捕获回归的系统,而不是排行榜。

您应该从中获得什么: 设计一套评估阶梯,在提示或模型变更触达用户之前捕获回归。

先观看或了解: 有发布或维护AI工作流的经验,并掌握已知的故障示例。

AI Expert 注释: 有些工具选择会过时,但这一阶梯依然可靠:先进行确定性检查,再进行与人类判断校准过的模型评分检查。不要仅仅因为添加大语言模型评判很容易,就跳过校准。

打开视频页面

也值得关注

18:44
如何构建领域专用的LLM评估系统:Hamel Husain与Emil Sedgh

AI Engineer

Hamel Husain与Rechat的CTO讲解一个真实AI产品背后的评估系统:通用现成评估为何会失败;如何分层设置断言、带人工审核的追踪日志,以及持续与领域专家对齐的大语言模型评判;一套有效的评估系统又如何推动数据策展和微调。它是文章核心主张的生产案例研究:评估是捕获回归的机制,而不是排行榜。

您应该从中获得什么: 了解生产团队如何分层结合断言、人工审核和大语言模型评判,让回归在发布前暴露出来。

先观看或了解: 熟悉基本的大语言模型评估术语,以及文章提出的评估阶梯框架。

AI Expert 注释: 视频录制于2024年年中;具体工具已经发展,但系统设计并未过时。请将其视为架构参考,而不是供应商指南;并按视频强调的那样,让领域专家持续参与。

打开视频页面