评估、可观测性与质量
衡量AI行为、发现回归、追踪成本和延迟,并持续改进工作流。
12 项内容 (5 篇文章 · 7 个视频)
从这里开始
浏览完整内容之前,先阅读几篇推荐文章。
10 分钟阅读面向非工程师的评估:判断AI工作流正在变好还是变差
评估(系统衡量AI输出质量)通常被视为工程问题。但每个运行AI工作流的团队都需要评估,而且无需编写代码也能掌握基础方法。本文将说明具体做法。
中级
13 分钟阅读构建真正能捕获回归的评估
大多数评估套件看起来令人印象深刻,却会漏掉真正的回归。要构建能够捕获关键问题的评估,需要仔细构造数据集、使用敏感的指标、校准评判模型,并建立信任文化。本文介绍优秀团队采用的实践模式。
高级
12 分钟阅读LLM应用的可观测性:追踪、成本、延迟与质量漂移
LLM应用有其独特的故障方式,传统可观测性无法捕捉。本文介绍追踪多步骤流程、跟踪单次调用相差可达100倍的成本、监控质量漂移,以及在生产规模下调试幻觉的模式。
高级此主题下的更多内容
69 分钟智能体生态:将智能体投入生产后得到的经验
MLOps.community. Prosus的AI副总裁和一位AI工程师讲述了他们在集团旗下公司部署智能体时真正出现的问题:上线前进行提示词注入渗透测试;Jira智能体无法理解人类简写而执行了不安全的写入;通过让智能体明确展示自身假设来处理陈旧上下文;以及在降级设计中,一旦智能体增加认知负担,就将其合并或停用。这就像把文章中的失败模式登记表搬进了一场现场复盘。
高级
10 分钟阅读生产AI失败模式:演示之后会出什么问题
AI系统通常以可预测的方式失败:幻觉、上下文过时、过度迎合、提示词注入、不安全的工具调用、模式漂移和薄弱的降级机制。这是一份面向真实工作流交付团队的生产AI失败模式清单。
高级
11 分钟阅读分块、重排序与混合搜索:让RAG真正发挥作用
大多数RAG实现效果不佳,是因为三个环节出了问题。本实用指南介绍如何对文档分块、对结果重排序,并将关键词搜索与语义搜索结合起来,而无需成为搜索工程师。
中级
107 分钟为什么AI评估是产品构建者最热门的新技能|Hamel Husain与Shreya Shankar
Lenny's Podcast. Hamel Husain和Shreya Shankar以一个真实的物业管理AI助手为例,完整讲解评估工作流:查看追踪记录,对错误进行开放式编码和轴心编码,判断何时停止,构建“LLM充当评审”,并依据人工判断验证它。这类真正面向产品经理和团队负责人(而非机器学习工程师)的长篇对谈非常少见,它还涵盖了文章建议的“设置完成后每周投入30分钟”节奏。
中级
3 分钟在Anthropic Console中评估提示词
Anthropic. Anthropic用3分钟演示如何在Workbench中开展一次真实评估:自动生成贴近实际的测试用例、为输出评分、调整提示词,然后重新运行同一套测试并进行并排比较。观看次数低于通常的收录门槛,但要回答“我怎样才能不写代码就真正完成评估”,这是最清楚的官方演示,也恰好能承接更偏战略的Husain/Shankar对谈。
中级
55 分钟如何系统构建LLM评估(指标、单元测试、LLM裁判)
Dave Ebbelaar. 一位一线AI工程师演示他实际采用的评估阶梯——断言式单元测试、无参考指标、让大语言模型评判与人类判断对齐,以及分析/衡量/改进循环。其结构与文章的主张最为接近:评估是用于捕获回归的系统,而不是排行榜。
高级
19 分钟如何构建领域专用的LLM评估系统:Hamel Husain与Emil Sedgh
AI Engineer. Hamel Husain与Rechat的CTO讲解一个真实AI产品背后的评估系统:通用现成评估为何会失败;如何分层设置断言、带人工审核的追踪日志,以及持续与领域专家对齐的大语言模型评判;一套有效的评估系统又如何推动数据策展和微调。它是文章核心主张的生产案例研究:评估是捕获回归的机制,而不是排行榜。
高级
9 分钟10分钟了解LangSmith
LangChain. LangChain联合创始人带你浏览大语言模型追踪、项目和数据集,涵盖token成本、延迟、错误率、反馈汇总,以及深入查看单个检索步骤的Span。文章谈到“每次调用都是一个Span”以及结构化追踪为何优于打印日志时,这段视频提供了最直观的视觉对应。
高级
154 分钟LLM的可观测性与评估
Hamel Husain. Hamel Husain、Eugene Yan、Brian Bischof、Harrison Chase和Shreya Shankar共同讲解追踪、日志分析、大语言模型评判,以及查看真实生产数据的工作流程。可以像听长篇播客一样耐心观看——这是YouTube上对文章“查看你的追踪”这一主张最深入的单一讲解。
高级