主题

评估、可观测性与质量

衡量AI行为、发现回归、追踪成本和延迟,并持续改进工作流。

12 项内容 (5 篇文章 · 7 个视频)

从这里开始

浏览完整内容之前,先阅读几篇推荐文章。

此主题下的更多内容

69 分钟
视频

智能体生态:将智能体投入生产后得到的经验

MLOps.community. Prosus的AI副总裁和一位AI工程师讲述了他们在集团旗下公司部署智能体时真正出现的问题:上线前进行提示词注入渗透测试;Jira智能体无法理解人类简写而执行了不安全的写入;通过让智能体明确展示自身假设来处理陈旧上下文;以及在降级设计中,一旦智能体增加认知负担,就将其合并或停用。这就像把文章中的失败模式登记表搬进了一场现场复盘。

高级
10 分钟阅读
文章

生产AI失败模式:演示之后会出什么问题

AI系统通常以可预测的方式失败:幻觉、上下文过时、过度迎合、提示词注入、不安全的工具调用、模式漂移和薄弱的降级机制。这是一份面向真实工作流交付团队的生产AI失败模式清单。

高级
11 分钟阅读
文章

分块、重排序与混合搜索:让RAG真正发挥作用

大多数RAG实现效果不佳,是因为三个环节出了问题。本实用指南介绍如何对文档分块、对结果重排序,并将关键词搜索与语义搜索结合起来,而无需成为搜索工程师。

中级
107 分钟
视频

为什么AI评估是产品构建者最热门的新技能|Hamel Husain与Shreya Shankar

Lenny's Podcast. Hamel Husain和Shreya Shankar以一个真实的物业管理AI助手为例,完整讲解评估工作流:查看追踪记录,对错误进行开放式编码和轴心编码,判断何时停止,构建“LLM充当评审”,并依据人工判断验证它。这类真正面向产品经理和团队负责人(而非机器学习工程师)的长篇对谈非常少见,它还涵盖了文章建议的“设置完成后每周投入30分钟”节奏。

中级
3 分钟
视频

在Anthropic Console中评估提示词

Anthropic. Anthropic用3分钟演示如何在Workbench中开展一次真实评估:自动生成贴近实际的测试用例、为输出评分、调整提示词,然后重新运行同一套测试并进行并排比较。观看次数低于通常的收录门槛,但要回答“我怎样才能不写代码就真正完成评估”,这是最清楚的官方演示,也恰好能承接更偏战略的Husain/Shankar对谈。

中级
55 分钟
视频

如何系统构建LLM评估(指标、单元测试、LLM裁判)

Dave Ebbelaar. 一位一线AI工程师演示他实际采用的评估阶梯——断言式单元测试、无参考指标、让大语言模型评判与人类判断对齐,以及分析/衡量/改进循环。其结构与文章的主张最为接近:评估是用于捕获回归的系统,而不是排行榜。

高级
19 分钟
视频

如何构建领域专用的LLM评估系统:Hamel Husain与Emil Sedgh

AI Engineer. Hamel Husain与Rechat的CTO讲解一个真实AI产品背后的评估系统:通用现成评估为何会失败;如何分层设置断言、带人工审核的追踪日志,以及持续与领域专家对齐的大语言模型评判;一套有效的评估系统又如何推动数据策展和微调。它是文章核心主张的生产案例研究:评估是捕获回归的机制,而不是排行榜。

高级
9 分钟
视频

10分钟了解LangSmith

LangChain. LangChain联合创始人带你浏览大语言模型追踪、项目和数据集,涵盖token成本、延迟、错误率、反馈汇总,以及深入查看单个检索步骤的Span。文章谈到“每次调用都是一个Span”以及结构化追踪为何优于打印日志时,这段视频提供了最直观的视觉对应。

高级
154 分钟
视频

LLM的可观测性与评估

Hamel Husain. Hamel Husain、Eugene Yan、Brian Bischof、Harrison Chase和Shreya Shankar共同讲解追踪、日志分析、大语言模型评判,以及查看真实生产数据的工作流程。可以像听长篇播客一样耐心观看——这是YouTube上对文章“查看你的追踪”这一主张最深入的单一讲解。

高级