主题

生产级LLM应用

让LLM应用走出演示阶段,完成架构设计、发布、观测和运维。

31 项内容 (20 篇文章 · 11 个视频)

从这里开始

浏览完整内容之前,先阅读几篇推荐文章。

此主题下的更多内容

69 分钟
视频

智能体生态:将智能体投入生产后得到的经验

MLOps.community. Prosus的AI副总裁和一位AI工程师讲述了他们在集团旗下公司部署智能体时真正出现的问题:上线前进行提示词注入渗透测试;Jira智能体无法理解人类简写而执行了不安全的写入;通过让智能体明确展示自身假设来处理陈旧上下文;以及在降级设计中,一旦智能体增加认知负担,就将其合并或停用。这就像把文章中的失败模式登记表搬进了一场现场复盘。

高级
11 分钟阅读
文章

LangGraph、CrewAI还是直接调用API:2026年如何选择智能体框架

2026年的智能体框架生态比以往成熟,却依然没有明确的统一选择。LangGraph、CrewAI、Pydantic AI、OpenAI Agents SDK和直接调用API各自适合一部分团队和项目,但没有一种方案适用于所有情况。本文将如实比较这些方案,并提供一套决策框架。

高级
13 分钟阅读
文章

如何设计不会无限循环的智能体

生产环境中最常见的智能体故障,是陷入无限或近乎无限的循环:智能体不断重试、转向分支,消耗大量token,却没有取得进展。本文介绍如何通过架构设计避免这类问题,让智能体即使面对困难任务也能正常结束。

高级
12 分钟阅读
文章

生产环境中的计算机操作与浏览器智能体

计算机操作与浏览器智能体的演示经常引发热议,但大规模生产部署呈现出另一番面貌:任务范围更窄、约束措施更多、用户体验设计更谨慎。本文介绍行之有效的模式、反复出现的故障,以及真实的成本效益。

高级
12 分钟阅读
文章

上下文工程:管理100万token的窗口,同时避免上下文退化

100万token的上下文窗口已经成为现实,但远未达到上限时,质量就会开始下降。上下文工程研究如何有效使用上下文窗口:该纳入什么、该总结什么、该实时检索什么,以及如何在上下文不断增长时维持高质量。

高级
12 分钟阅读
文章

推理成本优化:提示缓存、路由与输出控制

采用正确的技术,LLM推理成本可降低60–90%。提示缓存、模型路由、输出控制、批处理,以及一些不太为人所知的模式。本文介绍具体数字、实践模式,以及区分管理良好的推理系统与失控账单的生产纪律。

高级
13 分钟阅读
文章

构建真正能捕获回归的评估

大多数评估套件看起来令人印象深刻,却会漏掉真正的回归。要构建能够捕获关键问题的评估,需要仔细构造数据集、使用敏感的指标、校准评判模型,并建立信任文化。本文介绍优秀团队采用的实践模式。

高级
13 分钟阅读
文章

2026年的微调:LoRA何时胜过RAG,以及如何不靠集群完成微调

LoRA微调已不再遥不可及——你可以在笔记本电脑上真正完成微调,也可以租用一小时GPU。本文介绍行之有效的方法、微调胜过RAG的场景,以及从数据准备到部署的实用端到端工作流。

高级
14 分钟阅读
文章

从零构建MCP:使用TypeScript打造生产就绪的服务器

构建生产级Model Context Protocol服务器,不能只是连接几个工具。本文介绍Schema设计、身份验证、错误处理、流式传输、可观测性的模式,以及让MCP服务器在规模化场景中真正发挥作用的生产现实。

高级
12 分钟阅读
文章

设计LLM真正能够正确使用的MCP工具

我们看到的大多数MCP工具在技术上正确,在实践中却毫无用处。LLM会忽略、误用,或以无益的方式调用它们。本文介绍让LLM自然采用工具的设计原则,并给出常见失败及其修复示例。

高级
12 分钟阅读
文章

为长期运行的智能体构建记忆系统

智能体需要上下文窗口之外的记忆。长期记忆架构——存储什么、何时检索、如何遗忘——决定了智能体是像真正“了解”你一样延续互动,还是每次对话都从零开始。本文介绍相关设计模式及其生产环境权衡。

高级
10 分钟阅读
文章

多模型编排:按成本、延迟和质量进行路由

所有任务都使用同一个模型是新手做法。生产AI系统会将不同请求路由到不同模型——既节省60–90%的成本,又提高质量。本文将介绍其中的模式、路由逻辑和权衡。

中级
12 分钟阅读
文章

LLM应用的可观测性:追踪、成本、延迟与质量漂移

LLM应用有其独特的故障方式,传统可观测性无法捕捉。本文介绍追踪多步骤流程、跟踪单次调用相差可达100倍的成本、监控质量漂移,以及在生产规模下调试幻觉的模式。

高级
12 分钟阅读
文章

构建生产级RAG:摄取、嵌入、检索、重排序与评估

生产级RAG流水线包含六个阶段,每个阶段都有决定质量的特定模式。本文介绍整体架构、各阶段的选择,以及让有效RAG与令人失望的RAG拉开差距的迭代评估规范。

高级
14 分钟阅读
文章

提示词注入与大语言模型安全:威胁模型与纵深防御

提示词注入是长期存在的一类大语言模型安全风险,并非提示词编写失误。本文是一份面向生产环境的指南,涵盖威胁模型、数据边界、工具权限、回归测试、监控和事件响应。

高级
12 分钟阅读
文章

如何在提示词、RAG与微调之间选择(以及何时组合)

提示词、RAG和微调是让LLM适应你的问题的三大手段。它们各有适用和不适用的问题。本文提供选择框架、各自的实际成本,以及组合使用时效果突出的生产模式。

高级
13 分钟阅读
文章

发布LLM产品:定价、利润率与反护城河陷阱

LLM驱动产品面临比传统SaaS更严峻的经济问题:随使用量增长的可变成本、受推理挤压的利润率、商品化风险,以及使用相同基础模型的竞争对手。如何打造真正具有防御力的产品,以及哪些模式会让LLM初创公司最终消失。

高级
13 分钟阅读
文章

结构化输出与函数调用:生产环境中的实践模式

结构化输出和函数调用是从“生成文本的大语言模型(LLM)”走向“实际执行工作的系统”的桥梁。在生产环境中,真正重要的模式围绕模式定义、错误处理、幂等性和优雅降级展开,而不只是JSON模式。

高级
211 分钟
视频

深入解析ChatGPT等LLM

Andrej Karpathy. 这是YouTube上对大语言模型本质最清晰的端到端讲解,涵盖预训练、token化、SFT、RLHF、推理强化学习、工具使用和幻觉,详细程度足以帮助工程师分析模型权衡。完整看过一遍后,文章中的“GPT级模型、开放权重模型与推理模型”之选就不再像品牌选择,而会成为训练方案的选择。

高级
40 分钟
视频

Andrej Karpathy:软件正在再次改变

Y Combinator. Karpathy在AI Startup School的主题演讲中,将大语言模型描述为一种新型计算机——公用事业、晶圆厂和操作系统三者合一——并主张打造由人类掌控约束的“部分自主”产品。这是对文章所采用的架构层面思维模型最清晰的阐述:你是在为一种可编程基础载体选择推理供应商与工具,而不是在选择聊天机器人。

高级
9 分钟
视频

10分钟了解LangSmith

LangChain. LangChain联合创始人带你浏览大语言模型追踪、项目和数据集,涵盖token成本、延迟、错误率、反馈汇总,以及深入查看单个检索步骤的Span。文章谈到“每次调用都是一个Span”以及结构化追踪为何优于打印日志时,这段视频提供了最直观的视觉对应。

高级
154 分钟
视频

LLM的可观测性与评估

Hamel Husain. Hamel Husain、Eugene Yan、Brian Bischof、Harrison Chase和Shreya Shankar共同讲解追踪、日志分析、大语言模型评判,以及查看真实生产数据的工作流程。可以像听长篇播客一样耐心观看——这是YouTube上对文章“查看你的追踪”这一主张最深入的单一讲解。

高级
77 分钟
视频

深入解析AI提示工程

Anthropic. 四位来自研究、对齐、应用和开发者关系领域的Anthropic提示工程师深入讨论实际的日常工作:如何在压力下修改提示,如何理解指令中的“诚实”,XML脚手架何时有用、何时无用。文章的分层模型与他们描述的工作方式高度吻合;这也是以口头讲解方式理解该思维模型的最佳材料。

高级
25 分钟
视频

提示入门|Code with Claude

Anthropic. Anthropic应用AI团队围绕保险理赔提示开展实时构建:他们从一条模糊指令开始,逐步迭代为开发者真正可以发布的内容,展示文章所述系统层和开发者层的修改方式。建议先观看本视频,再重读文章中有关示例、输出结构和拒绝处理的检查清单。

高级
42 分钟
视频

垂直AI智能体市场可能达到SaaS的10倍

Y Combinator. Lightcone主持人通过具体案例,分析了为什么垂直AI智能体,而不是横向封装层,才是应用层公司具有防御力的形态,并坦率讨论哪些类别会被模型提供商吞噬。这正是文章警告的反护城河陷阱,只不过视频将其表达为一套正向行动指南。

高级
34 分钟
视频

AI如何重塑软件商业模式:Sierra的Bret Taylor

Sequoia Capital. Bret Taylor讲解了从按席位收费的SaaS转向按成果定价的过程:应以什么为定价锚点(解决率、CSAT、NPS)、为什么现有企业难以跟进,以及垂直领域专业化如何创造定价能力。这与文章的定价和利润率章节直接呼应。

高级
41 分钟
视频

OpenAI DevDay 2024|用结构化输出构建可靠应用

OpenAI. 视频详细讲解`strict: true`、它与旧JSON模式的区别、拒绝处理,以及函数调用与响应格式Schema如何组合。它的价值恰恰在于说明API为你提供的契约,而文章中的生产模式正是构建在这份契约之上。

高级
18 分钟
视频

只需Pydantic:Jason Liu

AI Engineer. 这场演讲明确提出了现代模式:“定义Pydantic模型,将其交给大语言模型,其余工作交给验证机制”,并给出嵌套对象、捕获虚构URL的验证器,以及将思维链作为类型化字段等具体示例。观看后再读文章中的验证器章节,你就会明白其中重试与拒绝规则的由来。

高级