成本与模型运维
控制推理成本、选择托管模式、路由模型并理解运维权衡。
13 项内容 (6 篇文章 · 7 个视频)
从这里开始
浏览完整内容之前,先阅读几篇推荐文章。
10 分钟阅读多模型编排:按成本、延迟和质量进行路由
所有任务都使用同一个模型是新手做法。生产AI系统会将不同请求路由到不同模型——既节省60–90%的成本,又提高质量。本文将介绍其中的模式、路由逻辑和权衡。
中级
12 分钟阅读推理成本优化:提示缓存、路由与输出控制
采用正确的技术,LLM推理成本可降低60–90%。提示缓存、模型路由、输出控制、批处理,以及一些不太为人所知的模式。本文介绍具体数字、实践模式,以及区分管理良好的推理系统与失控账单的生产纪律。
高级
11 分钟阅读自托管与托管推理对比:vLLM、TGI与盈亏平衡计算
自托管要达到什么规模才会胜过API调用?本文介绍实际计算、运维现实,以及区分哪些团队应该自托管、哪些团队应该继续为托管推理付费的模式。
高级此主题下的更多内容
13 分钟阅读2026年LLM技术栈:模型、推理、工具与权衡
从一线架构师的视角梳理2026年LLM技术栈:模型层级、推理服务商、编排层、评估工具,以及交付生产级AI时真正重要的权衡。这里汇集了我们希望在起步前就有人讲清楚的一切。
高级
6 分钟阅读免费版与付费版ChatGPT:升级究竟能得到什么
不讲术语,对比ChatGPT免费版、ChatGPT Plus和ChatGPT Pro——升级后有哪些变化,以及如何判断自己是否真的需要升级。
AI新手
10 分钟阅读在Mac上运行本地AI:Ollama、LM Studio,以及7B模型究竟能做什么
本地运行AI已日趋成熟。借助Ollama或LM Studio和一台现代Mac,你可以离线、免费且私密地运行能力不俗的模型。本文将介绍哪些方法可行、哪些不可行,以及真正能从中受益的使用场景。
中级
211 分钟深入解析ChatGPT等LLM
Andrej Karpathy. 这是YouTube上对大语言模型本质最清晰的端到端讲解,涵盖预训练、token化、SFT、RLHF、推理强化学习、工具使用和幻觉,详细程度足以帮助工程师分析模型权衡。完整看过一遍后,文章中的“GPT级模型、开放权重模型与推理模型”之选就不再像品牌选择,而会成为训练方案的选择。
高级
40 分钟Andrej Karpathy:软件正在再次改变
Y Combinator. Karpathy在AI Startup School的主题演讲中,将大语言模型描述为一种新型计算机——公用事业、晶圆厂和操作系统三者合一——并主张打造由人类掌控约束的“部分自主”产品。这是对文章所采用的架构层面思维模型最清晰的阐述:你是在为一种可编程基础载体选择推理供应商与工具,而不是在选择聊天机器人。
高级
19 分钟RAG会就此终结吗?Anthropic的新提示缓存
Prompt Engineering. 视频将Anthropic的提示缓存与Gemini的上下文缓存进行比较,并针对长文档聊天、少样本和多轮对话等用例给出具体的延迟与成本降幅。对缓存写入附加费与缓存读取折扣的拆解,正是文章讨论缓存何时划算时所采用的基础。
高级
56 分钟Build Hour:提示缓存
OpenAI. 这是OpenAI官方关于提示缓存的Build Hour,内容包括1024-token阈值、前缀稳定性要求、实时音频缓存的大幅折扣(确切费率请查看当前定价页面),以及长输入对首token延迟的影响。当你评估需要投入多少工程工作,才能让生产提示稳定命中缓存时,本视频很有帮助。
高级
19 分钟详解每一种AI模型
Tina Huang. 视频按层级清晰梳理当前的模型格局——旗舰模型、轻量模型、中档模型和专用模型——并通过具体选择说明各层级真正适合哪些任务。这对应文章中“先了解选项,再进行路由”的一半内容;Huang对成本与能力的分析方式也与文章一致,没有依赖基准测试炒作。
中级
9 分钟RouteLLM达到GPT4o质量的90%,成本还降低80%
Matthew Berman. 视频逐步讲解LMSYS的RouteLLM论文和代码:在强弱模型组合前放置一个小型分类器,由它决定调用哪个模型,最终仅用一小部分成本达到强模型约95%的质量。观看次数低于通常的100k门槛,但对于“展示真实模型路由,而不仅仅比较模型”这一具体需求,它是YouTube上最清晰的讲解,也与文章中的质量/成本权衡章节直接对应。
中级
32 分钟使用vLLM与PagedAttention实现高速LLM推理服务
Anyscale. 视频讲解了为什么朴素的LLM推理服务会浪费60–80%的GPU内存、PagedAttention如何借鉴操作系统式分页来解决这一问题,以及连续批处理为何能实现文章在计算中采用的24×吞吐量。看完后,文章中“利用率能达到50%就算幸运”这句话就不再抽象。
高级