主题

成本与模型运维

控制推理成本、选择托管模式、路由模型并理解运维权衡。

13 项内容 (6 篇文章 · 7 个视频)

从这里开始

浏览完整内容之前,先阅读几篇推荐文章。

此主题下的更多内容

13 分钟阅读
文章

2026年LLM技术栈:模型、推理、工具与权衡

从一线架构师的视角梳理2026年LLM技术栈:模型层级、推理服务商、编排层、评估工具,以及交付生产级AI时真正重要的权衡。这里汇集了我们希望在起步前就有人讲清楚的一切。

高级
6 分钟阅读
文章

免费版与付费版ChatGPT:升级究竟能得到什么

不讲术语,对比ChatGPT免费版、ChatGPT Plus和ChatGPT Pro——升级后有哪些变化,以及如何判断自己是否真的需要升级。

AI新手
10 分钟阅读
文章

在Mac上运行本地AI:Ollama、LM Studio,以及7B模型究竟能做什么

本地运行AI已日趋成熟。借助Ollama或LM Studio和一台现代Mac,你可以离线、免费且私密地运行能力不俗的模型。本文将介绍哪些方法可行、哪些不可行,以及真正能从中受益的使用场景。

中级
211 分钟
视频

深入解析ChatGPT等LLM

Andrej Karpathy. 这是YouTube上对大语言模型本质最清晰的端到端讲解,涵盖预训练、token化、SFT、RLHF、推理强化学习、工具使用和幻觉,详细程度足以帮助工程师分析模型权衡。完整看过一遍后,文章中的“GPT级模型、开放权重模型与推理模型”之选就不再像品牌选择,而会成为训练方案的选择。

高级
40 分钟
视频

Andrej Karpathy:软件正在再次改变

Y Combinator. Karpathy在AI Startup School的主题演讲中,将大语言模型描述为一种新型计算机——公用事业、晶圆厂和操作系统三者合一——并主张打造由人类掌控约束的“部分自主”产品。这是对文章所采用的架构层面思维模型最清晰的阐述:你是在为一种可编程基础载体选择推理供应商与工具,而不是在选择聊天机器人。

高级
19 分钟
视频

RAG会就此终结吗?Anthropic的新提示缓存

Prompt Engineering. 视频将Anthropic的提示缓存与Gemini的上下文缓存进行比较,并针对长文档聊天、少样本和多轮对话等用例给出具体的延迟与成本降幅。对缓存写入附加费与缓存读取折扣的拆解,正是文章讨论缓存何时划算时所采用的基础。

高级
56 分钟
视频

Build Hour:提示缓存

OpenAI. 这是OpenAI官方关于提示缓存的Build Hour,内容包括1024-token阈值、前缀稳定性要求、实时音频缓存的大幅折扣(确切费率请查看当前定价页面),以及长输入对首token延迟的影响。当你评估需要投入多少工程工作,才能让生产提示稳定命中缓存时,本视频很有帮助。

高级
19 分钟
视频

详解每一种AI模型

Tina Huang. 视频按层级清晰梳理当前的模型格局——旗舰模型、轻量模型、中档模型和专用模型——并通过具体选择说明各层级真正适合哪些任务。这对应文章中“先了解选项,再进行路由”的一半内容;Huang对成本与能力的分析方式也与文章一致,没有依赖基准测试炒作。

中级
9 分钟
视频

RouteLLM达到GPT4o质量的90%,成本还降低80%

Matthew Berman. 视频逐步讲解LMSYS的RouteLLM论文和代码:在强弱模型组合前放置一个小型分类器,由它决定调用哪个模型,最终仅用一小部分成本达到强模型约95%的质量。观看次数低于通常的100k门槛,但对于“展示真实模型路由,而不仅仅比较模型”这一具体需求,它是YouTube上最清晰的讲解,也与文章中的质量/成本权衡章节直接对应。

中级
32 分钟
视频

使用vLLM与PagedAttention实现高速LLM推理服务

Anyscale. 视频讲解了为什么朴素的LLM推理服务会浪费60–80%的GPU内存、PagedAttention如何借鉴操作系统式分页来解决这一问题,以及连续批处理为何能实现文章在计算中采用的24×吞吐量。看完后,文章中“利用率能达到50%就算幸运”这句话就不再抽象。

高级