配套视频

推理成本优化:提示缓存、路由与输出控制——配套视频

文章讨论了真正能显著影响LLM账单的一小组技术:提示缓存、模型路由、输出长度控制和批处理,以及如何组合使用而不在不知不觉中损害质量。YouTube上关于成本优化的演讲大多是产品演示,但这两段视频分别介绍了核心机制(提示缓存)和完整的优化手段,并具备足够的技术深度,可用于生产评审。

首选视频

18:50
RAG会就此终结吗?Anthropic的新提示缓存

Prompt Engineering

视频将Anthropic的提示缓存与Gemini的上下文缓存进行比较,并针对长文档聊天、少样本和多轮对话等用例给出具体的延迟与成本降幅。对缓存写入附加费与缓存读取折扣的拆解,正是文章讨论缓存何时划算时所采用的基础。

您应该从中获得什么: 你可以根据真实工作负载,权衡缓存写入附加费与读取节省的成本,估算提示缓存何时划算。

先观看或了解: 具备LLM API定价和长提示工作负载方面的实用知识。

AI Expert 注释: 视频录制于2024年8月,因此模型名称和每token价格已经过时。缓存写入附加费与缓存读取折扣这一机制仍然成立;在计算你的工作负载成本前,请查看提供商当前的定价页面。

打开视频页面

也值得关注

56:03
Build Hour:提示缓存

OpenAI

这是OpenAI官方关于提示缓存的Build Hour,内容包括1024-token阈值、前缀稳定性要求、实时音频缓存的大幅折扣(确切费率请查看当前定价页面),以及长输入对首token延迟的影响。当你评估需要投入多少工程工作,才能让生产提示稳定命中缓存时,本视频很有帮助。

您应该从中获得什么: 仅在稳定前缀、延迟和成本特征符合工作负载时使用提示缓存。

先观看或了解: 你应当已经在使用OpenAI API交付提示;本次课程讨论的是如何在生产中稳定命中缓存。

AI Expert 注释: 虽远低于我们的观看次数门槛,但这是官方深度讲解;1024-token阈值和前缀稳定性规则决定缓存能否真正生效,而当前费率应以定价页面为准。

打开视频页面