18:50Prompt Engineering
视频将Anthropic的提示缓存与Gemini的上下文缓存进行比较,并针对长文档聊天、少样本和多轮对话等用例给出具体的延迟与成本降幅。对缓存写入附加费与缓存读取折扣的拆解,正是文章讨论缓存何时划算时所采用的基础。
您应该从中获得什么: 你可以根据真实工作负载,权衡缓存写入附加费与读取节省的成本,估算提示缓存何时划算。
先观看或了解: 具备LLM API定价和长提示工作负载方面的实用知识。
AI Expert 注释: 视频录制于2024年8月,因此模型名称和每token价格已经过时。缓存写入附加费与缓存读取折扣这一机制仍然成立;在计算你的工作负载成本前,请查看提供商当前的定价页面。
