32 分钟使用vLLM与PagedAttention实现高速LLM推理服务
理解为什么推理服务引擎、批处理和KV缓存内存主导着自托管推理的经济性。
Prompt Engineering. 视频将Anthropic的提示缓存与Gemini的上下文缓存进行比较,并针对长文档聊天、少样本和多轮对话等用例给出具体的延迟与成本降幅。对缓存写入附加费与缓存读取折扣的拆解,正是文章讨论缓存何时划算时所采用的基础。
视频录制于2024年8月,因此模型名称和每token价格已经过时。缓存写入附加费与缓存读取折扣这一机制仍然成立;在计算你的工作负载成本前,请查看提供商当前的定价页面。
你可以根据真实工作负载,权衡缓存写入附加费与读取节省的成本,估算提示缓存何时划算。
具备LLM API定价和长提示工作负载方面的实用知识。
最后审核:2026年5月18日
通过相同的视频学习路径,继续观看下一个精选配套视频。
精选的外部课程,帮助您更深入地了解该主题。
Emory University Goizueta Business School faculty
The deeper, university-level counterpart to our beginner HubSpot marketing pick — Emory's business-school treatment goes past 'how to prompt' into training generative models for brand-specific output, the purchase-funnel economics of AI-generated content, and a full module of genuine skepticism about when generative AI is and isn't worth using in marketing.
IBM AI Academy
这是生成式AI时代对高管战略问题的解答。三门短课直接面向企业领导者,无需技术背景,内容涵盖生成式AI在何处创造价值、如何负责任地治理它,以及如何把模糊的“我们应该使用AI”转化为具体且站得住脚的用例。约700条评价的综合评分为4.6分。最适合在你下一次作出AI预算决策前学习。