34 分钟AI如何重塑软件商业模式:Sierra的Bret Taylor
围绕可衡量的成果而不是席位数量,评估AI产品的定价和专业化方向。
高级企业AI
Anyscale. 视频讲解了为什么朴素的LLM推理服务会浪费60–80%的GPU内存、PagedAttention如何借鉴操作系统式分页来解决这一问题,以及连续批处理为何能实现文章在计算中采用的24×吞吐量。看完后,文章中“利用率能达到50%就算幸运”这句话就不再抽象。
PagedAttention的思维模型依然重要,但吞吐量数据和推理服务引擎默认值很快就会过时。用本视频学习基础原理,然后基于自己的模型、硬件、批次形态和正常运行时间要求进行基准测试,再做出托管决策。
理解为什么推理服务引擎、批处理和KV缓存内存主导着自托管推理的经济性。
基本了解Transformer推理、GPU内存限制,以及API与自托管之间的权衡。
最后审核:2026年5月18日
通过相同的视频学习路径,继续观看下一个精选配套视频。