32:07使用vLLM与PagedAttention实现高速LLM推理服务打开视频页面
Anyscale
视频讲解了为什么朴素的LLM推理服务会浪费60–80%的GPU内存、PagedAttention如何借鉴操作系统式分页来解决这一问题,以及连续批处理为何能实现文章在计算中采用的24×吞吐量。看完后,文章中“利用率能达到50%就算幸运”这句话就不再抽象。
您应该从中获得什么: 理解为什么推理服务引擎、批处理和KV缓存内存主导着自托管推理的经济性。
先观看或了解: 基本了解Transformer推理、GPU内存限制,以及API与自托管之间的权衡。
AI Expert 注释: PagedAttention的思维模型依然重要,但吞吐量数据和推理服务引擎默认值很快就会过时。用本视频学习基础原理,然后基于自己的模型、硬件、批次形态和正常运行时间要求进行基准测试,再做出托管决策。