配套视频

自托管与托管推理对比:vLLM、TGI与盈亏平衡计算——配套视频

文章详细计算了API提供商与自托管vLLM/TGI之间的实际盈亏平衡点,包括利用率、KV缓存内存、GPU经济性和随叫随到的运维负担,并试图纠正“自托管就能省钱”这种盲目跟风的观念。由vLLM作者亲自进行的这场演讲,是理解推理服务引擎为何重要的最清晰技术基础。

首选视频

32:07
使用vLLM与PagedAttention实现高速LLM推理服务

Anyscale

视频讲解了为什么朴素的LLM推理服务会浪费60–80%的GPU内存、PagedAttention如何借鉴操作系统式分页来解决这一问题,以及连续批处理为何能实现文章在计算中采用的24×吞吐量。看完后,文章中“利用率能达到50%就算幸运”这句话就不再抽象。

您应该从中获得什么: 理解为什么推理服务引擎、批处理和KV缓存内存主导着自托管推理的经济性。

先观看或了解: 基本了解Transformer推理、GPU内存限制,以及API与自托管之间的权衡。

AI Expert 注释: PagedAttention的思维模型依然重要,但吞吐量数据和推理服务引擎默认值很快就会过时。用本视频学习基础原理,然后基于自己的模型、硬件、批次形态和正常运行时间要求进行基准测试,再做出托管决策。

打开视频页面