18 分钟AWS re:Invent 2025——为多智能体AI系统实现人在回路控制(CNS428)
了解如何将审批关卡实现为明确的工作流检查点,而不是等问题发生后再进行非正式人工审核。
中级自动化
Anyscale. 视频讲解了为什么朴素的LLM推理服务会浪费60–80%的GPU内存、PagedAttention如何借鉴操作系统式分页来解决这一问题,以及连续批处理为何能实现文章在计算中采用的24×吞吐量。看完后,文章中“利用率能达到50%就算幸运”这句话就不再抽象。
PagedAttention的思维模型依然重要,但吞吐量数据和推理服务引擎默认值很快就会过时。用本视频学习基础原理,然后基于自己的模型、硬件、批次形态和正常运行时间要求进行基准测试,再做出托管决策。
理解为什么推理服务引擎、批处理和KV缓存内存主导着自托管推理的经济性。
基本了解Transformer推理、GPU内存限制,以及API与自托管之间的权衡。
最后审核:2026年5月18日
通过相同的视频学习路径,继续观看下一个精选配套视频。