32:07Anyscale
Explica por qué un serving ingenuo desperdicia el 60–80% de la memoria de la GPU, cómo PagedAttention adopta la paginación de los sistemas operativos para corregirlo y por qué el procesamiento continuo por lotes produce las cifras de rendimiento de 24× utilizadas por el artículo. Después de verlo, la afirmación «tendrás suerte si alcanzas un 50% de utilización» deja de ser abstracta.
Qué aprenderás: Comprenderás por qué los motores de inferencia, el procesamiento por lotes y la caché KV dominan la economía del alojamiento propio.
Qué ver o saber antes: Conocimientos básicos de inferencia con transformers, límites de memoria de GPU y contrapartidas entre API y alojamiento propio.
Nota de AI Expert: El modelo mental de PagedAttention sigue siendo importante, pero las cifras de rendimiento y los valores predeterminados de los motores evolucionan con rapidez. Utiliza el vídeo para comprender los fundamentos y después evalúa tu propio modelo, hardware, forma de lote y requisitos de disponibilidad antes de decidir.