Vídeos complementarios

Inferencia con alojamiento propio frente a gestionada — vídeos complementarios

El artículo calcula el punto de equilibrio real entre proveedores de API y vLLM/TGI con alojamiento propio: utilización, memoria de caché KV, economía de las GPU y carga de las guardias. También desmonta la creencia infundada de que «ahorraremos dinero con alojamiento propio». La charla de los autores de vLLM ofrece la base técnica más clara para entender por qué importa un motor de inferencia.

Selección principal

32:07
Serving rápido de LLM con vLLM y PagedAttention

Anyscale

Explica por qué un serving ingenuo desperdicia el 60–80% de la memoria de la GPU, cómo PagedAttention adopta la paginación de los sistemas operativos para corregirlo y por qué el procesamiento continuo por lotes produce las cifras de rendimiento de 24× utilizadas por el artículo. Después de verlo, la afirmación «tendrás suerte si alcanzas un 50% de utilización» deja de ser abstracta.

Qué aprenderás: Comprenderás por qué los motores de inferencia, el procesamiento por lotes y la caché KV dominan la economía del alojamiento propio.

Qué ver o saber antes: Conocimientos básicos de inferencia con transformers, límites de memoria de GPU y contrapartidas entre API y alojamiento propio.

Nota de AI Expert: El modelo mental de PagedAttention sigue siendo importante, pero las cifras de rendimiento y los valores predeterminados de los motores evolucionan con rapidez. Utiliza el vídeo para comprender los fundamentos y después evalúa tu propio modelo, hardware, forma de lote y requisitos de disponibilidad antes de decidir.

Abrir página del vídeo