Serving rápido de LLM con vLLM y PagedAttention

32 minutosAvanzadoCreadorAnyscaleIA privada/local

Anyscale. Explica por qué un serving ingenuo desperdicia el 60–80% de la memoria de la GPU, cómo PagedAttention adopta la paginación de los sistemas operativos para corregirlo y por qué el procesamiento continuo por lotes produce las cifras de rendimiento de 24× utilizadas por el artículo. Después de verlo, la afirmación «tendrás suerte si alcanzas un 50% de utilización» deja de ser abstracta.

Nota de AI Expert

El modelo mental de PagedAttention sigue siendo importante, pero las cifras de rendimiento y los valores predeterminados de los motores evolucionan con rapidez. Utiliza el vídeo para comprender los fundamentos y después evalúa tu propio modelo, hardware, forma de lote y requisitos de disponibilidad antes de decidir.

Qué aprenderás

Comprenderás por qué los motores de inferencia, el procesamiento por lotes y la caché KV dominan la economía del alojamiento propio.

Qué ver o saber antes

Conocimientos básicos de inferencia con transformers, límites de memoria de GPU y contrapartidas entre API y alojamiento propio.

Última revisión: 18 may 2026

Ver siguiente

Continúa por el mismo itinerario de aprendizaje con los siguientes vídeos complementarios seleccionados.