34 minutosCómo la IA está reinventando los modelos de negocio del software ft. Bret Taylor de Sierra
Evaluarás los precios y la especialización de un producto de IA en torno a resultados medibles, no al número de puestos.
Anyscale. Explica por qué un serving ingenuo desperdicia el 60–80% de la memoria de la GPU, cómo PagedAttention adopta la paginación de los sistemas operativos para corregirlo y por qué el procesamiento continuo por lotes produce las cifras de rendimiento de 24× utilizadas por el artículo. Después de verlo, la afirmación «tendrás suerte si alcanzas un 50% de utilización» deja de ser abstracta.
El modelo mental de PagedAttention sigue siendo importante, pero las cifras de rendimiento y los valores predeterminados de los motores evolucionan con rapidez. Utiliza el vídeo para comprender los fundamentos y después evalúa tu propio modelo, hardware, forma de lote y requisitos de disponibilidad antes de decidir.
Comprenderás por qué los motores de inferencia, el procesamiento por lotes y la caché KV dominan la economía del alojamiento propio.
Conocimientos básicos de inferencia con transformers, límites de memoria de GPU y contrapartidas entre API y alojamiento propio.
Última revisión: 18 may 2026
Continúa por el mismo itinerario de aprendizaje con los siguientes vídeos complementarios seleccionados.
34 minutosEvaluarás los precios y la especialización de un producto de IA en torno a resultados medibles, no al número de puestos.
6 minutosReconocerás la arquitectura básica de un agente de voz y los puntos de fallo que afectan a la confianza del cliente en llamadas reales.
37 minutosEvaluarás la IA privada como una decisión de infraestructura y gobernanza, en lugar de elegir por instinto SaaS o alojamiento propio.