Tema

Costes y operaciones de modelos

Controla el coste de inferencia, elige patrones de alojamiento, dirige las solicitudes entre modelos y comprende los compromisos operativos.

13 contenidos (6 artículos · 7 vídeos)

Comienza aquí

Una selección inicial antes de explorar todo el contenido.

Más sobre este tema

13 min de lectura
Artículo

El stack de LLM en 2026: modelos, inferencia, herramientas y decisiones

La perspectiva práctica de un arquitecto sobre el stack de LLM en 2026: gamas de modelos, proveedores de inferencia, capas de orquestación, herramientas de evaluación y las decisiones que realmente importan al implantar IA en producción. Todo lo que te habría gustado saber antes de empezar.

Avanzado
6 min de lectura
Artículo

Versión gratuita vs. de pago de ChatGPT: qué incluye realmente la actualización

Comparación sin jerga de la versión gratuita de ChatGPT, ChatGPT Plus y ChatGPT Pro — qué cambia al actualizar y cómo saber si realmente necesitas hacerlo.

Primeros pasos con IA
10 min de lectura
Artículo

IA local en tu Mac: Ollama, LM Studio y lo que pueden hacer realmente los modelos 7B

La ejecución local de IA ha madurado. Con Ollama o LM Studio y un Mac moderno, puedes utilizar modelos capaces sin conexión, sin coste y de forma privada. Conoce qué funciona, qué no y qué casos de uso se benefician realmente.

Intermedio
211 minutos
Vídeo

Análisis a fondo de los LLM como ChatGPT

Andrej Karpathy. Es la explicación integral más clara de YouTube sobre qué es realmente un LLM: preentrenamiento, tokenización, SFT, RLHF, aprendizaje por refuerzo para razonamiento, uso de herramientas y alucinaciones, con el nivel de detalle necesario para que un ingeniero valore las contrapartidas entre modelos. Después de verlo, las decisiones del artículo entre modelos de clase GPT, de pesos abiertos y de razonamiento dejan de parecer elecciones de marca y pasan a entenderse como elecciones de recetas de entrenamiento.

Avanzado
40 minutos
Vídeo

Andrej Karpathy: El software está cambiando (de nuevo)

Y Combinator. En su ponencia de AI Startup School, Karpathy presenta los LLM como un nuevo tipo de ordenador —servicio público, fábrica de chips y sistema operativo a la vez— y defiende productos con «autonomía parcial» sujetos a una correa controlada por personas. Es la formulación más clara del modelo mental para el stack que presupone el artículo: eliges proveedores de inferencia y herramientas para un sustrato programable, no para un chatbot.

Avanzado
19 minutos
Vídeo

¿Es el fin del RAG? El nuevo almacenamiento en caché de prompts de Anthropic

Prompt Engineering. Compara la caché de prompts de Anthropic con la caché de contexto de Gemini mediante reducciones concretas de latencia y coste para chat con documentos largos, *few-shot* y conversaciones de varios turnos. El desglose entre el recargo por escribir en caché y el descuento por leer de ella es exactamente lo que presupone el artículo al explicar cuándo compensa.

Avanzado
56 minutos
Vídeo

Build Hour: Almacenamiento en caché de prompts

OpenAI. Es la Build Hour oficial de OpenAI sobre caché de prompts: el umbral de 1024 tokens, el requisito de estabilidad del prefijo, los grandes descuentos de caché de audio en tiempo real —consulta la tarifa exacta vigente— y el impacto sobre el tiempo hasta el primer token con entradas largas. Resulta útil para dimensionar el esfuerzo de ingeniería necesario para utilizar la caché de forma fiable con prompts de producción.

Avanzado
19 minutos
Vídeo

Todos los modelos de IA, explicados

Tina Huang. Es un recorrido claro por el panorama actual de modelos, agrupados por gama —modelos de gama alta, ligeros, de gama media y especializados—, con recomendaciones concretas para las tareas que mejor encajan en cada una. Cubre la mitad del artículo dedicada a «conocer las opciones antes de enrutar» y Huang plantea la relación entre coste y capacidad del mismo modo que el artículo, sin apoyarse en el sensacionalismo de los benchmarks.

Intermedio
9 minutos
Vídeo

RouteLLM alcanza el 90% de la calidad de GPT4o y cuesta un 80% menos

Matthew Berman. Recorre el artículo académico y el código de RouteLLM de LMSYS: un pequeño clasificador se sitúa delante de un par formado por un modelo potente y otro básico, y decide a cuál llamar. De este modo alcanza aproximadamente el 95% de la calidad del modelo potente por una fracción del coste. Las visualizaciones quedan por debajo del umbral habitual de 100k, pero, para la necesidad específica de «mostrar enrutamiento real, no solo comparar modelos», es la explicación más clara de YouTube y coincide directamente con la sección del artículo sobre la contrapartida entre calidad y coste.

Intermedio
32 minutos
Vídeo

Serving rápido de LLM con vLLM y PagedAttention

Anyscale. Explica por qué un serving ingenuo desperdicia el 60–80% de la memoria de la GPU, cómo PagedAttention adopta la paginación de los sistemas operativos para corregirlo y por qué el procesamiento continuo por lotes produce las cifras de rendimiento de 24× utilizadas por el artículo. Después de verlo, la afirmación «tendrás suerte si alcanzas un 50% de utilización» deja de ser abstracta.

Avanzado