Costes y operaciones de modelos
Controla el coste de inferencia, elige patrones de alojamiento, dirige las solicitudes entre modelos y comprende los compromisos operativos.
13 contenidos (6 artículos · 7 vídeos)
Comienza aquí
Una selección inicial antes de explorar todo el contenido.
10 min de lecturaOrquestación de múltiples modelos: enrutamiento por coste, latencia y calidad
Enrutar diferentes tareas a distintos modelos puede reducir el coste o la latencia, pero solo una evaluación específica de la carga de trabajo puede demostrar si la complejidad añadida vale la pena. Los patrones, las mediciones y los modos de fallo.
Intermedio
12 min de lecturaOptimización de costes en inferencia: almacenamiento en caché de prompts, enrutamiento y control de salida
Construye un modelo de costes de inferencia basado en trazas, optimiza los mayores contribuyentes medidos y demuestra que cada cambio preserva la calidad de la tarea.
Avanzado
11 min de lecturaInferencia en infraestructura propia frente a gestionada: un modelo de punto de equilibrio auditable
¿A partir de qué escala sale más rentable operar infraestructura propia que usar API? El cálculo real, las condiciones operativas y los patrones que distinguen a los equipos que deberían gestionar sus modelos de los que deberían seguir pagando por inferencia gestionada.
AvanzadoMás sobre este tema
13 min de lecturaEl stack de LLM en 2026: modelos, inferencia, herramientas y decisiones
La perspectiva práctica de un arquitecto sobre el stack de LLM en 2026: gamas de modelos, proveedores de inferencia, capas de orquestación, herramientas de evaluación y las decisiones que realmente importan al implantar IA en producción. Todo lo que te habría gustado saber antes de empezar.
Avanzado
6 min de lecturaVersión gratuita vs. de pago de ChatGPT: qué incluye realmente la actualización
Comparación sin jerga de la versión gratuita de ChatGPT, ChatGPT Plus y ChatGPT Pro — qué cambia al actualizar y cómo saber si realmente necesitas hacerlo.
Primeros pasos con IA
10 min de lecturaIA local en tu Mac: Ollama, LM Studio y lo que pueden hacer realmente los modelos 7B
La ejecución local de IA ha madurado. Con Ollama o LM Studio y un Mac moderno, puedes utilizar modelos capaces sin conexión, sin coste y de forma privada. Conoce qué funciona, qué no y qué casos de uso se benefician realmente.
Intermedio
211 minutosAnálisis a fondo de los LLM como ChatGPT
Andrej Karpathy. Es la explicación integral más clara de YouTube sobre qué es realmente un LLM: preentrenamiento, tokenización, SFT, RLHF, aprendizaje por refuerzo para razonamiento, uso de herramientas y alucinaciones, con el nivel de detalle necesario para que un ingeniero valore las contrapartidas entre modelos. Después de verlo, las decisiones del artículo entre modelos de clase GPT, de pesos abiertos y de razonamiento dejan de parecer elecciones de marca y pasan a entenderse como elecciones de recetas de entrenamiento.
Avanzado
40 minutosAndrej Karpathy: El software está cambiando (de nuevo)
Y Combinator. En su ponencia de AI Startup School, Karpathy presenta los LLM como un nuevo tipo de ordenador —servicio público, fábrica de chips y sistema operativo a la vez— y defiende productos con «autonomía parcial» sujetos a una correa controlada por personas. Es la formulación más clara del modelo mental para el stack que presupone el artículo: eliges proveedores de inferencia y herramientas para un sustrato programable, no para un chatbot.
Avanzado
19 minutos¿Es el fin del RAG? El nuevo almacenamiento en caché de prompts de Anthropic
Prompt Engineering. Compara la caché de prompts de Anthropic con la caché de contexto de Gemini mediante reducciones concretas de latencia y coste para chat con documentos largos, *few-shot* y conversaciones de varios turnos. El desglose entre el recargo por escribir en caché y el descuento por leer de ella es exactamente lo que presupone el artículo al explicar cuándo compensa.
Avanzado
56 minutosBuild Hour: Almacenamiento en caché de prompts
OpenAI. Es la Build Hour oficial de OpenAI sobre caché de prompts: el umbral de 1024 tokens, el requisito de estabilidad del prefijo, los grandes descuentos de caché de audio en tiempo real —consulta la tarifa exacta vigente— y el impacto sobre el tiempo hasta el primer token con entradas largas. Resulta útil para dimensionar el esfuerzo de ingeniería necesario para utilizar la caché de forma fiable con prompts de producción.
Avanzado
19 minutosTodos los modelos de IA, explicados
Tina Huang. Es un recorrido claro por el panorama actual de modelos, agrupados por gama —modelos de gama alta, ligeros, de gama media y especializados—, con recomendaciones concretas para las tareas que mejor encajan en cada una. Cubre la mitad del artículo dedicada a «conocer las opciones antes de enrutar» y Huang plantea la relación entre coste y capacidad del mismo modo que el artículo, sin apoyarse en el sensacionalismo de los benchmarks.
Intermedio
9 minutosRouteLLM alcanza el 90% de la calidad de GPT4o y cuesta un 80% menos
Matthew Berman. Recorre el artículo académico y el código de RouteLLM de LMSYS: un pequeño clasificador se sitúa delante de un par formado por un modelo potente y otro básico, y decide a cuál llamar. De este modo alcanza aproximadamente el 95% de la calidad del modelo potente por una fracción del coste. Las visualizaciones quedan por debajo del umbral habitual de 100k, pero, para la necesidad específica de «mostrar enrutamiento real, no solo comparar modelos», es la explicación más clara de YouTube y coincide directamente con la sección del artículo sobre la contrapartida entre calidad y coste.
Intermedio
32 minutosServing rápido de LLM con vLLM y PagedAttention
Anyscale. Explica por qué un serving ingenuo desperdicia el 60–80% de la memoria de la GPU, cómo PagedAttention adopta la paginación de los sistemas operativos para corregirlo y por qué el procesamiento continuo por lotes produce las cifras de rendimiento de 24× utilizadas por el artículo. Después de verlo, la afirmación «tendrás suerte si alcanzas un 50% de utilización» deja de ser abstracta.
Avanzado