Aplicaciones LLM en producción
Diseña, lanza, supervisa y opera aplicaciones LLM una vez superada la fase de demostración.
34 contenidos (23 artículos · 11 vídeos)
Comienza aquí
Una selección inicial antes de explorar todo el contenido.
13 min de lecturaEl stack de LLM en 2026: modelos, inferencia, herramientas y decisiones
La perspectiva práctica de un arquitecto sobre el stack de LLM en 2026: gamas de modelos, proveedores de inferencia, capas de orquestación, herramientas de evaluación y las decisiones que realmente importan al implantar IA en producción. Todo lo que te habría gustado saber antes de empezar.
Avanzado
12 min de lecturaDiseñar prompts para producción: capas del sistema, del desarrollador y del usuario
Un patrón de gobernanza para separar las instrucciones fiables, los datos en tiempo de ejecución y la entrada del usuario, y después versionar, evaluar, desplegar y observar los prompts según el riesgo.
Avanzado
10 min de lecturaModos de fallo de IA en producción: qué falla después de la demostración
Los sistemas de IA suelen fallar de formas predecibles: alucinaciones, contexto obsoleto, complacencia, inyección de prompts, uso inseguro de herramientas, deriva de esquemas y gestión deficiente de fallos. Este registro de modos de fallo está dirigido a equipos que despliegan flujos de trabajo reales.
AvanzadoMás sobre este tema
8 min de lecturaHermes vs n8n: elige según el trabajo (y cuándo usar ambos)
Un marco de decisión para elegir entre Hermes Agent y n8n: la integración determinista se queda en n8n, mientras que una etapa de la API de Hermes autenticada mediante bearer o una ruta separada de webhooks para eventos se ocupa del trabajo acotado del agente.
Intermedio
8 min de lecturaOpenClaw frente a Hermes: elige por el trabajo, no por la marca
OpenClaw y Hermes son sistemas de agentes alojados en infraestructura propia que se solapan, con fortalezas operativas distintas. Compara enrutamiento de canales, webhooks, herramientas y límites de automatización antes de elegir uno o ambos.
Intermedio
10 min de lecturaPila experimental con dos DGX Spark, DeepSeek-V4-Flash, n8n y Hermes
Cómo evaluar una ruta experimental de la comunidad con dos DGX Spark para DeepSeek-V4-Flash, con n8n en el borde determinista y Hermes en la ruta de juicio.
Avanzado
69 minutosEl panorama de los agentes: lecciones aprendidas al llevar agentes a producción
MLOps.community. El vicepresidente de IA de Prosus y un ingeniero de IA explican qué falló realmente cuando desplegaron agentes en las empresas de la cartera del grupo: pruebas de penetración de inyección de prompts antes del lanzamiento; una escritura insegura cuando un agente de Jira no interpretó correctamente la taquigrafía humana; contexto obsoleto gestionado haciendo que los agentes expusieran sus supuestos; y mecanismos alternativos que fusionaban o retiraban agentes cuando estos empezaban a añadir carga cognitiva. Es como ver el registro de modos de fallo del artículo reproducido en una autopsia en directo.
Avanzado
11 min de lecturaLangGraph vs CrewAI vs API directa: cómo elegir un framework de agentes en 2026
El panorama de los frameworks de agentes en 2026 es más maduro, pero no más claro. LangGraph, CrewAI, Pydantic AI, OpenAI Agents SDK y la API directa sirven a equipos y proyectos distintos; ninguno encaja en todos. Esta es una comparación honesta y un marco de decisión.
Avanzado
13 min de lecturaDiseñar agentes que no entren en bucles infinitos
Uno de los fallos más comunes de los agentes de producción son los bucles infinitos o casi infinitos: reintentos, ramificaciones y consumo de tokens sin avanzar. Estos patrones arquitectónicos los evitan y garantizan que los agentes terminen, incluso en tareas difíciles.
Avanzado
12 min de lecturaAgentes que controlan ordenadores y navegadores en producción
Las demostraciones de agentes que controlan ordenadores y navegadores se hacen virales. Las implantaciones a escala de producción son distintas: alcance limitado, salvaguardas estrictas y una experiencia de usuario cuidadosamente diseñada. Analizamos los patrones que funcionan, los fallos que seguimos observando y la realidad económica.
Avanzado
12 min de lecturaIngeniería de contexto: cómo gestionar ventanas de 1M de tokens sin degradar la calidad
Las ventanas de contexto de 1M de tokens existen, pero la calidad se degrada mucho antes de alcanzar ese límite. La ingeniería de contexto determina qué incluir, qué resumir, qué recuperar en el momento necesario y qué patrones mantienen la calidad a medida que aumenta el contexto.
Avanzado
12 min de lecturaOptimización de costes en inferencia: almacenamiento en caché de prompts, enrutamiento y control de salida
Construye un modelo de costes de inferencia basado en trazas, optimiza los mayores contribuyentes medidos y demuestra que cada cambio preserva la calidad de la tarea.
Avanzado
13 min de lecturaCómo crear evaluaciones que realmente detecten regresiones
La mayoría de las suites de evaluación parecen impresionantes, pero no detectan regresiones reales. Para crear evaluaciones que detecten lo importante se necesitan conjuntos de datos bien diseñados, métricas sensibles, jueces calibrados y una cultura de confianza. Estos son los patrones de los equipos que lo hacen bien.
Avanzado
13 min de lecturaAjuste fino en 2026: un experimento de LoRA y QLoRA basado en evidencia
Decide si el ajuste eficiente en parámetros está justificado, gobierna los datos, fija un experimento reproducible, compara resultados en conjuntos retenidos y pruebas de seguridad, y realiza benchmarks del servicio antes del despliegue.
Avanzado
14 min de lecturaMCP desde cero: construye un servidor listo para producción en TypeScript
Crear un servidor de Model Context Protocol (MCP) para producción exige mucho más que conectar unas cuantas herramientas. Estos son los patrones de diseño de esquemas, autenticación, gestión de errores, streaming y observabilidad que permiten que un servidor MCP resulte útil a gran escala.
Avanzado
12 min de lecturaCómo diseñar herramientas MCP que los LLM utilicen correctamente
La mayoría de las herramientas MCP que vemos son técnicamente correctas, pero en la práctica no sirven. Los LLM las ignoran, las utilizan mal o las invocan de formas poco útiles. Estos son los principios para diseñar herramientas que adopten de manera natural, con ejemplos de errores habituales y sus soluciones.
Avanzado
12 min de lecturaCómo crear memoria para agentes de larga duración
Los agentes de larga duración necesitan un diseño de persistencia propio: procedencia, confirmación, aislamiento por inquilino, pruebas de recuperación, conservación, corrección y eliminación verificable.
Avanzado
10 min de lecturaOrquestación de múltiples modelos: enrutamiento por coste, latencia y calidad
Enrutar diferentes tareas a distintos modelos puede reducir el coste o la latencia, pero solo una evaluación específica de la carga de trabajo puede demostrar si la complejidad añadida vale la pena. Los patrones, las mediciones y los modos de fallo.
Intermedio
12 min de lecturaObservabilidad para aplicaciones con LLM: trazas, costes, latencia y deriva de calidad
Amplía la observabilidad habitual con trazas multietapa, costes atribuibles, versiones de prompt y modelo, señales de calidad evaluada, controles de privacidad y alertas derivadas de la carga de trabajo.
Avanzado
12 min de lecturaCómo crear un RAG de producción: ingesta, embeddings, recuperación, reranking y evaluación
Un pipeline de RAG de producción consta de seis etapas, cada una con patrones que determinan la calidad. Esta es la arquitectura, las decisiones de cada etapa y la disciplina de evaluación iterativa que distingue un RAG eficaz de otro decepcionante.
Avanzado
14 min de lecturaInyección de prompts y seguridad de los LLM: modelos de amenazas y defensa en profundidad
La inyección de prompts es una categoría permanente de riesgo para la seguridad de los LLM, no un error de redacción de prompts. Esta guía para producción aborda modelos de amenazas, límites de datos, permisos de herramientas, pruebas de regresión, monitorización y respuesta a incidentes.
Avanzado
12 min de lecturaElegir entre prompting, RAG y fine-tuning (y cuándo combinarlos)
El prompting, RAG y el fine-tuning son las tres grandes palancas para adaptar los LLM a un problema. Cada una resulta adecuada en situaciones diferentes. Este marco ayuda a elegir, explica sus costes reales y muestra los patrones de producción en los que conviene combinarlas.
Avanzado
13 min de lecturaEconomía de unidades del producto LLM: una hoja de cálculo para fijar precios basada en evidencia
Distribución del uso del modelo, margen de contribución, gestión de fallos, soporte y retención antes de elegir un precio. Esta hoja de cálculo reemplaza rangos de mercado no respaldados con entradas auditables.
Avanzado
13 min de lecturaSalidas estructuradas y llamadas a funciones: patrones para producción
Las salidas estructuradas y las llamadas a funciones convierten un «modelo de lenguaje que genera texto» en un «sistema que ejecuta tareas». En producción importan los esquemas, la gestión de errores, la idempotencia y la degradación controlada, no solo el modo JSON.
Avanzado
211 minutosAnálisis a fondo de los LLM como ChatGPT
Andrej Karpathy. Es la explicación integral más clara de YouTube sobre qué es realmente un LLM: preentrenamiento, tokenización, SFT, RLHF, aprendizaje por refuerzo para razonamiento, uso de herramientas y alucinaciones, con el nivel de detalle necesario para que un ingeniero valore las contrapartidas entre modelos. Después de verlo, las decisiones del artículo entre modelos de clase GPT, de pesos abiertos y de razonamiento dejan de parecer elecciones de marca y pasan a entenderse como elecciones de recetas de entrenamiento.
Avanzado
40 minutosAndrej Karpathy: El software está cambiando (de nuevo)
Y Combinator. En su ponencia de AI Startup School, Karpathy presenta los LLM como un nuevo tipo de ordenador —servicio público, fábrica de chips y sistema operativo a la vez— y defiende productos con «autonomía parcial» sujetos a una correa controlada por personas. Es la formulación más clara del modelo mental para el stack que presupone el artículo: eliges proveedores de inferencia y herramientas para un sustrato programable, no para un chatbot.
Avanzado
9 minutosLangSmith en 10 minutos
LangChain. El cofundador de LangChain recorre una traza, un proyecto y un conjunto de datos de LLM: coste en tokens, latencia, tasa de errores, agregación de comentarios y análisis detallado del span correspondiente a un único paso de recuperación. Es el equivalente visual más cercano a lo que describe el artículo cuando afirma que «cada llamada es un span» y explica por qué las trazas estructuradas superan a los registros mediante print.
Avanzado
154 minutosInstrumentación y evaluación de LLM
Hamel Husain. Hamel Husain, Eugene Yan, Brian Bischof, Harrison Chase y Shreya Shankar trabajan con trazas, análisis de registros, LLM como juez y el proceso de revisión de datos reales de producción. Dedícale el tiempo que dedicarías a un pódcast extenso: es la mejor explicación en profundidad de YouTube sobre la tesis «observa tus trazas» del artículo.
Avanzado
77 minutosIngeniería de prompts de IA: un análisis profundo
Anthropic. Cuatro especialistas en prompts de Anthropic —investigación, alineación, IA aplicada y relaciones con desarrolladores— explican en detalle su trabajo cotidiano: cómo editan prompts bajo presión, cómo entienden la «honestidad» en las instrucciones y cuándo ayudan las estructuras XML o cuándo no. El modelo por capas del artículo encaja directamente con su descripción del trabajo; es la mejor forma de escuchar ese modelo mental expresado en voz alta.
Avanzado
25 minutosFundamentos del prompting | Programar con Claude
Anthropic. Es una sesión de creación en directo en la que el equipo de IA aplicada de Anthropic trabaja con un prompt para reclamaciones de seguros: parte de una instrucción imprecisa e itera hasta obtener algo que un desarrollador llevaría realmente a producción. De este modo muestra las revisiones de las capas del sistema y del desarrollador descritas por el artículo. Conviene verlo antes de releer la lista de comprobación sobre ejemplos, estructura de salida y gestión de rechazos.
Avanzado
42 minutosLos agentes de IA vertical podrían ser 10X mayores que el SaaS
Y Combinator. Los presentadores de Lightcone explican por qué los agentes de IA vertical —no los envoltorios horizontales— ofrecen una forma defendible a las empresas de la capa de aplicación. Aportan ejemplos concretos y una valoración franca de las categorías que absorberán los proveedores de modelos. Es la trampa del foso inverso del artículo expresada como un plan positivo.
Avanzado
34 minutosCómo la IA está reinventando los modelos de negocio del software ft. Bret Taylor de Sierra
Sequoia Capital. Bret Taylor explica el paso del SaaS cobrado por puesto a precios basados en resultados: qué métricas utilizar como referencia —resolución, CSAT y NPS—, por qué los proveedores establecidos tienen dificultades para seguirlo y cómo la especialización vertical aporta capacidad para fijar precios. Refleja directamente las secciones del artículo sobre precios y márgenes.
Avanzado
41 minutosOpenAI DevDay 2024 | Salidas estructuradas para aplicaciones fiables
OpenAI. Recorre `strict: true`, la diferencia respecto al antiguo modo JSON, la gestión de rechazos y la manera en que se combinan las llamadas a funciones con los esquemas de formato de respuesta. Resulta útil precisamente porque describe el contrato que ofrece la API, sobre el que se construyen los patrones para producción del artículo.
Avanzado
18 minutosPydantic es todo lo que necesitas: Jason Liu
AI Engineer. Es la charla que consolidó el patrón moderno de «definir un modelo Pydantic, entregárselo al LLM y dejar que la validación se encargue del resto», con ejemplos concretos de objetos anidados, validadores que detectan URL inventadas y Chain-of-Thought (cadena de pensamiento) como campo tipado. Al verla antes de releer la sección del artículo sobre validadores, reconocerás el origen de sus reglas de reintento y rechazo.
Avanzado