Evaluación, observabilidad y calidad
Mide el comportamiento de la IA, detecta regresiones, controla costes y latencia y mejora continuamente los flujos de trabajo.
12 contenidos (5 artículos · 7 vídeos)
Comienza aquí
Una selección inicial antes de explorar todo el contenido.
10 min de lecturaEvaluaciones para no ingenieros: descubre si tu flujo de IA mejora o empeora
Las evaluaciones —la medición sistemática de la calidad de las respuestas de una IA— suelen considerarse una tarea de ingeniería. Sin embargo, todos los equipos que ejecutan flujos de IA las necesitan y sus fundamentos se pueden aplicar sin programar. Aprende cómo hacerlo.
Intermedio
13 min de lecturaCómo crear evaluaciones que realmente detecten regresiones
La mayoría de las suites de evaluación parecen impresionantes, pero no detectan regresiones reales. Para crear evaluaciones que detecten lo importante se necesitan conjuntos de datos bien diseñados, métricas sensibles, jueces calibrados y una cultura de confianza. Estos son los patrones de los equipos que lo hacen bien.
Avanzado
12 min de lecturaObservabilidad para aplicaciones con LLM: trazas, costes, latencia y deriva de calidad
Amplía la observabilidad habitual con trazas multietapa, costes atribuibles, versiones de prompt y modelo, señales de calidad evaluada, controles de privacidad y alertas derivadas de la carga de trabajo.
AvanzadoMás sobre este tema
69 minutosEl panorama de los agentes: lecciones aprendidas al llevar agentes a producción
MLOps.community. El vicepresidente de IA de Prosus y un ingeniero de IA explican qué falló realmente cuando desplegaron agentes en las empresas de la cartera del grupo: pruebas de penetración de inyección de prompts antes del lanzamiento; una escritura insegura cuando un agente de Jira no interpretó correctamente la taquigrafía humana; contexto obsoleto gestionado haciendo que los agentes expusieran sus supuestos; y mecanismos alternativos que fusionaban o retiraban agentes cuando estos empezaban a añadir carga cognitiva. Es como ver el registro de modos de fallo del artículo reproducido en una autopsia en directo.
Avanzado
10 min de lecturaModos de fallo de IA en producción: qué falla después de la demostración
Los sistemas de IA suelen fallar de formas predecibles: alucinaciones, contexto obsoleto, complacencia, inyección de prompts, uso inseguro de herramientas, deriva de esquemas y gestión deficiente de fallos. Este registro de modos de fallo está dirigido a equipos que despliegan flujos de trabajo reales.
Avanzado
11 min de lecturaFragmentación, reranking y búsqueda híbrida: consigue que RAG funcione de verdad
La mayoría de las implementaciones de RAG funcionan mal porque fallan en tres aspectos. Una guía práctica para fragmentar documentos, reordenar resultados y combinar la búsqueda por palabras clave con la semántica, sin convertirte en especialista en motores de búsqueda.
Intermedio
107 minutosPor qué las evaluaciones de IA son la nueva habilidad más demandada para quienes crean productos | Hamel Husain y Shreya Shankar
Lenny's Podcast. Hamel Husain y Shreya Shankar recorren el flujo completo de evaluación con un asistente de IA real para la gestión inmobiliaria: inspeccionar trazas, aplicar codificación abierta y axial a los errores, decidir cuándo detenerse, crear un LLM como juez y validarlo frente al criterio humano. Es una de las pocas conversaciones extensas dirigidas realmente a responsables de producto y de equipo, no a ingenieros de ML, y sigue el mismo ritmo de «30 minutos a la semana después de la configuración» recomendado por el artículo.
Intermedio
3 minutosEvalúa prompts en la consola de Anthropic
Anthropic. Es una demostración de tres minutos de Anthropic sobre cómo ejecutar una evaluación real en Workbench: generar automáticamente casos de prueba realistas, calificar las respuestas, ajustar el prompt y volver a ejecutar en paralelo el mismo conjunto. Las visualizaciones quedan por debajo del umbral habitual, pero es la demostración oficial más clara para responder «¿cómo hago esto sin escribir código?» y complementa bien la conversación más estratégica de Husain y Shankar.
Intermedio
55 minutosCómo configurar sistemáticamente evaluaciones de modelos de lenguaje (métricas, pruebas unitarias, modelo como juez)
Dave Ebbelaar. Un ingeniero de IA en activo recorre su escala real de evaluaciones: pruebas unitarias de tipo assert, métricas sin referencia, alineación del LLM como juez con el criterio humano y el ciclo de analizar, medir y mejorar. Es la estructura audiovisual que más se aproxima al argumento del artículo: las evaluaciones forman un sistema para detectar regresiones, no una clasificación.
Avanzado
19 minutosCómo construir sistemas de evaluación específicos de dominio para modelos de lenguaje: Hamel Husain y Emil Sedgh
AI Engineer. Hamel Husain y el CTO de Rechat recorren el sistema de evaluación de un producto de IA real: por qué fallan las evaluaciones genéricas y preconfiguradas; cómo combinan por capas aserciones, trazas registradas con revisión humana y LLM jueces alineados con un especialista del dominio; y cómo un sistema funcional permite avanzar en la curación de datos y el ajuste fino. Es el caso de producción que materializa el argumento del artículo: las evaluaciones son maquinaria para detectar regresiones, no una clasificación.
Avanzado
9 minutosLangSmith en 10 minutos
LangChain. El cofundador de LangChain recorre una traza, un proyecto y un conjunto de datos de LLM: coste en tokens, latencia, tasa de errores, agregación de comentarios y análisis detallado del span correspondiente a un único paso de recuperación. Es el equivalente visual más cercano a lo que describe el artículo cuando afirma que «cada llamada es un span» y explica por qué las trazas estructuradas superan a los registros mediante print.
Avanzado
154 minutosInstrumentación y evaluación de LLM
Hamel Husain. Hamel Husain, Eugene Yan, Brian Bischof, Harrison Chase y Shreya Shankar trabajan con trazas, análisis de registros, LLM como juez y el proceso de revisión de datos reales de producción. Dedícale el tiempo que dedicarías a un pódcast extenso: es la mejor explicación en profundidad de YouTube sobre la tesis «observa tus trazas» del artículo.
Avanzado