Tema

Evaluación, observabilidad y calidad

Mide el comportamiento de la IA, detecta regresiones, controla costes y latencia y mejora continuamente los flujos de trabajo.

12 contenidos (5 artículos · 7 vídeos)

Comienza aquí

Una selección inicial antes de explorar todo el contenido.

Más sobre este tema

69 minutos
Vídeo

El panorama de los agentes: lecciones aprendidas al llevar agentes a producción

MLOps.community. El vicepresidente de IA de Prosus y un ingeniero de IA explican qué falló realmente cuando desplegaron agentes en las empresas de la cartera del grupo: pruebas de penetración de inyección de prompts antes del lanzamiento; una escritura insegura cuando un agente de Jira no interpretó correctamente la taquigrafía humana; contexto obsoleto gestionado haciendo que los agentes expusieran sus supuestos; y mecanismos alternativos que fusionaban o retiraban agentes cuando estos empezaban a añadir carga cognitiva. Es como ver el registro de modos de fallo del artículo reproducido en una autopsia en directo.

Avanzado
10 min de lectura
Artículo

Modos de fallo de IA en producción: qué falla después de la demostración

Los sistemas de IA suelen fallar de formas predecibles: alucinaciones, contexto obsoleto, complacencia, inyección de prompts, uso inseguro de herramientas, deriva de esquemas y gestión deficiente de fallos. Este registro de modos de fallo está dirigido a equipos que despliegan flujos de trabajo reales.

Avanzado
11 min de lectura
Artículo

Fragmentación, reranking y búsqueda híbrida: consigue que RAG funcione de verdad

La mayoría de las implementaciones de RAG funcionan mal porque fallan en tres aspectos. Una guía práctica para fragmentar documentos, reordenar resultados y combinar la búsqueda por palabras clave con la semántica, sin convertirte en especialista en motores de búsqueda.

Intermedio
107 minutos
Vídeo

Por qué las evaluaciones de IA son la nueva habilidad más demandada para quienes crean productos | Hamel Husain y Shreya Shankar

Lenny's Podcast. Hamel Husain y Shreya Shankar recorren el flujo completo de evaluación con un asistente de IA real para la gestión inmobiliaria: inspeccionar trazas, aplicar codificación abierta y axial a los errores, decidir cuándo detenerse, crear un LLM como juez y validarlo frente al criterio humano. Es una de las pocas conversaciones extensas dirigidas realmente a responsables de producto y de equipo, no a ingenieros de ML, y sigue el mismo ritmo de «30 minutos a la semana después de la configuración» recomendado por el artículo.

Intermedio
3 minutos
Vídeo

Evalúa prompts en la consola de Anthropic

Anthropic. Es una demostración de tres minutos de Anthropic sobre cómo ejecutar una evaluación real en Workbench: generar automáticamente casos de prueba realistas, calificar las respuestas, ajustar el prompt y volver a ejecutar en paralelo el mismo conjunto. Las visualizaciones quedan por debajo del umbral habitual, pero es la demostración oficial más clara para responder «¿cómo hago esto sin escribir código?» y complementa bien la conversación más estratégica de Husain y Shankar.

Intermedio
55 minutos
Vídeo

Cómo configurar sistemáticamente evaluaciones de modelos de lenguaje (métricas, pruebas unitarias, modelo como juez)

Dave Ebbelaar. Un ingeniero de IA en activo recorre su escala real de evaluaciones: pruebas unitarias de tipo assert, métricas sin referencia, alineación del LLM como juez con el criterio humano y el ciclo de analizar, medir y mejorar. Es la estructura audiovisual que más se aproxima al argumento del artículo: las evaluaciones forman un sistema para detectar regresiones, no una clasificación.

Avanzado
19 minutos
Vídeo

Cómo construir sistemas de evaluación específicos de dominio para modelos de lenguaje: Hamel Husain y Emil Sedgh

AI Engineer. Hamel Husain y el CTO de Rechat recorren el sistema de evaluación de un producto de IA real: por qué fallan las evaluaciones genéricas y preconfiguradas; cómo combinan por capas aserciones, trazas registradas con revisión humana y LLM jueces alineados con un especialista del dominio; y cómo un sistema funcional permite avanzar en la curación de datos y el ajuste fino. Es el caso de producción que materializa el argumento del artículo: las evaluaciones son maquinaria para detectar regresiones, no una clasificación.

Avanzado
9 minutos
Vídeo

LangSmith en 10 minutos

LangChain. El cofundador de LangChain recorre una traza, un proyecto y un conjunto de datos de LLM: coste en tokens, latencia, tasa de errores, agregación de comentarios y análisis detallado del span correspondiente a un único paso de recuperación. Es el equivalente visual más cercano a lo que describe el artículo cuando afirma que «cada llamada es un span» y explica por qué las trazas estructuradas superan a los registros mediante print.

Avanzado
154 minutos
Vídeo

Instrumentación y evaluación de LLM

Hamel Husain. Hamel Husain, Eugene Yan, Brian Bischof, Harrison Chase y Shreya Shankar trabajan con trazas, análisis de registros, LLM como juez y el proceso de revisión de datos reales de producción. Dedícale el tiempo que dedicarías a un pódcast extenso: es la mejor explicación en profundidad de YouTube sobre la tesis «observa tus trazas» del artículo.

Avanzado