Evaluación, observabilidad y calidad
Mide el comportamiento de la IA, detecta regresiones, controla costes y latencia y mejora continuamente los flujos de trabajo.
12 contenidos (5 artículos · 7 vídeos)
Comienza aquí
Una selección inicial antes de explorar todo el contenido.
10 min de lecturaEvaluaciones para no ingenieros: descubre si tu flujo de IA mejora o empeora
Las evaluaciones —la medición sistemática de la calidad de las respuestas de una IA— suelen considerarse una tarea de ingeniería. Sin embargo, todos los equipos que ejecutan flujos de IA las necesitan y sus fundamentos se pueden aplicar sin programar. Aprende cómo hacerlo.
Intermedio
13 min de lecturaCómo crear evaluaciones que realmente detecten regresiones
La mayoría de las suites de evaluación parecen impresionantes, pero no detectan regresiones reales. Para crear evaluaciones que detecten lo importante se necesitan conjuntos de datos bien diseñados, métricas sensibles, jueces calibrados y una cultura de confianza. Estos son los patrones de los equipos que lo hacen bien.
Avanzado
12 min de lecturaObservabilidad para aplicaciones con LLM: trazas, costes, latencia y deriva de la calidad
Las aplicaciones con LLM fallan de formas que la observabilidad tradicional no detecta. Estos son los patrones para trazar flujos de varios pasos, controlar costes que varían 100x por llamada, monitorizar la deriva de la calidad y depurar alucinaciones a escala de producción.
AvanzadoMás sobre este tema

El panorama de los agentes: lecciones aprendidas al llevar agentes a producción
El panorama de los agentes: lecciones aprendidas al llevar agentes a producción
Avanzado
10 min de lecturaModos de fallo de IA en producción: qué falla después de la demostración
Los sistemas de IA suelen fallar de formas predecibles: alucinaciones, contexto obsoleto, complacencia, inyección de prompts, uso inseguro de herramientas, deriva de esquemas y gestión deficiente de fallos. Este registro de modos de fallo está dirigido a equipos que despliegan flujos de trabajo reales.
Avanzado
11 min de lecturaFragmentación, reranking y búsqueda híbrida: consigue que RAG funcione de verdad
La mayoría de las implementaciones de RAG funcionan mal porque fallan en tres aspectos. Una guía práctica para fragmentar documentos, reordenar resultados y combinar la búsqueda por palabras clave con la semántica, sin convertirte en especialista en motores de búsqueda.
Intermedio
Por qué las evaluaciones de IA son la nueva habilidad más demandada para quienes crean productos | Hamel Husain y Shreya Shankar
Por qué las evaluaciones de IA son la nueva habilidad más demandada para quienes crean productos | Hamel Husain y Shreya Shankar
Intermedio
Evalúa prompts en la consola de Anthropic
Evalúa prompts en la consola de Anthropic
Intermedio
Cómo configurar sistemáticamente evaluaciones de modelos de lenguaje (métricas, pruebas unitarias, modelo como juez)
Cómo configurar sistemáticamente evaluaciones de modelos de lenguaje (métricas, pruebas unitarias, modelo como juez)
Avanzado
Cómo construir sistemas de evaluación específicos de dominio para modelos de lenguaje: Hamel Husain y Emil Sedgh
Cómo construir sistemas de evaluación específicos de dominio para modelos de lenguaje: Hamel Husain y Emil Sedgh
Avanzado
LangSmith en 10 minutos
LangSmith en 10 minutos
Avanzado
Instrumentación y evaluación de LLM
Instrumentación y evaluación de LLM
Avanzado