Cómo configurar sistemáticamente evaluaciones de modelos de lenguaje (métricas, pruebas unitarias, modelo como juez)

55 minutosAvanzadoCreadorDave EbbelaarIA para empresas

Dave Ebbelaar. Un ingeniero de IA en activo recorre su escala real de evaluaciones: pruebas unitarias de tipo assert, métricas sin referencia, alineación del LLM como juez con el criterio humano y el ciclo de analizar, medir y mejorar. Es la estructura audiovisual que más se aproxima al argumento del artículo: las evaluaciones forman un sistema para detectar regresiones, no una clasificación.

Nota de AI Expert

Algunas herramientas quedarán obsoletas, pero la escala es sólida: primero comprobaciones deterministas y después comprobaciones calificadas por modelos y validadas frente a personas. No omitas la calibración solo porque resulte fácil añadir un LLM juez.

Qué aprenderás

Diseñarás una escala de evaluaciones que detecte regresiones antes de que los cambios en los prompts o los modelos lleguen a los usuarios.

Qué ver o saber antes

Experiencia implementando o manteniendo un flujo de trabajo de IA con ejemplos de fallos conocidos.

Última revisión: 18 may 2026

Ver siguiente

Continúa por el mismo itinerario de aprendizaje con los siguientes vídeos complementarios seleccionados.