55:02Dave Ebbelaar
Un ingeniero de IA en activo recorre su escala real de evaluaciones: pruebas unitarias de tipo assert, métricas sin referencia, alineación del LLM como juez con el criterio humano y el ciclo de analizar, medir y mejorar. Es la estructura audiovisual que más se aproxima al argumento del artículo: las evaluaciones forman un sistema para detectar regresiones, no una clasificación.
Qué aprenderás: Diseñarás una escala de evaluaciones que detecte regresiones antes de que los cambios en los prompts o los modelos lleguen a los usuarios.
Qué ver o saber antes: Experiencia implementando o manteniendo un flujo de trabajo de IA con ejemplos de fallos conocidos.
Nota de AI Expert: Algunas herramientas quedarán obsoletas, pero la escala es sólida: primero comprobaciones deterministas y después comprobaciones calificadas por modelos y validadas frente a personas. No omitas la calibración solo porque resulte fácil añadir un LLM juez.
