Vídeos complementarios

Cómo crear evaluaciones que realmente detecten regresiones — vídeos complementarios

El diseño de evaluaciones es uno de los ámbitos del trabajo con LLM con menos vídeos de referencia en YouTube: el contenido popular suele preguntar «¿cuál es el mejor benchmark?» en lugar de «¿cómo evito que mi producto empeore sin que nadie lo advierta?». Ambas selecciones quedan por debajo de nuestro umbral habitual de visualizaciones porque este ámbito tiene realmente una audiencia reducida. Son las explicaciones más claras disponibles —una implementación práctica individual y un caso de producción— y permiten observar el mismo problema desde dos perspectivas.

Selección principal

55:02
Cómo configurar sistemáticamente evaluaciones de modelos de lenguaje (métricas, pruebas unitarias, modelo como juez)

Dave Ebbelaar

Un ingeniero de IA en activo recorre su escala real de evaluaciones: pruebas unitarias de tipo assert, métricas sin referencia, alineación del LLM como juez con el criterio humano y el ciclo de analizar, medir y mejorar. Es la estructura audiovisual que más se aproxima al argumento del artículo: las evaluaciones forman un sistema para detectar regresiones, no una clasificación.

Qué aprenderás: Diseñarás una escala de evaluaciones que detecte regresiones antes de que los cambios en los prompts o los modelos lleguen a los usuarios.

Qué ver o saber antes: Experiencia implementando o manteniendo un flujo de trabajo de IA con ejemplos de fallos conocidos.

Nota de AI Expert: Algunas herramientas quedarán obsoletas, pero la escala es sólida: primero comprobaciones deterministas y después comprobaciones calificadas por modelos y validadas frente a personas. No omitas la calibración solo porque resulte fácil añadir un LLM juez.

Abrir página del vídeo

También merece la pena

18:44
Cómo construir sistemas de evaluación específicos de dominio para modelos de lenguaje: Hamel Husain y Emil Sedgh

AI Engineer

Hamel Husain y el CTO de Rechat recorren el sistema de evaluación de un producto de IA real: por qué fallan las evaluaciones genéricas y preconfiguradas; cómo combinan por capas aserciones, trazas registradas con revisión humana y LLM jueces alineados con un especialista del dominio; y cómo un sistema funcional permite avanzar en la curación de datos y el ajuste fino. Es el caso de producción que materializa el argumento del artículo: las evaluaciones son maquinaria para detectar regresiones, no una clasificación.

Qué aprenderás: Verás cómo un equipo de producción combina aserciones, revisión humana y LLM jueces para hacer aflorar las regresiones antes del lanzamiento.

Qué ver o saber antes: Familiaridad con el vocabulario básico de evaluación de modelos de lenguaje y el marco de escalera de evaluaciones del artículo.

Nota de AI Expert: Se grabó a mediados de 2024; las herramientas concretas han evolucionado, pero no el diseño del sistema. Considéralo una referencia de arquitectura, no una guía de proveedores, y mantén al especialista del dominio dentro del proceso, tal como insiste la charla.

Abrir página del vídeo