Vídeos complementarios

Evaluaciones para no ingenieros: descubre si tu flujo de IA mejora o empeora — vídeos complementarios

El artículo sostiene que evaluar los prompts por sensaciones funciona hasta que deja de hacerlo: tarde o temprano necesitas una forma pequeña y repetible de responder «¿este cambio ha mejorado o empeorado el resultado?». Estos vídeos presentan el método desde dos perspectivas: el flujo conceptual de quienes enseñan evaluaciones a responsables de producto en OpenAI y Anthropic, y una demostración de 3 minutos para realizar una evaluación sin código desde una consola.

Selección principal

1:46:33
Por qué las evaluaciones de IA son la nueva habilidad más demandada para quienes crean productos | Hamel Husain y Shreya Shankar

Lenny's Podcast

Hamel Husain y Shreya Shankar recorren el flujo completo de evaluación con un asistente de IA real para la gestión inmobiliaria: inspeccionar trazas, aplicar codificación abierta y axial a los errores, decidir cuándo detenerse, crear un LLM como juez y validarlo frente al criterio humano. Es una de las pocas conversaciones extensas dirigidas realmente a responsables de producto y de equipo, no a ingenieros de ML, y sigue el mismo ritmo de «30 minutos a la semana después de la configuración» recomendado por el artículo.

Qué aprenderás: Aprenderás el ciclo de evaluación para productos: inspeccionar trazas, etiquetar fallos, definir criterios, probar cambios y comparar los resultados con el criterio humano.

Qué ver o saber antes: Tener al menos un flujo de trabajo de IA donde la calidad pueda mejorar o empeorar con el tiempo.

Nota de AI Expert: Sigue siendo una de las mejores explicaciones de las evaluaciones para personas no ingenieras porque se centra en la disciplina del flujo, no en una herramienta concreta. Conserva el método y elige después las herramientas que se ajusten a tus restricciones de privacidad y observabilidad.

Abrir página del vídeo

También merece la pena

03:20
Evalúa prompts en la consola de Anthropic

Anthropic

Es una demostración de tres minutos de Anthropic sobre cómo ejecutar una evaluación real en Workbench: generar automáticamente casos de prueba realistas, calificar las respuestas, ajustar el prompt y volver a ejecutar en paralelo el mismo conjunto. Las visualizaciones quedan por debajo del umbral habitual, pero es la demostración oficial más clara para responder «¿cómo hago esto sin escribir código?» y complementa bien la conversación más estratégica de Husain y Shankar.

Qué aprenderás: Verás la versión mínima y sin código de una evaluación de prompts repetible.

Qué ver o saber antes: Experiencia básica editando prompts y acceso a una herramienta de evaluación, como una consola o Workbench.

Nota de AI Expert: La interfaz y los nombres de las funciones de la consola pueden cambiar. Conserva el patrón: casos de prueba fijos, criterios de calificación explícitos, comparación en paralelo y ejecuciones repetibles.

Abrir página del vídeo