55:02Dave Ebbelaar
En verksam AI-ingenjör går igenom sin faktiska utvärderingsstege – enhetstester baserade på assertioner, referensfria mätvärden, anpassning av LLM-bedömare till människor och arbetscykeln analysera/mäta/förbättra. Strukturen är den närmaste videomotsvarigheten till artikelns argument att utvärderingar är ett system för att upptäcka regressioner, inte en topplista.
Vad du bör få ut av detta: Utforma en utvärderingsstege som upptäcker regressioner innan ändringar av prompt eller modell når användarna.
Titta på eller ha koll på först: Erfarenhet av att driftsätta eller underhålla ett AI-arbetsflöde med kända exempel på fel.
Anteckning från AI Expert: Vissa verktygsval kommer att åldras, men stegen är sund: deterministiska kontroller först, därefter modellbedömda kontroller som validerats mot människor. Hoppa inte över kalibreringen bara för att det är enkelt att lägga till en LLM-bedömare.
