55:02Dave Ebbelaar
En arbejdende AI-ingeniør gennemgår sin faktiske eval-stige — assert-stil unit tests, reference-free metrics, LLM-as-judge-alignment med mennesker og analyze/measure/improve-sløjfen. Strukturen er det nærmeste match på video til artiklens argument om, at evalueringer er et regression-fangende system, ikke en leaderboard.
Hvad du bør få ud af dette: Design en eval-stige, der fanger regressioner, før prompt- eller modelændringer når brugerne.
Forudsætninger: Erfaring med at shippe eller vedligeholde en AI-arbejdsgang med kendte fejleksempler.
Bemærkning fra AI Expert: Nogle værktøjsvalg vil ældes, men stigen er solid: deterministiske checks først, derefter model-bedømte checks valideret mod mennesker. Spring ikke kalibrering over bare fordi en LLM-judge er nem at tilføje.
