Tilhørende videoer

Sådan bygger du evalueringer, der faktisk opdager regressioner — ledsagende videoer

Eval-design er den del af LLM-arbejde, hvor YouTube-kanonen er tynd — det meste populære indhold er "hvad er det bedste benchmark" snarere end "hvordan stopper jeg mit produkt i stille at blive værre". Begge valg ligger under vores sædvanlige visningsgrænse, fordi det ægte er sådan, denne del af feltet ser ud; de er de klareste behandlinger tilgængelige — den ene en hands-on solo-bygning, den anden et produktionscasestudie — parret, så du kan se samme problem fra to vinkler.

Primært valg

55:02
Sådan sætter du systematisk LLM-evals op (metrics, unit tests, LLM-as-a-Judge)

Dave Ebbelaar

En arbejdende AI-ingeniør gennemgår sin faktiske eval-stige — assert-stil unit tests, reference-free metrics, LLM-as-judge-alignment med mennesker og analyze/measure/improve-sløjfen. Strukturen er det nærmeste match på video til artiklens argument om, at evalueringer er et regression-fangende system, ikke en leaderboard.

Hvad du bør få ud af dette: Design en eval-stige, der fanger regressioner, før prompt- eller modelændringer når brugerne.

Forudsætninger: Erfaring med at shippe eller vedligeholde en AI-arbejdsgang med kendte fejleksempler.

Bemærkning fra AI Expert: Nogle værktøjsvalg vil ældes, men stigen er solid: deterministiske checks først, derefter model-bedømte checks valideret mod mennesker. Spring ikke kalibrering over bare fordi en LLM-judge er nem at tilføje.

Åbn videoside

Også værd at se

18:44
Sådan konstruerer du domænespecifikke LLM-evalueringssystemer: Hamel Husain og Emil Sedgh

AI Engineer

Hamel Husain og Rechats CTO gennemgår eval-systemet bag et rigtigt AI-produkt: hvorfor generiske off-the-shelf-evals fejler, en lagdelt opsætning af assertions, loggede traces med menneskelig gennemgang og LLM-judges holdt aligned med en domæneekspert, og hvordan et fungerende eval-system låser data curation og finjustering op. Det er produktionscasestudiet for artiklens argument om, at evalueringer er regression-fangende maskineri, ikke en leaderboard.

Hvad du bør få ud af dette: Se, hvordan et produktionsteam lægger assertions, menneskelig gennemgang og LLM-judges i lag, så regressioner dukker op før release.

Forudsætninger: Fortrolig med grundlæggende LLM-evalueringsterminologi og artiklens eval-stige-framing.

Bemærkning fra AI Expert: Optaget midt i 2024; specifikke værktøjer er gået videre, men systemdesignet er det ikke. Behandl den som en arkitekturreference, ikke en vendor-guide, og hold domæneeksperten i loopet, som talket insisterer på.

Åbn videoside