Kompletterande videor

Bygg utvärderingar som faktiskt upptäcker regressioner – kompletterande videor

Utvärderingsdesign är den del av LLM-arbetet där YouTubes etablerade utbud är tunt – det mesta populära innehållet handlar om ”vilket riktmärke som är bäst” i stället för ”hur hindrar jag min produkt från att obemärkt bli sämre”. Båda valen ligger under vår vanliga gräns för antal visningar eftersom det faktiskt är så här det ser ut i denna del av området. De är de tydligaste behandlingarna som finns – ett praktiskt solobygge och en fallstudie från produktion – och tillsammans visar de samma problem ur två perspektiv.

Förstahandsval

55:02
Så sätter du systematiskt upp LLM-utvärderingar (mätvärden, enhetstester, LLM som bedömare)

Dave Ebbelaar

En verksam AI-ingenjör går igenom sin faktiska utvärderingsstege – enhetstester baserade på assertioner, referensfria mätvärden, anpassning av LLM-bedömare till människor och arbetscykeln analysera/mäta/förbättra. Strukturen är den närmaste videomotsvarigheten till artikelns argument att utvärderingar är ett system för att upptäcka regressioner, inte en topplista.

Vad du bör få ut av detta: Utforma en utvärderingsstege som upptäcker regressioner innan ändringar av prompt eller modell når användarna.

Titta på eller ha koll på först: Erfarenhet av att driftsätta eller underhålla ett AI-arbetsflöde med kända exempel på fel.

Anteckning från AI Expert: Vissa verktygsval kommer att åldras, men stegen är sund: deterministiska kontroller först, därefter modellbedömda kontroller som validerats mot människor. Hoppa inte över kalibreringen bara för att det är enkelt att lägga till en LLM-bedömare.

Öppna videosidan

Värt att titta på

18:44
Så bygger du domänspecifika system för LLM-utvärdering: Hamel Husain och Emil Sedgh

AI Engineer

Hamel Husain och Rechats CTO går igenom utvärderingssystemet bakom en verklig AI-produkt: varför generiska standardutvärderingar misslyckas, en skiktad uppsättning assertioner och loggade spår med mänsklig granskning, LLM-bedömare som hålls i linje med en domänexpert samt hur ett fungerande utvärderingssystem möjliggör datakuratering och finjustering. Det är fallstudien från produktion för artikelns argument att utvärderingar är maskiner för att upptäcka regressioner, inte en topplista.

Vad du bör få ut av detta: Se hur ett produktionsteam kombinerar assertioner, mänsklig granskning och LLM-bedömare i lager så att regressioner upptäcks före lansering.

Titta på eller ha koll på först: Du bör vara bekväm med grundläggande terminologi för LLM-utvärdering och artikelns modell med en utvärderingsstege.

Anteckning från AI Expert: Inspelad i mitten av 2024. De specifika verktygen har utvecklats, men det har inte systemdesignen. Behandla den som en arkitekturreferens, inte som en leverantörsguide, och behåll domänexperten i processen så som föredraget insisterar på.

Öppna videosidan