Tilhørende videoer

Evalueringer for ikke-ingeniører — ledsagende videoer

Artiklen argumenterer for, at evalueringer ikke er et ML-ingeniør-ritual — de er den eneste måde, et team ved, om en promptændring gjorde outputtet bedre eller værre. Videoerne nedenfor giver dig den strategiske samtale og den konkrete no-code-demo.

Primært valg

1:46:33
How to evaluate AI products | Hamel Husain & Shreya Shankar (Lenny's Podcast)

Lenny's Podcast

Hamel Husain og Shreya Shankar gennemgår hele eval-arbejdsgangen på en rigtig property-management-AI-assistent — at se på traces, open og axial coding af fejl, at beslutte, hvornår man skal stoppe, at bygge en LLM-as-judge og validere den mod menneskelig vurdering. Det er den sjældne lange samtale, der ægte er rettet mod PM'er og team leads snarere end ML-ingeniører, og den dækker samme "30 minutter om ugen efter opsætning"-rytme, artiklen anbefaler.

Hvad du bør få ud af dette: Lær produktbyggerens eval-sløjfe: inspicér traces, label fejl, definér kriterier, test ændringer, og sammenlign med menneskelig vurdering.

Forudsætninger: Hav mindst én AI-arbejdsgang, hvor kvalitet kan blive bedre eller værre over tid.

Bemærkning fra AI Expert: Dette forbliver en af de bedste eval-forklaringer for ikke-ingeniører, fordi den fokuserer på arbejdsgangsdisciplin snarere end et specifikt værktøj. Behold metoden, og vælg derefter tooling, der passer til jeres databeskyttelses- og observerbarhedsbegrænsninger.

Åbn videoside

Også værd at se

03:20
Evaluér prompts i Anthropic Console

Anthropic

En tre minutters Anthropic-gennemgang af at køre en rigtig eval inde i Workbench — auto-generering af realistiske testcases, bedømmelse af outputs, justering af prompten og genkørsel af samme suite side om side. Visningstallet ligger under den sædvanlige grænse, men til "hvordan gør jeg faktisk dette uden at skrive kode" er dette den klareste officielle demo og slotter pænt ind under den mere strategiske Husain/Shankar-samtale.

Hvad du bør få ud af dette: Se den mindste no-code-version af en gentagelig prompt-eval.

Forudsætninger: Grundlæggende erfaring med promptredigering og adgang til en evalueringsoverflade som en console eller workbench.

Bemærkning fra AI Expert: Console-UI og feature-navne kan ændre sig. Brug den som et mønster: faste testcases, eksplicitte bedømmelseskriterier, side-om-side-sammenligning og gentagelige genkørsler.

Åbn videoside