1:46:33Lenny's Podcast
Hamel Husain og Shreya Shankar gennemgår hele eval-arbejdsgangen på en rigtig property-management-AI-assistent — at se på traces, open og axial coding af fejl, at beslutte, hvornår man skal stoppe, at bygge en LLM-as-judge og validere den mod menneskelig vurdering. Det er den sjældne lange samtale, der ægte er rettet mod PM'er og team leads snarere end ML-ingeniører, og den dækker samme "30 minutter om ugen efter opsætning"-rytme, artiklen anbefaler.
Hvad du bør få ud af dette: Lær produktbyggerens eval-sløjfe: inspicér traces, label fejl, definér kriterier, test ændringer, og sammenlign med menneskelig vurdering.
Forudsætninger: Hav mindst én AI-arbejdsgang, hvor kvalitet kan blive bedre eller værre over tid.
Bemærkning fra AI Expert: Dette forbliver en af de bedste eval-forklaringer for ikke-ingeniører, fordi den fokuserer på arbejdsgangsdisciplin snarere end et specifikt værktøj. Behold metoden, og vælg derefter tooling, der passer til jeres databeskyttelses- og observerbarhedsbegrænsninger.
