Kompletterande videor

Utvärderingar för icke-utvecklare: ta reda på om ditt AI-arbetsflöde blir bättre eller sämre – kompletterande videor

Artikeln argumenterar för att det går bra att ”känna efter” om prompterna fungerar – tills det inte längre gör det. Förr eller senare behöver du ett litet, repeterbart sätt att fråga: ”Hjälpte eller stjälpte den här ändringen?” De här videorna ger dig handboken ur två perspektiv: det konceptuella arbetsflödet från personerna som lär ut utvärderingar till produktchefer på OpenAI och Anthropic samt en 3-minutersdemonstration av hur man genomför en utvärdering i en konsol utan kod.

Förstahandsval

1:46:33
Därför är AI-utvärderingar den hetaste nya färdigheten för produktutvecklare | Hamel Husain och Shreya Shankar

Lenny's Podcast

Hamel Husain och Shreya Shankar går igenom hela arbetsflödet för utvärderingar med en verklig AI-assistent för fastighetsförvaltning – granskar spårningar, kodar fel öppet och axialt, avgör när de ska sluta, bygger en LLM som bedömare och validerar den mot mänsklig bedömning. Det här är ett av få längre samtal som verkligen riktar sig till produktchefer och teamledare snarare än ML-utvecklare, och det tar upp samma rytm på ”30 minuter i veckan efter konfigureringen” som artikeln rekommenderar.

Vad du bör få ut av detta: Lär dig utvärderingsloopen för produktutvecklare: granska spårningar, märk fel, definiera kriterier, testa ändringar och jämför med mänsklig bedömning.

Titta på eller ha koll på först: Ha minst ett AI-arbetsflöde där kvaliteten kan bli bättre eller sämre med tiden.

Anteckning från AI Expert: Det här är fortfarande en av de bästa förklaringarna av utvärderingar för icke-utvecklare eftersom den fokuserar på arbetsflödesdisciplin snarare än ett specifikt verktyg. Behåll metoden och välj sedan verktyg som passar dina integritets- och observerbarhetskrav.

Öppna videosidan

Värt att titta på

03:20
Utvärdera prompter i Anthropic Console

Anthropic

En tre minuter lång genomgång från Anthropic av hur man kör en verklig utvärdering i Workbench – genererar automatiskt realistiska testfall, betygsätter resultat, finjusterar prompten och kör samma testsvit på nytt sida vid sida. Antalet visningar ligger under den vanliga gränsen, men för frågan ”hur gör jag faktiskt det här utan att skriva kod?” är det den tydligaste officiella demonstrationen och passar väl under det mer strategiska samtalet med Husain och Shankar.

Vad du bör få ut av detta: Se den minsta kodfria versionen av en repeterbar promptutvärdering.

Titta på eller ha koll på först: Grundläggande erfarenhet av att redigera prompter och åtkomst till en utvärderingsyta, exempelvis en konsol eller workbench.

Anteckning från AI Expert: Konsolens gränssnitt och funktionsnamn kan ändras. Använd detta som ett mönster: fasta testfall, uttryckliga bedömningskriterier, jämförelse sida vid sida och repeterbara omkörningar.

Öppna videosidan