Utvärdering, observerbarhet och kvalitet
Mät AI-beteende, upptäck regressioner, spåra kostnad och latens och förbättra arbetsflöden löpande.
12 innehållsposter (5 artiklar · 7 videor)
Börja här
Börja med några rekommenderade innehållsposter innan du går igenom hela flödet.
10 min läsningUtvärderingar för icke-utvecklare: ta reda på om ditt AI-arbetsflöde blir bättre eller sämre
Utvärderingar – systematisk mätning av kvaliteten på AI-resultat – behandlas vanligtvis som en utvecklarfråga. Men alla team som kör AI-arbetsflöden behöver dem, och grunderna är tillgängliga utan kod. Så gör du.
Mellannivå
13 min läsningBygg utvärderingar som faktiskt upptäcker regressioner
De flesta utvärderingssviter ser imponerande ut men missar verkliga regressioner. För att bygga utvärderingar som upptäcker det viktiga krävs noggrann konstruktion av dataset, känsliga mätetal, kalibrering av bedömare och en tillitskultur. Här är mönstren från team som lyckas.
Avancerad
12 min läsningObserverbarhet för LLM-appar: spårning, kostnader, latens och kvalitetsdrift
LLM-applikationer fallerar på unika sätt som traditionell observerbarhet missar. Här är mönstren för att spåra flerstegsflöden, följa kostnader som varierar 100 gånger per anrop, övervaka kvalitetsdrift och felsöka hallucinationer i produktionsskala.
AvanceradMer i detta ämne
69 minuterAgentlandskapet – lärdomar från att driftsätta agenter i produktion
MLOps.community. Prosus AI-chef och en AI-utvecklare berättar vad som faktiskt gick sönder när de driftsatte agenter i koncernens portföljbolag: penetrationstestning av promptinjektion före lansering, en osäker skrivning när en Jira-agent inte kunde tolka mänsklig kortnotation, inaktuell kontext som hanterades genom att agenterna fick redovisa sina antaganden samt reservlösningar som slog samman eller stängde av agenter när dessa började öka den kognitiva belastningen. Det är som att se artikelns register över fellägen spelas upp som en direktsänd incidentanalys.
Avancerad
10 min läsningFellägen för AI i produktion: det som går sönder efter demon
AI-system fallerar ofta på förutsägbara sätt: hallucinationer, inaktuell kontext, överdriven medhållsamhet, promptinjektion, osäker verktygsanvändning, schemadrift och bristfällig felhantering. Ett fellägesregister för team som driftsätter verkliga arbetsflöden.
Avancerad
11 min läsningSegmentering, omrangordning och hybridsökning: få RAG att faktiskt fungera
De flesta RAG-implementationer fungerar dåligt eftersom de gör tre saker fel. En praktisk guide till att segmentera dokument, rangordna om resultat och kombinera nyckelordssökning med semantisk sökning – utan att bli sökingenjör.
Mellannivå
107 minuterDärför är AI-utvärderingar den hetaste nya färdigheten för produktutvecklare | Hamel Husain och Shreya Shankar
Lenny's Podcast. Hamel Husain och Shreya Shankar går igenom hela arbetsflödet för utvärderingar med en verklig AI-assistent för fastighetsförvaltning – granskar spårningar, kodar fel öppet och axialt, avgör när de ska sluta, bygger en LLM som bedömare och validerar den mot mänsklig bedömning. Det här är ett av få längre samtal som verkligen riktar sig till produktchefer och teamledare snarare än ML-utvecklare, och det tar upp samma rytm på ”30 minuter i veckan efter konfigureringen” som artikeln rekommenderar.
Mellannivå
3 minuterUtvärdera prompter i Anthropic Console
Anthropic. En tre minuter lång genomgång från Anthropic av hur man kör en verklig utvärdering i Workbench – genererar automatiskt realistiska testfall, betygsätter resultat, finjusterar prompten och kör samma testsvit på nytt sida vid sida. Antalet visningar ligger under den vanliga gränsen, men för frågan ”hur gör jag faktiskt det här utan att skriva kod?” är det den tydligaste officiella demonstrationen och passar väl under det mer strategiska samtalet med Husain och Shankar.
Mellannivå
55 minuterSå sätter du systematiskt upp LLM-utvärderingar (mätvärden, enhetstester, LLM som bedömare)
Dave Ebbelaar. En verksam AI-ingenjör går igenom sin faktiska utvärderingsstege – enhetstester baserade på assertioner, referensfria mätvärden, anpassning av LLM-bedömare till människor och arbetscykeln analysera/mäta/förbättra. Strukturen är den närmaste videomotsvarigheten till artikelns argument att utvärderingar är ett system för att upptäcka regressioner, inte en topplista.
Avancerad
19 minuterSå bygger du domänspecifika system för LLM-utvärdering: Hamel Husain och Emil Sedgh
AI Engineer. Hamel Husain och Rechats CTO går igenom utvärderingssystemet bakom en verklig AI-produkt: varför generiska standardutvärderingar misslyckas, en skiktad uppsättning assertioner och loggade spår med mänsklig granskning, LLM-bedömare som hålls i linje med en domänexpert samt hur ett fungerande utvärderingssystem möjliggör datakuratering och finjustering. Det är fallstudien från produktion för artikelns argument att utvärderingar är maskiner för att upptäcka regressioner, inte en topplista.
Avancerad
9 minuterLangSmith på 10 minuter
LangChain. En av LangChains medgrundare ger en guidad rundtur i ett LLM-spår, ett projekt och en datamängd – tokenkostnad, latens, felfrekvens, aggregering av återkoppling och fördjupning i ett enskilt spann för ett hämtningssteg. Det är den närmaste visuella motsvarigheten till det artikeln beskriver med ”varje anrop är ett spann” och varför strukturerade spår är bättre än loggning med utskrifter.
Avancerad
154 minuterInstrumentering och utvärdering av LLM:er
Hamel Husain. Hamel Husain, Eugene Yan, Brian Bischof, Harrison Chase och Shreya Shankar arbetar med spårning, logganalys, LLM som bedömare och arbetsflödet för att granska verkliga produktionsdata. Ge den samma uppmärksamhet som en lång podd – det är YouTubes bästa enskilda djupbehandling av artikelns tes ”titta på dina spår”.
Avancerad