Ämne

Utvärdering, observerbarhet och kvalitet

Mät AI-beteende, upptäck regressioner, spåra kostnad och latens och förbättra arbetsflöden löpande.

12 innehållsposter (5 artiklar · 7 videor)

Börja här

Börja med några rekommenderade innehållsposter innan du går igenom hela flödet.

Mer i detta ämne

69 minuter
Video

Agentlandskapet – lärdomar från att driftsätta agenter i produktion

MLOps.community. Prosus AI-chef och en AI-utvecklare berättar vad som faktiskt gick sönder när de driftsatte agenter i koncernens portföljbolag: penetrationstestning av promptinjektion före lansering, en osäker skrivning när en Jira-agent inte kunde tolka mänsklig kortnotation, inaktuell kontext som hanterades genom att agenterna fick redovisa sina antaganden samt reservlösningar som slog samman eller stängde av agenter när dessa började öka den kognitiva belastningen. Det är som att se artikelns register över fellägen spelas upp som en direktsänd incidentanalys.

Avancerad
10 min läsning
Artikel

Fellägen för AI i produktion: det som går sönder efter demon

AI-system fallerar ofta på förutsägbara sätt: hallucinationer, inaktuell kontext, överdriven medhållsamhet, promptinjektion, osäker verktygsanvändning, schemadrift och bristfällig felhantering. Ett fellägesregister för team som driftsätter verkliga arbetsflöden.

Avancerad
11 min läsning
Artikel

Segmentering, omrangordning och hybridsökning: få RAG att faktiskt fungera

De flesta RAG-implementationer fungerar dåligt eftersom de gör tre saker fel. En praktisk guide till att segmentera dokument, rangordna om resultat och kombinera nyckelordssökning med semantisk sökning – utan att bli sökingenjör.

Mellannivå
107 minuter
Video

Därför är AI-utvärderingar den hetaste nya färdigheten för produktutvecklare | Hamel Husain och Shreya Shankar

Lenny's Podcast. Hamel Husain och Shreya Shankar går igenom hela arbetsflödet för utvärderingar med en verklig AI-assistent för fastighetsförvaltning – granskar spårningar, kodar fel öppet och axialt, avgör när de ska sluta, bygger en LLM som bedömare och validerar den mot mänsklig bedömning. Det här är ett av få längre samtal som verkligen riktar sig till produktchefer och teamledare snarare än ML-utvecklare, och det tar upp samma rytm på ”30 minuter i veckan efter konfigureringen” som artikeln rekommenderar.

Mellannivå
3 minuter
Video

Utvärdera prompter i Anthropic Console

Anthropic. En tre minuter lång genomgång från Anthropic av hur man kör en verklig utvärdering i Workbench – genererar automatiskt realistiska testfall, betygsätter resultat, finjusterar prompten och kör samma testsvit på nytt sida vid sida. Antalet visningar ligger under den vanliga gränsen, men för frågan ”hur gör jag faktiskt det här utan att skriva kod?” är det den tydligaste officiella demonstrationen och passar väl under det mer strategiska samtalet med Husain och Shankar.

Mellannivå
55 minuter
Video

Så sätter du systematiskt upp LLM-utvärderingar (mätvärden, enhetstester, LLM som bedömare)

Dave Ebbelaar. En verksam AI-ingenjör går igenom sin faktiska utvärderingsstege – enhetstester baserade på assertioner, referensfria mätvärden, anpassning av LLM-bedömare till människor och arbetscykeln analysera/mäta/förbättra. Strukturen är den närmaste videomotsvarigheten till artikelns argument att utvärderingar är ett system för att upptäcka regressioner, inte en topplista.

Avancerad
19 minuter
Video

Så bygger du domänspecifika system för LLM-utvärdering: Hamel Husain och Emil Sedgh

AI Engineer. Hamel Husain och Rechats CTO går igenom utvärderingssystemet bakom en verklig AI-produkt: varför generiska standardutvärderingar misslyckas, en skiktad uppsättning assertioner och loggade spår med mänsklig granskning, LLM-bedömare som hålls i linje med en domänexpert samt hur ett fungerande utvärderingssystem möjliggör datakuratering och finjustering. Det är fallstudien från produktion för artikelns argument att utvärderingar är maskiner för att upptäcka regressioner, inte en topplista.

Avancerad
9 minuter
Video

LangSmith på 10 minuter

LangChain. En av LangChains medgrundare ger en guidad rundtur i ett LLM-spår, ett projekt och en datamängd – tokenkostnad, latens, felfrekvens, aggregering av återkoppling och fördjupning i ett enskilt spann för ett hämtningssteg. Det är den närmaste visuella motsvarigheten till det artikeln beskriver med ”varje anrop är ett spann” och varför strukturerade spår är bättre än loggning med utskrifter.

Avancerad
154 minuter
Video

Instrumentering och utvärdering av LLM:er

Hamel Husain. Hamel Husain, Eugene Yan, Brian Bischof, Harrison Chase och Shreya Shankar arbetar med spårning, logganalys, LLM som bedömare och arbetsflödet för att granska verkliga produktionsdata. Ge den samma uppmärksamhet som en lång podd – det är YouTubes bästa enskilda djupbehandling av artikelns tes ”titta på dina spår”.

Avancerad