Evals, Observability & Quality
Measure AI behavior, catch regressions, trace cost and latency, and keep workflows improving.
12 historier (5 artikler · 7 videoer)
Start her
Et par gode steder at begynde, før du går på opdagelse i hele oversigten.
10 min læsningEvalueringer for ikke-ingeniører: Se, om jeres AI-arbejdsgang bliver bedre eller dårligere
Evalueringer — systematisk måling af kvaliteten i AI-output — behandles normalt som et teknisk anliggende. Men alle teams med AI-arbejdsgange har brug for dem, og grundprincipperne kræver ingen kode. Sådan gør I.
Let øvet
13 min læsningSådan bygger du evalueringer, der faktisk opdager regressioner
De fleste evalueringssuiter ser imponerende ud, men overser reelle regressioner. Det kræver omhyggelig opbygning af datasæt, følsomme målinger, kalibrering af dommermodeller og en kultur præget af tillid at bygge evalueringer, der opdager det væsentlige. Her er mønstrene fra de teams, der lykkes med det.
Avanceret
12 min læsningObserverbarhed i LLM-applikationer: sporing, omkostninger, svartid og kvalitetsændringer
Udvid almindelig observerbarhed med flertrinsspor, henførbare omkostninger, prompt- og modelversioner, evaluerede kvalitetssignaler, databeskyttelseskontroller og advarsler baseret på arbejdsbelastningen.
AvanceretFlere i dette emne
69 minutterAgentlandskabet – erfaringer fra at sætte agenter i produktion
MLOps.community. Prosus' VP of AI og en AI-ingeniør rapporterer, hvad der faktisk brød, da de deployede agenter på tværs af gruppens porteføljevirksomheder: promptinjektion-pentest før launch, en usikker write, da en Jira-agent fejlede på menneskelig stenografi, forældet kontekst håndteret ved at få agenter til at synliggøre deres antagelser, og fallback-design, der merged eller dræbte agenter, når de tilføjede cognitive load. Det læser som artiklens fejltilstandsregister genafspillet som en live postmortem.
Avanceret
10 min læsningFejltilstande i AI-produktion: det, der går i stykker efter demoen
AI-systemer fejler som regel på forudsigelige måder: hallucinationer, forældet kontekst, medløberi, prompt injection, usikker værktøjsbrug, skemadrift og svage fallbacks. Et register over fejltilstande til teams, der sætter reelle workflows i produktion.
Avanceret
11 min læsningChunking, reranking og hybridsøgning: Få RAG til faktisk at virke
De fleste RAG-implementeringer fungerer dårligt, fordi de håndterer tre ting forkert. En praktisk guide til chunking af dokumenter, reranking af resultater og kombination af søgeord med semantisk søgning — uden at du behøver blive søgeekspert.
Let øvet
107 minutterHow to evaluate AI products | Hamel Husain & Shreya Shankar (Lenny's Podcast)
Lenny's Podcast. Hamel Husain og Shreya Shankar gennemgår hele eval-arbejdsgangen på en rigtig property-management-AI-assistent — at se på traces, open og axial coding af fejl, at beslutte, hvornår man skal stoppe, at bygge en LLM-as-judge og validere den mod menneskelig vurdering. Det er den sjældne lange samtale, der ægte er rettet mod PM'er og team leads snarere end ML-ingeniører, og den dækker samme "30 minutter om ugen efter opsætning"-rytme, artiklen anbefaler.
Let øvet
3 minutterEvaluér prompts i Anthropic Console
Anthropic. En tre minutters Anthropic-gennemgang af at køre en rigtig eval inde i Workbench — auto-generering af realistiske testcases, bedømmelse af outputs, justering af prompten og genkørsel af samme suite side om side. Visningstallet ligger under den sædvanlige grænse, men til "hvordan gør jeg faktisk dette uden at skrive kode" er dette den klareste officielle demo og slotter pænt ind under den mere strategiske Husain/Shankar-samtale.
Let øvet
55 minutterSådan sætter du systematisk LLM-evals op (metrics, unit tests, LLM-as-a-Judge)
Dave Ebbelaar. En arbejdende AI-ingeniør gennemgår sin faktiske eval-stige — assert-stil unit tests, reference-free metrics, LLM-as-judge-alignment med mennesker og analyze/measure/improve-sløjfen. Strukturen er det nærmeste match på video til artiklens argument om, at evalueringer er et regression-fangende system, ikke en leaderboard.
Avanceret
19 minutterSådan konstruerer du domænespecifikke LLM-evalueringssystemer: Hamel Husain og Emil Sedgh
AI Engineer. Hamel Husain og Rechats CTO gennemgår eval-systemet bag et rigtigt AI-produkt: hvorfor generiske off-the-shelf-evals fejler, en lagdelt opsætning af assertions, loggede traces med menneskelig gennemgang og LLM-judges holdt aligned med en domæneekspert, og hvordan et fungerende eval-system låser data curation og finjustering op. Det er produktionscasestudiet for artiklens argument om, at evalueringer er regression-fangende maskineri, ikke en leaderboard.
Avanceret
9 minutterLangSmith på 10 minutter
LangChain. En guidet tour af en LLM-trace, project og dataset af LangChains medstifter — token-omkostning, latenstid, fejlrate, feedback-aggregering, drill-down i et enkelt retrieval-step-span. Det er den nærmeste visuelle analog til det, artiklen beskriver, når den taler om "hvert kald er et span", og hvorfor strukturerede traces slår print-logging.
Avanceret
154 minutterInstrumentering og evaluering af LLM'er
Hamel Husain. Hamel Husain, Eugene Yan, Brian Bischof, Harrison Chase og Shreya Shankar arbejder sig igennem tracing, loganalyse, LLM-as-judge og arbejdsgangen omkring at se på rigtige produktionsdata. Sid med den på samme måde, som du ville med en lang podcast — det er den bedste dybe behandling af artiklens tese "se på dine traces" på YouTube.
Avanceret