Evals, Observability & Quality
Measure AI behavior, catch regressions, trace cost and latency, and keep workflows improving.
12 historier (5 artikler · 7 videoer)
Start her
Et par gode steder at begynde, før du går på opdagelse i hele oversigten.
10 min læsningEvalueringer for ikke-ingeniører: Se, om jeres AI-arbejdsgang bliver bedre eller dårligere
Evalueringer — systematisk måling af kvaliteten i AI-output — behandles normalt som et teknisk anliggende. Men alle teams med AI-arbejdsgange har brug for dem, og grundprincipperne kræver ingen kode. Sådan gør I.
Let øvet
13 min læsningSådan bygger du evalueringer, der faktisk opdager regressioner
De fleste evalueringssuiter ser imponerende ud, men overser reelle regressioner. Det kræver omhyggelig opbygning af datasæt, følsomme målinger, kalibrering af dommermodeller og en kultur præget af tillid at bygge evalueringer, der opdager det væsentlige. Her er mønstrene fra de teams, der lykkes med det.
Avanceret
12 min læsningObservabilitet for LLM-applikationer: sporing, omkostninger, latenstid og kvalitetsafdrift
LLM-applikationer fejler på særlige måder, som traditionel observabilitet overser. Her er mønstrene til sporing af flertrinsforløb, overvågning af omkostninger, der varierer 100x pr. kald, registrering af kvalitetsafdrift og fejlfinding af hallucinationer i produktionsskala.
AvanceretFlere i dette emne

The Agent Landscape - Lessons Learned Putting Agents Into Production
MLOps.community.
Avanceret
10 min læsningFejltilstande i AI-produktion: det, der går i stykker efter demoen
AI-systemer fejler som regel på forudsigelige måder: hallucinationer, forældet kontekst, medløberi, prompt injection, usikker værktøjsbrug, skemadrift og svage fallbacks. Et register over fejltilstande til teams, der sætter reelle workflows i produktion.
Avanceret
11 min læsningChunking, reranking og hybridsøgning: Få RAG til faktisk at virke
De fleste RAG-implementeringer fungerer dårligt, fordi de håndterer tre ting forkert. En praktisk guide til chunking af dokumenter, reranking af resultater og kombination af søgeord med semantisk søgning — uden at du behøver blive søgeekspert.
Let øvet
How to evaluate AI products | Hamel Husain & Shreya Shankar (Lenny's Podcast)
Lenny's Podcast.
Let øvet
Evaluér prompts i Anthropic Console
Anthropic.
Let øvet
Sådan sætter du systematisk LLM-evals op (metrics, unit tests, LLM-as-a-Judge)
Dave Ebbelaar.
Avanceret
Sådan konstruerer du domænespecifikke LLM-evalueringssystemer: Hamel Husain og Emil Sedgh
AI Engineer.
Avanceret
LangSmith på 10 minutter
LangChain.
Avanceret
Instrumentering og evaluering af LLM'er
Hamel Husain.
Avanceret