Evals, Observability und Qualität
Messen Sie das Verhalten von KI, erkennen Sie Regressionen, verfolgen Sie Kosten und Latenz und verbessern Sie Workflows kontinuierlich.
12 Beiträge (5 Artikel · 7 Videos)
Hier beginnen
Einige gute Beiträge für den Einstieg, bevor Sie die vollständige Übersicht durchsuchen.
10 Min. LesezeitEvals für Nichttechniker: Erkennen Sie, ob Ihr KI-Workflow besser oder schlechter wird
Evals messen die Qualität von KI-Ausgaben systematisch und gelten meist als Aufgabe für Entwickler. Doch jedes Team mit KI-Workflows benötigt sie, und die Grundlagen kommen ohne Code aus. Eine praktische Anleitung.
Mittelstufe
13 Min. LesezeitEvals erstellen, die tatsächlich Regressionen erkennen
Die meisten Eval-Suites wirken beeindruckend, übersehen aber reale Regressionen. Evals, die relevante Fehler erkennen, erfordern sorgfältig aufgebaute Datensätze, empfindliche Metriken, kalibrierte Judges und eine Kultur des Vertrauens. Diese Muster nutzen Teams, die es richtig machen.
Fortgeschritten
12 Min. LesezeitObservability für LLM-Anwendungen: Tracing, Kosten, Latenz und Qualitätsdrift
LLM-Anwendungen scheitern auf Arten, die traditionelle Observability übersieht. Entscheidend sind Tracing für mehrstufige Abläufe, die Zuordnung von Kosten, die je Aufruf um den Faktor 100 variieren, das Monitoring von Qualitätsdrift und das Debugging von Halluzinationen im Produktivmaßstab.
FortgeschrittenWeitere in diesem Thema

Die Agentenlandschaft – Erkenntnisse aus dem Produktiveinsatz von Agenten
MLOps.community.
Fortgeschritten
10 Min. LesezeitFehlermodi produktiver KI-Systeme: Was nach der Demo schiefgehen kann
KI-Systeme scheitern auf vorhersehbare Weise: durch Halluzinationen, veralteten Kontext, übermäßige Zustimmung, Prompt Injection, unsichere Werkzeugnutzung, Schemadrift und schwache Fallbacks. Ein Fehlermodusregister für Teams, die reale Workflows bereitstellen.
Fortgeschritten
11 Min. LesezeitChunking, Reranking und hybride Suche: So funktioniert RAG wirklich
Die meisten RAG-Implementierungen scheitern an drei Punkten. Ein Praxisleitfaden für Dokument-Chunking, Reranking und die Kombination aus Schlüsselwort- und semantischer Suche — ohne Suchmaschinenexperte zu werden.
Mittelstufe
Warum KI-Evals die gefragteste neue Fähigkeit für Produktentwickler sind | Hamel Husain & Shreya Shankar
Lenny's Podcast.
Mittelstufe
Prompts in der Anthropic Console bewerten
Anthropic.
Mittelstufe
LLM-Evaluierungen systematisch einrichten (Metriken, Unit-Tests, LLM-as-a-Judge)
Dave Ebbelaar.
Fortgeschritten
Domänenspezifische LLM-Evaluierungssysteme entwickeln: Hamel Husain und Emil Sedgh
AI Engineer.
Fortgeschritten
LangSmith in 10 Minuten
LangChain.
Fortgeschritten
LLMs instrumentieren und evaluieren
Hamel Husain.
Fortgeschritten