Evals, Observability und Qualität
Messen Sie das Verhalten von KI, erkennen Sie Regressionen, verfolgen Sie Kosten und Latenz und verbessern Sie Workflows kontinuierlich.
12 Beiträge (5 Artikel · 7 Videos)
Hier beginnen
Einige gute Beiträge für den Einstieg, bevor Sie die vollständige Übersicht durchsuchen.
10 Min. LesezeitEvals für Nichttechniker: Erkennen Sie, ob Ihr KI-Workflow besser oder schlechter wird
Evals messen die Qualität von KI-Ausgaben systematisch und gelten meist als Aufgabe für Entwickler. Doch jedes Team mit KI-Workflows benötigt sie, und die Grundlagen kommen ohne Code aus. Eine praktische Anleitung.
Mittelstufe
13 Min. LesezeitEvals erstellen, die tatsächlich Regressionen erkennen
Die meisten Eval-Suites wirken beeindruckend, übersehen aber reale Regressionen. Evals, die relevante Fehler erkennen, erfordern sorgfältig aufgebaute Datensätze, empfindliche Metriken, kalibrierte Judges und eine Kultur des Vertrauens. Diese Muster nutzen Teams, die es richtig machen.
Fortgeschritten
12 Min. LesezeitObservability für LLM-Apps: Tracing, Kosten, Latenz und Qualitätsdrift
Erweitern Sie die übliche Observability um mehrstufige Traces, zurechenbare Kosten, Prompt- und Modellversionen, evaluierte Qualitätssignale, Datenschutzkontrollen und aus der jeweiligen Aufgabe abgeleitete Warnmeldungen.
FortgeschrittenWeitere in diesem Thema
69 MinutenDie Agentenlandschaft – Erkenntnisse aus dem Produktiveinsatz von Agenten
MLOps.community. Der VP of AI von Prosus und ein KI-Entwickler berichten, was beim Einsatz von Agenten in den Portfoliounternehmen der Gruppe tatsächlich schiefging: Penetrationstests auf Prompt-Injection vor dem Start, ein unsicherer Schreibvorgang, als ein Jira-Agent an menschlichen Abkürzungen scheiterte, Offenlegung von Annahmen bei veraltetem Kontext und Rückfallmechanismen, die Agenten zusammenführten oder abschalteten, sobald diese zusätzliche kognitive Last verursachten. Der Vortrag wirkt wie das Fehlermodusregister des Artikels als Live-Postmortem.
Fortgeschritten
10 Min. LesezeitFehlermodi produktiver KI-Systeme: Was nach der Demo schiefgehen kann
KI-Systeme scheitern auf vorhersehbare Weise: durch Halluzinationen, veralteten Kontext, übermäßige Zustimmung, Prompt Injection, unsichere Werkzeugnutzung, Schemadrift und schwache Fallbacks. Ein Fehlermodusregister für Teams, die reale Workflows bereitstellen.
Fortgeschritten
11 Min. LesezeitChunking, Reranking und hybride Suche: So funktioniert RAG wirklich
Die meisten RAG-Implementierungen scheitern an drei Punkten. Ein Praxisleitfaden für Dokument-Chunking, Reranking und die Kombination aus Schlüsselwort- und semantischer Suche — ohne Suchmaschinenexperte zu werden.
Mittelstufe
107 MinutenWarum KI-Evals die gefragteste neue Fähigkeit für Produktentwickler sind | Hamel Husain & Shreya Shankar
Lenny's Podcast. Hamel Husain und Shreya Shankar durchlaufen den gesamten Eval-Workflow anhand eines realen KI-Assistenten für die Immobilienverwaltung — Traces prüfen, Fehler offen und axial kodieren, einen sinnvollen Abbruchpunkt bestimmen, einen LLM-as-Judge entwickeln und ihn anhand menschlicher Bewertungen validieren. Dieses seltene ausführliche Gespräch richtet sich tatsächlich an Produktmanager und Teamleitungen statt an ML-Entwickler. Es behandelt außerdem genau den vom Artikel empfohlenen Rhythmus von „30 Minuten pro Woche nach der Einrichtung“.
Mittelstufe
3 MinutenPrompts in der Anthropic Console bewerten
Anthropic. Eine dreiminütige Anthropic-Anleitung für eine reale Evaluierung in der Workbench — realistische Testfälle automatisch erzeugen, Ausgaben bewerten, den Prompt anpassen und dieselbe Testsuite anschließend nebeneinander erneut ausführen. Die Aufrufzahl liegt unter der üblichen Schwelle. Für die Frage „Wie setze ich das ohne Programmierung praktisch um?“ ist dies jedoch die klarste offizielle Demonstration und eine gute Ergänzung zum strategischeren Gespräch mit Husain und Shankar.
Mittelstufe
55 MinutenLLM-Evaluierungen systematisch einrichten (Metriken, Unit-Tests, LLM-as-a-Judge)
Dave Ebbelaar. Ein praktizierender KI-Entwickler stellt seine tatsächlich verwendete Eval-Stufenfolge vor: assertionsbasierte Unit-Tests, referenzfreie Metriken, die Abstimmung von LLM-as-a-Judge mit menschlichen Bewertungen und den Zyklus aus Analysieren, Messen und Verbessern. Diese Struktur entspricht am ehesten dem Argument des Artikels, dass Evals ein System zum Erkennen von Regressionen sind und keine Rangliste.
Fortgeschritten
19 MinutenDomänenspezifische LLM-Evaluierungssysteme entwickeln: Hamel Husain und Emil Sedgh
AI Engineer. Hamel Husain und Emil Sedgh, CTO von Rechat, erläutern das Eval-System hinter einem realen KI-Produkt: warum generische Standard-Evals scheitern, wie Assertions, protokollierte Traces mit menschlicher Prüfung und an Domänenexperten ausgerichtete LLM-Bewerter aufeinander aufbauen und wie ein funktionierendes Eval-System Datenkuratierung und Fine-Tuning ermöglicht. Dies ist die Fallstudie aus dem Produktionseinsatz zum Argument des Artikels, dass Evals der Regressionserkennung dienen und keine Rangliste bilden.
Fortgeschritten
9 MinutenLangSmith in 10 Minuten
LangChain. Der Mitgründer von LangChain führt durch einen LLM-Trace, ein Projekt und einen Datensatz. Er zeigt Tokenkosten, Latenz, Fehlerrate, aggregiertes Feedback und die Detailansicht eines einzelnen Spans für einen Retrieval-Schritt. Das Video veranschaulicht am besten, was der Artikel mit „Jeder Aufruf ist ein Span“ meint und weshalb strukturierte Traces einfachen Print-Logs überlegen sind.
Fortgeschritten
154 MinutenLLMs instrumentieren und evaluieren
Hamel Husain. Hamel Husain, Eugene Yan, Brian Bischof, Harrison Chase und Shreya Shankar behandeln Tracing, Protokollanalyse, LLM-as-a-Judge und den Arbeitsablauf zur Untersuchung realer Produktionsdaten. Hören Sie die Sitzung wie einen langen Podcast. Sie ist die beste ausführliche Darstellung der Kernaussage „Sehen Sie sich Ihre Traces an“, die wir auf YouTube gefunden haben.
Fortgeschritten