Thema

Evals, Observability und Qualität

Messen Sie das Verhalten von KI, erkennen Sie Regressionen, verfolgen Sie Kosten und Latenz und verbessern Sie Workflows kontinuierlich.

12 Beiträge (5 Artikel · 7 Videos)

Hier beginnen

Einige gute Beiträge für den Einstieg, bevor Sie die vollständige Übersicht durchsuchen.

Weitere in diesem Thema

69 Minuten
Video

Die Agentenlandschaft – Erkenntnisse aus dem Produktiveinsatz von Agenten

MLOps.community. Der VP of AI von Prosus und ein KI-Entwickler berichten, was beim Einsatz von Agenten in den Portfoliounternehmen der Gruppe tatsächlich schiefging: Penetrationstests auf Prompt-Injection vor dem Start, ein unsicherer Schreibvorgang, als ein Jira-Agent an menschlichen Abkürzungen scheiterte, Offenlegung von Annahmen bei veraltetem Kontext und Rückfallmechanismen, die Agenten zusammenführten oder abschalteten, sobald diese zusätzliche kognitive Last verursachten. Der Vortrag wirkt wie das Fehlermodusregister des Artikels als Live-Postmortem.

Fortgeschritten
10 Min. Lesezeit
Artikel

Fehlermodi produktiver KI-Systeme: Was nach der Demo schiefgehen kann

KI-Systeme scheitern auf vorhersehbare Weise: durch Halluzinationen, veralteten Kontext, übermäßige Zustimmung, Prompt Injection, unsichere Werkzeugnutzung, Schemadrift und schwache Fallbacks. Ein Fehlermodusregister für Teams, die reale Workflows bereitstellen.

Fortgeschritten
11 Min. Lesezeit
Artikel

Chunking, Reranking und hybride Suche: So funktioniert RAG wirklich

Die meisten RAG-Implementierungen scheitern an drei Punkten. Ein Praxisleitfaden für Dokument-Chunking, Reranking und die Kombination aus Schlüsselwort- und semantischer Suche — ohne Suchmaschinenexperte zu werden.

Mittelstufe
107 Minuten
Video

Warum KI-Evals die gefragteste neue Fähigkeit für Produktentwickler sind | Hamel Husain & Shreya Shankar

Lenny's Podcast. Hamel Husain und Shreya Shankar durchlaufen den gesamten Eval-Workflow anhand eines realen KI-Assistenten für die Immobilienverwaltung — Traces prüfen, Fehler offen und axial kodieren, einen sinnvollen Abbruchpunkt bestimmen, einen LLM-as-Judge entwickeln und ihn anhand menschlicher Bewertungen validieren. Dieses seltene ausführliche Gespräch richtet sich tatsächlich an Produktmanager und Teamleitungen statt an ML-Entwickler. Es behandelt außerdem genau den vom Artikel empfohlenen Rhythmus von „30 Minuten pro Woche nach der Einrichtung“.

Mittelstufe
3 Minuten
Video

Prompts in der Anthropic Console bewerten

Anthropic. Eine dreiminütige Anthropic-Anleitung für eine reale Evaluierung in der Workbench — realistische Testfälle automatisch erzeugen, Ausgaben bewerten, den Prompt anpassen und dieselbe Testsuite anschließend nebeneinander erneut ausführen. Die Aufrufzahl liegt unter der üblichen Schwelle. Für die Frage „Wie setze ich das ohne Programmierung praktisch um?“ ist dies jedoch die klarste offizielle Demonstration und eine gute Ergänzung zum strategischeren Gespräch mit Husain und Shankar.

Mittelstufe
55 Minuten
Video

LLM-Evaluierungen systematisch einrichten (Metriken, Unit-Tests, LLM-as-a-Judge)

Dave Ebbelaar. Ein praktizierender KI-Entwickler stellt seine tatsächlich verwendete Eval-Stufenfolge vor: assertionsbasierte Unit-Tests, referenzfreie Metriken, die Abstimmung von LLM-as-a-Judge mit menschlichen Bewertungen und den Zyklus aus Analysieren, Messen und Verbessern. Diese Struktur entspricht am ehesten dem Argument des Artikels, dass Evals ein System zum Erkennen von Regressionen sind und keine Rangliste.

Fortgeschritten
19 Minuten
Video

Domänenspezifische LLM-Evaluierungssysteme entwickeln: Hamel Husain und Emil Sedgh

AI Engineer. Hamel Husain und Emil Sedgh, CTO von Rechat, erläutern das Eval-System hinter einem realen KI-Produkt: warum generische Standard-Evals scheitern, wie Assertions, protokollierte Traces mit menschlicher Prüfung und an Domänenexperten ausgerichtete LLM-Bewerter aufeinander aufbauen und wie ein funktionierendes Eval-System Datenkuratierung und Fine-Tuning ermöglicht. Dies ist die Fallstudie aus dem Produktionseinsatz zum Argument des Artikels, dass Evals der Regressionserkennung dienen und keine Rangliste bilden.

Fortgeschritten
9 Minuten
Video

LangSmith in 10 Minuten

LangChain. Der Mitgründer von LangChain führt durch einen LLM-Trace, ein Projekt und einen Datensatz. Er zeigt Tokenkosten, Latenz, Fehlerrate, aggregiertes Feedback und die Detailansicht eines einzelnen Spans für einen Retrieval-Schritt. Das Video veranschaulicht am besten, was der Artikel mit „Jeder Aufruf ist ein Span“ meint und weshalb strukturierte Traces einfachen Print-Logs überlegen sind.

Fortgeschritten
154 Minuten
Video

LLMs instrumentieren und evaluieren

Hamel Husain. Hamel Husain, Eugene Yan, Brian Bischof, Harrison Chase und Shreya Shankar behandeln Tracing, Protokollanalyse, LLM-as-a-Judge und den Arbeitsablauf zur Untersuchung realer Produktionsdaten. Hören Sie die Sitzung wie einen langen Podcast. Sie ist die beste ausführliche Darstellung der Kernaussage „Sehen Sie sich Ihre Traces an“, die wir auf YouTube gefunden haben.

Fortgeschritten