55:02Dave Ebbelaar
Ein praktizierender KI-Entwickler stellt seine tatsächlich verwendete Eval-Stufenfolge vor: assertionsbasierte Unit-Tests, referenzfreie Metriken, die Abstimmung von LLM-as-a-Judge mit menschlichen Bewertungen und den Zyklus aus Analysieren, Messen und Verbessern. Diese Struktur entspricht am ehesten dem Argument des Artikels, dass Evals ein System zum Erkennen von Regressionen sind und keine Rangliste.
Was Sie aus diesem Video mitnehmen sollten: Eine Eval-Stufenfolge entwerfen, die Regressionen erkennt, bevor Änderungen an Prompts oder Modellen die Nutzer erreichen.
Das sollten Sie zuerst ansehen oder wissen: Erfahrung mit dem Betrieb oder der Wartung eines KI-Workflows, für den konkrete Fehlerbeispiele bekannt sind.
Hinweis von AI Expert: Einzelne Werkzeuge werden veralten, die Stufenfolge bleibt jedoch tragfähig: zuerst deterministische Prüfungen, anschließend modellbasierte Bewertungen, die gegen menschliche Urteile validiert werden. Überspringen Sie die Kalibrierung nicht, nur weil sich ein LLM-Bewerter leicht ergänzen lässt.
