Begleitvideos

Evals erstellen, die tatsächlich Regressionen erkennen — Begleitvideos

Beim Entwurf von Evals ist der etablierte YouTube-Kanon für LLM-Anwendungen noch dünn. Die meisten beliebten Inhalte fragen nach dem „besten Benchmark“ statt danach, wie sich eine schleichende Verschlechterung des eigenen Produkts verhindern lässt. Beide Empfehlungen liegen unter unserer üblichen Schwelle für Aufrufzahlen, weil dieses Fachgebiet tatsächlich nur ein kleines Publikum erreicht. Dennoch sind sie die klarsten verfügbaren Darstellungen: ein praktischer Aufbau durch einen einzelnen Entwickler und eine Fallstudie aus dem Produktionseinsatz. Zusammen zeigen sie dasselbe Problem aus zwei Blickwinkeln.

Hauptauswahl

55:02
LLM-Evaluierungen systematisch einrichten (Metriken, Unit-Tests, LLM-as-a-Judge)

Dave Ebbelaar

Ein praktizierender KI-Entwickler stellt seine tatsächlich verwendete Eval-Stufenfolge vor: assertionsbasierte Unit-Tests, referenzfreie Metriken, die Abstimmung von LLM-as-a-Judge mit menschlichen Bewertungen und den Zyklus aus Analysieren, Messen und Verbessern. Diese Struktur entspricht am ehesten dem Argument des Artikels, dass Evals ein System zum Erkennen von Regressionen sind und keine Rangliste.

Was Sie aus diesem Video mitnehmen sollten: Eine Eval-Stufenfolge entwerfen, die Regressionen erkennt, bevor Änderungen an Prompts oder Modellen die Nutzer erreichen.

Das sollten Sie zuerst ansehen oder wissen: Erfahrung mit dem Betrieb oder der Wartung eines KI-Workflows, für den konkrete Fehlerbeispiele bekannt sind.

Hinweis von AI Expert: Einzelne Werkzeuge werden veralten, die Stufenfolge bleibt jedoch tragfähig: zuerst deterministische Prüfungen, anschließend modellbasierte Bewertungen, die gegen menschliche Urteile validiert werden. Überspringen Sie die Kalibrierung nicht, nur weil sich ein LLM-Bewerter leicht ergänzen lässt.

Videoseite öffnen

Auch sehenswert

18:44
Domänenspezifische LLM-Evaluierungssysteme entwickeln: Hamel Husain und Emil Sedgh

AI Engineer

Hamel Husain und Emil Sedgh, CTO von Rechat, erläutern das Eval-System hinter einem realen KI-Produkt: warum generische Standard-Evals scheitern, wie Assertions, protokollierte Traces mit menschlicher Prüfung und an Domänenexperten ausgerichtete LLM-Bewerter aufeinander aufbauen und wie ein funktionierendes Eval-System Datenkuratierung und Fine-Tuning ermöglicht. Dies ist die Fallstudie aus dem Produktionseinsatz zum Argument des Artikels, dass Evals der Regressionserkennung dienen und keine Rangliste bilden.

Was Sie aus diesem Video mitnehmen sollten: Verstehen, wie ein Produktionsteam Assertions, menschliche Prüfung und LLM-Bewerter so kombiniert, dass Regressionen vor der Veröffentlichung sichtbar werden.

Das sollten Sie zuerst ansehen oder wissen: Vertrautheit mit grundlegender LLM-Eval-Terminologie und dem Stufenmodell des Artikels.

Hinweis von AI Expert: Der Vortrag wurde Mitte 2024 aufgezeichnet. Einzelne Werkzeuge haben sich weiterentwickelt, das Systemdesign jedoch nicht. Verwenden Sie ihn als Architekturreferenz, nicht als Anbieterleitfaden, und beziehen Sie den Domänenexperten wie empfohlen weiterhin ein.

Videoseite öffnen