Domänenspezifische LLM-Evaluierungssysteme entwickeln: Hamel Husain und Emil Sedgh

19 MinutenFortgeschrittenUmsetzungAI EngineerKI für Unternehmen

AI Engineer. Hamel Husain und Emil Sedgh, CTO von Rechat, erläutern das Eval-System hinter einem realen KI-Produkt: warum generische Standard-Evals scheitern, wie Assertions, protokollierte Traces mit menschlicher Prüfung und an Domänenexperten ausgerichtete LLM-Bewerter aufeinander aufbauen und wie ein funktionierendes Eval-System Datenkuratierung und Fine-Tuning ermöglicht. Dies ist die Fallstudie aus dem Produktionseinsatz zum Argument des Artikels, dass Evals der Regressionserkennung dienen und keine Rangliste bilden.

Hinweis von AI Expert

Der Vortrag wurde Mitte 2024 aufgezeichnet. Einzelne Werkzeuge haben sich weiterentwickelt, das Systemdesign jedoch nicht. Verwenden Sie ihn als Architekturreferenz, nicht als Anbieterleitfaden, und beziehen Sie den Domänenexperten wie empfohlen weiterhin ein.

Was Sie aus diesem Video mitnehmen sollten

Verstehen, wie ein Produktionsteam Assertions, menschliche Prüfung und LLM-Bewerter so kombiniert, dass Regressionen vor der Veröffentlichung sichtbar werden.

Das sollten Sie zuerst ansehen oder wissen

Vertrautheit mit grundlegender LLM-Eval-Terminologie und dem Stufenmodell des Artikels.

Zuletzt geprüft: 15. Juli 2026

Nächste Videos ansehen

Fahren Sie mit demselben Lernpfad fort und sehen Sie die nächsten kuratierten Begleitvideos.