Begleitvideos

Evals für Nicht-Entwickler: Erkennen Sie, ob Ihr KI-Workflow besser oder schlechter wird — Begleitvideos

Der Artikel zeigt, dass die Prüfung Ihrer Prompts „nach Gefühl“ nur bis zu einem gewissen Punkt ausreicht — irgendwann benötigen Sie ein kleines, wiederholbares Verfahren für die Frage: „Hat diese Änderung geholfen oder geschadet?“ Die Videos vermitteln das Vorgehen aus zwei Perspektiven: den konzeptionellen Workflow von Fachleuten, die Produktmanager bei OpenAI und Anthropic in Evals schulen, sowie eine 3-minütige Demonstration einer codefreien Evaluierung in einer Konsole.

Hauptauswahl

1:46:33
Warum KI-Evals die gefragteste neue Fähigkeit für Produktentwickler sind | Hamel Husain & Shreya Shankar

Lenny's Podcast

Hamel Husain und Shreya Shankar durchlaufen den gesamten Eval-Workflow anhand eines realen KI-Assistenten für die Immobilienverwaltung — Traces prüfen, Fehler offen und axial kodieren, einen sinnvollen Abbruchpunkt bestimmen, einen LLM-as-Judge entwickeln und ihn anhand menschlicher Bewertungen validieren. Dieses seltene ausführliche Gespräch richtet sich tatsächlich an Produktmanager und Teamleitungen statt an ML-Entwickler. Es behandelt außerdem genau den vom Artikel empfohlenen Rhythmus von „30 Minuten pro Woche nach der Einrichtung“.

Was Sie aus diesem Video mitnehmen sollten: Lernen Sie den Eval-Zyklus für Produktentwickler kennen: Traces prüfen, Fehler kennzeichnen, Kriterien definieren, Änderungen testen und die Ergebnisse mit menschlichen Bewertungen vergleichen.

Das sollten Sie zuerst ansehen oder wissen: Sie benötigen mindestens einen KI-Workflow, dessen Qualität sich mit der Zeit verbessern oder verschlechtern kann.

Hinweis von AI Expert: Dies bleibt eine der besten Eval-Erklärungen für Nicht-Entwickler, weil die Workflow-Disziplin statt eines bestimmten Tools im Mittelpunkt steht. Übernehmen Sie die Methode und wählen Sie anschließend Tools, die zu Ihren Anforderungen an Datenschutz und Observability passen.

Videoseite öffnen

Auch sehenswert

03:20
Prompts in der Anthropic Console bewerten

Anthropic

Eine dreiminütige Anthropic-Anleitung für eine reale Evaluierung in der Workbench — realistische Testfälle automatisch erzeugen, Ausgaben bewerten, den Prompt anpassen und dieselbe Testsuite anschließend nebeneinander erneut ausführen. Die Aufrufzahl liegt unter der üblichen Schwelle. Für die Frage „Wie setze ich das ohne Programmierung praktisch um?“ ist dies jedoch die klarste offizielle Demonstration und eine gute Ergänzung zum strategischeren Gespräch mit Husain und Shankar.

Was Sie aus diesem Video mitnehmen sollten: Sehen Sie die kleinste codefreie Variante einer wiederholbaren Prompt-Evaluierung.

Das sollten Sie zuerst ansehen oder wissen: Grundkenntnisse in der Bearbeitung von Prompts und Zugriff auf eine Evaluierungsoberfläche wie eine Konsole oder Workbench.

Hinweis von AI Expert: Benutzeroberfläche und Funktionsnamen der Konsole können sich ändern. Nutzen Sie das Video als Muster: feste Testfälle, ausdrückliche Bewertungskriterien, Vergleich nebeneinander und wiederholbare erneute Durchläufe.

Videoseite öffnen