Comment construire des systèmes d'évaluation LLM spécifiques à un domaine : Hamel Husain et Emil Sedgh

19 minutesAvancéConcepteurAI EngineerIA pour les entreprises

AI Engineer. Hamel Husain et le directeur technique de Rechat présentent le système d’évaluation d’un véritable produit d’IA : les raisons de l’échec des évaluations génériques prêtes à l’emploi, une architecture en couches d’assertions, des traces journalisées soumises à une validation humaine, des LLM utilisés comme juges et maintenus en accord avec un expert du domaine, ainsi que la façon dont un système d’évaluation opérationnel rend possibles la curation des données et l’ajustement fin. C’est l’étude de cas en production qui étaye l’argument de l’article : les évaluations sont un dispositif de détection des régressions, pas un classement.

Note d’AI Expert

Cette vidéo a été enregistrée mi-2024 ; certains outils ont évolué, mais pas la conception du système. Considérez-la comme une référence d’architecture, pas comme un guide propre à un fournisseur, et maintenez l’expert du domaine dans la boucle comme le recommande la présentation.

Ce que vous en retirerez

Voir comment une équipe de production superpose assertions, validation humaine et LLM utilisés comme juges pour faire apparaître les régressions avant la publication.

À voir ou à connaître au préalable

Connaissances de base en terminologie d'évaluation LLM et le cadre d'échelle d'évaluation de l'article.

Dernière révision : 15 juil. 2026

À regarder ensuite

Continuez dans le même parcours d’apprentissage avec les prochaines vidéos d’accompagnement sélectionnées.