Vidéos complémentaires

Créer des évaluations qui détectent vraiment les régressions — vidéos complémentaires

Les références YouTube sont rares sur la conception des évaluations de LLM : les contenus populaires demandent surtout « quelle est la meilleure évaluation comparative ? », plutôt que « comment empêcher mon produit de se dégrader discrètement ? ». Les deux vidéos restent sous notre seuil habituel de 100 000 vues, ce qui reflète réellement ce créneau. Ce sont les explications les plus claires disponibles — l’une présente une réalisation pratique menée par une seule personne, l’autre une étude de cas en production — et leur association montre le même problème sous deux angles.

Choix principal

55:02
Comment mettre systématiquement en place des évaluations de LLM (métriques, tests unitaires, LLM utilisé comme juge)

Dave Ebbelaar

Un ingénieur en IA présente l’échelle d’évaluation qu’il utilise réellement — tests unitaires fondés sur des assertions, métriques sans référence, calibration du LLM utilisé comme juge par rapport aux humains, puis boucle analyser-mesurer-améliorer. Parmi les vidéos disponibles, cette structure correspond le mieux à l’argument de l’article : les évaluations forment un système de détection des régressions, pas un classement.

Ce que vous en retirerez: Concevoir une échelle d'évaluation qui détecte les régressions avant que les modifications de prompt ou de modèle n'atteignent les utilisateurs.

À voir ou à connaître au préalable: Une expérience du déploiement ou de la maintenance d’un flux de travail d’IA comportant des exemples de défaillance connus.

Note d’AI Expert: Certains choix d’outils vieilliront, mais l’échelle reste solide : d’abord des contrôles déterministes, puis des contrôles notés par un modèle et validés par des humains. Ne sautez pas la calibration sous prétexte qu’un LLM utilisé comme juge est facile à ajouter.

Ouvrir la page vidéo

À voir également

18:44
Comment construire des systèmes d'évaluation LLM spécifiques à un domaine : Hamel Husain et Emil Sedgh

AI Engineer

Hamel Husain et le directeur technique de Rechat présentent le système d’évaluation d’un véritable produit d’IA : les raisons de l’échec des évaluations génériques prêtes à l’emploi, une architecture en couches d’assertions, des traces journalisées soumises à une validation humaine, des LLM utilisés comme juges et maintenus en accord avec un expert du domaine, ainsi que la façon dont un système d’évaluation opérationnel rend possibles la curation des données et l’ajustement fin. C’est l’étude de cas en production qui étaye l’argument de l’article : les évaluations sont un dispositif de détection des régressions, pas un classement.

Ce que vous en retirerez: Voir comment une équipe de production superpose assertions, validation humaine et LLM utilisés comme juges pour faire apparaître les régressions avant la publication.

À voir ou à connaître au préalable: Connaissances de base en terminologie d'évaluation LLM et le cadre d'échelle d'évaluation de l'article.

Note d’AI Expert: Cette vidéo a été enregistrée mi-2024 ; certains outils ont évolué, mais pas la conception du système. Considérez-la comme une référence d’architecture, pas comme un guide propre à un fournisseur, et maintenez l’expert du domaine dans la boucle comme le recommande la présentation.

Ouvrir la page vidéo