55:02Dave Ebbelaar
Un ingénieur en IA présente l’échelle d’évaluation qu’il utilise réellement — tests unitaires fondés sur des assertions, métriques sans référence, calibration du LLM utilisé comme juge par rapport aux humains, puis boucle analyser-mesurer-améliorer. Parmi les vidéos disponibles, cette structure correspond le mieux à l’argument de l’article : les évaluations forment un système de détection des régressions, pas un classement.
Ce que vous en retirerez: Concevoir une échelle d'évaluation qui détecte les régressions avant que les modifications de prompt ou de modèle n'atteignent les utilisateurs.
À voir ou à connaître au préalable: Une expérience du déploiement ou de la maintenance d’un flux de travail d’IA comportant des exemples de défaillance connus.
Note d’AI Expert: Certains choix d’outils vieilliront, mais l’échelle reste solide : d’abord des contrôles déterministes, puis des contrôles notés par un modèle et validés par des humains. Ne sautez pas la calibration sous prétexte qu’un LLM utilisé comme juge est facile à ajouter.
