Évaluations, observabilité et qualité
Mesurez le comportement de l’IA, détectez les régressions, suivez les coûts et la latence, et améliorez continuellement les flux de travail.
12 contenus (5 articles · 7 vidéos)
Commencez ici
Quelques bons contenus pour débuter avant de parcourir l’ensemble du flux.
10 min de lectureÉvaluations pour les non-ingénieurs : savoir si votre flux de travail d’IA s’améliore ou se dégrade
Les évaluations — la mesure systématique de la qualité des productions de l’IA — sont généralement considérées comme un sujet réservé à l’ingénierie. Pourtant, toute équipe qui utilise des flux de travail d’IA en a besoin, et leurs principes fondamentaux sont accessibles sans écrire de code.
Intermédiaire
13 min de lectureCréer des évaluations qui détectent vraiment les régressions
La plupart des suites d’évaluation semblent impressionnantes, mais ne détectent pas les régressions réelles. Des évaluations pertinentes exigent des jeux de données soigneusement construits, des métriques sensibles, des juges étalonnés et une culture de confiance. Voici les pratiques des équipes qui maîtrisent cette discipline.
Avancé
12 min de lectureObservabilité des applications LLM : traçage, coûts, latence et dérive de la qualité
Étendez l’observabilité standard par des traces multi-étapes, un coût attribuable, les versions de prompt et de modèle, des signaux de qualité évalués, des contrôles de confidentialité et des alertes dérivées de la charge.
AvancéPlus de contenus sur ce thème
69 minutesLe paysage des agents – enseignements tirés de leur mise en production
MLOps.community. Le vice-président chargé de l'IA chez Prosus et un ingénieur en IA expliquent ce qui a réellement échoué lors du déploiement d'agents dans les entreprises du portefeuille du groupe : tests d'intrusion ciblant l'injection de prompt avant le lancement, écriture dangereuse lorsqu'un agent Jira a mal interprété une abréviation humaine, contexte périmé compensé en obligeant les agents à expliciter leurs hypothèses, et mécanismes de repli consistant à fusionner ou supprimer des agents devenus une source de charge cognitive. C'est presque le registre des défaillances de l'article rejoué sous la forme d'un retour d'incident en direct.
Avancé
10 min de lectureModes de défaillance de l'IA en production : ce qui échoue après la démonstration
Les systèmes d'IA échouent généralement de manière prévisible : hallucinations, contexte obsolète, complaisance, injection de consignes, usage non sûr des outils, dérive de schéma et mécanismes de repli insuffisants. Voici un registre des modes de défaillance pour les équipes qui mettent de véritables processus en production.
Avancé
11 min de lectureSegmentation, reclassement et recherche hybride : rendre le RAG réellement efficace
La plupart des systèmes RAG fonctionnent mal à cause de trois erreurs. Voici un guide pratique pour segmenter les documents, reclasser les résultats et combiner recherche par mots-clés et recherche sémantique, sans devenir ingénieur de recherche.
Intermédiaire
107 minutesPourquoi les évaluations d’IA sont la nouvelle compétence incontournable des concepteurs de produits | Hamel Husain et Shreya Shankar
Lenny's Podcast. Hamel Husain et Shreya Shankar parcourent l’intégralité du flux de travail d’évaluation sur un véritable assistant d’IA de gestion locative — examen des traces, codage ouvert et axial des erreurs, décision du moment où s’arrêter, création d’un LLM utilisé comme juge et validation par rapport au jugement humain. Ce rare entretien approfondi s’adresse réellement aux chefs de produit et aux responsables d’équipe, plutôt qu’aux ingénieurs en apprentissage automatique. Il reprend le rythme recommandé dans l’article : « 30 minutes par semaine après la configuration ».
Intermédiaire
3 minutesÉvaluer des prompts dans la console Anthropic
Anthropic. Cette présentation de trois minutes par Anthropic montre une véritable évaluation dans le Workbench — génération automatique de cas de test réalistes, notation des résultats, ajustement du prompt et nouvelle exécution de la même suite pour une comparaison côte à côte. Le nombre de vues reste sous notre seuil habituel, mais, pour répondre à la question « comment faire concrètement sans écrire de code ? », c’est la démonstration officielle la plus claire. Elle complète parfaitement l’entretien plus stratégique de Husain et Shankar.
Intermédiaire
55 minutesComment mettre systématiquement en place des évaluations de LLM (métriques, tests unitaires, LLM utilisé comme juge)
Dave Ebbelaar. Un ingénieur en IA présente l’échelle d’évaluation qu’il utilise réellement — tests unitaires fondés sur des assertions, métriques sans référence, calibration du LLM utilisé comme juge par rapport aux humains, puis boucle analyser-mesurer-améliorer. Parmi les vidéos disponibles, cette structure correspond le mieux à l’argument de l’article : les évaluations forment un système de détection des régressions, pas un classement.
Avancé
19 minutesComment construire des systèmes d'évaluation LLM spécifiques à un domaine : Hamel Husain et Emil Sedgh
AI Engineer. Hamel Husain et le directeur technique de Rechat présentent le système d’évaluation d’un véritable produit d’IA : les raisons de l’échec des évaluations génériques prêtes à l’emploi, une architecture en couches d’assertions, des traces journalisées soumises à une validation humaine, des LLM utilisés comme juges et maintenus en accord avec un expert du domaine, ainsi que la façon dont un système d’évaluation opérationnel rend possibles la curation des données et l’ajustement fin. C’est l’étude de cas en production qui étaye l’argument de l’article : les évaluations sont un dispositif de détection des régressions, pas un classement.
Avancé
9 minutesLangSmith en 10 minutes
LangChain. Le cofondateur de LangChain propose une visite guidée d’une trace LLM, d’un projet et d’un jeu de données — coût des tokens, latence, taux d’erreur, agrégation des retours et exploration du span d’une seule étape de récupération. C’est l’équivalent visuel le plus proche de ce que décrit l’article lorsqu’il affirme que « chaque appel est un span » et explique pourquoi les traces structurées sont supérieures aux simples journaux produits par des instructions d’affichage.
Avancé
154 minutesInstrumentation et évaluation des LLM
Hamel Husain. Hamel Husain, Eugene Yan, Brian Bischof, Harrison Chase et Shreya Shankar travaillent sur le traçage, l’analyse des journaux, les LLM utilisés comme juges et le flux d’examen de véritables données de production. Consacrez à cette vidéo la même attention qu’à un long podcast : c’est sur YouTube l’analyse la plus approfondie de la thèse « examinez vos traces » défendue dans l’article.
Avancé