Thème

Évaluations, observabilité et qualité

Mesurez le comportement de l’IA, détectez les régressions, suivez les coûts et la latence, et améliorez continuellement les flux de travail.

12 contenus (5 articles · 7 vidéos)

Commencez ici

Quelques bons contenus pour débuter avant de parcourir l’ensemble du flux.

Plus de contenus sur ce thème

69 minutes
Vidéo

Le paysage des agents – enseignements tirés de leur mise en production

MLOps.community. Le vice-président chargé de l'IA chez Prosus et un ingénieur en IA expliquent ce qui a réellement échoué lors du déploiement d'agents dans les entreprises du portefeuille du groupe : tests d'intrusion ciblant l'injection de prompt avant le lancement, écriture dangereuse lorsqu'un agent Jira a mal interprété une abréviation humaine, contexte périmé compensé en obligeant les agents à expliciter leurs hypothèses, et mécanismes de repli consistant à fusionner ou supprimer des agents devenus une source de charge cognitive. C'est presque le registre des défaillances de l'article rejoué sous la forme d'un retour d'incident en direct.

Avancé
10 min de lecture
Article

Modes de défaillance de l'IA en production : ce qui échoue après la démonstration

Les systèmes d'IA échouent généralement de manière prévisible : hallucinations, contexte obsolète, complaisance, injection de consignes, usage non sûr des outils, dérive de schéma et mécanismes de repli insuffisants. Voici un registre des modes de défaillance pour les équipes qui mettent de véritables processus en production.

Avancé
11 min de lecture
Article

Segmentation, reclassement et recherche hybride : rendre le RAG réellement efficace

La plupart des systèmes RAG fonctionnent mal à cause de trois erreurs. Voici un guide pratique pour segmenter les documents, reclasser les résultats et combiner recherche par mots-clés et recherche sémantique, sans devenir ingénieur de recherche.

Intermédiaire
107 minutes
Vidéo

Pourquoi les évaluations d’IA sont la nouvelle compétence incontournable des concepteurs de produits | Hamel Husain et Shreya Shankar

Lenny's Podcast. Hamel Husain et Shreya Shankar parcourent l’intégralité du flux de travail d’évaluation sur un véritable assistant d’IA de gestion locative — examen des traces, codage ouvert et axial des erreurs, décision du moment où s’arrêter, création d’un LLM utilisé comme juge et validation par rapport au jugement humain. Ce rare entretien approfondi s’adresse réellement aux chefs de produit et aux responsables d’équipe, plutôt qu’aux ingénieurs en apprentissage automatique. Il reprend le rythme recommandé dans l’article : « 30 minutes par semaine après la configuration ».

Intermédiaire
3 minutes
Vidéo

Évaluer des prompts dans la console Anthropic

Anthropic. Cette présentation de trois minutes par Anthropic montre une véritable évaluation dans le Workbench — génération automatique de cas de test réalistes, notation des résultats, ajustement du prompt et nouvelle exécution de la même suite pour une comparaison côte à côte. Le nombre de vues reste sous notre seuil habituel, mais, pour répondre à la question « comment faire concrètement sans écrire de code ? », c’est la démonstration officielle la plus claire. Elle complète parfaitement l’entretien plus stratégique de Husain et Shankar.

Intermédiaire
55 minutes
Vidéo

Comment mettre systématiquement en place des évaluations de LLM (métriques, tests unitaires, LLM utilisé comme juge)

Dave Ebbelaar. Un ingénieur en IA présente l’échelle d’évaluation qu’il utilise réellement — tests unitaires fondés sur des assertions, métriques sans référence, calibration du LLM utilisé comme juge par rapport aux humains, puis boucle analyser-mesurer-améliorer. Parmi les vidéos disponibles, cette structure correspond le mieux à l’argument de l’article : les évaluations forment un système de détection des régressions, pas un classement.

Avancé
19 minutes
Vidéo

Comment construire des systèmes d'évaluation LLM spécifiques à un domaine : Hamel Husain et Emil Sedgh

AI Engineer. Hamel Husain et le directeur technique de Rechat présentent le système d’évaluation d’un véritable produit d’IA : les raisons de l’échec des évaluations génériques prêtes à l’emploi, une architecture en couches d’assertions, des traces journalisées soumises à une validation humaine, des LLM utilisés comme juges et maintenus en accord avec un expert du domaine, ainsi que la façon dont un système d’évaluation opérationnel rend possibles la curation des données et l’ajustement fin. C’est l’étude de cas en production qui étaye l’argument de l’article : les évaluations sont un dispositif de détection des régressions, pas un classement.

Avancé
9 minutes
Vidéo

LangSmith en 10 minutes

LangChain. Le cofondateur de LangChain propose une visite guidée d’une trace LLM, d’un projet et d’un jeu de données — coût des tokens, latence, taux d’erreur, agrégation des retours et exploration du span d’une seule étape de récupération. C’est l’équivalent visuel le plus proche de ce que décrit l’article lorsqu’il affirme que « chaque appel est un span » et explique pourquoi les traces structurées sont supérieures aux simples journaux produits par des instructions d’affichage.

Avancé
154 minutes
Vidéo

Instrumentation et évaluation des LLM

Hamel Husain. Hamel Husain, Eugene Yan, Brian Bischof, Harrison Chase et Shreya Shankar travaillent sur le traçage, l’analyse des journaux, les LLM utilisés comme juges et le flux d’examen de véritables données de production. Consacrez à cette vidéo la même attention qu’à un long podcast : c’est sur YouTube l’analyse la plus approfondie de la thèse « examinez vos traces » défendue dans l’article.

Avancé