Évaluations, observabilité et qualité
Mesurez le comportement de l’IA, détectez les régressions, suivez les coûts et la latence, et améliorez continuellement les flux de travail.
12 contenus (5 articles · 7 vidéos)
Commencez ici
Quelques bons contenus pour débuter avant de parcourir l’ensemble du flux.
10 min de lectureÉvaluations pour les non-ingénieurs : savoir si votre flux de travail d’IA s’améliore ou se dégrade
Les évaluations — la mesure systématique de la qualité des productions de l’IA — sont généralement considérées comme un sujet réservé à l’ingénierie. Pourtant, toute équipe qui utilise des flux de travail d’IA en a besoin, et leurs principes fondamentaux sont accessibles sans écrire de code.
Intermédiaire
13 min de lectureCréer des évaluations qui détectent vraiment les régressions
La plupart des suites d’évaluation semblent impressionnantes, mais ne détectent pas les régressions réelles. Des évaluations pertinentes exigent des jeux de données soigneusement construits, des métriques sensibles, des juges étalonnés et une culture de confiance. Voici les pratiques des équipes qui maîtrisent cette discipline.
Avancé
12 min de lectureObservabilité des applications LLM : suivi, coûts, latence, dérive de la qualité
Les applications LLM présentent des modes de défaillance particuliers que l’observabilité traditionnelle ne détecte pas. Voici comment tracer les flux en plusieurs étapes, suivre des coûts pouvant varier d’un facteur 100 par appel, surveiller la dérive de qualité et analyser à grande échelle les informations inventées.
AvancéPlus de contenus sur ce thème

Le paysage des agents – enseignements tirés de leur mise en production
Le paysage des agents – enseignements tirés de leur mise en production
Avancé
10 min de lectureModes de défaillance de l'IA en production : ce qui échoue après la démonstration
Les systèmes d'IA échouent généralement de manière prévisible : hallucinations, contexte obsolète, complaisance, injection de consignes, usage non sûr des outils, dérive de schéma et mécanismes de repli insuffisants. Voici un registre des modes de défaillance pour les équipes qui mettent de véritables processus en production.
Avancé
11 min de lectureSegmentation, reclassement et recherche hybride : rendre le RAG réellement efficace
La plupart des systèmes RAG fonctionnent mal à cause de trois erreurs. Voici un guide pratique pour segmenter les documents, reclasser les résultats et combiner recherche par mots-clés et recherche sémantique, sans devenir ingénieur de recherche.
Intermédiaire
Pourquoi les évaluations d’IA sont la nouvelle compétence incontournable des concepteurs de produits | Hamel Husain et Shreya Shankar
Pourquoi les évaluations d’IA sont la nouvelle compétence incontournable des concepteurs de produits | Hamel Husain et Shreya Shankar
Intermédiaire
Évaluer des prompts dans la console Anthropic
Évaluer des prompts dans la console Anthropic
Intermédiaire
Comment mettre systématiquement en place des évaluations de LLM (métriques, tests unitaires, LLM utilisé comme juge)
Comment mettre systématiquement en place des évaluations de LLM (métriques, tests unitaires, LLM utilisé comme juge)
Avancé
Comment construire des systèmes d'évaluation LLM spécifiques à un domaine : Hamel Husain et Emil Sedgh
Comment construire des systèmes d'évaluation LLM spécifiques à un domaine : Hamel Husain et Emil Sedgh
Avancé
LangSmith en 10 minutes
LangSmith en 10 minutes
Avancé
Instrumentation et évaluation des LLM
Instrumentation et évaluation des LLM
Avancé