Vidéos complémentaires

Évaluations pour les non-ingénieurs : savoir si votre flux de travail d’IA s’améliore ou se dégrade — vidéos complémentaires

L’article explique qu’évaluer vos prompts à l’intuition suffit jusqu’à un certain point : tôt ou tard, il faut une petite méthode reproductible pour demander « cette modification a-t-elle amélioré ou dégradé le résultat ? ». Ces vidéos présentent la méthode sous deux angles — le flux de travail conceptuel des personnes qui enseignent les évaluations aux chefs de produit chez OpenAI et Anthropic, puis une démonstration de trois minutes pour en réaliser une sans code dans une console.

Choix principal

1:46:33
Pourquoi les évaluations d’IA sont la nouvelle compétence incontournable des concepteurs de produits | Hamel Husain et Shreya Shankar

Lenny's Podcast

Hamel Husain et Shreya Shankar parcourent l’intégralité du flux de travail d’évaluation sur un véritable assistant d’IA de gestion locative — examen des traces, codage ouvert et axial des erreurs, décision du moment où s’arrêter, création d’un LLM utilisé comme juge et validation par rapport au jugement humain. Ce rare entretien approfondi s’adresse réellement aux chefs de produit et aux responsables d’équipe, plutôt qu’aux ingénieurs en apprentissage automatique. Il reprend le rythme recommandé dans l’article : « 30 minutes par semaine après la configuration ».

Ce que vous en retirerez: Apprendre le cycle d’évaluation destiné aux concepteurs de produits : examiner les traces, étiqueter les défaillances, définir des critères, tester les modifications et les comparer au jugement humain.

À voir ou à connaître au préalable: Avoir au moins un flux de travail d'IA où la qualité peut s'améliorer ou se détériorer au fil du temps.

Note d’AI Expert: Cette vidéo reste l’une des meilleures explications des évaluations pour les non-ingénieurs, car elle privilégie la rigueur du flux de travail plutôt qu’un outil particulier. Conservez la méthode, puis choisissez les outils adaptés à vos contraintes de confidentialité et d’observabilité.

Ouvrir la page vidéo

À voir également

03:20
Évaluer des prompts dans la console Anthropic

Anthropic

Cette présentation de trois minutes par Anthropic montre une véritable évaluation dans le Workbench — génération automatique de cas de test réalistes, notation des résultats, ajustement du prompt et nouvelle exécution de la même suite pour une comparaison côte à côte. Le nombre de vues reste sous notre seuil habituel, mais, pour répondre à la question « comment faire concrètement sans écrire de code ? », c’est la démonstration officielle la plus claire. Elle complète parfaitement l’entretien plus stratégique de Husain et Shankar.

Ce que vous en retirerez: Voir la version la plus simple sans code d'une évaluation de prompt répétible.

À voir ou à connaître au préalable: Savoir modifier des prompts et avoir accès à une interface d’évaluation telle qu’une console ou un workbench.

Note d’AI Expert: L’interface et les noms des fonctionnalités de la console peuvent changer. Retenez le modèle : cas de test fixes, critères de notation explicites, comparaison côte à côte et nouvelles exécutions reproductibles.

Ouvrir la page vidéo