Vidéos complémentaires

Construire un RAG de production — vidéos complémentaires

L’article décrit ce qui change lorsqu’un système RAG quitte un notebook pour traiter un trafic réel — cas limites de l’ingestion, choix des embeddings, récupération hybride, modèles de reclassement et dispositif d’évaluation qui contrôle l’ensemble du pipeline. Ces deux conférences de l’AI Engineer Summit en donnent les explications vidéo les plus claires : le PDG de LlamaIndex présente une véritable pile RAG de production, puis l’auteur principal de l’article scientifique fondateur du RAG expose les difficultés rencontrées lors de déploiements chez des clients du Fortune 500.

Choix principal

18:34
Créer des applications RAG prêtes pour la production : Jerry Liu

AI Engineer

Le PDG de LlamaIndex explique l’écart entre une démonstration naïve du RAG et un véritable pipeline — récupération de petits segments vers de grands contextes, routage des sous-questions, recherche hybride et évaluation. La structure de ses diapositives correspond presque directement aux sections du pipeline de l’article ; regardez la vidéo d’abord, puis relisez l’article avec ses schémas en tête.

Ce que vous en retirerez: Identifier les contrôles de RAG en production absents des démonstrations naïves de chat avec des documents.

À voir ou à connaître au préalable: Avoir construit ou évalué un prototype RAG de base.

Note d’AI Expert: Les API de LlamaIndex et les composants recommandés évoluent, mais les écarts entre démonstration et production restent les mêmes : qualité de l’ingestion, routage de la récupération, reclassement, évaluations et observabilité. Vérifiez les valeurs par défaut actuelles de la bibliothèque avant de les mettre en œuvre.

Ouvrir la page vidéo

À voir également

16:56
Agents RAG en production : dix leçons tirées du terrain — Douwe Kiela, créateur du RAG

AI Engineer

Douwe Kiela a dirigé l’article scientifique fondateur du RAG chez FAIR et déploie désormais le RAG dans des entreprises réglementées. La conférence porte surtout sur ce qui cesse de fonctionner à grande échelle — stratégies de segmentation qui ne résistent pas à 100 000 documents, constat selon lequel « l’exactitude est le minimum attendu ; l’inexactitude est le véritable problème », et importance supérieure de l’attribution et de l’observabilité par rapport au modèle d’embedding. Elle offre un bon étalonnage avant de relire les sections de l’article sur l’évaluation et la surveillance.

Ce que vous en retirerez: Comprendre ce qui se brise lorsque le RAG est utilisé dans des entreprises réglementées pour des activités à forts enjeux.

À voir ou à connaître au préalable: Connaître le pipeline RAG de base et pourquoi l'attribution compte.

Note d’AI Expert: Cette vidéo constitue une solide mise en garde issue de la production. Utilisez-la pour éprouver les décisions d’architecture — en particulier les autorisations, l’attribution, l’observabilité et la confiance des utilisateurs — avant de débattre des détails infimes du modèle d’embedding.

Ouvrir la page vidéo