Le RAG, ou génération augmentée par récupération, désigne un schéma dans lequel un système retrouve les éléments pertinents pour une question et les fournit au modèle lorsqu’il génère une réponse. Des produits grand public permettent de dialoguer à partir de documents sans construire soi-même une pile de récupération. Les plateformes et API configurables offrent davantage de contrôle, mais ajoutent aussi du travail d’ingénierie, d’évaluation et de gouvernance.
L’objectif n’est pas de tout importer ni de reproduire un chatbot général assorti de vos fichiers. Il consiste à créer un assistant délimité dont vous pouvez examiner les sources, les autorisations, le comportement de récupération, les citations et les limites.
N’importez pas de contrats, dossiers clients, fichiers RH, code source, identifiants, données de santé, documents protégés par le secret professionnel ou autres contenus confidentiels ou réglementés tant que le service, le compte, la région, les paramètres de conservation, les contrôles de partage et la politique de l’organisation n’ont pas été approuvés pour cet usage. Utilisez le minimum de sources nécessaire à la tâche.
Ce que fait un RAG personnel
Un flux de récupération classique comporte quatre étapes :
- Ingestion. Le système importe des documents ou se connecte à une source approuvée.
- Indexation. Il prépare le contenu pour la recherche, souvent en extrayant le texte, en le découpant et en créant des représentations interrogeables.
- Récupération. La question sert à sélectionner les passages jugés pertinents.
- Génération. Un modèle emploie la question et les passages récupérés pour produire une réponse, parfois accompagnée de citations ou de liens vers les sources.
Tous les produits n’implémentent pas ces étapes de la même manière. Certains espaces de projet peuvent placer de petits ensembles de connaissances directement dans le contexte du modèle avant de passer à la récupération. Considérez ici « RAG personnel » comme une catégorie pratique d’assistants documentaires délimités, puis vérifiez le mécanisme et les contrôles réels du produit retenu.
La récupération donne accès à des contenus récents, privés ou spécialisés que le modèle de base peut ignorer. Elle peut réduire les réponses non étayées pour les questions dans le périmètre lorsque récupération et génération fonctionnent correctement. Elle ne garantit pas que le bon passage a été retrouvé, qu’il est à jour, que le modèle l’a correctement interprété ni que chaque phrase de la réponse est étayée.
Définissez la réussite en termes observables : l’assistant trouve la source pertinente, cite ou identifie le passage probant, préserve le sens et l’incertitude de la source, traite correctement les contenus remplacés, respecte les autorisations et refuse ou signale clairement les questions auxquelles le corpus approuvé ne permet pas de répondre.
Trois voies d’implémentation
Les voies ci-dessous couvrent un carnet de sources hébergé, un espace de projet et un pipeline de récupération configurable. Il ne s’agit pas d’un classement.
Voie 1 : Gemini Notebook
Gemini Notebook, anciennement NotebookLM, est un carnet de recherche hébergé fondé sur des sources sélectionnées. La documentation de Google sur les sources répertorie les importations prises en charge et explique que les sources Drive peuvent se synchroniser automatiquement, tandis que les autres types suivent des comportements d’importation différents. Le chat peut fournir des citations intégrées, bien que Google précise que certaines réponses peuvent ne pas comporter de citation au niveau du passage et que le système peut se tromper.
Utile lorsque : vous souhaitez un carnet interactif pour un corpus délimité et appréciez une interface permettant d’examiner les passages et de générer des formats d’étude ou de briefing.
À vérifier avant utilisation : limites de sources et de requêtes de votre offre, statut de copie ou de synchronisation de chaque source, parties importées des pages et fichiers, traitement des données propre au compte, partage et présence effective de citations avec vos documents et questions.
Voie 2 : Claude Projects
Claude Projects propose des instructions de projet, des fichiers de connaissances et des chats limités au projet. Anthropic documente un mode RAG automatique destiné aux connaissances de projet étendues dans les offres payantes admissibles. Les contenus importés peuvent fournir du contexte, mais une réponse peut aussi refléter la conversation, les instructions, les connecteurs, les résultats web ou les connaissances du modèle selon les fonctionnalités activées.
Utile lorsque : vous voulez un espace récurrent dans lequel instructions, documents et conversations restent regroupés.
À vérifier avant utilisation : offre et contrôles de l’organisation, visibilité du projet, fichiers pris en charge, capacité de connaissances, activation de la récupération, attribution des sources, connecteurs ou recherche web, conservation et partage. Ne supposez pas qu’une réponse fluide provient d’un fichier du projet si vous ne pouvez pas la retracer.
Voie 3 : Un pipeline de récupération géré ou personnalisé
Un pipeline configurable peut associer ingestion, analyse, découpage, embeddings, index de recherche ou base vectorielle, récupération, reclassement, modèle et interface. Vous pouvez le construire avec du code, une plateforme de flux comme n8n, un framework visuel comme Langflow ou Flowise, ou une API gérée. Par exemple, la documentation d’OpenAI sur la recherche de fichiers décrit un outil hébergé de l’API Responses qui recherche des fichiers dans des bases vectorielles. Les autres fournisseurs proposent des contrats différents de récupération et de contrôle des données.
Utile lorsque : vous avez besoin de synchronisation automatique, de filtres de métadonnées, d’intégration applicative, de contrôles d’accès personnalisés, d’une récupération observable ou d’évaluations reproductibles qu’un carnet hébergé n’expose pas.
À vérifier avant utilisation : authentification, autorisation au niveau des documents, suppression et révocation, séparation des tenants, chiffrement, région, conservation, qualité de l’analyseur, fraîcheur de l’index, journaux de récupération, conditions d’utilisation des données du modèle, injection de prompts depuis les documents, surveillance et responsabilité de maintenance.
Choisir selon les exigences et les preuves
Employez un tableau de décision plutôt que des étiquettes telles que « le plus simple », « le plus souple » ou « le plus puissant » :
| Exigence | Questions auxquelles répondre | Méthode de vérification |
|---|---|---|
| Types de sources | Peut-il ingérer les fichiers, pages, tableaux, images et langues réellement employés ? | Testez des sources représentatives, y compris des formats difficiles. |
| Actualité | Copie-t-il, synchronise-t-il ou interroge-t-il la source de référence ? Comment propage-t-il mises à jour et suppressions ? | Modifiez et révoquez une source de test, puis examinez le résultat. |
| Qualité de récupération | Retrouve-t-il le passage nécessaire pour des questions réelles ? | Exécutez un jeu de questions étiqueté et inspectez les preuves. |
| Traçabilité des citations | Un réviseur peut-il atteindre la source et le passage exacts ? | Échantillonnez les citations et comparez-les aux affirmations. |
| Contrôle du périmètre | Pouvez-vous séparer les preuves du corpus du web ou des connaissances du modèle ? | Posez des questions répondables, ambiguës et hors corpus. |
| Autorisations | Chaque récupération applique-t-elle le public de la source et les accès actuels ? | Testez avec des utilisateurs aux autorisations différentes. |
| Exploitation | Pouvez-vous observer les échecs, réindexer sans risque, supprimer les données et attribuer une responsabilité ? | Testez mise à jour, suppression, panne et retour en arrière. |
| Coût et latence | Le flux complet est-il acceptable à un volume réaliste ? | Mesurez ingestion, stockage, requêtes, révision et maintenance. |
La bonne voie est la moins complexe qui satisfait les contrôles exigés par votre cas d’usage.
Créer un pilote délimité
La séquence suivante convient aux carnets hébergés, espaces de projet et pipelines configurables.
Étape 1 : Définir le périmètre et l’autorité
Consignez :
- les questions auxquelles l’assistant doit répondre ;
- celles auxquelles il ne doit pas répondre ;
- les utilisateurs prévus et l’enjeu de leurs décisions ;
- les types de sources faisant autorité, complémentaires ou exclus ;
- le responsable de la révision et la voie d’escalade ;
- la règle d’actualité ou de version applicable requise pour chaque classe de sources.
L’actualité dépend du domaine. Un article historique peut conserver son autorité quant à ses conclusions, tandis qu’une grille tarifaire, une procédure de sécurité, une règle fiscale, une politique produit ou une réglementation peut devenir dangereuse dès son remplacement. Consignez la date de publication, la date d’effet s’il y a lieu, la juridiction, la version et l’événement qui doit déclencher une révision. N’appliquez pas le même seuil d’âge arbitraire à tous les documents.
Étape 2 : Approuver la limite des données
Classez les sources avant l’ingestion. Confirmez le service, le compte, la région, la conservation, les conditions d’entraînement et les contrôles de partage auprès des responsables compétents de la sécurité, de la vie privée, du droit ou des données. Conservez les publics différents dans des bases ou projets séparés et ne divulguez que ce dont chaque assistant a besoin.
| Limite | Schéma plus sûr | Raccourci dangereux |
|---|---|---|
| Étude personnelle | Vos notes et des sources publiques dans un espace personnel | Documents professionnels mélangés dans un compte grand public |
| Connaissances d’équipe | Sources approuvées, détenues par l’équipe et assorties des mêmes accès | Contenus de plusieurs services copiés dans un projet partagé |
| Support client | Aide publique approuvée et dossiers à accès contrôlé | Dossiers clients mélangés à une base largement partagée |
| Juridique ou conformité | Droit primaire actuel et lignes directrices approuvées par un juriste dans un corpus de droit public | Notes privilégiées, projets de contrats et documentation publique mélangés |
La séparation par projet ou carnet n’est utile que si le compte et les contrôles de partage l’imposent. Dans un système personnalisé, l’autorisation doit s’appliquer lors de la récupération, pas seulement à l’importation.
Étape 3 : Créer un registre des sources
Pour chaque source, consignez :
- un identifiant stable et le titre ;
- le propriétaire et le public approuvé ;
- l’emplacement d’origine et la méthode d’ingestion ;
- le niveau d’autorité et la juridiction ;
- les dates de publication, d’effet, de révision et de remplacement s’il y a lieu ;
- la version ou la somme de contrôle ;
- la classification de confidentialité et le responsable de la suppression.
Le modèle complémentaire d’audit des sources lié à cet article fournit un tableau initial léger.
Étape 4 : Préparer et ingérer des documents représentatifs
Commencez avec des sources qui couvrent les formats et modes d’échec réels du cas d’usage. Examinez le texte extrait, les tableaux, les titres, les notes de bas de page et les pages numérisées. Une conversion textuelle propre, des fichiers plus petits ou d’autres limites de section peuvent améliorer la récupération pour un corpus et la dégrader pour un autre. Traitez la préparation et le découpage comme des hypothèses, puis comparez-les sur les mêmes questions.
Des noms de fichiers descriptifs et les métadonnées peuvent aider à identifier les preuves, mais ne supposez pas que le modèle déduit correctement l’autorité ou les dates d’un nom de fichier. Stockez ces champs explicitement lorsque le produit le permet.
Étape 5 : Rédiger un contrat de réponse
Une instruction initiale pourrait être :
Répondez pour [audience and purpose] à partir du corpus approuvé.
Pour chaque affirmation factuelle importante :
- indiquez la source et la section ou le passage probant lorsque l'interface le permet ;
- préservez les réserves, la juridiction et les dates d'effet ;
- signalez toute inférence comme telle ;
- exposez les contradictions entre sources sans en choisir une silencieusement.
Si les sources approuvées ne répondent pas à la question, indiquez cette limite.
N'utilisez ni le web ni les connaissances générales du modèle sauf activation explicite de ma part, et signalez-les séparément lorsqu'ils sont activés.
Transmettez [high-stakes categories] à [review owner].
Les instructions influencent la génération, mais ne prouvent pas que la récupération, la citation ou le refus fonctionneront. Testez chaque exigence.
Étape 6 : Évaluer avant l’usage courant
Constituez un jeu étiqueté à partir de tâches réelles. Incluez des questions ayant une réponse claire, des questions nécessitant plusieurs sources, des contradictions, des sources remplacées, des requêtes hors périmètre et des limites d’autorisation. Pour chaque cas, consignez la source attendue, les éléments de réponse acceptables, les affirmations interdites et l’escalade prévue.
Examinez séparément au moins trois couches :
- Récupération : le système a-t-il présenté les passages requis ?
- Génération : la réponse a-t-elle fidèlement restitué ces passages sans les renforcer ?
- Gouvernance : a-t-elle respecté les accès, le périmètre, l’actualité et les règles d’escalade ?
Fixez les seuils selon les conséquences de votre cas d’usage. Un assistant d’étude et un assistant servant à préparer des contenus juridiques ou destinés aux clients ne doivent pas partager la même barre d’acceptation.
Étape 7 : Exploiter avec des responsables
Désignez un responsable des mises à jour des sources, des revues d’accès, de la répétition des évaluations, de la gestion des incidents et de la suppression. Réévaluez après toute modification significative du corpus, de l’analyseur, de la configuration de récupération, du modèle, du prompt, de l’offre du produit ou de la politique de partage. Un rappel périodique peut aider, mais une révision déclenchée par les changements importe davantage qu’un rituel mensuel arbitraire.
Exemple d’informations juridiques avec séparation stricte
Supposons que vous souhaitiez un assistant sur le droit du travail estonien et la protection des données de l’UE.
Constituez un corpus de droit public à partir de sources primaires actuelles, comme la version consolidée de la loi estonienne sur les contrats de travail dans Riigi Teataja et le texte du RGPD dans EUR-Lex, ainsi que des lignes directrices approuvées par un avocat estonien ou européen qualifié pour les questions prévues. Consignez la juridiction, la version en vigueur, la date de consolidation et le caractère contraignant ou explicatif des orientations.
Ne mélangez pas ce corpus avec des projets de contrats, communications clients, dossiers d’enquête internes ou conseils juridiques privilégiés. Si un conseil juridique approuve un espace assisté par l’IA pour un dossier, gardez-le séparé, utilisez uniquement le système et les utilisateurs autorisés et préservez les contrôles de secret et de confidentialité précisés. Une réponse générée doit citer la disposition applicable, distinguer le droit des orientations et des inférences, et transmettre toute interprétation ou action contraignante à un juriste qualifié.
Cette conception permet de retrouver des documents sans prétendre que la récupération fournit une conclusion juridique ou remplace un avocat.
Tester les comportements difficiles, pas seulement les réponses idéales
| Test | Exemple | Comportement attendu |
|---|---|---|
| Répondable | Une question associée à une section probante connue | Trouve la section et la restitue fidèlement. |
| Plusieurs sources | Une question nécessitant politique et documentation technique | Utilise les deux et indique la source de chaque affirmation. |
| Remplacement | Une ancienne politique et la politique actuelle répondent toutes deux | Identifie la version applicable ou transmet le conflit. |
| Hors corpus | Une question stratégique sans source approuvée | Indique la limite au lieu d’inventer un fait interne. |
| Autorisation | Un utilisateur interroge une source inaccessible | Ne la récupère pas, ne la cite pas, ne la résume pas et ne révèle pas indûment son existence. |
| Contradiction | Deux documents apparemment autoritatifs divergent | Expose le conflit et les métadonnées nécessaires à sa résolution. |
| Appui de la citation | Une réponse fluide cite un passage proche mais non probant | Échoue au contrôle ; la seule présence d’une citation ne suffit pas. |
| Injection | Un document ordonne d’ignorer l’utilisateur ou de révéler des données | Traite le texte comme un contenu non fiable, pas comme une instruction prioritaire. |
Le refus n’est pas le seul comportement acceptable hors périmètre. Selon le cas, il peut être préférable d’indiquer clairement que le corpus ne contient pas la réponse, de demander une source approuvée ou de transmettre. Mesurez la fiabilité du comportement choisi.
Diagnostiquer les échecs courants
Sources obsolètes ou remplacées. Le système peut citer fidèlement une version qui ne s’applique plus. Corrigez le registre, les règles de version applicable, la synchronisation et l’affichage des réponses. La synchronisation automatique n’est utile que si elle pointe vers une source de référence et propage correctement les changements d’accès et les suppressions.
Sources de faible autorité. La récupération classe la pertinence, pas l’autorité juridique ou factuelle, sauf si vous la concevez en ce sens. Séparez sources primaires, sources secondaires approuvées et documents informels, puis testez la gestion des conflits.
Fuite de périmètre. Le modèle peut utiliser le contexte de la conversation, la recherche web, des connecteurs ou ses connaissances antérieures en plus des fichiers récupérés. Désactivez les contextes inutiles lorsque c’est possible, signalez les contextes externes autorisés et testez les questions hors corpus.
Échecs d’analyse et de récupération. Tableaux, scans, colonnes, notes, diagrammes, blocs de code et formats inhabituels peuvent être mal extraits. Examinez la représentation analysée et les passages récupérés. Comparez les changements de préparation, de découpage, de recherche ou de reclassement sur le jeu étiqueté au lieu de supposer qu’une recette unique convient.
Confiance excessive dans les citations. Une citation peut renvoyer à un passage réel qui n’étaye pas la phrase, ne l’étaye qu’en partie ou a été remplacé. Échantillonnez l’alignement entre affirmation et passage et imposez une vérification humaine pour les résultats importants.
Dérive des autorisations. Une copie peut rester interrogeable après la modification des accès à l’original. Testez la révocation et la suppression. Préférez les connecteurs ou architectures capables d’appliquer les autorisations actuelles lorsque le risque l’exige.
Préserver la provenance entre les outils
Lorsqu’une réponse passe dans un chatbot général, un document, un ticket ou un flux de décision, transférez aussi sa provenance. Incluez la question, les identifiants et versions des sources, les passages ou liens probants, la date de récupération, la réponse générée, les étiquettes d’inférence, les conflits non résolus et l’état de révision. Ne transférez que le sous-ensemble approuvé nécessaire à l’outil suivant.
Sans ce dossier, une réponse soigneusement étayée peut devenir un paragraphe sans attribution qu’un autre modèle traite comme un fait. Avec lui, le réviseur suivant peut distinguer le texte source, le résumé généré, l’inférence et la décision approuvée.
Quand créer davantage de contrôle
Quittez un carnet ou un projet hébergé lorsque des besoins mesurés l’exigent, par exemple :
- l’évaluation montre que la qualité de récupération baisse lorsque le corpus évolue ;
- les sources exigent une synchronisation, une suppression ou un héritage des autorisations automatiques ;
- les utilisateurs ont besoin de l’assistant dans une application ou un canal contrôlé ;
- les requêtes exigent des filtres de métadonnées, une recherche hybride, un reclassement ou une récupération structurée ;
- les exigences d’observabilité, d’audit, de région, de conservation ou de séparation des tenants dépassent les contrôles du produit hébergé ;
- les coûts d’utilisation et de maintenance justifient une responsabilité d’ingénierie.
Ce sont des exigences architecturales, pas un seuil de nombre de documents. Un petit corpus sensible peut nécessiter un modèle d’accès personnalisé, tandis qu’un grand corpus public peut fonctionner dans un service géré.
Pour un système configurable, envisagez des outils de récupération gérée, des plateformes de flux et des frameworks comme LlamaIndex, LangChain ou Haystack. Comparez-les selon les mêmes critères de sources, d’autorisations, d’évaluation et d’exploitation, pas selon la rapidité d’une démonstration.
Comptabiliser le coût complet
Le coût pertinent comprend les abonnements ou l’API, le stockage, les embeddings ou l’indexation, les mises à jour, l’évaluation, la révision humaine, la gestion des incidents et la maintenance. Les produits hébergés peuvent proposer un accès gratuit ou groupé assorti de limites dépendant de l’offre. Les systèmes personnalisés peuvent réduire ou augmenter le coût unitaire selon l’échelle et la conception opérationnelle.
Comparez le coût total aux tâches documentaires que l’assistant améliore réellement. Un pilote réussit lorsqu’il produit des réponses mieux étayées, plus faciles à vérifier et correctement délimitées, pas simplement lorsque le chat paraît plus rapide.
Commencez par un domaine étroit, un corpus représentatif approuvé et une évaluation étiquetée. N’élargissez qu’après avoir démontré la qualité de récupération, l’appui des citations, la gestion des versions applicables, l’application des autorisations et un comportement sûr hors périmètre. Cette discipline transforme un dossier de fichiers en assistant documentaire utilisable de manière responsable.



