Guide

Qu’est-ce que le RAG (génération augmentée par récupération) ? Le guide pratique

L'équipe Kopik13 min de lecture

Les grands modèles de langage rédigent remarquablement bien, mais ils ne connaissent que ce qu’ils ont vu pendant leur entraînement, et ils n’hésitent pas à inventer quand ils ne savent pas. Alors, qu’est-ce que le RAG, et pourquoi s’est-il imposé comme la méthode de référence pour faire travailler une IA sur de vrais documents ? Le principe est simple : avant de répondre, le système va chercher les passages pertinents dans un ensemble de documents de confiance, puis les transmet au modèle comme éléments de preuve. La réponse s’appuie alors sur vos sources, reste à jour et peut être vérifiée. Ce guide explique comment fonctionne le RAG, dans quels cas l’utiliser, où il atteint ses limites et comment créer votre première base de connaissances.

Qu’est-ce que le RAG, en termes simples ?

RAG est l’acronyme anglais de retrieval-augmented generation, que l’on traduit par « génération augmentée par récupération » (ou « par recherche »). Le terme a été popularisé en 2020 par un article de recherche de Facebook AI Research, Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks, qui associait un moteur de recherche à un générateur de texte. Aujourd’hui, on parle de RAG pour tout système dans lequel une IA répond à une question à partir d’informations récupérées au moment de la question, plutôt qu’en s’appuyant uniquement sur sa mémoire.

L’image la plus parlante est celle de l’examen à livre ouvert. Sans RAG, le modèle est un étudiant qui répond de mémoire : à l’aise, sûr de lui, parfois à côté. Avec le RAG, c’est le même étudiant, mais autorisé à ouvrir le bon manuel à la bonne page avant de rédiger. Le raisonnement et la rédaction restent les siens, mais les faits viennent du manuel, et il peut indiquer la page.

L’ensemble des documents interrogés s’appelle généralement une base de connaissances. Il peut s’agir d’un règlement intérieur, d’une convention collective, de contrats, d’une documentation produit, de textes réglementaires, de supports de formation ou de notes d’expert : tout contenu écrit à partir duquel vous voulez qu’une IA réponde.

Pourquoi les modèles de langage ont-ils besoin du RAG ?

Les modèles généralistes ont trois limites structurelles qu’aucune formulation astucieuse de prompt ne corrige totalement :

  • Ils ne connaissent pas vos documents. Vos procédures internes, vos dossiers clients ou votre expertise pointue n’ont jamais fait partie de leurs données d’entraînement.
  • Leurs connaissances sont figées. Un modèle est entraîné jusqu’à une date donnée. Tout ce qui a changé ensuite (une nouvelle loi, une grille tarifaire révisée, un accord d’entreprise mis à jour) lui échappe.
  • Ils peuvent halluciner. Faute d’information, un modèle peut produire une réponse plausible mais fausse. Sans source, impossible de distinguer le vrai de l’inventé.

Le RAG répond aux trois problèmes d’un coup. Les documents apportent le savoir manquant, les mettre à jour met instantanément à jour les réponses, et comme la réponse est construite à partir de passages précis, le système peut les citer pour qu’un humain vérifie.

Comment fonctionne le RAG ? Les trois étapes

Du prototype bricolé en un week-end à la plateforme d’entreprise, tous les systèmes RAG suivent la même logique. Une partie se déroule une seule fois, à l’ajout des documents ; le reste se joue à chaque question.

1. L’indexation : préparer les documents

Le texte est extrait de chaque fichier (PDF, Word, pages web…), puis découpé en passages plus courts, qu’on appelle des chunks (ou fragments). Ce découpage est nécessaire parce qu’un modèle ne peut lire qu’une quantité limitée de texte par question, et parce qu’un passage ciblé constitue une bien meilleure preuve qu’un document entier de 80 pages. Chaque passage est ensuite rangé dans un index de recherche pour être retrouvé rapidement.

2. La recherche : retrouver les bons passages

Quand une question arrive, le système interroge l’index et remonte une poignée de passages parmi les plus pertinents. C’est l’étape décisive : si le bon passage n’est pas retrouvé, même le meilleur modèle ne pourra pas répondre correctement.

3. La génération : rédiger une réponse sourcée

Les passages retrouvés sont insérés dans le prompt du modèle, avec la question et des consignes du type « réponds uniquement à partir de ces sources et cite-les ». Le modèle rédige alors la réponse, idéalement avec des renvois vers les passages utilisés.

Chacune de ces étapes suppose de vrais choix : taille des passages et chevauchement, type de recherche, nombre de résultats, formulation des consignes. Nous les détaillons dans notre article sur le pipeline RAG : chunking, indexation et recherche.

Recherche par mots-clés, vectorielle ou hybride : comment le RAG retrouve l’information

Il existe deux grandes familles de recherche, et beaucoup de systèmes en production les combinent.

Les principales méthodes de recherche en RAG

MéthodePrincipePoints fortsPoints faibles
Mots-clés / plein texteMots communs, avec racinisation et classementTermes exacts, références, numéros d’article ; transparenteRate les synonymes sans reformulation
Vectorielle (embeddings)Proximité de sens dans un espace numériqueParaphrases, questions flouesPeut rater un identifiant exact ; plus dure à déboguer
HybrideLes deux, classements fusionnésCouvre les deux casPlus de réglages

La recherche plein texte est souvent sous-estimée. Les moteurs matures, comme celui intégré à PostgreSQL, gèrent la racinisation (« licencier » retrouve « licenciement ») et classent les résultats par pertinence. Sa principale faiblesse, les synonymes, se corrige en demandant à un modèle de langage de reformuler la question en plusieurs variantes de mots-clés avant la recherche. La recherche vectorielle brille quand les utilisateurs formulent les choses très différemment des documents. Aucune n’est meilleure dans l’absolu : tout dépend de vos documents et de la façon dont on les interroge.

Le vocabulaire du RAG

Les mêmes termes reviennent dans toutes les discussions sur le RAG. Voici ce qu’ils recouvrent concrètement.

Petit lexique du RAG

TermeSignification
Chunk / passageCourt extrait d’un document, l’unité que l’on retrouve
ChevauchementTexte répété entre deux passages pour ne pas couper une idée
IndexL’ensemble interrogeable de tous les passages
Top-kLe nombre de passages retrouvés par question
Expansion de requêteReformuler la question en mots-clés ou synonymes avant la recherche
Ancrage (grounding)Contraindre la réponse aux sources retrouvées
CitationRenvoi de la réponse vers le passage sur lequel elle s’appuie

Deux réglages méritent votre attention dès le départ. La taille des passages est un compromis : trop courts, ils perdent le contexte ; trop longs, ils diluent la pertinence. Le top-k aussi : trop peu de passages et la réponse peut manquer, trop et l’on ajoute du bruit et du coût. Il n’existe pas de valeur idéale universelle : testez avec vos documents et vos questions.

À quoi sert le RAG ? Les principaux cas d’usage

Le RAG vaut le coup dès que des personnes posent régulièrement des questions dont la réponse existe déjà quelque part par écrit. Quelques exemples typiques :

  • Savoir interne : politique RH, livret d’accueil, procédures informatiques, consultables sans déranger un collègue.
  • Support client : réponses tirées de la documentation produit et des articles d’aide, avec lien vers la source.
  • Juridique, RH et conformité : Code du travail, conventions collectives, RGPD ou clauses contractuelles, là où la citation des sources est indispensable. Voir notre guide RAG pour le juridique, les RH et la conformité.
  • Produits d’expertise : un consultant, un formateur ou un auteur qui transforme son savoir-faire en base de connaissances interrogeable, parfois payante.
  • Agents IA : donner à un assistant (Claude, ChatGPT, Cursor ou votre propre agent) une source fiable à consulter en cours de tâche, par exemple via MCP.

RAG, fine-tuning ou long prompt : quelles différences ?

Le RAG n’est pas la seule façon de faire « connaître » vos contenus à un modèle. Les deux alternatives principales sont le fine-tuning (réentraîner le modèle sur vos données) et le simple copier-coller des documents dans un long prompt.

Trois façons d’apporter vos connaissances à une IA

CritèreRAGFine-tuningLong prompt
Mise à jourAjouter ou retirer un fichierRéentraînerModifier le prompt
Cite ses sourcesOui, nativementNonPossible, à la main
Volume de documentsImportantImportantLimité par le contexte
Idéal pourFaits et référencesStyle, format, comportementPetits corpus ponctuels

Pour répondre à des questions factuelles sur des documents métier, le RAG est presque toujours le meilleur point de départ : moins coûteux, facile à tenir à jour et vérifiable. Le fine-tuning est plus efficace pour apprendre un style ou un format de réponse que pour transmettre des faits. Nous comparons les deux approches en détail dans RAG ou fine-tuning : que choisir pour vos documents métier.

Les limites et les pièges du RAG

Le RAG réduit les hallucinations, il ne les supprime pas. Connaître ses points faibles permet de s’en prémunir.

  • Des documents médiocres donnent des réponses médiocres. Des contenus périmés, contradictoires ou mal structurés dégradent les réponses. Les PDF scannés sans couche texte sont tout simplement illisibles.
  • Des passages ratés. Si le passage utile emploie d’autres mots que la question, ou s’il est coupé au mauvais endroit, il peut ne jamais atteindre le modèle.
  • Les questions qui exigent tout le corpus. « Résume tous les contrats signés cette année » suppose de tout lire, pas de retrouver quelques passages. Le RAG est conçu pour des questions ciblées.
  • Tableaux et schémas. Les tableaux complexes, graphiques et images perdent souvent leur structure à l’extraction du texte.
  • L’excès de confiance. Les citations donnent un air d’autorité aux réponses. Pour tout enjeu important, il faut quand même ouvrir la source.

L’amélioration la moins chère

La plupart des problèmes de qualité en RAG sont des problèmes de documents. Des titres clairs, un sujet par section, des dates explicites et des termes définis font plus qu’un changement de modèle. Notre méthode pour préparer vos documents pour l’IA et le RAG vous guide pas à pas.

Comment créer une base de connaissances RAG ?

Vous pouvez assembler vous-même un système RAG avec des briques open source, ou passer par une plateforme qui gère le pipeline. Dans les deux cas, la démarche est la même :

  1. Définir le périmètre. À quelles questions la base doit-elle répondre, et pour qui ? Une base ciblée répond mieux qu’un fourre-tout.
  2. Rassembler et nettoyer les documents. Supprimer les doublons et les anciennes versions ; vérifier que les PDF contiennent du texte sélectionnable.
  3. Indexer. Extraire le texte, le découper et le stocker dans un index de recherche (plein texte, vectoriel ou les deux).
  4. Paramétrer la réponse. Choisir le modèle, le nombre de passages remontés, et des consignes qui imposent les citations et autorisent le « je ne sais pas ».
  5. Tester avec de vraies questions. Rédiger 20 à 30 questions que vos utilisateurs posent réellement, confronter chaque réponse à la source et corriger les documents quand ça coince.
  6. Entretenir. Remplacer les documents quand ils évoluent, retirer ce qui est obsolète.

Tout faire soi-même implique d’assembler un extracteur, un découpeur, une base de données, une couche de recherche et une API de modèle. C’est un excellent exercice, mais pour la plupart des gens, la valeur est dans les documents, pas dans la tuyauterie. Notre guide pas à pas montre comment créer une base de connaissances à partir de vos documents en quelques minutes.

Le RAG en pratique avec Kopik

Kopik est la bibliothèque de bases de connaissances expertes pour l’IA, conçue en France. La création d’une base est gratuite. Vous déposez vos documents (PDF avec couche texte, Word .docx et formats texte comme .txt, .md, .csv, .tsv, .json, .html ou .xml, jusqu’à 4 Mo par fichier) ou collez du texte, et la base se construit automatiquement :

  • Le texte est extrait puis découpé en passages d’environ 1 200 caractères qui se chevauchent, indexés dès l’envoi du fichier.
  • Les passages sont indexés avec la recherche plein texte de PostgreSQL (sans base vectorielle), réglée sur la langue des documents de la base : français, anglais, allemand, espagnol, italien, portugais, néerlandais, ou un mode neutre pour les contenus mixtes.
  • Au moment de la question, un petit modèle rapide la reformule en mots-clés et synonymes dans la langue des documents : une question posée dans une autre langue retrouve donc quand même les bons passages. Les 8 meilleurs passages sont retrouvés, puis un modèle de langage rédige la réponse à partir de ces seuls passages, avec des citations numérotées [1][2]. Si la base ne contient pas la réponse, il le dit.
  • Un mode « passages » renvoie uniquement les extraits pertinents, sans réponse rédigée, pour les agents qui préfèrent raisonner eux-mêmes.

Chaque base peut être publique (visible dans le catalogue des bases de connaissances), non listée (accessible par lien) ou privée. Une base privée, c’est votre propre RAG privé : vous l’interrogez gratuitement depuis le site, l’API REST ou MCP avec votre clé d’API, ce qui en fait une source de connaissances clé en main pour vos agents IA, sans infrastructure à gérer. Nous détaillons cet usage dans utiliser une base de connaissances privée comme RAG pour vos agents IA. Les bases publiques rejoignent la bibliothèque : les abonnés les interrogent dans le chat du site, et les agents paient à la requête via l’API et MCP, dès quelques centimes. Le créateur perçoit une part fixe sur chaque question d’abonné et 70 % de chaque requête payante : de quoi transformer une documentation spécialisée en véritable produit. Si c’est votre projet, lisez comment partager votre expertise sous forme de base de connaissances.

Les bases s’interrogent sur le site, via une API REST, ou directement depuis des agents IA (Claude, Cursor, ChatGPT ou le vôtre) grâce à un serveur MCP. La mise en place est détaillée dans connecter une base de connaissances à un agent IA avec MCP et dans la documentation développeurs.

Transformez vos documents en base de connaissances RAG

Déposez vos PDF ou fichiers Word et obtenez une base qui répond en citant ses sources, à garder privée, partager par lien ou publier.

Le RAG est-il adapté à votre projet ? La check-list

  • Les réponses existent déjà dans des documents écrits.
  • Les utilisateurs posent des questions ciblées, pas « lis tout et fais-moi une synthèse ».
  • Pouvoir vérifier la source est important.
  • Le contenu évolue et doit rester à jour.
  • Les documents sont textuels (ou peuvent être convertis en texte).

Si vous cochez la plupart de ces cases, le RAG est très probablement la bonne approche. Si votre objectif est surtout de changer la manière dont un modèle rédige ou se comporte, plutôt que ce qu’il sait, regardez d’abord du côté du fine-tuning ou d’un meilleur prompt.

Pour aller plus loin

Vous débutez ? Commencez par créer une base de connaissances à partir de vos documents, puis plongez dans le fonctionnement du pipeline RAG quand vous voudrez comprendre les compromis.

Questions fréquentes

Que signifie RAG en intelligence artificielle ?

RAG signifie retrieval-augmented generation, soit « génération augmentée par récupération ». Le système commence par retrouver les passages pertinents dans un ensemble de documents, puis les transmet à un modèle de langage qui rédige une réponse fondée sur ces passages. La réponse s’appuie ainsi sur vos sources et peut les citer.

Le RAG supprime-t-il les hallucinations ?

Non, mais il les réduit nettement et les rend plus faciles à repérer. Comme la réponse est construite à partir de passages précis, le modèle peut citer ses sources et être configuré pour dire qu’il ne sait pas quand rien de pertinent n’est trouvé. Pour les décisions importantes, il reste indispensable de vérifier les passages cités.

Faut-il obligatoirement des embeddings pour faire du RAG ?

Non. Les embeddings (recherche vectorielle) sont une option, mais la recherche par mots-clés et plein texte fonctionne très bien, en particulier sur des documents au vocabulaire précis comme les textes juridiques. Beaucoup de systèmes combinent les deux, et la recherche plein texte gagne en efficacité quand un modèle reformule d’abord la question en synonymes.

Vaut-il mieux faire du RAG ou du fine-tuning ?

Pour répondre à des questions factuelles sur des documents métier, le RAG est généralement le meilleur choix : moins cher, facile à mettre à jour et capable de citer ses sources. Le fine-tuning convient mieux pour apprendre à un modèle un style, un ton ou un format de réponse. Les deux peuvent aussi se combiner.

Quels documents fonctionnent le mieux avec le RAG ?

Les documents textuels bien structurés : titres explicites, un sujet par section, définitions et dates claires. Les PDF doivent contenir une vraie couche texte ; un scan sans OCR est illisible. Les tableaux complexes et schémas perdent souvent leur structure à l’extraction, mieux vaut donc reprendre l’information clé dans le texte.

Peut-on créer une base de connaissances RAG sans coder ?

Oui. Des plateformes comme Kopik prennent en charge l’extraction, le découpage, l’indexation et la génération des réponses : vous déposez vos fichiers et la base est prête à être interrogée sur le web, par API ou depuis des agents IA via MCP. Sur Kopik, créer une base est gratuit, et interroger votre propre base privée aussi. Le code n’est utile que si vous voulez construire et régler votre propre pipeline.

Recevez la newsletter Kopik

Nouvelles bases de connaissances, guides sur le RAG et nouveautés du produit. Un mail toutes les une à deux semaines, désinscription en un clic.

En vous abonnant, vous acceptez de recevoir notre newsletter. Votre adresse n'est jamais partagée.