Guide

Comment fonctionne le RAG, étape par étape : une question suivie de bout en bout

L'équipe Kopik9 min de lecture

Comment fonctionne le RAG ? En amont, vos documents sont découpés en passages et indexés ; au moment de la question, le système retrouve les passages pertinents, les reclasse, les place dans un prompt et demande à un modèle de langage de répondre uniquement à partir d’eux, en citant ses sources. Pour vraiment comprendre ce mécanisme, rien ne vaut de le voir tourner. Nous suivons ici une seule question, posée par une salariée d’une PME fictive, à travers les sept étapes de la génération augmentée par récupération, du dépôt du PDF jusqu’à la réponse sourcée.

Le point de départ : une question, trois documents

Notre PME, un bureau d’études de 40 personnes à Nantes, a versé trois documents dans sa base de connaissances : l’accord d’entreprise sur le temps de travail signé en 2026 (un PDF de 30 pages), l’ancien accord de 2022, que personne n’a retiré, et une FAQ RH rédigée sous Word. Une salariée tape dans l’assistant interne :

Est-ce que je peux garder mes jours de congé non pris pour l’an prochain ?

La réponse se trouve à l’article 6.2 de l’accord de 2026, intitulé « Report des congés payés ». Il ne contient ni le mot « garder » ni l’expression « l’an prochain ». L’accord de 2022 prévoyait une règle différente. Retenez ces deux détails : ce sont précisément les pièges qu’un pipeline RAG doit déjouer. Si vous cherchez d’abord les notions de base, notre guide Qu’est-ce que le RAG ? explique le pourquoi ; ici, on reste sur le comment.

Avant toute question : ingestion, découpage, indexation

Les trois premières étapes ont lieu une fois, au dépôt des documents, puis à chaque mise à jour. La salariée ne les voit jamais, mais elles déterminent l’essentiel de la qualité finale.

Étape 1. L’ingestion : des fichiers au texte propre

Le pipeline ouvre chaque fichier et en extrait le texte. Pour le PDF de l’accord, il lit la couche texte page par page, supprime les en-têtes et pieds de page répétés (« Accord d’entreprise, page 12/30 ») et conserve les titres pour garder la structure. Chaque document reçoit aussi des métadonnées : titre, nom de fichier et, idéalement, date d’effet. Cette date jouera un rôle quand les accords de 2022 et de 2026 entreront en concurrence.

Ce qui peut mal tourner : un PDF scanné sans couche texte ne donne rien, et un tableau aplati devient une suite de chiffres illisible. Notre guide Préparer ses documents pour l’IA détaille les corrections.

Étape 2. Le découpage : des passages qu’on peut retrouver

Le texte est découpé en chunks, des passages de quelques centaines de mots. L’article 6.2 devient le passage 87. Un bon découpage fait deux choses qui serviront notre question : il préfixe le passage avec son chemin de titres (« Accord 2026 > Titre 6 Congés > 6.2 Report des congés payés ») et il chevauche légèrement le passage suivant pour ne pas couper une phrase en deux. En substance, le passage 87 dit : les congés non pris au 31 mai peuvent être reportés dans la limite de 5 jours ouvrables, à poser avant le 31 décembre suivant.

Étape 3. L’indexation : rendre les passages trouvables

Chaque passage est rangé dans un index. Un index plein texte enregistre les mots sous forme normalisée, pour que « report », « reporter » et « reportés » se répondent. Un index vectoriel stocke un embedding, une suite de nombres qui résume le sens du passage. Beaucoup de systèmes combinent les deux. Les arbitrages sur la taille des passages, le chevauchement et le type d’index sont détaillés dans Chunking, indexation, recherche : comment fonctionne un pipeline RAG.

Au moment de la question : recherche et reranking

Étape 4. La recherche : ratisser large

Une recherche littérale sur « garder mes jours de congé non pris » bute sur un problème : l’accord parle de « report » et de « congés payés ». Deux techniques sauvent la question. L’élargissement de la requête demande à un modèle de langage de reformuler la question en termes supplémentaires (report, reporter, congés payés, solde de congés, période de référence). La recherche sémantique retrouve les passages proches par le sens, même avec d’autres mots. On obtient une liste de candidats, souvent 20 à 50 passages, dont voici la tête :

  1. Passage 87 (accord 2026, art. 6.2 Report) : 5 jours ouvrables au plus, à poser avant le 31 décembre.
  2. Passage 301 (accord 2022, art. 6.2 Report) : l’ancienne règle, 10 jours sans date limite.
  3. Passage 88 (accord 2026, art. 6.3 Compte épargne-temps) : les jours au-delà peuvent alimenter le CET.
  4. Passage 9 (FAQ RH) : les RTT suivent des règles distinctes.
  5. Passage 40 (accord 2026, art. 4.1 Jours fériés) : la liste des jours fériés chômés.

Étape 5. Le reranking : remettre les meilleures preuves en tête

La recherche privilégie la vitesse et le rappel : elle a le droit d’être un peu large. Le reranking (ou reclassement) est la seconde lecture, plus attentive. Un reclasseur lit la question et chaque candidat ensemble et note à quel point le passage y répond vraiment. On y ajoute des règles métier : éliminer les doublons, préférer la version la plus récente d’un document. Dans notre exemple, le passage 87 remonte en tête, le passage 88 reste car le CET est la suite logique, les jours fériés disparaissent, et l’accord de 2022 est écarté ou clairement signalé comme ancien. On ne garde que trois à huit passages.

Le reranking est facultatif, son rôle ne l’est pas

Certains systèmes utilisent un modèle de reclassement dédié, d’autres une recherche hybride bien réglée et des filtres sur les métadonnées. L’essentiel : qu’un passage périmé n’arrive jamais en premier devant le modèle. Ici, laisser passer la règle de 2022 sans étiquette produirait une réponse assurée et fausse.

Assemblage du prompt et réponse avec sources

Étape 6. L’assemblage du prompt

Le modèle de langage ne cherche rien lui-même. Il reçoit un prompt construit par le pipeline, en général en quatre parties :

  1. Les consignes : répondre uniquement à partir des sources ci-dessous, les citer [1], [2], dire clairement si elles ne contiennent pas la réponse.
  2. Les sources numérotées : [1] passage 87 avec son titre et sa date, [2] passage 88, [3] passage 9.
  3. La question, telle que la salariée l’a posée.
  4. Le contexte utile : langue, date du jour, format attendu (réponse courte puis détails).

Les passages issus des documents sont traités comme des données, jamais comme des ordres, et placés entre des balises claires : une phrase glissée dans un document (« ignore les consignes précédentes ») ne doit pas pouvoir détourner le modèle.

Étape 7. La génération : une réponse vérifiable

Le modèle rédige quelque chose comme : « Oui, en partie. Les congés non pris au 31 mai peuvent être reportés dans la limite de 5 jours ouvrables, à poser avant le 31 décembre [1]. Les jours au-delà peuvent être versés sur votre compte épargne-temps [2]. Les RTT obéissent à d’autres règles [3]. » Chaque numéro renvoie au passage d’origine : la salariée, ou le service RH, peut cliquer et lire le texte exact.

Ce que le modèle n’a pas fait : inventer une règle ou citer l’accord de 2022. Ce que le RAG ne fait pas non plus : trancher un cas particulier. Le Code du travail prévoit des reports spécifiques, par exemple pour les congés non pris à cause d’un arrêt maladie, et un assistant bien conçu renvoie vers les RH plutôt que d’improviser. Pour ce type de questions, la base publique Congés payés et temps de travail rassemble les textes de référence.

Le parcours complet en un tableau

Une question à travers un pipeline RAG

ÉtapeCe qui arrive à notre questionPanne typique
1. IngestionTexte extrait, en-têtes retirés, date d’effet conservéePDF scanné, tableaux cassés
2. DécoupageL’article 6.2 devient le passage 87 avec ses titresRègle coupée entre deux passages
3. IndexationPassage rangé dans l’index plein texte et vectorielMauvaise langue, index pas à jour
4. Recherche« Garder » relié à « report » ; 5 candidatsLe bon passage absent des candidats
5. RerankingRègle 2026 en tête, accord 2022 écartéVersion périmée classée première
6. PromptConsignes, 3 sources numérotées, questionTrop de passages, pas d’obligation de citer
7. GénérationRéponse avec [1][2][3] et une limite signaléeAffirmations sans source

Ce tableau sert aussi de grille de diagnostic. Face à une mauvaise réponse, remontez le fil : le bon passage était-il dans le prompt ? Si oui, le problème vient des consignes ou de la génération. Sinon, figurait-il parmi les candidats ? Sinon, regardez le découpage, puis l’extraction. La plupart des erreurs naissent aux étapes 1, 2 et 4.

Faire tourner ce parcours sans le construire

Monter ces sept étapes soi-même suppose un extracteur, un découpeur, une base de données, une couche de recherche, l’API d’un modèle et le code qui relie le tout. Kopik fait tourner ce pipeline pour vous. Créer une base est gratuit : vous déposez des PDF, des fichiers Word, du texte ou du Markdown, et Kopik extrait, découpe et indexe pour une recherche hybride (plein texte et élargissement sémantique des mots-clés). Chaque question renvoie une réponse fondée sur vos documents avec les passages cités, ou seulement les passages bruts en mode « passages ».

Une base peut rester privée (vous et vos clés API seulement) ou être publiée au catalogue, payée à la question, avec un prix fixé par le créateur qui en garde 70 %. Elle s’interroge sur le site, par l’API REST ou depuis Claude, Cursor, ChatGPT et d’autres clients MCP. Côté RGPD, vérifiez comme toujours les données personnelles présentes dans vos documents avant de les déposer.

Suivez votre propre question de bout en bout

Déposez un accord, un manuel ou une procédure et posez-lui une vraie question : la réponse arrive avec les passages qui la fondent.

Testez comme nous venons de le faire

Choisissez cinq questions que votre équipe pose vraiment, notez où se trouve la réponse dans les documents, puis comparez les citations de chaque réponse à cet endroit. C’est le moyen le plus rapide de savoir quelle étape améliorer.

Questions fréquentes

Quelles sont les étapes de la génération augmentée par récupération ?

Deux phases. En amont : ingestion (extraction du texte), découpage en passages et indexation. Au moment de la question : recherche des passages candidats, reranking pour les classer par pertinence réelle, assemblage du prompt (consignes, sources, question) et génération d’une réponse qui cite ses sources.

Le reranking est-il indispensable dans une architecture RAG ?

Pas toujours. Une petite base bien rangée fonctionne souvent très bien avec une bonne recherche hybride. Le reranking devient précieux quand la liste de candidats est longue, quand plusieurs versions d’un document coexistent ou quand des passages se ressemblent sans répondre à la même question.

Combien de passages faut-il envoyer au modèle ?

En général une poignée, souvent entre trois et dix. Trop peu, et la réponse risque de manquer ; trop, et le modèle se disperse tandis que le coût et le délai augmentent. Le bon réglage dépend de la taille des passages et de vos documents : testez avec de vraies questions.

Pourquoi un RAG répond-il parfois à partir d’un document périmé ?

Parce que les deux versions ont été indexées et que l’ancienne correspondait bien à la question. Retirez les documents obsolètes, enregistrez une date d’effet en métadonnée et faites en sorte que le classement favorise la version la plus récente. Une date écrite dans le document aide aussi.

Le modèle de langage cherche-t-il lui-même dans les documents ?

Non. La recherche est faite en amont par la couche de récupération. Le modèle ne voit que les passages sélectionnés et placés dans son prompt, d’où l’importance décisive de la qualité de la recherche.

Recevez la newsletter Kopik

Nouvelles bases de connaissances, guides sur le RAG et nouveautés du produit. Un mail toutes les une à deux semaines, désinscription en un clic.

En vous abonnant, vous acceptez de recevoir notre newsletter. Votre adresse n'est jamais partagée.