Tutoriel

Préparer ses documents pour l’IA : rédiger un corpus qui donne de bonnes réponses

L'équipe Kopik11 min de lecture

Quand un assistant RAG répond à côté, on accuse d’abord le modèle. Le plus souvent, le problème se situe en amont : un PDF scanné sans texte, une procédure qui existe en trois versions contradictoires, un chiffre clé enfoui dans un tableau illisible pour l’extracteur. Savoir préparer ses documents pour l’IA est le levier le plus rentable pour améliorer les réponses. Ce guide passe en revue les formats, la structure, la rédaction et les tests, avec des check-lists applicables à n’importe quel corpus.

Pourquoi la préparation compte plus que le modèle

Un système de génération augmentée par la recherche fonctionne en deux temps : il cherche d’abord dans vos documents les passages les plus pertinents pour la question, puis un modèle de langage rédige une réponse à partir de ces passages. Pour un rappel complet, lisez qu’est-ce que le RAG.

Le modèle ne peut pas faire mieux que ce que la recherche lui transmet. Si le bon passage n’est jamais retrouvé, parce que le texte n’a pas été extrait, que le vocabulaire ne correspond pas à la question ou que l’information est éparpillée sur deux pages éloignées, même le meilleur modèle échouera. Une bonne préparation augmente les chances que le bon passage remonte, et qu’il contienne tout ce qu’il faut pour répondre.

L’idée clé

Rédigez chaque section pour qu’elle reste compréhensible lue seule, hors contexte. C’est exactement ce que fait un système RAG avec votre texte.

Étape 1 : choisir des formats que l’IA sait lire

Avant tout, vérifiez que le texte peut être extrait. Cela paraît évident, c’est pourtant la panne silencieuse la plus fréquente.

Formats courants et points de vigilance

FormatFonctionne bien siAttention à
PDFExporté depuis un traitement de texteScans sans OCR : aucun texte
Word (.docx)Vrais styles de titresTexte dans des images ou zones de texte
Markdown / .txtTexte propre et structuréStructure perdue par copier-coller
HTMLTitres sémantiques, peu de décorMenus, pieds de page, bandeaux cookies
CSV / TSVUne ligne par fiche, en-têtes clairsColonnes codées, abréviations
JSON / XMLNoms de champs lisiblesImbrications sans libellés
  • Testez un PDF en dix secondes : essayez de sélectionner et copier une phrase. Si c’est impossible, le fichier n’est qu’une image et doit passer par un OCR avant toute exploitation par l’IA.
  • Privilégiez le fichier source : si vous avez le Word d’origine, importez-le plutôt que son export PDF ; la structure est mieux conservée.
  • Débarrassez les pages web du superflu : menus, pieds de page et mentions répétées ajoutent du bruit qui concurrence le vrai contenu.
  • Découpez les fichiers volumineux : des fichiers plus courts et centrés sur un thème sont plus faciles à maintenir et respectent plus facilement les limites d’import.

Étape 2 : faire le ménage avant d’indexer

Un corpus RAG n’est pas une archive. Chaque document ajouté entre en concurrence pour les quelques passages retenus à chaque question. Un contenu hors sujet ou périmé ne se contente pas d’encombrer : il fait sortir les bons passages des résultats.

  1. Supprimer les doublons : la même FAQ recopiée dans cinq fichiers, ce sont cinq passages quasi identiques qui saturent les résultats.
  2. Ne garder que la version en vigueur : retirez les procédures remplacées, les anciens tarifs, les brouillons. Si l’historique compte, placez-le dans une base à part.
  3. Dater ce qui évolue : indiquez la date d’effet ou de mise à jour en tête de chaque document.
  4. Trancher les contradictions : si deux documents se contredisent, corrigez la source au lieu d’espérer que le modèle choisisse le bon.
  5. Retirer les données sensibles : données personnelles, identifiants et informations confidentielles n’ont rien à faire dans un corpus, sauf nécessité stricte et protection adaptée (RGPD oblige).

Étape 3 : structurer pour le découpage (chunking)

Avant l’indexation, un système RAG découpe les documents en passages, qu’on appelle souvent des chunks. La plupart des découpeurs respectent les frontières naturelles : d’abord les paragraphes, puis les phrases. Notre article sur le chunking, l’indexation et la recherche détaille la mécanique. Pour le rédacteur, retenez ceci : une structure claire produit des passages propres.

Des titres qui disent de quoi on parle

« Article 4 » n’apprend rien au moteur de recherche. « Remboursement des abonnements annuels » dit exactement ce que couvre la section, avec les mots que les gens utiliseront dans leurs questions. Un titre ne coûte rien et sert autant au lecteur qu’à la recherche.

Des paragraphes centrés sur une idée

Une idée par paragraphe, et des paragraphes de longueur raisonnable. Un pavé qui mélange trois sujets donne des passages qui correspondent vaguement à beaucoup de questions et précisément à aucune. Des paragraphes ciblés donnent des passages qui répondent nettement à une question.

Les règles et leurs exceptions côte à côte

Si une règle et son exception sont séparées de cinq pages, elles finiront presque à coup sûr dans des passages différents. Placez conditions, dérogations et seuils juste à côté de la règle qu’ils modifient. C’est crucial pour les documents juridiques, RH et de conformité, où l’exception change la réponse.

Rédiger des sections autonomes

C’est l’habitude d’écriture la plus utile pour un corpus destiné à l’IA. Un passage retrouvé arrive sans les pages qui l’entourent : toute référence au contexte précédent perd son sens.

Réécrire pour des passages autonomes

Au lieu deÉcrivez
« Comme indiqué plus haut, c’est 30 jours. »« Le délai de remboursement des abonnements annuels est de 30 jours. »
« Cela ne les concerne pas. »« Cette règle ne s’applique pas aux prestataires. »
« Voir le tableau précédent. »Reprenez la valeur clé dans la phrase.
« Le logiciel »Le nom exact du logiciel.
« Contactez le service. »« Contactez le service facturation à l’adresse indiquée sur chaque facture. »
  • Rappelez le sujet : nommez le produit, la procédure ou la population concernée dans chaque section, même si cela semble redondant à un lecteur humain.
  • Chassez les pronoms orphelins : « il », « celui-ci », « cela » en début de paragraphe sont des signaux d’alerte.
  • Développez les sigles au moins une fois par section, puisque chaque section est lue isolément : CSE, DPAE, RTT…
  • Donnez les chiffres avec leur unité et leur périmètre : « 5 jours par an pour les salariés à temps plein », pas « 5 jours ».

Étape 4 : employer les mots de vos utilisateurs

Beaucoup de systèmes de recherche, à commencer par la recherche plein texte par mots-clés, s’appuient fortement sur le vocabulaire commun entre la question et le passage. Même les systèmes à base d’embeddings (vecteurs sémantiques) gagnent à ce que le document emploie les termes de la question. Si votre documentation parle de « résiliation du contrat » alors que vos clients demandent « comment me désabonner », la correspondance est plus faible qu’elle ne devrait.

  • Ajoutez les synonymes courants : « résilier (se désabonner) », « arrêt maladie (arrêt de travail) ».
  • Insérez une courte FAQ dans les documents longs, formulée comme les gens posent réellement leurs questions.
  • Inspirez-vous des tickets support : les mots de vos clients dans leurs e-mails sont une mine pour les titres et la FAQ.
  • Expliquez le jargon interne : une définition d’une ligne relie un nom de code maison au terme courant.

Gain rapide

Prenez vos 20 questions les plus fréquentes et cherchez dans vos documents les mots exacts qu’elles emploient. Chaque fois que les termes clés d’une question n’apparaissent nulle part, ajoutez une phrase ou une entrée de FAQ qui les contient.

Étape 5 : soigner tableaux, listes et chiffres

Les tableaux sont parfaits pour un humain et délicats pour l’extraction de texte. Mises en page complexes, cellules fusionnées ou tableaux collés en image peuvent ressortir comme une suite de valeurs sans en-têtes. Quelques réflexes :

  • Des tableaux simples : une seule ligne d’en-tête, pas de cellules fusionnées.
  • Une phrase avant le tableau qui dit ce qu’il contient et à qui il s’applique.
  • Les valeurs essentielles reprises en toutes lettres : « L’offre Pro coûte 20 € par mois. »
  • Pour de gros volumes de données, un CSV aux colonnes explicites est souvent plus fiable qu’un tableau dans un PDF.

Comment vérifier que vos documents sont prêts pour l’IA ?

La préparation n’est terminée qu’une fois testée. Bonne nouvelle : le test est simple et ne demande aucune compétence technique.

  1. Rédigez un jeu de test de 20 à 50 vraies questions, chacune avec la réponse attendue et le document d’où elle doit venir.
  2. Posez chaque question et vérifiez deux choses : la réponse est-elle juste, et la citation renvoie-t-elle au bon passage ?
  3. Classez les échecs : texte non extrait, mauvais document retrouvé, bon document mais passage incomplet, ou réponse tout simplement absente du corpus.
  4. Corrigez les documents : ajout de titres, réécriture en sections autonomes, synonymes, suppression des doublons.
  5. Repassez tout le jeu de test après chaque correction, et à chaque ajout ou mise à jour de document.

Tester la recherche seule est également précieux. Si votre outil peut renvoyer les passages bruts sans réponse rédigée, vous voyez exactement ce que le modèle recevrait, ce qui accélère beaucoup le diagnostic.

Préparer ses documents pour une base Kopik

Tout ce qui précède vaut pour n’importe quel outil RAG. Voici comment cela se traduit concrètement sur Kopik, pour créer une base de connaissances à partir de vos documents en sachant à quoi vous attendre.

  • Formats : PDF avec couche texte, 1 500 pages maximum (les PDF scannés, qui ne contiennent que des images, ne sont pas lisibles : passez-les d’abord à l’OCR), Word (.docx) et formats texte (.txt, .md, .csv, .tsv, .json, .html, .xml), ou texte collé. 4 Mo maximum par fichier et 2 millions de caractères par document ; une base peut contenir jusqu’à 1 000 documents et 20 millions de caractères, et vous pouvez ajouter ou retirer des documents à tout moment.
  • Découpage : le texte est coupé en passages d’environ 1 200 caractères avec un chevauchement d’environ 200 caractères, d’abord sur les paragraphes, puis sur les phrases. Des paragraphes ciblés et des titres clairs paient donc directement.
  • Recherche : Kopik utilise la recherche plein texte de PostgreSQL, pas la recherche vectorielle. Avant la recherche, un petit modèle de langage enrichit chaque question de mots-clés et de synonymes dans la langue des documents, puis les 8 meilleurs passages sont retenus. Cet enrichissement rattrape bien des reformulations, mais la recherche reste lexicale : le vocabulaire de vos utilisateurs compte.
  • Langue du document : chaque base a un réglage de langue du document (français, anglais, allemand, espagnol, italien, portugais, néerlandais, ou Mixte/autre). Il règle la racinisation et les mots vides : choisissez la langue dans laquelle vos documents sont rédigés, pas celle de vos utilisateurs, puisque l’enrichissement des questions fait déjà le pont. Optez pour Mixte/autre si le corpus est multilingue. Changer ce réglage réindexe toute la base, ce qui est possible quelques fois par heure.
  • Tests : les questions que vous posez à vos propres bases sont gratuites (usage raisonnable : 200 par jour), même sur une base privée. Le mode passages renvoie les extraits retrouvés sans réponse rédigée, idéal pour contrôler ce que trouve la recherche. Il est disponible via l’API REST et MCP.
  • Les vraies questions : une fois la base en service, votre tableau de bord affiche le texte des questions posées (jamais l’identité de leur auteur) et signale celles qui n’ont rien trouvé. C’est votre meilleure liste de corrections : ajoutez le document manquant, ou le terme que vos utilisateurs emploient vraiment.

Mettez vos documents au travail

Importez votre corpus nettoyé, posez vos questions de test et voyez quels passages remontent, avec une citation pour chaque réponse.

Un corpus bien préparé, c’est aussi ce qui donne sa valeur à une base publique. Si vous envisagez de partager votre expertise sous forme de base de connaissances, la qualité des documents est votre produit. Parcourez le catalogue des bases publiques pour voir comment d’autres créateurs présentent les leurs.

La check-list du document prêt pour l’IA

  • Le texte est sélectionnable (pas de scan image seul).
  • Une seule version en vigueur par document, datée.
  • Ni doublons ni sources contradictoires.
  • Des titres explicites, proches des questions réelles.
  • Une idée par paragraphe ; règles et exceptions côte à côte.
  • Chaque section compréhensible seule : sujet nommé, pas de pronom orphelin.
  • Synonymes et termes courants à côté du jargon interne.
  • Tableaux simples introduits par une phrase ; valeurs clés reprises dans le texte.
  • Données sensibles retirées.
  • Un jeu de questions test, validé et repassé après chaque mise à jour.

Questions fréquentes

Quel est le meilleur format de fichier pour le RAG ?

Les formats texte propres, comme le Markdown ou un document Word bien structuré, sont généralement les plus fiables, car titres et paragraphes survivent à l’extraction. Les PDF fonctionnent bien s’ils possèdent une vraie couche texte. Un PDF scanné sans OCR ne contient que des images et reste illisible pour un outil fondé sur le texte.

Faut-il réécrire tous ses documents pour l’IA ?

Non. Commencez par les documents qui répondent à vos questions les plus fréquentes et corrigez ce que les tests révèlent : titres manquants, phrases dépendantes du contexte, doublons, versions périmées. Des retouches ciblées sur une petite partie du corpus suffisent souvent à nettement améliorer les réponses.

Quelle longueur de paragraphe pour un corpus RAG ?

Il n’existe pas de chiffre universel, mais des paragraphes centrés sur une seule idée fonctionnent le mieux. Beaucoup de systèmes découpent le texte en passages de quelques centaines à quelques milliers de caractères, en respectant les paragraphes. Des titres clairs et des paragraphes autonomes comptent davantage qu’une longueur précise.

Faut-il garder les anciennes versions des documents ?

En général, pas dans la même base de connaissances. Les anciennes versions concurrencent les actuelles lors de la recherche et peuvent produire des réponses périmées. Si l’historique vous est utile, rangez-le dans une base séparée, avec des dates bien visibles.

Comment savoir si mon corpus est prêt ?

Constituez un jeu de vraies questions avec les réponses et les sources attendues, puis vérifiez à la fois les réponses et les citations. Quand la plupart des questions ramènent le bon passage et que les échecs restants sont compris, le corpus est prêt. Repassez le test à chaque modification des documents.

Recevez la newsletter Kopik

Nouvelles bases de connaissances, guides sur le RAG et nouveautés du produit. Un mail toutes les une à deux semaines, désinscription en un clic.

En vous abonnant, vous acceptez de recevoir notre newsletter. Votre adresse n'est jamais partagée.