RAG ou fine-tuning : que choisir pour vos documents métier ?
Vous disposez d’un stock de documents métier (procédures, contrats, manuels produits, notes d’expertise) et vous voulez une IA capable d’y répondre. Deux techniques reviennent immédiatement : la génération augmentée par récupération et le fine-tuning. Le choix RAG ou fine-tuning est souvent présenté comme un match, alors que les deux approches ne modifient pas la même chose. Le RAG change ce que le modèle voit au moment de répondre. Le fine-tuning change la façon dont le modèle se comporte. Une fois cette distinction posée, le choix devient évident pour la plupart des projets documentaires.
Deux approches, deux missions différentes
Le RAG (retrieval-augmented generation) ne touche pas au modèle. Vos documents sont découpés en passages et indexés. Quand une question arrive, les passages les plus pertinents sont retrouvés et insérés dans le prompt, puis le modèle rédige sa réponse à partir d’eux, idéalement en les citant. Si la notion est nouvelle pour vous, commencez par notre guide qu’est-ce que le RAG.
Le fine-tuning (ou « affinage ») modifie le modèle lui-même. On part d’un modèle pré-entraîné et on poursuit son entraînement sur un jeu d’exemples, généralement des couples entrée / réponse idéale. Les poids internes du modèle évoluent pour reproduire les régularités de ces exemples : un ton, un format, une grille de classement, une manière de traiter une tâche précise.
La règle à retenir
Le RAG apporte au modèle des connaissances au moment où il répond. Le fine-tuning lui donne des habitudes qu’il garde définitivement. Pour des faits consignés dans des documents, c’est de connaissances que vous avez besoin, pas d’habitudes.
Comment fonctionne le RAG sur des documents d’entreprise
Un système RAG fonctionne en deux temps. À la mise en place, le texte de chaque document est extrait, découpé en passages qui se chevauchent, puis rangé dans un index de recherche (plein texte, vectoriel ou les deux). À chaque question, le système interroge l’index, sélectionne les meilleurs passages et demande au modèle de répondre uniquement à partir d’eux. Le découpage et la recherche sont détaillés dans le pipeline RAG : chunking, indexation et recherche.
Trois propriétés découlent directement de ce fonctionnement :
- Des mises à jour immédiates. Remplacez un PDF, la réponse suivante utilise la nouvelle version. Aucun réentraînement.
- Des réponses traçables. Le modèle travaille sur des passages précis : il peut les citer, et le lecteur peut vérifier.
- Un accès maîtrisé. Vous décidez quels documents entrent dans une base, et qui peut l’interroger.
Comment fonctionne le fine-tuning, et à quoi il sert vraiment
Le fine-tuning exige un jeu de données d’entraînement, en général des centaines voire des milliers d’exemples soigneusement rédigés. Les documents bruts ne suffisent pas : il faut les transformer en paires question / réponse ou en démonstrations de la tâche attendue. On lance ensuite l’entraînement, on évalue le modèle obtenu, puis on le déploie. Et à chaque évolution des connaissances, on recommence.
Là où le fine-tuning est réellement pertinent :
- Un format de sortie constant. Toujours produire le même schéma JSON, le même modèle de compte rendu ou la même structure de courrier.
- Un ton et une voix. Écrire comme votre marque, ou dans le registre d’une profession.
- Des tâches étroites et répétitives. Classer des tickets, extraire des champs, étiqueter des documents, à gros volume.
- Des modèles plus petits et moins chers. Apprendre à un petit modèle à faire une tâche aussi bien qu’un grand modèle généraliste, pour réduire coût ou latence.
Remarquez ce qui manque à cette liste : restituer fidèlement des faits précis. Un modèle peut retenir certaines informations par fine-tuning, mais le rappel reste approximatif, la source est perdue, et le modèle peut mélanger ce qu’il a appris avec ce qu’il croyait déjà. C’est précisément le défaut à éviter face à un contrat, un article du Code du travail ou une convention collective.
RAG ou fine-tuning : le comparatif
RAG et fine-tuning en un coup d’œil
| Critère | RAG | Fine-tuning |
|---|---|---|
| Ce qui change | Ce que le modèle voit | Le comportement du modèle |
| Matière première | Vos documents tels quels | Un jeu de données construit |
| Mise à jour | Ajouter ou retirer un fichier | Refaire le jeu, réentraîner |
| Citation des sources | Oui | Non |
| Risque d’invention | Plus faible, vérifiable | Plus élevé, difficile à repérer |
| Effort initial | Faible | Élevé |
| Point fort | Faits, références, questions-réponses | Style, format, tâches ciblées |
Coût et effort
Les coûts du RAG tiennent à l’indexation (peu chère, une fois par document) et à un prompt un peu plus long à chaque question, puisqu’il inclut les passages retrouvés. Le coût du fine-tuning est surtout humain : constituer et maintenir un jeu de données de qualité, évaluer chaque nouvelle version, lancer les entraînements. Pour une base documentaire qui évolue tous les mois, c’est généralement ce réentraînement récurrent qui disqualifie le fine-tuning.
Fraîcheur et gouvernance des données
Avec le RAG, supprimer un document retire son contenu des réponses suivantes. Avec le fine-tuning, une connaissance intégrée aux poids ne peut pas être retirée chirurgicalement : il faut réentraîner à partir d’un jeu nettoyé. Si vos documents sont soumis à des versions successives, à la confidentialité ou au RGPD, cette différence pèse lourd.
Quand choisir le RAG ?
Optez pour le RAG si la plupart de ces affirmations sont vraies :
- Les réponses se trouvent dans des documents que vous possédez déjà.
- Le contenu évolue : nouvelles versions, nouveaux textes, nouveaux produits.
- Les utilisateurs doivent voir d’où vient la réponse.
- Une erreur a des conséquences (juridiques, RH, financières, de sécurité).
- Vous voulez démarrer cette semaine, pas après un chantier d’annotation de données.
C’est le cas de l’immense majorité des projets de savoir interne, de support et d’expertise, et de presque tous les domaines réglementés. Pour des exemples concrets, voir le RAG pour le juridique, les RH et la conformité.
Quand le fine-tuning vaut-il l’investissement ?
Le fine-tuning se justifie quand le problème relève du comportement plutôt que du savoir :
- Le prompt seul ne suffit pas à obtenir un format ou un ton assez constant.
- La tâche est étroite, stable et à très gros volume.
- Vous avez besoin d’un petit modèle pour des raisons de coût, de rapidité ou d’hébergement sur site.
- Vous disposez, ou pouvez constituer, un jeu d’exemples propre et fiable.
Commencez par le prompt
Avant de fine-tuner pour un format ou un ton, rédigez des consignes claires et quelques exemples dans le prompt. Les modèles actuels les suivent bien, et vous itérez en quelques minutes au lieu d’enchaîner les entraînements.
Peut-on combiner RAG et fine-tuning ?
Oui, et la combinaison suit la même logique : fine-tuning pour le comportement, RAG pour le savoir. Un modèle affiné peut toujours répondre dans le style de la maison ou produire une structure de rapport fixe, tandis que le RAG lui fournit les faits issus des documents à jour au moment de la question. En pratique, la plupart des équipes constatent qu’un bon modèle généraliste associé au RAG et à des consignes soignées couvre leurs besoins, et n’ajoutent le fine-tuning que plus tard, pour un manque précis et mesuré.
Quelle approche pour quel besoin
| Besoin | Approche conseillée |
|---|---|
| Répondre sur la politique RH interne | RAG |
| Assistant sur la documentation produit | RAG |
| Toujours produire un schéma JSON fixe | Prompt, puis fine-tuning |
| Écrire avec une voix de marque marquée | Prompt, puis fine-tuning |
| Réponses sourcées dans le style maison | RAG + fine-tuning |
Les idées reçues sur le RAG et le fine-tuning
- « Le fine-tuning va faire du modèle un expert de nos documents. » Il lui donne surtout l’air d’un expert. Sans recherche documentaire, il répond toujours de mémoire, une mémoire un peu différente, et ne peut pas montrer ses sources.
- « Le RAG, c’est juste un moteur de recherche avec un chatbot. » La recherche en est le socle, mais le modèle fait un vrai travail : croiser plusieurs passages, les appliquer à la question posée et signaler quand les sources ne couvrent pas le sujet.
- « Notre vocabulaire est trop technique, il faut fine-tuner. » Un jargon précis est souvent un atout pour le RAG, car la recherche plein texte retrouve très bien les termes exacts. La reformulation de la question gère les synonymes et les sigles.
- « Avec des fenêtres de contexte géantes, le RAG ne sert plus à rien. » Tout coller dans le prompt fonctionne pour quelques documents, mais devient lent et coûteux quand le corpus grossit, et les modèles peuvent négliger des détails noyés dans un texte très long. La recherche garde le prompt ciblé.
À retenir : partez du problème, pas de la technique. Si les réponses sont fausses parce que le modèle manque d’information, améliorez la recherche et les documents. Si elles sont justes mais mal présentées, travaillez les consignes, et seulement ensuite envisagez le fine-tuning.
Passer au RAG sur vos propres documents
Comme le RAG fonctionne avec vos documents tels qu’ils sont, le plus rapide est de créer une petite base et de la tester avec de vraies questions :
- Choisissez un périmètre ciblé (par exemple votre politique RH) plutôt que tout d’un coup.
- Vérifiez que les documents sont textuels et à jour ; supprimez doublons et anciennes versions.
- Déposez-les dans un outil ou un pipeline RAG.
- Posez 20 à 30 questions réelles et confrontez chaque réponse à sa source citée.
- Corrigez les documents là où les réponses sont faibles. Notre guide pour préparer vos documents pour l’IA liste les points à vérifier.
Sur Kopik, cette boucle prend quelques minutes. Vous déposez des PDF (avec couche texte), des fichiers Word ou des formats texte, et la base se construit automatiquement : les passages sont indexés en recherche plein texte adaptée à la langue des documents, la question est reformulée en mots-clés et synonymes dans cette langue, les passages les plus pertinents sont retrouvés et un modèle de langage répond à partir d’eux avec des citations numérotées, ou signale que la base ne contient pas la réponse. Vous pouvez garder la base privée, la partager par lien ou la publier dans le catalogue public, puis l’interroger depuis le web, une API REST ou des agents IA via MCP (voir la documentation développeurs). Interroger votre propre base privée est gratuit : elle fait aussi office de RAG privé pour vos agents. Le pas-à-pas complet est dans créer une base de connaissances à partir de vos documents.
Testez le RAG sur vos documents
Pas de jeu de données, pas d’entraînement : déposez vos fichiers et posez votre première question sourcée en quelques minutes.
Questions fréquentes
Quelle est la différence principale entre RAG et fine-tuning ?
Le RAG donne au modèle accès aux documents pertinents au moment où il répond, sans modifier le modèle. Le fine-tuning réentraîne le modèle sur des exemples pour changer durablement son comportement. Le RAG est adapté aux connaissances et aux faits ; le fine-tuning au style, au format et aux tâches ciblées.
Le fine-tuning permet-il d’apprendre les documents de mon entreprise à une IA ?
En partie, mais pas de façon fiable. Un modèle affiné peut retenir certains faits, mais le rappel reste approximatif, il ne peut pas indiquer d’où vient l’information et chaque mise à jour impose un réentraînement. Pour répondre à partir de documents, le RAG est plus précis, traçable et simple à maintenir.
Le RAG coûte-t-il moins cher que le fine-tuning ?
Dans la plupart des cas, oui. Le RAG ne demande ni jeu de données ni entraînement : les coûts se limitent à l’indexation des documents et à des prompts un peu plus longs. Le fine-tuning suppose de constituer et maintenir un jeu d’exemples et de réentraîner à chaque évolution, ce qui représente surtout du temps humain.
Peut-on utiliser RAG et fine-tuning ensemble ?
Oui. Un schéma courant consiste à affiner un modèle pour le ton ou le format de sortie, et à utiliser le RAG pour lui fournir les faits à jour issus des documents. La plupart des équipes commencent par le RAG avec un bon modèle généraliste, et n’ajoutent le fine-tuning que si un comportement précis reste hors d’atteinte avec le prompt.
Quelle approche pour des documents sensibles ou réglementés ?
Le RAG est généralement mieux adapté. Vous maîtrisez précisément les documents inclus, pouvez en retirer un à tout moment, et chaque réponse est rattachée à son passage source. Une connaissance intégrée aux poids d’un modèle affiné ne peut pas être supprimée ni auditée de la même manière, ce qui complique la conformité, notamment au RGPD.
Recevez la newsletter Kopik
Nouvelles bases de connaissances, guides sur le RAG et nouveautés du produit. Un mail toutes les une à deux semaines, désinscription en un clic.
En vous abonnant, vous acceptez de recevoir notre newsletter. Votre adresse n'est jamais partagée.