Tutoriel

Un ChatGPT privé pour les documents de votre entreprise : ce que « privé » veut vraiment dire

L'équipe Kopik8 min de lecture

Un ChatGPT privé pour vos documents d'entreprise, c'est un assistant qui répond à partir de vos fichiers internes sans que ces fichiers échappent à votre contrôle : ils ne servent pas à entraîner un modèle public, ils ne sont pas conservés plus longtemps que vous ne le décidez, et seules les personnes et applications autorisées peuvent les interroger. On y arrive avec une offre professionnelle d'assistant, une installation sur vos propres serveurs ou une base de connaissances privée que n'importe quel assistant interroge par API ou par MCP. Le bon choix dépend moins de la marque du chatbot que de trois questions : qui peut lire quoi, combien de temps tout est gardé, et d'où viennent les réponses.

« Privé » : cinq promesses différentes derrière un seul mot

Quand un éditeur affirme que vos données « restent privées », la formule peut couvrir des engagements très différents. Avant de déposer le moindre contrat, décomposez le mot :

  • Pas d'entraînement : vos questions et vos fichiers ne servent pas à améliorer un modèle utilisé par d'autres clients.
  • Conservation limitée : conversations, fichiers déposés et journaux sont supprimés au bout d'une durée connue, ou dès que vous les effacez.
  • Contrôle d'accès : seules les personnes et applications que vous autorisez interrogent les documents, et vous pouvez retirer cet accès.
  • Cloisonnement : vos documents ne sont pas mélangés dans un index partagé où la recherche d'un autre client pourrait les faire remonter.
  • Engagement contractuel : ces promesses figurent dans un contrat, en particulier un accord de sous-traitance au sens de l'article 28 du RGPD.

Une solution peut être excellente sur un point et faible sur un autre. Un modèle installé chez vous offre un cloisonnement parfait, mais aucun contrôle d'accès tant que vous ne l'avez pas développé. Une offre professionnelle d'assistant peut exclure vos données de l'entraînement tout en laissant n'importe quel collègue de l'espace de travail ouvrir un fichier partagé. Traitez chaque promesse comme une case distincte.

Conservation des données et RGPD : les questions à poser

C'est sur la conservation que se cachent la plupart des surprises. Les offres grand public et professionnelles d'un même assistant n'ont souvent pas les mêmes réglages par défaut, et ceux-ci évoluent. Nous ne résumons donc pas les conditions d'un éditeur en particulier : vérifiez les conditions de votre offre, par écrit, et gardez-en une copie datée. Les questions utiles :

  1. Les questions, fichiers et réponses servent-ils à l'entraînement par défaut, et un administrateur peut-il le désactiver pour toute l'organisation ?
  2. Combien de temps une conversation est-elle gardée après suppression, et existe-t-il des copies (sauvegardes, surveillance des abus) avec un autre délai ?
  3. Le fichier, le texte extrait et l'index sont-ils tous supprimés quand vous retirez un document ?
  4. Qui, chez le fournisseur, peut accéder à vos contenus, dans quels cas, et ces accès sont-ils tracés ?
  5. Quels sous-traitants interviennent, et des données sortent-elles de l'Union européenne ? Sur quel fondement ?
  6. Pouvez-vous tout exporter puis tout supprimer en fin de contrat ?

Dès que les documents contiennent des données personnelles (dossiers salariés, échanges clients, CV), le RGPD s'applique : base légale, minimisation, durée de conservation, contrat de sous-traitance, et analyse d'impact (AIPD) si le traitement présente un risque élevé. La CNIL publie des recommandations sur l'IA et les données personnelles qui méritent d'être lues avant de choisir. L'AI Act ajoute ses propres obligations selon l'usage, mais un assistant documentaire interne relève rarement des catégories à haut risque. Notre liste de contrôle pour un chatbot conforme au RGPD détaille ces points.

Quatre façons d'interroger vos documents en privé

Les options pour un assistant documentaire privé

OptionPrincipePoints fortsPoints de vigilance
Dépôt de fichiers dans un assistantChacun joint ses PDF à une conversationAucune mise en placeConservation selon l'offre ; copies éparpillées dans les conversations ; pas de référence commune
Offre professionnelle avec espaces partagésAdministration centrale des utilisateurs, fichiers et réglagesConsole d'administration, engagements contractuelsDroits souvent à l'échelle de l'espace entier ; documents liés à un seul assistant
Pile open source sur vos serveursModèle, index et interface tournent chez vousCloisonnement maximalDroits, mises à jour, supervision et qualité des réponses à votre charge
Base de connaissances privée par API ou MCPDocuments indexés une fois ; assistants et applications l'interrogent avec une cléUne seule source de vérité, clés révocables, passages cités, plusieurs assistantsChoisir ce qui entre dans la base, et vérifier le fournisseur comme tout sous-traitant

La quatrième option est la moins connue et souvent la plus pratique. Plutôt que de recopier le même règlement intérieur dans chaque outil de chat, vous gardez les documents dans une couche de recherche privée et laissez les assistants l'interroger. C'est le principe du RAG, suivi pas à pas dans Comment fonctionne le RAG.

Les droits d'accès : l'étape que l'on oublie

Un assistant que tout salarié peut interroger sur tous les documents n'est pas privé à l'intérieur de l'entreprise. Le dossier disciplinaire, le projet de réorganisation ou la grille des salaires ne doivent pas se trouver à une question d'un stagiaire. Quelques règles simples :

  • Découpez par public, pas par thème. Une base commune (règlement, procédures, documentation produit), une base RH, une base juridique, une base finance. Une question ne peut ramener que ce que contient la base interrogée.
  • Une clé par application ou par personne. Si un script, un agent et un collègue partagent la même clé, impossible d'en révoquer un sans couper les autres.
  • Révoquez au départ. Ajoutez clés API et connexions d'assistants à la procédure de sortie, à côté de la messagerie.
  • Minimisez les données personnelles. Le document sensible le plus sûr est celui que vous n'avez pas indexé : anonymisez ou résumez avant le dépôt.
  • Revoyez les accès chaque trimestre. Membres, clés et documents dérivent avec le temps.

Une consigne n'est pas un droit d'accès

Écrire à l'assistant « ne révèle pas les salaires » ne protège rien. Si un document doit rester restreint, placez-le dans une base que seules les clés autorisées peuvent interroger. Ce qui n'est pas dans la base ne peut pas être cité.

Une base privée interrogeable depuis ChatGPT, Claude ou votre code

C'est l'approche de Kopik. Vous créez gratuitement une base en déposant des PDF, Word, textes ou fichiers Markdown ; Kopik extrait le texte, le découpe en passages et l'indexe pour une recherche hybride (plein texte et élargissement sémantique des mots-clés). Une base privée n'est accessible qu'à son propriétaire et à ses clés API ; elle n'apparaît jamais dans le catalogue public.

Vous l'interrogez de trois façons : sur le site, par l'API REST avec une clé, ou par le serveur MCP de Kopik, auquel se connectent des clients MCP comme Claude, Cursor ou ChatGPT (vérifiez ce que votre offre autorise comme connecteurs personnalisés). Chaque réponse s'appuie sur vos documents et cite ses passages numérotés ; vous pouvez aussi demander les passages seuls et laisser votre assistant rédiger. Le Model Context Protocol étant un standard ouvert, la même base sert plusieurs assistants sans être copiée dans chacun.

Pour une seule base, l'adresse est `https://kopik.io/api/mcp?base=<slug>` (affichée sur la page de la base) et la clé passe dans l'en-tête `Authorization: Bearer kpk_…`. Avec Claude Code, par exemple : `claude mcp add --transport http kopik "https://kopik.io/api/mcp?base=<slug>" --header "Authorization: Bearer kpk_…"` (gardez les guillemets autour de l'URL sous zsh).

L'assistant dispose alors de `ask_base` (réponse rédigée avec passages sources) et de `search_base` (passages seuls). Le contenu de la base arrive entre balises `<kopik-untrusted>`, pour que l'assistant le traite comme des données et non comme des consignes : une protection utile si un document contient un texte qui ressemble à un ordre. La configuration complète, Cursor compris, est dans Connecter une base de connaissances aux agents IA avec MCP, et l'intérêt d'avoir votre propre couche de recherche est développé dans Une base de connaissances privée comme RAG pour vos agents IA.

La méthode de déploiement en huit étapes

  1. Recensez les documents sur lesquels on vous pose réellement des questions : procédures, accueil des nouveaux, fiches produits, modèles de contrats.
  2. Classez-les : public, interne, confidentiel, données personnelles, données sensibles.
  3. Choisissez l'option par catégorie. La documentation interne peut aller vite dans une base privée ; les données sensibles exigent un cadre contractuel solide, ou restent dehors.
  4. Lisez les conditions du fournisseur : entraînement, conservation, sous-traitants, transferts, suppression. Notez les réponses avec la date.
  5. Inscrivez le traitement au registre et menez une AIPD si des données personnelles à risque sont concernées.
  6. Créez une base par public et une clé par application, nommée d'après son usage.
  7. Testez avec des questions dont vous connaissez la réponse et vérifiez les passages cités, pas seulement la formulation.
  8. Retirez les versions périmées : deux versions d'une procédure donnent deux réponses.

Créez votre base de connaissances privée

Déposez vos PDF et fichiers Word, gardez la base privée et interrogez-la depuis le site, l'API ou votre client MCP avec vos propres clés.

Questions fréquentes

Peut-on utiliser ChatGPT sur des documents confidentiels d'entreprise ?

Cela dépend de l'offre utilisée et de la nature des documents. Les offres professionnelles proposent en général des réglages plus stricts que les offres grand public, mais les détails (entraînement, conservation, administration) varient et changent : vérifiez les conditions de votre offre par écrit, et confrontez-les à vos engagements de confidentialité et au RGPD.

Faut-il héberger l'IA sur ses propres serveurs pour qu'elle soit privée ?

Pas forcément. L'hébergement interne donne le cloisonnement maximal mais vous rend responsable des mises à jour de sécurité, des droits et de la qualité des réponses. Beaucoup d'entreprises préfèrent un service hébergé avec un contrat clair, des accès stricts et des documents supprimables à tout moment.

Quelle différence entre déposer un fichier dans un chatbot et une base de connaissances privée ?

Un fichier déposé vit dans un assistant, souvent dans une seule conversation. Une base privée est un index central : vous gérez les documents une fois, décidez quelles clés peuvent l'interroger, et tout assistant compatible y accède par API ou MCP.

Le RGPD interdit-il d'indexer des documents contenant des données personnelles ?

Non, mais il impose une base légale, la minimisation, une durée de conservation définie, un contrat avec le sous-traitant et, en cas de risque élevé, une analyse d'impact. Le plus simple reste d'anonymiser ce qui n'a pas besoin d'être nominatif.

Comment empêcher l'assistant de citer un document réservé à la direction ?

Ne comptez pas sur une consigne. Placez ce document dans une base séparée et ne donnez la clé de cette base qu'aux personnes et applications autorisées : l'assistant ne peut pas retrouver ce qui n'est pas dans la base qu'il interroge.

Recevez la newsletter Kopik

Nouvelles bases de connaissances, guides sur le RAG et nouveautés du produit. Un mail toutes les une à deux semaines, désinscription en un clic.

En vous abonnant, vous acceptez de recevoir notre newsletter. Votre adresse n'est jamais partagée.