Intégrations

Une base de connaissances privée comme RAG pour vos agents IA, sans infrastructure

L'équipe Kopik10 min de lecture

Tôt ou tard, tout agent IA sérieux bute sur le même obstacle : il lui faut des informations qui n’existent que dans vos documents. Vos procédures, vos cahiers des charges, vos grilles tarifaires, vos notes. La réponse habituelle consiste à monter une chaîne RAG, et le chantier devient vite un projet à part entière. Ce guide propose un raccourci : rangez vos documents dans une base de connaissances privée sur Kopik et branchez-la à vos agents via l’API REST ou MCP. Pas de base de données à provisionner, pas de pipeline d’ingestion à faire tourner, pas de serveur à héberger, et vos propres questions sont gratuites.

Pourquoi un agent a besoin d’une recherche ancrée dans vos sources

Un modèle de langage répond à partir de ce qu’il a appris à l’entraînement et de ce qui figure dans sa fenêtre de contexte. Interrogez-le sur votre politique de remboursement interne : au mieux il avouera ne pas savoir, au pire il inventera une réponse plausible. Le RAG (génération augmentée par la recherche) corrige ce travers en allant chercher, au moment de la question, des extraits pertinents dans un corpus de confiance pour les fournir au modèle. Si la notion est nouvelle pour vous, commencez par qu’est-ce que le RAG.

Pour un agent, l’enjeu est plus fort encore : il enchaîne les étapes : il vérifie une règle, rédige un e-mail, met à jour un ticket. Une seule information inventée en début de chaîne contamine toute la suite. Lui donner un outil de recherche qu’il appelle de lui-même, avec des citations qu’il peut transmettre, c’est ce qui sépare une démo séduisante d’un outil à qui l’on confie du vrai travail.

Construire ou déléguer : ce qu’implique vraiment une chaîne RAG

Monter son propre backend RAG est un excellent exercice. L’exploiter en production, c’est une autre histoire. Voici ce qu’il faut généralement assembler et maintenir en vie, face à ce qu’une base privée Kopik prend en charge pour vous.

Les briques d’un backend RAG

BriqueSi vous la construisezAvec une base privée Kopik
Extraction du texteLire PDF, Word, HTML, CSV…Déposer le fichier ou coller le texte
DécoupageChoisir tailles et chevauchements, gérer les cas limitesPassages d’environ 1 200 caractères, avec chevauchement
IndexFaire tourner une base vectorielle ou un moteur de rechercheRecherche plein texte, gérée pour vous
Pipeline d’ingestionDes tâches pour retraiter les fichiers modifiésIndexation immédiate à l’envoi
Couche de requêteReformuler, classer, renvoyer les passagesExpansion de la question par un petit modèle, 8 meilleurs passages
Génération de la réponsePrompts, citations, refus quand rien n’est trouvéMode réponse intégré avec citations numérotées
AccèsAuthentification, clés API, serveur MCPAPI REST et MCP avec votre clé API
ExploitationHébergement, supervision, sauvegardes, mises à jourRien à faire tourner

La plupart des tutoriels partent sur une base vectorielle et des embeddings : c’est une technique valable parmi d’autres, et nous comparons les options dans le fonctionnement d’un pipeline RAG. Kopik a fait un autre choix, décrit plus bas. Pour beaucoup d’équipes, la recherche documentaire relève de la plomberie : autant que quelqu’un d’autre l’entretienne.

Comment fonctionne une base privée Kopik

Kopik est la bibliothèque de bases de connaissances expertes pour l’IA, mais chaque base commence par être la vôtre, et c’est vous qui choisissez sa visibilité : publique, non listée ou privée. Une base privée n’est visible que par son propriétaire. Concrètement, c’est votre propre backend RAG.

Ce que vous pouvez y mettre

  • Formats : PDF avec couche texte (jusqu’à 1 500 pages), Word .docx, TXT, Markdown, CSV, TSV, JSON, HTML et XML, ou du texte collé.
  • Par fichier : 4 Mo au maximum et 2 millions de caractères par document.
  • Par base : jusqu’à 1 000 documents et 20 millions de caractères. Un compte peut contenir 20 bases.
  • Croissance : chaque envoi est découpé en passages et indexé aussitôt ; la base s’enrichit à chaque nouveau document.

Comment se fait la recherche

Chaque base possède une langue des documents : anglais, français, allemand, espagnol, italien, portugais, néerlandais, ou mixte/autre. Elle règle la recherche plein texte (racinisation, mots vides) : choisissez donc la langue dans laquelle vos documents sont rédigés. La modifier après coup réindexe la base, ce qui n’est possible que quelques fois par heure.

À l’arrivée d’une question, un petit modèle de langage commence par la décliner en mots-clés et en synonymes dans la langue des documents. C’est ce qui permet à une question posée en anglais de trouver des passages dans une base en français. Kopik lance ensuite une recherche plein texte PostgreSQL et retient les 8 passages les plus pertinents. Ni base vectorielle ni embeddings. En mode réponse, un modèle de langage rédige la réponse à partir de ces seuls passages, avec des citations numérotées du type [1] et [2]. Si la base ne contient pas la réponse, il le dit au lieu de deviner.

Vos propres questions sont gratuites

En tant que propriétaire, vous interrogez vos bases gratuitement depuis le site, l’API REST et MCP, dans la limite d’un usage raisonnable de 200 questions par jour. Vos questions ne comptent pas non plus dans le classement du catalogue.

Mode passages ou mode réponse ?

Le point d’accès de requête renvoie l’un ou l’autre. Pour un agent qui dispose déjà de son modèle et de ses consignes, le mode passages est souvent le plus adapté : vous récupérez les extraits bruts et les confiez à votre modèle, qui garde la main sur le ton, le format et le raisonnement. Le mode réponse est le raccourci quand vous voulez simplement une réponse rédigée et sourcée.

passagesanswer
Ce que vous obtenezLes extraits les plus pertinentsUne réponse rédigée avec citations numérotées
Qui rédige le texte finalVotre modèleKopik
Idéal pourLes agents qui croisent plusieurs sources ou suivent un format strictLes scripts, les bots simples, les vérifications rapides
Quand rien ne correspondVotre agent décide de la suiteLa réponse indique que la base ne couvre pas le sujet

Interroger votre base privée avec l’API REST

Créez une clé API depuis votre tableau de bord. Elle commence par kpk_ et s’envoie comme jeton Bearer. Envoyez ensuite une requête POST au point d’accès de votre base, identifiée par son slug :

Exemple de requête

curl -X POST https://kopik.io/api/v1/bases/ma-base/query -H "Authorization: Bearer kpk_…" -H "Content-Type: application/json" -d '{"question": "Quel est notre délai de remboursement pour les abonnements annuels ?", "mode": "passages"}'

Le corps de la requête contient une question et un mode (answer ou passages). La réponse inclut aussi costCents (nul pour votre propre base) et balanceCents. Les erreurs sont renvoyées sous la forme {error, code}, avec des codes comme api_key_invalid, base_not_found, base_empty ou rate_limited : votre agent peut réagir en conséquence. L’en-tête x-kopik-locale (en ou fr) fixe la langue des messages d’erreur. La référence complète se trouve dans la documentation développeurs.

Brancher la base à vos agents via MCP

Si votre agent tourne dans un client MCP, inutile même d’écrire l’appel HTTP. Kopik expose un serveur MCP en Streamable HTTP, et chaque base a sa propre URL : https://kopik.io/api/mcp?base=ma-base. Ce point d’accès fournit deux outils déjà ciblés sur la base : search_base, qui renvoie des passages, et ask_base, qui renvoie une réponse sourcée. L’authentification passe par le même en-tête : Authorization: Bearer kpk_…

Dans Claude Code, une seule commande suffit. Gardez l’URL entre guillemets, sinon des shells comme zsh tentent d’interpréter le point d’interrogation : claude mcp add --transport http kopik-ma-base "https://kopik.io/api/mcp?base=ma-base" --header "Authorization: Bearer kpk_…"

Cursor et la plupart des autres clients MCP lisent une configuration JSON qui reprend les deux mêmes informations, l’URL et l’en-tête : {"mcpServers": {"kopik-ma-base": {"url": "https://kopik.io/api/mcp?base=ma-base", "headers": {"Authorization": "Bearer kpk_…"}}}}. Claude, Cursor, ChatGPT ou un agent maison : la base se comporte partout de la même façon. Pour approfondir le protocole, lisez connecter une base de connaissances via MCP.

Donnez une mémoire à vos agents en cinq minutes

Créez une base privée, déposez vos documents et interrogez-la depuis vos agents en REST ou en MCP. Gratuit pour vos propres questions.

Sécurité : ce qui reste privé

  • Accès réservé au propriétaire. Une base privée ne peut être interrogée que par son propriétaire, sur tous les canaux.
  • Clés API hachées. Les clés sont stockées sous forme hachée et affichées une seule fois, à leur création. Rangez-les dans des variables d’environnement ou un gestionnaire de secrets, et révoquez toute clé compromise.
  • Usage cantonné de vos documents. Vos documents ne servent qu’à répondre aux questions posées à cette base.
  • Protection contre l’injection de prompt. Via MCP, le contenu issu d’une base est encadré par des balises <kopik-untrusted>, accompagnées d’une note demandant à l’agent de le traiter comme une donnée, jamais comme une instruction. Précieux dès que vos documents contiennent des textes de tiers (e-mails, contrats fournisseurs).

Les limites à prévoir dans votre conception

Les limites de Kopik pour les concepteurs d’agents

LimiteValeur
Questions par utilisateur20 par minute, 1 000 par jour
Questions gratuites du propriétaire200 par jour (usage raisonnable)
Limite atteinteHTTP 429, code rate_limited (avec Retry-After quand la limite par IP est atteinte)
Lots MCP10 requêtes au maximum
Bases par compte20
Documents par base1 000, et 20 millions de caractères
Envois de documents120 par heure

Pour un agent qui tourne en boucle : patientez avant de réessayer (en respectant Retry-After s’il est présent), mettez en cache les réponses aux questions récurrentes, et préférez une question précise à dix questions vagues.

Les limites, en toute transparence

  • La recherche repose sur les mots. L’expansion ajoute des synonymes, mais la recherche reste lexicale. Des documents au vocabulaire clair et explicite, bien titrés, remontent mieux. Notre guide pour préparer vos documents pour l’IA explique comment faire.
  • La langue des documents compte. Une base réglée sur la mauvaise langue perd en qualité de racinisation et de filtrage des mots vides. Ne choisissez mixte/autre que si votre corpus mélange réellement plusieurs langues.
  • Les PDF scannés sont illisibles. Un PDF composé d’images n’a pas de couche texte. Passez-le d’abord par un OCR, ou exportez le document source.
  • Les réponses peuvent être fausses. Les citations permettent à vous ou à votre agent de vérifier la source, et rien de ce que renvoie Kopik ne constitue un conseil juridique, médical ou financier. Gardez un humain dans la boucle pour les décisions importantes.

Plus tard : ouvrir la base aux autres

Certaines bases privées se révèlent utiles à d’autres : un corpus réglementaire bien tenu, une méthode, une documentation technique de référence. Vous pouvez à tout moment passer une base en non listée (accessible uniquement par lien, avec un long identifiant aléatoire) ou en publique (visible dans le catalogue). Les abonnés peuvent alors l’interroger dans le chat du site, et les agents des autres via l’API et MCP, au prix par requête que vous fixez. Vous percevez une part fixe sur chaque question d’abonné posée à votre base et 70 % de chaque requête API ou MCP payante. Vos propres questions restent gratuites.

Les agents des autres peuvent eux aussi appeler votre base sans risque : le paramètre facultatif maxPriceCents leur permet de fixer un plafond de prix, et si la base coûte plus cher, l’appel est refusé avec le code price_above_max, sans rien débiter. La page publique n’affiche que le nom des documents, jamais leur contenu intégral. La rémunération des créateurs est détaillée dans partager son expertise sous forme de base de connaissances, et la construction dans créer une base de connaissances à partir de vos documents.

Consultez la référence API et MCP

Points d’accès, codes d’erreur, outils MCP et exemples de configuration pour chaque client.

Questions fréquentes

Puis-je utiliser une base Kopik privée comme backend RAG pour mon propre agent IA ?

Oui. Une base privée n’est visible que par vous, et vous pouvez l’interroger depuis le site, l’API REST et MCP avec votre propre clé API. Utilisez le mode passages pour confier les extraits à votre modèle, ou le mode réponse pour obtenir une réponse rédigée et sourcée.

Interroger ma propre base est-il vraiment gratuit ?

Oui. Les questions posées à vos propres bases sont gratuites sur tous les canaux, dans la limite d’un usage raisonnable de 200 questions par jour. Les limites générales de 20 questions par minute et 1 000 par jour s’appliquent toujours.

Kopik utilise-t-il une base vectorielle ou des embeddings ?

Non. Kopik s’appuie sur la recherche plein texte de PostgreSQL, réglée sur la langue des documents. Avant la recherche, un petit modèle de langage décline la question en mots-clés et synonymes, puis les 8 passages les plus pertinents sont retenus.

Quels clients IA peuvent se connecter à ma base via MCP ?

Tout client qui prend en charge les serveurs MCP distants en HTTP avec un en-tête personnalisé : Claude, Cursor, ChatGPT ou un agent construit avec un SDK MCP, par exemple. Il suffit de lui fournir l’URL de la base et un en-tête Authorization contenant votre clé API.

Que se passe-t-il si mes documents sont des PDF scannés ?

Un PDF scanné est une image sans couche texte : Kopik ne peut pas le lire. Passez-le d’abord par un OCR, ou déposez la version Word ou texte d’origine.

Puis-je rendre ma base privée publique plus tard ?

Oui. Vous pouvez la passer en non listée ou en publique à tout moment et fixer un prix par requête pour les appels API et MCP. Vous percevez alors une part fixe sur chaque question d’abonné posée dans le chat du site et 70 % de chaque requête API ou MCP payante. Vos propres questions restent gratuites.

Recevez la newsletter Kopik

Nouvelles bases de connaissances, guides sur le RAG et nouveautés du produit. Un mail toutes les une à deux semaines, désinscription en un clic.

En vous abonnant, vous acceptez de recevoir notre newsletter. Votre adresse n'est jamais partagée.