Anleitung

Privates ChatGPT für Unternehmensdokumente: Was „privat“ wirklich bedeutet

Das Kopik-Team6 Min. Lesezeit

Ein privates ChatGPT für Unternehmensdokumente ist ein Assistent, der aus Ihren internen Unterlagen antwortet, ohne dass diese Unterlagen Ihre Kontrolle verlassen: Sie trainieren kein öffentliches Modell, werden nicht länger gespeichert als von Ihnen festgelegt und sind nur für berechtigte Personen und Anwendungen abfragbar. Umsetzen lässt sich das mit einem Business-Tarif eines Chat-Assistenten, einer selbst betriebenen Lösung oder einer privaten Wissensdatenbank, die jeder Assistent per API oder MCP abfragt. Entscheidend ist weniger die Marke des Chatbots als drei Fragen: Wer darf was lesen, wie lange wird etwas gespeichert, und woher stammen die Antworten?

„Privat“ ist kein Merkmal, sondern ein Bündel von Zusagen

Wenn ein Anbieter verspricht, Ihre Daten blieben privat, kann das sehr Unterschiedliches heißen. Bevor Sie den ersten Vertrag hochladen, lohnt es sich, den Begriff zu zerlegen:

  • Kein Training: Ihre Fragen und Dateien werden nicht genutzt, um ein Modell zu verbessern, das andere Kunden verwenden.
  • Begrenzte Speicherung: Chats, hochgeladene Dateien und Protokolle werden nach einer festgelegten Frist oder auf Ihren Wunsch gelöscht.
  • Zugriffskontrolle: Nur von Ihnen berechtigte Personen und Anwendungen können die Dokumente abfragen, und Sie können Berechtigungen entziehen.
  • Mandantentrennung: Ihre Inhalte landen nicht in einem gemeinsamen Index, aus dem die Suche eines anderen Kunden sie hervorholen könnte.
  • Vertragliche Absicherung: Die Zusagen stehen in einem Vertrag, insbesondere einem Auftragsverarbeitungsvertrag nach Art. 28 DSGVO.

Eine Lösung kann bei einem Punkt stark und beim nächsten schwach sein. Ein selbst gehostetes Modell trennt perfekt, hat aber keine Rechteverwaltung, solange Sie keine bauen. Ein Business-Tarif schließt Ihre Daten womöglich vom Training aus und lässt trotzdem jede Kollegin im Workspace jede geteilte Datei öffnen. Behandeln Sie jede Zusage als eigenes Prüfkriterium.

Speicherdauer und DSGVO: Diese Fragen gehören an jeden Anbieter

Die meisten Überraschungen verstecken sich bei der Speicherung. Private und geschäftliche Tarife desselben Assistenten haben oft unterschiedliche Voreinstellungen, und die ändern sich. Deshalb fassen wir hier keine Anbieterbedingungen zusammen: Prüfen Sie die Bedingungen Ihres eigenen Tarifs schriftlich und bewahren Sie eine datierte Kopie auf. Diese Fragen helfen:

  1. Werden Eingaben, Dateien und Antworten standardmäßig für Training genutzt, und kann ein Admin das für die ganze Organisation abschalten?
  2. Wie lange bleiben gelöschte Chats noch gespeichert, und gibt es Kopien (Backups, Missbrauchskontrolle) mit eigener Frist?
  3. Werden beim Löschen eines Dokuments auch der extrahierte Text und der Suchindex entfernt?
  4. Wer beim Anbieter kann auf Inhalte zugreifen, unter welchen Bedingungen, und wird das protokolliert?
  5. Welche Unterauftragsverarbeiter sind beteiligt, und verlassen Daten die EU? Auf welcher Rechtsgrundlage?
  6. Können Sie zum Vertragsende alles exportieren und anschließend löschen lassen?

Sobald die Dokumente personenbezogene Daten enthalten, etwa Personalakten, Kundenkorrespondenz oder Bewerbungen, greift die DSGVO: Rechtsgrundlage, Datenminimierung, Speicherbegrenzung, Auftragsverarbeitungsvertrag und bei hohem Risiko eine Datenschutz-Folgenabschätzung. Für die technische Seite bietet das Bundesamt für Sicherheit in der Informationstechnik Orientierung zu sicherer IT und KI. Der AI Act bringt je nach Einsatzzweck weitere Pflichten. Unsere Checkliste für einen DSGVO-konformen Chatbot geht die Anforderungen Punkt für Punkt durch.

Den Betriebsrat früh einbinden

Führt ein Unternehmen mit Betriebsrat ein KI-System ein, das Verhalten oder Leistung von Beschäftigten erfassen könnte, etwa über protokollierte Fragen, besteht in der Regel ein Mitbestimmungsrecht nach § 87 Abs. 1 Nr. 6 BetrVG. Eine frühe Betriebsvereinbarung erspart später Verzögerungen.

Vier Wege, intern privat mit Dokumenten zu chatten

Varianten für einen privaten Dokumenten-Assistenten

VarianteFunktionsweiseStärkenGrenzen
Datei-Upload im Chat-AssistentenMitarbeitende hängen PDFs an einzelne UnterhaltungenKein EinrichtungsaufwandSpeicherung je nach Tarif; Kopien verstreut; keine gemeinsame Quelle
Business-Tarif mit geteilten BereichenZentrale Verwaltung von Nutzern, Dateien und EinstellungenAdmin-Konsole, vertragliche ZusagenRechte oft nur auf Workspace-Ebene; Dokumente an einen Assistenten gebunden
Open-Source-Stack im eigenen RechenzentrumModell, Index und Oberfläche laufen bei IhnenMaximale TrennungRechte, Updates, Monitoring und Antwortqualität liegen bei Ihnen
Private Wissensdatenbank per API oder MCPDokumente werden einmal indexiert; Assistenten und Anwendungen fragen per Schlüssel abEine Quelle, widerrufbare Schlüssel, zitierte Passagen, mehrere AssistentenAuswahl der Inhalte bleibt Ihre Aufgabe; Anbieter wie jeden Auftragsverarbeiter prüfen

Die vierte Variante trennt, was Chat-Tools meist vermischen: den Ort der Dokumente und den Assistenten, der antwortet. Die Unterlagen liegen in einer privaten Suchschicht; Claude, Cursor, ChatGPT oder Ihre eigene Anwendung stellen Fragen und erhalten nur die passenden Passagen. Das ist Retrieval-Augmented Generation, an einem Beispiel erklärt in Wie funktioniert RAG?.

Zugriffsrechte: der unterschätzte Teil

Ein Assistent, den jede Mitarbeiterin zu jedem Dokument befragen kann, ist nach innen nicht privat. Die Abmahnung, der Entwurf zur Umstrukturierung und die Gehaltsbänder gehören nicht eine Frage weit vom Praktikanten entfernt. Bewährte Regeln:

  • Nach Zielgruppe trennen, nicht nach Thema. Eine Datenbank für alle (Richtlinien, Prozesse, Produktdoku), je eine für Personal, Recht und Finanzen. Eine Abfrage findet nur, was in der jeweiligen Datenbank steht.
  • Ein Schlüssel pro Person oder Anwendung. Teilen sich Skript, Agent und Kollege einen Schlüssel, lässt sich keiner einzeln sperren.
  • Beim Austritt widerrufen. API-Schlüssel und Assistenten-Verbindungen gehören auf die Offboarding-Liste, neben E-Mail und VPN.
  • Personenbezug vermeiden. Was nicht indexiert ist, kann nicht durchsickern: anonymisieren oder zusammenfassen, bevor Sie hochladen.
  • Regelmäßig prüfen. Ein Quartalsrhythmus passt für die meisten Mittelständler.

Private Wissensdatenbank mit Kopik: abfragbar aus ChatGPT, Claude oder eigenem Code

Kopik setzt genau dieses Muster um. Sie laden PDF-, Word-, Text- oder Markdown-Dateien hoch; Kopik extrahiert den Text, zerlegt ihn in Passagen und indexiert ihn für eine hybride Suche (Volltext plus semantische Erweiterung der Suchbegriffe). Eine private Datenbank ist nur für ihren Eigentümer und dessen API-Schlüssel zugänglich und erscheint nie im öffentlichen Katalog.

Abgefragt wird sie auf der Website, über die REST-API oder über den MCP-Server von Kopik, mit dem sich MCP-Clients wie Claude, Cursor oder ChatGPT verbinden (prüfen Sie, welche eigenen Konnektoren Ihr Tarif erlaubt). Jede Antwort stützt sich auf Ihre Dokumente und nennt nummerierte Quellpassagen; alternativ erhalten Sie nur die Passagen und lassen Ihren Assistenten formulieren. Wie das offene Model Context Protocol funktioniert, erklärt unser Beitrag MCP erklärt.

Für eine einzelne Datenbank lautet die Adresse `https://kopik.fr/api/mcp?base=<slug>` (auf der Seite der Datenbank angezeigt), der Schlüssel steht im Header `Authorization: Bearer kpk_…`. In Cursor, in der Datei `.cursor/mcp.json`: `{ "mcpServers": { "kopik": { "url": "https://kopik.fr/api/mcp?base=<slug>", "headers": { "Authorization": "Bearer kpk_…" } } } }`

Der Assistent erhält dann `ask_base` (ausformulierte Antwort mit Quellen) und `search_base` (nur Passagen). Inhalte der Datenbank kommen in `<kopik-untrusted>`-Tags an, damit der Assistent sie als Daten und nicht als Anweisungen behandelt: ein sinnvoller Schutz, falls ein Dokument Text enthält, der wie ein Befehl aussieht. Wenn Sie vor allem mit Claude arbeiten, vergleicht Claude Zugriff auf Unternehmensdokumente geben diesen Weg mit den Alternativen.

Einführung in acht Schritten

  1. Bestand aufnehmen: Zu welchen Dokumenten werden tatsächlich Fragen gestellt? Richtlinien, Einarbeitung, Produktdaten, Vertragsvorlagen.
  2. Klassifizieren: öffentlich, intern, vertraulich, personenbezogen, besonders schutzwürdig.
  3. Variante je Klasse wählen: Interne Doku kann schnell in eine private Datenbank; besonders schutzwürdige Daten brauchen einen belastbaren Vertragsrahmen oder bleiben draußen.
  4. Anbieterbedingungen lesen: Training, Speicherung, Unterauftragnehmer, Drittlandtransfer, Löschung. Antworten mit Datum festhalten.
  5. Verzeichnis der Verarbeitungstätigkeiten ergänzen, bei Bedarf Datenschutz-Folgenabschätzung und Betriebsrat einbinden.
  6. Datenbanken nach Zielgruppe, Schlüssel nach Anwendung anlegen, mit sprechenden Namen.
  7. Mit bekannten Antworten testen und die zitierten Passagen prüfen, nicht nur die Formulierung.
  8. Veraltete Fassungen entfernen: Zwei Versionen einer Richtlinie ergeben zwei Antworten.

Private Wissensdatenbank anlegen

Laden Sie PDFs und Word-Dateien hoch, halten Sie die Datenbank privat und fragen Sie sie über die Website, die API oder Ihren MCP-Client mit eigenen Schlüsseln ab.

Häufige Fragen

Darf man ChatGPT im Unternehmen mit vertraulichen Dokumenten nutzen?

Das hängt vom genutzten Tarif und von den Dokumenten ab. Geschäftliche Tarife bieten meist strengere Einstellungen als private, die Details zu Training, Speicherung und Verwaltung unterscheiden sich aber und ändern sich. Prüfen Sie die Bedingungen Ihres Tarifs schriftlich und gleichen Sie sie mit DSGVO und Vertraulichkeitspflichten ab.

Muss eine private KI on-premise laufen?

Nicht zwingend. Eigener Betrieb bietet maximale Trennung, macht Sie aber für Sicherheitsupdates, Rechte und Antwortqualität verantwortlich. Viele Mittelständler setzen auf einen gehosteten Dienst mit klarem Vertrag, strikter Zugriffskontrolle und jederzeit löschbaren Dokumenten.

Was unterscheidet einen Datei-Upload im Chatbot von einer privaten Wissensdatenbank?

Ein hochgeladenes Dokument lebt in einem Assistenten, oft in einer einzigen Unterhaltung. Eine private Wissensdatenbank ist ein zentraler Index: Sie pflegen die Dokumente einmal, bestimmen, welche Schlüssel abfragen dürfen, und jeder kompatible Assistent greift per API oder MCP darauf zu.

Braucht ein interner KI-Assistent eine Datenschutz-Folgenabschätzung?

Nur wenn die Verarbeitung voraussichtlich ein hohes Risiko für Betroffene birgt, etwa bei umfangreichen Personal- oder Gesundheitsdaten. Für reine Prozess- und Produktdokumentation ohne Personenbezug ist sie in der Regel nicht erforderlich; dokumentieren Sie die Abwägung trotzdem.

Wie verhindere ich, dass der Assistent Vorstandsunterlagen zitiert?

Nicht per Anweisung im Prompt. Legen Sie solche Unterlagen in eine eigene Datenbank und geben Sie deren Schlüssel nur berechtigten Personen und Anwendungen. Was nicht in der abgefragten Datenbank liegt, kann der Assistent nicht finden.

Den Kopik-Newsletter abonnieren

Neue Wissensdatenbanken, RAG-Leitfäden und Produktneuheiten. Eine E-Mail alle ein bis zwei Wochen, Abmeldung mit einem Klick.

Mit dem Abonnement stimmen Sie dem Erhalt unseres Newsletters zu. Ihre Adresse wird nie weitergegeben.