Tutorial

Un ChatGPT privado para los documentos de su empresa: qué significa realmente «privado»

El equipo de Kopik8 min de lectura

Un ChatGPT privado para los documentos de su empresa es un asistente que responde a partir de sus archivos internos sin que esos archivos se le escapen: no se usan para entrenar modelos públicos, no se conservan más tiempo del que usted decida y solo los consultan las personas y aplicaciones autorizadas. Se puede conseguir con un plan profesional de un asistente, con una instalación en sus propios servidores o con una base de conocimiento privada que cualquier asistente consulta por API o por MCP. La elección depende menos de la marca del chatbot que de tres preguntas: quién puede leer qué, cuánto tiempo se guarda todo y de dónde salen las respuestas.

«Privado»: cinco compromisos distintos bajo una sola palabra

Cuando un proveedor asegura que sus datos «son privados», la frase puede significar cosas muy diferentes. Antes de subir un solo contrato, conviene desglosarla:

  • Sin entrenamiento: sus preguntas y archivos no sirven para mejorar un modelo que usan otros clientes.
  • Conservación limitada: conversaciones, archivos subidos y registros se borran en un plazo conocido o cuando usted los elimina.
  • Control de acceso: solo las personas y aplicaciones autorizadas consultan los documentos, y usted puede retirar ese acceso.
  • Aislamiento: sus documentos no se mezclan en un índice compartido donde la búsqueda de otro cliente pudiera encontrarlos.
  • Compromiso por contrato: todo lo anterior figura por escrito, en particular en un contrato de encargo del tratamiento conforme al artículo 28 del RGPD.

Una solución puede ser excelente en un punto y floja en otro. Un modelo instalado en sus servidores aísla a la perfección, pero no tiene permisos hasta que usted los programe. Un plan profesional puede excluir sus datos del entrenamiento y aun así dejar que cualquier compañero del espacio de trabajo abra un archivo compartido. Trate cada compromiso como una casilla independiente.

Conservación de datos y RGPD: preguntas para cualquier proveedor

Las sorpresas suelen esconderse en la conservación. Los planes personales y profesionales de un mismo asistente rara vez comparten la misma configuración por defecto, y esta cambia con el tiempo. Por eso no resumimos aquí las condiciones de ningún proveedor: verifique las condiciones de su plan, por escrito, y guarde una copia fechada. Estas son las preguntas útiles:

  1. ¿Se usan por defecto las preguntas, archivos y respuestas para entrenar, y puede un administrador desactivarlo para toda la organización?
  2. ¿Cuánto tiempo se guarda una conversación tras borrarla, y existen copias (respaldos, control de abusos) con otro plazo?
  3. Al eliminar un documento, ¿se borran también el texto extraído y el índice de búsqueda?
  4. ¿Quién en el proveedor puede acceder a sus contenidos, en qué casos, y queda registrado?
  5. ¿Qué subencargados intervienen y salen datos del Espacio Económico Europeo? ¿Con qué garantías?
  6. ¿Puede exportarlo todo y pedir su borrado al terminar el contrato?

En cuanto los documentos contienen datos personales (expedientes de empleados, correos de clientes, currículos), se aplican el RGPD y la LOPDGDD: base jurídica, minimización, plazo de conservación, contrato con el encargado y, si el riesgo es alto, una evaluación de impacto. La Agencia Española de Protección de Datos publica guías sobre inteligencia artificial y protección de datos que vale la pena leer antes de elegir. El AI Act añade sus propias obligaciones según el uso. Nuestra lista de control para un chatbot que cumpla el RGPD repasa estos puntos uno a uno.

Cuatro maneras de chatear con documentos internos en privado

Opciones para un asistente documental privado

OpciónCómo funcionaVentajasPrecauciones
Subir archivos a un asistente de chatCada empleado adjunta PDF a sus conversacionesSin puesta en marchaConservación según el plan; copias dispersas; ninguna fuente común
Plan profesional con espacios compartidosGestión central de usuarios, archivos y ajustesConsola de administración, compromisos contractualesPermisos a menudo para todo el espacio; documentos atados a un solo asistente
Pila de código abierto en sus servidoresModelo, índice e interfaz funcionan en su infraestructuraAislamiento máximoPermisos, actualizaciones, supervisión y calidad corren de su cuenta
Base de conocimiento privada por API o MCPLos documentos se indexan una vez; asistentes y aplicaciones la consultan con una claveUna sola fuente, claves revocables, pasajes citados, varios asistentesUsted decide qué entra; el proveedor se revisa como cualquier encargado

La cuarta opción separa dos cosas que las herramientas de chat suelen mezclar: dónde viven los documentos y qué asistente redacta la respuesta. Los documentos quedan en una capa de búsqueda privada; Claude, Cursor, ChatGPT o su propia aplicación le hacen preguntas y reciben solo los pasajes pertinentes. Es la generación aumentada por recuperación, explicada con un ejemplo real en Cómo funciona RAG paso a paso.

Permisos internos: la parte que casi nadie planifica

Un asistente al que cualquier empleado puede preguntar sobre cualquier documento no es privado dentro de la empresa. El expediente disciplinario, el plan de reestructuración o la tabla salarial no deberían estar a una pregunta del becario. Reglas que funcionan en una pyme:

  • Separe por destinatarios, no por temas. Una base común (normas internas, procedimientos, documentación de producto) y bases aparte para RR. HH., jurídico y finanzas. Una consulta solo encuentra lo que contiene la base consultada.
  • Una clave por persona o aplicación. Si un script, un agente y un compañero comparten clave, no podrá revocar una sin cortar las demás.
  • Revoque al salir. Las claves API y las conexiones de asistentes van en la lista de baja, junto al correo.
  • Minimice los datos personales. Lo que no se indexa no puede filtrarse: anonimice o resuma antes de subir.
  • Revise los accesos cada trimestre. Miembros, claves y documentos cambian con el tiempo.

Una instrucción no es un permiso

Pedir al asistente «no reveles los sueldos» no protege nada. Si un documento debe ser restringido, guárdelo en una base que solo puedan consultar las claves autorizadas. Lo que no está en la base no se puede citar.

Una base privada consultable desde ChatGPT, Claude o su propio código

Es el enfoque de Kopik. Usted crea una base subiendo archivos PDF, Word, de texto o Markdown; Kopik extrae el texto, lo divide en pasajes y lo indexa para una búsqueda híbrida (texto completo más ampliación semántica de las palabras clave). Una base privada solo es accesible para su propietario y sus claves API, y nunca aparece en el catálogo público.

Se consulta de tres formas: en la web, con la API REST y una clave, o mediante el servidor MCP de Kopik, al que se conectan clientes MCP como Claude, Cursor o ChatGPT (compruebe qué conectores personalizados permite su plan). Cada respuesta se basa en sus documentos y cita pasajes numerados; también puede pedir solo los pasajes y dejar que su asistente redacte. Qué es el Model Context Protocol y por qué permite usar la misma base desde varios asistentes se explica en Qué es MCP.

Para una sola base, la dirección es `https://kopik.io/api/mcp?base=<slug>` (aparece en la página de la base) y la clave va en la cabecera `Authorization: Bearer kpk_…`. En Claude Code, por ejemplo: `claude mcp add --transport http kopik "https://kopik.io/api/mcp?base=<slug>" --header "Authorization: Bearer kpk_…"` (mantenga las comillas alrededor de la URL en zsh).

El asistente dispone entonces de `ask_base` (respuesta redactada con pasajes fuente) y `search_base` (solo pasajes). El contenido de la base llega entre etiquetas `<kopik-untrusted>`, para que el asistente lo trate como datos y no como instrucciones: una protección útil si un documento contiene un texto que parece una orden. Si trabaja sobre todo con Claude, Cómo dar acceso a Claude a los documentos de su empresa compara esta vía con las demás.

Plan de implantación en ocho pasos

  1. Haga inventario de los documentos sobre los que realmente le preguntan: procedimientos, acogida de nuevos empleados, fichas de producto, modelos de contrato.
  2. Clasifíquelos: público, interno, confidencial, datos personales, categorías especiales.
  3. Elija la opción por categoría. La documentación interna puede ir rápido a una base privada; los datos especialmente protegidos exigen un marco contractual sólido o se quedan fuera.
  4. Lea las condiciones del proveedor: entrenamiento, conservación, subencargados, transferencias, borrado. Anote las respuestas con la fecha.
  5. Actualice el registro de actividades de tratamiento y haga una evaluación de impacto si procede.
  6. Cree una base por destinatarios y una clave por aplicación, con nombres que indiquen su uso.
  7. Pruebe con preguntas cuya respuesta conoce y revise los pasajes citados, no solo la redacción.
  8. Retire versiones obsoletas: dos versiones de un procedimiento producen dos respuestas.

Cree su base de conocimiento privada

Suba sus PDF y archivos Word, mantenga la base privada y consúltela desde la web, la API o su cliente MCP con sus propias claves.

Preguntas frecuentes

¿Se puede usar ChatGPT con documentos confidenciales de la empresa?

Depende del plan y de los documentos. Los planes profesionales suelen ofrecer ajustes más estrictos que los personales, pero los detalles sobre entrenamiento, conservación y administración varían y cambian. Verifique las condiciones de su plan por escrito y contrástelas con el RGPD y sus compromisos de confidencialidad.

¿Una IA privada tiene que estar instalada en mis servidores?

No necesariamente. La instalación propia da el máximo aislamiento, pero le hace responsable de las actualizaciones de seguridad, los permisos y la calidad de las respuestas. Muchas pymes prefieren un servicio alojado con contrato claro, accesos estrictos y documentos que pueden borrar en cualquier momento.

¿Qué diferencia hay entre subir un archivo a un chatbot y una base de conocimiento privada?

Un archivo subido vive dentro de un asistente, a menudo en una sola conversación. Una base privada es un índice central: gestiona los documentos una vez, decide qué claves pueden consultarla y cualquier asistente compatible accede por API o MCP.

¿El RGPD prohíbe indexar documentos con datos personales?

No, pero exige base jurídica, minimización, un plazo de conservación definido, contrato con el encargado y, si el riesgo es alto, evaluación de impacto. Lo más sencillo es anonimizar lo que no necesita ser nominativo.

¿Cómo evito que el asistente cite documentos reservados a la dirección?

No confíe en una instrucción. Guarde esos documentos en una base separada y entregue su clave solo a las personas y aplicaciones autorizadas: el asistente no puede encontrar lo que no está en la base que consulta.

Reciba la newsletter de Kopik

Nuevas bases de conocimiento, guías sobre RAG y novedades del producto. Un correo cada una o dos semanas, baja con un clic.

Al suscribirse, acepta recibir nuestra newsletter. Nunca compartimos su dirección.