Cómo funciona RAG paso a paso: seguimos una pregunta real de principio a fin
Cómo funciona RAG, en una frase: antes de nada, sus documentos se dividen en fragmentos y se indexan; cuando llega una pregunta, el sistema recupera los fragmentos más útiles, los reordena, los coloca en un prompt y pide a un modelo de lenguaje que responda solo a partir de ellos, citando las fuentes. La mejor manera de entenderlo es verlo en marcha. En esta guía seguimos una única pregunta, enviada al servicio de atención al cliente de una tienda online ficticia de pequeños electrodomésticos, a través de las siete etapas de la generación aumentada por recuperación.
El punto de partida: una pregunta y tres documentos
Nuestra pyme, una tienda online con sede en Valencia, ha cargado tres documentos en su base de conocimiento: las condiciones de garantía de 2026 (un PDF de 12 páginas), las condiciones antiguas de 2021, que nadie retiró, y unas preguntas frecuentes sobre envíos y devoluciones en Word. Un cliente escribe en el chat de la web:
Mi cafetera dejó de funcionar a los 20 meses de comprarla. ¿Me la reparan gratis?
La respuesta está en el apartado 3 de las condiciones de 2026, titulado «Garantía de los productos». No aparece ni la palabra «cafetera» ni «reparar gratis». Las condiciones de 2021 recogían otro plazo. Quédese con estos dos detalles: son justo las trampas que un pipeline RAG tiene que sortear.
Antes de cualquier pregunta: ingesta, troceado e indexación
Las tres primeras etapas se ejecutan una vez, al subir los documentos, y de nuevo cada vez que cambian. El cliente nunca las ve, pero de ellas depende casi toda la calidad de la respuesta.
Paso 1. Ingesta: de archivos a texto limpio
El pipeline abre cada archivo y extrae su texto. En el PDF, eso significa leer la capa de texto página a página, eliminar cabeceras y pies repetidos («Condiciones generales, página 4 de 12») y conservar los títulos para no perder la estructura. Cada documento recibe además metadatos: título, nombre de archivo y, a ser posible, fecha de entrada en vigor. Esa fecha será clave cuando compitan las versiones de 2021 y 2026.
Lo que puede fallar: un PDF escaneado sin capa de texto no aporta nada, y una tabla aplanada se convierte en una lista de cifras sin sentido. Por eso conviene que los plazos importantes también aparezcan redactados en el texto.
Paso 2. Troceado: fragmentos que se puedan encontrar
El texto se divide en fragmentos (chunks) de unos cientos de palabras. El apartado 3 se convierte en el fragmento 23. Un buen troceado hace dos cosas que ayudan a nuestra pregunta: antepone al fragmento su ruta de títulos («Condiciones 2026 > 3. Garantía de los productos») y lo solapa ligeramente con el siguiente para no cortar una frase a la mitad. En esencia, el fragmento 23 dice: todos los productos tienen una garantía de tres años desde la entrega; durante ese plazo, la reparación o sustitución es gratuita.
Paso 3. Indexación: hacer que los fragmentos se encuentren
Cada fragmento se guarda en un índice. Un índice de texto completo registra las palabras en forma normalizada, de modo que «garantía», «garantías» y «garantizado» se reconozcan entre sí. Un índice vectorial guarda un embedding, una serie de números que resume el significado del fragmento. Muchos sistemas combinan ambos, y la configuración del idioma español es lo que permite que la búsqueda entienda plurales y conjugaciones.
Llega la pregunta: búsqueda y reranking
Paso 4. Búsqueda: echar la red amplia
El cliente escribe «dejó de funcionar», «cafetera» y «reparan gratis». Las condiciones hablan de «garantía», «productos» y «reparación o sustitución». Una búsqueda literal fallaría. Dos técnicas salvan la distancia: la ampliación de la consulta, en la que un modelo de lenguaje reformula la pregunta con términos adicionales (garantía, avería, reparación, sustitución, plazo de garantía), y la búsqueda semántica, que encuentra fragmentos de significado parecido aunque usen otras palabras. El resultado es una lista de candidatos, a menudo entre 20 y 50. Los primeros son:
- Fragmento 23 (condiciones 2026, 3. Garantía): tres años desde la entrega, reparación o sustitución gratuita.
- Fragmento 71 (condiciones 2021, 3. Garantía): el plazo antiguo de dos años.
- Fragmento 24 (condiciones 2026, 3.2 Cómo tramitar la garantía): conservar la factura y abrir una incidencia desde su cuenta.
- Fragmento 8 (FAQ): la recogida del producto averiado corre a cargo de la tienda.
- Fragmento 30 (condiciones 2026, 5. Desistimiento): devolución en 14 días por cambio de opinión.
Paso 5. Reranking: las mejores pruebas, primero
La búsqueda está pensada para ser rápida y no dejarse nada; puede ser algo generosa. El reranking (reordenación) es una segunda lectura más atenta: un modelo lee la pregunta junto con cada candidato y puntúa hasta qué punto el fragmento la responde de verdad. Se añaden reglas de negocio: eliminar duplicados y preferir la versión más reciente. En nuestro ejemplo, el fragmento 23 pasa al primer puesto, el 24 y el 8 se quedan porque explican qué hacer, el desistimiento cae (el cliente no ha cambiado de opinión, la cafetera está averiada) y las condiciones de 2021 se descartan o se marcan como antiguas.
El reranking es opcional, su función no
Algunos sistemas usan un modelo de reordenación específico; otros, una búsqueda híbrida bien ajustada con filtros de metadatos. Lo importante es que un fragmento obsoleto nunca llegue el primero y sin etiqueta al modelo. Aquí, eso daría una respuesta segura y equivocada: «su garantía ya ha caducado».
Montaje del prompt y respuesta con fuentes
Paso 6. Montaje del prompt
El modelo de lenguaje no busca nada por sí mismo. Recibe un prompt construido por el pipeline, normalmente con cuatro partes:
- Instrucciones: responder solo con las fuentes siguientes, citarlas como [1], [2] y decir claramente si no contienen la respuesta.
- Fuentes numeradas: [1] fragmento 23 con su título y fecha, [2] fragmento 24, [3] fragmento 8.
- La pregunta, tal como la escribió el cliente.
- Contexto: idioma, fecha del día, formato esperado (respuesta breve y luego detalles).
Los fragmentos se tratan como datos, nunca como órdenes, y se colocan entre delimitadores claros, para que una frase escondida en un documento no pueda desviar al modelo.
Paso 7. Generación: una respuesta que se puede comprobar
El modelo redacta algo así: «Sí. Los productos tienen tres años de garantía desde la entrega, y durante ese plazo la reparación o sustitución es gratuita [1]. Para tramitarla, conserve la factura y abra una incidencia desde su cuenta [2]; nosotros nos encargamos de recoger la cafetera [3].» Cada número enlaza con el fragmento original, así que el cliente o el equipo de soporte pueden leer el texto exacto.
El modelo no ha inventado un plazo ni ha citado las condiciones de 2021. Y hay algo que no debe hacer: interpretar la ley por su cuenta. En España, la garantía legal de los bienes vendidos a consumidores es de tres años para compras realizadas desde 2022, por lo que la política de la tienda coincide aquí con la ley; pero si un cliente plantea un caso dudoso, un buen asistente lo deriva a una persona en lugar de improvisar.
El recorrido completo en una tabla
Una pregunta a través de un pipeline RAG
| Paso | Qué le pasa a nuestra pregunta | Fallo típico |
|---|---|---|
| 1. Ingesta | Texto extraído, cabeceras eliminadas, fecha guardada | PDF escaneado, tablas rotas |
| 2. Troceado | El apartado 3 pasa a ser el fragmento 23 con sus títulos | Regla partida entre dos fragmentos |
| 3. Indexación | Fragmento en índice de texto completo y vectorial | Idioma mal configurado, índice desfasado |
| 4. Búsqueda | «Reparan gratis» enlazado con «garantía»; 5 candidatos | El fragmento correcto no aparece |
| 5. Reranking | Condiciones 2026 primero, 2021 descartadas | Versión antigua en primer lugar |
| 6. Prompt | Instrucciones, tres fuentes numeradas, pregunta | Demasiados fragmentos, sin obligación de citar |
| 7. Generación | Respuesta con [1][2][3] | Afirmaciones sin fuente |
La tabla sirve también como lista de diagnóstico. Ante una respuesta errónea, recorra el camino al revés: ¿estaba el fragmento correcto en el prompt? Si es así, el problema está en las instrucciones o en la generación. Si no, ¿estaba entre los candidatos? Si tampoco, revise el troceado y la extracción. La mayoría de los errores nacen en los pasos 1, 2 y 4.
Usar este pipeline sin tener que construirlo
Montar las siete etapas por su cuenta exige un extractor, un troceador, una base de datos, una capa de búsqueda, la API de un modelo y el código que lo une todo. Kopik ejecuta ese pipeline por usted. Crear una base es gratis: sube archivos PDF, Word, texto o Markdown, y Kopik extrae, trocea e indexa el contenido para una búsqueda híbrida (texto completo más ampliación semántica de las palabras clave). Cada pregunta devuelve una respuesta basada en sus documentos con los fragmentos citados, o solo los fragmentos en bruto en el modo «pasajes».
Una base puede ser privada (solo usted y sus claves API) o publicarse en el catálogo de bases, donde se paga por pregunta: el creador fija el precio y se queda con el 70 %. Se consulta en la web, con la API REST o desde Claude, Cursor, ChatGPT y otros clientes MCP; la documentación para desarrolladores explica la configuración. Como con cualquier proveedor, revise antes de subir los documentos si contienen datos personales sujetos al RGPD.
Haga pasar su propia pregunta por el pipeline
Suba unas condiciones, un manual o un procedimiento y hágale una pregunta real: la respuesta llega con los fragmentos en los que se apoya.
Pruébelo como acabamos de hacer
Elija cinco preguntas que su equipo recibe de verdad, anote dónde está la respuesta en los documentos y compare las citas de cada respuesta con ese lugar. Es la forma más rápida de saber qué etapa mejorar.
Preguntas frecuentes
¿Cuáles son las etapas de la generación aumentada por recuperación?
Hay dos fases. Antes de las preguntas: ingesta (extraer el texto), troceado en fragmentos e indexación. Con cada pregunta: búsqueda de candidatos, reranking para ordenarlos por relevancia real, montaje del prompt (instrucciones, fuentes y pregunta) y generación de una respuesta que cita sus fuentes.
¿Es obligatorio el reranking en una arquitectura RAG?
No siempre. Una base pequeña y ordenada suele funcionar bien con una buena búsqueda híbrida. El reranking aporta mucho cuando la lista de candidatos es larga, cuando conviven varias versiones de un documento o cuando hay fragmentos parecidos que responden a preguntas distintas.
¿Cuántos fragmentos hay que enviar al modelo?
Normalmente unos pocos, entre tres y diez. Con muy pocos puede faltar la respuesta; con demasiados, el modelo se distrae y suben el coste y el tiempo de respuesta. El número adecuado depende del tamaño de los fragmentos y de sus documentos, así que conviene probarlo con preguntas reales.
¿Por qué un sistema RAG responde a veces con un documento desactualizado?
Porque las dos versiones están indexadas y la antigua encajaba bien con la pregunta. La solución es retirar los documentos obsoletos, guardar la fecha de vigencia como metadato y hacer que la clasificación prefiera la versión más reciente.
¿El modelo de lenguaje busca él mismo en los documentos?
No. La búsqueda la hace la capa de recuperación antes de llamar al modelo, que solo ve los fragmentos seleccionados en su prompt. Por eso la calidad de la búsqueda pesa tanto en la respuesta final.
Reciba la newsletter de Kopik
Nuevas bases de conocimiento, guías sobre RAG y novedades del producto. Un correo cada una o dos semanas, baja con un clic.
Al suscribirse, acepta recibir nuestra newsletter. Nunca compartimos su dirección.