Tutorial

Chattare con i PDF: come ottenere risposte affidabili e con fonti citate

Il team di Kopik8 min di lettura

Per chattare con un PDF e ottenere risposte affidabili servono tre condizioni: un file da cui il testo si possa davvero estrarre, uno strumento che risponda solo sulla base di quel testo e fonti che rimandino al passaggio esatto. Quando un’«IA per PDF» delude, la causa è quasi sempre il documento (una scansione, una tabella scomposta) e non il modello. Questa guida spiega come preparare i PDF, come valutare le risposte e come interrogare decine di file insieme senza confonderli.

Che cosa succede quando fa una domanda a un PDF

Uno strumento per chattare con i PDF non legge il file come lo legge Lei. Dietro la finestra di chat, la maggior parte delle soluzioni serie usa la generazione aumentata dal recupero (RAG). Il documento viene elaborato una volta e poi consultato a ogni domanda.

  1. Estrazione: lo strumento ricava il livello di testo di ogni pagina. Senza livello di testo, non c’è nulla da leggere.
  2. Suddivisione: il testo viene diviso in passaggi di qualche paragrafo, abbastanza brevi da fare da prova precisa.
  3. Indicizzazione: i passaggi finiscono in un indice di ricerca (testo integrale, vettori o entrambi).
  4. Ricerca: la Sua domanda avvia la selezione dei pochi passaggi più pertinenti.
  5. Risposta: un modello linguistico scrive la risposta partendo da quei passaggi e, in uno strumento ben fatto, li cita.

La conseguenza è semplice: il modello vede solo ciò che l’estrazione ha prodotto e la ricerca ha selezionato. Se il dato utile stava in una tabella arrivata in disordine, o se la clausola giusta non è stata recuperata, la risposta sarà vaga o sbagliata, qualunque sia il modello. Per seguire questo percorso nel dettaglio, legga come funziona il RAG, passo dopo passo.

Le trappole dell’estrazione: scansioni, tabelle e impaginazione

Il PDF è nato per stampare in modo identico ovunque, non per far leggere comodamente il testo a un software. Due file uguali sullo schermo possono comportarsi in modo molto diverso. Un test di trenta secondi evita parecchie delusioni: apra il PDF, provi a selezionare una frase e cerchi con Ctrl+F (Cmd+F su Mac) una parola visibile nella pagina. Se non riesce né a selezionare né a trovare nulla, la pagina è un’immagine.

Problemi frequenti dei PDF e come correggerli prima del caricamento

Tipo di PDFCosa non funzionaCosa fare prima di caricarlo
Lettere o contratti scansionatiSolo immagine: nessun testo da estrarrePassare il file all’OCR, poi ricontrollare alcune pagine
Foto di pagine scattate con lo smartphonePagina storta, ombre, cifre riconosciute maleScansionare in piano, poi OCR
Tabelle di tariffe o aliquoteRighe e colonne si mescolanoRiscrivere le cifre chiave in una frase o allegare un CSV
Documenti su due colonneLe righe delle due colonne possono intrecciarsiCaricare piuttosto la versione Word o web originale
Moduli compilatiIl contenuto dei campi può andare persoAppiattire il modulo o ristamparlo in PDF
PDF protettiLa copia del testo è bloccataRimuovere la protezione se ne ha il diritto

PDF scansionati: prima l’OCR

Non conti sul fatto che lo strumento di chat legga immagini di testo. Passi le scansioni al riconoscimento ottico dei caratteri (OCR) prima del caricamento, per esempio con la funzione OCR del Suo editor PDF o con lo strumento open source OCRmyPDF, che aggiunge al file un livello di testo ricercabile. Controlli poi importi, nomi e date: è lì che si annidano gli errori di riconoscimento.

Le tabelle meritano un’attenzione particolare. Una tabella di aliquote, un listino prezzi o uno scadenzario sono spesso proprio ciò che si vuole interrogare, e anche ciò che l’estrazione gestisce peggio. Se una tabella conta, aggiunga accanto una frase esplicita («Dal 1° gennaio 2026 la tariffa della categoria B è del 4,2%») oppure la carichi a parte in formato CSV o testo.

Pretendere risposte verificabili

Una risposta ben scritta non è per forza corretta. La caratteristica più importante di uno strumento di IA per PDF è mostrare da dove viene ogni affermazione. Senza questo, Lei si fida di un paragrafo sicuro di sé, ed è proprio così che dettagli inventati finiscono in un verbale o in un’email a un cliente. Altre tecniche sono raccolte nella nostra guida per ridurre le allucinazioni dell’IA.

Quando confronta gli strumenti, guardi la precisione delle fonti. Alcuni indicano il numero di pagina, comodo per i rapporti lunghi. Altri mostrano il passaggio citato con il nome del documento, così si può controllare la formulazione senza aprire il file. Entrambe le soluzioni vanno bene; una menzione generica come «in base ai Suoi documenti» non basta.

  • Si aspetti un «non lo so». Uno strumento valido segnala che i documenti non coprono la domanda invece di improvvisare.
  • Verifichi tutto ciò che ha conseguenze. Scadenze, importi, obblighi contrattuali o di legge vanno sempre confrontati con il passaggio citato.
  • Faccia domande precise. «Quale preavviso prevede l’articolo 4 del contratto quadro 2025?» funziona meglio di «Riassumi questo contratto».
  • Usi il lessico del documento. Se il contratto collettivo parla di «ferie annuali retribuite», usi quell’espressione.
  • Attenzione alle versioni doppie. Se l’edizione dell’anno scorso è ancora nel mucchio, potrebbe essere quella citata.

Interrogare molti PDF insieme

Trascinare un PDF in un assistente generico basta per un riassunto veloce. Non regge invece una raccolta di procedure, una cartella di contratti di locazione o dieci anni di verbali. Incollare tutto in una conversazione si scontra con i limiti di dimensione, e il modello finisce per confondere i documenti. Una base di conoscenza basata sul RAG se la cava meglio, perché cerca in tutta la raccolta e passa al modello solo i passaggi utili.

  • Dia nomi chiari ai file: «Manuale-sicurezza-magazzino-2026.pdf» rende utile una citazione, «scan_0042.pdf» no.
  • Elimini duplicati e versioni superate, oppure indichi l’anno nel titolo di ogni file.
  • Raggruppi per argomento: una base per le risorse umane e una per l’area legale rispondono di solito in modo più netto di un contenitore unico.
  • Formuli i confronti in modo esplicito: «Che cosa cambia nei termini di pagamento tra i contratti fornitori 2025 e 2026?» spinge la ricerca a trovarli entrambi.
  • Conosca i limiti: «Riassumi tutti i 300 file» non è una domanda mirata, e il RAG è fatto per trovare passaggi precisi.

Protezione dei dati: cosa verificare prima del caricamento

I PDF contengono spesso proprio ciò che non va diffuso: fascicoli del personale, contratti con i clienti, referti medici. Se includono dati personali, il GDPR si applica anche al loro caricamento in uno strumento di IA: base giuridica, controllo degli accessi, luogo del trattamento e responsabili del trattamento. Il Garante per la protezione dei dati personali pubblica indicazioni utili anche per le PMI, e la nostra checklist per un chatbot conforme al GDPR riassume i controlli pratici. La precauzione più semplice resta togliere i dati personali non necessari prima del caricamento.

Chattare con i Suoi PDF su Kopik

Kopik trasforma i Suoi documenti in una base di conoscenza da interrogare. Creare una base è gratuito, e una base privata è accessibile solo a Lei e alle Sue chiavi API. Il procedimento:

  1. Prepari i file: verifichi che ogni PDF contenga testo selezionabile e passi le scansioni all’OCR prima del caricamento. Sono accettati anche file Word, di testo e Markdown.
  2. Crei una base e carichi i documenti: Kopik estrae il testo, lo divide in passaggi e li indicizza per una ricerca ibrida, che unisce testo integrale e ampliamento semantico delle parole chiave, così anche una domanda formulata diversamente dal documento trova il passaggio giusto.
  3. Faccia le Sue domande: le risposte sono scritte solo a partire dai Suoi documenti, con passaggi citati e numerati che mostrano l’estratto e il nome del documento di origine.
  4. Controlli le fonti: legga i passaggi citati prima di riutilizzare una cifra o una clausola.
  5. Colleghi i Suoi strumenti: la stessa base si interroga dal sito, tramite l’API REST o da un client MCP come Claude, Cursor o ChatGPT. La modalità passaggi restituisce solo gli estratti grezzi, se preferisce leggerli Lei.

Kopik lavora sul testo contenuto nei Suoi file: per questo, con i documenti scansionati, l’OCR viene prima. Le domande alle proprie basi sono gratuite entro un uso ragionevole.

Faccia rispondere i Suoi PDF

Carichi PDF, file Word o di testo e ottenga risposte tratte dai Suoi documenti, con ogni passaggio citato.

Checklist per scegliere uno strumento di chat con PDF

  • Ogni risposta cita le fonti con precisione sufficiente per verificarla (passaggio o pagina).
  • Lo strumento ammette quando i documenti non contengono la risposta.
  • Cerca in un’intera raccolta di file, non in un PDF per conversazione.
  • Lei decide chi vede i documenti e può cancellarli in qualsiasi momento.
  • Accetta Word e testo quando il PDF non è la fonte migliore.
  • Offre un’API o un accesso MCP se vuole integrarlo con altri strumenti.

Domande frequenti

Perché l’IA non trova nulla nel mio PDF?

Nella maggior parte dei casi il PDF è una scansione senza livello di testo, quindi non c’è nulla da cercare. Provi a selezionare il testo nel visualizzatore. Se non ci riesce, passi il file all’OCR, ricontrolli qualche pagina e carichi la nuova versione.

Si possono fare domande a più PDF contemporaneamente?

Sì, con uno strumento che costruisce una base di conoscenza da tutti i file e cerca nell’insieme. Dia nomi chiari ai file e tolga le vecchie versioni, così le citazioni indicano il documento giusto. Le richieste che impongono di leggere ogni file per intero restano un punto debole.

Come capisco se la risposta viene davvero dal mio documento?

Scelga uno strumento che citi le fonti, con il numero di pagina o con il passaggio citato e il nome del documento, e legga la citazione prima di fidarsi della risposta. Una risposta senza fonte verificabile va considerata non verificata.

Il GDPR si applica quando carico PDF in uno strumento di IA?

Sì, se i PDF contengono dati personali. Servono una base giuridica, misure di sicurezza adeguate e chiarezza su chi tratta i dati e dove. Rimuovere prima i dati personali non necessari è il modo più semplice per ridurre il rischio.

Tabelle e grafici vengono capiti bene?

Le tabelle perdono spesso la loro struttura durante l’estrazione, e grafici o immagini di solito non contengono testo utilizzabile. Scriva le cifre importanti in una frase oppure carichi la tabella a parte in formato CSV o testo.

Riceva la newsletter di Kopik

Nuove basi di conoscenza, guide sul RAG e novità del prodotto. Un'email ogni una o due settimane, disiscrizione con un clic.

Iscrivendosi accetta di ricevere la nostra newsletter. Il Suo indirizzo non viene mai condiviso.