Guida

Cos’è una biblioteca di conoscenza per l’IA: sapere esperto con fonti, per persone e agenti

Il team di Kopik9 min di lettura

Una biblioteca di conoscenza per l’IA è un catalogo di basi di conoscenza selezionate, ciascuna costruita a partire da un insieme definito di documenti ufficiali o di esperti, che persone e agenti IA possono interrogare in linguaggio naturale ottenendo risposte fondate su passaggi citati. Immagini una biblioteca di consultazione con scaffali scelti con cura e un bibliotecario che Le indica il paragrafo esatto. Si colloca tra due strumenti che Lei già usa: la ricerca web, ampia ma rumorosa, e la memoria di un modello linguistico, scorrevole ma non verificabile. Ecco la definizione, il confronto con entrambi e i criteri concreti per decidere di quale base fidarsi.

Cos’è una biblioteca di conoscenza per l’IA

Il mattone di base è la base di conoscenza per l’IA: un insieme di documenti preparato in modo che un software possa cercarvi dentro. Il testo viene estratto, suddiviso in brevi passaggi e indicizzato. Quando arriva una domanda, il sistema recupera i passaggi più pertinenti e li restituisce così come sono, oppure chiede a un modello linguistico di scrivere una risposta basata solo su quei passaggi, citandoli. Questa tecnica si chiama generazione aumentata dal recupero, o RAG, e la seguiamo passo dopo passo in come funziona il RAG.

Si parla di biblioteca quando molte basi di questo tipo sono riunite in un unico luogo, ognuna con un tema chiaro, un’origine nota e un modo comune per interrogarla. La parola non è casuale. Una biblioteca non è l’intero web: è una selezione. Qualcuno ha deciso che cosa mettere sugli scaffali, da dove proviene e a quando risale. È proprio questo lavoro di selezione a dare valore.

In concreto, una biblioteca di conoscenza per l’IA mette insieme quattro elementi:

  • Basi circoscritte. Ogni base tratta un tema, per esempio l’AI Act o i trasferimenti internazionali di dati, invece di voler rispondere a tutto.
  • Fonti dichiarate. Ogni base indica i documenti che contiene, idealmente testi normativi, linee guida delle autorità o lavori di un esperto identificato.
  • Risposte fondate e citate. Le risposte nascono dai passaggi recuperati e vi rimandano, così il lettore può verificare la formulazione originale.
  • Accesso per le macchine. Oltre alla chat, le basi si possono chiamare da un software tramite API o da un assistente IA attraverso uno standard come il Model Context Protocol.

Biblioteca di conoscenza, ricerca web e memoria del modello a confronto

Quando pone una domanda fattuale a un assistente IA, la risposta arriva da una di queste tre fonti. Ognuna sbaglia a modo suo, quindi è utile sapere quale è all’opera.

Da dove arriva la risposta di un’IA

CriterioMemoria del modelloRicerca web genericaBiblioteca di conoscenza IA
Origine dei fattiSchemi appresi durante l’addestramentoLe pagine meglio posizionateUn insieme dichiarato di documenti scelti
AggiornamentoFermo alla data di fine addestramentoAggiornata, mista a pagine superateAggiornata quanto viene curata la base
Qualità delle fontiSconosciuta, non ispezionabileDalla Gazzetta Ufficiale allo spamScelta e documentata per ogni base
CitazioniNessuna, o ricostruite a posterioriLink a pagine, di rado al paragrafoI passaggi esatti utilizzati
Ideale perRagionare, scrivere, spiegareScoprire, notizie, domande ampieDomande precise in un ambito noto

Perché la memoria del modello non basta

Un modello linguistico condensa i dati di addestramento in schemi statistici. Spiega molto bene un concetto, ma riproduce con molta meno affidabilità una soglia esatta, una scadenza o il testo di un articolo. Non può mostrare da dove viene un’informazione e, quando non la conosce, può comunque rispondere con sicurezza. È l’origine delle allucinazioni, di cui parliamo in come ridurre le allucinazioni dell’IA.

Perché nemmeno la ricerca web generica basta

La ricerca web risolve l’aggiornamento, ma sposta il problema sulla scelta delle fonti. Su un obbligo dell’AI Act o sulle clausole contrattuali tipo, i primi risultati mescolano spesso EUR-Lex, la Gazzetta Ufficiale o il Garante Privacy con blog commerciali, vecchi forum e pagine scritte soprattutto per posizionarsi. Un assistente che naviga deve decidere in pochi secondi a quale pagina credere, e non sempre sceglie quella ufficiale. Inoltre consuma molto contesto caricando pagine intere quando bastava un paragrafo.

La biblioteca di conoscenza non sostituisce né l’una né l’altra: restringe il campo. Quando la domanda rientra nell’ambito di una base, l’agente cerca in un piccolo corpus che una persona ha già giudicato degno di essere letto, e può citare il paragrafo esatto.

Sei criteri per capire se una base è affidabile

Una biblioteca vale quanto le sue basi, e una risposta con citazioni sembra sempre seria. Si ponga le domande che si porrebbe un buon documentalista.

  1. Fonti ufficiali o primarie. In ambito fiscale, del lavoro o della protezione dei dati, la base migliore si fonda sui testi dell’autorità stessa: Gazzetta Ufficiale dell’UE, Gazzetta Ufficiale italiana, provvedimenti e linee guida del Garante Privacy, guide dell’Agenzia delle Entrate. Le sintesi di seconda mano sono utili se presentate come tali.
  2. Date visibili. Le regole cambiano. Una base affidabile mostra quando i documenti sono stati aggiunti o aggiornati, e i documenti riportano la propria data di pubblicazione. Diffidi di una base che non sa dire a quando risale.
  3. Un autore o curatore identificato. Qualcuno deve rispondere dei contenuti: un ente pubblico, un professionista qualificato o un team che spiega come ha scelto i documenti.
  4. Citazioni a livello di passaggio. La risposta deve rimandare al passaggio su cui si basa, non solo al titolo di un documento. È ciò che permette di verificare un numero in pochi secondi.
  5. Un ambito dichiarato. Una base che dice cosa non copre è più utile di una che pretende di sapere tutto. Una domanda fuori tema deve ricevere un onesto «non è nei documenti» invece di un’ipotesi.
  6. Il diritto di usare i contenuti. Testi ufficiali riutilizzabili, contenuti con licenza aperta o scritti dell’autore stesso non creano problemi. Una base costruita copiando contenuti a pagamento è un rischio legale e di qualità.

Il test dei cinque minuti

Ponga a una base tre domande di cui conosce già la risposta, una delle quali volutamente fuori tema. Verifichi che i passaggi citati dicano davvero ciò che afferma la risposta e che la domanda fuori tema venga rifiutata. Questa breve prova dice più di qualsiasi pagina promozionale.

GDPR e AI Act

Se costruisce una base con documenti interni, il GDPR si applica ai dati personali che contengono, e le indicazioni del Garante Privacy sono il punto di partenza. Una base pubblica di riferimento farebbe bene a non contenere alcun dato personale. L’AI Act europeo introduce inoltre obblighi di trasparenza per i sistemi di IA, e le risposte con fonti vanno in questa direzione.

Chi usa una biblioteca di conoscenza per l’IA

Due pubblici attingono agli stessi contenuti. Le persone: il DPO di una PMI che verifica una regola sui trasferimenti verso paesi terzi, la responsabile di prodotto che vuole capire se il suo sistema rientra tra quelli ad alto rischio, il consulente che prepara una nota per un cliente. Vogliono una risposta diretta in un italiano chiaro e un modo rapido per verificarla, senza leggere un documento di cento pagine.

Gli agenti IA sono il secondo pubblico. Assistenti come Claude, ChatGPT o Cursor svolgono sempre più compiti in autonomia: scrivere testi, rispondere ai clienti, programmare. Quando incontrano una domanda fattuale specialistica, serve loro una fonte da chiamare a metà del lavoro. Tramite un’API o un server MCP, l’agente elenca le basi disponibili, sceglie quella giusta e riceve una risposta scritta oppure i passaggi grezzi su cui ragionare. La biblioteca diventa uno strumento in più, accanto alla ricerca web.

Kopik, un esempio concreto

Kopik è un marketplace di basi di conoscenza pronte da interrogare, costruito proprio su questo modello. Creare una base è gratuito: Lei carica i documenti (PDF, Word, testo o Markdown) e Kopik estrae il testo, lo suddivide e lo indicizza per una ricerca ibrida che unisce la ricerca full text a un ampliamento semantico delle parole chiave della domanda. Così anche una domanda formulata diversamente dai documenti ritrova il passaggio giusto.

  • Le basi pubbliche compaiono nel catalogo delle basi e si pagano a domanda; il creatore fissa il prezzo e trattiene il 70 %.
  • Le basi private sono accessibili solo al proprietario e alle sue chiavi API.
  • Due tipi di risposta: una risposta fondata sui documenti con passaggi citati e numerati, oppure la modalità «passaggi», che restituisce solo gli estratti agli agenti che preferiscono ragionare da sé.
  • Tre accessi: il sito, un’API REST con chiavi e un server MCP utilizzabile da Claude, Cursor, ChatGPT e altri client MCP.

Due esempi dal catalogo, entrambi con testi originali in inglese: la base EU AI Act essentials, con il testo del regolamento e le linee guida della Commissione, e GDPR & International Data Transfers, con i testi ufficiali dell’UE. Entrambe hanno un ambito ristretto e fonti ufficiali, il che rende verificabili le risposte. Sul sito si paga con crediti prepagati o con un abbonamento chat da 12 € al mese; gli agenti che passano dall’API o da MCP pagano il prezzo di ciascuna base a domanda.

Quando scegliere una biblioteca di conoscenza per l’IA

  • La domanda è precisa e appartiene a un ambito definito: protezione dei dati, fisco, sicurezza sul lavoro, una norma, la documentazione di un prodotto.
  • La formulazione esatta, il numero o la scadenza contano, e un errore costerebbe caro.
  • Lei, il Suo cliente o il Suo agente dovete poter mostrare da dove viene la risposta.
  • Esistono fonti scritte affidabili e qualcuno di credibile le aggiorna.
  • La ricerca web generica continua a restituire pagine non ufficiali o superate su questo tema.

Per domande aperte, notizie di attualità o questioni di opinione, la ricerca web o il ragionamento del modello restano un punto di partenza migliore. I flussi di lavoro più solidi combinano i tre: il modello ragiona, la ricerca web esplora e la biblioteca di conoscenza conferma i fatti precisi con una citazione.

Esplori la biblioteca di basi

Scopra basi costruite da fonti ufficiali ed esperte, ponga una domanda e verifichi Lei stesso i passaggi citati.

Domande frequenti

Una biblioteca di conoscenza per l’IA è la stessa cosa di una base di conoscenza?

Non proprio. Una base di conoscenza è un corpus interrogabile su un tema. Una biblioteca di conoscenza per l’IA è un catalogo di molte basi, ciascuna con il proprio ambito e le proprie fonti, accessibili tramite un’interfaccia comune perché persone e agenti trovino e interroghino quella giusta.

Che differenza c’è rispetto a chiedere direttamente a un chatbot?

Un chatbot che risponde a memoria si basa su schemi appresi durante l’addestramento, che possono essere superati e non rimandano ad alcuna fonte. Una biblioteca di conoscenza recupera prima i passaggi da documenti dichiarati e risponde a partire da essi citandoli, così ogni affermazione si può verificare.

Un agente IA può interrogare da solo una biblioteca di conoscenza?

Sì, se la biblioteca offre un’API o un server MCP. L’agente elenca le basi, ne sceglie una, pone la domanda e riceve una risposta con citazioni o i passaggi grezzi. Così assistenti come Claude o Cursor consultano fonti specialistiche durante un compito.

Le fonti ufficiali garantiscono una risposta corretta?

No. Rendono affidabili le prove, ma la ricerca può mancare un passaggio e una norma può essere stata modificata nel frattempo. Per decisioni con conseguenze reali, legga il passaggio citato e ne verifichi la data prima di agire.

Posso pubblicare la mia competenza in una biblioteca di questo tipo?

Su un marketplace come Kopik, sì. Crea gratuitamente una base con i Suoi documenti, decide se tenerla privata o renderla pubblica e, per una base pubblica, fissa il prezzo a domanda e trattiene il 70 % di quanto incassato.

Riceva la newsletter di Kopik

Nuove basi di conoscenza, guide sul RAG e novità del prodotto. Un'email ogni una o due settimane, disiscrizione con un clic.

Iscrivendosi accetta di ricevere la nostra newsletter. Il Suo indirizzo non viene mai condiviso.