Che cos’è il RAG? L’IA basata sulle fonti, spiegata

TL;DR

RAG — Retrieval-Augmented Generation — significa che l’IA va a cercare qualcosa prima di rispondere. Invece di ripescare dall’addestramento, il sistema cerca nei tuoi documenti, mette davanti al modello i passaggi più pertinenti e gli chiede di rispondere partendo da quelli, con citazioni che rimandano alla fonte. Risolve il limite temporale dell’addestramento, il problema del «non ha mai visto i miei file» e buona parte delle invenzioni dette con sicurezza. Non le elimina del tutto.

Il problema, detto come si deve

Un modello linguistico è, di fatto, un’ottima compressione di moltissimo testo che ha letto una volta. Questo gli dà scorrevolezza e ampiezza, e tre debolezze precise: smette di sapere le cose dopo la data limite del suo addestramento, non ha mai visto nulla di privato, e quando non sa qualcosa produce comunque una risposta plausibile, perché produrre testo plausibile è tutto il suo mestiere.

Non puoi riaddestrare un modello ogni volta che scrivi un documento. Quindi cambi invece da dove arriva la risposta.

I quattro passaggi

  1. Indicizzazione. I tuoi documenti vengono divisi in passaggi — qualche paragrafo ciascuno — e ogni passaggio viene convertito in una rappresentazione numerica che ne cattura il significato. Succede una volta sola, all’inizio.
  2. Recupero. La tua domanda viene convertita allo stesso modo e il sistema trova i passaggi più vicini per significato. Non è una ricerca per parole chiave: «cosa avevamo concordato sui ritardi di consegna» può trovare un paragrafo che parla di «ritardi nelle spedizioni» senza usare mai le tue parole.
  3. Arricchimento. Quei passaggi vengono messi nel contesto del modello insieme alla tua domanda e all’istruzione di rispondere partendo dal materiale fornito.
  4. Generazione e citazione. Il modello scrive la risposta e, poiché il sistema sa quali passaggi gli sono stati dati, può ricondurre ogni affermazione alla sua fonte.

Tutto qui. La parte ingegnosa è il passaggio 2; la parte affidabile è il passaggio 4.

Neurobase mostra una risposta basata sulle fonti con citazioni che rimandano al materiale originale.
La citazione è la funzione. Una risposta che non puoi verificare è solo un’opinione detta con sicurezza.

Perché «basta incollarlo nella chat» non è la stessa cosa

Allegare un documento a una conversazione mette l’intero testo nel contesto del modello per quella conversazione. Funziona benissimo per un articolo. Smette di funzionare quando ne hai novanta, quando farai domande anche il mese prossimo, o quando il paragrafo che serve è a pagina 340 e le 339 pagine attorno sono rumore che compete per l’attenzione del modello.

Il RAG indicizza una volta e recupera a ogni domanda. Paghi il costo di configurazione una volta sola e poi interroghi l’intera raccolta all’infinito. Abbiamo approfondito il compromesso in GPT-5 e Gemini a confronto: i modelli a contesto ampio hanno ridotto il divario sui singoli documenti, ma non sulle raccolte a cui torni più volte.

Dove il RAG fallisce ancora

Vale la pena essere precisi, perché «ancorato alle fonti» viene usato come se significasse «corretto»:

Il meccanismo generale dietro il secondo punto merita di essere capito a sé — leggi perché l’IA si inventa le cose.

Quando vale la configurazione

SituazioneCosa usare
Un documento, una domandaIncollalo in una chat
Un documento lungo che interrogherai più volteIndifferente, con una preferenza per il RAG
Decine di documenti su un temaRAG
Risposte su cui si baserà qualcun altroRAG — per le citazioni, non per il recupero
Contenuti misti: PDF, video, audio, pagine webRAG, se li gestisce tutti
Domande di cultura generaleNessuno dei due — chiedi a un modello

Che aspetto ha come prodotto

Neurobase è la nostra versione di tutto questo: dai a un Neuron delle fonti — PDF, file di testo, video, YouTube, pagine web, immagini, audio — e lui le indicizza trasformandole in un assistente mirato che risponde con citazioni al materiale originale. Le risposte si possono provare nel Lab prima di farci affidamento, e più Neurons si possono concatenare in un flusso di lavoro con operazioni come Summarize, Compare, Extract e Translate.

Se vuoi la versione concreta invece del concetto, parti da trasformare una cartella di PDF in un assistente.

Domande frequenti

Che cos’è il RAG?

Retrieval-Augmented Generation: il sistema cerca prima nei tuoi documenti, mette i passaggi pertinenti nel contesto del modello e gli chiede di rispondere partendo da quelli — con le citazioni.

Quale problema risolve?

I limiti temporali dell’addestramento, i documenti privati che il modello non ha mai visto e le invenzioni dette con sicurezza. Le citazioni ti permettono di verificare invece di fidarti.

È la stessa cosa che caricare un file in un chatbot?

No. Allegare un file funziona per un documento in una conversazione. Il RAG indicizza una raccolta una volta sola e recupera a ogni domanda, su molte conversazioni.

Il RAG impedisce all’IA di inventare?

Lo riduce parecchio, non del tutto. Il recupero può mancare il bersaglio, le risposte possono andare oltre le prove e le fonti possono essere sbagliate. Le citazioni rendono verificabili questi fallimenti.