Was ist RAG? Quellenbasierte KI verständlich erklärt

TL;DR

RAG – Retrieval-Augmented Generation – heißt, dass die KI etwas nachschlägt, bevor sie antwortet. Statt sich aus dem Training zu erinnern, durchsucht das System deine Dokumente, legt dem Modell die relevantesten Passagen vor und lässt es daraus antworten, mit Quellenangaben zurück zum Original. Das behebt den Trainingsstichtag, das Problem „hat meine Dateien nie gesehen“ und einen großen Teil der selbstbewussten Erfindung. Nicht alles davon.

Formulieren wir das Problem sauber

Ein Sprachmodell ist im Grunde eine sehr gute Kompression enormer Textmengen, den es einmal gelesen hat. Das verleiht ihm Flüssigkeit und Breite – und drei konkrete Schwächen: Nach seinem Stichtag weiß es nichts mehr dazu, es hat nie etwas Privates gesehen, und wenn es etwas nicht weiß, produziert es trotzdem eine plausible Antwort, denn plausiblen Text zu produzieren ist die ganze Aufgabe.

Man kann ein Modell nicht jedes Mal neu trainieren, wenn man ein Dokument schreibt. Also ändert man stattdessen, woher die Antwort kommt.

Die vier Schritte

  1. Indexieren. Deine Dokumente werden in Passagen zerlegt – jeweils ein paar Absätze – und jede Passage in eine numerische Repräsentation ihrer Bedeutung überführt. Das passiert einmal, vorab.
  2. Abrufen. Deine Frage wird genauso überführt, und das System findet die Passagen, die ihr in der Bedeutung am nächsten sind. Kein Stichwortabgleich: „was haben wir zu verspäteten Lieferungen vereinbart“ findet auch einen Absatz, in dem „Versandverzögerungen“ steht und keines deiner Wörter vorkommt.
  3. Anreichern. Diese Passagen kommen zusammen mit deiner Frage und der Anweisung, aus dem gelieferten Material zu antworten, in den Kontext des Modells.
  4. Erzeugen und belegen. Das Modell schreibt die Antwort, und weil das System weiß, welche Passagen es übergeben hat, kann es jede Aussage auf ihre Quelle zurückführen.

Das war es. Der clevere Teil ist Schritt 2; der vertrauenswürdige Teil ist Schritt 4.

Neurobase zeigt eine quellenbasierte Antwort mit Belegen, die auf das Originalmaterial verweisen.
Der Beleg ist das Feature. Eine Antwort, die du nicht prüfen kannst, ist nur eine selbstbewusste Meinung.

Warum „einfach in den Chat einfügen“ nicht dasselbe ist

Ein Dokument an eine Unterhaltung anzuhängen legt die ganze Datei für diese Unterhaltung in den Kontext. Für ein einzelnes Paper reicht das. Es hört auf zu funktionieren bei neunzig Dokumenten, wenn du nächsten Monat wieder fragen willst, oder wenn der relevante Absatz auf Seite 340 steht und die übrigen 339 als Rauschen um die Aufmerksamkeit des Modells konkurrieren.

RAG indexiert einmal und ruft pro Frage ab. Du zahlst die Einrichtung ein einziges Mal und fragst danach die gesamte Sammlung beliebig oft. Diesen Kompromiss haben wir in GPT-5 vs. Gemini vertieft: Modelle mit großem Kontext haben den Abstand bei Einzeldokumenten verkleinert, nicht aber bei Sammlungen, zu denen du zurückkehrst.

Wo RAG weiterhin scheitert

Hier lohnt Genauigkeit, denn „verankert“ wird benutzt, als hieße es „korrekt“:

Wann sich der Aufwand lohnt

SituationNutze
Ein Dokument, eine FrageIn einen Chat einfügen
Ein langes Dokument, das du wiederholt abfragstBeides, mit Tendenz zu RAG
Dutzende Dokumente zu einem ThemaRAG
Antworten, auf die sich andere verlassenRAG – wegen der Belege, nicht wegen des Abrufs
Gemischte Medien: PDF, Video, Audio, WebseitenRAG, sofern alle unterstützt werden
AllgemeinwissenKeins – frag einfach ein Modell

Wie das als Produkt aussieht

Neurobase ist unsere Fassung davon: Du gibst einem Neuron Quellen – PDFs, Textdateien, Video, YouTube, Webseiten, Bilder, Audio – und es indexiert sie zu einem fokussierten Assistenten, der mit Belegen auf das Originalmaterial antwortet. Antworten lassen sich im Lab testen, bevor du dich darauf verlässt, und mehrere Neuronen lassen sich zu einem Workflow verketten – mit Operationen wie Zusammenfassen, Vergleichen, Extrahieren und Übersetzen.

Wenn dir die konkrete Fassung lieber ist als das Konzept, fang mit einem Ordner voller PDFs an.

Häufige Fragen

Was ist RAG?

Retrieval-Augmented Generation: Das System durchsucht zuerst deine Dokumente, legt die relevanten Passagen in den Kontext des Modells und lässt es daraus antworten – mit Belegen.

Welches Problem löst es?

Trainingsstichtage, private Dokumente, die das Modell nie gesehen hat, und selbstbewusste Erfindung. Belege lassen dich prüfen statt vertrauen.

Ist das wie eine Datei hochzuladen?

Nein. Ein Anhang reicht für ein Dokument in einer Unterhaltung. RAG indexiert eine Sammlung einmal und ruft pro Frage ab, über viele Unterhaltungen hinweg.

Verhindert es Halluzinationen?

Es reduziert sie deutlich, nicht vollständig. Der Abruf kann danebentreffen, die Antwort über die Belege hinausgehen, die Quelle falsch sein. Belege machen das prüfbar.