Definition: RAG in einem Satz
RAG steht für Retrieval-Augmented Generation. Bevor ein Sprachmodell eine Frage beantwortet, sucht das System in einer festgelegten Wissensbasis nach passenden Textstellen (Retrieval), gibt diese zusammen mit der Frage an das Modell (Augmentation) und lässt es auf dieser Grundlage antworten (Generation).
Der Unterschied zu einem normalen KI-Chat ist grundlegend. Ein Sprachmodell wie GPT, Claude oder Llama weiß nur, was in seinen Trainingsdaten stand. Ihre Preislisten, Verträge oder Wartungsanleitungen gehören nicht dazu. Ein RAG-System gibt dem Modell bei jeder Frage genau das Wissen mit, das es für eine korrekte Antwort braucht.
Kurz gesagt: Das Sprachmodell liefert die Sprachkompetenz, Ihre Dokumente liefern die Fakten, die Suche verbindet beides.
So funktioniert ein RAG-System
Ein RAG-System arbeitet in zwei Phasen. Die Vorbereitung passiert einmalig und danach laufend im Hintergrund. Die Beantwortung passiert bei jeder einzelnen Frage in wenigen Sekunden.
Phase 1: Vorbereitung der Wissensbasis
- Dokumente sammeln. Das System wird an Ihre Quellen angebunden, etwa SharePoint, Netzlaufwerke, ein DMS oder ein Wiki.
- Aufbereiten. Texte werden aus PDFs, Scans und Tabellen extrahiert, Dubletten und veraltete Versionen aussortiert.
- In Abschnitte teilen. Lange Dokumente werden in sinnvolle Einheiten zerlegt, zum Beispiel Kapitel oder Absätze, und mit Metadaten wie Titel, Datum und Abteilung versehen.
- Indexieren. Jeder Abschnitt wird in einen Zahlenvektor übersetzt, ein sogenanntes Embedding, das seine Bedeutung abbildet. Diese Vektoren landen in einer Vektordatenbank.
Phase 2: Beantwortung einer Frage
- Retrieval. Die Frage wird ebenfalls in einen Vektor übersetzt. Das System sucht die Abschnitte, deren Bedeutung am besten passt. Das funktioniert auch, wenn die Frage andere Wörter verwendet als das Dokument.
- Augmentation. Die besten Treffer werden zusammen mit der Frage und klaren Anweisungen an das Sprachmodell übergeben.
- Generation. Das Modell formuliert eine Antwort ausschließlich aus diesen Textstellen und verweist auf die Quellen. Findet es nichts Passendes, sagt es das.
Die Bausteine eines RAG-Systems
| Baustein | Aufgabe | Worauf es ankommt |
|---|---|---|
| Konnektoren | Holen Dokumente aus Ihren Quellen | Automatische Aktualisierung, Übernahme der Zugriffsrechte |
| Aufbereitung | Extrahiert und bereinigt Text | Tabellen, Scans und Layouts korrekt erfassen |
| Chunking | Teilt Dokumente in Abschnitte | Sinnvolle Grenzen, Kontext bleibt erhalten |
| Embedding-Modell | Übersetzt Text in Bedeutungsvektoren | Gute Qualität für Deutsch und Fachsprache |
| Vektordatenbank | Speichert und durchsucht die Vektoren | Schnelle Suche, Filter nach Metadaten, Hosting in der EU |
| Sprachmodell | Formuliert die Antwort | Qualität, Kosten, Datenschutz, Austauschbarkeit |
| Oberfläche | Chat im Browser, in Teams oder im Intranet | Dort, wo Ihr Team ohnehin arbeitet |
Viele Projekte nutzen zusätzlich eine klassische Stichwortsuche parallel zur Vektorsuche (hybride Suche) und einen zweiten Sortierschritt für die Treffer (Reranking). Beides verbessert die Trefferqualität spürbar, gerade bei Artikelnummern, Normen und Eigennamen.
Was ist der Unterschied zwischen LLM und RAG?
Die beiden Begriffe stehen nicht in Konkurrenz. Ein LLM (Large Language Model) ist das Sprachmodell selbst, etwa GPT, Claude, Mistral oder Llama. Es versteht und formuliert Sprache, kennt aber nur sein Trainingswissen. RAG ist das Verfahren, das dem LLM bei jeder Frage passende Informationen aus einer externen Wissensbasis mitgibt.
Ein RAG-System enthält also immer ein LLM. Der Unterschied liegt darin, woher die Fakten kommen: beim reinen LLM aus dem Gedächtnis des Modells, beim RAG-System aus Ihren Dokumenten.
RAG, Fine-Tuning oder einfach ChatGPT?
| KI-Chat allgemein | Fine-Tuning | RAG-System | |
|---|---|---|---|
| Kennt Ihre Dokumente | Nein | Teilweise, zum Trainingszeitpunkt | Ja, immer aktuell |
| Quellenangaben | Nein | Nein | Ja |
| Aktualisierung | Nicht möglich | Neues Training nötig | Automatisch |
| Zugriffsrechte | Nein | Nein | Ja |
| Aufwand | Gering | Hoch | Mittel, vor allem in der Datenaufbereitung |
Fine-Tuning hat seinen Platz, etwa wenn ein Modell einen bestimmten Schreibstil oder ein Ausgabeformat lernen soll. Für die Frage „Was steht in unseren Unterlagen?“ ist RAG der Standard.
Woran RAG-Systeme in der Praxis scheitern
Einen RAG-Prototyp baut man heute an einem Nachmittag. Ein System, dem ein Team im Alltag vertraut, ist etwas anderes. Die häufigsten Gründe für schlechte Antworten liegen selten im Sprachmodell, sondern fast immer in den Daten:
- Veraltete Versionen liegen neben aktuellen und widersprechen sich.
- Gescannte PDFs ohne Texterkennung sind für das System unsichtbar.
- Tabellen werden beim Einlesen zerrissen und verlieren ihre Bedeutung.
- Abschnitte ohne Kontext wie „siehe oben“ oder „gilt wie in Anlage 2“ ergeben einzeln keinen Sinn.
- Fehlende Metadaten verhindern, dass nach Gültigkeit, Land oder Abteilung gefiltert wird.
Deshalb beginnt jedes unserer Projekte mit der Datenaufbereitung.
Einsatz im Unternehmen
RAG-Systeme lohnen sich überall dort, wo Wissen in vielen Dokumenten verteilt ist und regelmäßig nachgefragt wird: Vertrieb, Kundenservice, Technik, Qualitätsmanagement, Personal und Recht. Ein guter Einstieg ist ein einzelner Anwendungsfall mit klarem Nutzen und überschaubarer Datenmenge. Wie ein RAG-System das Wissensmanagement in Ihrem Unternehmen verändert, lesen Sie unter KI-Wissensmanagement. Wie der Aufbau Schritt für Schritt abläuft, zeigt unser Leitfaden RAG-System aufbauen. Wenn Ihre Kundinnen und Kunden direkt Fragen stellen sollen, ist ein RAG-Chatbot die passende Form.