Grundlagen

Was ist ein RAG-System?

Ein RAG-System (Retrieval-Augmented Generation) verbindet ein Sprachmodell mit einer Suche in Ihren eigenen Dokumenten. Die KI antwortet dann nicht aus allgemeinem Weltwissen, sondern aus Ihren Unterlagen, und nennt die Quelle dazu.

Lesezeit etwa 8 Minuten

Definition: RAG in einem Satz

RAG steht für Retrieval-Augmented Generation. Bevor ein Sprachmodell eine Frage beantwortet, sucht das System in einer festgelegten Wissensbasis nach passenden Textstellen (Retrieval), gibt diese zusammen mit der Frage an das Modell (Augmentation) und lässt es auf dieser Grundlage antworten (Generation).

Der Unterschied zu einem normalen KI-Chat ist grundlegend. Ein Sprachmodell wie GPT, Claude oder Llama weiß nur, was in seinen Trainingsdaten stand. Ihre Preislisten, Verträge oder Wartungsanleitungen gehören nicht dazu. Ein RAG-System gibt dem Modell bei jeder Frage genau das Wissen mit, das es für eine korrekte Antwort braucht.

Kurz gesagt: Das Sprachmodell liefert die Sprachkompetenz, Ihre Dokumente liefern die Fakten, die Suche verbindet beides.

So funktioniert ein RAG-System

Ein RAG-System arbeitet in zwei Phasen. Die Vorbereitung passiert einmalig und danach laufend im Hintergrund. Die Beantwortung passiert bei jeder einzelnen Frage in wenigen Sekunden.

So funktioniert ein RAG-System Oben die Vorbereitung: Dokumente werden aufbereitet, in Abschnitte geteilt und in einem Suchindex gespeichert. Unten jede Anfrage: Die Frage wird im Index gesucht, die passenden Textstellen gehen mit der Frage an das Sprachmodell, das eine Antwort mit Quellen formuliert. VORBEREITUNG · EINMALIG UND LAUFEND Ihre DokumentePDF, Word, Mails, Wiki Aufbereitenbereinigen, strukturieren Abschnitte bildenmit Metadaten SuchindexVektordatenbank Suche nach Bedeutung, nicht nur nach Stichwort BEI JEDER FRAGE Fragein normaler Sprache Retrievalpassende Stellen finden AugmentationFrage + Textstellen GenerationSprachmodell Antwortmit Quellenangabe Das Sprachmodell sieht nur die gefundenen Textstellen, nicht Ihren ganzen Bestand.
Vorbereitung und Beantwortung in einem RAG-System

Phase 1: Vorbereitung der Wissensbasis

  1. Dokumente sammeln. Das System wird an Ihre Quellen angebunden, etwa SharePoint, Netzlaufwerke, ein DMS oder ein Wiki.
  2. Aufbereiten. Texte werden aus PDFs, Scans und Tabellen extrahiert, Dubletten und veraltete Versionen aussortiert.
  3. In Abschnitte teilen. Lange Dokumente werden in sinnvolle Einheiten zerlegt, zum Beispiel Kapitel oder Absätze, und mit Metadaten wie Titel, Datum und Abteilung versehen.
  4. Indexieren. Jeder Abschnitt wird in einen Zahlenvektor übersetzt, ein sogenanntes Embedding, das seine Bedeutung abbildet. Diese Vektoren landen in einer Vektordatenbank.

Phase 2: Beantwortung einer Frage

  1. Retrieval. Die Frage wird ebenfalls in einen Vektor übersetzt. Das System sucht die Abschnitte, deren Bedeutung am besten passt. Das funktioniert auch, wenn die Frage andere Wörter verwendet als das Dokument.
  2. Augmentation. Die besten Treffer werden zusammen mit der Frage und klaren Anweisungen an das Sprachmodell übergeben.
  3. Generation. Das Modell formuliert eine Antwort ausschließlich aus diesen Textstellen und verweist auf die Quellen. Findet es nichts Passendes, sagt es das.

Die Bausteine eines RAG-Systems

BausteinAufgabeWorauf es ankommt
KonnektorenHolen Dokumente aus Ihren QuellenAutomatische Aktualisierung, Übernahme der Zugriffsrechte
AufbereitungExtrahiert und bereinigt TextTabellen, Scans und Layouts korrekt erfassen
ChunkingTeilt Dokumente in AbschnitteSinnvolle Grenzen, Kontext bleibt erhalten
Embedding-ModellÜbersetzt Text in BedeutungsvektorenGute Qualität für Deutsch und Fachsprache
VektordatenbankSpeichert und durchsucht die VektorenSchnelle Suche, Filter nach Metadaten, Hosting in der EU
SprachmodellFormuliert die AntwortQualität, Kosten, Datenschutz, Austauschbarkeit
OberflächeChat im Browser, in Teams oder im IntranetDort, wo Ihr Team ohnehin arbeitet

Viele Projekte nutzen zusätzlich eine klassische Stichwortsuche parallel zur Vektorsuche (hybride Suche) und einen zweiten Sortierschritt für die Treffer (Reranking). Beides verbessert die Trefferqualität spürbar, gerade bei Artikelnummern, Normen und Eigennamen.

Was ist der Unterschied zwischen LLM und RAG?

Die beiden Begriffe stehen nicht in Konkurrenz. Ein LLM (Large Language Model) ist das Sprachmodell selbst, etwa GPT, Claude, Mistral oder Llama. Es versteht und formuliert Sprache, kennt aber nur sein Trainingswissen. RAG ist das Verfahren, das dem LLM bei jeder Frage passende Informationen aus einer externen Wissensbasis mitgibt.

Ein RAG-System enthält also immer ein LLM. Der Unterschied liegt darin, woher die Fakten kommen: beim reinen LLM aus dem Gedächtnis des Modells, beim RAG-System aus Ihren Dokumenten.

RAG, Fine-Tuning oder einfach ChatGPT?

KI-Chat allgemeinFine-TuningRAG-System
Kennt Ihre DokumenteNeinTeilweise, zum TrainingszeitpunktJa, immer aktuell
QuellenangabenNeinNeinJa
AktualisierungNicht möglichNeues Training nötigAutomatisch
ZugriffsrechteNeinNeinJa
AufwandGeringHochMittel, vor allem in der Datenaufbereitung

Fine-Tuning hat seinen Platz, etwa wenn ein Modell einen bestimmten Schreibstil oder ein Ausgabeformat lernen soll. Für die Frage „Was steht in unseren Unterlagen?“ ist RAG der Standard.

Woran RAG-Systeme in der Praxis scheitern

Einen RAG-Prototyp baut man heute an einem Nachmittag. Ein System, dem ein Team im Alltag vertraut, ist etwas anderes. Die häufigsten Gründe für schlechte Antworten liegen selten im Sprachmodell, sondern fast immer in den Daten:

  • Veraltete Versionen liegen neben aktuellen und widersprechen sich.
  • Gescannte PDFs ohne Texterkennung sind für das System unsichtbar.
  • Tabellen werden beim Einlesen zerrissen und verlieren ihre Bedeutung.
  • Abschnitte ohne Kontext wie „siehe oben“ oder „gilt wie in Anlage 2“ ergeben einzeln keinen Sinn.
  • Fehlende Metadaten verhindern, dass nach Gültigkeit, Land oder Abteilung gefiltert wird.

Deshalb beginnt jedes unserer Projekte mit der Datenaufbereitung.

Einsatz im Unternehmen

RAG-Systeme lohnen sich überall dort, wo Wissen in vielen Dokumenten verteilt ist und regelmäßig nachgefragt wird: Vertrieb, Kundenservice, Technik, Qualitätsmanagement, Personal und Recht. Ein guter Einstieg ist ein einzelner Anwendungsfall mit klarem Nutzen und überschaubarer Datenmenge. Wie ein RAG-System das Wissensmanagement in Ihrem Unternehmen verändert, lesen Sie unter KI-Wissensmanagement. Wie der Aufbau Schritt für Schritt abläuft, zeigt unser Leitfaden RAG-System aufbauen. Wenn Ihre Kundinnen und Kunden direkt Fragen stellen sollen, ist ein RAG-Chatbot die passende Form.

Häufige Fragen zu RAG

Was bedeutet RAG?
RAG steht für Retrieval-Augmented Generation, auf Deutsch etwa „durch Suche erweiterte Textgenerierung“. Ein Sprachmodell beantwortet Fragen nicht aus seinem Trainingswissen, sondern auf Basis von Textstellen, die vorher in Ihren eigenen Dokumenten gesucht wurden.
Ist ChatGPT ein RAG-System?
Nicht von sich aus. ChatGPT antwortet zunächst aus seinem Trainingswissen. Funktionen wie Websuche oder Datei-Uploads nutzen zwar RAG-Prinzipien, ersetzen aber kein System, das dauerhaft und mit Zugriffsrechten an Ihre Unternehmensquellen angebunden ist.
Was ist der Unterschied zwischen RAG und Fine-Tuning?
Beim Fine-Tuning wird ein Modell mit Ihren Daten nachtrainiert. Das ist aufwendig, schwer zu aktualisieren und liefert keine Quellen. Bei RAG bleibt das Modell unverändert, Ihr Wissen liegt in einem Suchindex, der sich jederzeit aktualisieren lässt. Für Unternehmenswissen ist RAG in den meisten Fällen die bessere Wahl.
Welche Dokumente kann ein RAG-System verarbeiten?
Alles, was sich als Text erschließen lässt: PDF, Word, PowerPoint, Excel, E-Mails, Wiki-Seiten, Tickets und Datenbankexporte. Gescannte Dokumente brauchen vorher eine Texterkennung.
Kann ein RAG-System halluzinieren?
Seltener als ein reines Sprachmodell, aber nicht nie. Deshalb gehören Quellenangaben, klare Anweisungen, bei fehlenden Informationen nichts zu erfinden, und regelmäßige Tests mit echten Fragen zu jedem System, das wir bauen.
Wie kann ich ein RAG-System aufbauen?
In fünf Schritten: Anwendungsfall und Testfragen festlegen, Dokumente aufbereiten, Abschnitte bilden und in einer Vektordatenbank indexieren, Suche und Sprachmodell verbinden, dann mit echten Fragen testen und nachschärfen. Einen Prototyp schaffen Entwickler schnell. Den Aufwand machen Datenqualität, Zugriffsrechte und Betrieb aus. Details im Leitfaden RAG-System aufbauen.
Welche Sprachmodelle kommen zum Einsatz?
Das hängt von Ihren Anforderungen an Qualität, Kosten und Datenschutz ab. Wir nutzen etablierte Modelle über EU-Rechenzentren oder Open-Source-Modelle auf eigener Infrastruktur und können das Modell später wechseln, ohne den Suchindex neu aufzubauen.

Welche Fragen soll Ihr RAG-System beantworten?

In 30 Minuten klären wir Anwendungsfall, Datenlage und den sinnvollsten ersten Schritt. Kostenlos und ohne Verkaufsdruck.