Leitfaden

RAG-System aufbauen: Architektur und Schritte

Einen RAG-Prototyp bauen Entwickler an einem Nachmittag. Ein System, dem Ihr Team im Alltag vertraut, braucht mehr. Dieser Leitfaden zeigt die Architektur, die Schritte und die typischen Stolperfallen.

Lesezeit etwa 9 Minuten

Die Architektur eines RAG-Systems

Jedes RAG-System besteht aus zwei Strecken. Die Indexierungs-Pipeline bereitet Ihre Dokumente vor und legt sie durchsuchbar ab. Die Abfrage-Pipeline beantwortet Fragen in Echtzeit.

SchichtKomponentenTypische Entscheidungen
QuellenKonnektoren zu SharePoint, Netzlaufwerk, DMS, Wiki, TicketsWelche Quellen, wie oft synchronisieren, Rechte übernehmen
AufbereitungParser, Texterkennung, Tabellenerkennung, BereinigungUmgang mit Scans, Tabellen, Versionen
ChunkingAufteilung in Abschnitte mit MetadatenNach Struktur oder fester Länge, Überlappung, Kontext-Header
EmbeddingEmbedding-ModellQualität für Deutsch, Mehrsprachigkeit, Hosting
SpeicherVektordatenbank, optional StichwortindexProdukt, Hosting in der EU, Filter nach Metadaten
RetrievalVektorsuche, hybride Suche, Reranking, RechteprüfungAnzahl Treffer, Gewichtung, Filter
GenerierungSprachmodell, Prompt mit RegelnModellwahl, Quellenpflicht, Verhalten ohne Treffer
Oberfläche und BetriebChat, Teams-App, API, Logging, MonitoringWo Nutzer arbeiten, welche Metriken zählen

In sechs Schritten zum produktiven RAG-System

1. Anwendungsfall und Testfragen festlegen

Starten Sie mit einer Nutzergruppe und 30 bis 50 echten Fragen, die heute regelmäßig gestellt werden. Notieren Sie zu jeder Frage, in welchem Dokument die richtige Antwort steht. Dieses Testset ist später Ihr Maßstab für Qualität.

2. Daten sichten und aufbereiten

Prüfen Sie, ob die Antworten tatsächlich in lesbarer Form vorliegen. Veraltete Versionen, Scans ohne Texterkennung und komplexe Tabellen sind die häufigsten Probleme. Details unter Datenaufbereitung.

3. Chunking und Metadaten

Teilen Sie Dokumente an ihrer natürlichen Struktur, also an Kapiteln, Paragrafen oder Abschnitten. Geben Sie jedem Abschnitt Titel, Kapitelüberschrift, Datum und Gültigkeitsbereich mit. Abschnitte ohne Kontext sind die häufigste Ursache für schwache Treffer.

4. Indexieren

Wählen Sie ein Embedding-Modell, das Deutsch und Ihre Fachsprache gut abbildet, und legen Sie die Vektoren in einer Vektordatenbank ab. Ergänzen Sie eine Stichwortsuche für Artikelnummern, Normen und Eigennamen.

5. Retrieval und Generierung verbinden

Die Suche liefert die besten Abschnitte, ein Reranker sortiert sie nach Relevanz, das Sprachmodell formuliert die Antwort. Der Prompt legt fest: nur aus den Quellen antworten, Quellen nennen, bei fehlenden Informationen nichts erfinden.

6. Testen, messen, nachschärfen

Lassen Sie das Testset laufen und bewerten Sie Suche und Antwort getrennt. Findet die Suche die richtige Stelle nicht, hilft kein besseres Sprachmodell. Danach geht der Pilot an eine kleine Nutzergruppe, deren Feedback in die nächste Runde fließt.

Werkzeuge im Überblick

BereichBeispiele
FrameworksLangChain, LlamaIndex, Haystack
Vektordatenbankenpgvector (PostgreSQL), Qdrant, Weaviate, Milvus, OpenSearch
SprachmodelleModelle von Anthropic, OpenAI, Mistral oder Meta, über EU-Cloud-Regionen oder selbst gehostet
DokumentenverarbeitungParser für PDF und Office, Texterkennung (OCR), Tabellenerkennung
QualitätsmessungTestsets mit erwarteten Antworten, Frameworks wie Ragas

Die Werkzeugwahl ist selten der Engpass. Entscheidend sind Datenqualität, saubere Rechte und ein Testset, an dem Sie Fortschritt messen.

Die häufigsten Stolperfallen

  • Alles auf einmal indexieren. Mehr Dokumente bedeuten nicht bessere Antworten, sondern mehr Widersprüche.
  • Kein Testset. Ohne feste Testfragen bleibt Qualität Gefühlssache.
  • Rechte vergessen. Ein Assistent, der Gehaltslisten zitiert, ist schneller abgeschaltet als eingeführt.
  • Nur Vektorsuche. Artikelnummern und Normbezeichnungen findet eine reine Vektorsuche oft schlecht.
  • Kein Betrieb geplant. Ohne automatische Aktualisierung veraltet die Wissensbasis in Wochen.

Selbst bauen oder bauen lassen?

Wenn Sie ein eigenes Entwicklerteam mit Erfahrung in Datenverarbeitung haben, ist ein eigener Aufbau gut machbar. Dieser Leitfaden ist dafür ein Startpunkt. Wenn Sie schnell zu einem verlässlichen Ergebnis kommen wollen, ohne intern Kapazität aufzubauen, übernehmen wir Aufbereitung, Aufbau und Betrieb. Ein Mittelweg ist ebenfalls möglich: Wir bauen den Pilot, Ihr Team übernimmt den Betrieb.

Häufige Fragen zum Aufbau

Kann ich ein RAG-System selber bauen?
Einen Prototyp ja. Mit Frameworks wie LangChain oder LlamaIndex, einer Vektordatenbank und einem Sprachmodell entsteht in kurzer Zeit eine erste Version. Der Aufwand für ein System, das im Alltag verlässlich funktioniert, liegt in Datenaufbereitung, Zugriffsrechten, Tests und Betrieb.
Welche Architektur braucht ein RAG-System?
Mindestens eine Indexierungs-Pipeline (Einlesen, Aufbereiten, Chunking, Embedding), eine Vektordatenbank, einen Retrieval-Schritt und ein Sprachmodell mit Oberfläche. In der Praxis kommen hybride Suche, Reranking, Rechteprüfung und Monitoring hinzu.
Wie misst man die Qualität eines RAG-Systems?
Mit einem Testset aus echten Fragen und erwarteten Antworten. Gemessen wird getrennt, ob die Suche die richtigen Textstellen findet und ob das Modell daraus eine korrekte, belegte Antwort macht.
Braucht man für RAG eine GPU oder eigene Server?
Nicht zwingend. Sprachmodelle lassen sich über Cloud-Dienste in EU-Rechenzentren nutzen. Eigene Hardware lohnt sich vor allem, wenn Daten das Haus nicht verlassen dürfen oder sehr viele Anfragen anfallen.

Welche Fragen soll Ihr RAG-System beantworten?

In 30 Minuten klären wir Anwendungsfall, Datenlage und den sinnvollsten ersten Schritt. Kostenlos und ohne Verkaufsdruck.