Die Architektur eines RAG-Systems
Jedes RAG-System besteht aus zwei Strecken. Die Indexierungs-Pipeline bereitet Ihre Dokumente vor und legt sie durchsuchbar ab. Die Abfrage-Pipeline beantwortet Fragen in Echtzeit.
| Schicht | Komponenten | Typische Entscheidungen |
|---|---|---|
| Quellen | Konnektoren zu SharePoint, Netzlaufwerk, DMS, Wiki, Tickets | Welche Quellen, wie oft synchronisieren, Rechte übernehmen |
| Aufbereitung | Parser, Texterkennung, Tabellenerkennung, Bereinigung | Umgang mit Scans, Tabellen, Versionen |
| Chunking | Aufteilung in Abschnitte mit Metadaten | Nach Struktur oder fester Länge, Überlappung, Kontext-Header |
| Embedding | Embedding-Modell | Qualität für Deutsch, Mehrsprachigkeit, Hosting |
| Speicher | Vektordatenbank, optional Stichwortindex | Produkt, Hosting in der EU, Filter nach Metadaten |
| Retrieval | Vektorsuche, hybride Suche, Reranking, Rechteprüfung | Anzahl Treffer, Gewichtung, Filter |
| Generierung | Sprachmodell, Prompt mit Regeln | Modellwahl, Quellenpflicht, Verhalten ohne Treffer |
| Oberfläche und Betrieb | Chat, Teams-App, API, Logging, Monitoring | Wo Nutzer arbeiten, welche Metriken zählen |
In sechs Schritten zum produktiven RAG-System
1. Anwendungsfall und Testfragen festlegen
Starten Sie mit einer Nutzergruppe und 30 bis 50 echten Fragen, die heute regelmäßig gestellt werden. Notieren Sie zu jeder Frage, in welchem Dokument die richtige Antwort steht. Dieses Testset ist später Ihr Maßstab für Qualität.
2. Daten sichten und aufbereiten
Prüfen Sie, ob die Antworten tatsächlich in lesbarer Form vorliegen. Veraltete Versionen, Scans ohne Texterkennung und komplexe Tabellen sind die häufigsten Probleme. Details unter Datenaufbereitung.
3. Chunking und Metadaten
Teilen Sie Dokumente an ihrer natürlichen Struktur, also an Kapiteln, Paragrafen oder Abschnitten. Geben Sie jedem Abschnitt Titel, Kapitelüberschrift, Datum und Gültigkeitsbereich mit. Abschnitte ohne Kontext sind die häufigste Ursache für schwache Treffer.
4. Indexieren
Wählen Sie ein Embedding-Modell, das Deutsch und Ihre Fachsprache gut abbildet, und legen Sie die Vektoren in einer Vektordatenbank ab. Ergänzen Sie eine Stichwortsuche für Artikelnummern, Normen und Eigennamen.
5. Retrieval und Generierung verbinden
Die Suche liefert die besten Abschnitte, ein Reranker sortiert sie nach Relevanz, das Sprachmodell formuliert die Antwort. Der Prompt legt fest: nur aus den Quellen antworten, Quellen nennen, bei fehlenden Informationen nichts erfinden.
6. Testen, messen, nachschärfen
Lassen Sie das Testset laufen und bewerten Sie Suche und Antwort getrennt. Findet die Suche die richtige Stelle nicht, hilft kein besseres Sprachmodell. Danach geht der Pilot an eine kleine Nutzergruppe, deren Feedback in die nächste Runde fließt.
Werkzeuge im Überblick
| Bereich | Beispiele |
|---|---|
| Frameworks | LangChain, LlamaIndex, Haystack |
| Vektordatenbanken | pgvector (PostgreSQL), Qdrant, Weaviate, Milvus, OpenSearch |
| Sprachmodelle | Modelle von Anthropic, OpenAI, Mistral oder Meta, über EU-Cloud-Regionen oder selbst gehostet |
| Dokumentenverarbeitung | Parser für PDF und Office, Texterkennung (OCR), Tabellenerkennung |
| Qualitätsmessung | Testsets mit erwarteten Antworten, Frameworks wie Ragas |
Die Werkzeugwahl ist selten der Engpass. Entscheidend sind Datenqualität, saubere Rechte und ein Testset, an dem Sie Fortschritt messen.
Die häufigsten Stolperfallen
- Alles auf einmal indexieren. Mehr Dokumente bedeuten nicht bessere Antworten, sondern mehr Widersprüche.
- Kein Testset. Ohne feste Testfragen bleibt Qualität Gefühlssache.
- Rechte vergessen. Ein Assistent, der Gehaltslisten zitiert, ist schneller abgeschaltet als eingeführt.
- Nur Vektorsuche. Artikelnummern und Normbezeichnungen findet eine reine Vektorsuche oft schlecht.
- Kein Betrieb geplant. Ohne automatische Aktualisierung veraltet die Wissensbasis in Wochen.
Selbst bauen oder bauen lassen?
Wenn Sie ein eigenes Entwicklerteam mit Erfahrung in Datenverarbeitung haben, ist ein eigener Aufbau gut machbar. Dieser Leitfaden ist dafür ein Startpunkt. Wenn Sie schnell zu einem verlässlichen Ergebnis kommen wollen, ohne intern Kapazität aufzubauen, übernehmen wir Aufbereitung, Aufbau und Betrieb. Ein Mittelweg ist ebenfalls möglich: Wir bauen den Pilot, Ihr Team übernimmt den Betrieb.