Warum Datenaufbereitung über Erfolg oder Frust entscheidet
Die meisten RAG-Prototypen funktionieren in der Demo und enttäuschen im Alltag. Der Grund ist fast nie das Sprachmodell. Es sind die Dokumente: fünf Versionen derselben Preisliste, eingescannte Verträge ohne Texterkennung, Excel-Tabellen, die beim Einlesen ihre Spaltenköpfe verlieren.
Das Sprachmodell kann nur mit den Textstellen arbeiten, die die Suche ihm liefert. Findet die Suche die veraltete Version, bekommt Ihr Team eine falsche Antwort, formuliert mit großer Überzeugung.
Unsere Erfahrung: Der größte Teil der Arbeit an einem verlässlichen RAG-System steckt in der Aufbereitung der Daten. Wer diesen Schritt überspringt, zahlt später mit schlechten Antworten und sinkendem Vertrauen.
Die sieben Schritte der Datenaufbereitung
1. Inventur
Welche Quellen gibt es, wie viele Dokumente, in welchen Formaten und Sprachen? Welche Bestände sind für den Anwendungsfall relevant, welche bleiben bewusst draußen?
2. Bereinigung
Wir erkennen Dubletten und Versionsketten und legen fest, welche Fassung gilt. Entwürfe, Kopien und Archivstände werden aussortiert oder gekennzeichnet.
3. Texterschließung
Scans erhalten eine Texterkennung, PDFs werden mit Blick auf Layout, Spalten und Kopfzeilen ausgelesen. Tabellen und Diagramme werden so übersetzt, dass ihr Inhalt verständlich bleibt.
4. Strukturierung
Dokumente werden an sinnvollen Grenzen in Abschnitte geteilt, etwa an Kapiteln oder Paragrafen. Jeder Abschnitt behält den Kontext, zu dem er gehört: Dokumenttitel, Kapitel, übergeordnete Überschrift.
5. Metadaten
Gültigkeitsdatum, Land, Produktlinie, Abteilung, Sprache. Mit diesen Angaben kann das System gezielt filtern und etwa nur die aktuell gültige AGB für Österreich heranziehen.
6. Zugriffsrechte
Die Berechtigungen aus Ihren Quellsystemen werden übernommen. Vertrauliche Bereiche bleiben geschützt, auch innerhalb des RAG-Systems.
7. Laufender Prozess
Aufbereitung ist kein einmaliges Projekt. Wir richten die Verarbeitung so ein, dass neue und geänderte Dokumente automatisch nach denselben Regeln aufbereitet werden.
Papierakten und alte Scans
Viel Wissen im Mittelstand liegt noch in Ordnern oder als reine Bildscans vor. Für ein RAG-System ist es damit unsichtbar. Über unser Partnerangebot ordner-digitalisieren.de digitalisieren wir Papierbestände und erschließen sie per Texterkennung, sodass sie direkt in die Aufbereitung fließen.
Was Sie nach dem Datencheck erhalten
- Eine Übersicht Ihrer Quellen mit Umfang, Formaten und Zustand
- Konkrete Beispiele, wo heute falsche oder keine Antworten entstehen würden
- Eine Empfehlung, welche Bestände für den Pilot sinnvoll sind
- Ein verbindliches Angebot für Aufbereitung und Pilot