Datenaufbereitung für KI

Gute Antworten beginnen bei den Daten

Ein RAG-System ist nur so gut wie die Dokumente dahinter. Wir bringen Ihre Bestände in einen Zustand, in dem eine KI die richtige Stelle findet und nicht irgendeine.

Warum Datenaufbereitung über Erfolg oder Frust entscheidet

Die meisten RAG-Prototypen funktionieren in der Demo und enttäuschen im Alltag. Der Grund ist fast nie das Sprachmodell. Es sind die Dokumente: fünf Versionen derselben Preisliste, eingescannte Verträge ohne Texterkennung, Excel-Tabellen, die beim Einlesen ihre Spaltenköpfe verlieren.

Das Sprachmodell kann nur mit den Textstellen arbeiten, die die Suche ihm liefert. Findet die Suche die veraltete Version, bekommt Ihr Team eine falsche Antwort, formuliert mit großer Überzeugung.

Unsere Erfahrung: Der größte Teil der Arbeit an einem verlässlichen RAG-System steckt in der Aufbereitung der Daten. Wer diesen Schritt überspringt, zahlt später mit schlechten Antworten und sinkendem Vertrauen.

Die sieben Schritte der Datenaufbereitung

1. Inventur

Welche Quellen gibt es, wie viele Dokumente, in welchen Formaten und Sprachen? Welche Bestände sind für den Anwendungsfall relevant, welche bleiben bewusst draußen?

2. Bereinigung

Wir erkennen Dubletten und Versionsketten und legen fest, welche Fassung gilt. Entwürfe, Kopien und Archivstände werden aussortiert oder gekennzeichnet.

3. Texterschließung

Scans erhalten eine Texterkennung, PDFs werden mit Blick auf Layout, Spalten und Kopfzeilen ausgelesen. Tabellen und Diagramme werden so übersetzt, dass ihr Inhalt verständlich bleibt.

4. Strukturierung

Dokumente werden an sinnvollen Grenzen in Abschnitte geteilt, etwa an Kapiteln oder Paragrafen. Jeder Abschnitt behält den Kontext, zu dem er gehört: Dokumenttitel, Kapitel, übergeordnete Überschrift.

5. Metadaten

Gültigkeitsdatum, Land, Produktlinie, Abteilung, Sprache. Mit diesen Angaben kann das System gezielt filtern und etwa nur die aktuell gültige AGB für Österreich heranziehen.

6. Zugriffsrechte

Die Berechtigungen aus Ihren Quellsystemen werden übernommen. Vertrauliche Bereiche bleiben geschützt, auch innerhalb des RAG-Systems.

7. Laufender Prozess

Aufbereitung ist kein einmaliges Projekt. Wir richten die Verarbeitung so ein, dass neue und geänderte Dokumente automatisch nach denselben Regeln aufbereitet werden.

Papierakten und alte Scans

Viel Wissen im Mittelstand liegt noch in Ordnern oder als reine Bildscans vor. Für ein RAG-System ist es damit unsichtbar. Über unser Partnerangebot ordner-digitalisieren.de digitalisieren wir Papierbestände und erschließen sie per Texterkennung, sodass sie direkt in die Aufbereitung fließen.

Was Sie nach dem Datencheck erhalten

  • Eine Übersicht Ihrer Quellen mit Umfang, Formaten und Zustand
  • Konkrete Beispiele, wo heute falsche oder keine Antworten entstehen würden
  • Eine Empfehlung, welche Bestände für den Pilot sinnvoll sind
  • Ein verbindliches Angebot für Aufbereitung und Pilot

Häufige Fragen zur Datenaufbereitung

Warum reicht es nicht, einfach alle Dateien hochzuladen?
Weil das System dann auch alle Fehler Ihres Bestands übernimmt: alte Versionen, doppelte Dateien, unlesbare Scans und zerrissene Tabellen. Die Antworten werden widersprüchlich, und das Vertrauen im Team ist schnell verspielt.
Müssen wir unsere Ablage dafür neu organisieren?
Nein. Wir bereiten die Daten für das RAG-System auf, Ihre gewohnte Ablage bleibt, wie sie ist. Häufig fallen dabei aber Hinweise ab, wo sich eine Bereinigung auch für die tägliche Arbeit lohnt.
Was passiert mit neuen Dokumenten?
Wir richten die Aufbereitung als laufenden Prozess ein. Neue und geänderte Dokumente werden automatisch verarbeitet, gelöschte fallen aus dem Index.
Wie gehen Sie mit personenbezogenen Daten um?
Wir legen gemeinsam fest, welche Quellen und Ordner überhaupt einbezogen werden. Wo nötig, schließen wir Bereiche aus oder filtern personenbezogene Angaben vor der Indexierung.

Welche Fragen soll Ihr RAG-System beantworten?

In 30 Minuten klären wir Anwendungsfall, Datenlage und den sinnvollsten ersten Schritt. Kostenlos und ohne Verkaufsdruck.