senn-techsenn-tech
← Alle Referenzen02 · LLM

KI-Dokumentenverarbeitung mit Konsens-Prüfung

Referenzkunde: Logistik- und Handelsgruppe in Tirol · ~100 Mitarbeiter · 4 Standorte

Kundendaten in Texten und Bildern sind neutralisiert.

3Lesewege je Dokument
≤ 3 minhartes Limit je Dokument
100 %on-premise
01

Ausgangslage

Transportaufträge und Bestellungen kommen als PDF per Mail: jedes anders aufgebaut, und jedes wurde von Hand ins System übertragen. Tippfehler bei Mengen, Preisen oder Ladestellen inklusive.

Klassische OCR scheitert an der Vielfalt: Jeder Absender formatiert anders, und ein falsch gelesener Preis ist teurer als gar keiner.

Abb. 01Drei Lesewege, ein Abgleich: ein Feld gilt erst, wenn mindestens zwei Wege übereinstimmen. Rechenproben fangen Lesefehler vorher ab.
Grafik: drei Lesewege führen in einen Abgleich mit Konsens je Feld

Abb. 01Drei Lesewege, ein Abgleich: ein Feld gilt erst, wenn mindestens zwei Wege übereinstimmen. Rechenproben fangen Lesefehler vorher ab.

02

Das Schwierige daran

Sprachmodelle sind selbstbewusst falsch. Sie melden keinen Zweifel und liefern keine Fehlermeldung; sie liefern eine Zahl. Bei einem Transportauftrag ist diese Zahl ein Preis, und ein still falsch gelesener Preis kostet mehr, als das ganze Abtippen je gekostet hat.

Das entscheidende Problem ist also nicht das Lesen. Es ist das Wissen, wann man dem Gelesenen nicht trauen darf, und diese Frage kann ein einzelnes Modell grundsätzlich nicht beantworten: Es hat keinen unabhängigen Maßstab für sich selbst.

Dazu kommt die Vielfalt der Absender. Jedes Haus baut sein Formular anders, viele Dokumente sind Scans, manche schief, manche Fotos vom Ausdruck. Klassische Texterkennung bricht daran, und je schlechter die Vorlage, desto überzeugter erfindet ein Modell das Fehlende.

03

Lösung

Die Lösung liest jedes Dokument dreifach: Ein Vision-Modell sieht das PDF wie ein Mensch, ein Text-Modell liest den extrahierten Inhalt, und ein deterministischer Parser prüft Tabellen und Ankerbegriffe.

Ein Abgleich führt die drei Ergebnisse zusammen: Stimmen mindestens zwei Wege überein, gilt das Feld als sicher. Rechenproben wie Menge mal Einzelpreis gleich Gesamtpreis decken Lesefehler auf, und unsichere Felder werden markiert statt geraten.

Das geprüfte Ergebnis geht direkt in den TMS/ERP-Import. Der Mensch kontrolliert die markierten Stellen, statt alles abzutippen. Alles läuft auf den eigenen GPUs; kein Dokument verlässt das Haus.

Vision-LLMDoclingFastAPITMS/ERP
04

Wie es gebaut ist

Jedes Dokument läuft über drei bewusst verschiedene Wege. Ein Bildmodell sieht die Seite, wie ein Mensch sie sieht: Layout, Tabellenlinien, Position. Ein Textmodell liest den extrahierten Inhalt. Ein deterministischer Parser sucht Ankerbegriffe und Tabellenstrukturen ohne jede KI.

Dass die Wege verschieden sind, ist der ganze Punkt. Zwei Leser, die auf derselben Texterkennung aufsetzen, können sich einig und trotzdem gemeinsam falsch sein, denn sie erben denselben Fehler; nur ein Weg, der die Seite als Bild betrachtet, kann einen Fehler der Texterkennung überhaupt bemerken.

Ein Abgleich führt die drei Ergebnisse feldweise zusammen. Stimmen mindestens zwei überein, gilt das Feld als sicher. Sonst wird es markiert und nicht geraten. Dazu kommen Rechenproben: Menge mal Einzelpreis gegen die Endsumme, Positionssummen gegen den Gesamtbetrag.

Jedes Dokument hat ein hartes Zeitbudget. Ein Modell, das sich in eine Schleife redet, wird abgebrochen und der Vorgang der Nachbearbeitung übergeben. Das ist die unspektakulärste Sicherung im ganzen Aufbau, und die wirksamste.

Abb. 02Was mit jedem Feld passiert: sicher bei Übereinstimmung, markiert bei Widerspruch oder Rechenprobe, abgebrochen bei Überschreiten des Zeitbudgets.
Drei Ausgänge für jedes Feld: sicher, markiert, abgebrochen

Abb. 02Was mit jedem Feld passiert: sicher bei Übereinstimmung, markiert bei Widerspruch oder Rechenprobe, abgebrochen bei Überschreiten des Zeitbudgets.

BelegBildmodellsieht die Seite als BildTextmodellliest den erkannten TextParserAnkerbegriffe, ohne KIAbgleichfeldweise, 2 von 3Feld gilt als sicherzwei stimmen übereinFeld wird markiertund nicht geratenDazu Rechenproben (Menge mal Preis gegen die Endsumme) und ein hartes Zeitbudget je Beleg.
Zwei Leser auf derselben Texterkennung wären sich einig, und gemeinsam falsch. Deshalb sieht einer die Seite als Bild.
05

Im Betrieb

Der Mensch bleibt im Ablauf, nur an anderer Stelle. Er kontrolliert die markierten Felder, statt alles abzutippen, und damit verschiebt sich die Arbeit vom Erfassen zum Prüfen: genau jene Tätigkeit, in der ein Mensch dem System tatsächlich überlegen ist.

Neue Absenderformate brauchen keine Programmierung. Sie melden sich von selbst, weil bei ihnen die Zahl der markierten Felder steigt. Das ist zugleich die laufende Qualitätsmessung.

Der gesamte Ablauf läuft auf eigenen GPUs. Kein Dokument, kein Preis und keine Kundenadresse verlässt dabei das Haus.

06

Ergebnis

Der auf Tempo ausgelegte Lesepfad erfasst einen Transportauftrag in rund einer halben Minute, hart begrenzt auf drei Minuten je Dokument, mit Konfidenz je Feld statt blindem Vertrauen.

Abtippen wird zur Ausnahme: Der Aufwand pro Auftrag sinkt auf eine kurze Kontrolle, und Lesefehler fallen im Abgleich auf. Nicht erst in der Rechnung.

07

Was wir daraus gelernt haben

Das stärkere Modell war die schlechtere Wahl. Ein Modell, das seine Überlegungen mit ausgibt, liefert zwar gute Antworten, schreibt die Überlegung aber mit in die Antwort und zerstört damit das erwartete Datenformat. Für strukturierte Auslesung braucht man ein Modell, das antwortet und nicht eines, das denkt. Das war unser teuerster Irrtum in diesem Projekt, und aus keinem Datenblatt wäre er abzulesen gewesen.

Die wirksamste Prüfung im ganzen System ist keine KI. Es ist eine Multiplikation. Menge mal Einzelpreis gegen den Gesamtbetrag findet mehr Lesefehler als jedes Konfidenzmaß eines Modells, weil sie eine Aussage über die Wirklichkeit trifft und nicht eine über das Selbstvertrauen des Lesers.

Der Abgleich braucht vorher definierte Felder. Drei Leser, die in verschiedene Felder schreiben, ergeben keine Mehrheit, vielmehr drei Meinungen. Das Zielschema ist die Voraussetzung der Konsensprüfung und nicht ihr Nebenprodukt.

Ähnliches Problem?

Erzähl uns, was du vorhast, ein kurzes Gespräch klärt, ob sich das rechnet.