KI liest Lohnausweise: Warum Testdaten wichtiger sind als das Modell

Der Beitrag erklärt, warum zuverlässige Dokumentenextraktion mit guten Testdaten beginnt.

Thumbnail

Ein Lohnausweis, eine Krankenkassenbescheinigung oder ein Depotauszug ist für dich als Mensch meist auf den ersten Blick verständlich. Du siehst die Tabelle, findest die Zahl, ordnest sie ein - fertig. Für ein KI-System ist genau das eine der schwierigsten Aufgaben überhaupt. Es muss das Dokument lesen, richtig einordnen und die relevanten Angaben den passenden Feldern zuweisen, ohne dass jemand daneben sitzt und mitdenkt.

Dieser Prozess trägt einen eigenen Namen: Dokumentenextraktion. Dabei werden unstrukturierte Dokumente in strukturierte Daten verwandelt - etwa der Bruttolohn aus einem Lohnausweis oder der Rückkaufswert aus einer Versicherungsbescheinigung. Klingt simpel, ist es aber nicht. Die eigentliche Herausforderung liegt nämlich nicht darin, ein einzelnes Dokument korrekt zu verarbeiten. Spannend wird es erst bei der Frage, ob ein System auch mit völlig unterschiedlichen Formularen, wechselnden Scanqualitäten und kniffligen Sonderfällen zuverlässig klarkommt. Genau hier entscheidet sich, ob eine KI-Lösung im Alltag wirklich taugt oder nur in der Theorie glänzt.

Warum wenige Testdokumente nicht ausreichen

Dokumente derselben Kategorie sehen oft überraschend unterschiedlich aus. Versicherungen nutzen andere Tabellen und Bezeichnungen, Banken strukturieren ihre Auszüge nach eigenen Regeln, und selbst genormte Formulare werden in der Praxis unterschiedlich ausgefüllt. Wer glaubt, mit ein paar Musterdokumenten sei die Sache erledigt, irrt sich schnell.

Grafik zu Testdaten für KI bei Lohnausweisen und Dokumentenextraktion.

Dokumenten Chaos

Hinzu kommen ganz praktische Stolpersteine, die dir aus dem Alltag vermutlich bekannt sind:

  • schiefe oder unscharfe Scans
  • schlecht erkennbare Zahlen
  • mehrere Dokumente in einer einzigen PDF-Datei
  • unterschiedliche Schreibweisen und Zahlenformate
  • Tabellen mit Einzelwerten und Gesamtsummen
  • ähnliche Dokumentarten mit unterschiedlicher steuerlicher Bedeutung

Ein System, das mit drei sorgfältig ausgewählten Lohnausweisen funktioniert, muss noch lange nicht mit dem echten Dokumentenchaos einer Treuhandgesellschaft zurechtkommen. Deshalb braucht es einen möglichst breiten und repräsentativen Datensatz - einen, der nicht nur einfache Beispiele enthält, sondern auch unterschiedliche Herausgeber, Layouts, Qualitätsstufen und bekannte Problemfälle abbildet.

Was Data Labelling wirklich bedeutet

Damit sich die Qualität eines Systems überhaupt objektiv messen lässt, braucht jedes Testdokument ein erwartetes Ergebnis. Dieser Schritt heisst Data Labelling. Bei einem Lohnausweis hältst du dabei zum Beispiel fest:

  • Um welche Dokumentart handelt es sich?
  • Welcher Bruttolohn müsste erkannt werden?
  • Welche Sozialabzüge sind ausgewiesen?
  • Welche Person gehört zum Dokument?
  • Welche weiteren steuerlich relevanten Angaben sind vorhanden?

Diese geprüften Sollwerte nennt man häufig Ground Truth. Gemeint ist damit nichts Geheimnisvolles, sondern schlicht die fachlich korrekte Referenz, an der sich das Ergebnis des Systems messen muss.

Gerade deshalb ist das Fachwissen von Treuhänderinnen und Treuhändern beim Aufbau solcher Testdaten unverzichtbar. Ohne diese Prüfung baust du dein System auf einem Fundament aus Vermutungen statt auf gesichertem Wissen.

Backtesting statt Stichproben

Bei einem Backtest lässt du die gesamte Verarbeitung automatisiert über einen bestehenden Testdatensatz laufen. Anschliessend vergleicht das System die erkannten Kategorien und Werte mit den hinterlegten Sollwerten. Kein Zufall, keine Momentaufnahme - sondern ein reproduzierbarer Check über die gesamte Breite deiner Dokumente.

Dadurch lässt sich einiges messen, was dir sonst verborgen bliebe:

  • Wie viele Dokumente wurden richtig klassifiziert?
  • Wie viele Felder wurden korrekt extrahiert?
  • Bei welchen Dokumentarten treten Fehler auf?
  • Wie lange dauert die Verarbeitung?
  • Hat eine technische Änderung die Qualität verbessert oder verschlechtert?

Das ist besonders wichtig, weil eine Verbesserung an einer Stelle unbemerkt neue Fehler an anderer Stelle auslösen kann. Eine zusätzliche Prüfstufe klingt zunächst nach einer guten Idee, kann aber bereits korrekte Werte plötzlich verändern. Ohne einen vollständigen Backtest würde dir eine solche Verschlechterung womöglich erst im laufenden Betrieb auffallen - dann, wenn es am unangenehmsten ist.

Der Datensatz wächst mit dem System

Ein guter Testdatensatz ist nie fertig. Sobald im Betrieb ein neuer Sonderfall auftaucht, wird er anonymisiert, fachlich geprüft und als zusätzlicher Testfall aufgenommen. So entsteht mit der Zeit ein immer genaueres Abbild der tatsächlichen Arbeit in einer Treuhandgesellschaft. Jeder erkannte Fehler verbessert damit nicht nur ein einzelnes Dokument, sondern trägt dauerhaft zur Qualitätssicherung des gesamten Systems bei.

Zuverlässige KI-Extraktion entsteht deshalb nicht allein durch ein leistungsfähiges Modell. Sie entsteht durch das Zusammenspiel aus fachlich geprüften Daten, reproduzierbaren Tests und einem Prozess, der jede Änderung messbar macht.

Warum das stärkste Modell nicht automatisch die beste Wahl ist

Bei der Entwicklung einer KI-Lösung liegt ein Gedanke nahe: Nimm einfach das grösste und leistungsfähigste verfügbare Modell, dann müsste sich doch automatisch die höchste Qualität einstellen. Klingt logisch - ist in der Praxis aber oft ein Trugschluss.

Ein grösseres Modell kann spürbar langsamer und teurer sein, ohne bei einer klar abgegrenzten Aufgabe tatsächlich bessere Ergebnisse zu liefern. Bei der Dokumentenverarbeitung kommt es deshalb nicht darauf an, pauschal das stärkste Modell einzusetzen. Entscheidend ist vielmehr, für jeden einzelnen Verarbeitungsschritt die kleinste Lösung zu finden, die die erforderliche Qualität zuverlässig erreicht.

AnsatzGrösstes verfügbares ModellPassend dimensioniertes Modell
Geschwindigkeitoft langsamermeist schneller
Kostenin der Regel höherin der Regel geringer
Qualität bei klar abgegrenzter Aufgabenicht automatisch besserdurch Tests messbar passend
Testbarkeitschwerer zu optimierengezielt auf Aufgabe abstimmbar
Ein Lohnausweis zeigt geprüfte Sollwerte und deren Kategorisierung als Testdaten.

Backtest

Fazit: Qualität entsteht durch Prüfung, nicht durch Grösse

Wer eine verlässliche KI-Lösung für die Dokumentenverarbeitung aufbauen will, sollte sein Augenmerk weniger auf die Modellgrösse und mehr auf die Qualität der Testdaten legen. Ein breiter, realistischer Datensatz, saubere Ground-Truth-Werte durch Fachwissen und ein konsequenter Backtest bei jeder Änderung sind der eigentliche Schlüssel zu verlässlichen Ergebnissen. Nimm dir das als Denkanstoss: Prüfe bei deinem nächsten KI-Projekt zuerst, wie gut deine Testdaten wirklich sind, bevor du über das grösste Modell nachdenkst.

Was ist der Unterschied zwischen Dokumentenextraktion und Data Labelling?

Dokumentenextraktion beschreibt den eigentlichen Vorgang, in dem eine KI Informationen aus einem Dokument herausliest und strukturiert. Data Labelling ist die vorbereitende Arbeit, bei der Fachleute die korrekten Sollwerte für jedes Testdokument festlegen, damit sich die Qualität der Extraktion später überprüfen lässt.

Warum reicht ein kleiner Testdatensatz nicht aus?

Weil Dokumente derselben Kategorie in der Praxis sehr unterschiedlich aussehen können. Unterschiedliche Herausgeber, Layouts, Scanqualitäten und Sonderfälle sorgen dafür, dass ein System, das mit wenigen Beispielen gut funktioniert, im echten Arbeitsalltag trotzdem scheitern kann.

Was genau ist ein Backtest?

Bei einem Backtest wird die komplette Verarbeitung automatisiert über einen bestehenden Testdatensatz laufen gelassen. Die erkannten Werte werden anschliessend mit den geprüften Sollwerten verglichen, sodass sich Fehler und Qualitätsveränderungen zuverlässig messen lassen.

Ist ein grösseres KI-Modell automatisch besser?

Nein. Ein grösseres Modell kann langsamer und teurer sein, ohne bei einer klar abgegrenzten Aufgabe bessere Ergebnisse zu liefern. Sinnvoller ist es, für jeden Verarbeitungsschritt die kleinste Lösung zu wählen, die die geforderte Qualität nachweislich erreicht.

Wie bleibt ein Testdatensatz langfristig nützlich?

Indem er kontinuierlich weiterwächst. Jeder neue Sonderfall aus dem laufenden Betrieb wird anonymisiert, fachlich geprüft und als zusätzlicher Testfall aufgenommen, wodurch der Datensatz die reale Arbeit immer genauer abbildet.

Diese Webseite verwendet Cookies

Diese Webseite nutzt Cookies, um Ihnen das bestmögliche Erlebnis zu gewährleisten. Cookies helfen uns, die Webseite mit Analysen zu verbessern. Mit einem Klick auf „Zustimmen“, stimmen Sie der Verwendung von Cookies zu. Sie können Ihre Einwilligung jederzeit ändern, indem Sie unter "Optionen verwalten" Ihre getroffenen Einstellungen selbst rückgängig machen. Weitere Informationen finden Sie in unserer Datenschutzerklärung.

Privatsphäre-Einstellungen

Wir verwenden Cookies und ähnliche Technologien auf unserer Website und verarbeiten personenbezogene Daten von dir (z.B. IP-Adresse), um z.B. Inhalte und Anzeigen zu personalisieren, Medien von Drittanbietern einzubinden oder Zugriffe auf unsere Website zu analysieren.

Die Datenverarbeitung kann auch erst in Folge gesetzter Cookies stattfinden. Wir teilen diese Daten mit Dritten, die wir in den Privatsphäre-Einstellungen benennen.

Einige Services verarbeiten personenbezogene Daten in den USA. Indem du der Nutzung dieser Services zustimmst, erklärst du dich auch mit der Verarbeitung deiner Daten in den USA gemäß Art. 49 (1) lit. a DSGVO einverstanden. Die USA werden vom EuGH als ein Land mit einem unzureichenden Datenschutzniveau nach EU-Standards angesehen. Insbesondere besteht das Risiko, dass deine Daten von US-Behörden zu Kontroll- und Überwachungszwecken verarbeitet werden, unter Umständen ohne die Möglichkeit eines Rechtsbehelfs.

Du bist unter 16 Jahre alt? Dann kannst du nicht in optionale Services einwilligen. Du kannst deine Eltern oder Erziehungsberechtigten bitten, mit dir in diese Services einzuwilligen.


Ihre Einstellungen für Einwilligungen

Hier haben Sie die Möglichkeit, Ihre Einwilligung für die Datenverarbeitung durch Cookies zu erteilen oder zu widerrufen. Sie können Ihre Einstellungen jederzeit ändern. Weitere Informationen finden Sie in unserer Datenschutzerklärung.