Strukturierte und unstrukturierte Daten im KMU


KI in KMU wird oft über Anwendungsfälle diskutiert: Rechnungen verarbeiten, E-Mails vorsortieren, Anfragen schneller beantworten oder Dokumente prüfen. Der eigentliche Ausgangspunkt liegt aber meist früher: bei den vorhandenen Daten.
Ob ein Vorhaben einfach, aufwendig oder vorerst noch nicht sinnvoll ist, hängt stark davon ab, wie die Daten vorliegen. Eine sauber geführte Excel-Liste ist etwas anderes als ein gescanntes PDF, eine E-Mail mit Anhang oder eine freie Notiz aus dem Kundendienst. Genau hier liegt in vielen Projekten die grösste Fehleinschätzung.
Wer strukturierte, semi-strukturierte und unstrukturierte Daten sauber unterscheidet, kann den Aufwand realistischer planen. Das hilft nicht nur bei KI-Projekten, sondern auch bei klassischer Automatisierung, Auswertungen und der Standardisierung von Abläufen.
Welche Datenarten in KMU im Alltag wirklich vorkommen
In Schweizer KMU liegen Daten selten nur in einem einzigen Format vor. Meist entsteht ein Prozess über mehrere Stationen hinweg: Eine Anfrage kommt per E-Mail, wird in einer Excel-Liste erfasst, später im ERP ergänzt und endet als PDF im Dossier. Genau deshalb ist die Einordnung der Datenarten so wichtig.
Typische Beispiele aus dem Alltag:
Tabellen in Excel, CSV-Dateien oder ERP-Listen, etwa für Adressen, Offerten, Bestellungen oder Zeiterfassung
Formulare aus HR, Einkauf oder Offertwesen mit festen Feldern und einzelnen Freitexten
JSON- oder XML-ähnliche Exporte aus Fachanwendungen, Onlineformularen oder Schnittstellen
E-Mails mit Betreff, Signatur, Anhängen und oft uneinheitlichem Inhalt
PDF-Dokumente, zum Beispiel Verträge, Rechnungen, Rapporte oder Lieferscheine
Gescannte Belege aus Papierprozessen
Bilder von Schäden, Produkten, Quittungen oder Anlagen
Freie Texte aus Tickets, Notizen, Gesprächsprotokollen oder internen Kommentaren
Im Alltag wirken diese Daten oft selbstverständlich. Für KI und Automatisierung sind sie aber nicht gleich gut nutzbar. Eine Tabelle mit klaren Spalten ist maschinell viel einfacher zu verarbeiten als ein Mailverlauf mit mehreren Antworten, Signaturen und einem PDF-Anhang.
Gerade in der Administration und Office Management kommen diese Mischformen besonders häufig vor. Dort zeigt sich schnell: Nicht der Prozess allein entscheidet über die Machbarkeit, sondern auch die Art und Qualität der Daten entlang des Prozesses.
Strukturierte Daten: Wenn Felder, Spalten und Werte klar vorgegeben sind
Strukturierte Daten sind die am einfachsten nutzbare Grundlage für Auswertungen, Regeln und Automatisierung. Sie liegen in einem klar definierten Raster vor: feste Felder, eindeutige Spalten, einheitliche Werte.
Beispiele dafür sind:
Adresslisten mit Name, Strasse, PLZ, Ort
Artikelstämme mit Artikelnummer, Bezeichnung, Preis, Einheit
Zeiterfassung mit Datum, Mitarbeitenden, Tätigkeit, Stunden
Bestellungen mit Kundennummer, Bestelldatum, Positionen, Betrag
Rechnungsdaten aus ERP oder Buchhaltung
Der grosse Vorteil: Maschinen können solche Daten direkt lesen, vergleichen und weiterverarbeiten. Wenn ein Feld "Rechnungsdatum" heisst und in allen Fällen im gleichen Format geführt wird, lässt sich dieses Datum einfach prüfen, filtern oder in einen Folgeprozess übernehmen.
Das ist die Grundlage für viele einfache und wirkungsvolle Vorhaben:
automatische Prüfregeln
Standardauswertungen
Erinnerungen oder Eskalationen
Übergaben zwischen Systemen
einfache KI-Modelle mit klaren Eingabefeldern
Wichtig ist aber: Strukturiert heisst nicht automatisch sauber. Auch Tabellen können problematisch sein, wenn Begriffe uneinheitlich verwendet werden, Pflichtfelder fehlen oder Werte manuell und unterschiedlich erfasst werden. Eine Excel-Liste mit den Statuswerten "offen", "Offen", "in Bearbeitung", "pendent" und "später" ist zwar strukturiert gespeichert, aber für Auswertungen nur bedingt hilfreich.
Für KMU heisst das: Strukturierte Daten sind meist der beste Startpunkt für erste Automatisierungs- oder KI-Projekte. Der Nutzen wird besonders dort schnell sichtbar, wo Prozesse bereits standardisiert und Eingaben relativ einheitlich sind.
Semi-strukturierte Daten: Zwischen Ordnung und Freitext
Viele Daten im Unternehmen sind weder ganz frei noch vollständig klar strukturiert. Genau in diesem Zwischenbereich liegen semi-strukturierte Daten. Sie haben erkennbare Muster oder einzelne klar definierte Bestandteile, enthalten aber zusätzlich freie Inhalte, die erst eingeordnet werden müssen.
Typische Beispiele sind:
JSON-ähnliche Exporte aus Tools oder Webanwendungen
XML-Dateien aus Datenaustausch oder Formularsystemen
Webformulare mit Pflichtfeldern plus Kommentarfeld
E-Mails mit Betreff, Absender, Datum und freiem Nachrichtentext
Formulare mit festen Feldern und angehängten Dokumenten
Ein praktisches Beispiel: Ein Onlineformular für Serviceanfragen enthält Kundenname, Anlagentyp, Dringlichkeit und ein Freitextfeld für die Problembeschreibung. Die ersten Felder sind gut auswertbar. Das Freitextfeld braucht unter Umständen zusätzliche Verarbeitung, etwa um Störungen zu klassifizieren oder Prioritäten vorzuschlagen.
Ähnlich ist es bei E-Mails. Der Betreff, der Zeitstempel und der Absender sind relativ gut greifbar. Der eigentliche Nachrichtentext ist oft weniger sauber: unvollständig, mehrdeutig, mit Rückfragen, Antworten oder Signaturblöcken vermischt. Wenn dann noch ein PDF oder ein Bild mitgeschickt wird, steigt die Komplexität weiter.
Semi-strukturierte Daten werden in Projekten oft unterschätzt, weil sie auf den ersten Blick "schon digital" wirken. Für die Praxis bedeutet das aber nur, dass ein Teil direkt nutzbar ist. Der andere Teil muss weiterhin vorbereitet, bereinigt oder interpretiert werden.
Gerade hier ist KI interessant: nicht als Ersatz für klare Strukturen, sondern als Ergänzung. Wenn feste Felder vorhanden sind, kann KI den freien Teil besser einordnen, klassifizieren oder zusammenfassen. Ohne diese Basis steigt der Aufwand deutlich.
Unstrukturierte Daten: Warum PDFs, Bilder und Freitexte mehr Vorarbeit brauchen
Unstrukturierte Daten haben kein festes Raster, das eine Maschine direkt auslesen kann. Der Inhalt liegt zwar vor, aber nicht in einer Form, die sich ohne weitere Schritte zuverlässig weiterverarbeiten lässt.
Dazu gehören unter anderem:
E-Mails mit freiem Text
Verträge oder Rapporte als PDF
gescannte Rechnungen und Belege
Fotos von Dokumenten oder Schäden
Sitzungsprotokolle
Gesprächsnotizen
freie Kundenrückmeldungen
interne Kommentare in Tickets oder Dossiers
Das bedeutet nicht, dass solche Daten für KI ungeeignet sind. Im Gegenteil: Viele moderne Anwendungsfälle setzen genau hier an. Der Unterschied ist der Aufwand. Bei unstrukturierten Daten muss der Inhalt zunächst erkannt, gelesen, klassifiziert oder extrahiert werden.
Ein gescanntes PDF einer Lieferantenrechnung enthält die nötigen Informationen vielleicht vollständig. Trotzdem muss das System zuerst erkennen:
Wo steht der Rechnungsbetrag?
Welches ist die Rechnungsnummer?
Ist das Dokument überhaupt eine Rechnung?
Sind Positionen, Mehrwertsteuer und Datum sauber lesbar?
Dasselbe gilt für freie Texte. Eine Notiz wie "Kunde meldet wiederholt Lieferverzug, bittet um Rückruf heute noch" ist für Menschen klar verständlich. Eine Maschine muss daraus zuerst Bedeutung ableiten: Thema, Dringlichkeit, zuständige Stelle, Handlungsempfehlung.
Bei unstrukturierten Daten entstehen Fehlerquellen, die in Tabellen kaum vorkommen:
schlechte Scanqualität
abgeschnittene Seiten
unterschiedliche Layouts
uneinheitliche Begriffe
mehrsprachige Inhalte
unklare Formulierungen
fehlender Kontext
eingebettete Informationen in Bildern statt im Text
Deshalb ist Vorsicht wichtig. KI kann unstrukturierte Daten oft sinnvoll nutzen, aber nicht automatisch fehlerfrei. OCR liest einen schlecht gescannten Beleg nicht immer korrekt. Ein Sprachmodell erkennt in einer E-Mail nicht in jedem Fall sauber, ob es sich um eine Reklamation, eine Bestellung oder nur um eine Rückfrage handelt.
Für KMU ist die entscheidende Erkenntnis: Unstrukturierte Daten sind möglich, aber aufwendiger. Je stärker ein Prozess auf PDFs, Bilder und Freitexte angewiesen ist, desto wichtiger werden Tests, Qualitätskontrollen und klare fachliche Regeln.
Was das für KI- und Automatisierungsprojekte konkret bedeutet
Nicht jede Datenart passt gleich gut zu jedem Vorhaben. Wer KI oder Automatisierung plant, sollte deshalb zuerst den Prozess und die zugrunde liegenden Daten zusammen betrachten.
Bei strukturierten Daten eignen sich oft klassische Automatisierung und einfache Prüfmechanismen besonders gut. Beispiele:
Bestellungen automatisch an das ERP übergeben
fehlende Pflichtfelder erkennen
Dubletten in Stammdaten prüfen
Fristen überwachen
einfache Reports erzeugen
Hier braucht es nicht immer KI. Saubere strukturierte Daten sind oft schon mit klaren Regeln sehr gut nutzbar.
Bei semi-strukturierten Daten wird KI dort sinnvoll, wo ein Teil des Inhalts geordnet ist, der Rest aber interpretiert werden muss. Typische Beispiele:
Formularanfragen nach Inhalt oder Dringlichkeit vorsortieren
E-Mails anhand von Betreff, Absender und Text klassifizieren
Datenauszüge aus unterschiedlichen Quellen vereinheitlichen
Texte aus Kommentarfeldern zusammenfassen
Bei unstrukturierten Daten liegt der Nutzen häufig in Extraktion, Erkennung und Klassifikation. Beispiele aus KMU:
Rechnungserkennung aus PDFs oder Scans
E-Mail-Triage im Kundendienst
Ticket-Vorsortierung nach Thema oder Priorität
Dokumentenprüfung auf bestimmte Inhalte oder fehlende Angaben
Zusammenfassung längerer Protokolle oder Notizen
Wichtig ist die Unterscheidung zwischen fachlicher Eignung und technischem Vorbereitungsaufwand. Ein Anwendungsfall kann fachlich sehr sinnvoll sein, aber trotzdem aufwendig, wenn die Daten verstreut, unvollständig oder nur als Bilddateien vorhanden sind.
Ein Beispiel: Die automatische Verarbeitung von Lieferantenrechnungen klingt oft nach einem naheliegenden Start. Sind Rechnungen aber in zehn verschiedenen Formaten vorhanden, teils als Scan, teils als Foto, teils mit handschriftlichen Ergänzungen, steigt der Aufwand stark. Ein anderes Beispiel ist die E-Mail-Vorsortierung. Fachlich oft sinnvoll, praktisch aber nur dann stabil, wenn Kategorien, Zuständigkeiten und Eskalationsregeln im Unternehmen sauber definiert sind.
KI ersetzt dabei keine unklaren Prozesse. Sie funktioniert auf klaren Prozessen deutlich besser. Wo Begriffe, Zuständigkeiten und Entscheidungskriterien intern bereits uneinheitlich sind, wird auch das beste Modell keine stabile Grundlage schaffen.
Daten aufbereiten für KI: Die wichtigsten Vorbereitungsschritte für KMU
Bevor Daten produktiv in KI- oder Automatisierungsprozessen genutzt werden, braucht es in den meisten Fällen Vorarbeit. Diese Vorarbeit ist kein Nebenschritt, sondern oft der eigentliche Hebel für ein funktionierendes Projekt.
Ein praxistauglicher Start besteht aus sechs Schritten.
1. Dateninventar erstellen
Zuerst sollte geklärt werden, welche Daten überhaupt vorhanden sind. Nicht nur im Hauptsystem, sondern entlang des ganzen Prozesses:
Wo entstehen Daten?
In welchem Format liegen sie vor?
Wer erfasst oder verändert sie?
In welchem System oder Ordner werden sie abgelegt?
Welche Informationen werden mehrfach geführt?
Oft zeigt sich bereits hier, dass ein Prozess zwar digital wirkt, aber in Wahrheit aus mehreren Medienbrüchen besteht.
2. Datenqualität prüfen
Danach geht es um die Qualität. Relevante Fragen sind:
Sind Pflichtfelder vollständig?
Werden Begriffe einheitlich verwendet?
Gibt es Dubletten?
Fehlen Datumsangaben, Referenzen oder Statuswerte?
Sind Dokumente lesbar und vollständig?
Gerade bei strukturierten Daten entscheidet diese Prüfung darüber, ob sich ein Vorhaben schnell umsetzen lässt oder zuerst bereinigt werden muss.
3. Begriffe und Formate vereinheitlichen
Für KI und Automatisierung sind einheitliche Bezeichnungen zentral. Wenn ein Kunde einmal als "Kunde", einmal als "Debitor" und einmal mit Kürzel geführt wird, erschwert das Auswertungen und Zuordnungen.
Dasselbe gilt für Formate:
Datumsformate
Adressschreibweisen
Statusbezeichnungen
Artikelnummern
Dateibenennungen
Schon einfache Vereinheitlichungen reduzieren Fehler deutlich.
4. Fehlende Felder und Verantwortlichkeiten klären
Nicht jedes Problem ist technisch. Oft fehlen klare fachliche Regeln: Wer pflegt ein Feld? Wann gilt ein Vorgang als abgeschlossen? Welche Kategorie ist verbindlich?
Wenn solche Verantwortlichkeiten unklar sind, leidet die Datenqualität dauerhaft. Vor einem KI-Einsatz sollte daher nicht nur auf die Daten geschaut werden, sondern auch auf den Prozess dahinter.
5. Dokumente sinnvoll strukturieren und benennen
Bei PDFs, Scans und Bilddateien hilft bereits eine einfache Grundordnung:
nachvollziehbare Dateinamen
klare Ablagestruktur
einheitliche Dokumenttypen
Trennung von Entwürfen und finalen Versionen
Das ersetzt keine inhaltliche Erkennung, schafft aber eine deutlich bessere Ausgangslage für spätere Extraktion und Klassifikation.
6. Zugriffsrechte und Datenschutz klären
Nicht alle Daten dürfen für jeden Zweck gleich genutzt werden. Gerade in HR, Administration, Vertragswesen oder Kundendossiers ist zu prüfen:
Wer darf auf welche Daten zugreifen?
Welche Daten sind besonders schützenswert?
Welche Dokumente dürfen automatisiert verarbeitet werden?
Wo braucht es Protokollierung oder Freigaben?
Für viele KMU ist das ein wichtiger Teil der Vorbereitung, damit fachliche und organisatorische Anforderungen zusammenpassen.
So schätzen KMU den Aufwand realistisch ein
Viele Projekte scheitern nicht an der Idee, sondern an falschen Erwartungen. Eine realistische Einschätzung beginnt mit den Faktoren, die den Aufwand tatsächlich treiben.
Wesentliche Treiber sind:
Datenmenge: Einige hundert Dokumente sind anders zu behandeln als mehrere Jahre Archivbestand.
Datenqualität: Saubere Felder und lesbare Dokumente reduzieren den Aufwand erheblich.
Anzahl Quellen: Ein Prozess mit einem System ist einfacher als einer mit E-Mail, Excel, ERP und Netzlaufwerk.
Medienbruch: Papier, Scan, Copy-paste und manuelle Überträge erschweren die Verarbeitung.
Manuelle Nacharbeit: Wenn Mitarbeitende Daten regelmässig interpretieren oder korrigieren müssen, ist das ein Hinweis auf höhere Komplexität.
Prüfbedarf: Prozesse mit hoher Relevanz für Finanzen, Qualität oder Compliance brauchen zusätzliche Kontrolle.
Eine einfache Daumenregel für die Praxis lautet: Je strukturierter die Daten, desto schneller sind erste Ergebnisse möglich. Je mehr Freitext, PDFs, Bilder und Ausnahmen vorkommen, desto höher ist der Vorbereitungs- und Prüfaufwand.
Das heisst nicht, dass unstrukturierte Daten vermieden werden sollten. Es heisst nur, dass Aufwand, Fehlerrisiko und fachliche Abstimmung von Anfang an ehrlich eingeplant werden müssen.
Ein sinnvoller Weg ist oft, nicht mit dem komplexesten Fall zu starten, sondern mit einem Bereich, in dem bereits eine gewisse Struktur vorhanden ist. Statt alle eingehenden E-Mails im Unternehmen sofort intelligent zu verarbeiten, kann zunächst ein klar abgegrenzter Eingangskanal betrachtet werden. Statt sämtliche Dokumente automatisiert auszulesen, kann man mit einem definierten Rechnungstyp oder einem standardisierten Formular beginnen.
Wenn die Einordnung schwierig ist oder mehrere Quellen zusammenspielen, hilft eine strukturierte Beratung und Analyse, um Machbarkeit, Nutzen und Aufwand vor einem grösseren Projekt sauber zu klären.
Den eigenen Prozess anhand der Datenarten prüfen
Für KMU lohnt es sich, nicht mit der Frage "Wo kann KI eingesetzt werden?" zu beginnen, sondern mit einer einfacheren und oft wichtigeren Frage: Welche Datenarten liegen im Prozess heute überhaupt vor?
Eine pragmatische Prüfung kann entlang von vier Punkten erfolgen:
Was liegt bereits strukturiert vor?
Zum Beispiel Stammdaten, Listen, ERP-Felder oder Formularwerte.
Was ist nur teilweise geordnet?
Etwa E-Mails, Formulare mit Freitext oder Exporte mit gemischten Inhalten.
Was ist unstrukturiert?
Beispielsweise PDFs, Scans, Bilder, Protokolle oder Notizen.
Wo fehlt Vorarbeit?
Etwa bei unklaren Begriffen, uneinheitlichen Ablagen, fehlenden Feldern oder schlechter Dokumentqualität.
Diese Sicht hilft, Potenziale und Grenzen früh zu erkennen. Oft wird dabei sichtbar, dass ein Vorhaben grundsätzlich sinnvoll ist, aber zunächst Bereinigung oder Standardisierung braucht. In anderen Fällen zeigt sich, dass bereits genug Grundlage vorhanden ist, um einen ersten Anwendungsfall schlank umzusetzen.
Wer den eigenen Stand systematisch einordnen will, kann dafür den Selbstcheck nutzen. Er hilft dabei, die vorhandenen Daten, den Reifegrad des Prozesses und den wahrscheinlichen Vorbereitungsaufwand besser einzuschätzen.
Häufig gestellte Fragen
Woran erkennt man im KMU, ob Daten für KI bereits gut genug strukturiert sind?
Ein guter Hinweis ist, ob Informationen in festen Feldern, Spalten oder klar benannten Kategorien vorliegen und ob diese über viele Fälle hinweg einheitlich verwendet werden. Wenn Datumsfelder unterschiedlich geführt werden, Statuswerte variieren oder zentrale Angaben oft fehlen, besteht meist zuerst Bereinigungsbedarf. Gut genug strukturiert sind Daten dann, wenn sie ohne laufende Interpretation durch Mitarbeitende konsistent genutzt werden können.
Welche Datenarten eignen sich am ehesten für erste Automatisierungsprojekte?
Am ehesten eignen sich strukturierte Daten aus Tabellen, ERP-Feldern, Stammdaten oder standardisierten Formularen. Dort lassen sich Regeln, Prüfungen und einfache Übergaben oft mit überschaubarem Aufwand umsetzen. Semi-strukturierte Daten können ein guter zweiter Schritt sein, wenn bereits ein Teil des Prozesses klar definiert ist.
Warum sind PDFs und E-Mails für KI deutlich aufwendiger als Tabellen?
Weil ihr Inhalt nicht automatisch in klaren Feldern vorliegt. Bei PDFs, E-Mails und Scans muss zuerst erkannt werden, welche Information wo steht und wie sie fachlich zu interpretieren ist. Dazu kommen Fehlerquellen wie unterschiedliche Layouts, unvollständige Inhalte, schlechte Scanqualität oder mehrdeutige Formulierungen. Tabellen sind in der Regel direkter maschinenlesbar.
Wie viel Vorarbeit braucht es, bevor KI mit unseren Daten arbeiten kann?
Das hängt stark von Datenart, Qualität und Prozessklarheit ab. Bei sauberen strukturierten Daten kann die Vorarbeit relativ klein sein. Bei gemischten Quellen, vielen PDFs, E-Mails oder uneinheitlichen Begriffen ist sie oft erheblich. Typische Vorarbeiten sind Dateninventar, Bereinigung, Vereinheitlichung, Klärung von Zuständigkeiten und Prüfung der Dokumentqualität.
Kann man unstrukturierte Daten wie Freitexte oder Bilder überhaupt sinnvoll einsetzen?
Ja, aber mit realistischen Erwartungen. KI kann Freitexte zusammenfassen, E-Mails klassifizieren oder Informationen aus Dokumenten und Bildern extrahieren. Der Nutzen ist oft gross, wenn das fachliche Ziel klar ist und Qualitätskontrollen eingeplant werden. Entscheidend ist, dass die Daten nicht als automatisch fehlerfrei lesbar betrachtet werden.
Wie lässt sich der Aufwand für ein KI-Projekt in der Administration realistisch einschätzen?
Hilfreich ist eine Einschätzung entlang von Datenmenge, Datenqualität, Anzahl Quellen, Medienbrüchen, notwendiger manueller Prüfung und fachlicher Standardisierung. Je strukturierter und einheitlicher die Daten bereits vorliegen, desto schneller ist ein Vorhaben meist umsetzbar. Bei administrativen Prozessen mit vielen E-Mails, PDFs und Ausnahmen sollte die Vorbereitungsphase bewusst eingeplant werden.




