← Zurück zu allen Insights

Ein mittelständischer Maschinenbauer will die Angebotserstellung mit KI beschleunigen: Ein Sprachmodell soll aus historischen Anfragen, Stücklisten und Kalkulationen automatisch Angebotsentwürfe vorschlagen. Das Modell selbst ist schnell angebunden, die Demo überzeugt. Doch im Praxisbetrieb häufen sich falsche Preise, doppelte Kundendatensätze und widersprüchliche Produktbezeichnungen zwischen CRM, ERP und den Excel-Listen des Vertriebs. Nach sechs Wochen liegt das Projekt auf Eis – nicht wegen des Modells, sondern wegen der Daten, auf denen es aufsetzt. Diese Geschichte wiederholt sich in unzähligen Varianten, und sie zeigt ein Muster, das in der Euphorie um generative KI gerne übersehen wird: Die Qualität der Ergebnisse hängt zu einem großen Teil von der Qualität der zugrunde liegenden Daten ab, nicht vom gewählten Modell.

Garbage in, garbage out – aktueller denn je

Das alte Informatik-Prinzip "Garbage in, garbage out" hat mit generativer KI eine neue Brisanz bekommen. Klassische Software liefert bei schlechten Eingabedaten meist offensichtliche Fehler – ein KI-Modell dagegen formuliert seine Antworten oft flüssig und selbstbewusst, auch wenn die zugrunde liegenden Daten lückenhaft, veraltet oder widersprüchlich sind. Das macht Datenprobleme in KI-Projekten tückischer als in klassischen IT-Vorhaben: Der Fehler fällt nicht sofort auf, sondern schleicht sich als scheinbar plausible, aber falsche Aussage ins Tagesgeschäft. Wer ein Modell auf Basis dubletter Kundendatensätze trainiert oder befüllt, bekommt nicht "ungefähr richtige", sondern systematisch verzerrte Ergebnisse – und trägt das Risiko oft erst dann, wenn ein Kunde die falsche Rechnung reklamiert oder ein Report eine falsche Kennzahl ausweist.

Die Dimensionen von Datenqualität kennen

In der Praxis lohnt es sich, Datenqualität nicht als diffuses Bauchgefühl zu behandeln, sondern entlang klarer Dimensionen zu prüfen:

Vollständigkeit fragt, ob alle relevanten Felder tatsächlich gefüllt sind – fehlende Werte führen bei KI-Anwendungen schnell zu Lücken in der Argumentationskette. Konsistenz prüft, ob dieselbe Information über verschiedene Systeme hinweg übereinstimmt, etwa die Kundenadresse in CRM und Rechnungssystem. Aktualität stellt sicher, dass Daten den gegenwärtigen Zustand widerspiegeln und nicht den von vor zwei Jahren. Genauigkeit meint schlicht die Korrektheit der einzelnen Einträge, während Eindeutigkeit Duplikate und mehrdeutige Identifikatoren verhindert, die Auswertungen und Trainingsdaten verzerren. Gültigkeit schließlich prüft, ob Daten dem erwarteten Format entsprechen – ein Datum als Freitext statt als Datumsfeld etwa erschwert jede automatisierte Verarbeitung erheblich.

Diese Dimensionen sind kein akademisches Konstrukt, sondern eine praktische Checkliste: Wer ein KI-Vorhaben plant, sollte die relevanten Datenquellen entlang genau dieser Kriterien durchgehen, bevor das erste Modell angebunden wird.

Warum der Mittelstand hier besonders gefordert ist

In großen Konzernen kümmern sich oft eigene Data-Governance-Teams um Stammdatenqualität. Mittelständische Unternehmen haben diese Strukturen selten – dafür aber eine über Jahre gewachsene Systemlandschaft aus ERP, CRM, Fachanwendungen und unzähligen Excel-Listen, die parallel gepflegt werden. Zuständigkeiten für Dateneingabe sind häufig nicht klar geregelt, Pflichtfelder fehlen oder werden großzügig ausgelegt, und niemand fühlt sich für die Datenqualität als Ganzes verantwortlich. Das ist im Tagesgeschäft oft kein akutes Problem – bis ein KI-Projekt genau diese Unsauberkeiten gnadenlos offenlegt. Die gute Nachricht: Anders als ein komplettes Data-Warehouse-Projekt lässt sich Datenqualität im Mittelstand mit überschaubarem Aufwand gezielt für den jeweiligen KI-Anwendungsfall verbessern, statt gleich alle Daten im Unternehmen "perfekt" machen zu wollen.

Handlungsempfehlungen für den Projektstart

Vor jedem KI-Projekt lohnt sich eine kurze, aber ehrliche Bestandsaufnahme: Welche Datenquellen sollen einfließen, und wie vollständig, konsistent und aktuell sind sie tatsächlich – nicht in der Theorie, sondern im Export? Häufig reicht schon eine Stichprobe von einigen hundert Datensätzen, um systematische Lücken oder Formatprobleme sichtbar zu machen. Darauf folgt Standardisierung: klare Eingabemasken, Pflichtfelder und einheitliche Formate, damit neue Daten nicht dieselben Probleme reproduzieren wie die alten. Ebenso wichtig ist eine klare Verantwortlichkeit für Datenpflege – ein Name, keine diffuse Teamzuständigkeit – sowie ein regelmäßiger Rhythmus für Bereinigung und Duplikaterkennung, etwa quartalsweise. Eine Faustregel, die sich in der Praxis bewährt: Ein kleiner, sauberer Datensatz für einen klar abgegrenzten Anwendungsfall liefert bessere KI-Ergebnisse als eine riesige, aber inkonsistente Datenbasis. Es lohnt sich also, mit einem eng gefassten Pilotbereich zu starten, dort Datenqualität wirklich sicherzustellen, und erst danach schrittweise zu erweitern.

Ein typisches Beispiel

Ein Dienstleistungsunternehmen wollte Support-Anfragen automatisiert kategorisieren und priorisieren lassen. Die erste Version funktionierte schlecht: Ähnliche Anliegen wurden in völlig unterschiedliche Kategorien einsortiert. Die Ursachenanalyse zeigte, dass dieselbe Kategorie in den letzten Jahren unter vier verschiedenen Bezeichnungen im Ticketsystem existierte, weil unterschiedliche Mitarbeitende sie jeweils neu angelegt hatten, statt vorhandene Kategorien zu nutzen. Erst eine Bereinigung der Kategorienliste – von über sechzig auf rund fünfzehn klar abgegrenzte Kategorien – sowie eine Pflichtauswahl im Ticketformular brachten die nötige Konsistenz. Erst danach lieferte die KI-Kategorisierung brauchbare, nachvollziehbare Ergebnisse. Die eigentliche Arbeit lag also nicht im Modell, sondern in der vorgelagerten Datenhygiene.

Auf den Punkt

Der Erfolg von KI-Projekten entscheidet sich selten allein an der gewählten Technologie, sondern an der Qualität der Daten, mit denen sie arbeitet. Wer vor dem Projektstart die eigenen Datenquellen entlang klarer Dimensionen wie Vollständigkeit, Konsistenz, Aktualität, Genauigkeit und Eindeutigkeit prüft, erspart sich spätere Enttäuschungen. Gerade im Mittelstand gilt: klein anfangen, Datenqualität für einen konkreten Anwendungsfall wirklich sicherstellen, klare Verantwortlichkeiten schaffen – und von dort aus schrittweise wachsen, statt auf die perfekte Gesamtdatenbasis zu warten, die es selten gibt.

(Erstellt mit KI-Unterstützung, redaktionell geprüft)