Acht Piloten, keine Zahl: Wie eine KI-Offensive ohne Wertlogik verglüht
9 Min. Lesezeit
Jetzt lesenDer Auslöser war ein verlorener Auftrag. Ein Wettbewerber hatte in acht Tagen angeboten, das eigene Haus brauchte sechs Wochen. Die Kalkulation hing an drei erfahrenen Mitarbeitern, von denen einer kurz vor der Rente stand. Das Wissen lag verstreut: Artikelstammdaten und alte Kalkulationen im ERP, Konstruktionsberichte
| Merkmal | Ausprägung |
|---|---|
| Branche | Maschinen- und Anlagenbau (Sondermaschinen) |
| Unternehmensgröße | rund 900 Mitarbeiter, drei Standorte |
| Vorhaben | KI-gestützte Angebotserstellung und Wissensassistent auf ERP- und Dokumentenbestand |
| Laufzeit bis Kipppunkt | 11 Monate, Abbruch nach 14 Monaten |
| Versenkte Kosten (typisiert) | rund 480.000 Euro direkt, ohne Opportunitätskosten |
| Scheiter-Muster | Datenqualität: Stammdaten-Duplikate, veraltete Kalkulationen, Berechtigungswildwuchs |
Diese Fallakte ist ein typisiertes, redaktionell verdichtetes Post-mortem: Unternehmen, Personen und Projektverlauf sind fiktiv, die Entscheidungen, Zahlen und Fehlermuster folgen dokumentierten Scheiter-Mustern aus Studien und veröffentlichten Projektberichten (Quellen am Ende).
Der Auslöser war ein verlorener Auftrag. Ein Wettbewerber hatte in acht Tagen angeboten, das eigene Haus brauchte sechs Wochen. Die Kalkulation hing an drei erfahrenen Mitarbeitern, von denen einer kurz vor der Rente stand. Das Wissen lag verstreut: Artikelstammdaten und alte Kalkulationen im ERP, Konstruktionsberichte und Angebotstexte auf Dateiablagen, Sonderabsprachen in Postfächern.
Die Geschäftsführung wollte beides auf einmal lösen. Ein KI-Assistent sollte auf den gesamten Bestand zugreifen, Vergleichsangebote finden und Entwürfe vorschlagen. Das Ziel klang messbar: Angebotsdurchlaufzeit halbieren. Der Vertriebsleiter trieb das Projekt, der IT-Leiter trug es mit, der CFO gab 350.000 Euro für das erste Jahr frei.
Niemand in diesem Kreis handelte leichtfertig. Der Anwendungsfall gehört zu den plausibelsten im Mittelstand. Was fehlte, war eine einzige Frage zu Beginn: In welchem Zustand sind die Daten, auf denen das alles stehen soll? Genau an dieser Frage scheitern die meisten vergleichbaren Vorhaben. Gartner nannte 2024 schlechte Datenqualität als ersten von vier Gründen, warum mindestens 30 Prozent der GenAI-Projekte nach dem Proof of Concept enden.
Kein einzelner Beschluss war für sich genommen falsch. Die Kette macht das Muster sichtbar.
| Monat | Entscheidung | Was dabei überging |
|---|---|---|
| 1 | Projektstart mit Ziel „Angebotszeit halbieren“, Budgetfreigabe | Kein Daten-Inventar. Die ERP-Stammdaten waren seit der Migration 2016 nie bereinigt worden. |
| 2 | Anbieterauswahl nach überzeugender Demo auf Beispieldaten | Die Demo lief auf einem handverlesenen, vom Anbieter bereinigten Ausschnitt. Der Produktivbestand sah anders aus. |
| 4 | Anbindung aller Dateiablagen, „damit nichts fehlt“ | Die Berechtigungsstruktur stammte von 2014. Ganze Abteilungsordner waren faktisch für jeden lesbar, niemand prüfte das vor der Indexierung. |
| 6 | Nach ersten Fehlantworten: Optimierung der Prompts statt Datenbereinigung | Die Fehlerursache lag im Bestand: dieselbe Baugruppe existierte unter drei Artikelnummern mit drei Preisständen. Das Modell konnte nur wiedergeben, was es fand. |
| 8 | Pilotbetrieb mit fünf Kalkulatoren, parallel Anbindung weiterer Quellen | Mehr Quellen bedeuteten mehr Widersprüche. Veraltete Preislisten von 2019 erschienen gleichrangig neben aktuellen. |
| 10 | Nach einem Berechtigungsvorfall: Index einfrieren, Prüfung durch IT-Sicherheit | Der Assistent hatte Deckungsbeiträge und eine Gehaltsliste aus einem offenen Altordner zitiert. Die Prüfung kam neun Monate zu spät. |
| 11 | Weiterbetrieb im Testmodus, Entscheidung über Datenprojekt vertagt | Die Kalkulatoren arbeiteten längst wieder in Excel. Das Vertrauen war zu diesem Zeitpunkt bereits verbraucht. |
Der Moment lässt sich auf ein Meeting datieren, Monat 11, Projektreview mit Geschäftsführung. Der Leiter der Kalkulation hatte sich vorbereitet. Er legte zwei Angebotsentwürfe für dieselbe Schweißbaugruppe nebeneinander, beide vom Assistenten erstellt, beide mit Quellenangabe. Der eine Preis lag 40 Prozent über dem anderen. Beide Belege waren echt: zwei Artikelstämme, zwei Preisstände, ein physisches Teil.
Dann stellte er die Frage, die das Projekt beendete: „Welchem der beiden soll mein Team glauben, und wer haftet, wenn wir mit dem falschen anbieten?“ Niemand im Raum hatte eine Antwort. Der Vertriebsleiter schlug eine manuelle Prüfschleife vor. Damit war der Nutzen des Assistenten rechnerisch dahin: Prüfen dauerte länger als selbst kalkulieren.
Ab diesem Meeting war das Scheitern unumkehrbar, aus einem einfachen Grund. Die nötige Stammdatenbereinigung wurde intern auf zwölf bis achtzehn Monate geschätzt. Ein Projekt, das bereits elf Monate Geduld verbraucht hatte, bekam diese zweite Laufzeit nicht mehr. Drei Monate später wurde der Vertrag still auslaufen gelassen. Gescheitert ist nicht das Modell. Gescheitert ist die Annahme, der Datenbestand sei gut genug, weil das Tagesgeschäft ja auch damit lief. Das Tagesgeschäft hatte die Widersprüche im Kopf der drei Kalkulatoren ausgeglichen. Der Assistent hatte diesen Kopf nicht.
| Posten | Betrag/Ausmaß (typisiert) | Einordnung |
|---|---|---|
| Lizenzen und Anbieterleistungen | rund 220.000 Euro | Plattform, Integration, zwei Verlängerungen im Hoffnungsmodus |
| Interne Aufwände | rund 180.000 Euro | IT, Kalkulation, Projektleitung; konservativ mit Tagessätzen bewertet |
| Externe Beratung und Nacharbeiten | rund 80.000 Euro | Berechtigungsprüfung nach dem Vorfall, Datenschutz-Aufarbeitung |
| Opportunitätskosten | sechsstellig, nicht exakt bezifferbar | 14 Monate keine Kapazität für die eigentlich nötige Stammdatenbereinigung |
| Organisationsschaden | schwer reversibel | Kalkulation und Vertrieb begegnen jedem Folgevorhaben mit „das hatten wir schon“ |
Die direkten Kosten von rund 480.000 Euro sind dabei der kleinere Teil. Schwerer wiegt der Glaubwürdigkeitsverlust. Das nächste KI-Vorhaben startet in diesem Haus nicht bei null, sondern im Minus. Und der Berechtigungsvorfall band Führungszeit über Monate.
Mit einem zeitlich begrenzten Daten-Assessment, zwei bis vier Wochen, vor jeder Anbieterentscheidung. Kernmetriken: Dublettenquote je Stammdatenobjekt, Anteil veralteter Preis- und Lieferantenstände, Feldbefüllungsgrad der Pflichtfelder, Zahl der parallel gepflegten Quellen je Information. Ziehen Sie die Stichprobe selbst, nicht der Anbieter. Wenn dieselbe Information mehrfach mit abweichenden Werten existiert, ist das der Befund. Ein Sprachmodell löst diesen Konflikt nicht, es reproduziert ihn schneller.
Als Größenordnung für ein Haus mit 500 bis 1.000 Mitarbeitern: sechsstelliger Betrag und zwölf bis achtzehn Monate, abhängig von Objektzahl und Systemlandschaft. Entscheidend ist der Zuschnitt: Nicht der gesamte Bestand muss sauber sein, sondern die Objekte des Anwendungsfalls, etwa Artikelstämme und Kalkulationshistorie. Wer nur diesen Korridor bereinigt und Regeln für die laufende Pflege einführt, ist deutlich schneller als ein Komplettprojekt. Ohne laufende Pflege verfällt das Ergebnis binnen weniger Jahre wieder.
Weil in diesem Muster keine Halluzination vorliegt. Der Assistent im Fall fand drei echte Preise für dasselbe Teil, alle korrekt belegt. Prompt-Optimierung wirkt auf die Formulierung von Antworten, nicht auf Widersprüche im Quellbestand. Wenn zwei gleichrangige Quellen Verschiedenes sagen, kann das Modell nur wählen oder beide nennen. Die Korrektur gehört in die Datenschicht: eindeutige Vorrangregeln, entwertete Altstände, zusammengeführte Dubletten. Erst danach lohnt Feinarbeit am Modellverhalten.
Der Index macht jede historisch gewachsene Fehlberechtigung sofort auffindbar. Dokumente, die formal offen, aber praktisch vergessen waren, werden per Frage abrufbar: Gehaltslisten, Margen, Personalunterlagen. Damit entstehen Datenschutz- und Arbeitsrechtsrisiken, bei personenbezogenen Daten auch Meldepflichten. Vor der Indexierung gehören drei Schritte gesetzt: Berechtigungsprüfung auf Soll-Ist-Abweichung, Ausschlussliste für sensible Bereiche, und ein Test, ob der Assistent Berechtigungen des fragenden Nutzers durchgängig respektiert.
Ein vollständiger Stopp ist selten nötig, volle Parallelität selten ehrlich. Der belastbare Mittelweg: den KI-Piloten auf einen Bestand verengen, der bereits sauber ist oder sich schnell bereinigen lässt, etwa eine Produktlinie. Daran lässt sich der Nutzen real messen, während die Bereinigung des Restbestands als eigenes Projekt läuft. Wichtig ist die Reihenfolge im Einzelfall: erst der saubere Korridor, dann die Ausweitung. Die umgekehrte Reihenfolge erzeugt das Muster dieser Fallakte.
Ein Briefing pro Woche: Entscheidungsfragen, eingeordnete Zahlen und Fristen. Ihre Adresse geben wir nicht weiter.
9 Min. Lesezeit
Jetzt lesen9 Min. Lesezeit
Jetzt lesen9 Min. Lesezeit
Jetzt lesen