Ausgabe 39/2026 · Stand: Mittwoch, 23. September 2026 Das Fachmagazin für KI-Transformation im Mittelstand
Briefing abonnieren
Fallakte

Der Wissensassistent, der drei Preise für dasselbe Teil fand

Der Auslöser war ein verlorener Auftrag. Ein Wettbewerber hatte in acht Tagen angeboten, das eigene Haus brauchte sechs Wochen. Die Kalkulation hing an drei erfahrenen Mitarbeitern, von denen einer kurz vor der Rente stand. Das Wissen lag verstreut: Artikelstammdaten und alte Kalkulationen im ERP, Konstruktionsberichte

Veröffentlicht · Aktualisiert · 9 Min. Lesezeit
Kundenservice-Team an benachbarten Schreibtischen, im Hintergrund ein Regal mit Handbüchern.
Wo Anfragen auflaufen, wird der Nutzen zuerst spürbar. Symbolbild, KI-generiert für KIONIER.
Merkmal Ausprägung
Branche Maschinen- und Anlagenbau (Sondermaschinen)
Unternehmensgröße rund 900 Mitarbeiter, drei Standorte
Vorhaben KI-gestützte Angebotserstellung und Wissensassistent auf ERP- und Dokumentenbestand
Laufzeit bis Kipppunkt 11 Monate, Abbruch nach 14 Monaten
Versenkte Kosten (typisiert) rund 480.000 Euro direkt, ohne Opportunitätskosten
Scheiter-Muster Datenqualität: Stammdaten-Duplikate, veraltete Kalkulationen, Berechtigungswildwuchs

Diese Fallakte ist ein typisiertes, redaktionell verdichtetes Post-mortem: Unternehmen, Personen und Projektverlauf sind fiktiv, die Entscheidungen, Zahlen und Fehlermuster folgen dokumentierten Scheiter-Mustern aus Studien und veröffentlichten Projektberichten (Quellen am Ende).

Ausgangslage

Der Auslöser war ein verlorener Auftrag. Ein Wettbewerber hatte in acht Tagen angeboten, das eigene Haus brauchte sechs Wochen. Die Kalkulation hing an drei erfahrenen Mitarbeitern, von denen einer kurz vor der Rente stand. Das Wissen lag verstreut: Artikelstammdaten und alte Kalkulationen im ERP, Konstruktionsberichte und Angebotstexte auf Dateiablagen, Sonderabsprachen in Postfächern.

Die Geschäftsführung wollte beides auf einmal lösen. Ein KI-Assistent sollte auf den gesamten Bestand zugreifen, Vergleichsangebote finden und Entwürfe vorschlagen. Das Ziel klang messbar: Angebotsdurchlaufzeit halbieren. Der Vertriebsleiter trieb das Projekt, der IT-Leiter trug es mit, der CFO gab 350.000 Euro für das erste Jahr frei.

Niemand in diesem Kreis handelte leichtfertig. Der Anwendungsfall gehört zu den plausibelsten im Mittelstand. Was fehlte, war eine einzige Frage zu Beginn: In welchem Zustand sind die Daten, auf denen das alles stehen soll? Genau an dieser Frage scheitern die meisten vergleichbaren Vorhaben. Gartner nannte 2024 schlechte Datenqualität als ersten von vier Gründen, warum mindestens 30 Prozent der GenAI-Projekte nach dem Proof of Concept enden.

Die Entscheidungen

Kein einzelner Beschluss war für sich genommen falsch. Die Kette macht das Muster sichtbar.

Monat Entscheidung Was dabei überging
1 Projektstart mit Ziel „Angebotszeit halbieren“, Budgetfreigabe Kein Daten-Inventar. Die ERP-Stammdaten waren seit der Migration 2016 nie bereinigt worden.
2 Anbieterauswahl nach überzeugender Demo auf Beispieldaten Die Demo lief auf einem handverlesenen, vom Anbieter bereinigten Ausschnitt. Der Produktivbestand sah anders aus.
4 Anbindung aller Dateiablagen, „damit nichts fehlt“ Die Berechtigungsstruktur stammte von 2014. Ganze Abteilungsordner waren faktisch für jeden lesbar, niemand prüfte das vor der Indexierung.
6 Nach ersten Fehlantworten: Optimierung der Prompts statt Datenbereinigung Die Fehlerursache lag im Bestand: dieselbe Baugruppe existierte unter drei Artikelnummern mit drei Preisständen. Das Modell konnte nur wiedergeben, was es fand.
8 Pilotbetrieb mit fünf Kalkulatoren, parallel Anbindung weiterer Quellen Mehr Quellen bedeuteten mehr Widersprüche. Veraltete Preislisten von 2019 erschienen gleichrangig neben aktuellen.
10 Nach einem Berechtigungsvorfall: Index einfrieren, Prüfung durch IT-Sicherheit Der Assistent hatte Deckungsbeiträge und eine Gehaltsliste aus einem offenen Altordner zitiert. Die Prüfung kam neun Monate zu spät.
11 Weiterbetrieb im Testmodus, Entscheidung über Datenprojekt vertagt Die Kalkulatoren arbeiteten längst wieder in Excel. Das Vertrauen war zu diesem Zeitpunkt bereits verbraucht.

Der Kipppunkt

Der Moment lässt sich auf ein Meeting datieren, Monat 11, Projektreview mit Geschäftsführung. Der Leiter der Kalkulation hatte sich vorbereitet. Er legte zwei Angebotsentwürfe für dieselbe Schweißbaugruppe nebeneinander, beide vom Assistenten erstellt, beide mit Quellenangabe. Der eine Preis lag 40 Prozent über dem anderen. Beide Belege waren echt: zwei Artikelstämme, zwei Preisstände, ein physisches Teil.

Dann stellte er die Frage, die das Projekt beendete: „Welchem der beiden soll mein Team glauben, und wer haftet, wenn wir mit dem falschen anbieten?“ Niemand im Raum hatte eine Antwort. Der Vertriebsleiter schlug eine manuelle Prüfschleife vor. Damit war der Nutzen des Assistenten rechnerisch dahin: Prüfen dauerte länger als selbst kalkulieren.

Ab diesem Meeting war das Scheitern unumkehrbar, aus einem einfachen Grund. Die nötige Stammdatenbereinigung wurde intern auf zwölf bis achtzehn Monate geschätzt. Ein Projekt, das bereits elf Monate Geduld verbraucht hatte, bekam diese zweite Laufzeit nicht mehr. Drei Monate später wurde der Vertrag still auslaufen gelassen. Gescheitert ist nicht das Modell. Gescheitert ist die Annahme, der Datenbestand sei gut genug, weil das Tagesgeschäft ja auch damit lief. Das Tagesgeschäft hatte die Widersprüche im Kopf der drei Kalkulatoren ausgeglichen. Der Assistent hatte diesen Kopf nicht.

Schadensbilanz

Posten Betrag/Ausmaß (typisiert) Einordnung
Lizenzen und Anbieterleistungen rund 220.000 Euro Plattform, Integration, zwei Verlängerungen im Hoffnungsmodus
Interne Aufwände rund 180.000 Euro IT, Kalkulation, Projektleitung; konservativ mit Tagessätzen bewertet
Externe Beratung und Nacharbeiten rund 80.000 Euro Berechtigungsprüfung nach dem Vorfall, Datenschutz-Aufarbeitung
Opportunitätskosten sechsstellig, nicht exakt bezifferbar 14 Monate keine Kapazität für die eigentlich nötige Stammdatenbereinigung
Organisationsschaden schwer reversibel Kalkulation und Vertrieb begegnen jedem Folgevorhaben mit „das hatten wir schon“

Die direkten Kosten von rund 480.000 Euro sind dabei der kleinere Teil. Schwerer wiegt der Glaubwürdigkeitsverlust. Das nächste KI-Vorhaben startet in diesem Haus nicht bei null, sondern im Minus. Und der Berechtigungsvorfall band Führungszeit über Monate.

Was der Vorstand hätte anders machen müssen

  1. Vor der Budgetfreigabe (Monat 0): Ein zweiwöchiges Daten-Assessment beauftragen, bevor ein Anbieter ausgewählt wird. Stichprobe der Artikelstämme, Dublettenquote, Alter der Preisstände, Zustand der Berechtigungen. Das Ergebnis hätte den Projektzuschnitt verändert, nicht das Ziel.
  2. Bei der Anbieterauswahl (Monat 2): Die Demo auf einem ungefilterten, selbst gezogenen Ausschnitt der eigenen Daten verlangen. Ein Anbieter, der das ablehnt, beantwortet die Frage damit auch.
  3. Vor der Indexierung der Ablagen (Monat 4): Berechtigungen als Sicherheitsthema behandeln, nicht als Projektdetail. Ein KI-Index macht jede Altlast im Zugriffssystem durchsuchbar. Diese Prüfung war der letzte Zeitpunkt, den Vorfall aus Monat 10 zu verhindern.
  4. Nach den ersten Fehlantworten (Monat 6): Die Ursachenfrage erzwingen: Liegt der Fehler im Modell oder im Bestand? Hier war die letzte Ausfahrt, das Budget in ein Stammdatenprojekt mit klarem Scope umzuwidmen. Das Ziel wäre um ein Jahr verschoben worden, aber erreichbar geblieben.

Übertragbare Lehren

  • Haben wir für den geplanten Anwendungsfall ein aktuelles Daten-Inventar mit Dublettenquote und Altersstruktur der Bestände?
  • Wurde die Anbieter-Demo auf einem ungefilterten Ausschnitt unserer eigenen Produktivdaten gefahren?
  • Wissen wir, wer heute faktisch auf welche Ablagen zugreifen kann, und deckt sich das mit dem Soll?
  • Ist geklärt, welche Quelle bei widersprüchlichen Angaben führend ist (ERP vor Ablage, aktuell vor alt)?
  • Gibt es ein Abbruchkriterium, das zwischen Modellfehler und Datenfehler unterscheidet, bevor nachjustiert wird?
  • Ist die Datenbereinigung als eigenes Arbeitspaket mit Budget und Verantwortlichem eingeplant, nicht als Nebenleistung des KI-Projekts?
  • Haben die Fachanwender, die das Werkzeug nutzen sollen, im Pilotdesign ein Vetorecht bei der Qualitätsbewertung?
  • Existiert ein Eskalationsweg, der Berechtigungs- und Datenschutzvorfälle vor der Indexierung prüft statt danach?

FAQ

Wie prüfe ich vor einem KI-Projekt, ob unsere ERP-Stammdaten gut genug sind?

Mit einem zeitlich begrenzten Daten-Assessment, zwei bis vier Wochen, vor jeder Anbieterentscheidung. Kernmetriken: Dublettenquote je Stammdatenobjekt, Anteil veralteter Preis- und Lieferantenstände, Feldbefüllungsgrad der Pflichtfelder, Zahl der parallel gepflegten Quellen je Information. Ziehen Sie die Stichprobe selbst, nicht der Anbieter. Wenn dieselbe Information mehrfach mit abweichenden Werten existiert, ist das der Befund. Ein Sprachmodell löst diesen Konflikt nicht, es reproduziert ihn schneller.

Was kostet eine Stammdatenbereinigung im Mittelstand ungefähr, und wie lange dauert sie?

Als Größenordnung für ein Haus mit 500 bis 1.000 Mitarbeitern: sechsstelliger Betrag und zwölf bis achtzehn Monate, abhängig von Objektzahl und Systemlandschaft. Entscheidend ist der Zuschnitt: Nicht der gesamte Bestand muss sauber sein, sondern die Objekte des Anwendungsfalls, etwa Artikelstämme und Kalkulationshistorie. Wer nur diesen Korridor bereinigt und Regeln für die laufende Pflege einführt, ist deutlich schneller als ein Komplettprojekt. Ohne laufende Pflege verfällt das Ergebnis binnen weniger Jahre wieder.

Warum halluziniert ein KI-Assistent nicht einfach weniger, wenn wir die Prompts verbessern?

Weil in diesem Muster keine Halluzination vorliegt. Der Assistent im Fall fand drei echte Preise für dasselbe Teil, alle korrekt belegt. Prompt-Optimierung wirkt auf die Formulierung von Antworten, nicht auf Widersprüche im Quellbestand. Wenn zwei gleichrangige Quellen Verschiedenes sagen, kann das Modell nur wählen oder beide nennen. Die Korrektur gehört in die Datenschicht: eindeutige Vorrangregeln, entwertete Altstände, zusammengeführte Dubletten. Erst danach lohnt Feinarbeit am Modellverhalten.

Welche Risiken entstehen, wenn wir alle Dateiablagen für einen KI-Assistenten indexieren?

Der Index macht jede historisch gewachsene Fehlberechtigung sofort auffindbar. Dokumente, die formal offen, aber praktisch vergessen waren, werden per Frage abrufbar: Gehaltslisten, Margen, Personalunterlagen. Damit entstehen Datenschutz- und Arbeitsrechtsrisiken, bei personenbezogenen Daten auch Meldepflichten. Vor der Indexierung gehören drei Schritte gesetzt: Berechtigungsprüfung auf Soll-Ist-Abweichung, Ausschlussliste für sensible Bereiche, und ein Test, ob der Assistent Berechtigungen des fragenden Nutzers durchgängig respektiert.

Sollten wir das KI-Projekt stoppen, bis die Daten bereinigt sind, oder beides parallel machen?

Ein vollständiger Stopp ist selten nötig, volle Parallelität selten ehrlich. Der belastbare Mittelweg: den KI-Piloten auf einen Bestand verengen, der bereits sauber ist oder sich schnell bereinigen lässt, etwa eine Produktlinie. Daran lässt sich der Nutzen real messen, während die Bereinigung des Restbestands als eigenes Projekt läuft. Wichtig ist die Reihenfolge im Einzelfall: erst der saubere Korridor, dann die Ausweitung. Die umgekehrte Reihenfolge erzeugt das Muster dieser Fallakte.

Quellen der typisierten Muster

  1. Gartner (2024): „Gartner Predicts 30% of Generative AI Projects Will Be Abandoned After Proof of Concept By End of 2025“, Abbruchgründe: schlechte Datenqualität, unzureichende Risikokontrollen, steigende Kosten, unklarer Geschäftswert. https://www.gartner.com/en/newsroom/press-releases/2024-07-29-gartner-predicts-30-percent-of-generative-ai-projects-will-be-abandoned-after-proof-of-concept-by-end-of-2025
  2. S&P Global Market Intelligence (2025): Befragung von über 1.000 Unternehmen, 42 Prozent gaben die Mehrheit ihrer KI-Initiativen auf, im Schnitt wurden 46 Prozent der Proof-of-Concepts vor Produktivgang verworfen. https://www.ciodive.com/news/AI-project-fail-data-SPGlobal/742590/
  3. RAND Corporation (2024): „The Root Causes of Failure for Artificial Intelligence Projects“, über 80 Prozent Fehlschlagquote; fehlende oder unzureichende Daten als eine von fünf Hauptursachen („80 percent of AI is the dirty work of data engineering“). https://www.rand.org/pubs/research_reports/RRA2680-1.html
  4. Informatica (2025): „CDO Insights 2025“ (600 Data Leader), 43 Prozent nennen Qualität, Vollständigkeit und Readiness der Daten als Haupthindernis; 67 Prozent bringen weniger als die Hälfte ihrer GenAI-Piloten in Produktion. https://www.informatica.com/campaigns/cdo-insights-2025/assets/resources/cdo_insights_2025_PDF.pdf
  5. Fivetran (2025): Befragung zu AI Data Readiness, 42 Prozent der Unternehmen melden, dass mehr als die Hälfte ihrer KI-Projekte wegen mangelnder Daten-Readiness verzögert, unter Erwartung oder gescheitert sind. https://www.fivetran.com/press/fivetran-report-finds-nearly-half-of-enterprise-ai-projects-fail-due-to-poor-data-readiness
  6. MIT NANDA (2025): „The GenAI Divide: State of AI in Business 2025“, 95 Prozent der GenAI-Piloten ohne messbaren P&L-Effekt; Scheitern überwiegend an Integration in reale Arbeitsabläufe, nicht an Modellqualität. https://www.mlq.ai/media/quarterly_decks/v0.1_State_of_AI_in_Business_2025_Report.pdf

Das Entscheider-Briefing

Ein Briefing pro Woche: Entscheidungsfragen, eingeordnete Zahlen und Fristen. Ihre Adresse geben wir nicht weiter.

Sie erhalten zuerst eine E-Mail mit einem Bestätigungslink. Erst nach dem Klick nehmen wir Sie auf. Abmeldung mit einem Klick in jeder Ausgabe.

Weiterführend im Themenfeld