Ausgabe 39/2026 · Stand: Mittwoch, 23. September 2026 Das Fachmagazin für KI-Transformation im Mittelstand
Briefing abonnieren
Fallakte

Der Pilot lieferte zwölf Prozent und galt als Misserfolg

Das Unternehmen fertigt Spezialchemikalien im Kundenauftrag. Jede Charge braucht einen Prüfbericht, jede Rezepturänderung eine dokumentierte Freigabe. Das Qualitätslabor mit zwölf Mitarbeitern verbringt einen erheblichen Teil seiner Zeit mit dieser Dokumentation.

Veröffentlicht · Aktualisiert · 9 Min. Lesezeit
Mitarbeiterin mit Headset an einem aufgeräumten Arbeitsplatz einer offenen Servicefläche.
Im Serviceaufkommen wird Entlastung zuerst spürbar. Symbolbild, KI-generiert für KIONIER.
Merkmal Ausprägung
Branche Chemie (Spezialchemie, Auftragsfertigung)
Unternehmensgröße rund 350 Mitarbeiter
Vorhaben KI-Assistent zur Vorbefüllung von Prüfberichten im Qualitätslabor, gedacht als Einstieg in breitere Dokumentations-Automatisierung
Laufzeit bis Kipppunkt 5 Monate (Beerdigung des Projekts nach 9 Monaten)
Versenkte Kosten (typisiert) rund 120.000 Euro, dazu ein funktionierender Anwendungsfall
Scheiter-Muster Erwartungsmanagement: Das Projekt scheiterte an der Messlatte, nicht an der Technik

Diese Fallakte ist ein typisiertes, redaktionell verdichtetes Post-mortem: Unternehmen, Personen und Projektverlauf sind fiktiv, die Entscheidungen, Zahlen und Fehlermuster folgen dokumentierten Scheiter-Mustern aus Studien und veröffentlichten Projektberichten (Quellen am Ende).

Ausgangslage

Das Unternehmen fertigt Spezialchemikalien im Kundenauftrag. Jede Charge braucht einen Prüfbericht, jede Rezepturänderung eine dokumentierte Freigabe. Das Qualitätslabor mit zwölf Mitarbeitern verbringt einen erheblichen Teil seiner Zeit mit dieser Dokumentation.

Der geschäftsführende Gesellschafter besuchte im Herbst eine Branchenmesse. Ein Anbieter führte dort einen Dokumenten-Assistenten vor: Aus Messdaten und Textbausteinen entstand in Sekunden ein fertiger Berichtsentwurf. Die Demo lief auf kuratierten Beispieldaten, was in der Vorführung nicht zur Sprache kam. Der Gesellschafter war beeindruckt, und zwar zu Recht: Die Technik konnte, was sie zeigte.

Das Problem entstand eine Woche später. In der Beiratssitzung berichtete er von der Messe und nannte eine Zahl: 30 Prozent Produktivitätsgewinn, über die Verwaltung und das Labor hinweg. Die Zahl stammte aus dem Prospekt des Anbieters. Sie war keine Lüge. Sie war eine Hoffnung, die als Zusage protokolliert wurde. Der Beirat, besetzt mit zwei Bankenvertretern und einem externen Industriellen, nahm sie wohlwollend auf. Ab diesem Tag hatte das Projekt eine Messlatte, die es nie selbst gewählt hatte.

Die Entscheidungen

Kein einzelner Schritt war fahrlässig. Die Kette machte aus einem soliden Piloten einen programmierten Misserfolg.

Monat Entscheidung Was dabei überging
1 Der Gesellschafter nennt dem Beirat 30 Prozent Produktivitätsgewinn als Zielgröße Niemand trennte das Demo-Ergebnis des Anbieters von der eigenen Betriebsrealität; die Zahl hatte keine Baseline
1 Der Beirat nimmt die 30 Prozent ins Protokoll und in die Mittelfristplanung auf Aus einer Hoffnung wurde eine Planungsgröße; eine Revision hätte fortan wie ein Eingeständnis gewirkt
2 Als Pilot wird die Vorbefüllung von Prüfberichten im Labor gewählt, weil dort die Daten sauber vorliegen Der Pilot deckte eine Teilaufgabe ab, das Versprechen aber das ganze Haus; diese Lücke wurde nicht benannt
3 Auf ein Messkonzept wird verzichtet, man wolle erst sehen, was herauskommt Es blieb undefiniert, worauf sich Prozentwerte beziehen: auf die Aufgabe, das Labor oder das Unternehmen
5 Im Zwischenbericht meldet der Gesellschafter dem Beirat, das Projekt sei auf Kurs Der letzte gute Moment, die Erwartung zu korrigieren, verstrich; stattdessen wurde sie bekräftigt
8 Die Abschlussmessung wird als eine Folie in die Beiratsvorlage übernommen: zwölf Prozent Der Kontext fehlte: zwölf Prozent wovon, verglichen womit, mit welchem Ausbaupfad
9 Der Beirat bewertet das Ergebnis als weit unter Plan; die Rollout-Freigabe wird verweigert Bewertet wurde die Differenz zur Messe-Zahl, nicht die Wirtschaftlichkeit der Teilaufgabe

Der Kipppunkt

Der Kipppunkt lag nicht in der Beiratssitzung von Monat 9. Er lag vier Monate früher, im Zwischenbericht von Monat 5.

Zu diesem Zeitpunkt wusste das Projektteam bereits, was realistisch war. Die ersten Wochen im Labor zeigten eine Zeitersparnis von 10 bis 15 Prozent bei der Berichtserstellung. Hochgerechnet auf die gesamte Laborkapazität: rund zwei Prozent. Hochgerechnet auf das Unternehmen: nicht messbar. Die Projektleiterin schrieb das in ihre Vorlage für den Zwischenbericht, mit dem Vorschlag, die Zielgröße gegenüber dem Beirat neu zu fassen.

Der Gesellschafter strich die Passage. Nicht aus Täuschungsabsicht, sondern aus einem im Moment verständlichen Kalkül: Eine Korrektur nach unten hätte in der Sitzung wie ein halbes Scheitern gewirkt. Der Pilot lief doch gut. Vielleicht würden die Zahlen noch steigen. Er meldete: auf Kurs.

Damit war das Scheitern unumkehrbar, denn ab jetzt gab es keinen Ausgang mehr, in dem zwölf Prozent eine gute Nachricht sein konnten. Jede spätere Korrektur wäre als Rückzug gelesen worden. Die Abschlussmessung in Monat 8 war handwerklich sauber: zwölf Prozent Zeitersparnis bei der Berichtserstellung, stabile Qualität, hohe Akzeptanz im Labor. Gemessen am Pilotziel ein Erfolg. Gemessen an der protokollierten Erwartung ein Debakel. In der Beiratssitzung von Monat 9 fiel der Satz, der das Projekt beendete: „Das ist ein Zehntel von dem, was uns angekündigt wurde.“ Die Rollout-Freigabe wurde verweigert. Das Budget floss in ein anderes Vorhaben.

Das Paradox dieser Fallakte: Die Technik hat geliefert. Gestorben ist das Projekt an der Differenz zwischen zwei Zahlen, von denen nur eine je gemessen wurde.

Schadensbilanz

Posten Betrag/Ausmaß Einordnung
Externe Pilotkosten (Anbieter, Anpassung, Schulung) rund 85.000 Euro Direkte Kosten; das Ergebnis war technisch brauchbar und wurde dennoch stillgelegt
Interner Aufwand (Projektleitung, Labor, IT) rund 0,4 Personenjahre (35.000 Euro) Direkte Kosten; inklusive der Messung, deren Ergebnis niemand verwenden wollte
Nicht realisierte Entlastung rund 700 Laborstunden pro Jahr Opportunitätskosten: zwölf Prozent der Berichtszeit, dauerhaft, bei laufend steigendem Dokumentationsaufwand
Verlorener Ausbaupfad zwei bis drei Folge-Anwendungsfälle Rezepturfreigaben und Kundenspezifikationen waren als nächste Schritte vorbereitet und wurden mit beerdigt
Organisationsschaden erheblich Das Laborteam sah ein funktionierendes Werkzeug verschwinden; die Projektleiterin verließ das Haus ein halbes Jahr später
Beschädigte Sprechfähigkeit zwei Jahre KI gilt im Beirat als enttäuschtes Thema; jeder neue Antrag startet mit Beweislast gegen sich

Was der Vorstand hätte anders machen müssen

  1. Monat 1, vor der Beiratssitzung: Die Anbieterzahl als das kennzeichnen, was sie war: ein Prospektwert ohne eigene Baseline. Formulierung als Hypothese („wir prüfen, was davon bei uns erreichbar ist“) statt als Zielgröße. Danach stand die Zahl im Protokoll und war nur noch teuer zu korrigieren.
  2. Monat 2 bis 3: Vor dem Pilotstart eine Messvereinbarung treffen: Bezugsgröße (Teilaufgabe, nicht Unternehmen), Baseline-Erhebung, Erfolgsschwelle. Ein Pilot, dessen Erfolgsdefinition fehlt, erbt automatisch die lauteste Erwartung im Raum.
  3. Monat 5, Zwischenbericht: Die Hochrechnung der Projektleiterin dem Beirat vorlegen und die Erwartung aktiv neu verankern. Das war der letzte Zeitpunkt, zu dem eine Korrektur als Steuerung gegolten hätte statt als Eingeständnis.
  4. Monat 9, Beiratssitzung: Die Entscheidung über den Rollout von der Frage trennen, ob die Messe-Erwartung erfüllt wurde. Entscheidungsgrundlage wäre die Wirtschaftlichkeit der Teilaufgabe gewesen: 700 Stunden pro Jahr gegen laufende Kosten. Selbst hier war die Rettung noch möglich, sie hätte nur den Mut erfordert, den eigenen Fehler aus Monat 1 zu benennen.

Übertragbare Lehren

  • Stammt jede Prozentzahl, die wir in Gremien berichten, aus einer eigenen Messung, oder aus einem Anbieterprospekt?
  • Ist bei jeder Produktivitätszahl die Bezugsgröße benannt: Teilaufgabe, Abteilung oder Gesamtunternehmen?
  • Haben wir vor dem Pilotstart eine Baseline erhoben, gegen die das Ergebnis später gemessen wird?
  • Ist die Erfolgsschwelle des Piloten schriftlich vereinbart, bevor die erste Zahl vorliegt?
  • Gibt es einen definierten Zeitpunkt, an dem Erwartungen gegenüber Gremien nachjustiert werden, ohne dass es als Scheitern gilt?
  • Würde ein Ergebnis von 10 bis 15 Prozent bei einer Teilaufgabe bei uns als Erfolg gelten, und wissen das alle Beteiligten?
  • Trennt unsere Gremienvorlage die Bewertung des Piloten von der Bewertung der ursprünglichen Ankündigung?
  • Wer im Haus darf der Geschäftsführung widersprechen, wenn eine kommunizierte Zahl nicht haltbar ist, und wurde das je genutzt?

FAQ

Sind 10 bis 15 Prozent Zeitersparnis bei einer Teilaufgabe ein Erfolg oder ein Misserfolg?

Für einen ersten Piloten ist das ein belastbarer Erfolg. Studien zu generativer KI zeigen: Breite, sofort messbare Produktivitätssprünge über ganze Unternehmen sind die Ausnahme, nicht die Regel. MIT NANDA fand 2025, dass 95 Prozent der Organisationen keinen messbaren Ergebniseffekt erreichen. Wer bei einer klar umrissenen Aufgabe zweistellig spart, gehört bereits zur Minderheit mit nachweisbarem Nutzen. Entscheidend ist die Rechnung: eingesparte Stunden mal Dauerhaftigkeit gegen laufende Kosten, plus der Ausbaupfad auf ähnliche Aufgaben.

Wie setze ich gegenüber Beirat oder Gesellschaftern realistische Erwartungen für ein KI-Projekt?

Berichten Sie in drei getrennten Größen: erstens die Hypothese (was der Anbieter oder eine Studie verspricht), zweitens den Pilotumfang (welche Aufgabe, welcher Anteil am Ganzen), drittens die Erfolgsschwelle (ab welchem gemessenen Wert der Rollout folgt). Legen Sie diese drei Größen vor dem Start schriftlich vor. Dann ist jede spätere Zahl eine Information und kein Urteil. Vereinbaren Sie außerdem einen festen Termin zur Erwartungsrevision, etwa nach der Hälfte der Pilotlaufzeit.

Warum wirken Anbieter-Demos so viel stärker als spätere Pilotergebnisse?

Weil Demos auf kuratierten Daten laufen und um die Stärken des Systems herum gebaut sind. Der Pilot dagegen trifft auf echte Daten, Ausnahmen und gewachsene Prozesse. Gartner ordnete generative KI 2024 dem Tal der Enttäuschung zu und nannte als Hauptgrund genau diese Lücke zwischen hohen Erwartungen und Betriebsrealität. Die praktische Konsequenz: Behandeln Sie jede Demo-Zahl als oberen Rand des theoretisch Möglichen. Verhandeln Sie mit dem Anbieter einen Test auf Ihren eigenen Daten, bevor Zahlen das Haus erreichen.

Wie korrigiere ich eine zu hohe Erwartung, die schon im Gremium kommuniziert ist?

Früh, aktiv und mit neuer Datenlage als Begründung. Der wirksamste Rahmen: „Wir haben jetzt erstmals eigene Messwerte, sie ersetzen die Prospektannahme.“ Das macht die Korrektur zu einem Zeichen von Steuerungsfähigkeit. Je später die Korrektur, desto mehr wirkt sie als Rückzug. Hilfreich ist, die ursprüngliche Zahl explizit zu benennen und einzuordnen, statt sie stillschweigend verschwinden zu lassen. Gremien verzeihen revidierte Annahmen deutlich eher als den Eindruck, geführt worden zu sein.

Sollten wir einen Piloten wiederbeleben, der an Erwartungen statt an Technik gescheitert ist?

Prüfen Sie es ernsthaft, denn die teuerste Position ist oft schon bezahlt: der Nachweis, dass es funktioniert. Rechnen Sie den Fall neu, diesmal gegen die Teilaufgabe: eingesparte Stunden, Qualität, Akzeptanz, laufende Kosten. Trägt die Rechnung, starten Sie einen Neuantrag mit sauberer Messvereinbarung und benennen Sie offen, woran der erste Anlauf scheiterte. Warten Sie nicht zu lange: Wissen, Konfiguration und die beteiligten Personen verfallen. Nach ein bis zwei Jahren beginnt auch ein bewiesener Anwendungsfall wieder bei null.

Quellen der typisierten Muster

  1. Gartner (2024): Hype Cycle for Artificial Intelligence 2024. Generative KI im Tal der Enttäuschung; Diskrepanz zwischen hohen Erwartungen und Realität als zentraler Treiber; weniger als 30 Prozent der AI-Verantwortlichen berichten von zufriedenen CEOs, bei durchschnittlich 1,9 Millionen US-Dollar GenAI-Ausgaben. https://www.gartner.com/en/articles/hype-cycle-for-artificial-intelligence
  2. MIT NANDA (2025): The GenAI Divide. State of AI in Business 2025: 95 Prozent der Organisationen ohne messbaren P&L-Effekt; verbreitete Werkzeuge steigern individuelle Produktivität, ohne auf Unternehmensebene sichtbar zu werden.
  3. Gartner (2024): Gartner Predicts 30% of Generative AI Projects Will Be Abandoned After Proof of Concept By End of 2025; unklarer Geschäftswert als einer von vier Hauptgründen. https://www.gartner.com/en/newsroom/press-releases/2024-07-29-gartner-predicts-30-percent-of-generative-ai-projects-will-be-abandoned-after-proof-of-concept-by-end-of-2025
  4. S&P Global Market Intelligence / 451 Research (2025): 42 Prozent der Unternehmen gaben die Mehrheit ihrer KI-Initiativen auf; im Schnitt 46 Prozent der Proof-of-Concepts verworfen. Vgl. CIO Dive, 2025. https://www.ciodive.com/news/AI-project-fail-data-SPGlobal/742590/
  5. RAND Corporation (2024): The Root Causes of Failure for Artificial Intelligence Projects: missverstandene oder falsch kommunizierte Problem- und Zieldefinitionen als häufigste Fehlerursache. https://www.rand.org/pubs/research_reports/RRA2680-1.html
  6. Horváth (2024): KI-Investitionen drohen in vielen Unternehmen zu versickern. C-Level sieht Umsetzungsprobleme deutlich seltener als die Fachebene; hohe Erwartungen bei verdoppelter Projektlast. https://www.horvath-partners.com/de/presse/detail/horvath-studie-ki-investitionen-drohen-in-vielen-unternehmen-zu-versickern

Das Entscheider-Briefing

Ein Briefing pro Woche: Entscheidungsfragen, eingeordnete Zahlen und Fristen. Ihre Adresse geben wir nicht weiter.

Sie erhalten zuerst eine E-Mail mit einem Bestätigungslink. Erst nach dem Klick nehmen wir Sie auf. Abmeldung mit einem Klick in jeder Ausgabe.

Weiterführend im Themenfeld