Der Pilot lieferte zwölf Prozent und galt als Misserfolg
9 Min. Lesezeit
Jetzt lesenDer Anstoß kam von außen. Zwei Großkunden fragten im Jahresgespräch nach der KI-Strategie, ein Wettbewerber warb öffentlich mit KI-gestützter Tourenplanung. Auf dem Strategie-Offsite beschloss die Geschäftsführung eine „KI-Offensive“: 1,2 Millionen Euro für das erste Jahr, sichtbar in allen Bereichen, Start sofort.
| Merkmal | Ausprägung |
|---|---|
| Branche | Logistik (Stückgut, Kontraktlogistik, eigene Flotte) |
| Unternehmensgröße | rund 1.400 Mitarbeiter, sieben Niederlassungen |
| Vorhaben | „KI-Offensive“: acht parallele Piloten quer durch alle Bereiche |
| Laufzeit bis Kipppunkt | 14 Monate |
| Versenkte Kosten (typisiert) | rund 1,1 Millionen Euro direkt, ohne Opportunitätskosten |
| Scheiter-Muster | Unklarer Business Case: keine Baseline, keine Wertlogik, keine Abbruchkriterien |
Diese Fallakte ist ein typisiertes, redaktionell verdichtetes Post-mortem: Unternehmen, Personen und Projektverlauf sind fiktiv, die Entscheidungen, Zahlen und Fehlermuster folgen dokumentierten Scheiter-Mustern aus Studien und veröffentlichten Projektberichten (Quellen am Ende).
Der Anstoß kam von außen. Zwei Großkunden fragten im Jahresgespräch nach der KI-Strategie, ein Wettbewerber warb öffentlich mit KI-gestützter Tourenplanung. Auf dem Strategie-Offsite beschloss die Geschäftsführung eine „KI-Offensive“: 1,2 Millionen Euro für das erste Jahr, sichtbar in allen Bereichen, Start sofort.
Die Logik dahinter war nachvollziehbar. Niemand wusste, welcher Anwendungsfall trägt. Also sollten viele Versuche schnell Erfahrung schaffen: Tourenplanung, Kundenservice-Chatbot, Beleg-Erkennung im Wareneingang, ETA-Prognose, Bewerbervorauswahl, Rechnungsprüfung, E-Mail-Klassifizierung, dazu ein Copilot-Rollout für die Verwaltung. Jeder Bereichsleiter bekam einen Piloten und Budget. Das fühlte sich nach Aufbruch an und verteilte die Last auf viele Schultern.
Was auf dem Offsite nicht beschlossen wurde, war der Maßstab. Keine der acht Initiativen hatte eine dokumentierte Ausgangsbasis, eine Wertlogik oder ein Kriterium für Stopp und Ausbau. Genau dieses Vorgehen beschreibt die Studienlage als Normalfall: BCG zählte 2024 nur 26 Prozent der Unternehmen, die über Proof-of-Concepts hinaus messbaren Wert erreichen. Der Rest experimentiert, ohne den Nachweis führen zu können.
Jede Entscheidung wirkte im Moment vernünftig. Zusammen bauten sie ein Portfolio, dessen Wirkung niemand mehr belegen konnte.
| Monat | Entscheidung | Was dabei überging |
|---|---|---|
| 1 | Beschluss der Offensive: acht Piloten, Budget gleichmäßig verteilt | Keine Priorisierung nach Wertpotenzial. Acht halbe Projekte statt zwei ganze. Keine Baseline-Erhebung vor dem Start. |
| 2 | Jeder Bereich führt seinen Piloten selbst, „kurze Wege statt Overhead“ | Kein gemeinsames Messkonzept, keine zentrale Instanz, die Vergleichbarkeit hätte erzwingen können. |
| 4 | Erste Demos im Management-Meeting, Fortschrittsbericht eingeführt | Der Bericht zählte Aktivitäten: Workshops, angebundene Systeme, Nutzerzahlen. Wirkung kam als Spalte nicht vor. |
| 6 | CFO fragt nach ROI, Antwort „zu früh“; alle acht laufen weiter | Der letzte gute Moment, Abbruchkriterien nachzuziehen, verstrich. Weiterlaufen wurde zum Standard, der keine Begründung mehr brauchte. |
| 9 | Copilot-Lizenzen für die gesamte Verwaltung verlängert | Die Nutzungsquote lag bei rund 30 Prozent. Niemand verglich Lizenzkosten mit tatsächlicher Nutzung, das Reporting zählte weiter Lizenzen als Erfolg. |
| 12 | Vertragsverlängerungen bei drei Anbietern im Paket verhandelt | Zwei Piloten waren faktisch tot, aber nie formell beendet. Sie liefen als Kostenstellen weiter, weil ein Stopp jemandem als Scheitern zugerechnet worden wäre. |
| 13 | Vorbereitung der Budgetrunde: Bereiche liefern Erfolgsfolien zu | Die Folien enthielten Adjektive und Nutzerstimmen. Auf keiner stand eine Zahl mit Vorher-Nachher-Bezug. |
Monat 14, Budgetklausur für das Folgejahr. Der CFO hatte die Wirtschaftsplanung zu kürzen und stellte jedem Pilotverantwortlichen dieselbe Frage: „Eine Zahl. Was hat es gebracht?“
Der Leiter Fuhrpark kam der Antwort am nächsten. Die Tourenplanung habe die gefahrenen Kilometer je Sendung gesenkt, etwa vier Prozent. Auf die Nachfrage, gegen welchen Referenzwert, fiel die Antwort auseinander. Im Pilotjahr hatten sich Sendungsstruktur, zwei Großkunden und die Dieselpreise geändert. Eine Vorher-Messung existierte nicht. Ob die vier Prozent vom System kamen oder von der veränderten Struktur, war nicht mehr trennbar, und zwar endgültig nicht: Eine Baseline lässt sich nachträglich nicht erheben.
Die übrigen sieben Antworten waren dünner. Der Chatbot „entlastet spürbar“, die Beleg-Erkennung „läuft stabil“, der Copilot „wird gut angenommen“. Nach vierzig Minuten beendete der CFO die Runde mit einem Satz, der im Protokoll steht: „Wir geben seit vierzehn Monaten Geld für etwas aus, dessen Wirkung niemand von Ihnen beziffern kann.“
Das war der Kipppunkt, und er war unumkehrbar aus einem strukturellen Grund. Um Wirkung zu belegen, hätte jeder Pilot vierzehn Monate früher eine Messbasis gebraucht. Der einzige Weg zur Zahl wäre ein Neustart unter Messbedingungen gewesen, und dafür war das Vertrauen aufgebraucht. Das Budget wurde halbiert, die Offensive zur „Konsolidierungsphase“ erklärt. Sechs Piloten endeten binnen drei Monaten. Bezeichnend ist, was überlebte: die Rechnungsprüfung, der einzige Fall mit harter, zählbarer Größe, war vierzehn Monate lang am knappsten ausgestattet gewesen.
| Posten | Betrag/Ausmaß (typisiert) | Einordnung |
|---|---|---|
| Lizenzen, Anbieter, Integration (8 Piloten) | rund 780.000 Euro | Darunter zwei faktisch tote Piloten, die sechs Monate als Kostenstellen weiterliefen |
| Interne Aufwände | rund 320.000 Euro | Projektleitung in acht Bereichen, IT-Anbindungen, Berichtswesen |
| Opportunitätskosten | hoch, nicht bezifferbar | Der wertstärkste Fall (Rechnungsprüfung) blieb unterfinanziert; ein fokussiertes Vorgehen hätte belegbare Wirkung liefern können |
| Organisationsschaden | zwei bis drei Jahre Nachwirkung | „KI bringt bei uns nichts“ wurde zur Hausmeinung, obwohl die Aussage nie geprüft werden konnte |
| Kundenwirkung | nicht bezifferbar | Die beiden Großkunden, deren Nachfrage die Offensive auslöste, erhielten im Folgejahr keine belastbare Antwort |
Die eigentliche Pointe der Bilanz: Es gibt keinen Beleg, dass die Piloten wirkungslos waren. Es gibt nur den Beleg, dass niemand es wissen kann. Das ist der teuerste Zustand, denn er entwertet auch das, was funktioniert haben mag. MIT NANDA zeigte 2025 dasselbe Muster im Großen: 95 Prozent der GenAI-Piloten ohne messbaren Ergebniseffekt, häufig schlicht, weil keine Messbasis existierte.
Messen Sie die Zielgröße vier bis acht Wochen vor dem Start und dokumentieren Sie die Rahmenbedingungen dazu: Mengenstruktur, Preisstände, Personalstand. Wo das Umfeld stark schwankt, hilft eine Vergleichsgruppe: eine Niederlassung oder Route arbeitet mit dem System, eine strukturell ähnliche ohne. Die Differenz zwischen beiden ist robuster als jeder Vorher-Nachher-Vergleich. Perfektion ist nicht das Ziel. Eine grobe, dokumentierte Ausgangsbasis schlägt jede nachträgliche Schätzung, denn nachträglich lässt sich eine Baseline nicht mehr erheben.
Als Faustregel: zwei bis drei, nicht acht. Maßgeblich ist nicht die Zahl der Ideen, sondern die Zahl der Vorhaben, die Sie sauber messen und mit Fachbereichs-Kapazität begleiten können. Studien zu erfolgreichen Anwendern zeigen ein konsistentes Muster: Wenige, hoch priorisierte Initiativen mit klarer Wertlogik schlagen breite Portfolios. Für jede weitere Idee gilt eine Warteliste mit dokumentiertem Wertversprechen. Nachrücken darf, was einen frei gewordenen Platz und eine messbare Zielgröße hat.
Je Vorhaben drei Ebenen. Erstens die Wirkungsgröße aus der Wertlogik: Kosten je Vorgang, Durchlaufzeit, Fehlerquote, jeweils gegen die Baseline. Zweitens eine Nutzungsgröße als Frühindikator: Anteil der Vorgänge, die tatsächlich über das System laufen. Drittens die Vollkosten: Lizenzen, Integration, interne Aufwände. Aktivitätsgrößen wie Workshop-Zahlen oder ausgerollte Lizenzen gehören nicht in den Bericht. Sie messen Bewegung, nicht Fortschritt, und verdecken über Monate, dass Wirkung fehlt.
Abgebrochen wird, wenn ein vorab beschlossenes Kriterium reißt: Wirkungsgröße nach definierter Frist nicht erreicht, Nutzung dauerhaft unter Schwelle, Kosten über Deckel. Die Entscheidung gehört auf Portfolioebene, also zu Geschäftsführung oder Lenkungskreis, nicht zum Pilotverantwortlichen. Der steckt strukturell im Interessenkonflikt, weil ein Stopp ihm als Scheitern zugerechnet wird. Wichtig ist die Kultur dahinter: Ein sauber begründeter Abbruch ist ein Erkenntnisgewinn. Bei Abbruchquoten von 30 bis 46 Prozent in der Breite ist er der statistische Normalfall.
Prüfen Sie zuerst, ob Wirkung fehlt oder nur die Messung. Das ist der entscheidende Unterschied. Wenn Nutzer das System freiwillig und regelmäßig verwenden, spricht das für einen Nutzen, der nur nicht gemessen wird: Dann lohnt ein Reset unter Messbedingungen mit begrenzter Frist, etwa drei Monate mit Baseline und Vergleichsgruppe. Liegt die Nutzung niedrig und braucht das System Dauerbetreuung, ist der Abbruch meist die bessere Entscheidung. Verlängern Sie nie allein deshalb, weil schon viel investiert wurde. Versenkte Kosten sind kein Argument für weitere.
Ein Briefing pro Woche: Entscheidungsfragen, eingeordnete Zahlen und Fristen. Ihre Adresse geben wir nicht weiter.
9 Min. Lesezeit
Jetzt lesen10 Min. Lesezeit
Jetzt lesen9 Min. Lesezeit
Jetzt lesen