Ausgabe 39/2026 · Stand: Mittwoch, 23. September 2026 Das Fachmagazin für KI-Transformation im Mittelstand
Briefing abonnieren
Fallakte

Acht Piloten, keine Zahl: Wie eine KI-Offensive ohne Wertlogik verglüht

Der Anstoß kam von außen. Zwei Großkunden fragten im Jahresgespräch nach der KI-Strategie, ein Wettbewerber warb öffentlich mit KI-gestützter Tourenplanung. Auf dem Strategie-Offsite beschloss die Geschäftsführung eine „KI-Offensive“: 1,2 Millionen Euro für das erste Jahr, sichtbar in allen Bereichen, Start sofort.

Veröffentlicht · Aktualisiert · 9 Min. Lesezeit
Kommissionierer scannt einen Behälter in einem Regalgang des Kleinteilelagers.
Wo Bestände und Belege auseinanderlaufen, hilft kein Modell. Symbolbild, KI-generiert für KIONIER.
Merkmal Ausprägung
Branche Logistik (Stückgut, Kontraktlogistik, eigene Flotte)
Unternehmensgröße rund 1.400 Mitarbeiter, sieben Niederlassungen
Vorhaben „KI-Offensive“: acht parallele Piloten quer durch alle Bereiche
Laufzeit bis Kipppunkt 14 Monate
Versenkte Kosten (typisiert) rund 1,1 Millionen Euro direkt, ohne Opportunitätskosten
Scheiter-Muster Unklarer Business Case: keine Baseline, keine Wertlogik, keine Abbruchkriterien

Diese Fallakte ist ein typisiertes, redaktionell verdichtetes Post-mortem: Unternehmen, Personen und Projektverlauf sind fiktiv, die Entscheidungen, Zahlen und Fehlermuster folgen dokumentierten Scheiter-Mustern aus Studien und veröffentlichten Projektberichten (Quellen am Ende).

Ausgangslage

Der Anstoß kam von außen. Zwei Großkunden fragten im Jahresgespräch nach der KI-Strategie, ein Wettbewerber warb öffentlich mit KI-gestützter Tourenplanung. Auf dem Strategie-Offsite beschloss die Geschäftsführung eine „KI-Offensive“: 1,2 Millionen Euro für das erste Jahr, sichtbar in allen Bereichen, Start sofort.

Die Logik dahinter war nachvollziehbar. Niemand wusste, welcher Anwendungsfall trägt. Also sollten viele Versuche schnell Erfahrung schaffen: Tourenplanung, Kundenservice-Chatbot, Beleg-Erkennung im Wareneingang, ETA-Prognose, Bewerbervorauswahl, Rechnungsprüfung, E-Mail-Klassifizierung, dazu ein Copilot-Rollout für die Verwaltung. Jeder Bereichsleiter bekam einen Piloten und Budget. Das fühlte sich nach Aufbruch an und verteilte die Last auf viele Schultern.

Was auf dem Offsite nicht beschlossen wurde, war der Maßstab. Keine der acht Initiativen hatte eine dokumentierte Ausgangsbasis, eine Wertlogik oder ein Kriterium für Stopp und Ausbau. Genau dieses Vorgehen beschreibt die Studienlage als Normalfall: BCG zählte 2024 nur 26 Prozent der Unternehmen, die über Proof-of-Concepts hinaus messbaren Wert erreichen. Der Rest experimentiert, ohne den Nachweis führen zu können.

Die Entscheidungen

Jede Entscheidung wirkte im Moment vernünftig. Zusammen bauten sie ein Portfolio, dessen Wirkung niemand mehr belegen konnte.

Monat Entscheidung Was dabei überging
1 Beschluss der Offensive: acht Piloten, Budget gleichmäßig verteilt Keine Priorisierung nach Wertpotenzial. Acht halbe Projekte statt zwei ganze. Keine Baseline-Erhebung vor dem Start.
2 Jeder Bereich führt seinen Piloten selbst, „kurze Wege statt Overhead“ Kein gemeinsames Messkonzept, keine zentrale Instanz, die Vergleichbarkeit hätte erzwingen können.
4 Erste Demos im Management-Meeting, Fortschrittsbericht eingeführt Der Bericht zählte Aktivitäten: Workshops, angebundene Systeme, Nutzerzahlen. Wirkung kam als Spalte nicht vor.
6 CFO fragt nach ROI, Antwort „zu früh“; alle acht laufen weiter Der letzte gute Moment, Abbruchkriterien nachzuziehen, verstrich. Weiterlaufen wurde zum Standard, der keine Begründung mehr brauchte.
9 Copilot-Lizenzen für die gesamte Verwaltung verlängert Die Nutzungsquote lag bei rund 30 Prozent. Niemand verglich Lizenzkosten mit tatsächlicher Nutzung, das Reporting zählte weiter Lizenzen als Erfolg.
12 Vertragsverlängerungen bei drei Anbietern im Paket verhandelt Zwei Piloten waren faktisch tot, aber nie formell beendet. Sie liefen als Kostenstellen weiter, weil ein Stopp jemandem als Scheitern zugerechnet worden wäre.
13 Vorbereitung der Budgetrunde: Bereiche liefern Erfolgsfolien zu Die Folien enthielten Adjektive und Nutzerstimmen. Auf keiner stand eine Zahl mit Vorher-Nachher-Bezug.

Der Kipppunkt

Monat 14, Budgetklausur für das Folgejahr. Der CFO hatte die Wirtschaftsplanung zu kürzen und stellte jedem Pilotverantwortlichen dieselbe Frage: „Eine Zahl. Was hat es gebracht?“

Der Leiter Fuhrpark kam der Antwort am nächsten. Die Tourenplanung habe die gefahrenen Kilometer je Sendung gesenkt, etwa vier Prozent. Auf die Nachfrage, gegen welchen Referenzwert, fiel die Antwort auseinander. Im Pilotjahr hatten sich Sendungsstruktur, zwei Großkunden und die Dieselpreise geändert. Eine Vorher-Messung existierte nicht. Ob die vier Prozent vom System kamen oder von der veränderten Struktur, war nicht mehr trennbar, und zwar endgültig nicht: Eine Baseline lässt sich nachträglich nicht erheben.

Die übrigen sieben Antworten waren dünner. Der Chatbot „entlastet spürbar“, die Beleg-Erkennung „läuft stabil“, der Copilot „wird gut angenommen“. Nach vierzig Minuten beendete der CFO die Runde mit einem Satz, der im Protokoll steht: „Wir geben seit vierzehn Monaten Geld für etwas aus, dessen Wirkung niemand von Ihnen beziffern kann.“

Das war der Kipppunkt, und er war unumkehrbar aus einem strukturellen Grund. Um Wirkung zu belegen, hätte jeder Pilot vierzehn Monate früher eine Messbasis gebraucht. Der einzige Weg zur Zahl wäre ein Neustart unter Messbedingungen gewesen, und dafür war das Vertrauen aufgebraucht. Das Budget wurde halbiert, die Offensive zur „Konsolidierungsphase“ erklärt. Sechs Piloten endeten binnen drei Monaten. Bezeichnend ist, was überlebte: die Rechnungsprüfung, der einzige Fall mit harter, zählbarer Größe, war vierzehn Monate lang am knappsten ausgestattet gewesen.

Schadensbilanz

Posten Betrag/Ausmaß (typisiert) Einordnung
Lizenzen, Anbieter, Integration (8 Piloten) rund 780.000 Euro Darunter zwei faktisch tote Piloten, die sechs Monate als Kostenstellen weiterliefen
Interne Aufwände rund 320.000 Euro Projektleitung in acht Bereichen, IT-Anbindungen, Berichtswesen
Opportunitätskosten hoch, nicht bezifferbar Der wertstärkste Fall (Rechnungsprüfung) blieb unterfinanziert; ein fokussiertes Vorgehen hätte belegbare Wirkung liefern können
Organisationsschaden zwei bis drei Jahre Nachwirkung „KI bringt bei uns nichts“ wurde zur Hausmeinung, obwohl die Aussage nie geprüft werden konnte
Kundenwirkung nicht bezifferbar Die beiden Großkunden, deren Nachfrage die Offensive auslöste, erhielten im Folgejahr keine belastbare Antwort

Die eigentliche Pointe der Bilanz: Es gibt keinen Beleg, dass die Piloten wirkungslos waren. Es gibt nur den Beleg, dass niemand es wissen kann. Das ist der teuerste Zustand, denn er entwertet auch das, was funktioniert haben mag. MIT NANDA zeigte 2025 dasselbe Muster im Großen: 95 Prozent der GenAI-Piloten ohne messbaren Ergebniseffekt, häufig schlicht, weil keine Messbasis existierte.

Was der Vorstand hätte anders machen müssen

  1. Auf dem Offsite (Monat 1): Die acht Ideen als Portfolio bewerten und auf zwei bis drei Vorhaben mit klarer Wertlogik verdichten. Je Vorhaben ein Satz: Welche Größe soll sich von welchem Ausgangswert um wie viel bewegen, bis wann. Ideen ohne diesen Satz bleiben auf der Liste, nicht im Budget.
  2. Vor jedem Pilotstart (Monat 1 bis 2): Vier Wochen Baseline-Messung als Startbedingung. Kilometer je Sendung, Bearbeitungszeit je Beleg, Kosten je Serviceanfrage. Wer die Ausgangsbasis nicht misst, verzichtet auf jede spätere Erfolgsaussage, und zwar unumkehrbar.
  3. Bei Einführung des Berichtswesens (Monat 4): Wirkungskennzahlen statt Aktivitätskennzahlen berichten lassen. Ein Bericht, der Workshops und Nutzerzahlen zählt, erzeugt vierzehn Monate gefühlten Fortschritt und null Belege.
  4. Bei der ROI-Nachfrage des CFO (Monat 6): „Zu früh“ als Alarmsignal behandeln und Abbruchkriterien nachziehen. Zu diesem Zeitpunkt war eine Kurskorrektur noch billig: sechs Piloten pausieren, zwei unter Messbedingungen weiterführen.
  5. Vor den Vertragsverlängerungen (Monat 9 bis 12): Jede Verlängerung an eine belegte Wirkungszahl knüpfen. Ein toter Pilot, der aus Gesichtswahrung weiterläuft, kostet doppelt: Geld und die Glaubwürdigkeit der lebenden.

Übertragbare Lehren

  • Hat jedes laufende KI-Vorhaben eine dokumentierte Baseline, die vor dem Start erhoben wurde?
  • Können wir je Vorhaben in einem Satz sagen, welche Kennzahl sich um wie viel bewegen soll und bis wann?
  • Ist unser KI-Portfolio priorisiert, oder haben wir Budget gleichmäßig verteilt, um niemanden zu übergehen?
  • Berichten unsere Statusberichte Wirkung (Vorher-Nachher) oder Aktivität (Workshops, Nutzer, Systeme)?
  • Existieren beschlossene Abbruchkriterien, und wurde in den letzten zwölf Monaten mindestens ein Vorhaben danach beendet?
  • Sind Vertragsverlängerungen bei KI-Anbietern an belegte Wirkungszahlen geknüpft?
  • Wissen wir, welche unserer Piloten faktisch tot sind, aber formal weiterlaufen, und was sie monatlich kosten?
  • Würde der wertstärkste Anwendungsfall im Haus heute mehr Ressourcen bekommen als der sichtbarste?

FAQ

Wie definiere ich vor einem KI-Piloten eine Baseline, wenn sich unser Geschäft ständig ändert?

Messen Sie die Zielgröße vier bis acht Wochen vor dem Start und dokumentieren Sie die Rahmenbedingungen dazu: Mengenstruktur, Preisstände, Personalstand. Wo das Umfeld stark schwankt, hilft eine Vergleichsgruppe: eine Niederlassung oder Route arbeitet mit dem System, eine strukturell ähnliche ohne. Die Differenz zwischen beiden ist robuster als jeder Vorher-Nachher-Vergleich. Perfektion ist nicht das Ziel. Eine grobe, dokumentierte Ausgangsbasis schlägt jede nachträgliche Schätzung, denn nachträglich lässt sich eine Baseline nicht mehr erheben.

Wie viele KI-Piloten sollte ein Unternehmen mit 1.000 bis 1.500 Mitarbeitern parallel betreiben?

Als Faustregel: zwei bis drei, nicht acht. Maßgeblich ist nicht die Zahl der Ideen, sondern die Zahl der Vorhaben, die Sie sauber messen und mit Fachbereichs-Kapazität begleiten können. Studien zu erfolgreichen Anwendern zeigen ein konsistentes Muster: Wenige, hoch priorisierte Initiativen mit klarer Wertlogik schlagen breite Portfolios. Für jede weitere Idee gilt eine Warteliste mit dokumentiertem Wertversprechen. Nachrücken darf, was einen frei gewordenen Platz und eine messbare Zielgröße hat.

Welche Kennzahlen eignen sich für einen KI-Statusbericht an die Geschäftsführung?

Je Vorhaben drei Ebenen. Erstens die Wirkungsgröße aus der Wertlogik: Kosten je Vorgang, Durchlaufzeit, Fehlerquote, jeweils gegen die Baseline. Zweitens eine Nutzungsgröße als Frühindikator: Anteil der Vorgänge, die tatsächlich über das System laufen. Drittens die Vollkosten: Lizenzen, Integration, interne Aufwände. Aktivitätsgrößen wie Workshop-Zahlen oder ausgerollte Lizenzen gehören nicht in den Bericht. Sie messen Bewegung, nicht Fortschritt, und verdecken über Monate, dass Wirkung fehlt.

Wann sollte ich einen laufenden KI-Piloten abbrechen, und wer entscheidet das?

Abgebrochen wird, wenn ein vorab beschlossenes Kriterium reißt: Wirkungsgröße nach definierter Frist nicht erreicht, Nutzung dauerhaft unter Schwelle, Kosten über Deckel. Die Entscheidung gehört auf Portfolioebene, also zu Geschäftsführung oder Lenkungskreis, nicht zum Pilotverantwortlichen. Der steckt strukturell im Interessenkonflikt, weil ein Stopp ihm als Scheitern zugerechnet wird. Wichtig ist die Kultur dahinter: Ein sauber begründeter Abbruch ist ein Erkenntnisgewinn. Bei Abbruchquoten von 30 bis 46 Prozent in der Breite ist er der statistische Normalfall.

Unser KI-Projekt läuft seit über einem Jahr ohne messbare Wirkung. Neustart oder Abbruch?

Prüfen Sie zuerst, ob Wirkung fehlt oder nur die Messung. Das ist der entscheidende Unterschied. Wenn Nutzer das System freiwillig und regelmäßig verwenden, spricht das für einen Nutzen, der nur nicht gemessen wird: Dann lohnt ein Reset unter Messbedingungen mit begrenzter Frist, etwa drei Monate mit Baseline und Vergleichsgruppe. Liegt die Nutzung niedrig und braucht das System Dauerbetreuung, ist der Abbruch meist die bessere Entscheidung. Verlängern Sie nie allein deshalb, weil schon viel investiert wurde. Versenkte Kosten sind kein Argument für weitere.

Quellen der typisierten Muster

  1. Gartner (2024): „Gartner Predicts 30% of Generative AI Projects Will Be Abandoned After Proof of Concept By End of 2025“, unklarer Geschäftswert als einer von vier Hauptabbruchgründen. https://www.gartner.com/en/newsroom/press-releases/2024-07-29-gartner-predicts-30-percent-of-generative-ai-projects-will-be-abandoned-after-proof-of-concept-by-end-of-2025
  2. S&P Global Market Intelligence (2025): 42 Prozent der Unternehmen gaben die Mehrheit ihrer KI-Initiativen auf (Vorjahr 17 Prozent); im Schnitt wurden 46 Prozent der Proof-of-Concepts verworfen. https://www.ciodive.com/news/AI-project-fail-data-SPGlobal/742590/
  3. MIT NANDA (2025): „The GenAI Divide: State of AI in Business 2025“, 95 Prozent der untersuchten GenAI-Piloten ohne messbaren P&L-Effekt; fehlende Messbasis als wiederkehrendes Strukturproblem. https://www.mlq.ai/media/quarterly_decks/v0.1_State_of_AI_in_Business_2025_Report.pdf
  4. Boston Consulting Group (2024): „Where’s the Value in AI?“ (1.000 Führungskräfte, 59 Länder), nur 26 Prozent kommen über Proof-of-Concepts hinaus zu messbarem Wert; Führende setzen auf wenige, hoch priorisierte Initiativen. https://www.bcg.com/press/24october2024-ai-adoption-in-2024-74-of-companies-struggle-to-achieve-and-scale-value
  5. RAND Corporation (2024): „The Root Causes of Failure for Artificial Intelligence Projects“, häufigste Fehlerursache: Führung definiert Problem und Erfolgsmaßstab unklar oder kommuniziert ihn falsch; über 80 Prozent Fehlschlagquote. https://www.rand.org/pubs/research_reports/RRA2680-1.html

Das Entscheider-Briefing

Ein Briefing pro Woche: Entscheidungsfragen, eingeordnete Zahlen und Fristen. Ihre Adresse geben wir nicht weiter.

Sie erhalten zuerst eine E-Mail mit einem Bestätigungslink. Erst nach dem Klick nehmen wir Sie auf. Abmeldung mit einem Klick in jeder Ausgabe.

Weiterführend im Themenfeld