KI-Systeme vom Pilot in den verantworteten Betrieb
13 Min. Lesezeit
Jetzt lesenAm Pilotende gibt es drei ehrliche Optionen — und eine unehrliche: die stille Verlängerung. Ein messbares Entscheidungsraster, Schutz vor Sunk-Cost-Psychologie und ein protokolliertes Review machen aus dem Pilotende eine Portfolioentscheidung statt einer Gesichtsverlust-Debatte.
Am Ende eines KI-Piloten stehen drei legitime Optionen: fortführen Richtung Betrieb, neu aufsetzen mit geändertem Design oder verbindlich stoppen. Entschieden wird gegen sechs messbare Kriterien: Outcome gegen Baseline, Qualität, Adoption, Kosten je Vorgang, Betriebsfähigkeit und Lernwert. Die Entscheidung trifft ein Portfoliogremium. Die Erbauer liefern dort Daten, bewerten aber nicht selbst. Denn die Neigung, eigenen Fehlinvestitionen Geld nachzuwerfen, ist experimentell gut belegt. Protokolliert wird in einem einseitigen Memo mit Begründung, Kapazitätsfreigabe und Lerntransfer. Die stille Verlängerung ohne neue Hypothese ist keine vierte Option, sondern die teuerste Form der Entscheidungsvermeidung.
Der Rückstau ist real. Gartner prognostizierte 2024, dass mindestens 30 Prozent der GenAI-Projekte nach dem Proof of Concept aufgegeben werden. S&P Global Market Intelligence (2025) maß kurz darauf, dass 42 Prozent der befragten Unternehmen bereits die Mehrheit ihrer KI-Initiativen abgebrochen haben. McKinsey (2025) beschreibt die Gegenseite desselben Befunds. 88 Prozent der Organisationen nutzen KI, aber die meisten stecken auf Unternehmensebene im Pilotstadium fest. Zwischen diesen Zahlen liegt ein Bestand an Piloten ohne förmliche Entscheidung. Sie laufen, kosten und blockieren.
Wichtig ist die Arbeitsteilung mit dem Business Case: Abbruchkriterien mit Messgröße und Datum entstehen vor dem Start, als Teil der Freigabe. Dieser Beitrag behandelt den zweiten Akt: das Review am Pilotende, wenn die Messwerte vorliegen und Menschen mit Interessen am Tisch sitzen. Genau dort scheitert die Disziplin am häufigsten. Denn jetzt geht es nicht mehr um Prognosen. Es geht um Gesichter, Budgets und die Frage, wer sich geirrt hat.
Das Review beginnt mit Messwerten, nicht mit Meinungen. Sechs Kriterien haben sich als tragfähiger Kern bewährt. Jedes wird gegen die im Business Case fixierte Schwelle gestellt; die Ampel ergibt sich aus dem Vergleich, nicht aus der Stimmung im Raum.
| Kriterium | Messgröße (Beispiele) | Spricht für Fortführen | Spricht für Neuaufsetzen | Spricht für Stopp |
|---|---|---|---|---|
| Outcome | Zeit-, Kosten- oder Qualitätseffekt gegen Baseline | Schwelle erreicht, Mechanismus belegt | Ziel relevant, Effekt am falschen Aufbau gescheitert | Effekt fehlt, kein plausibler Realisierungspfad |
| Qualität | Fehler- oder Korrekturquote gegen Referenzfälle | Innerhalb der Toleranz, stabil | Fehler stammen aus Datenbasis oder Scope-Zuschnitt | Fehlerbild trotz Nachbesserung unverändert |
| Adoption | Aktive Nutzung je Zielgruppe über Zeit | Wächst oder hält Zielniveau | Nutzende wollen das Ziel, aber nicht diesen Weg | Nutzung fällt trotz Schulung und Anpassung |
| Kosten je Vorgang | Vollkosten pro Fall gegen Altprozess | Unter oder nahe Altprozess, sinkend | Treiber liegt in Architektur, nicht in Nutzung | Dauerhaft über Altprozess ohne Senkungspfad |
| Betriebsfähigkeit | Betriebsrollen, Run-Budget, Compliance-Pfad | Besetzbar und finanzierbar | Erst nach Redesign realistisch | Nicht darstellbar oder nicht gewollt |
| Lernwert | Übertragbare Erkenntnisse, Datenaufbau | Zusatzargument, nie allein tragend | Rechtfertigt gezielten zweiten Versuch | Erkenntnisse gesichert, Rest ist Wiederholung |
Zwei Leseregeln gehören dazu. Erstens: Fortführen verlangt Grün bei Outcome, Qualität und Adoption gleichzeitig, zwei von drei reichen nicht, denn der Betrieb verzeiht keine der drei Lücken. Zweitens: Der Lernwert ist ein ehrenwertes Kriterium mit Missbrauchspotenzial. Er begründet nie allein eine Fortführung, sonst wird jedes festgefahrene Vorhaben zur „wertvollen Lernreise“ umdeklariert.
Wer fortführt, entscheidet zugleich über den Einstieg in den Betrieb mit allem Zubehör: Betriebsrollen, Run-Budget, Monitoring und, je nach Einstufung, die Betreiberpflichten nach Artikel 26 der Verordnung (EU) 2024/1689 ab dem 2. August 2026. Diese Folgekosten gehören in die Review-Vorlage, damit „weitermachen“ nicht als die billige Option erscheint.
Die härteste Gegnerin des Reviews sitzt mit am Tisch: die Selbstrechtfertigung. Barry Staw zeigte das 1976 in einem viel zitierten Experiment mit 240 Wirtschaftsstudierenden. Entscheider investieren nach negativen Ergebnissen mehr Ressourcen in den gewählten Kurs. Am stärksten wirkt das bei denen, die die Ursprungsentscheidung persönlich verantworteten. Der Befund trägt bis heute die Forschung zur Eskalation des Commitments. Versunkene Kosten, investierte Zeit und die Nähe zum „fast fertigen“ Zustand erhöhen die Bereitschaft, schlechtem Geld gutes hinterherzuwerfen.
Im KI-Kontext verstärken drei Dynamiken den Effekt. Der interne Champion hat den Piloten oft gegen Widerstände durchgesetzt; ein Stopp fühlt sich wie eine persönliche Niederlage an. Der Anbieter drängt auf „noch einen Sprint“, weil sein Vertrag am Weiterlaufen hängt. Und die sichtbare Technik-Faszination macht es leicht, Fortschritt im System mit Fortschritt im Geschäftsergebnis zu verwechseln.
Piloten sterben selten an schlechten Zahlen. Sie überleben an guten Geschichten, und die besten Geschichten erzählen die, die den Piloten gestartet haben.
Die Abwehr ist strukturell, nicht appellativ. Erstens Rollentrennung: Das Pilotteam liefert Messwerte und eine Diagnose, bewertet aber nicht selbst. Die Entscheidung liegt bei einem Gremium ohne Urheberinteresse. Zweitens Umkehr der Begründungslast: Die vor dem Start fixierten Schwellen gelten als Standard. Wer von ihnen abweichen will, muss das begründen, nicht wer sie anwendet. Drittens Verbot des Rückspiegel-Arguments: Die bereits ausgegebene Summe taucht in der Vorlage als Information auf, nie als Begründung. Entscheidungsrelevant sind allein künftige Kosten gegen künftigen Nutzen. Viertens Normalisierung: Die Abbruchquoten von Gartner und S&P Global gehören ins Gremium. Sie machen den Stopp zu dem, was er statistisch ist, ein gewöhnliches Portfolioereignis, kein Skandal.
Die Option „neu aufsetzen“ existiert, weil viele Piloten am Aufbau scheitern und nicht am Ziel. Die MIT-Untersuchung NANDA (2025) fand als dominante Scheiterursachen brüchige Workflows, fehlende Einbettung in den Arbeitsalltag und fehlende Lernfähigkeit der Systeme, nicht die Modellqualität. Ein solches Befundbild bei weiterhin relevantem Outcome ist der legitime Fall für ein Redesign. Möglich sind anderer Scope-Zuschnitt, andere Datenbasis, andere Architektur oder ein anderer Integrationspunkt im Prozess.
Damit die Option nicht zur Hintertür der Verlängerung wird, braucht sie drei harte Bausteine. Eine neue Hypothese: Was genau war falsch, und warum wird der zweite Aufbau es anders machen? Ein neues Budget mit eigener Freigabe: Der zweite Versuch konkurriert im Portfolio wie jedes neue Vorhaben, er erbt keinen Anspruch aus dem ersten. Ein neues Exit-Datum mit denselben sechs Kriterien: Auch der zweite Versuch ist eine Hypothese mit Frist.
Wer denselben Aufbau mit mehr Zeit fortsetzt und es Neuaufsetzen nennt, hat nur die Sprache gewechselt, nicht das Risiko.
Der Prüfsatz für das Gremium ist einfach: Würden wir dieses Vorhaben heute, mit dem Wissen aus dem Piloten, als neues Projekt genehmigen? Wenn ja, ist das Redesign begründbar. Wenn die ehrliche Antwort nein lautet und nur die Vorgeschichte für den zweiten Versuch spricht, ist es ein Stopp-Fall mit schlechtem Gewissen.
Beim Stopp wiederum ist der Lerntransfer der einzige Ertrag, und er verfällt schnell. Deshalb gehört in jedes Stopp-Memo ein Pflichtblock: drei übertragbare Erkenntnisse mit Adressat. Beispiele sind die Datenqualität einer Quelle, die Integrationsfähigkeit eines Systems oder das reale Nutzerverhalten. Aufgebaute Testsets, bereinigte Daten und Prozessdokumentation werden explizit an benannte Nachnutzer übergeben, bevor das Team auseinandergeht.
Die Entscheidung gehört in ein Portfoliogremium: die Geschäftsführung oder ein von ihr mandatierter Kreis mit Budget- und Kapazitätshoheit. Fachbereich, IT und Finanzen sind darin vertreten. Der Lenkungskreis des Piloten scheidet aus, er ist strukturell befangen, weil er aus den Urhebern besteht. Das Pilotteam bekommt eine klare, würdige Rolle: Es liefert die Messwerte, die Diagnose und eine Empfehlung. Es stimmt nicht ab.
Der Takt ist fest: Jeder Pilot hat ab Start einen Review-Termin. Das Gremium behandelt jede Vorlage mit allen drei Optionen auf dem Tisch. Eine Vorlage, die nur „fortführen“ zur Wahl stellt, geht zurück. Fällt die Entscheidung „fortführen“, übernimmt ab diesem Punkt die Betriebsreife-Logik des Übergangs, mit eigener Checkliste und eigener Freigabe.
Protokolliert wird auf einer Seite, mehr Umfang schadet der Wahrheit. Das Memo enthält sechs Blöcke: Messwerte gegen die sechs Kriterien, geprüfte Optionen, Entscheidung, tragende Begründung, Kapazitäts- und Budgetfolge, Lerntransferpunkte mit Adressaten. Dieses Memo hat doppelten Wert. Nach innen ist es das Gedächtnis des Portfolios: Beim nächsten verwandten Vorhaben liegen Befunde vor statt Anekdoten. Nach außen ist es der Sorgfaltsnachweis der Geschäftsleitung. Die Dokumentation einer angemessenen Informationsgrundlage trägt bei späterer Kritik durch Gesellschafter, Beirat oder Prüfer.
Ein letzter Punkt zur Kommunikation: Die Entscheidung wird den Beteiligten aktiv mitgeteilt, einschließlich der Begründung. Ein still beerdigter Pilot erzeugt Legenden; ein erklärter Stopp erzeugt Vertrauen in den Prozess. Teams melden Probleme früher, wenn sie wissen, dass ein Stopp geordnet abläuft und niemanden beschädigt.
In 30 Tagen:
In 60 Tagen:
In 90 Tagen:
Mehr als sein Budget: Er bindet die knappste Ressource, nämlich die Integrations- und Fachkapazität, die neue Vorhaben bräuchten. Dazu kommen laufende Nutzungs- und Betreuungskosten sowie der Vertrauensverlust der Nutzenden an einem System im Dauerprovisorium. Die Größenordnung des Problems ist belegt: Laut S&P Global Market Intelligence (2025) haben 42 Prozent der Unternehmen die Mehrheit ihrer KI-Initiativen abgebrochen. Wer nicht bewusst entscheidet, trägt dieselben Kosten, nur später und ohne Lernertrag. Ein fester Review-Termin mit Stopprecht ist die billigste Versicherung dagegen.
Ja, ein kurzes Entscheidungsmemo ist Pflicht guter Governance und schützt in zwei Richtungen. Erstens belegt es, dass die Geschäftsleitung auf angemessener Informationsgrundlage entschieden hat. Das ist der Kern der gesellschaftsrechtlichen Sorgfaltspflichten gegenüber Gesellschaftern, Beirat und Wirtschaftsprüfung. Zweitens sichert es den Lernertrag: Messwerte, Begründung und Transferpunkte bleiben verfügbar, wenn ein verwandtes Vorhaben startet. Eine Seite genügt: Datenlage, geprüfte Optionen, Entscheidung, Begründung, Kapazitätsfreigabe, Lerntransfer. Ohne Memo ist der Stopp nur ein Gerücht mit Budgetwirkung.
Mit einem Stichtag und einer einzigen Review-Runde, nicht mit Selbstvorwürfen. Setzen Sie für jeden laufenden Piloten binnen 30 Tagen einen Review-Termin. Ziehen Sie die sechs Kriterien nach: Outcome, Qualität, Adoption, Kosten je Vorgang, Betriebsfähigkeit, Lernwert. Messen Sie, was messbar ist, und markieren Sie ehrlich, was fehlt. Dann entscheidet das Gremium jede Vorlage in einer Sitzung mit allen drei Optionen auf dem Tisch. Die erste Runde ist unbequem, erzeugt aber den Präzedenzfall, dass Pilotenden Entscheidungen folgen. Danach sinkt der Aufwand deutlich.
Wenn das Ziel relevant bleibt, aber die Diagnose zeigt, dass der Aufbau falsch war, nicht nur unfertig. Typische Belege: Die Fehlerquote liegt an der Datenbasis statt am Feinschliff. Der gewählte Scope trifft den Prozess nicht, oder die Architektur passt nicht zur Integrationslandschaft. Die MIT-Untersuchung NANDA (2025) fand als Hauptscheiterursache brüchige Workflows und fehlende Alltagspassung, nicht Modellqualität. Genau solche Befunde rechtfertigen ein Redesign. Neuaufsetzen verlangt dann neue Hypothese, neues Budget und neues Exit-Datum. Fehlt einer dieser drei Bausteine, ist es Fortführen unter freundlicherem Namen.
Durch Rollentrennung und Vorfestlegung, nicht durch Appelle an die Vernunft. Die Forschung ist eindeutig: Wer die Ursprungsentscheidung persönlich verantwortet, investiert nach negativen Ergebnissen mehr statt weniger (Staw 1976). Drei Gegenmittel wirken strukturell: Erstens bewerten nicht die Erbauer, sondern ein Gremium ohne Projektbeteiligung. Zweitens gelten die vor dem Start fixierten Schwellen als Standard, wer abweichen will, trägt die Begründungslast. Drittens wird die bereits ausgegebene Summe in der Vorlage nicht als Argument geführt. Entscheidungsrelevant sind nur künftige Kosten und künftiger Nutzen.
Belegt ist: die Größenordnung der Abbruch- und Verwurfsquoten (Gartner 2024; S&P Global Market Intelligence 2025), das Feststecken der Mehrheit im Pilotstadium (McKinsey 2025), die dominanten Scheiterursachen jenseits der Modellqualität (MIT NANDA 2025) sowie der Eskalations-Effekt bei persönlicher Verantwortung für die Ursprungsentscheidung (Staw 1976 und Folgeforschung).
Redaktionelle Einschätzung ist: der Zuschnitt der sechs Kriterien, die Leseregeln des Rasters, die Gremien- und Memo-Konstruktion sowie die drei Bausteine des Neuaufsetzens. Es handelt sich um verdichtete Portfolio- und Stage-Gate-Praxis, nicht um empirisch validierte Schwellenwerte. Die konkreten Schwellen bleiben unternehmensspezifisch.
Dieser Artikel leistet nicht: die Herleitung der Abbruchkriterien vor dem Start (das ist Aufgabe des Business-Case-Beitrags mit Base, Downside und Ex-ante-Kriterien), eine Rechtsberatung zu Gesellschafts- oder KI-Verordnungsfragen und die Gestaltung des Betriebsübergangs nach einem „Fortführen“, dafür der Beitrag zum Übergang in den verantworteten Betrieb.
Methodik: Studien- und Zahlenclaims wurden im Juli 2026 per Web-Recherche gegen die genannten Fundstellen geprüft; die Abbruchquoten verschiedener Erhebungen beruhen auf unterschiedlichen Definitionen und werden deshalb als konvergierende Indizien behandelt. Die Erstfassung entstand mit KI-Unterstützung; menschliche Faktenprüfung und redaktionelle Freigabe sind vor Veröffentlichung vorgesehen. Der Beitrag ersetzt keine Rechtsberatung.
| Datum | Änderung |
|---|---|
| 2026-07-23 | Erstfassung Launch-Korpus (Status: draft) |
| 2026-07-23 | Vollständige Neufassung: Sechs-Kriterien-Raster, Sunk-Cost-Kapitel mit Staw-Beleg, Redesign-Bausteine, Gremien- und Memo-Konstruktion, Quellen verifiziert |
Ein Briefing pro Woche: Entscheidungsfragen, eingeordnete Zahlen und Fristen. Ihre Adresse geben wir nicht weiter.
13 Min. Lesezeit
Jetzt lesen14 Min. Lesezeit
Jetzt lesen13 Min. Lesezeit
Jetzt lesen