Ausgabe 39/2026 · Stand: Donnerstag, 24. September 2026 Das Fachmagazin für KI-Transformation im Mittelstand
Briefing abonnieren
Betrieb

Pilot fortführen, neu aufsetzen oder stoppen

Am Pilotende gibt es drei ehrliche Optionen — und eine unehrliche: die stille Verlängerung. Ein messbares Entscheidungsraster, Schutz vor Sunk-Cost-Psychologie und ein protokolliertes Review machen aus dem Pilotende eine Portfolioentscheidung statt einer Gesichtsverlust-Debatte.

Veröffentlicht · Aktualisiert · 13 Min. Lesezeit
Ingenieurin führt in einer hellen Roboterzelle den Arm eines Leichtbauroboters von Hand an eine Position.
Erst am Bauteil zeigt sich, ob die Automatisierung den Takt hält. Symbolbild, KI-generiert für KIONIER.

Kurzantwort

Am Ende eines KI-Piloten stehen drei legitime Optionen: fortführen Richtung Betrieb, neu aufsetzen mit geändertem Design oder verbindlich stoppen. Entschieden wird gegen sechs messbare Kriterien: Outcome gegen Baseline, Qualität, Adoption, Kosten je Vorgang, Betriebsfähigkeit und Lernwert. Die Entscheidung trifft ein Portfoliogremium. Die Erbauer liefern dort Daten, bewerten aber nicht selbst. Denn die Neigung, eigenen Fehlinvestitionen Geld nachzuwerfen, ist experimentell gut belegt. Protokolliert wird in einem einseitigen Memo mit Begründung, Kapazitätsfreigabe und Lerntransfer. Die stille Verlängerung ohne neue Hypothese ist keine vierte Option, sondern die teuerste Form der Entscheidungsvermeidung.

Die Kernaussagen

  • Ein Pilot ist eine Hypothese mit Datum. Am Stichtag wird entschieden — nicht verlängert, weil das Ergebnis noch nicht gefällt.
  • Stoppen ist statistisch Normalfall: Unternehmen verwerfen laut S&P Global Market Intelligence (2025) im Schnitt 46 Prozent ihrer KI-Machbarkeitsnachweise vor der Produktion.
  • Sunk-Cost-Psychologie wirkt am stärksten bei denen, die den Piloten initiiert haben. Das Review-Design muss die Bewertung deshalb von der Urheberschaft trennen.
  • Neuaufsetzen ist nur dann eine eigene Option, wenn Architektur, Scope oder Datenbasis nachweislich falsch waren und das Ziel relevant bleibt. Sonst ist es Fortführen mit besserem Marketing.
  • Wer fortführt, kauft den Betrieb mit: Run-Budget, Betriebsrollen und ab August 2026 gegebenenfalls die Betreiberpflichten der Verordnung (EU) 2024/1689.
  • Das Entscheidungsmemo ist zugleich Sorgfaltsnachweis der Geschäftsleitung und Träger des Lerntransfers in die nächsten Vorhaben.

Warum die Frage jetzt zählt

Der Rückstau ist real. Gartner prognostizierte 2024, dass mindestens 30 Prozent der GenAI-Projekte nach dem Proof of Concept aufgegeben werden. S&P Global Market Intelligence (2025) maß kurz darauf, dass 42 Prozent der befragten Unternehmen bereits die Mehrheit ihrer KI-Initiativen abgebrochen haben. McKinsey (2025) beschreibt die Gegenseite desselben Befunds. 88 Prozent der Organisationen nutzen KI, aber die meisten stecken auf Unternehmensebene im Pilotstadium fest. Zwischen diesen Zahlen liegt ein Bestand an Piloten ohne förmliche Entscheidung. Sie laufen, kosten und blockieren.

Wichtig ist die Arbeitsteilung mit dem Business Case: Abbruchkriterien mit Messgröße und Datum entstehen vor dem Start, als Teil der Freigabe. Dieser Beitrag behandelt den zweiten Akt: das Review am Pilotende, wenn die Messwerte vorliegen und Menschen mit Interessen am Tisch sitzen. Genau dort scheitert die Disziplin am häufigsten. Denn jetzt geht es nicht mehr um Prognosen. Es geht um Gesichter, Budgets und die Frage, wer sich geirrt hat.

Das Entscheidungsraster: sechs Kriterien, drei Optionen

Das Review beginnt mit Messwerten, nicht mit Meinungen. Sechs Kriterien haben sich als tragfähiger Kern bewährt. Jedes wird gegen die im Business Case fixierte Schwelle gestellt; die Ampel ergibt sich aus dem Vergleich, nicht aus der Stimmung im Raum.

Kriterium Messgröße (Beispiele) Spricht für Fortführen Spricht für Neuaufsetzen Spricht für Stopp
Outcome Zeit-, Kosten- oder Qualitätseffekt gegen Baseline Schwelle erreicht, Mechanismus belegt Ziel relevant, Effekt am falschen Aufbau gescheitert Effekt fehlt, kein plausibler Realisierungspfad
Qualität Fehler- oder Korrekturquote gegen Referenzfälle Innerhalb der Toleranz, stabil Fehler stammen aus Datenbasis oder Scope-Zuschnitt Fehlerbild trotz Nachbesserung unverändert
Adoption Aktive Nutzung je Zielgruppe über Zeit Wächst oder hält Zielniveau Nutzende wollen das Ziel, aber nicht diesen Weg Nutzung fällt trotz Schulung und Anpassung
Kosten je Vorgang Vollkosten pro Fall gegen Altprozess Unter oder nahe Altprozess, sinkend Treiber liegt in Architektur, nicht in Nutzung Dauerhaft über Altprozess ohne Senkungspfad
Betriebsfähigkeit Betriebsrollen, Run-Budget, Compliance-Pfad Besetzbar und finanzierbar Erst nach Redesign realistisch Nicht darstellbar oder nicht gewollt
Lernwert Übertragbare Erkenntnisse, Datenaufbau Zusatzargument, nie allein tragend Rechtfertigt gezielten zweiten Versuch Erkenntnisse gesichert, Rest ist Wiederholung

Zwei Leseregeln gehören dazu. Erstens: Fortführen verlangt Grün bei Outcome, Qualität und Adoption gleichzeitig, zwei von drei reichen nicht, denn der Betrieb verzeiht keine der drei Lücken. Zweitens: Der Lernwert ist ein ehrenwertes Kriterium mit Missbrauchspotenzial. Er begründet nie allein eine Fortführung, sonst wird jedes festgefahrene Vorhaben zur „wertvollen Lernreise“ umdeklariert.

Wer fortführt, entscheidet zugleich über den Einstieg in den Betrieb mit allem Zubehör: Betriebsrollen, Run-Budget, Monitoring und, je nach Einstufung, die Betreiberpflichten nach Artikel 26 der Verordnung (EU) 2024/1689 ab dem 2. August 2026. Diese Folgekosten gehören in die Review-Vorlage, damit „weitermachen“ nicht als die billige Option erscheint.

Sunk-Cost-Psychologie: warum Piloten unsterblich werden

Die härteste Gegnerin des Reviews sitzt mit am Tisch: die Selbstrechtfertigung. Barry Staw zeigte das 1976 in einem viel zitierten Experiment mit 240 Wirtschaftsstudierenden. Entscheider investieren nach negativen Ergebnissen mehr Ressourcen in den gewählten Kurs. Am stärksten wirkt das bei denen, die die Ursprungsentscheidung persönlich verantworteten. Der Befund trägt bis heute die Forschung zur Eskalation des Commitments. Versunkene Kosten, investierte Zeit und die Nähe zum „fast fertigen“ Zustand erhöhen die Bereitschaft, schlechtem Geld gutes hinterherzuwerfen.

Im KI-Kontext verstärken drei Dynamiken den Effekt. Der interne Champion hat den Piloten oft gegen Widerstände durchgesetzt; ein Stopp fühlt sich wie eine persönliche Niederlage an. Der Anbieter drängt auf „noch einen Sprint“, weil sein Vertrag am Weiterlaufen hängt. Und die sichtbare Technik-Faszination macht es leicht, Fortschritt im System mit Fortschritt im Geschäftsergebnis zu verwechseln.

Piloten sterben selten an schlechten Zahlen. Sie überleben an guten Geschichten, und die besten Geschichten erzählen die, die den Piloten gestartet haben.

Die Abwehr ist strukturell, nicht appellativ. Erstens Rollentrennung: Das Pilotteam liefert Messwerte und eine Diagnose, bewertet aber nicht selbst. Die Entscheidung liegt bei einem Gremium ohne Urheberinteresse. Zweitens Umkehr der Begründungslast: Die vor dem Start fixierten Schwellen gelten als Standard. Wer von ihnen abweichen will, muss das begründen, nicht wer sie anwendet. Drittens Verbot des Rückspiegel-Arguments: Die bereits ausgegebene Summe taucht in der Vorlage als Information auf, nie als Begründung. Entscheidungsrelevant sind allein künftige Kosten gegen künftigen Nutzen. Viertens Normalisierung: Die Abbruchquoten von Gartner und S&P Global gehören ins Gremium. Sie machen den Stopp zu dem, was er statistisch ist, ein gewöhnliches Portfolioereignis, kein Skandal.

Neu aufsetzen ist eine neue Investition, keine Verlängerung

Die Option „neu aufsetzen“ existiert, weil viele Piloten am Aufbau scheitern und nicht am Ziel. Die MIT-Untersuchung NANDA (2025) fand als dominante Scheiterursachen brüchige Workflows, fehlende Einbettung in den Arbeitsalltag und fehlende Lernfähigkeit der Systeme, nicht die Modellqualität. Ein solches Befundbild bei weiterhin relevantem Outcome ist der legitime Fall für ein Redesign. Möglich sind anderer Scope-Zuschnitt, andere Datenbasis, andere Architektur oder ein anderer Integrationspunkt im Prozess.

Damit die Option nicht zur Hintertür der Verlängerung wird, braucht sie drei harte Bausteine. Eine neue Hypothese: Was genau war falsch, und warum wird der zweite Aufbau es anders machen? Ein neues Budget mit eigener Freigabe: Der zweite Versuch konkurriert im Portfolio wie jedes neue Vorhaben, er erbt keinen Anspruch aus dem ersten. Ein neues Exit-Datum mit denselben sechs Kriterien: Auch der zweite Versuch ist eine Hypothese mit Frist.

Wer denselben Aufbau mit mehr Zeit fortsetzt und es Neuaufsetzen nennt, hat nur die Sprache gewechselt, nicht das Risiko.

Der Prüfsatz für das Gremium ist einfach: Würden wir dieses Vorhaben heute, mit dem Wissen aus dem Piloten, als neues Projekt genehmigen? Wenn ja, ist das Redesign begründbar. Wenn die ehrliche Antwort nein lautet und nur die Vorgeschichte für den zweiten Versuch spricht, ist es ein Stopp-Fall mit schlechtem Gewissen.

Beim Stopp wiederum ist der Lerntransfer der einzige Ertrag, und er verfällt schnell. Deshalb gehört in jedes Stopp-Memo ein Pflichtblock: drei übertragbare Erkenntnisse mit Adressat. Beispiele sind die Datenqualität einer Quelle, die Integrationsfähigkeit eines Systems oder das reale Nutzerverhalten. Aufgebaute Testsets, bereinigte Daten und Prozessdokumentation werden explizit an benannte Nachnutzer übergeben, bevor das Team auseinandergeht.

Wer entscheidet, und wie es protokolliert wird

Die Entscheidung gehört in ein Portfoliogremium: die Geschäftsführung oder ein von ihr mandatierter Kreis mit Budget- und Kapazitätshoheit. Fachbereich, IT und Finanzen sind darin vertreten. Der Lenkungskreis des Piloten scheidet aus, er ist strukturell befangen, weil er aus den Urhebern besteht. Das Pilotteam bekommt eine klare, würdige Rolle: Es liefert die Messwerte, die Diagnose und eine Empfehlung. Es stimmt nicht ab.

Der Takt ist fest: Jeder Pilot hat ab Start einen Review-Termin. Das Gremium behandelt jede Vorlage mit allen drei Optionen auf dem Tisch. Eine Vorlage, die nur „fortführen“ zur Wahl stellt, geht zurück. Fällt die Entscheidung „fortführen“, übernimmt ab diesem Punkt die Betriebsreife-Logik des Übergangs, mit eigener Checkliste und eigener Freigabe.

Protokolliert wird auf einer Seite, mehr Umfang schadet der Wahrheit. Das Memo enthält sechs Blöcke: Messwerte gegen die sechs Kriterien, geprüfte Optionen, Entscheidung, tragende Begründung, Kapazitäts- und Budgetfolge, Lerntransferpunkte mit Adressaten. Dieses Memo hat doppelten Wert. Nach innen ist es das Gedächtnis des Portfolios: Beim nächsten verwandten Vorhaben liegen Befunde vor statt Anekdoten. Nach außen ist es der Sorgfaltsnachweis der Geschäftsleitung. Die Dokumentation einer angemessenen Informationsgrundlage trägt bei späterer Kritik durch Gesellschafter, Beirat oder Prüfer.

Ein letzter Punkt zur Kommunikation: Die Entscheidung wird den Beteiligten aktiv mitgeteilt, einschließlich der Begründung. Ein still beerdigter Pilot erzeugt Legenden; ein erklärter Stopp erzeugt Vertrauen in den Prozess. Teams melden Probleme früher, wenn sie wissen, dass ein Stopp geordnet abläuft und niemanden beschädigt.

Maßnahmen für die Geschäftsführung

In 30 Tagen:

  • Bestandsaufnahme: alle laufenden KI-Piloten mit Startdatum, Budgetstand und vorhandenen oder fehlenden Exit-Kriterien listen. Owner: CIO / Head of AI.
  • Für jeden Piloten ohne Kriterien die sechs Raster-Kriterien mit Schwellen nachziehen und einen Review-Termin setzen. Owner: Fachbereichsleitung mit Controlling.
  • Das Entscheidungsmemo als einseitige Pflichtvorlage mit den sechs Blöcken beschließen. Owner: Geschäftsführung.

In 60 Tagen:

  • Erste Review-Runde im Portfoliogremium durchführen: jede Vorlage mit allen drei Optionen, Rollentrennung zwischen Erbauern und Bewertern. Owner: Geschäftsführung.
  • Bei jedem Stopp die Kapazität ausdrücklich ins Portfolio zurückbuchen und neu vergeben. Owner: CFO mit CIO.
  • Lerntransfer sichern: Testsets, Datenaufbereitung und Prozessdoku gestoppter Piloten an benannte Nachnutzer übergeben. Owner: Head of AI.

In 90 Tagen:

  • Review-Kadenz verstetigen: Pilotenden-Reviews als fester Tagesordnungspunkt des Portfoliogremiums. Owner: Geschäftsführung.
  • Für fortgeführte Piloten den Übergang in den Betrieb nach Betriebsreife-Checkliste einleiten, inklusive KI-VO-Einstufung. Owner: Ergebnis-Owner Fachbereich.
  • Retrospektive der ersten Runde: Wo hat Sunk-Cost-Argumentation die Debatte geprägt, und welche Vorlagen-Regel wird nachgeschärft? Owner: Head of AI.

Was Führung jetzt entscheiden muss

  • Welche laufenden Piloten haben heute weder Exit-Kriterien noch Review-Termin?
  • Gilt ab sofort: keine Review-Vorlage ohne alle drei Optionen und ohne Messwerte gegen die sechs Kriterien?
  • Ist die Rollentrennung beschlossen, Erbauer liefern, Bewerter entscheiden?
  • Wird die bereits ausgegebene Summe aus der Begründungslogik verbannt und nur informatorisch geführt?
  • Verlangt jedes „Neuaufsetzen“ neue Hypothese, neues Budget und neues Exit-Datum?
  • Wird bei jedem Stopp Kapazität zurückgebucht und der Lerntransfer mit Adressaten protokolliert?
  • Ist klar, dass ein „Fortführen“ die Betriebsreife-Prüfung und gegebenenfalls die Betreiberpflichten der KI-Verordnung auslöst?

Häufige Fragen (FAQ)

Was kostet uns ein KI-Pilot, der ohne Entscheidung einfach weiterläuft?

Mehr als sein Budget: Er bindet die knappste Ressource, nämlich die Integrations- und Fachkapazität, die neue Vorhaben bräuchten. Dazu kommen laufende Nutzungs- und Betreuungskosten sowie der Vertrauensverlust der Nutzenden an einem System im Dauerprovisorium. Die Größenordnung des Problems ist belegt: Laut S&P Global Market Intelligence (2025) haben 42 Prozent der Unternehmen die Mehrheit ihrer KI-Initiativen abgebrochen. Wer nicht bewusst entscheidet, trägt dieselben Kosten, nur später und ohne Lernertrag. Ein fester Review-Termin mit Stopprecht ist die billigste Versicherung dagegen.

Müssen wir eine Stopp-Entscheidung dokumentieren, und schützt uns das?

Ja, ein kurzes Entscheidungsmemo ist Pflicht guter Governance und schützt in zwei Richtungen. Erstens belegt es, dass die Geschäftsleitung auf angemessener Informationsgrundlage entschieden hat. Das ist der Kern der gesellschaftsrechtlichen Sorgfaltspflichten gegenüber Gesellschaftern, Beirat und Wirtschaftsprüfung. Zweitens sichert es den Lernertrag: Messwerte, Begründung und Transferpunkte bleiben verfügbar, wenn ein verwandtes Vorhaben startet. Eine Seite genügt: Datenlage, geprüfte Optionen, Entscheidung, Begründung, Kapazitätsfreigabe, Lerntransfer. Ohne Memo ist der Stopp nur ein Gerücht mit Budgetwirkung.

Womit fangen wir an, wenn unsere laufenden Piloten nie Exit-Kriterien bekommen haben?

Mit einem Stichtag und einer einzigen Review-Runde, nicht mit Selbstvorwürfen. Setzen Sie für jeden laufenden Piloten binnen 30 Tagen einen Review-Termin. Ziehen Sie die sechs Kriterien nach: Outcome, Qualität, Adoption, Kosten je Vorgang, Betriebsfähigkeit, Lernwert. Messen Sie, was messbar ist, und markieren Sie ehrlich, was fehlt. Dann entscheidet das Gremium jede Vorlage in einer Sitzung mit allen drei Optionen auf dem Tisch. Die erste Runde ist unbequem, erzeugt aber den Präzedenzfall, dass Pilotenden Entscheidungen folgen. Danach sinkt der Aufwand deutlich.

Wann ist Neuaufsetzen die bessere Wahl als Fortführen?

Wenn das Ziel relevant bleibt, aber die Diagnose zeigt, dass der Aufbau falsch war, nicht nur unfertig. Typische Belege: Die Fehlerquote liegt an der Datenbasis statt am Feinschliff. Der gewählte Scope trifft den Prozess nicht, oder die Architektur passt nicht zur Integrationslandschaft. Die MIT-Untersuchung NANDA (2025) fand als Hauptscheiterursache brüchige Workflows und fehlende Alltagspassung, nicht Modellqualität. Genau solche Befunde rechtfertigen ein Redesign. Neuaufsetzen verlangt dann neue Hypothese, neues Budget und neues Exit-Datum. Fehlt einer dieser drei Bausteine, ist es Fortführen unter freundlicherem Namen.

Wie verhindern wir, dass versunkene Kosten die Entscheidung bestimmen?

Durch Rollentrennung und Vorfestlegung, nicht durch Appelle an die Vernunft. Die Forschung ist eindeutig: Wer die Ursprungsentscheidung persönlich verantwortet, investiert nach negativen Ergebnissen mehr statt weniger (Staw 1976). Drei Gegenmittel wirken strukturell: Erstens bewerten nicht die Erbauer, sondern ein Gremium ohne Projektbeteiligung. Zweitens gelten die vor dem Start fixierten Schwellen als Standard, wer abweichen will, trägt die Begründungslast. Drittens wird die bereits ausgegebene Summe in der Vorlage nicht als Argument geführt. Entscheidungsrelevant sind nur künftige Kosten und künftiger Nutzen.

Evidenz und Grenzen

Belegt ist: die Größenordnung der Abbruch- und Verwurfsquoten (Gartner 2024; S&P Global Market Intelligence 2025), das Feststecken der Mehrheit im Pilotstadium (McKinsey 2025), die dominanten Scheiterursachen jenseits der Modellqualität (MIT NANDA 2025) sowie der Eskalations-Effekt bei persönlicher Verantwortung für die Ursprungsentscheidung (Staw 1976 und Folgeforschung).

Redaktionelle Einschätzung ist: der Zuschnitt der sechs Kriterien, die Leseregeln des Rasters, die Gremien- und Memo-Konstruktion sowie die drei Bausteine des Neuaufsetzens. Es handelt sich um verdichtete Portfolio- und Stage-Gate-Praxis, nicht um empirisch validierte Schwellenwerte. Die konkreten Schwellen bleiben unternehmensspezifisch.

Dieser Artikel leistet nicht: die Herleitung der Abbruchkriterien vor dem Start (das ist Aufgabe des Business-Case-Beitrags mit Base, Downside und Ex-ante-Kriterien), eine Rechtsberatung zu Gesellschafts- oder KI-Verordnungsfragen und die Gestaltung des Betriebsübergangs nach einem „Fortführen“, dafür der Beitrag zum Übergang in den verantworteten Betrieb.

Quellen und Methodik

  1. Staw, B. M. (1976): „Knee-deep in the big muddy: A study of escalating commitment to a chosen course of action“, Organizational Behavior and Human Performance, 16(1), S. 27 bis 44. https://doi.org/10.1016/0030-5073(76)90005-2
  2. Gartner (2024): „Gartner Predicts 30% of Generative AI Projects Will Be Abandoned After Proof of Concept By End of 2025“, Pressemitteilung, 29.07.2024. https://www.gartner.com/en/newsroom/press-releases/2024-07-29-gartner-predicts-30-percent-of-generative-ai-projects-will-be-abandoned-after-proof-of-concept-by-end-of-2025
  3. S&P Global Market Intelligence (2025): Voice-of-the-Enterprise-Erhebung zu KI-Projektabbrüchen (1.006 Befragte, Nordamerika und Europa); Berichterstattung u. a. CIO Dive, März 2025. https://www.ciodive.com/news/AI-project-fail-data-SPGlobal/742590/
  4. MIT NANDA (2025): „The GenAI Divide: State of AI in Business 2025“, MIT Project NANDA, Juli 2025. https://mlq.ai/media/quarterly_decks/v0.1_State_of_AI_in_Business_2025_Report.pdf
  5. McKinsey (2025): „The State of AI“, Global Survey, November 2025 (1.993 Befragte, 105 Länder). https://www.mckinsey.com/capabilities/quantumblack/our-insights/the-state-of-ai
  6. Verordnung (EU) 2024/1689 (KI-Verordnung), insbesondere Artikel 26 (Pflichten der Betreiber von Hochrisiko-KI-Systemen); Amtsblatt der EU, 12.07.2024. https://eur-lex.europa.eu/eli/reg/2024/1689/oj

Methodik: Studien- und Zahlenclaims wurden im Juli 2026 per Web-Recherche gegen die genannten Fundstellen geprüft; die Abbruchquoten verschiedener Erhebungen beruhen auf unterschiedlichen Definitionen und werden deshalb als konvergierende Indizien behandelt. Die Erstfassung entstand mit KI-Unterstützung; menschliche Faktenprüfung und redaktionelle Freigabe sind vor Veröffentlichung vorgesehen. Der Beitrag ersetzt keine Rechtsberatung.

Änderungsprotokoll

Datum Änderung
2026-07-23 Erstfassung Launch-Korpus (Status: draft)
2026-07-23 Vollständige Neufassung: Sechs-Kriterien-Raster, Sunk-Cost-Kapitel mit Staw-Beleg, Redesign-Bausteine, Gremien- und Memo-Konstruktion, Quellen verifiziert

Das Entscheider-Briefing

Ein Briefing pro Woche: Entscheidungsfragen, eingeordnete Zahlen und Fristen. Ihre Adresse geben wir nicht weiter.

Sie erhalten zuerst eine E-Mail mit einem Bestätigungslink. Erst nach dem Klick nehmen wir Sie auf. Abmeldung mit einem Klick in jeder Ausgabe.

Weiterführend im Themenfeld