Ausgabe 39/2026 · Stand: Mittwoch, 23. September 2026 Das Fachmagazin für KI-Transformation im Mittelstand
Briefing abonnieren
Leitfaden

Vom Piloten in den Produktivbetrieb: der Weg, den 95 Prozent nicht schaffen

Warum die meisten KI-Piloten nie produktiv werden und was den Übergang trägt: Produktiv-Kriterien, Betriebslast, Verantwortung und Abbruchdisziplin.

Veröffentlicht · Aktualisiert · 35 Min. Lesezeit
Drei Kolleginnen und Kollegen vor einer Kartenwand im Projektraum eines Dienstleisters.
Ein Vorhaben wird an der Wand sortiert, bevor es ein Programm wird. Symbolbild, KI-generiert für KIONIER.

KIONIER Guide · Folge 3

Stand: Juli 2026, dieser Guide wird laufend aktualisiert.

Das Wichtigste in 90 Sekunden

Ein KI-Pilot beweist den Nutzen einer Idee. Er beweist nicht, dass ein Unternehmen das System betreiben kann. Der Übergang in den Produktivbetrieb scheitert selten an der Technik. Er scheitert an vier Lücken: Die Antwortqualität wird gelobt statt gemessen. Die Betriebslast aus Wissenspflege, Monitoring und Modell-Updates steht in keinem Budget. Niemand in der Linie übernimmt die Verantwortung nach dem Go-live. Und es fehlt der Mut, aussichtslose Piloten früh zu beenden. Wer diese vier Lücken vor dem Produktivgang schließt, gehört zur Minderheit, die aus Piloten laufende Systeme macht. Der Prüfrahmen dafür existiert: 37 Kriterien in sechs Dimensionen, mit acht KO-Punkten.

  • Die berühmten 95 Prozent aus der NANDA-Studie des MIT messen fehlende Ergebniswirkung, nicht technisches Scheitern. Ohne Baseline ist „kein messbarer Effekt“ das automatische Urteil.
  • Der laufende Betrieb kostet als Größenordnung 15 bis 30 Prozent der Aufbaukosten pro Jahr. Bei einem typischen Mittelstandssystem übersteigt die jährliche Betriebslast das gesamte Pilotbudget.
  • Vor dem Go-live müssen drei Rollen namentlich besetzt sein: Produktverantwortung, Wissenspflege, technischer Betrieb. Der Satz „die Linie übernimmt“ ersetzt keine Besetzung.
  • In Woche sechs eines Piloten ist erkennbar, ob er je produktiv wird. Die Frühindikatoren sind messbar, nicht gefühlt.
  • Ein geordneter Abbruch ist ein Steuerungserfolg. Das teuerste Muster ist der Pilot, der weder lebt noch sterben darf.

Die 95 Prozent: was die Zahl sagt und was sie verschweigt

Was Project NANDA wirklich gemessen hat

Die Zahl im Titel dieses Guides stammt aus dem Bericht „The GenAI Divide: State of AI in Business 2025“ von Project NANDA am MIT. Der Befund: 95 Prozent der untersuchten GenAI-Vorhaben blieben ohne messbaren Effekt auf die Ergebnisrechnung. Nur 5 Prozent der integrierten Piloten schufen erheblichen, bezifferbaren Wert.

Diese Zahl verdient eine genaue Lesart, denn sie wird häufig falsch zitiert. Die Studie beruht auf 52 strukturierten Interviews, Umfragen mit 153 Führungskräften und der Analyse von über 300 öffentlichen KI-Initiativen. Die Erfolgsmesslatte lag hoch: Einsatz über den Piloten hinaus, messbare Kennzahlen und nachgewiesene Ergebniswirkung sechs Monate nach dem Piloten. Die Autoren selbst nennen ihre Zahlen richtungsweisend, nicht präzise, und benennen die Grenzen ihrer Stichprobe offen.

Drei Dinge sagt die Studie also nicht. Erstens: Sie sagt nicht, dass 95 Prozent der Piloten technisch versagen. Viele funktionierten, wurden von Nutzern geschätzt und verschwanden trotzdem. Zweitens: Sie sagt nicht, dass KI keinen Nutzen stiftet. Allgemeine Assistenten wie Chat-Werkzeuge waren in über 80 Prozent der Organisationen erprobt und steigerten individuelle Produktivität. Diese Gewinne erreichen nur die Ergebnisrechnung nicht. Drittens: Wer vor dem Start keine Ausgangsmessung erhoben hat, kann hinterher keinen Effekt belegen. „Kein messbarer Effekt“ ist dann das automatische Urteil, unabhängig vom tatsächlichen Nutzen.

Die richtige Lesart lautet: Die 95 Prozent messen eine Organisations- und Messlücke, keine Techniklücke. Als Kernursachen nennt der Bericht brüchige Arbeitsabläufe, fehlendes Lernen im Betrieb und Systeme, die sich dem Alltag nicht anpassen. Genau diese Ursachen behandelt dieser Guide.

Der Befundkorridor der übrigen Studien

Die NANDA-Zahl steht nicht allein. Andere Erhebungen zeichnen mit anderen Methoden dasselbe Bild einer Pilotschwelle, an der die Mehrheit hängen bleibt.

Gartner prognostizierte 2024, dass mindestens 30 Prozent der GenAI-Projekte nach der Konzeptphase abgebrochen werden. Als Gründe nannte die Analyse Datenqualität, unzureichende Risikokontrollen, eskalierende Kosten und unklaren Geschäftswert. S&P Global Market Intelligence maß 2025 unter gut 1.000 Befragten: 42 Prozent der Unternehmen gaben die Mehrheit ihrer KI-Initiativen auf, im Schnitt wurden 46 Prozent der Machbarkeitsnachweise verworfen. RAND fand 2024 in Interviews mit Fachleuten eine Fehlschlagquote von über 80 Prozent. Die häufigste Ursache war dabei kein Technikversagen: Am Anfang stand eine unklare Problem- und Zieldefinition durch die Führung.

McKinsey liefert 2025 die Gegenprobe von der Nutzungsseite. 88 Prozent der befragten Organisationen setzen KI in mindestens einer Funktion ein. Aber nur rund ein Drittel hat mit der Skalierung begonnen. Nur 39 Prozent berichten überhaupt eine Wirkung auf das Betriebsergebnis, meist unter 5 Prozent. Und Deloitte fand Ende 2024: Über zwei Drittel der Organisationen erwarten selbst, dass höchstens 30 Prozent ihrer GenAI-Experimente zeitnah in den vollen Betrieb kommen.

Der Korridor ist damit klar. Zwischen einem Drittel und der Hälfte der Piloten stirbt vor dem Produktivgang. Von den überlebenden erreicht nur ein kleiner Teil belegbare Ergebniswirkung. Der Engpass der Transformation liegt also nicht am Start eines Vorhabens. Er liegt an der Schwelle zum Betrieb.

Was das KIONIER-Lagebild für den Mittelstand ergänzt

Für das Größensegment zwischen 250 und 2.000 Mitarbeitern schärft die modellierte KIONIER-Lagebild-Erhebung das Bild. Im Querschnitt (n=250, modelliert) haben 26 Prozent der Unternehmen KI produktiv im Einsatz, 33 Prozent pilotieren. Aber nur 14 Prozent der KI-aktiven Häuser belegen einen Ergebnisbeitrag mit Zahlen. 48 Prozent haben vor dem Pilotstart keine Baseline erhoben. 38 Prozent der Häuser mit Pilot-Erfahrung haben mindestens einen Piloten beerdigt.

Das modellierte Lagebild der KI-Verantwortlichen (n=50) zeigt die Innensicht derselben Schwelle. 22 Prozent haben kein einziges produktives Vorhaben mit messbarem Ergebnisbeitrag. Bei 46 Prozent steckt die Mehrheit des Portfolios im Pilotstadium. Über das Portfolio gerechnet liegt die Produktivquote bei grob 15 Prozent der gestarteten Vorhaben. 62 Prozent haben in den letzten 24 Monaten mindestens ein Vorhaben beendet, 48 Prozent verlieren mindestens ein Drittel ihrer Piloten vor dem Produktivgang. Als Abbruchgründe führen Datenqualität und unklarer Geschäftswert die Liste an, die Modelltechnik steht am Ende.

Bemerkenswert ist die Agenda derselben modellierten Erhebung: 72 Prozent der KI-Verantwortlichen wollen in den nächsten zwölf Monaten vor allem bestehende Piloten produktiv machen, nur 26 Prozent planen neue Piloten. Die Experimentierphase des Segments endet erkennbar. Was jetzt zählt, ist der Weg über die Schwelle. Dieser Guide beschreibt ihn.

Pilot und Produktivsystem: zwei verschiedene Maschinen

Was der Pilot nie beweisen musste

Ein Pilot und ein Produktivsystem tragen denselben Namen und sind doch verschiedene Maschinen. Der Pilot läuft unter Idealbedingungen: ein kleiner Kreis motivierter Freiwilliger, ausgewählte Fälle, intensive Betreuung durch das Projektteam. Fällt er zwei Stunden aus, verliert niemand etwas. Gibt er eine falsche Antwort, korrigiert der wohlwollende Nutzer sie stillschweigend. Zeigt er ein Dokument, das der Fragende nicht sehen dürfte, bemerkt es in der kleinen Runde niemand.

Der Produktivbetrieb kehrt jede dieser Bedingungen um. Hunderte Nutzer verlassen sich im Tagesgeschäft auf das System. Ein Ausfall kostet ab der ersten Minute Arbeitszeit und Vertrauen. Eine falsche Antwort erreicht Menschen, die sie nicht als falsch erkennen. Und die Berechtigungsfrage wird scharf: Ein Wissensassistent, der allen alles zeigt, ist im Pilotkreis ein Komfortmerkmal und im Rollout ein Datenvorfall.

Fünf Anforderungen unterscheiden die beiden Maschinen im Kern. Verfügbarkeit: Der Betrieb braucht Zusagen, Ausweichwege und einen geübten Rückfall auf die letzte funktionierende Version. Berechtigungen: Die Suche darf je Nutzer nur freigegebene Dokumente sehen, durchgängig und belegt. Eskalationspfade: Es ist geregelt, wer bei einer Störung oder einer gefährlichen Falschantwort in welcher Frist eingreift. Protokoll: Jede produktive Anfrage wird nach festem Schema aufgezeichnet, sonst lässt sich kein Vorfall rekonstruieren. Und Messung: Die Antwortqualität ist eine Kennzahl mit Stichprobe, kein Stimmungsbild.

These: Der Pilot beweist den Nutzen, niemals die Betriebsfähigkeit. Wer einen gelungenen Piloten einfach „ausrollt“, skaliert nicht den Nutzen, sondern das Risiko, auf mehr Nutzer, mehr Daten und mehr Fallhöhe.

Antwortqualität messen statt loben

Die häufigste Schwäche beim Übergang ist die anekdotische Qualitätsbewertung. „Die Nutzer sind zufrieden“ ist keine Messung. Zufriedenheit misst Stimmung, und Stimmung ist systematisch verzerrt. Eine randomisierte Studie von METR (2025) zeigte das drastisch: Erfahrene Entwickler brauchten mit KI-Werkzeugen 19 Prozent länger für ihre Aufgaben, glaubten aber hinterher, 20 Prozent schneller gewesen zu sein. Wer Qualität und Nutzen per Umfrage erhebt, kann in beide Richtungen grob danebenliegen.

Messbar wird Qualität mit drei Bausteinen. Erstens ein Prüfset: eine feste Sammlung echter Anfragen aus dem Alltag, je mit dokumentierter Soll-Antwort, in der Größenordnung von 100 bis 200 Fällen. Zweitens eine gemessene Fehlerrate: Der Anteil falscher oder unbrauchbarer Antworten wird gegen das Prüfset erhoben, mit Angabe der Stichprobengröße und des Datums. Drittens ein Regressionslauf: Vor jeder Änderung an Modell, Anweisungen oder Datenbasis läuft das Prüfset erneut, und eine Verschlechterung blockiert die Auslieferung.

Diese drei Bausteine kosten beim Aufbau wenige Wochen Arbeit. Sie sind die Eintrittskarte in jede seriöse Freigabeentscheidung, denn sie verwandeln die Frage „Ist das System gut genug?“ in eine Zahl mit Beleg.

Die Übersetzungstabelle für die Führungsebene

Die folgende Tabelle übersetzt den Unterschied in Prüffragen, die eine Geschäftsführung ohne Technikwissen stellen kann.

Anforderung Im Piloten üblich Im Produktivbetrieb nötig Prüffrage der Führung
Verfügbarkeit Ausfall bleibt folgenlos Zusage mit Ausweichweg und geübtem Rückfall Wie schnell sind wir nach einer schlechten Änderung zurück auf dem letzten Stand?
Berechtigungen Alle sehen alles Suche respektiert Nutzerrechte je Dokument Sieht ein Sachbearbeiter über das System Unterlagen, die ihm sonst verwehrt sind?
Eskalation Zuruf ans Projektteam Störungsprozess mit Fristen und Vertretung Wer greift heute Nacht ein, wenn das System gefährlichen Unsinn ausgibt?
Protokoll Stichproben, wenn überhaupt Lückenlose Aufzeichnung nach festem Schema Können wir für eine beliebige Antwort von letzter Woche belegen, worauf sie beruhte?
Qualität Lob im Flurgespräch Fehlerrate gegen Prüfset, mit Stichprobe und Datum Wie hoch ist unsere gemessene Fehlerrate, und wann wurde sie zuletzt erhoben?
Kosten Projektbudget deckt alles Eigenes Betriebsbudget mit Alarm und Drossel Wessen Budget trägt den Betrieb im dritten Jahr?

Wer auf zwei oder mehr dieser Prüffragen keine belegte Antwort erhält, hat keinen Produktivkandidaten vor sich. Er hat einen Piloten mit Rollout-Wunsch.

Die Produktiv-Kriterien: sechs Dimensionen, 37 Prüfpunkte, acht KO-Punkte

Die sechs Dimensionen im Überblick

Damit die Freigabeentscheidung nicht an Einzelmeinungen hängt, braucht sie einen festen Prüfrahmen. Die KIONIER-Arbeitshilfe „Produktiv-Readiness-Check: 37 Kriterien, bevor ein KI-System in den Betrieb geht“ liefert ihn. Sie prüft ein einzelnes System entlang von 37 Kriterien in sechs Dimensionen. Jedes Kriterium erhält 0, 1 oder 2 Punkte. Gezählt wird nur, was sich belegen lässt: Eine Regelung ohne Nachweis bringt einen Punkt, erst die nachgewiesene Wirkung bringt zwei.

Dimension Kriterien Leitfrage Typische Lücke beim Pilotende
1 Datenbasis 6 Ist das Wissen erfasst, geschützt und gepflegt? Kein Aktualisierungszyklus, keine gemessene Trefferqualität
2 Architektur 6 Ruht das System auf austauschbaren, steuerbaren Bausteinen? Anweisungen im Code, kein Ausweichmodell, keine Kostendrossel
3 Sicherheit 6 Sind Angriffswege und Datenabfluss kontrolliert? Suche ignoriert Nutzerrechte, kein Lecktest
4 Recht und Nachweis 7 Ist das Haus gegenüber Aufsicht und Betroffenen auskunftsfähig? Kein Inventareintrag, Protokoll unvollständig
5 Betrieb 7 Gibt es Messung, Rückfallweg und Störungsprozess? Kein Prüfset, keine Fehlerrate, Rückschaltung nie geübt
6 Organisation 5 Trägt der Fachbereich Verantwortung, ziehen die Nutzer mit? Kein Startwert der Erfolgskennzahl, kein Rückmeldeweg

Aus der Punktsumme entsteht je Dimension ein Wert von 0 bis 10. Unter 5,0 ist das Feld rot: nicht betriebsfähig. Zwischen 5,0 und 6,9 gelb: Betrieb nur mit Auflagen und Termin. Ab 7,0 grün.

Die KO-Regel: warum ein guter Durchschnitt nicht reicht

Acht der 37 Kriterien sind als KO markiert. Steht eines davon auf null Punkten, bleibt das System im Pilotstatus, unabhängig von allen anderen Werten. Zu den KO-Punkten zählen der Schutzfilter für Personendaten, die zentrale Schlüsselverwaltung, die durchgreifenden Zugriffsrechte, Inventareintrag und Risikoeinstufung, die Eingriffsmöglichkeit einer benannten Person, das lückenlose Protokoll und der geübte Rückfallweg.

Die Logik dahinter ist keine Pedanterie. Die acht KO-Punkte sind die Stellen, an denen ein Ausfall nicht intern bleibt: der meldepflichtige Datenvorfall, der offene Generalschlüssel, der Praktikant mit Blick auf Vorstandsunterlagen, die fehlende Auskunftsfähigkeit gegenüber einer Aufsicht. Ein hervorragender Durchschnitt in fünf Dimensionen gleicht ein fehlendes Protokoll nicht aus, weil sich Risiken nicht mitteln lassen. Ein System ist so verwundbar wie seine schwächste unkontrollierte Stelle.

Für die Führungsebene übersetzt sich die KO-Regel in einen einzigen Satz: Es gibt Lücken, über die man nicht hinwegfreigeben kann, nur hinwegarbeiten.

Wie der Score in eine Entscheidung übersetzt wird

Die Freigaberegel der Arbeitshilfe ist bewusst schlicht. Ein regulärer Produktivgang ist vertretbar, wenn jede der sechs Dimensionen mindestens 6,0 erreicht und kein KO-Kriterium offen ist. Für einen kontrollierten Betrieb mit kleiner Nutzergruppe genügt durchgängig 5,0, wiederum ohne offenen KO-Punkt. Alles darunter bleibt Pilot.

Wichtig ist, was der Check leistet und was nicht. Er verhindert keinen Rollout, er terminiert ihn: Aus der Lückenliste wird ein Arbeitsplan mit Paketen und Fristen, aus dem Bauchgefühl eine belegbare Entscheidung. Und er bewertet Kontrollen, nicht Wirtschaftlichkeit. Ein System kann alle 37 Kriterien erfüllen und wirtschaftlich trotzdem nicht tragen. Die Nutzenfrage gehört in die Rechnung weiter unten in diesem Guide.

Für die schnelle Standortbestimmung existiert der interaktive Readiness-Selbsttest im KIONIER-Werkzeugbereich. Er führt durch alle 37 Kriterien, berechnet die Dimensionswerte samt KO-Sperren im Browser und erzeugt eine priorisierte Lückenliste. Als Quartalsroutine eingesetzt macht er sichtbar, ob sich ein System auf die Freigabe zubewegt oder von ihr weg.

Betriebslast: was nach dem Go-live jeden Monat anfällt

Die fünf Lastblöcke, die in keinem Pilotbudget stehen

Der teuerste Denkfehler beim Übergang ist die Annahme, ein fertig gebautes System sei fertig. Ein produktives KI-System ist kein Bauwerk, sondern ein Betrieb. Fünf Lastblöcke fallen ab dem Go-live dauerhaft an. Die Größenordnungen in der Tabelle sind typisierte Erfahrungswerte für mittlere Systeme im Segment 250 bis 2.000 Mitarbeiter; die Spannen sind bewusst breit.

Lastblock Was dahintersteckt Typische Größenordnung pro Jahr (typisiert)
Wissenspflege Geänderte und zurückgezogene Dokumente nachziehen, Korpus kuratieren, Löschregeln durchsetzen 0,2 bis 0,5 Stellenanteile, meist im Fachbereich
Monitoring und Qualitätssicherung Fehlerrate gegen Prüfset messen, Stichproben, Alarme, Prüfset-Pflege 0,1 bis 0,3 Stellenanteile plus Werkzeugkosten
Modell-Updates und Prompt-Pflege Modellwechsel testen, Anweisungen nachjustieren, Regressionsläufe mehrere Personentage je Modell- oder Versionswechsel
Modell- und Infrastrukturkosten Nutzung, Hosting, Lizenzen, Skalierung mit der Nutzerzahl wächst mit Reichweite; Budgetgrenze und Drossel nötig
Support und Befähigung Nutzerfragen, Schulung neuer Mitarbeiter, Rückmeldekanal betreiben 0,1 bis 0,2 Stellenanteile

Als Faustregel über alle Blöcke hinweg arbeitet die KIONIER-Fallakten-Serie mit 15 bis 30 Prozent der Aufbaukosten pro Jahr. Die Richtung bestätigt Gartner deutlich: Fehlschätzungen der GenAI-Kosten von 500 bis 1.000 Prozent sind möglich, vor allem durch nicht eingeplante Betriebsanteile beim Übergang in den Skalenbetrieb. Eine Rechnung, die am Go-live endet, weist deshalb nur den halben Preis aus und verspricht die ganze Wirkung.

Die modellierte KIONIER-Lagebild-Erhebung der KI-Verantwortlichen macht sichtbar, warum diese Lücke so oft übersehen wird: Der Median der KI-Jahresbudgets liegt dort zwischen 100.000 und 500.000 Euro. Für Piloten reicht das. Für den Dauerbetrieb mehrerer Systeme samt Betreuung, Monitoring und Schulung wird es knapp, und genau an dieser Stelle beginnt die stille Erosion.

Modell-Drift ist belegt, nicht theoretisch

Zwei der fünf Lastblöcke werden regelmäßig bestritten: Modell-Updates und Prompt-Pflege. Das Argument lautet, ein einmal eingestelltes System bleibe stabil. Die Forschung widerlegt das. Chen, Zaharia und Zou verglichen 2023 die März- und Juni-Versionen derselben kommerziellen Sprachmodelle über acht Aufgabentypen. Das Ergebnis: Verhalten und Leistung desselben Dienstes verschoben sich binnen drei Monaten erheblich, teils drastisch. Die Genauigkeit eines Modells bei einer Mathematikaufgabe fiel von 84 auf 51 Prozent, die Bereitschaft, Anweisungen zu befolgen, nahm messbar ab.

Für den Betrieb heißt das: Anbieter aktualisieren ihre Modelle laufend und teils unangekündigt. Ein Anweisungssatz, der heute präzise Antworten erzeugt, kann nach einem stillen Update ausschweifend, unvollständig oder falsch antworten. Dieses Phänomen wird als Prompt-Drift bezeichnet: Die einmal justierten Anweisungen verlieren durch die Bewegung des Modells ihre Wirkung. Die einzige Abwehr ist der Regressionslauf gegen das eigene Prüfset, automatisch bei jedem erkannten Versionswechsel. Genau deshalb sind Prüfset und Veränderungserkennung Kriterien des Readiness-Checks und keine Kür.

Der Befund trägt eine Konsequenz für Verträge: Wer ein KI-System betreibt, braucht vom Anbieter Transparenz über Modellversionen und Ankündigungsfristen für Wechsel. Wo beides fehlt, muss das eigene Monitoring die Veränderung erkennen, bevor die Nutzer sie erleben.

Das Muster der Fallakte 06: Erosion ist leise

Wie sich fehlende Betriebslast-Planung im Zeitverlauf entfaltet, dokumentiert die KIONIER-Fallakte „Das Projekt endete mit dem Go-live, für den Betrieb war niemand zuständig“. Der typisierte Fall: Ein Versorger mit rund 800 Mitarbeitern baut einen sauberen Wissensassistenten, das Projekt gelingt, über 60 Prozent der Zielgruppe nutzen ihn. Dann wird das Projektteam planmäßig aufgelöst, der Betrieb erscheint im Business Case als „laufende Cloud-Kosten, geringfügig“. Niemand pflegt den Dokumentenindex. In Monat zwölf zitiert das System eine drei Monate zuvor zurückgezogene Arbeitsanweisung, überzeugend vorgetragen, in einem sicherheitsnahen Bereich. Ein Bereichsleiter untersagt die Nutzung. Neun Betriebsmonate später wird abgeschaltet, versenkte Kosten rund 410.000 Euro, typisiert.

Das übertragbare Muster hat drei Züge. Erstens: Ein Wissenssystem ohne Pflegezyklus ist am Tag des Go-live auf seinem Höchststand und verfällt ab dann. Zweitens: Das Vertrauen der Nutzer kennt keine Grauzone; schon eine falsche Antwort, die überzeugend klingt, kann eine ganze Nutzergruppe abwenden. Drittens: Die Erosion ist leise. Sie zeigt sich zuerst in einzelnen Qualitätsmeldungen, dann in sinkender Wiederkehrquote, zuletzt in informellen Verboten. Wer nur die monatliche Nutzungsquote betrachtet, sieht den Kipppunkt Monate zu spät.

Das Zahlenbeispiel: Betriebslast gegen Pilotbudget

Die Ausgangswerte

Das folgende Beispiel ist typisiert und durchgerechnet. Ein Logistiker mit 600 Mitarbeitern hat einen Wissensassistenten für Disposition und Kundendienst pilotiert: Tarifwerke, Arbeitsanweisungen, Kundenvereinbarungen. Der Pilot mit 25 Nutzern kostete 60.000 Euro und lieferte per Zeiterfassung eine belastbare Messung: 45 Minuten Suchzeitersparnis je Nutzer und Woche. Der Ausbau zum Produktivsystem für 120 Nutzer kostet einmalig 150.000 Euro: Berechtigungen, Protokoll, Prüfset, Monitoring, Anbindung der Dokumentenquellen.

Position Wert (typisiert)
Pilotbudget (bereits ausgegeben) 60.000 Euro
Einmalkosten Ausbau zum Produktivsystem 150.000 Euro
Laufend: Wissenspflege (0,25 Stellenanteile, Fachbereich) 20.000 Euro/Jahr
Laufend: technischer Betrieb und Updates (0,15 Stellenanteile) 13.500 Euro/Jahr
Laufend: Modellnutzung, Hosting, Lizenzen 12.000 Euro/Jahr
Laufend: Monitoring-Werkzeuge 5.000 Euro/Jahr
Laufend: Qualitätsprüfung und Prüfset-Pflege 6.500 Euro/Jahr
Laufend: Schulung und Support 6.000 Euro/Jahr
Betriebslast gesamt 63.000 Euro/Jahr

Die erste Erkenntnis steht schon in dieser Tabelle: Die jährliche Betriebslast von 63.000 Euro übersteigt das gesamte Pilotbudget von 60.000 Euro. Das ist kein Ausreißer. Es ist der Normalfall am oberen Rand der Faustregel: 63.000 Euro sind 30 Prozent der gesamten Aufbaukosten von 210.000 Euro.

Der Rechenweg: naive gegen ehrliche Rechnung

Die naive Rechnung, wie sie in vielen Vorlagen steht, multipliziert die Pilotersparnis hoch und vergisst den Betrieb. Die ehrliche Rechnung folgt drei Regeln aus dem KIONIER-Board-ROI-Modell: Nur umgesetzte Kapazität zählt als Nutzen (Umsetzungsquote), im ersten Jahr baut sich der Nutzen erst über Monate auf (Anlauffaktor), während die Betriebslast vom ersten Tag an voll läuft.

„`
Gemessene Zeitersparnis:
120 Nutzer × 0,75 Std/Woche × 46 Wochen = 4.140 Std/Jahr

NAIV: 4.140 Std × 45 Euro Vollkostensatz = 186.300 Euro/Jahr
minus Cloud/Lizenzen 12.000 = 174.300 Euro „Nettonutzen“
Amortisation: 150.000 / 174.300 = rund 10 Monate

EHRLICH:
Anrechenbar: 4.140 Std × Umsetzungsquote 0,5 = 2.070 Std
2.070 Std × 45 Euro = 93.150 Euro/Jahr
Nettonutzen voll (Jahr 2 und 3): 93.150 − 63.000 = 30.150 Euro/Jahr
Nettonutzen Jahr 1: 0,6 × 93.150 − 63.000 = −7.110 Euro
(Anlauffaktor 0,6 senkt nur den Nutzen; die
Betriebslast läuft ab Tag eins voll)

Kumuliert nach 3 Jahren: −7.110 + 30.150 + 30.150 = 53.190 Euro
Einmalkosten: 150.000 Euro → nicht amortisiert
„`

Dieselbe Messbasis, zwei Urteile. Die naive Rechnung verspricht Amortisation in zehn Monaten. Die ehrliche Rechnung zeigt ein erstes Jahr im Minus und nach drei Jahren nur gut ein Drittel der Einmalkosten zurückverdient. Keine der beiden Zahlen ist gelogen. Aber nur eine trägt eine Investitionsentscheidung.

Die Lesart für das Gremium

Das Beispiel begründet keine Absage. Es stellt eine Gestaltungsaufgabe, denn die Betriebslast wächst deutlich langsamer als der Nutzen. Weitet der Logistiker das System auf 300 Nutzer aus, etwa um Lager und Fuhrpark, steigt die Betriebslast typisiert auf rund 78.000 Euro. Der anrechenbare Nutzen steigt auf rund 233.000 Euro pro Jahr. Der volle Nettonutzen liegt dann bei rund 155.000 Euro jährlich. Die Gesamtinvestition amortisiert sich, einschließlich moderater Erweiterungskosten, in rund zwei Jahren.

These: Der zweite Anwendungsfall bezahlt den Betrieb des ersten. Ein einzelnes KI-System trägt seine Betriebslast oft nicht allein; erst die zweite und dritte Nutzergruppe auf demselben Fundament macht aus einem Zuschussbetrieb eine Rechnung, die trägt. Wer Piloten einzeln bewertet und einzeln betreibt, bezahlt jedes Fundament mehrfach.

Daraus folgt die Empfehlung für die Vorlage an das Gremium: Betriebslast über drei Jahre als eigene Zeile, Anlauffaktor und Umsetzungsquote als ausgewiesene Annahmen, und der Ausbaupfad auf weitere Nutzergruppen als Teil der Entscheidung, nicht als vage Aussicht. Wer tiefer einsteigen will, findet Wirkungszuordnung, Bandbreitenrechnung und die Board-Seite im KIONIER-Board-ROI-Modell; der zugehörige ROI-Rechner rechnet das eigene Vorhaben im Browser durch.

Verantwortungsübergabe: vom Projekt in die Linie

Drei Rollen, die vor dem Go-live besetzt sein müssen

Projekte enden, Systeme bleiben. Der Satz „die Linie übernimmt nach dem Go-live“ ist die häufigste Form, diese Wahrheit zu umgehen. Er klingt nach Plan und ist keiner, solange niemand prüft, ob die Linie Kapazität, Kompetenz und einen Auftrag hat.

Drei Funktionen müssen vor dem Go-live namentlich besetzt sein, mit bezifferter Kapazität. Erstens die Produktverantwortung: eine Person, die Nutzung, Qualität und Weiterentwicklung steuert, das Betriebsbudget vertritt und der Führung berichtet. Zweitens die Wissenspflege: meist im Fachbereich angesiedelt, zieht geänderte Dokumente binnen definierter Frist nach und kuratiert den Korpus. Drittens der technische Betrieb: Monitoring, Updates, Schnittstellen, Störungsdienst. Bei 500 bis 1.000 Mitarbeitern summieren sich die drei Funktionen, verteilt auf mehrere Köpfe, meist auf eine halbe bis eine volle Stelle.

Entscheidend ist der Zeitpunkt. Die Besetzung gehört drei Monate vor den Go-live, nicht danach. Nur dann kann das Projektteam sein Wissen geordnet übertragen: die Architekturentscheidungen, die bekannten Schwächen, das Prüfset, die Betriebsroutinen. Eine Übergabe nach der Auflösung des Teams verdient den Namen nicht mehr; sie ist eine Suche nach Hinterlassenschaften.

Wer misst, wer entscheidet, wer schaltet ab

Verantwortung wird erst konkret, wenn sie an Entscheidungen hängt. Die folgende Matrix ordnet die wiederkehrenden Betriebsentscheidungen den Rollen zu. Sie ist ein typisiertes Muster für ein internes Assistenzsystem und wird je Haus angepasst.

Entscheidung Produktverantwortung Wissenspflege (Fachbereich) Technischer Betrieb Geschäftsführung
Fehlerrate messen und berichten verantwortlich liefert Stichproben-Urteile betreibt Messung erhält Quartalsbericht
Dokument nachziehen oder entfernen wird informiert entscheidet und führt aus setzt technisch um
Modell- oder Versionswechsel freigeben entscheidet nach Regressionslauf prüft Stichprobe testet und empfiehlt
Nutzung für einen Bereich aussetzen entscheidet bei Qualitätsvorfall meldet und begründet setzt um wird informiert
Betriebsbudget für das Folgejahr beantragt mit Kennzahlen meldet Aufwand meldet Aufwand entscheidet
Endgültige Abschaltung empfiehlt mit Beleg wird gehört wird gehört entscheidet

Zwei Regeln machen die Matrix wirksam. Erstens: Die Abschaltentscheidung liegt bewusst bei der Geschäftsführung, denn sie ist eine Investitionsentscheidung mit Signalwirkung, keine technische. Zweitens: Die Produktverantwortung berichtet mit festen Kennzahlen, nicht mit Prosa. Drei genügen: gemessene Fehlerrate, Wiederkehrquote der Nutzer, Betriebskosten gegen Budget.

Die Übergabe-Checkliste

Die folgende Checkliste ist die Abnahmegrundlage für den Übergang vom Projekt in die Linie. Jeder offene Punkt ist ein benanntes Risiko, das die Freigabe entweder blockiert oder als dokumentierte Auflage begleitet.

  • Sind Produktverantwortung, Wissenspflege und technischer Betrieb namentlich besetzt, mit bezifferten Stellenanteilen?
  • Existiert ein Betriebsbudget als eigene, wiederkehrende Position, getrennt vom Projektbudget und über drei Jahre geplant?
  • Ist der Pflegezyklus schriftlich: In wie vielen Tagen muss ein geändertes oder zurückgezogenes Dokument im System nachgezogen sein?
  • Liegt das Prüfset mit Soll-Antworten vor, und ist der Regressionslauf vor jeder Änderung technisch erzwungen?
  • Ist die Fehlerrate erstmals gemessen, mit Stichprobengröße und Datum, und als Startwert dokumentiert?
  • Können Nutzer eine falsche Antwort mit einem Klick melden, und landet die Meldung bei einer verantwortlichen Person mit Reaktionsfrist?
  • Ist die Rückschaltung auf die letzte funktionierende Version geübt und mit Zeitangabe protokolliert?
  • Sind Berichtsweg und Kennzahlen an die Geschäftsführung vereinbart, mit erstem Termin im Kalender?

Abbruchdisziplin: das Urteil in Woche sechs

Die Frühindikatoren: woran ein toter Pilot früh erkennbar ist

Die teuersten Piloten sind nicht die, die scheitern. Es sind die, die weiterlaufen, obwohl ihr Scheitern absehbar ist. Die modellierte KIONIER-Lagebild-Erhebung der KI-Verantwortlichen zeigt das Muster: Nur 16 Prozent haben selbst einen Abbruch entschieden, und ein Teil der Vorhaben endet nie formal, es schläft ein. Ein eingeschlafener Pilot kostet dabei weiter: Lizenzen laufen, Aufmerksamkeit versickert, und für das Ende trägt niemand Verantwortung.

Dabei ist das Urteil früh möglich. Nach etwa sechs Wochen Laufzeit trennen sieben messbare Indikatoren die Kandidaten von den Karteileichen. Kein einzelner Indikator ist ein Todesurteil. Drei oder mehr zugleich sind es fast immer.

Frühindikator in Woche sechs Warum er zählt
Keine Baseline erhoben, und niemand plant die Erhebung Ohne Ausgangswert wird der Nutzen nie belegbar sein; das Vorhaben erbt das NANDA-Schicksal: wirksam vielleicht, nachweisbar nie
Qualität wird erzählt, nicht gemessen: kein Prüfset in Arbeit Die Freigabeentscheidung wird später an Anekdoten hängen, und Anekdoten verlieren gegen jede laute Erwartung
Die Wiederkehrquote sinkt schon im Pilotkreis Wenn Freiwillige unter Idealbedingungen nicht zurückkommen, kommt der Regelbetrieb erst recht nicht
Der Fachbereich schickt Vertreter statt Entscheider ins Review Ohne fachlichen Eigentümer gibt es später niemanden, der Qualität verantwortet und Budget verteidigt
Der Datenzugang bleibt provisorisch: Exporte statt Anbindung, Rechtefrage vertagt Die Provisorien des Piloten sind im Betrieb KO-Kriterien; ihr Nachbau ist oft teurer als der Pilot selbst
Niemand kann sagen, wessen Budget den Betrieb tragen würde Ein Vorhaben ohne Betriebsheimat wird nach dem Go-live verhungern, siehe Fallakte 06
Die Erfolgsdefinition wandert: „eigentlich geht es um etwas anderes“ Ein Ziel, das sich dem Ergebnis anpasst, ist keines; das Vorhaben dient dann der Rechtfertigung, nicht dem Nutzen

Der geordnete Abbruch ist ein Steuerungserfolg

Ein Abbruch nach Woche sechs kostet einen Bruchteil des Pilotbudgets und liefert dokumentiertes Wissen: welcher Anwendungsfall, welche Datenlücke, welche Voraussetzung fehlte. Ein Abbruch nach Monat neun kostet das volle Budget plus die Glaubwürdigkeit des Themas. Die Zahlen des Marktes geben der Disziplin recht: Wenn nach Gartner mindestens 30 Prozent und nach S&P Global fast die Hälfte der Machbarkeitsnachweise verworfen werden, dann ist der Abbruch der statistische Normalfall. Ein Haus, das nie abbricht, prüft nicht ehrlich.

Damit der Abbruch als Steuerung gilt und nicht als Niederlage, braucht er drei Dinge, die vor dem Start vereinbart werden. Erstens die Erfolgsschwelle: der gemessene Wert, ab dem der Ausbau folgt. Zweitens der Prüftermin: das Datum, an dem gegen die Schwelle entschieden wird. Drittens die Abbruchfolge: was mit Daten, Lizenzen, Erkenntnissen und Team geschieht. Wer diese drei Punkte im Startbeschluss fixiert, macht das Beenden zu einer normalen Option statt zu einem Gesichtsverlust.

Die KIONIER-Fallakte „Der Pilot lieferte zwölf Prozent und galt als Misserfolg“ zeigt die Kehrseite derselben Disziplin: Dort wurde ein funktionierender Pilot beerdigt, weil die Messlatte aus einem Anbieterprospekt stammte und nie korrigiert wurde. Abbruchdisziplin heißt beides: aussichtslose Vorhaben früh beenden und tragfähige Vorhaben gegen die richtige Messlatte verteidigen.

Die Woche-sechs-Checkliste für das Review

  • Liegt die Baseline vor: Ausgangswert, Erhebungszeitraum, Stichprobe, Quelle?
  • Ist die Erfolgsschwelle schriftlich vereinbart, bevor die erste Ergebniszahl kursiert?
  • Existiert ein Prüfset-Entwurf mit mindestens 50 echten Fällen aus dem Alltag?
  • Steigt oder hält die Wiederkehrquote im Pilotkreis, belegt aus Nutzungsdaten?
  • Sitzt ein entscheidungsbefugter Fachbereichs-Owner im Review, nicht nur ein Delegierter?
  • Ist der produktive Datenzugang geklärt: Anbindung, Berechtigungen, Aktualisierung?
  • Ist benannt, wessen Budget den späteren Betrieb trägt, mit erster Schätzung der Betriebslast?
  • Steht der Prüftermin für die Ausbau- oder Abbruchentscheidung mit Datum im Kalender?
  • Ist die ursprüngliche Erfolgsdefinition unverändert, oder wurde sie dokumentiert und begründet angepasst?

Recht und Nachweis: Betreiberpflichten ab dem Produktivgang

Was mit dem Produktivgang rechtlich real wird

Die folgenden Angaben geben den Stand Juli 2026 wieder und dienen der Orientierung; sie ersetzen keine Rechtsberatung. Der Produktivgang ist auch juristisch eine Schwelle. Mit ihm wird das Unternehmen Betreiber eines KI-Systems im Sinn der KI-Verordnung (Verordnung (EU) 2024/1689), mit eigenen Pflichten nach Artikel 26: zweckgemäßer Einsatz nach den Vorgaben des Anbieters, menschliche Aufsicht durch kompetente Personen, Kontrolle der Eingabedaten, Aufbewahrung der Protokolle und laufende Beobachtung des Systems.

Unabhängig von der Risikoklasse gelten zwei Pflichten schon heute. Die KI-Kompetenz nach Artikel 4 verlangt seit Februar 2025, dass Beschäftigte, die mit KI-Systemen arbeiten, dafür befähigt sind. Die Transparenzpflichten nach Artikel 50 gelten ab dem 2. August 2026 unverändert: Nutzer müssen erkennen können, dass sie mit einem KI-System interagieren, und bestimmte KI-erzeugte Inhalte sind zu kennzeichnen.

Praktisch bedeutsam ist die Deckungsgleichheit mit dem Readiness-Check: Inventareintrag, Risikoeinstufung, Eingriffsmöglichkeit und lückenloses Protokoll sind dort KO-Kriterien, und genau diese vier Punkte machen ein Haus gegenüber einer Aufsicht auskunftsfähig. Wer den Check besteht, hat den Kern der Betreiberpflichten technisch unterlegt, statt sie als Papierlage zu simulieren.

Was der Digital Omnibus verschiebt und was nicht

Der Digital Omnibus on AI wurde vom Europäischen Parlament am 16. Juni 2026 und vom Rat am 29. Juni 2026 angenommen und am 8. Juli 2026 unterzeichnet. Die Veröffentlichung im Amtsblatt stand im Juli 2026 noch aus; bis zum Inkrafttreten gilt formal der ursprüngliche Zeitplan. Nach dem unterzeichneten Text verschieben sich die Pflichten für Hochrisiko-Systeme: für eigenständige Systeme nach Anhang III auf den 2. Dezember 2027, für in regulierte Produkte eingebettete Systeme nach Anhang I auf den 2. August 2028.

Zwei Fehldeutungen sind zu vermeiden. Erstens: Verschoben ist nur das Hochrisiko-Regime. Transparenz nach Artikel 50, die KI-Kompetenzpflicht und die Regeln für Basismodelle laufen nach altem Kalender. Zweitens: Die Verschiebung ist ein Zeitfenster für den Aufbau der Nachweise, keine Entwarnung. Die Substanz der Pflichten, von Risikomanagement über Dokumentation bis zur menschlichen Aufsicht, ist unverändert. Ein Haus, das seine produktiven Systeme heute inventarisiert, einstuft und protokolliert, verbraucht das Zeitfenster für Nachweise statt für Nachlässigkeit. Für die meisten internen Assistenzsysteme im Mittelstand gilt ohnehin: Sie sind selten hochriskant im Sinn der Verordnung, aber die Einstufung muss begründet und dokumentiert sein, sonst ist sie nur eine Vermutung.

Die fünf Stellen, an denen es scheitert

  1. Die Messlatte kommt von außen. Eine Prospekt- oder Demozahl des Anbieters wird im Gremium zur Zielgröße, bevor eine eigene Baseline existiert. Frühwarnzeichen: In Vorlagen kursieren Prozentwerte, deren Bezugsgröße niemand benennen kann. Gegenmaßnahme: Jede berichtete Zahl braucht Baseline und Bezugsgröße; Anbieterzahlen werden als Hypothese gekennzeichnet, nie als Ziel. Die Fallakte „Der Pilot lieferte zwölf Prozent und galt als Misserfolg“ zeigt, wie eine Messe-Zahl ein funktionierendes Projekt beerdigt.

  2. Der Business Case endet am Go-live. Wissenspflege, Monitoring, Modell-Updates und Support stehen in keiner Zeile. Frühwarnzeichen: Der Betrieb erscheint als „laufende Cloud-Kosten, geringfügig“. Gegenmaßnahme: Betriebslast über drei Jahre als eigene Position rechnen, als Größenordnung 15 bis 30 Prozent der Aufbaukosten pro Jahr. Die Fallakte „Das Projekt endete mit dem Go-live, für den Betrieb war niemand zuständig“ dokumentiert die Erosion bis zur Abschaltung.

  3. Niemand übernimmt. Das Projektteam wird aufgelöst, „die Linie übernimmt“, aber ohne Namen, Kapazität und Auftrag. Frühwarnzeichen: Drei Monate vor Go-live kann niemand die drei Betriebsrollen nennen. Gegenmaßnahme: Produktverantwortung, Wissenspflege und technischer Betrieb vor dem Go-live namentlich besetzen und die Übergabe-Checkliste dieses Guides zur Abnahmebedingung machen.

  4. Qualität wird gelobt statt gemessen. Es gibt kein Prüfset, keine Fehlerrate, keinen Regressionslauf; die Freigabe stützt sich auf Zufriedenheit. Frühwarnzeichen: Auf die Frage nach der gemessenen Fehlerrate folgt eine Geschichte statt einer Zahl. Gegenmaßnahme: Prüfset und erste Fehlerraten-Messung als Freigabebedingung; die KO-Regel des Readiness-Checks konsequent anwenden, auch gegen Termindruck.

  5. Der Pilot darf nicht sterben. Ohne Erfolgsschwelle und Prüftermin läuft das Vorhaben weiter, weil niemand das Ende verantworten will. Frühwarnzeichen: Der Pilot ist älter als sechs Monate, und es gibt kein Datum, an dem über Ausbau oder Abbruch entschieden wird. Gegenmaßnahme: Erfolgsschwelle, Prüftermin und Abbruchfolgen im Startbeschluss fixieren; eingeschlafene Piloten quartalsweise aufspüren und formal beenden.

Maßnahmen für die Geschäftsführung: 30, 60, 90 Tage

Bis Tag 30, Transparenz herstellen:

  • Alle laufenden Piloten und produktiven Systeme auflisten lassen: Startdatum, Ziel, Baseline vorhanden oder nicht, geplanter Prüftermin (Owner: KI-Verantwortlicher oder CIO).
  • Für das wichtigste System den Produktiv-Readiness-Check durchführen, etwa mit dem interaktiven Selbsttest, und die KO-Punkte berichten lassen (Owner: KI-Verantwortlicher mit Fachbereich).
  • Je System die Frage beantworten lassen: Wessen Budget trägt den Betrieb im dritten Jahr? Jede fehlende Antwort wird als Risiko protokolliert (Owner: CFO).
  • Eingeschlafene Piloten identifizieren: läuft, aber ohne Review-Termin und ohne Kennzahl. Für jeden einen Entscheidungstermin setzen (Owner: Geschäftsführung).

Bis Tag 60, Regeln setzen:

  • Freigaberegel beschließen: Kein Produktivgang ohne bestandenen Readiness-Check, ohne benannte Betriebsrollen und ohne Betriebsbudget über drei Jahre (Owner: Geschäftsführung).
  • Startregel beschließen: Kein neuer Pilot ohne Baseline, Erfolgsschwelle und Prüftermin im Startbeschluss (Owner: Geschäftsführung mit KI-Verantwortlichem).
  • Für das führende System Prüfset und erste Fehlerraten-Messung beauftragen, mit Termin und Stichprobengröße (Owner: KI-Verantwortlicher).
  • Berichtsformat festlegen: quartalsweise drei Kennzahlen je produktivem System, Fehlerrate, Wiederkehrquote, Betriebskosten gegen Budget (Owner: KI-Verantwortlicher).

Bis Tag 90, Übergang vollziehen:

  • Für den reifsten Piloten die Ausbau- oder Abbruchentscheidung treffen, auf Basis von Readiness-Score, ehrlicher Betriebsrechnung und Erfolgsschwelle (Owner: Geschäftsführung).
  • Bei Ausbau: die drei Betriebsrollen namentlich besetzen und die Übergabe-Checkliste als Abnahme durchgehen (Owner: Fachbereichsleitung mit CIO).
  • Bei Abbruch: Erkenntnisse, Daten und Lizenzfolgen dokumentieren und dem Gremium als geordneten Abschluss berichten (Owner: KI-Verantwortlicher).
  • KI-Inventar und Risikoeinstufungen für alle produktiven Systeme vervollständigen, als Orientierung an den Betreiberpflichten der KI-Verordnung (Owner: KI-Verantwortlicher mit Rechtsfunktion).

FAQ

Unser KI-Pilot läuft seit vier Monaten gut. Woran erkenne ich, ob er wirklich reif für den Produktivbetrieb ist?

An Nachweisen, nicht an Zufriedenheit. Prüfen Sie sechs Felder: Datenbasis, Architektur, Sicherheit, Recht und Nachweis, Betrieb, Organisation. Reif ist das System, wenn alle Felder solide belegt sind und keines der KO-Kriterien offen steht: Personendaten-Schutzfilter, Schlüsselverwaltung, durchgreifende Zugriffsrechte, Inventareintrag, Risikoeinstufung, Eingriffsmöglichkeit, lückenloses Protokoll, geübter Rückfallweg. Dazu gehören eine gemessene Fehlerrate mit Stichprobe und ein besetztes Betriebsmodell. Der KIONIER-Readiness-Check mit 37 Kriterien macht daraus in 60 bis 90 Minuten eine belegbare Freigabeentscheidung.

Was kostet der laufende Betrieb eines KI-Assistenten bei 600 Mitarbeitern realistisch pro Jahr?

Kalkulieren Sie als typisierte Größenordnung 15 bis 30 Prozent der Aufbaukosten pro Jahr; ein mittlerer Wissensassistent landet damit oft bei 50.000 bis 80.000 Euro jährlich. Der größte Einzelposten ist keine Technik: Es ist die Personalzeit für Wissenspflege und Qualitätssicherung. Dazu kommen Modellnutzung, Hosting, Monitoring-Werkzeuge, Updates und Support. Nach Gartner sind Kostenfehlschätzungen von 500 bis 1.000 Prozent möglich, meist wegen vergessener Betriebsanteile. Rechnen Sie drei Betriebsjahre als eigene Budgetposition. Ein Vorhaben, dessen Betrieb niemand beziffern kann, ist noch kein Vorhaben.

Wer sollte nach dem Go-live für unser KI-System verantwortlich sein, wenn wir kein eigenes Data-Team haben?

Sie brauchen kein Data-Team, aber drei benannte Zuständigkeiten, die auch in Teilzeit tragfähig sind: eine Produktverantwortung, die Qualität, Nutzung und Budget steuert; eine Wissenspflege im Fachbereich, die Dokumente aktuell hält; einen technischen Betrieb für Monitoring und Updates, der auch bei einem IT-Dienstleister liegen kann. Bei 500 bis 1.000 Mitarbeitern summiert sich das meist auf eine halbe bis eine volle Stelle. Entscheidend ist die namentliche Besetzung drei Monate vor dem Go-live, damit das Projektwissen geordnet übergeht.

Stimmt es, dass 95 Prozent aller KI-Projekte scheitern?

So pauschal nicht. Die Zahl stammt aus der NANDA-Studie des MIT (2025) und besagt: 95 Prozent der untersuchten GenAI-Vorhaben erreichten keinen messbaren Effekt auf die Ergebnisrechnung, gemessen an einer strengen Latte sechs Monate nach dem Piloten. Das ist keine technische Fehlschlagquote; viele Systeme funktionierten und steigerten individuelle Produktivität. Häufig fehlte schlicht die Baseline, um Wirkung zu belegen. Andere Erhebungen nennen 30 bis 46 Prozent verworfene Machbarkeitsnachweise. Die ehrliche Botschaft: Scheitern ist häufig, aber der Engpass ist Messung und Betrieb, nicht die Technik.

Welche Kennzahlen sollten wir für ein produktives KI-System an die Geschäftsführung berichten?

Drei Betriebskennzahlen im Quartalstakt: die gemessene Fehlerrate gegen ein festes Prüfset mit Stichprobengröße, die Wiederkehrquote der Nutzer als Frühwarnindikator vor Vertrauensverlust und die Betriebskosten gegen Budget. Dazu jährlich die Nutzenrechnung: umgesetzte Stunden oder Qualitätswirkung gegen die Baseline, mit ausgewiesener Umsetzungsquote. Vermeiden Sie reine Aktivitätszahlen wie Anfragen pro Monat, sie steigen auch bei sinkender Qualität. Wichtig ist die Vorher-Festlegung: Kennzahlen, die erst nach dem Ergebnis gewählt werden, beweisen nichts.

Wann sollten wir einen KI-Piloten abbrechen, statt weiter Geld hineinzugeben?

Wenn in Woche sechs drei oder mehr Frühindikatoren zugleich anschlagen: keine Baseline und keine geplante, kein Prüfset in Arbeit, sinkende Wiederkehrquote im Pilotkreis, kein entscheidungsbefugter Fachbereichs-Owner, provisorischer Datenzugang ohne Klärungspfad, kein benanntes Betriebsbudget, wandernde Erfolgsdefinition. Brechen Sie dann geordnet ab: Erkenntnisse dokumentieren, Lizenzen beenden, dem Gremium als Steuerungsentscheidung berichten. Ein Abbruch nach sechs Wochen kostet einen Bruchteil, einer nach neun Monaten das volle Budget plus Glaubwürdigkeit. Häuser, die nie abbrechen, prüfen nicht ehrlich.

Welche Pflichten haben wir nach dem EU AI Act, wenn unser KI-System produktiv geht, Stand Juli 2026?

Als Orientierung, keine Rechtsberatung: Mit dem Produktivgang werden Sie Betreiber mit Pflichten nach Artikel 26 der KI-Verordnung, darunter zweckgemäßer Einsatz, menschliche Aufsicht, Protokollaufbewahrung und Beobachtung. Die KI-Kompetenzpflicht nach Artikel 4 gilt bereits, die Transparenzpflichten nach Artikel 50 ab dem 2. August 2026. Der beschlossene Digital Omnibus verschiebt nur das Hochrisiko-Regime: Anhang III auf den 2. Dezember 2027, Anhang I auf den 2. August 2028; die Amtsblatt-Veröffentlichung stand im Juli 2026 noch aus. Pflichtenkern für Sie: Inventar, begründete Einstufung, Kennzeichnung, Protokoll.

Vertiefung im KIONIER-Bestand

  • Arbeitshilfe A, Produktiv-Readiness-Check (37 Kriterien): Der vollständige Prüfrahmen hinter diesem Guide, mit Prüffragen, Nachweis-Artefakten und Regelwerks-Mapping; der interaktive Readiness-Selbsttest rechnet Score und KO-Sperren im Browser und erzeugt die Lückenliste.
  • Arbeitshilfe C, Board-ROI-Modell: Liefert Anlauffaktor, Umsetzungsquote, Bandbreitenrechnung und die Board-Seite für das Zahlenbeispiel dieses Guides; der ROI-Rechner spielt das eigene Vorhaben mit drei Fällen durch.
  • Fallakte 05, „Der Pilot lieferte zwölf Prozent und galt als Misserfolg“: Das Erwartungs-Scheitern im Detail: wie eine fremde Zahl zur Messlatte wird und ein funktionierendes Projekt beerdigt.
  • Fallakte 06, „Das Projekt endete mit dem Go-live, für den Betrieb war niemand zuständig“: Das Betriebslast-Scheitern im Zeitverlauf, vom unbudgetierten Betrieb bis zur Abschaltung nach 17 Monaten.
  • Lagebild-Umfrage 1 (Head of AI, n=50, modelliert) und Lagebild-Umfrage 4 (Querschnitt, n=250, modelliert): Die Produktivquoten, Abbruchgründe und Budgetrealitäten des Segments, an publizierten Primärstudien kalibriert; nützlich als Vergleichsmaßstab für das eigene Portfolio.
  • Glossar: Die Einträge „Pilot vs. Produktivbetrieb“, „Evaluation“, „Monitoring“, „Drift-Erkennung“ und „Hypercare“ erklären die Betriebsbegriffe dieses Guides je in einem zitierfähigen Satz mit Führungsrelevanz.

Quellen

  1. MIT Project NANDA (2025): „The GenAI Divide: State of AI in Business 2025“; 95 Prozent der untersuchten GenAI-Vorhaben ohne messbaren Effekt auf die Ergebnisrechnung; Methodik: 52 Interviews, 153 befragte Führungskräfte, über 300 analysierte Initiativen; Autoren-Einordnung als richtungsweisend. https://www.mlq.ai/media/quarterly_decks/v0.1_State_of_AI_in_Business_2025_Report.pdf
  2. Gartner (2024): Pressemitteilung vom 29.07.2024; mindestens 30 Prozent der GenAI-Projekte werden bis Ende 2025 nach der Konzeptphase abgebrochen; Gründe: Datenqualität, Risikokontrollen, eskalierende Kosten, unklarer Geschäftswert. https://www.gartner.com/en/newsroom/press-releases/2024-07-29-gartner-predicts-30-percent-of-generative-ai-projects-will-be-abandoned-after-proof-of-concept-by-end-of-2025
  3. Gartner, IT Symposium/Xpo (2024): Fehlschätzungen der GenAI-Kosten von 500 bis 1.000 Prozent möglich, vor allem durch ungeplante Betriebsanteile. Vgl. iStart (2024). https://istart.com.au/news-items/ai-blowouts-its-really-easy-to-waste-money/
  4. S&P Global Market Intelligence / 451 Research (2025): „Voice of the Enterprise: AI & Machine Learning 2025“, 1.006 Befragte; 42 Prozent gaben die Mehrheit ihrer KI-Initiativen auf, im Schnitt 46 Prozent der Machbarkeitsnachweise verworfen. Vgl. CIO Dive (2025). https://www.ciodive.com/news/AI-project-fail-data-SPGlobal/742590/
  5. RAND Corporation (2024): „The Root Causes of Failure for Artificial Intelligence Projects“; über 80 Prozent Fehlschlagquote, unklare Problem- und Zieldefinition als häufigste Ursache, unzureichende Infrastruktur für Datenpflege und Modellbetrieb als weitere. https://www.rand.org/pubs/research_reports/RRA2680-1.html
  6. McKinsey & Company (2025): „The State of AI“ (Global Survey, November 2025, 1.993 Befragte); 88 Prozent KI-Nutzung, rund ein Drittel in Skalierung, 39 Prozent mit berichteter Ergebniswirkung, rund 6 Prozent High Performer; Neugestaltung von Arbeitsabläufen als stärkster Wirkfaktor. https://www.mckinsey.com/capabilities/quantumblack/our-insights/the-state-of-ai
  7. Deloitte (2024): „The State of Generative AI in the Enterprise“ (Q4 2024, 2.800 Befragte); über zwei Drittel erwarten, dass höchstens 30 Prozent ihrer GenAI-Experimente zeitnah skaliert werden; über 40 Prozent haben Schwierigkeiten, Wirkung zu definieren und zu messen. https://www.deloitte.com/us/en/services/consulting/articles/state-of-generative-ai-in-enterprise.html
  8. Chen, L. / Zaharia, M. / Zou, J. (2023/2024): „How Is ChatGPT’s Behavior Changing over Time?“; erhebliche Verhaltens- und Leistungsverschiebungen derselben Modelldienste binnen drei Monaten; Beleg für die Notwendigkeit laufender Überwachung. Harvard Data Science Review 6.2 / arXiv:2307.09009. https://arxiv.org/abs/2307.09009
  9. METR (2025): „Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity“; randomisierte Studie: 19 Prozent längere Bearbeitungszeit mit KI bei wahrgenommener Beschleunigung von 20 Prozent. https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/
  10. Humlum, A. / Vestergaard, E. (2025): „Still Waters, Rapid Currents: Early Labor Market Transformation under Generative AI“, NBER Working Paper 33777; rund 2,8 Prozent Zeitersparnis durch KI-Chatbots, präzise Nulleffekte auf Löhne und Arbeitsstunden. https://www.nber.org/papers/w33777
  11. Microsoft / LinkedIn (2024): „Work Trend Index 2024“; 75 Prozent der Wissensarbeiter nutzen generative KI, 78 Prozent davon mit eigenen, nicht freigegebenen Werkzeugen. https://www.microsoft.com/en-us/worklab/work-trend-index/ai-at-work-is-here-now-comes-the-hard-part
  12. Europäische Union (2024): Verordnung (EU) 2024/1689 (KI-Verordnung), insbesondere Artikel 4, 26 und 50. https://eur-lex.europa.eu/eli/reg/2024/1689/oj
  13. Rat der Europäischen Union (2026): Pressemitteilung zum Digital Omnibus on AI vom 29.06.2026; Annahme durch das Europaparlament am 16.06.2026, Unterzeichnung am 08.07.2026; Anhang III auf 02.12.2027, Anhang I auf 02.08.2028 verschoben; Amtsblatt-Veröffentlichung im Juli 2026 ausstehend. https://www.consilium.europa.eu/en/press/press-releases/2026/06/29/
  14. OWASP Foundation (2025): „OWASP Top 10 for LLM Applications 2025“; Risikokatalog für produktive Sprachmodell-Anwendungen, Grundlage der Sicherheitskriterien im Readiness-Check. https://genai.owasp.org/llm-top-10/
  15. ISO/IEC 42001:2023: „Information technology — Artificial intelligence — Management system“; Rahmen für den geführten KI-Betrieb, auf den die Betriebs- und Organisationskriterien verweisen. Internationale Organisation für Normung, 2023.
  16. KIONIER-Redaktion (2026): Lagebild-Umfragen 1 (Head of AI, n=50) und 4 (Querschnitt, n=250), redaktionell modellierte, an publizierten Primärstudien kalibrierte Erhebungen (Kalibrierungs-Anhänge dort); im Text durchgängig als modellierte KIONIER-Lagebild-Erhebung gekennzeichnet.

Das Entscheider-Briefing

Ein Briefing pro Woche: Entscheidungsfragen, eingeordnete Zahlen und Fristen. Ihre Adresse geben wir nicht weiter.

Sie erhalten zuerst eine E-Mail mit einem Bestätigungslink. Erst nach dem Klick nehmen wir Sie auf. Abmeldung mit einem Klick in jeder Ausgabe.

Weiterführend im Themenfeld