Ausgabe 39/2026 · Stand: Mittwoch, 23. September 2026 Das Fachmagazin für KI-Transformation im Mittelstand
Briefing abonnieren
Strategie

Was zählt als KI-Transformation? Ein prüfbares Reifegradmodell

36 Prozent der deutschen Unternehmen „nutzen KI“ — doch Nutzung sagt nichts über Reife. Fünf Stufen mit Belegpflicht trennen Experiment, Betrieb und echte Transformation.

Veröffentlicht · Aktualisiert · 13 Min. Lesezeit
Blick durch den Hauptgang einer modernen Fertigungshalle mit Bearbeitungszentren auf beiden Seiten.
Zwischen Strategiepapier und Halle liegt der Weg, den die meisten Vorhaben nicht schaffen. Symbolbild, KI-generiert für KIONIER.

Kurzantwort

Transformation liegt vor, wenn KI-Vorhaben an Unternehmenszielen ausgerichtet, als Portfolio geführt, kontrolliert betrieben und in messbaren Outcomes gesteuert werden. Verteilte Lizenzen und einzelne Piloten sind Vorstufen. Prüfbar wird der Unterschied durch ein fünfstufiges Modell, bei dem jede Stufe an Artefakten hängt: Inventar, Baselines, Evaluationsnachweise, Incident-Pfad, dokumentierte Abschaltungen. Die eigene Stufe bestimmt, was ein Externer in einer Woche an Belegen einsehen könnte — nicht, was das Strategiedeck behauptet.

Die Kernaussagen

  • Nutzungsquoten messen Verbreitung, nicht Reife: 36 Prozent der deutschen Unternehmen nutzen KI (Bitkom 2025), aber nur 5 Prozent der unternehmensspezifischen Werkzeuge erreichen laut MIT die Produktion (2025).
  • Jede Stufe des Modells ist an vorzeigbare Artefakte gebunden — Selbsteinschätzung ohne Beleg zählt nicht.
  • Der Sprung von Stufe 2 auf Stufe 3 ist der teuerste und der am häufigsten übersprungene: Hier entstehen Betrieb, Kontrollen und Nachweisakte.
  • Eine dokumentierte Abschaltung ist ein härterer Reifebeleg als drei neue Piloten.
  • Kommunikation gehört an die belegte Stufe gebunden; jede Übertreibung baut Fallhöhe für Audits, Kunden und Belegschaft auf.

Warum die Frage jetzt zählt

Zwei amtliche und verbandliche Zahlen zeigen, wie dehnbar der Begriff geworden ist. Das Statistische Bundesamt zählte für 2024 ein Fünftel der Unternehmen ab zehn Beschäftigten als KI-Nutzer, nach 12 Prozent im Vorjahr (Destatis 2024). Bitkom kam 2025 mit anderer Grundgesamtheit auf 36 Prozent, fast eine Verdopplung gegenüber 2024 (Bitkom Research 2025, 604 Unternehmen ab 20 Beschäftigten). Beide Erhebungen zählen als Nutzung bereits das erste eingesetzte Werkzeug. Zwischen „ein Team nutzt einen Assistenten“ und „das Unternehmen steuert Wertschöpfung mit KI“ liegen Welten, in der Statistik fallen beide in dieselbe Zelle.

Wie groß die Lücke ist, zeigt das MIT: In der NANDA-Untersuchung „The GenAI Divide“ hatten über 80 Prozent der Organisationen Werkzeuge wie ChatGPT oder Copilot erprobt, aber nur 5 Prozent der unternehmensspezifischen KI-Lösungen erreichten die Produktion; rund 95 Prozent der Organisationen konnten keinen messbaren Ergebnisbeitrag zeigen (2025). Gartner misst dieselbe Spreizung als Reifegefälle: Organisationen mit hoher KI-Reife halten 45 Prozent ihrer Systeme drei Jahre und länger produktiv, bei niedriger Reife sind es 20 Prozent (2025).

Für die Führung ist das keine akademische Frage. Ohne belegbare Standortbestimmung fließt Budget in Ambitionen, deren Fundament fehlt. Und mit den Pflichten der Verordnung (EU) 2024/1689, KI-Kompetenz nach Artikel 4 seit Februar 2025, Hochrisiko-Anforderungen im Wesentlichen ab August 2026, wird aus der Reifelücke eine Compliance-Lücke.

Warum „wir nutzen KI“ nichts beweist

Nutzungsquoten sind Verbreitungsmaße. Sie beantworten die Frage, ob irgendwo im Haus ein KI-Werkzeug läuft, nicht, ob jemand dessen Qualität misst, dessen Risiken kontrolliert oder dessen Nutzen belegt. Ein Unternehmen kann in jeder Abteilung Assistenten einsetzen und trotzdem auf der untersten Reifestufe stehen: ohne Inventar, ohne Baseline, ohne Evaluationspfad, ohne einen einzigen dokumentierten Nutzenbeleg.

Die Verwechslung hat einen Verstärker: Schatten-Nutzung. Beschäftigte verwenden private KI-Konten für dienstliche Aufgaben, während die offizielle Statistik des Hauses „keine KI-Nutzung“ meldet, oder umgekehrt meldet das Haus Nutzung, die in Wahrheit aus unkontrollierten Einzelinitiativen besteht. Beides verzerrt das Lagebild in dieselbe Richtung: Die Führung weiß nicht, was läuft. Genau hier setzt ein Reifegradmodell an. Es ersetzt die Frage „Nutzen wir KI?“ durch die Frage „Was können wir belegen?“.

Die ehrlichste Kennzahl der KI-Reife ist nicht die Zahl der Piloten, sondern die Antwortzeit auf eine einfache Frage: Wie viele KI-Systeme laufen bei uns produktiv, wer verantwortet sie, und wann wurden sie zuletzt evaluiert? Wer dafür länger als eine Woche braucht, steht auf Stufe 1, egal, was die Strategiefolien sagen.

Das Fünf-Stufen-Modell mit Belegpflicht

Das Modell unterscheidet fünf Stufen. Entscheidend ist die dritte Spalte: Jede Stufe gilt erst als erreicht, wenn die genannten Artefakte vorliegen und einem Dritten gezeigt werden könnten. Die vierte Spalte benennt den typischen Selbstbetrug. Die Erzählung, mit der Häuser sich eine Stufe höher reden, als die Belege tragen.

Stufe Zustand Pflicht-Artefakte (prüfbar) Typischer Selbstbetrug
S0 Experiment Einzelne Tests, teils privat initiiert; kein Betriebsversprechen Keine, S0 ist der Startzustand „Wir arbeiten schon lange mit KI“ (gemeint: einzelne Ausprobierer)
S1 Produktiver Einzelfall Mindestens ein System im Arbeitsalltag mit Owner Inventar aller Nutzung; je System: Owner, Zweckbeschreibung, Datenschutzklärung, Basisprotokollierung „Das läuft produktiv“, ohne Baseline bleibt der Nutzen Behauptung
S2 Geführtes Portfolio Alle Vorhaben in einer Liste mit gemeinsamen Regeln Portfolioliste mit Baselines, Risikoklassen, Stage-Gates; Kapazitätsgrenze als Beschluss; Review-Protokolle „Wir haben eine Roadmap“, eine Wunschliste ohne Gates ist kein Portfolio
S3 Kontrollierter Betrieb Produktive Systeme mit Kontrollen und Nachweisakte Evaluationsberichte je System; Incident-Pfad (geübt, nicht nur beschrieben); Berechtigungskonzept; Nachweisakte für Audits „Compliance ist mitgedacht“, Policies ohne Artefakte sind Papier
S4 Gesteuerte Transformation Outcomes in der Unternehmenssteuerung; Arbeit und Rollen angepasst Nutzenbelege gegen Baseline in der GF-Berichterstattung; Adoptions- und Schulungsnachweise; mindestens eine dokumentierte Abschaltung oder ein begründetes Nicht-Go-live; Lerntransfer zwischen Vorhaben „Wir sind KI-getrieben“, ohne Outcome-Bericht ist das eine Selbstbeschreibung

Drei Eigenschaften des Modells sind bewusst unbequem. Erstens: Die Stufen bauen aufeinander auf. Ein Haus mit beeindruckendem Piloten, aber ohne Inventar, steht auf S0. Der Pilot zählt erst, wenn die S1-Artefakte existieren. Zweitens: Der Übergang von S2 nach S3 ist der teuerste. Hier entstehen Evaluationsroutinen, Berechtigungskonzepte, Incident-Übungen und die Nachweisakte. Viele Häuser überspringen ihn rhetorisch und holen ihn nach dem ersten Vorfall teuer nach. Drittens: S4 verlangt eine dokumentierte Abschaltung oder ein begründetes Nicht-Go-live. Das ist kein Formalismus. Wer noch nie ein KI-Vorhaben belegt beendet hat, hat sein Steuerungssystem noch nie unter Last getestet.

Das Modell verträgt sich mit den externen Ankern, ersetzt sie aber nicht. ISO/IEC 42001 beschreibt ein KI-Managementsystem und deckt sich in weiten Teilen mit S3; Gartner führt ein fünfstufiges Reifemodell von „Planung“ bis „Führerschaft“ (2025). Der Unterschied dieses Modells liegt in der Belegpflicht: Es fragt nicht, wie sich das Haus einschätzt, sondern was es zeigen kann.

Der Selbsttest: zehn Prüffragen mit Artefaktpflicht

Der Selbsttest übersetzt das Modell in eine Übung von einem halben Tag. Jede Frage wird nur mit Ja beantwortet, wenn das geforderte Artefakt vorliegt. Acht bis zehn Ja-Antworten sprechen für S3 oder höher, fünf bis sieben für S2, darunter für S0 bis S1.

  1. Liegt ein vollständiges Inventar aller KI-Nutzung vor, aktualisiert in den letzten drei Monaten? Artefakt: Inventarliste mit Datum.
  2. Hat jedes produktive System einen benannten Owner mit Vertretungsregel? Artefakt: Ownerliste.
  3. Existiert für jedes Vorhaben eine vor dem Start gemessene Baseline? Artefakt: Baseline-Protokolle.
  4. Sind alle Vorhaben nach der Verordnung (EU) 2024/1689 risikoklassifiziert? Artefakt: Klassifizierungsvermerk je Vorhaben.
  5. Gibt es eine beschlossene Kapazitätsgrenze für parallele Vorhaben? Artefakt: GF- oder Gremiumsbeschluss.
  6. Wurde jedes produktive System in den letzten sechs Monaten evaluiert? Artefakt: Evaluationsbericht mit Testfällen.
  7. Ist der Incident-Pfad in den letzten zwölf Monaten real geübt worden? Artefakt: Übungsprotokoll mit Datum und Beteiligten.
  8. Kann das Haus binnen einer Woche eine Nachweisakte für ein beliebiges produktives System vorlegen? Artefakt: Stichprobe.
  9. Berichtet die Geschäftsführung mindestens quartalsweise über KI-Outcomes gegen Baseline? Artefakt: GF-Berichtsauszug.
  10. Gibt es mindestens eine dokumentierte Abschaltung oder ein begründetes Nicht-Go-live? Artefakt: Stopp-Protokoll mit Lernwerten.

Zwei Regeln schützen den Test vor Gefälligkeit. Die Artefakte werden von jemandem gesichtet, der sie nicht selbst erstellt hat, interne Revision, ein anderer Bereich oder ein Externer. Und das Ergebnis wird mit Datum protokolliert, damit die nächste Bewertung eine Entwicklung zeigt statt einer neuen Momentaufnahme.

Kommunikation an die Stufe binden

Der Reifegrad ist auch ein Kommunikationsrisiko. Nach außen erzeugen Transformationsclaims Erwartungen bei Kunden, Banken und Auditoren; nach innen erlebt die Belegschaft den Abstand zwischen Folie und Alltag täglich. Die Regel ist einfach: Kommuniziert wird die belegte Stufe, nicht die angestrebte. Ein Haus auf S1 spricht wahrheitsgemäß von produktivem Einzeleinsatz und konkreten Lernzielen. Das ist 2026 keine Schwäche. Laut Bitkom hält inzwischen jeder zweite Entscheider Unternehmen ohne KI für nicht zukunftsfähig (51 Prozent, 2025); der Druck, mehr zu behaupten, wächst also. Ihm nachzugeben verlagert das Problem nur: von der Marketingabteilung in das nächste Kundenaudit.

Reifegrad-Rhetorik ist ein Kredit auf die eigene Glaubwürdigkeit. Zurückgezahlt wird er beim ersten Audit, beim ersten Vorfall oder in der ersten Betriebsversammlung, mit Zinsen.

Dieselbe Disziplin gilt gegenüber der Aufsicht und in Verträgen. Wer Kunden „geprüfte KI-Prozesse“ zusichert, hat eine Bringschuld erzeugt, die mit den Dokumentationspflichten der Verordnung (EU) 2024/1689 zusätzlich justiziabel wird. Die Nachweisakte aus S3 ist deshalb kein Bürokratieprojekt, sondern die Deckung für jede externe Aussage über den eigenen KI-Einsatz.

Maßnahmen für die Geschäftsführung

Bis Tag 30:

  • Selbsttest mit den zehn Prüffragen durchführen und Ergebnis mit Datum protokollieren (Owner: CIO/KI-Leitung).
  • Inventar aller KI-Nutzung erstellen oder aktualisieren, inklusive informeller Werkzeuge (Owner: IT-Leitung).
  • Kommunikationsleitplanke beschließen: Außenaussagen nur auf Höhe der belegten Stufe (Owner: Geschäftsführung mit Kommunikation).
  • Die zwei größten Artefakt-Lücken benennen und als Aufträge vergeben (Owner: Geschäftsführung).

Bis Tag 60:

  • Für jedes produktive System Owner, Datenschutzklärung und Basisprotokollierung nachziehen, S1 vollständig machen (Owner: jeweilige Fachbereichsleitung).
  • Baselines für die zwei wichtigsten Vorhaben messen, bevor weiter investiert wird (Owner: Vorhaben-Owner).
  • Risikoklassifizierung nach der Verordnung (EU) 2024/1689 für alle Vorhaben abschließen (Owner: Compliance/Datenschutz).

Bis Tag 90:

  • Erste Incident-Übung für ein produktives System durchführen und protokollieren (Owner: Informationssicherheit).
  • Nachweisakte für ein System pilotieren und den Aufwand für den Rollout schätzen (Owner: KI-Leitung).
  • Zielstufe für die nächsten zwölf Monate beschließen, als Portfolioziel mit Budget, nicht als Slogan (Owner: Geschäftsführung).
  • Zweite Selbsttest-Runde terminieren, Sichtung durch eine nicht beteiligte Stelle (Owner: interne Revision oder Externer).

Was Führung jetzt entscheiden muss

  • Kennen wir unsere Stufe anhand von Artefakten, mit Datum und unabhängiger Sichtung?
  • Ist das Inventar vollständig, inklusive Schatten-Nutzung?
  • Haben die wichtigsten Vorhaben eine vor dem Start gemessene Baseline?
  • Welche zwei Artefakt-Lücken blockieren die nächste Stufe, und wer schließt sie bis wann?
  • Sind unsere Außenaussagen zur KI auf Höhe der belegten Stufe?
  • Können wir mindestens eine dokumentierte Abschaltung oder ein begründetes Nicht-Go-live vorweisen?
  • Ist die nächste Reifegradbewertung terminiert und einem Owner zugeordnet?

Häufige Fragen (FAQ)

Was kostet eine ehrliche Standortbestimmung des KI-Reifegrads?

Deutlich weniger als jede Fehlinvestition, die sie verhindert: Eine interne Bestandsaufnahme entlang der fünf Stufen kostet vor allem zwei bis vier Wochen Arbeitszeit für Inventar, Artefakt-Sichtung und Selbsttest, im Kern eine halbe bis eine Personenstelle für diesen Zeitraum. Externe Unterstützung ist optional und lohnt vor allem für den unbequemen Blick auf Lücken. Teuer wird nicht die Messung, sondern ihr Unterlassen: Wer seine Stufe nicht kennt, investiert in Stufe-4-Ambitionen auf Stufe-1-Fundamenten und bezahlt beides doppelt.

Was riskieren wir, wenn wir unseren Reifegrad zu hoch kommunizieren?

Eine Fallhöhe, die bei der ersten Prüfung real wird. Gegenüber Kunden und Auditoren erzeugen Transformationsclaims Erwartungen an Nachweise: Wer „KI-gestützte Prozesse“ zusichert, muss bei Audits Inventar, Evaluationen und Kontrollen zeigen können. Die Verordnung (EU) 2024/1689 verschärft das ab August 2026 für Hochrisiko-Systeme mit Dokumentations- und Aufsichtspflichten. Intern kostet Übertreibung Glaubwürdigkeit: Belegschaft und Betriebsrat erleben den Abstand zwischen Folie und Alltag täglich. Die Kommunikationsregel lautet deshalb: nie mehr als eine Stufe über dem belegbaren Stand erzählen, besser gar nicht.

Womit beginnt ein Unternehmen, das ehrlich auf Stufe 0 oder 1 steht?

Mit dem Inventar und einer einzigen sauber gemessenen Baseline, nicht mit einer Toolauswahl. Das Inventar erfasst binnen vier Wochen alle KI-Nutzung im Haus, auch die informelle. Die Baseline macht einen Prozess messbar, der wirklich schmerzt: Durchlaufzeit, Fehlerquote oder Kosten je Vorgang. Danach folgt ein einziger produktiver Anwendungsfall mit Owner, Protokollierung und geklärtem Datenschutz. Der Sprung auf Stufe 1 in drei bis sechs Monaten. Destatis nennt fehlendes Wissen als häufigsten Grund für KI-Verzicht (71 Prozent, 2024); ein erster kontrollierter Fall baut genau dieses Wissen auf.

Brauchen wir eine Zertifizierung nach ISO/IEC 42001?

Für die meisten Mittelständler ist die Norm zunächst als Strukturvorlage wertvoll, nicht als Zertifikat. ISO/IEC 42001 beschreibt ein Managementsystem für KI (Rollen, Risikoprozesse, Lebenszyklus-Kontrollen) und deckt sich stark mit den Stufen 3 und 4 des Modells. Eine Zertifizierung lohnt, wenn Kunden oder Ausschreibungen sie verlangen, was in regulierten Lieferketten zunimmt. Wer ohne diesen Außendruck zertifiziert, bezahlt Auditkosten für ein Signal, das intern auch die Selbsttest-Artefakte liefern. Erst Managementsystem leben, dann über das Zertifikat entscheiden.

Wie oft sollten wir den Reifegrad neu bewerten?

Zweimal jährlich reicht, wenn die Bewertung an Artefakten hängt und nicht an Workshops. Der Selbsttest ist bewusst so gebaut, dass er sich aus laufenden Unterlagen speist: Inventar, Gate-Protokolle, Evaluationsberichte, Incident-Übungen. Eine Neubewertung ist dann ein halber Tag Durchsicht plus eine Führungsentscheidung über die nächste Lücke. Häufiger lohnt nur bei Sondersituationen: nach einem KI-Vorfall, vor einem großen Kundenaudit oder wenn die Verordnung (EU) 2024/1689 neue Pflichten für das eigene Portfolio scharf schaltet.

Evidenz und Grenzen

Belegt sind die Verbreitungs- und Lückenzahlen: die Nutzungsquoten von Destatis (2024) und Bitkom (2025) samt ihrer unterschiedlichen Grundgesamtheiten, der MIT-NANDA-Befund zur Produktions- und Wirkungslücke (2025), die Gartner-Daten zu Reife und Betriebsdauer (2025) sowie die Fristen der Verordnung (EU) 2024/1689. Die Nutzungsstatistiken sind wegen verschiedener Erhebungsdesigns nicht direkt vergleichbar; der Beitrag nutzt sie als Beleg für die Spannbreite des Nutzungsbegriffs, nicht als Messreihe. Redaktionelle Einschätzung sind das Fünf-Stufen-Modell, die Artefaktlisten, der Selbsttest und die Schwellenwerte seiner Auswertung: Sie sind eine Führungsheuristik ohne Zertifizierungsanspruch und ohne statistische Validierung über Unternehmen hinweg. Der Beitrag ersetzt keine Rechtsberatung, keine Datenschutz-Folgenabschätzung und keine normkonforme Auditvorbereitung.

Quellen und Methodik

  1. Bitkom Research / Bitkom e. V.: „Künstliche Intelligenz 2025“, September 2025 (repräsentative Befragung von 604 Unternehmen ab 20 Beschäftigten). https://bitkom-research.de/studien/kuenstliche-intelligenz-2025 sowie Studienbericht: https://www.bitkom.org/sites/main/files/2026-02/bitkom-studienbericht-ki.pdf
  2. Statistisches Bundesamt (Destatis): Pressemitteilung Nr. 444, „Jedes fünfte Unternehmen nutzt künstliche Intelligenz“, 25. November 2024. https://www.destatis.de/DE/Presse/Pressemitteilungen/2024/11/PD24_444_52911.html
  3. MIT Project NANDA: „The GenAI Divide: State of AI in Business 2025“, Juli 2025 (über 300 ausgewertete Initiativen, 52 Interviews, 153 Befragungsantworten).
  4. Gartner: „Gartner Survey Finds 45% of Organizations With High AI Maturity Keep AI Projects Operational for at Least Three Years“, Pressemitteilung, 30. Juni 2025 (Befragung Q4 2024, 432 Teilnehmer; Gartner AI Maturity Model). https://www.gartner.com/en/newsroom/press-releases/2025-06-30-gartner-survey-finds-forty-five-percent-of-organizations-with-high-artificial-intelligence-maturity-keep-artificial-intelligence-projects-operational-for-at-least-three-years
  5. Verordnung (EU) 2024/1689 des Europäischen Parlaments und des Rates vom 13. Juni 2024 (KI-Verordnung), Amtsblatt der EU, 12. Juli 2024; Artikel 4 (KI-Kompetenz) und Anwendungsfristen nach Artikel 113.
  6. ISO/IEC 42001:2023 — Information technology, Artificial intelligence, Management system.
  7. McKinsey & Company: „The State of AI: How organizations are rewiring to capture value“, März 2025 (Governance-Verantwortung und Ergebnisbeitrag). https://www.mckinsey.com/capabilities/quantumblack/our-insights/the-state-of-ai-how-organizations-are-rewiring-to-capture-value

Methodik: Recherche und Erstfassung entstanden mit KI-Unterstützung; alle Zahlen wurden gegen die genannten Quellen geprüft und mit Herausgeber und Jahr ausgewiesen. Stufenmodell, Artefaktlisten und Selbsttest sind redaktionelle Eigenleistung und als Heuristik gekennzeichnet. Menschliche Endredaktion vor Veröffentlichung ist vorgesehen.

Änderungsprotokoll

Datum Änderung
2026-07-23 Erstfassung Launch-Korpus (Status: draft)
2026-07-23 Vollständige Neufassung: Fünf-Stufen-Modell mit Belegpflicht, Zehn-Fragen-Selbsttest, Kommunikationsregeln; Quellen extern verifiziert

Das Entscheider-Briefing

Ein Briefing pro Woche: Entscheidungsfragen, eingeordnete Zahlen und Fristen. Ihre Adresse geben wir nicht weiter.

Sie erhalten zuerst eine E-Mail mit einem Bestätigungslink. Erst nach dem Klick nehmen wir Sie auf. Abmeldung mit einem Klick in jeder Ausgabe.

Weiterführend im Themenfeld