Portfoliosteuerung für 20 KI-Vorhaben
13 Min. Lesezeit
Jetzt lesen36 Prozent der deutschen Unternehmen „nutzen KI“ — doch Nutzung sagt nichts über Reife. Fünf Stufen mit Belegpflicht trennen Experiment, Betrieb und echte Transformation.
Transformation liegt vor, wenn KI-Vorhaben an Unternehmenszielen ausgerichtet, als Portfolio geführt, kontrolliert betrieben und in messbaren Outcomes gesteuert werden. Verteilte Lizenzen und einzelne Piloten sind Vorstufen. Prüfbar wird der Unterschied durch ein fünfstufiges Modell, bei dem jede Stufe an Artefakten hängt: Inventar, Baselines, Evaluationsnachweise, Incident-Pfad, dokumentierte Abschaltungen. Die eigene Stufe bestimmt, was ein Externer in einer Woche an Belegen einsehen könnte — nicht, was das Strategiedeck behauptet.
Zwei amtliche und verbandliche Zahlen zeigen, wie dehnbar der Begriff geworden ist. Das Statistische Bundesamt zählte für 2024 ein Fünftel der Unternehmen ab zehn Beschäftigten als KI-Nutzer, nach 12 Prozent im Vorjahr (Destatis 2024). Bitkom kam 2025 mit anderer Grundgesamtheit auf 36 Prozent, fast eine Verdopplung gegenüber 2024 (Bitkom Research 2025, 604 Unternehmen ab 20 Beschäftigten). Beide Erhebungen zählen als Nutzung bereits das erste eingesetzte Werkzeug. Zwischen „ein Team nutzt einen Assistenten“ und „das Unternehmen steuert Wertschöpfung mit KI“ liegen Welten, in der Statistik fallen beide in dieselbe Zelle.
Wie groß die Lücke ist, zeigt das MIT: In der NANDA-Untersuchung „The GenAI Divide“ hatten über 80 Prozent der Organisationen Werkzeuge wie ChatGPT oder Copilot erprobt, aber nur 5 Prozent der unternehmensspezifischen KI-Lösungen erreichten die Produktion; rund 95 Prozent der Organisationen konnten keinen messbaren Ergebnisbeitrag zeigen (2025). Gartner misst dieselbe Spreizung als Reifegefälle: Organisationen mit hoher KI-Reife halten 45 Prozent ihrer Systeme drei Jahre und länger produktiv, bei niedriger Reife sind es 20 Prozent (2025).
Für die Führung ist das keine akademische Frage. Ohne belegbare Standortbestimmung fließt Budget in Ambitionen, deren Fundament fehlt. Und mit den Pflichten der Verordnung (EU) 2024/1689, KI-Kompetenz nach Artikel 4 seit Februar 2025, Hochrisiko-Anforderungen im Wesentlichen ab August 2026, wird aus der Reifelücke eine Compliance-Lücke.
Nutzungsquoten sind Verbreitungsmaße. Sie beantworten die Frage, ob irgendwo im Haus ein KI-Werkzeug läuft, nicht, ob jemand dessen Qualität misst, dessen Risiken kontrolliert oder dessen Nutzen belegt. Ein Unternehmen kann in jeder Abteilung Assistenten einsetzen und trotzdem auf der untersten Reifestufe stehen: ohne Inventar, ohne Baseline, ohne Evaluationspfad, ohne einen einzigen dokumentierten Nutzenbeleg.
Die Verwechslung hat einen Verstärker: Schatten-Nutzung. Beschäftigte verwenden private KI-Konten für dienstliche Aufgaben, während die offizielle Statistik des Hauses „keine KI-Nutzung“ meldet, oder umgekehrt meldet das Haus Nutzung, die in Wahrheit aus unkontrollierten Einzelinitiativen besteht. Beides verzerrt das Lagebild in dieselbe Richtung: Die Führung weiß nicht, was läuft. Genau hier setzt ein Reifegradmodell an. Es ersetzt die Frage „Nutzen wir KI?“ durch die Frage „Was können wir belegen?“.
Die ehrlichste Kennzahl der KI-Reife ist nicht die Zahl der Piloten, sondern die Antwortzeit auf eine einfache Frage: Wie viele KI-Systeme laufen bei uns produktiv, wer verantwortet sie, und wann wurden sie zuletzt evaluiert? Wer dafür länger als eine Woche braucht, steht auf Stufe 1, egal, was die Strategiefolien sagen.
Das Modell unterscheidet fünf Stufen. Entscheidend ist die dritte Spalte: Jede Stufe gilt erst als erreicht, wenn die genannten Artefakte vorliegen und einem Dritten gezeigt werden könnten. Die vierte Spalte benennt den typischen Selbstbetrug. Die Erzählung, mit der Häuser sich eine Stufe höher reden, als die Belege tragen.
| Stufe | Zustand | Pflicht-Artefakte (prüfbar) | Typischer Selbstbetrug |
|---|---|---|---|
| S0 Experiment | Einzelne Tests, teils privat initiiert; kein Betriebsversprechen | Keine, S0 ist der Startzustand | „Wir arbeiten schon lange mit KI“ (gemeint: einzelne Ausprobierer) |
| S1 Produktiver Einzelfall | Mindestens ein System im Arbeitsalltag mit Owner | Inventar aller Nutzung; je System: Owner, Zweckbeschreibung, Datenschutzklärung, Basisprotokollierung | „Das läuft produktiv“, ohne Baseline bleibt der Nutzen Behauptung |
| S2 Geführtes Portfolio | Alle Vorhaben in einer Liste mit gemeinsamen Regeln | Portfolioliste mit Baselines, Risikoklassen, Stage-Gates; Kapazitätsgrenze als Beschluss; Review-Protokolle | „Wir haben eine Roadmap“, eine Wunschliste ohne Gates ist kein Portfolio |
| S3 Kontrollierter Betrieb | Produktive Systeme mit Kontrollen und Nachweisakte | Evaluationsberichte je System; Incident-Pfad (geübt, nicht nur beschrieben); Berechtigungskonzept; Nachweisakte für Audits | „Compliance ist mitgedacht“, Policies ohne Artefakte sind Papier |
| S4 Gesteuerte Transformation | Outcomes in der Unternehmenssteuerung; Arbeit und Rollen angepasst | Nutzenbelege gegen Baseline in der GF-Berichterstattung; Adoptions- und Schulungsnachweise; mindestens eine dokumentierte Abschaltung oder ein begründetes Nicht-Go-live; Lerntransfer zwischen Vorhaben | „Wir sind KI-getrieben“, ohne Outcome-Bericht ist das eine Selbstbeschreibung |
Drei Eigenschaften des Modells sind bewusst unbequem. Erstens: Die Stufen bauen aufeinander auf. Ein Haus mit beeindruckendem Piloten, aber ohne Inventar, steht auf S0. Der Pilot zählt erst, wenn die S1-Artefakte existieren. Zweitens: Der Übergang von S2 nach S3 ist der teuerste. Hier entstehen Evaluationsroutinen, Berechtigungskonzepte, Incident-Übungen und die Nachweisakte. Viele Häuser überspringen ihn rhetorisch und holen ihn nach dem ersten Vorfall teuer nach. Drittens: S4 verlangt eine dokumentierte Abschaltung oder ein begründetes Nicht-Go-live. Das ist kein Formalismus. Wer noch nie ein KI-Vorhaben belegt beendet hat, hat sein Steuerungssystem noch nie unter Last getestet.
Das Modell verträgt sich mit den externen Ankern, ersetzt sie aber nicht. ISO/IEC 42001 beschreibt ein KI-Managementsystem und deckt sich in weiten Teilen mit S3; Gartner führt ein fünfstufiges Reifemodell von „Planung“ bis „Führerschaft“ (2025). Der Unterschied dieses Modells liegt in der Belegpflicht: Es fragt nicht, wie sich das Haus einschätzt, sondern was es zeigen kann.
Der Selbsttest übersetzt das Modell in eine Übung von einem halben Tag. Jede Frage wird nur mit Ja beantwortet, wenn das geforderte Artefakt vorliegt. Acht bis zehn Ja-Antworten sprechen für S3 oder höher, fünf bis sieben für S2, darunter für S0 bis S1.
Zwei Regeln schützen den Test vor Gefälligkeit. Die Artefakte werden von jemandem gesichtet, der sie nicht selbst erstellt hat, interne Revision, ein anderer Bereich oder ein Externer. Und das Ergebnis wird mit Datum protokolliert, damit die nächste Bewertung eine Entwicklung zeigt statt einer neuen Momentaufnahme.
Der Reifegrad ist auch ein Kommunikationsrisiko. Nach außen erzeugen Transformationsclaims Erwartungen bei Kunden, Banken und Auditoren; nach innen erlebt die Belegschaft den Abstand zwischen Folie und Alltag täglich. Die Regel ist einfach: Kommuniziert wird die belegte Stufe, nicht die angestrebte. Ein Haus auf S1 spricht wahrheitsgemäß von produktivem Einzeleinsatz und konkreten Lernzielen. Das ist 2026 keine Schwäche. Laut Bitkom hält inzwischen jeder zweite Entscheider Unternehmen ohne KI für nicht zukunftsfähig (51 Prozent, 2025); der Druck, mehr zu behaupten, wächst also. Ihm nachzugeben verlagert das Problem nur: von der Marketingabteilung in das nächste Kundenaudit.
Reifegrad-Rhetorik ist ein Kredit auf die eigene Glaubwürdigkeit. Zurückgezahlt wird er beim ersten Audit, beim ersten Vorfall oder in der ersten Betriebsversammlung, mit Zinsen.
Dieselbe Disziplin gilt gegenüber der Aufsicht und in Verträgen. Wer Kunden „geprüfte KI-Prozesse“ zusichert, hat eine Bringschuld erzeugt, die mit den Dokumentationspflichten der Verordnung (EU) 2024/1689 zusätzlich justiziabel wird. Die Nachweisakte aus S3 ist deshalb kein Bürokratieprojekt, sondern die Deckung für jede externe Aussage über den eigenen KI-Einsatz.
Bis Tag 30:
Bis Tag 60:
Bis Tag 90:
Deutlich weniger als jede Fehlinvestition, die sie verhindert: Eine interne Bestandsaufnahme entlang der fünf Stufen kostet vor allem zwei bis vier Wochen Arbeitszeit für Inventar, Artefakt-Sichtung und Selbsttest, im Kern eine halbe bis eine Personenstelle für diesen Zeitraum. Externe Unterstützung ist optional und lohnt vor allem für den unbequemen Blick auf Lücken. Teuer wird nicht die Messung, sondern ihr Unterlassen: Wer seine Stufe nicht kennt, investiert in Stufe-4-Ambitionen auf Stufe-1-Fundamenten und bezahlt beides doppelt.
Eine Fallhöhe, die bei der ersten Prüfung real wird. Gegenüber Kunden und Auditoren erzeugen Transformationsclaims Erwartungen an Nachweise: Wer „KI-gestützte Prozesse“ zusichert, muss bei Audits Inventar, Evaluationen und Kontrollen zeigen können. Die Verordnung (EU) 2024/1689 verschärft das ab August 2026 für Hochrisiko-Systeme mit Dokumentations- und Aufsichtspflichten. Intern kostet Übertreibung Glaubwürdigkeit: Belegschaft und Betriebsrat erleben den Abstand zwischen Folie und Alltag täglich. Die Kommunikationsregel lautet deshalb: nie mehr als eine Stufe über dem belegbaren Stand erzählen, besser gar nicht.
Mit dem Inventar und einer einzigen sauber gemessenen Baseline, nicht mit einer Toolauswahl. Das Inventar erfasst binnen vier Wochen alle KI-Nutzung im Haus, auch die informelle. Die Baseline macht einen Prozess messbar, der wirklich schmerzt: Durchlaufzeit, Fehlerquote oder Kosten je Vorgang. Danach folgt ein einziger produktiver Anwendungsfall mit Owner, Protokollierung und geklärtem Datenschutz. Der Sprung auf Stufe 1 in drei bis sechs Monaten. Destatis nennt fehlendes Wissen als häufigsten Grund für KI-Verzicht (71 Prozent, 2024); ein erster kontrollierter Fall baut genau dieses Wissen auf.
Für die meisten Mittelständler ist die Norm zunächst als Strukturvorlage wertvoll, nicht als Zertifikat. ISO/IEC 42001 beschreibt ein Managementsystem für KI (Rollen, Risikoprozesse, Lebenszyklus-Kontrollen) und deckt sich stark mit den Stufen 3 und 4 des Modells. Eine Zertifizierung lohnt, wenn Kunden oder Ausschreibungen sie verlangen, was in regulierten Lieferketten zunimmt. Wer ohne diesen Außendruck zertifiziert, bezahlt Auditkosten für ein Signal, das intern auch die Selbsttest-Artefakte liefern. Erst Managementsystem leben, dann über das Zertifikat entscheiden.
Zweimal jährlich reicht, wenn die Bewertung an Artefakten hängt und nicht an Workshops. Der Selbsttest ist bewusst so gebaut, dass er sich aus laufenden Unterlagen speist: Inventar, Gate-Protokolle, Evaluationsberichte, Incident-Übungen. Eine Neubewertung ist dann ein halber Tag Durchsicht plus eine Führungsentscheidung über die nächste Lücke. Häufiger lohnt nur bei Sondersituationen: nach einem KI-Vorfall, vor einem großen Kundenaudit oder wenn die Verordnung (EU) 2024/1689 neue Pflichten für das eigene Portfolio scharf schaltet.
Belegt sind die Verbreitungs- und Lückenzahlen: die Nutzungsquoten von Destatis (2024) und Bitkom (2025) samt ihrer unterschiedlichen Grundgesamtheiten, der MIT-NANDA-Befund zur Produktions- und Wirkungslücke (2025), die Gartner-Daten zu Reife und Betriebsdauer (2025) sowie die Fristen der Verordnung (EU) 2024/1689. Die Nutzungsstatistiken sind wegen verschiedener Erhebungsdesigns nicht direkt vergleichbar; der Beitrag nutzt sie als Beleg für die Spannbreite des Nutzungsbegriffs, nicht als Messreihe. Redaktionelle Einschätzung sind das Fünf-Stufen-Modell, die Artefaktlisten, der Selbsttest und die Schwellenwerte seiner Auswertung: Sie sind eine Führungsheuristik ohne Zertifizierungsanspruch und ohne statistische Validierung über Unternehmen hinweg. Der Beitrag ersetzt keine Rechtsberatung, keine Datenschutz-Folgenabschätzung und keine normkonforme Auditvorbereitung.
Methodik: Recherche und Erstfassung entstanden mit KI-Unterstützung; alle Zahlen wurden gegen die genannten Quellen geprüft und mit Herausgeber und Jahr ausgewiesen. Stufenmodell, Artefaktlisten und Selbsttest sind redaktionelle Eigenleistung und als Heuristik gekennzeichnet. Menschliche Endredaktion vor Veröffentlichung ist vorgesehen.
| Datum | Änderung |
|---|---|
| 2026-07-23 | Erstfassung Launch-Korpus (Status: draft) |
| 2026-07-23 | Vollständige Neufassung: Fünf-Stufen-Modell mit Belegpflicht, Zehn-Fragen-Selbsttest, Kommunikationsregeln; Quellen extern verifiziert |
Ein Briefing pro Woche: Entscheidungsfragen, eingeordnete Zahlen und Fristen. Ihre Adresse geben wir nicht weiter.
13 Min. Lesezeit
Jetzt lesen13 Min. Lesezeit
Jetzt lesen13 Min. Lesezeit
Jetzt lesen