Portfoliosteuerung für 20 KI-Vorhaben
13 Min. Lesezeit
Jetzt lesenEinzelprojekte erzeugen Aktivität, kein Ergebnis. Wer KI-Vorhaben als Portfolio führt — mit Stage-Gates, Budgettranchen und schriftlichen Abbruchregeln — steuert statt zu hoffen.
KI-Vorhaben werden steuerbar, wenn sie nach einer gemeinsamen Mechanik geführt werden: eine vollständige Liste, vier Stage-Gates mit harten Eintrittskriterien, Budget in Tranchen je Gate, eine Kapazitätsgrenze für parallele Arbeit und Abbruchkriterien, die bei Aufnahme geschrieben werden. Die Geschäftsführung setzt Rahmen und Grenze. Ein Gremium mit Entscheidungsrechten führt quartalsweise Aufnahme, Fortführung und Stopp. Wer stattdessen Einzelprojekte nebeneinander laufen lässt, reproduziert den Marktbefund: viele Piloten, wenig Produktion, kein messbarer Ergebnisbeitrag.
Die Zahlen aus 2024 und 2025 erzählen eine konsistente Geschichte. Gartner prognostizierte im Juli 2024, dass mindestens 30 Prozent aller GenAI-Projekte nach dem Proof of Concept aufgegeben werden, wegen Datenqualität, unzureichender Risikokontrollen, steigender Kosten oder unklaren Nutzens. Die Messung übertraf die Prognose: Laut S&P Global Market Intelligence brachen 2025 bereits 42 Prozent der befragten Unternehmen die Mehrzahl ihrer KI-Initiativen ab, nach 17 Prozent im Jahr davor. Im Schnitt wurden 46 Prozent der Proof of Concepts vor der Produktion verworfen (Befragung von 1.006 Unternehmen in Nordamerika und Europa).
Die schärfste Zahl liefert das MIT: In der NANDA-Studie „The GenAI Divide“ (2025) erreichten nur 5 Prozent der untersuchten unternehmensspezifischen KI-Werkzeuge die Produktion. Rund 95 Prozent der Organisationen konnten keinen messbaren Ergebnisbeitrag aus ihren GenAI-Investitionen zeigen. Deloitte ergänzt die Zeitdimension: Über zwei Drittel der befragten Führungskräfte erwarteten, dass höchstens 30 Prozent ihrer laufenden Experimente in den folgenden drei bis sechs Monaten skaliert würden (Q4-Report 2024, 2.773 Befragte).
Diese Zahlen beschreiben keinen Technologiefehler. Sie beschreiben einen Steuerungsfehler: zu viele parallele Starts, keine gemeinsame Bewertung, kein geordneter Stopp. Genau dafür gibt es ein etabliertes Instrument, Portfoliosteuerung. Sie ist in der IT- und Investitionsplanung seit Jahrzehnten Standard. Neu ist nur, dass KI-Vorhaben zusätzliche Felder brauchen: Risikoklasse nach der Verordnung (EU) 2024/1689, Evaluationsergebnisse und Adoptionsstand.
Der Unterschied zwischen Projektsammlung und Portfolio liegt in fünf Eigenschaften. Erstens: Vollständigkeit. Es gibt genau eine Liste, und sie enthält auch die inoffiziellen Vorhaben. Ein Portfolio, das nur die vorzeigbaren Initiativen kennt, priorisiert eine Minderheit. Zweitens: einheitliche Bewertung. Jedes Vorhaben wird mit denselben Feldern beschrieben, Problem, Baseline, Nutzenmechanik, Risikoklasse, Owner, Stage, Abbruchkriterium. Drittens: Knappheitslogik. Es existiert eine ausgesprochene Grenze, wie viel parallel laufen darf. Viertens: Gates statt Termine. Fortschritt wird an Eintrittskriterien gemessen, nicht an Kalenderdaten. Fünftens: Entscheidungsrhythmus. Ein Gremium mit echten Rechten tagt regelmäßig und protokolliert Aufnahme, Fortführung, Stopp.
Zwei Kategorien verdienen getrennte Führung. Use Cases erzeugen Nutzen in einem Prozess. Enabler (Identitätsmanagement, Logging, Evaluationswerkzeuge, Datenkontrakte) erzeugen selbst keinen Nutzen, entscheiden aber über Tempo und Risiko vieler Use Cases. Portfolios, die nur Use Cases listen, untersteuern systematisch: Der dritte Chatbot wird bewilligt, während das fehlende Berechtigungskonzept alle drei ausbremst. Enabler brauchen eigene Owner, eigene Fertigstellungskriterien und einen geschützten Kapazitätsanteil.
Die Portfolioliste ist der eigentliche Lackmustest der Transformation: Wer sie in einer Woche nicht vollständig vorlegen kann, führt keine KI-Strategie, sondern verwaltet Gerüchte über laufende Projekte.
Bewährt hat sich ein Modell mit vier Toren. Jedes Tor hat Eintrittskriterien, die als Artefakte vorliegen müssen, nicht als Absichtserklärung im Statusbericht. Was kein Artefakt hat, hat das Gate nicht passiert.
| Gate | Übergang | Eintrittskriterien (Artefakte) | Budgetlogik | Typischer Fehler |
|---|---|---|---|---|
| G1 | Idee → Exploration | Problembeschreibung, messbare Baseline, Nutzenhypothese, Risiko-Vorklassifizierung, benannter Owner | Kleine Tranche, fixe Laufzeit (4 bis 8 Wochen) | Exploration ohne Baseline, Erfolg bleibt unbeweisbar |
| G2 | Exploration → Pilot | Machbarkeitsbeleg auf echten Daten, Datenzugriff geklärt, Evaluationsplan, schriftliches Abbruchkriterium | Mittlere Tranche, Pilot-Scope eingefroren | Scope wächst im Pilot, Tranche wird stillschweigend überzogen |
| G3 | Pilot → Betrieb | Exit-Kriterien des Piloten erfüllt, Betriebsmodell mit Betriebsbudget, Kontrollnachweise (Berechtigungen, Protokollierung, Incident-Pfad), Adoptionsplan | Betriebsbudget separat bewilligt, jährlich erneuert | Go-live ohne Betriebsbudget, das System verwaist nach sechs Monaten |
| G4 | Betrieb → Skalierung oder Abschaltung | Nutzenbeleg gegen Baseline über mindestens ein Quartal, Reviewbeschluss | Skalierungstranche oder geordneter Rückbau | Weiterbetrieb aus Gewohnheit, ohne Nutzenbeleg |
Drei Punkte machen das Modell im Alltag scharf. Das Baseline-Kriterium an G1 ist unbequem und unverzichtbar. Wer den Ist-Zustand nicht messen kann (Durchlaufzeit, Fehlerquote, Kosten je Vorgang), kann später keinen Nutzen belegen. Gartner nennt unklaren Geschäftsnutzen ausdrücklich als einen der vier Hauptgründe für Projektabbrüche (2024). Die Baseline-Pflicht verlagert dieses Scheitern an den billigsten Punkt: vor die erste Ausgabe.
Das Abbruchkriterium an G2 wird geschrieben, solange alle noch nüchtern sind. Ein brauchbares Kriterium nennt Messwert, Schwelle und Datum: „Wenn die Extraktionsqualität bis Ende des Piloten unter 90 Prozent der definierten Testfälle bleibt, wird gestoppt oder der Scope reduziert.“ In der Krise lässt sich so ein Satz nicht mehr ehrlich verhandeln, vorher schon.
Die Betriebsbedingung an G3 adressiert das teuerste Missverständnis: dass mit dem Go-live die Arbeit endet. Tatsächlich beginnen dort Monitoring, Evaluation, Modell- und Prompt-Pflege, Support und Nachweisführung. Gartner zufolge halten Organisationen mit hoher KI-Reife 45 Prozent ihrer Systeme drei Jahre oder länger produktiv, bei niedriger Reife nur 20 Prozent (2025). Der Unterschied liegt selten am Modell, er liegt am Betriebsmodell.
Die klassische Jahresbudgetierung passt schlecht zu KI-Vorhaben, weil sie Unsicherheit falsch bepreist. Wer einem Projekt im Januar das Jahresbudget bewilligt, hat im März kein Druckmittel mehr. Das Geld ist zugesagt, der Sunk-Cost-Reflex übernimmt. Tranchierung dreht die Logik um: Jedes Gate schaltet die nächste Tranche frei, und nur die.
Praktisch heißt das: Die Explorationstranche ist klein und zeitlich begrenzt. Sie kauft eine Antwort auf eine Frage, kein Produkt. Die Pilottranche ist an den eingefrorenen Scope gebunden; wächst der Scope, muss das Gremium neu entscheiden. Die Betriebstranche wird separat und jährlich bewilligt, mit dem Nutzenbeleg als Erneuerungsbedingung. Diese Struktur begrenzt den maximalen Schaden je Irrtum auf die laufende Tranche. Bei den von S&P Global gemessenen Verwurfquoten von 46 Prozent der Proof of Concepts (2025) ist das keine Vorsicht, sondern Arithmetik.
Ein Nebeneffekt ist unbezahlbar: Tranchierung erzeugt automatisch die Stopp-Gelegenheiten, die Jahresbudgets systematisch vermeiden. Jede Tranchenentscheidung ist ein legitimer, gesichtswahrender Ausstiegspunkt. Niemand muss ein Scheitern erklären. Das Gremium hat schlicht die nächste Tranche nicht freigegeben.
Die Kapazitätsgrenze beantwortet eine einfache Frage: Wie viele Vorhaben verträgt das Haus gleichzeitig, gemessen an Integrationsstunden, Betriebskapazität und Veränderungsbandbreite der betroffenen Teams? Die ehrliche Antwort liegt fast immer unter der Wunschliste. Eine brauchbare Startregel für 250 bis 2.000 Beschäftigte: höchstens so viele parallele Piloten, wie es benannte Owner mit realer Zeitfreistellung gibt, und kein neuer Pilot, solange ein produktives System ohne funktionierenden Betriebsprozess läuft.
Ein Portfolio, das ein Jahr lang keinen einzigen Stopp produziert, ist kein Beweis für gute Auswahl. Es ist ein Beweis dafür, dass niemand hinschaut, oder dass niemand widersprechen darf.
Abbruchregeln brauchen drei Eigenschaften. Sie sind schriftlich und bei Aufnahme fixiert. Sie sind messbar, Wert, Schwelle, Datum. Und sie sind folgenreich: Ein gerissenes Kriterium erzwingt eine dokumentierte Entscheidung zwischen Stopp, Scope-Reduktion und begründeter Ausnahme. Die Ausnahme ist erlaubt, aber sie kostet: Sie muss vom Gremium beschlossen und protokolliert werden. So bleibt der Ausnahmefall die Ausnahme.
Der Umgang mit gestoppten Vorhaben entscheidet über die Kultur des Portfolios. Ein Stopp nach Gate 1 oder 2 ist ein günstiger Erkenntnisgewinn. Die Alternative wäre derselbe Befund nach dem Zehnfachen an Ausgaben gewesen. Wer Stopps als Karriererisiko behandelt, bekommt keine Stopps mehr, sondern Zombie-Projekte: Vorhaben, die niemand mehr verteidigt, aber auch niemand beerdigt. Sie binden genau die Kapazität, die den aussichtsreichen Vorhaben fehlt.
Portfoliosteuerung lebt vom Rhythmus, nicht vom Dokument. Bewährt hat sich eine doppelte Kadenz: monatlich operativ (Gate-Entscheidungen, Tranchenfreigaben, Eskalationen), quartalsweise strategisch mit der Geschäftsführung (Kapazitätsgrenze, Gewichtung, Portfoliobalance, Stopps). Das Quartalsreview arbeitet mit drei Unterlagen: der vollständigen Liste, der Kapazitätsauslastung und den Top-Risiken. Toolvergleiche und Demos gehören nicht hinein.
Vier Kennzahlen genügen für den Anfang. Erstens der Anteil der Vorhaben mit Baseline und Abbruchkriterium, er misst die Disziplin des Portfolios selbst. Zweitens die Durchlaufzeit je Gate, sie zeigt, wo das Portfolio staut. Drittens der Anteil produktiver Systeme mit aktuellem Nutzenbeleg, er trennt Betrieb von Weiterbetrieb aus Gewohnheit. Viertens die Zahl der Stopps mit dokumentiertem Lernwert, sie misst, ob die Abbruchmechanik lebt. Wer zusätzlich Führungsverantwortung sichtbar machen will, findet bei McKinsey den Anlass: Die aktive Aufsicht der Unternehmensführung über KI-Governance gehört zu den Elementen mit der stärksten Korrelation zum berichteten Ergebnisbeitrag (2025).
Bis Tag 30:
Bis Tag 60:
Bis Tag 90:
Es gibt keine seriöse Pauschale, aber eine seriöse Struktur: Budget wird pro Stage-Gate in Tranchen vergeben, nicht als Jahresbetrag pro Projekt. Eine Exploration kostet typischerweise einen niedrigen fünfstelligen Betrag, ein Pilot mit Integration deutlich mehr, der Betrieb noch einmal so viel pro Jahr. Gartner nennt für große GenAI-Vorhaben Spannen von 5 bis 20 Millionen US-Dollar (2024), im Mittelstand kleiner, aber mit derselben Warnung: Die Betriebskosten übersteigen die Pilotkosten regelmäßig. Wer nur den Piloten budgetiert, hat nicht budgetiert.
Nein, gefährlich ist die Abbruchquote null. Gartner prognostizierte, dass mindestens 30 Prozent der GenAI-Projekte nach dem Proof of Concept eingestellt werden (2024); S&P Global maß 2025, dass Unternehmen im Schnitt 46 Prozent ihrer Proof of Concepts verwerfen. Ein früher, geordneter Stopp nach Gate 1 kostet einen Bruchteil eines gescheiterten Produktivsystems. Schlechtes Management zeigt sich nicht am Stopp, sondern am späten Stopp: wenn ein Vorhaben zwei Quartale ohne Baseline-Verbesserung weiterlief, weil niemand die Abbruchfrage stellen wollte.
Mit einer einzigen vollständigen Liste aller Vorhaben, inklusive der inoffiziellen. Je Vorhaben genügen zehn Felder: Problem, Baseline, erwarteter Nutzen, Owner, Stage, Risikoklasse, Datenabhängigkeit, Integrationsaufwand, nächstes Gate, Abbruchkriterium. Diese Liste entsteht in zwei bis vier Wochen und erzwingt die ersten ehrlichen Gespräche, weil Lücken sichtbar werden. Danach setzt die Geschäftsführung die Kapazitätsgrenze, und das erste Portfolioreview entscheidet über Fortführung, Zusammenlegung oder Stopp jedes einzelnen Eintrags.
Das Gremium braucht Entscheidungsrechte, sonst ist es ein Jour fixe: Geschäftsführung oder ein benannter Delegierter mit Budgetvollmacht, IT- oder KI-Leitung, eine Fachbereichsstimme im Rotationsprinzip, Datenschutz und Informationssicherheit anlassbezogen. Entscheiden sollte das Gremium per dokumentiertem Beschluss über Aufnahme, Gate-Wechsel, Tranchenfreigabe und Stopp. Die Geschäftsführung behält zwei Dinge bei sich: die Kapazitätsgrenze und die strategische Gewichtung der Bewertungskriterien. McKinsey zufolge korreliert aktive Führungsverantwortung für KI-Governance messbar mit dem Ergebnisbeitrag (2025).
Mit dem Produktivgang wird aus einem Experiment ein betriebenes System mit Pflichten. Nach der Verordnung (EU) 2024/1689 gelten für Hochrisiko-Systeme im Wesentlichen ab dem 2. August 2026 Anforderungen an Risikomanagement, Dokumentation, Protokollierung und menschliche Aufsicht; Transparenzpflichten und die KI-Kompetenzpflicht nach Artikel 4 greifen früher. Dazu kommen DSGVO-Pflichten, gegebenenfalls Mitbestimmung und vertragliche Zusagen gegenüber Kunden. Genau deshalb gehört die Risikoklassifizierung an Gate 1, nicht erst an den Go-live, wo sie Nachrüstkosten und Verzögerung erzeugt.
Belegt sind die Markt- und Abbruchzahlen: die Gartner-Prognose zu GenAI-Abbrüchen und die Kostenspannen (2024), die S&P-Global-Messung zu Initiativ-Abbrüchen und verworfenen Proof of Concepts (2025), der MIT-NANDA-Befund zum ausbleibenden Ergebnisbeitrag (2025), die Deloitte-Skalierungserwartungen (Q4 2024), die McKinsey-Korrelation von Governance-Verantwortung und Ergebnisbeitrag (2025) sowie die Fristen der Verordnung (EU) 2024/1689. Die Befragungen unterscheiden sich in Grundgesamtheit und Definitionen; die Quoten sind daher als konsistentes Muster zu lesen, nicht als exakt vergleichbare Messreihe. Redaktionelle Einschätzung sind das Vier-Gate-Modell, die Tranchenlogik, die Startregel zur Kapazitätsgrenze und die Kennzahlenauswahl. Der Beitrag ersetzt keine Rechtsberatung und liefert keine branchenspezifischen Renditezusagen.
Methodik: Recherche und Erstfassung entstanden mit KI-Unterstützung; alle Zahlenangaben wurden gegen die genannten Quellen geprüft und mit Herausgeber und Jahr ausgewiesen. Gate-Modell, Tranchenlogik und Kennzahlen sind redaktionelle Eigenleistung. Menschliche Endredaktion vor Veröffentlichung ist vorgesehen.
| Datum | Änderung |
|---|---|
| 2026-07-23 | Erstfassung Launch-Korpus (Status: draft) |
| 2026-07-23 | Vollständige Neufassung: Stage-Gate-Tabelle, Tranchen-Budgetlogik, Abbruchregeln, Kennzahlen; Quellen extern verifiziert |
Ein Briefing pro Woche: Entscheidungsfragen, eingeordnete Zahlen und Fristen. Ihre Adresse geben wir nicht weiter.
13 Min. Lesezeit
Jetzt lesen13 Min. Lesezeit
Jetzt lesen13 Min. Lesezeit
Jetzt lesen