Wirtschaftlichkeit von KI belastbar steuern
13 Min. Lesezeit
Jetzt lesenPunktprognosen erzeugen bei KI-Vorhaben Scheingenauigkeit. Ein belastbarer Case rechnet Base und Downside getrennt durch und fixiert Abbruchkriterien mit Messgröße und Datum vor der Freigabe.
Ein KI-Business-Case wird nicht durch mehr Nachkommastellen belastbar, sondern durch drei Bausteine. Erstens ein Base Case, der nur Nutzen mit benanntem Realisierungsmechanismus enthält. Zweitens ein Downside, der konkrete Annahmebrüche durchrechnet statt pauschale Abschläge zu nehmen. Drittens Abbruchkriterien mit Messgröße und Datum, die Teil der Freigabe sind. Freigegeben wird nur, wenn die Geschäftsführung den Verlust im Downside bewusst trägt. Nach dem Start wird der Case quartalsweise gegen Ist-Werte geführt.
Die Abbruchzahlen sind inzwischen gut belegt. Gartner prognostizierte im Juli 2024, dass mindestens 30 Prozent der GenAI-Projekte nach dem Proof of Concept aufgegeben werden, unter anderem wegen eskalierender Kosten und unklarem Geschäftswert. Eine Befragung von S&P Global Market Intelligence unter gut 1.000 Unternehmen ergab 2025, dass 42 Prozent die Mehrheit ihrer KI-Initiativen abgebrochen haben, nach 17 Prozent im Vorjahr. Das MIT-Projekt NANDA kam 2025 zu dem Ergebnis, dass 95 Prozent der untersuchten GenAI-Piloten keinen messbaren Beitrag zur Gewinn- und Verlustrechnung leisten.
Diese Zahlen beschreiben keinen Technologiedefekt. Sie beschreiben eine Freigabepraxis, die Unsicherheit nicht rechnet, sondern wegrundet. Für Geschäftsführung und Controlling im Mittelstand folgt daraus eine präzise Frage: Welche Annahmen müssen halten, damit das Vorhaben trägt, und was passiert verbindlich, wenn sie brechen?
Eine klassische IT-Investition hat eine dominante Unsicherheit: das Projekt selbst. Läuft die Einführung, sind die Betriebskosten weitgehend planbar. KI-Vorhaben tragen drei Unsicherheiten gleichzeitig, und sie multiplizieren sich.
Die erste ist die Modellqualität im eigenen Kontext. Ein Sprachmodell, das im Anbieterdemo überzeugt, kann an den eigenen Dokumenten, Fachbegriffen und Sonderfällen deutlich schwächer arbeiten. Das zeigt sich erst in der Evaluation, also im strukturierten Test gegen echte Fälle.
Die zweite ist die Adoption, also die tatsächliche Nutzung durch die Zielgruppe. Ein Werkzeug, das nur ein Drittel der vorgesehenen Anwender regelmäßig einsetzt, liefert nur ein Drittel des gerechneten Nutzens. Die Kosten laufen trotzdem weiter.
Die dritte ist die Kostenseite selbst. Viele KI-Dienste rechnen nutzungsabhängig ab, oft je verarbeiteter Texteinheit (Token). Erfolg treibt hier die Rechnung. Gartner warnte im Oktober 2024, dass Unternehmen ihre GenAI-Kosten um 500 bis 1.000 Prozent falsch einschätzen können, wenn sie die Skalierungslogik nicht verstehen. Mehr als 90 Prozent der befragten CIOs nannten Kostenmanagement als begrenzenden Faktor für den Wertbeitrag.
Dazu kommt eine Messlücke: Laut Deloitte (2024) konnten 41 Prozent der befragten Organisationen Wirkung und Wert ihrer GenAI-Initiativen nicht sauber definieren und messen. Nur 16 Prozent berichteten dem CFO regelmäßig über den geschaffenen Wert. Eine Punktprognose in dieser Lage ist keine Prognose. Sie ist eine Verhandlungszahl.
Der belastbare Case ersetzt die eine Zahl durch drei Bausteine mit klaren Regeln.
Der Base Case enthält nur Nutzen mit Realisierungsmechanismus. Für jeden Effekt werden vier Dinge benannt: die heutige Baseline, die Messgröße, die Zurechnung zum Vorhaben und der Weg, auf dem aus dem Effekt Geld wird. Gesparte Minuten qualifizieren sich nur über Umwidmung der Kapazität, höheren Durchsatz, geringere Fehlerkosten oder ersetzte Fremdleistung. Auf der Kostenseite stehen die vollen Betriebskosten: Lizenzen, nutzungsabhängige Kosten, Monitoring, Modellpflege, Zweitprüfung, Schulung.
Der Downside ist kein Prozentabschlag, sondern eine Rechnung mit gebrochenen Annahmen. Typische Brüche: Die Adoption erreicht nur die Hälfte des Plans. Die menschliche Zweitprüfung bleibt dauerhaft, weil die Fehlerquote nicht sinkt. Die nutzungsabhängigen Kosten steigen schneller als der realisierte Nutzen. Die Integration verschiebt sich um zwei Quartale. Jeder Bruch wird einzeln beziffert, dann werden die plausiblen Kombinationen gerechnet.
Ein Business-Case ohne Abbruchkriterium ist kein Plan. Er ist eine Hoffnung mit Tabellenkalkulation.
Die Abbruchlogik verbindet beide Szenarien mit der Zeitachse. Sie legt fest, welcher Messwert zu welchem Datum welche Entscheidung auslöst: stoppen, verkleinern, umbauen oder skalieren. Damit wird die Freigabe zu dem, was sie unter Unsicherheit sein muss: der Kauf einer begrenzten, bewusst bezifferten Lernoption statt eines unbegrenzten Versprechens.
Die folgende Modellrechnung der Redaktion ist bewusst vereinfacht und illustrativ. Sie zeigt die Methode, nicht Branchenbenchmarks. Angenommen wird ein Maschinenbauer mit 800 Beschäftigten. Das Vorhaben: eine KI-Assistenz für Angebots- und Dokumentationstexte im Vertriebsinnendienst mit 40 vorgesehenen Nutzern. Einmalkosten für Integration, Datenaufbereitung, Evaluationsaufbau und Schulung: 180.000 Euro.
Im Base Case sinkt die Bearbeitungszeit je Angebot von 6,0 auf 4,5 Stunden. Bei 1.500 Angeboten im Jahr werden 2.250 Stunden frei. Als realisierbar gelten davon 60 Prozent, weil Umwidmung nie verlustfrei gelingt. Bewertet mit 90 Euro Vollkosten je Stunde und ergänzt um 30.000 Euro ersetzte externe Dokumentationsleistung ergibt das rund 151.500 Euro Jahresnutzen. Im Downside halbiert sich die Adoption, die Fremdvergabe bleibt bestehen, und die Zweitprüfung wird dauerhaft.
| Größe | Base Case | Downside |
|---|---|---|
| Aktive Nutzung der Zielgruppe | 70 Prozent | 35 Prozent |
| Zeit je Angebot | 4,5 statt 6,0 Stunden | 5,25 statt 6,0 Stunden |
| Realisierte Stunden pro Jahr | 1.350 | 675 |
| Bewerteter Nutzen pro Jahr | 151.500 Euro | 60.750 Euro |
| Laufende Kosten pro Jahr | 90.000 Euro | 110.000 Euro |
| Jahresergebnis ab Jahr 1 | +61.500 Euro | −49.250 Euro |
| Kumuliert Ende Jahr 3 (inkl. 180.000 Euro Invest) | +4.500 Euro | −327.750 Euro |
Die Lektüre dieser Tabelle ist unbequem und genau deshalb wertvoll. Der Base Case trägt sich erst im dritten Jahr. Der Downside kostet ohne Abbruchregel über 320.000 Euro. Mit einem Stopp nach zwölf Monaten bleibt der Maximalverlust bei rund 229.000 Euro begrenzt. Die Freigabefrage lautet damit nicht mehr „Glauben wir an die Rendite?“, sondern: Akzeptieren wir 229.000 Euro als Preis für die Klärung, und reichen uns zwölf Monate dafür?
Der Downside ist die einzige Zahl im Case, die die Geschäftsführung wirklich unterschreibt. Alles andere ist Absicht.
Abbruchkriterien wirken nur, wenn sie vor der Freigabe fixiert und personell hinterlegt sind. Für das Beispiel oben könnten sie so aussehen: Erstens, aktive Nutzung unter 40 Prozent der Zielgruppe in Monat 4 und erneut in Monat 6. Zweitens, Korrekturquote der KI-Entwürfe über 25 Prozent nach Ablauf einer Nachbesserungsfrist bis Monat 6. Drittens, Vollkosten je Angebot über dem Altprozess in zwei aufeinanderfolgenden Monaten. Viertens, kein belegter Realisierungsmechanismus bis Monat 9, also keine nachweisbare Umwidmung, kein Mehrdurchsatz, keine reduzierte Fremdvergabe.
Am Messpunkt Monat 6 entsteht daraus ein einfacher Entscheidungsbaum. Liegt die Nutzung bei mindestens 60 Prozent und die Korrekturquote unter 15 Prozent, wird skaliert. Liegt die Nutzung zwischen 40 und 60 Prozent oder die Korrekturquote zwischen 15 und 25 Prozent, folgt ein Redesign mit 90 Tagen Frist und genau einem weiteren Messpunkt. Danach wird binär entschieden. Unterschreitet die Nutzung 40 Prozent oder überschreitet die Korrekturquote 25 Prozent, wird gestoppt. Kein drittes Nachfassen, keine neue Story.
Wichtig ist die Gegenrichtung: Abbruchkriterien sind kein Misstrauensvotum gegen das Team. Sie schützen es. Wer vorab weiß, welcher Messwert den Stopp auslöst, kann nach dem Stopp ohne Schuldzuweisung weiterarbeiten. Die Gartner-Analyse von 2024 nennt unklaren Geschäftswert als einen der Hauptgründe für Projektabbrüche. Ein Abbruch nach Regel ist das Gegenteil davon: Er ist der Beleg, dass der Geschäftswert ernsthaft geprüft wurde.
Nach der Freigabe stirbt der Case gern in der Ablage. Dagegen hilft ein fester Rhythmus. Monatlich laufen die operativen Signale auf: Nutzung, Korrekturquote, nutzungsabhängige Kosten. Quartalsweise wird der Ergebnisbeitrag gegen Base und Downside gestellt, mit Stoppentscheid als expliziten Tagesordnungspunkt. Neue Kennzahlen werden zwischen den Terminen nicht erfunden. Stabile Messgrößen sind selbst ein Wert, weil sie Trends sichtbar machen.
Die Wertlogik muss dabei an das bestehende Controlling anschließen: Baseline, Plan, Ist, Abweichung, Maßnahme. Eine KI-Sonderrechnung, die niemand ins Berichtswesen übernimmt, wird in der Freigabe geduldet und im Betrieb ignoriert. Der McKinsey-Befund von 2025 zeigt die Fallhöhe: 88 Prozent der befragten Unternehmen nutzen KI in mindestens einer Funktion, aber nur 39 Prozent berichten überhaupt einen Effekt auf das Betriebsergebnis (EBIT), und bei den meisten davon liegt er unter 5 Prozent. Der Unterschied zwischen Nutzung und Wirkung ist eine Führungs- und Messfrage, keine Modellfrage.
Zur Ehrlichkeit gehört auch die Gegenposition: Nicht jedes Vorhaben verdient diesen Apparat. Ein Werkzeug für 20.000 Euro Jahreskosten braucht keine Portfoliosimulation. Die Drei-Szenarien-Methode gehört dorthin, wo Einmalkosten, Betriebskosten oder Risiken sechsstellig werden oder wo ein Prozess mit Außenwirkung betroffen ist. Darunter genügt eine Seite mit Baseline, erwartetem Effekt und einem Stoppdatum.
Bis Tag 30 (Owner: CFO gemeinsam mit Projektleitung KI):
Bis Tag 60 (Owner: Controlling-Leitung):
Bis Tag 90 (Owner: Geschäftsführung):
Im schlechten Fall den vollen Projekteinsatz plus Monate an Opportunitätskosten, weil das Scheitern zu spät erkannt wird. Gartner (2024) berichtet, dass Unternehmen ihre GenAI-Kosten um 500 bis 1.000 Prozent falsch einschätzen können, und bezifferte Proof-of-Concept-Ausgaben 2023 auf 300.000 bis 2,9 Millionen US-Dollar. Ohne Downside und Abbruchregel gibt es keinen Punkt, an dem jemand verbindlich stoppen muss. Die Punktprognose spart in der Freigabe eine Stunde Diskussion und kostet im Betrieb ein Jahr Klarheit.
Bewährt haben sich vier Typen: Nutzungsgrad unter Schwelle an zwei aufeinanderfolgenden Messpunkten, Korrektur- oder Fehlerquote über Schwelle nach einer Nachbesserungsfrist, Kosten je Vorgang dauerhaft über dem Altprozess und fehlender Nachweis des Realisierungsmechanismus bis zu einem Stichtag. Jedes Kriterium braucht Messgröße, Schwelle, Datum und einen Benannten mit Stopprecht. Entscheidend ist, dass die Kriterien vor der Freigabe fixiert werden, damit der Stopp später keine Gesichtsverlust-Debatte auslöst.
Es gibt keinen pauschalen Prozentsatz, denn ein pauschaler Abschlag ist Kosmetik. Der Downside entsteht, indem konkrete Annahmen gebrochen werden: Adoption halbiert sich, die Zweitprüfung bleibt dauerhaft, nutzungsabhängige Kosten steigen schneller als der Nutzen, die Integration verzögert sich um zwei Quartale. Diese Brüche werden einzeln durchgerechnet und kombiniert. S&P Global (2025) zufolge haben 42 Prozent der Unternehmen die Mehrheit ihrer KI-Initiativen abgebrochen. Der Downside soll genau diesen Fall vorab beziffern.
Das Scheitern allein löst keine Haftung aus, eine unzureichende Entscheidungsgrundlage kann es aber. Geschäftsleiter müssen unternehmerische Entscheidungen auf angemessener Informationsbasis treffen; das folgt aus den allgemeinen Sorgfaltspflichten des Gesellschaftsrechts. Ein dokumentierter Case mit Base, Downside und Abbruchkriterien ist genau diese Informationsbasis und schützt bei späterer Kritik durch Gesellschafter oder Beirat. Zusätzlich verlangt die Verordnung (EU) 2024/1689 je nach Einsatzfall eigene Pflichten, deren Kosten in den Case gehören.
Mit dem größten laufenden Vorhaben, nicht mit allen gleichzeitig. Innerhalb von 30 Tagen werden Base und Downside nachgezogen, die vollständigen Betriebskosten ergänzt und drei Abbruchkriterien mit Datum nachgetragen. Danach folgt ein erster Ist-Vergleich mit Entscheidungsprotokoll: weiterführen, umbauen oder stoppen. Diese Nachrüstung dauert bei vorhandenen Daten wenige Arbeitstage und macht aus einem stillschweigend laufenden Projekt wieder eine steuerbare Investition.
Belegt sind die Rahmendaten: Abbruch- und Fehlschlagquoten (Gartner 2024, S&P Global 2025, MIT NANDA 2025), das Ausmaß möglicher Kostenfehleinschätzungen (Gartner 2024), die verbreitete Messschwäche (Deloitte 2024) und die Lücke zwischen Nutzung und Ergebniswirkung (McKinsey 2025). Redaktionelle Einschätzung sind die Methodik des Drei-Szenarien-Cases, die Schwellenwerte im Entscheidungsbaum und die Modellrechnung; deren Zahlen sind illustrativ und keine Benchmarks. Der Artikel leistet keine unternehmensindividuelle Wirtschaftlichkeitsrechnung und keine Rechtsberatung. Universelle Schwellen für Abbruchkriterien gibt es nicht; sie müssen je Prozess und Risikoprofil gesetzt werden.
Methodik: Recherchebasierter Redaktionsbeitrag. Externe Zahlen wurden per Web-Recherche gegen die genannten Herausgeber verifiziert; die Modellrechnung ist eine gekennzeichnete, illustrative Eigenrechnung der Redaktion. Die Erstfassung entstand mit KI-Unterstützung; Faktenprüfung und redaktionelle Freigabe erfolgen durch Menschen vor Veröffentlichung.
| Datum | Änderung |
|---|---|
| 2026-07-23 | Erstfassung Launch-Korpus (Status: draft) |
| 2026-07-23 | Vollständige Neufassung nach Qualitäts-Spec: Szenario-Methodik, Modellrechnung, Entscheidungsbaum, verifizierte Quellen, FAQ |
Ein Briefing pro Woche: Entscheidungsfragen, eingeordnete Zahlen und Fristen. Ihre Adresse geben wir nicht weiter.
13 Min. Lesezeit
Jetzt lesen12 Min. Lesezeit
Jetzt lesen12 Min. Lesezeit
Jetzt lesen