Wirtschaftlichkeit von KI belastbar steuern
13 Min. Lesezeit
Jetzt lesenGesparte Minuten sind noch kein Geld. Die Forschung zeigt, wie klein der Weg von gefühlter Produktivität ins Betriebsergebnis wirklich ist und über welche vier Mechanismen er gelingt.
Gemessene Zeitersparnis ist eine notwendige, aber keine hinreichende Bedingung für einen finanziellen Ergebnisbeitrag. Geld entsteht erst über vier Mechanismen: Umwidmung freier Kapazität in benannte Arbeit, höherer Durchsatz, geringere Fehler- und Nacharbeitskosten oder Substitution externer Leistung. Jeder Mechanismus braucht eine Baseline, einen Messpunkt und einen Realisierungsowner im Fachbereich. Die Forschung von 2025 mahnt doppelt: Echte Zeitgewinne kommen ohne Steuerung kaum im Ergebnis an, und gefühlte Zeitgewinne sind oft nicht einmal echt.
Drei Studien aus dem Jahr 2025 haben die Beweislast umgekehrt. Die Ökonomen Humlum und Vestergaard werteten für das NBER Daten von 25.000 Beschäftigten und 7.000 Betrieben in Dänemark aus. Trotz breiter, oft arbeitgeberseitig geförderter Nutzung von KI-Chatbots fanden sie keine signifikanten Effekte auf Löhne oder erfasste Arbeitsstunden; die Konfidenzintervalle schließen Effekte über 1 Prozent aus. Die berichtete Zeitersparnis lag im Schnitt bei 2,8 Prozent der Arbeitszeit, und nur 3 bis 7 Prozent der Produktivitätsgewinne kamen als Einkommen an.
Das MIT-Projekt NANDA ergänzte die Unternehmenssicht: 95 Prozent der untersuchten GenAI-Piloten lieferten keinen messbaren Beitrag zur Gewinn- und Verlustrechnung, obwohl Werkzeuge wie Chat-Assistenten breit genutzt werden und die individuelle Produktivität spürbar stützen. McKinsey (2025) misst dieselbe Lücke von oben: 88 Prozent der Unternehmen nutzen KI, aber nur 39 Prozent berichten überhaupt einen Effekt auf das Betriebsergebnis. Wer heute eine KI-Freigabe mit Zeitersparnis begründet, muss deshalb eine Zusatzfrage beantworten: über welchen Weg die Minuten zu Geld werden und wer diesen Weg geht.
Die verbreitetste Rechnung in Freigabeunterlagen lautet: gesparte Minuten je Vorgang, mal Fallzahl, mal Personalkostensatz. Diese Rechnung unterstellt zwei Dinge stillschweigend. Erstens, dass die Ersparnis real ist. Zweitens, dass frei werdende Zeit automatisch produktiv wird. Beide Annahmen sind empirisch schwach.
Zur ersten Annahme liefert die METR-Studie von 2025 das unbequemste Ergebnis des Jahres. In einem randomisierten Experiment, also mit zufälliger Zuteilung der Aufgaben mit und ohne KI, bearbeiteten erfahrene Softwareentwickler 246 reale Aufgaben. Vorab erwarteten sie, mit KI 24 Prozent schneller zu sein. Hinterher schätzten sie, 20 Prozent schneller gewesen zu sein. Tatsächlich waren sie 19 Prozent langsamer. Die Wahrnehmung lag um 39 Prozentpunkte neben der Messung. Das Ergebnis gilt für ein spezifisches Setting, erfahrene Leute in vertrauten Systemen, aber es zerstört die Beweiskraft von Selbstauskünften als Nutzenbeleg.
Zur zweiten Annahme zeigt die dänische Studie, was mit echter Ersparnis ohne Steuerung passiert: fast nichts. Freie Minuten verteilen sich auf Erholung, höhere Gründlichkeit und neue Aufgaben. Bemerkenswert ist der letzte Punkt: Die Autoren dokumentieren, dass KI-Einführung neue Aufgabentypen erzeugt, vom Prüfen maschineller Entwürfe bis zu neuen Abstimmungen. Ein Teil der Bruttoersparnis wird also von der Technologie selbst wieder konsumiert. In den Case gehört die Nettoersparnis.
Gefühlte Zeitersparnis ist die am schlechtesten gesicherte Kennzahl der KI-Ökonomie und zugleich die am häufigsten präsentierte.
Der Weg von der Minute zum Euro führt über genau vier Mechanismen. Jeder hat eine eigene Messlogik und eine eigene Falle.
Erstens die Umwidmung: Frei werdende Kapazität fließt in benannte, höherwertige Arbeit, etwa mehr Kundenkontakte statt Verwaltungsaufwand. Der Nachweis verlangt, dass die neue Arbeit tatsächlich stattfindet und einen Wert hat. Die Falle ist die stillschweigende Umwidmung ins Unbestimmte, die niemand je prüft.
Zweitens der Durchsatz: mehr abgeschlossene Vorgänge bei gleicher Kapazität. Das ist der sauberste Mechanismus, weil er sich auf Prozessebene objektiv messen lässt. Die im Quarterly Journal of Economics 2025 publizierte Studie von Brynjolfsson, Li und Raymond ist das Referenzbeispiel: Bei 5.172 Callcenter-Beschäftigten stieg die Zahl gelöster Anliegen pro Stunde durch einen KI-Assistenten um 15 Prozent, gemessen an harten Betriebsdaten, mit den größten Gewinnen bei weniger erfahrenen Kräften. Die Falle: Mehrdurchsatz zählt nur, wenn es die zusätzliche Nachfrage oder den Rückstau gibt, den er abarbeitet.
Drittens die Fehler- und Nacharbeitskosten: weniger Ausschuss, Rückfragen, Gutschriften, Reklamationen. Hier ist die Baseline entscheidend, weil Qualitätskosten oft nirgends gesondert ausgewiesen sind. Die Falle ist die Doppelzählung mit dem Durchsatzeffekt, wenn beide auf denselben Minuten beruhen.
Viertens die Substitution: ersetzte Fremdleistung, vermiedene Nachbesetzung, reduzierte Überstunden. Das ist der härteste Euro und zugleich der heikelste Mechanismus, weil er Arbeitsplätze berührt und mitbestimmungsrelevant sein kann. Die Falle ist die großzügige Zurechnung geplanter Einsparungen, die auch ohne KI gekommen wären.
| Mechanismus | Messgröße | Nachweis | Typische Falle |
|---|---|---|---|
| Umwidmung | Anteil umgewidmeter Stunden in benannte Arbeit | Kapazitätsnachweis im Fachbereich | Umwidmung ins Unbestimmte |
| Durchsatz | Abgeschlossene Vorgänge je Zeiteinheit | Prozessdaten vor/nach, gleiche Baseline | Kein Rückstau, keine Nachfrage |
| Fehlerkosten | Nacharbeit, Gutschriften, Reklamationsquote | Qualitätskosten-Baseline | Doppelzählung mit Durchsatz |
| Substitution | Externe Ausgaben, offene Stellen, Überstunden | Budget- und Stellenplanabgleich | Zurechnung ohnehin geplanter Einsparungen |
Attribution heißt: den gemessenen Effekt dem KI-Einsatz zurechnen und nicht anderen Veränderungen. Dafür genügen im Mittelstand drei Disziplinen, kein Forschungsdesign.
Die Baseline kommt zuerst. Vier bis acht Wochen Ist-Messung der gewählten Kennzahl vor der Einführung, auf derselben Definition, die auch danach gilt. Eine nachträglich rekonstruierte Baseline ist verhandelbar und damit wertlos.
Die Gegenprobe kommt zweitens. Wo möglich, wird ein vergleichbares Team oder ein vergleichbarer Standort ohne KI-Einsatz mitbeobachtet. Wo das nicht geht, werden Störgrößen protokolliert: Saisonalität, Personalwechsel, parallele Prozessänderungen. Ein Effekt, der exakt mit einer Systemumstellung zusammenfällt, gehört nicht der KI.
Der Owner kommt drittens, und er sitzt im Fachbereich. Das Projektteam kann Werkzeuge liefern und Zeit freisetzen. Umwidmen, Durchsatz annehmen, Fremdvergabe kündigen kann nur die Linie. Deshalb gehört in jede Freigabe ein Name: Wer weist die Realisierung bis wann nach, und was passiert bei Nichterreichen. Deloitte (2024) fand, dass 41 Prozent der Organisationen Wirkung und Wert ihrer GenAI-Initiativen nicht sauber definieren und messen konnten und nur 16 Prozent dem CFO regelmäßig berichteten. Diese Lücke ist keine Messtechnik, sie ist fehlende Zuständigkeit.
Eine Stunde Ersparnis, die niemand umwidmet, ist betriebswirtschaftlich keine Stunde. Sie ist ein Gerücht über eine Stunde.
Zur Fairness gehört die Gegenposition: Nicht jeder Nutzen muss sofort in Euro erscheinen. Lernkurven, Arbeitgeberattraktivität und strategische Optionen sind legitime Gründe für KI-Einsatz. Sie gehören nur nicht in die Renditezeile, sondern daneben, als ausgewiesene qualitative Effekte. Vermischung erzeugt Scheingenauigkeit und beschädigt die Glaubwürdigkeit der echten Zahlen.
Fünf Muster kehren in Nutzenberichten regelmäßig wieder. Erstens die Wahrnehmungslücke: Nutzer fühlen sich schneller, als sie sind; die METR-Studie liefert dafür den experimentellen Beleg. Zweitens die Minutenmultiplikation: Bruttominuten mal Stundensatz, ohne Realisierungsmechanismus und ohne Nettobetrachtung. Drittens die Doppelzählung: Dieselbe gesparte Stunde erscheint einmal als Durchsatz und einmal als Qualitätsgewinn. Viertens die verschwiegene Neuarbeit: Prüf-, Korrektur- und Koordinationsaufwand der KI-Nutzung fehlt in der Rechnung, obwohl die dänischen Daten zeigen, dass neue Aufgaben systematisch entstehen. Fünftens der Pilot-Selektionseffekt: Gemessen wird an freiwilligen, motivierten Frühnutzern, hochgerechnet wird auf alle.
Gegen alle fünf hilft dieselbe Regel: Jede Nutzenzahl nennt Mechanismus, Baseline, Messpunkt, Owner und Nettologik. Was diese fünf Angaben nicht hat, wird als Hypothese geführt, nicht als Ergebnis. Das klingt streng, ist aber die Bedingung dafür, dass die guten Vorhaben Budget bekommen. Wo alles glänzt, gewinnt nicht das beste Projekt, sondern die beste Folie.
Bis Tag 30 (Owner: Fachbereichsleitung des größten KI-Vorhabens):
Bis Tag 60 (Owner: Controlling-Leitung):
Bis Tag 90 (Owner: Geschäftsführung):
Weil Zeitersparnis erst über einen Realisierungsmechanismus zu Geld wird und dieser Schritt in den meisten Unternehmen niemandem gehört. Die dänische NBER-Studie von 2025 fand trotz breiter KI-Nutzung keine messbaren Effekte auf Löhne oder Arbeitsstunden; nur 3 bis 7 Prozent der Produktivitätsgewinne kamen bei den Beschäftigten an. Freie Minuten verteilen sich auf Pausen, Mehrqualität und neue Aufgaben, wenn niemand Umwidmung, Durchsatz oder Substitution aktiv steuert. Das Ergebnis entsteht in der Linie, nicht im Werkzeug.
Durchsatz je Zeiteinheit auf Prozessebene, etwa abgeschlossene Vorgänge pro Stunde, gemessen vor und nach der Einführung auf derselben Baseline. So hat die im Quarterly Journal of Economics 2025 publizierte Callcenter-Studie einen Produktivitätsgewinn von 15 Prozent sauber belegt: gelöste Anliegen pro Stunde über 5.172 Beschäftigte. Selbstauskünfte und Zufriedenheitsumfragen taugen als Frühindikator, aber nicht als Nachweis. Wo Durchsatz nicht passt, sind Fehler- und Nacharbeitskosten oder ersetzte Fremdleistung die nächstbeste Wahl.
Sie führt zu Fehlskalierung: Budgets fließen in Vorhaben, die nur gefühlt wirken. Gartner nannte 2024 unklaren Geschäftswert als einen Hauptgrund dafür, dass GenAI-Projekte nach dem Proof of Concept aufgegeben werden; die Abbruchentscheidung fällt dann spät und teuer. Dazu kommen Glaubwürdigkeitskosten: Ein Controlling, das einmal aufgeblasene KI-Renditen entdeckt, diskontiert künftig auch die echten. Die METR-Studie von 2025 zeigt die Fallhöhe: Beteiligte fühlten sich 20 Prozent schneller und waren 19 Prozent langsamer.
Nur konservativ, belegt und rechtlich sauber vorbereitet. Eine vermiedene Nachbesetzung ist als Substitutionseffekt zurechenbar, wenn die Stelle konkret geplant war und die Aufgaben nachweislich vom System übernommen werden. Geplanter Stellenabbau kann eine mitbestimmungspflichtige Betriebsänderung sein und erfordert frühe Einbindung des Betriebsrats. Wer Substitution großzügig rechnet, riskiert doppelt: arbeitsrechtliche Konflikte und einen Case, der bei der ersten Prüfung zusammenfällt. Im Zweifel gehört der Effekt in den Downside, nicht in den Base Case.
Mit genau einem Prozess, einer Kennzahl und einer Baseline. Wählen Sie einen Vorgang mit hoher Stückzahl, messen Sie vier Wochen den Ist-Durchsatz oder die Fehlerquote, und benennen Sie einen Realisierungsowner im Fachbereich. Danach wird der KI-Einsatz eingeführt und dieselbe Größe weiter gemessen. Nach einem Quartal liegt ein erster ehrlicher Vorher-nachher-Vergleich vor. Das ist kein Forschungsprojekt, sondern zwei Spalten im bestehenden Berichtswesen, und es ersetzt Anekdoten durch eine belastbare Zahl.
Belegt sind die zentralen empirischen Aussagen: die geringe Durchschlagskraft von Zeitersparnis auf Löhne und Stunden samt Entstehung neuer Aufgaben (Humlum/Vestergaard, NBER 2025), die Wahrnehmungslücke zwischen gefühlter und gemessener Produktivität (METR 2025), der sauber gemessene Durchsatzeffekt im Kundenservice (Brynjolfsson/Li/Raymond, QJE 2025), die Lücke zwischen Nutzung und Ergebniswirkung (MIT NANDA 2025; McKinsey 2025) und die Messschwäche in Unternehmen (Deloitte 2024). Redaktionelle Einschätzung sind die Vier-Mechanismen-Systematik, die Pflichtangaben-Regel und die Liste der fünf Selbsttäuschungen. Die zitierten Studien stammen aus spezifischen Kontexten, dänischer Arbeitsmarkt, erfahrene Softwareentwickler, Callcenter, und sind nicht eins zu eins auf jeden Prozess übertragbar. Der Artikel ersetzt keine unternehmensindividuelle Wirtschaftlichkeits- oder Rechtsberatung, insbesondere nicht zu Mitbestimmungsfragen.
Methodik: Recherchebasierter Redaktionsbeitrag. Alle Studienangaben wurden per Web-Recherche gegen Originalveröffentlichungen oder Herausgeberseiten verifiziert. Die Erstfassung entstand mit KI-Unterstützung; Faktenprüfung und redaktionelle Freigabe erfolgen durch Menschen vor Veröffentlichung.
| Datum | Änderung |
|---|---|
| 2026-07-23 | Erstfassung Launch-Korpus (Status: draft) |
| 2026-07-23 | Vollständige Neufassung nach Qualitäts-Spec: Studienlage 2025, Vier-Mechanismen-Tabelle, Attributionslogik, fünf Selbsttäuschungen, FAQ |
Ein Briefing pro Woche: Entscheidungsfragen, eingeordnete Zahlen und Fristen. Ihre Adresse geben wir nicht weiter.
13 Min. Lesezeit
Jetzt lesen12 Min. Lesezeit
Jetzt lesen12 Min. Lesezeit
Jetzt lesen