Ausgabe 39/2026 · Stand: Mittwoch, 23. September 2026 Das Fachmagazin für KI-Transformation im Mittelstand
Briefing abonnieren
Wertbeitrag

Von Zeitersparnis zu Ergebnisbeitrag

Gesparte Minuten sind noch kein Geld. Die Forschung zeigt, wie klein der Weg von gefühlter Produktivität ins Betriebsergebnis wirklich ist und über welche vier Mechanismen er gelingt.

Veröffentlicht · Aktualisiert · 12 Min. Lesezeit
Controller notiert am Rand einer ausgedruckten Zahlenaufstellung, daneben ein Tischrechner.
Jede Zahl im Business-Case braucht eine Herkunft. Symbolbild, KI-generiert für KIONIER.

Kurzantwort

Gemessene Zeitersparnis ist eine notwendige, aber keine hinreichende Bedingung für einen finanziellen Ergebnisbeitrag. Geld entsteht erst über vier Mechanismen: Umwidmung freier Kapazität in benannte Arbeit, höherer Durchsatz, geringere Fehler- und Nacharbeitskosten oder Substitution externer Leistung. Jeder Mechanismus braucht eine Baseline, einen Messpunkt und einen Realisierungsowner im Fachbereich. Die Forschung von 2025 mahnt doppelt: Echte Zeitgewinne kommen ohne Steuerung kaum im Ergebnis an, und gefühlte Zeitgewinne sind oft nicht einmal echt.

Die Kernaussagen

  • Minuten mal Stundensatz ist eine Rechenhilfe, kein Nachweis. Ohne Realisierungsmechanismus bleibt die Minute im Tagesrauschen.
  • Selbstauskunft ist die schwächste Datenquelle der Nutzenmessung. In der METR-Studie (2025) lag sie um 39 Prozentpunkte neben der Realität.
  • Auch reale Ersparnis versickert: Die NBER-Studie aus Dänemark (2025) fand 2,8 Prozent Zeitgewinn und null messbaren Lohn- oder Stundeneffekt.
  • Der belastbarste Nachweis ist Durchsatz je Zeiteinheit auf Prozessebene, mit Baseline vor der Einführung.
  • KI erzeugt auch neue Arbeit: Prüfen, Korrigieren, neue Aufgabentypen. Nur die Nettoersparnis zählt.
  • Realisierung ist Linienverantwortung. Ein Projektteam kann Zeit freisetzen, aber nur der Fachbereich kann sie zu Geld machen.

Warum die Frage jetzt zählt

Drei Studien aus dem Jahr 2025 haben die Beweislast umgekehrt. Die Ökonomen Humlum und Vestergaard werteten für das NBER Daten von 25.000 Beschäftigten und 7.000 Betrieben in Dänemark aus. Trotz breiter, oft arbeitgeberseitig geförderter Nutzung von KI-Chatbots fanden sie keine signifikanten Effekte auf Löhne oder erfasste Arbeitsstunden; die Konfidenzintervalle schließen Effekte über 1 Prozent aus. Die berichtete Zeitersparnis lag im Schnitt bei 2,8 Prozent der Arbeitszeit, und nur 3 bis 7 Prozent der Produktivitätsgewinne kamen als Einkommen an.

Das MIT-Projekt NANDA ergänzte die Unternehmenssicht: 95 Prozent der untersuchten GenAI-Piloten lieferten keinen messbaren Beitrag zur Gewinn- und Verlustrechnung, obwohl Werkzeuge wie Chat-Assistenten breit genutzt werden und die individuelle Produktivität spürbar stützen. McKinsey (2025) misst dieselbe Lücke von oben: 88 Prozent der Unternehmen nutzen KI, aber nur 39 Prozent berichten überhaupt einen Effekt auf das Betriebsergebnis. Wer heute eine KI-Freigabe mit Zeitersparnis begründet, muss deshalb eine Zusatzfrage beantworten: über welchen Weg die Minuten zu Geld werden und wer diesen Weg geht.

Die Lücke zwischen Minuten und Geld

Die verbreitetste Rechnung in Freigabeunterlagen lautet: gesparte Minuten je Vorgang, mal Fallzahl, mal Personalkostensatz. Diese Rechnung unterstellt zwei Dinge stillschweigend. Erstens, dass die Ersparnis real ist. Zweitens, dass frei werdende Zeit automatisch produktiv wird. Beide Annahmen sind empirisch schwach.

Zur ersten Annahme liefert die METR-Studie von 2025 das unbequemste Ergebnis des Jahres. In einem randomisierten Experiment, also mit zufälliger Zuteilung der Aufgaben mit und ohne KI, bearbeiteten erfahrene Softwareentwickler 246 reale Aufgaben. Vorab erwarteten sie, mit KI 24 Prozent schneller zu sein. Hinterher schätzten sie, 20 Prozent schneller gewesen zu sein. Tatsächlich waren sie 19 Prozent langsamer. Die Wahrnehmung lag um 39 Prozentpunkte neben der Messung. Das Ergebnis gilt für ein spezifisches Setting, erfahrene Leute in vertrauten Systemen, aber es zerstört die Beweiskraft von Selbstauskünften als Nutzenbeleg.

Zur zweiten Annahme zeigt die dänische Studie, was mit echter Ersparnis ohne Steuerung passiert: fast nichts. Freie Minuten verteilen sich auf Erholung, höhere Gründlichkeit und neue Aufgaben. Bemerkenswert ist der letzte Punkt: Die Autoren dokumentieren, dass KI-Einführung neue Aufgabentypen erzeugt, vom Prüfen maschineller Entwürfe bis zu neuen Abstimmungen. Ein Teil der Bruttoersparnis wird also von der Technologie selbst wieder konsumiert. In den Case gehört die Nettoersparnis.

Gefühlte Zeitersparnis ist die am schlechtesten gesicherte Kennzahl der KI-Ökonomie und zugleich die am häufigsten präsentierte.

Vier Mechanismen machen aus Zeit Geld

Der Weg von der Minute zum Euro führt über genau vier Mechanismen. Jeder hat eine eigene Messlogik und eine eigene Falle.

Erstens die Umwidmung: Frei werdende Kapazität fließt in benannte, höherwertige Arbeit, etwa mehr Kundenkontakte statt Verwaltungsaufwand. Der Nachweis verlangt, dass die neue Arbeit tatsächlich stattfindet und einen Wert hat. Die Falle ist die stillschweigende Umwidmung ins Unbestimmte, die niemand je prüft.

Zweitens der Durchsatz: mehr abgeschlossene Vorgänge bei gleicher Kapazität. Das ist der sauberste Mechanismus, weil er sich auf Prozessebene objektiv messen lässt. Die im Quarterly Journal of Economics 2025 publizierte Studie von Brynjolfsson, Li und Raymond ist das Referenzbeispiel: Bei 5.172 Callcenter-Beschäftigten stieg die Zahl gelöster Anliegen pro Stunde durch einen KI-Assistenten um 15 Prozent, gemessen an harten Betriebsdaten, mit den größten Gewinnen bei weniger erfahrenen Kräften. Die Falle: Mehrdurchsatz zählt nur, wenn es die zusätzliche Nachfrage oder den Rückstau gibt, den er abarbeitet.

Drittens die Fehler- und Nacharbeitskosten: weniger Ausschuss, Rückfragen, Gutschriften, Reklamationen. Hier ist die Baseline entscheidend, weil Qualitätskosten oft nirgends gesondert ausgewiesen sind. Die Falle ist die Doppelzählung mit dem Durchsatzeffekt, wenn beide auf denselben Minuten beruhen.

Viertens die Substitution: ersetzte Fremdleistung, vermiedene Nachbesetzung, reduzierte Überstunden. Das ist der härteste Euro und zugleich der heikelste Mechanismus, weil er Arbeitsplätze berührt und mitbestimmungsrelevant sein kann. Die Falle ist die großzügige Zurechnung geplanter Einsparungen, die auch ohne KI gekommen wären.

Mechanismus Messgröße Nachweis Typische Falle
Umwidmung Anteil umgewidmeter Stunden in benannte Arbeit Kapazitätsnachweis im Fachbereich Umwidmung ins Unbestimmte
Durchsatz Abgeschlossene Vorgänge je Zeiteinheit Prozessdaten vor/nach, gleiche Baseline Kein Rückstau, keine Nachfrage
Fehlerkosten Nacharbeit, Gutschriften, Reklamationsquote Qualitätskosten-Baseline Doppelzählung mit Durchsatz
Substitution Externe Ausgaben, offene Stellen, Überstunden Budget- und Stellenplanabgleich Zurechnung ohnehin geplanter Einsparungen

Attributionslogik: Baseline, Gegenprobe, Owner

Attribution heißt: den gemessenen Effekt dem KI-Einsatz zurechnen und nicht anderen Veränderungen. Dafür genügen im Mittelstand drei Disziplinen, kein Forschungsdesign.

Die Baseline kommt zuerst. Vier bis acht Wochen Ist-Messung der gewählten Kennzahl vor der Einführung, auf derselben Definition, die auch danach gilt. Eine nachträglich rekonstruierte Baseline ist verhandelbar und damit wertlos.

Die Gegenprobe kommt zweitens. Wo möglich, wird ein vergleichbares Team oder ein vergleichbarer Standort ohne KI-Einsatz mitbeobachtet. Wo das nicht geht, werden Störgrößen protokolliert: Saisonalität, Personalwechsel, parallele Prozessänderungen. Ein Effekt, der exakt mit einer Systemumstellung zusammenfällt, gehört nicht der KI.

Der Owner kommt drittens, und er sitzt im Fachbereich. Das Projektteam kann Werkzeuge liefern und Zeit freisetzen. Umwidmen, Durchsatz annehmen, Fremdvergabe kündigen kann nur die Linie. Deshalb gehört in jede Freigabe ein Name: Wer weist die Realisierung bis wann nach, und was passiert bei Nichterreichen. Deloitte (2024) fand, dass 41 Prozent der Organisationen Wirkung und Wert ihrer GenAI-Initiativen nicht sauber definieren und messen konnten und nur 16 Prozent dem CFO regelmäßig berichteten. Diese Lücke ist keine Messtechnik, sie ist fehlende Zuständigkeit.

Eine Stunde Ersparnis, die niemand umwidmet, ist betriebswirtschaftlich keine Stunde. Sie ist ein Gerücht über eine Stunde.

Zur Fairness gehört die Gegenposition: Nicht jeder Nutzen muss sofort in Euro erscheinen. Lernkurven, Arbeitgeberattraktivität und strategische Optionen sind legitime Gründe für KI-Einsatz. Sie gehören nur nicht in die Renditezeile, sondern daneben, als ausgewiesene qualitative Effekte. Vermischung erzeugt Scheingenauigkeit und beschädigt die Glaubwürdigkeit der echten Zahlen.

Die fünf Selbsttäuschungen der Nutzenmessung

Fünf Muster kehren in Nutzenberichten regelmäßig wieder. Erstens die Wahrnehmungslücke: Nutzer fühlen sich schneller, als sie sind; die METR-Studie liefert dafür den experimentellen Beleg. Zweitens die Minutenmultiplikation: Bruttominuten mal Stundensatz, ohne Realisierungsmechanismus und ohne Nettobetrachtung. Drittens die Doppelzählung: Dieselbe gesparte Stunde erscheint einmal als Durchsatz und einmal als Qualitätsgewinn. Viertens die verschwiegene Neuarbeit: Prüf-, Korrektur- und Koordinationsaufwand der KI-Nutzung fehlt in der Rechnung, obwohl die dänischen Daten zeigen, dass neue Aufgaben systematisch entstehen. Fünftens der Pilot-Selektionseffekt: Gemessen wird an freiwilligen, motivierten Frühnutzern, hochgerechnet wird auf alle.

Gegen alle fünf hilft dieselbe Regel: Jede Nutzenzahl nennt Mechanismus, Baseline, Messpunkt, Owner und Nettologik. Was diese fünf Angaben nicht hat, wird als Hypothese geführt, nicht als Ergebnis. Das klingt streng, ist aber die Bedingung dafür, dass die guten Vorhaben Budget bekommen. Wo alles glänzt, gewinnt nicht das beste Projekt, sondern die beste Folie.

Maßnahmen für die Geschäftsführung

Bis Tag 30 (Owner: Fachbereichsleitung des größten KI-Vorhabens):

  • Den Hauptnutzen des Vorhabens auf genau einen Primärmechanismus festlegen: Umwidmung, Durchsatz, Fehlerkosten oder Substitution.
  • Baseline der zugehörigen Kennzahl erheben oder aus Bestandsdaten der letzten acht Wochen sichern.
  • Einen Realisierungsowner mit Namen, Zielwert und Nachweistermin benennen.

Bis Tag 60 (Owner: Controlling-Leitung):

  • Nutzenberichte auf die Pflichtangaben Mechanismus, Baseline, Messpunkt, Owner und Nettologik umstellen.
  • Selbstauskünfte und Zufriedenheitswerte als Frühindikatoren kennzeichnen, nicht als Ergebnisbeitrag.
  • Doppelzählungsprüfung über alle laufenden KI-Vorhaben durchführen.

Bis Tag 90 (Owner: Geschäftsführung):

  • Ersten Quartalsnachweis je Vorhaben abnehmen: realisierter Beitrag je Mechanismus gegen Plan.
  • Vorhaben ohne belegten Mechanismus abwerten: Nutzen wandert aus der Rendite in die qualitativen Effekte.
  • Bei Substitutionseffekten die Einbindung von Betriebsrat und Personalbereich terminieren, bevor kommuniziert wird.

Was Führung jetzt entscheiden muss

  • Ist je Hauptnutzen genau ein Primärmechanismus benannt, statt einer Sammelliste?
  • Existiert eine Baseline mit derselben Definition vor und nach der Einführung?
  • Wer ist Realisierungsowner im Fachbereich, und kennt diese Person Zielwert und Termin?
  • Wird die durch KI neu entstehende Arbeit in der Nettorechnung ausgewiesen?
  • Sind Selbstauskünfte im Berichtswesen klar als Frühindikator markiert?
  • Was passiert verbindlich, wenn der Nachweis am Messpunkt fehlt: Abwertung, Umbau oder Stopp?
  • Sind Substitutionseffekte konservativ gerechnet und mitbestimmungsseitig vorbereitet?

Häufige Fragen (FAQ)

Warum sehen wir trotz gemessener Zeitersparnis nichts im Betriebsergebnis?

Weil Zeitersparnis erst über einen Realisierungsmechanismus zu Geld wird und dieser Schritt in den meisten Unternehmen niemandem gehört. Die dänische NBER-Studie von 2025 fand trotz breiter KI-Nutzung keine messbaren Effekte auf Löhne oder Arbeitsstunden; nur 3 bis 7 Prozent der Produktivitätsgewinne kamen bei den Beschäftigten an. Freie Minuten verteilen sich auf Pausen, Mehrqualität und neue Aufgaben, wenn niemand Umwidmung, Durchsatz oder Substitution aktiv steuert. Das Ergebnis entsteht in der Linie, nicht im Werkzeug.

Welche Kennzahl eignet sich am besten, um den KI-Beitrag zu belegen?

Durchsatz je Zeiteinheit auf Prozessebene, etwa abgeschlossene Vorgänge pro Stunde, gemessen vor und nach der Einführung auf derselben Baseline. So hat die im Quarterly Journal of Economics 2025 publizierte Callcenter-Studie einen Produktivitätsgewinn von 15 Prozent sauber belegt: gelöste Anliegen pro Stunde über 5.172 Beschäftigte. Selbstauskünfte und Zufriedenheitsumfragen taugen als Frühindikator, aber nicht als Nachweis. Wo Durchsatz nicht passt, sind Fehler- und Nacharbeitskosten oder ersetzte Fremdleistung die nächstbeste Wahl.

Was kostet uns eine falsche oder geschönte Nutzenmessung?

Sie führt zu Fehlskalierung: Budgets fließen in Vorhaben, die nur gefühlt wirken. Gartner nannte 2024 unklaren Geschäftswert als einen Hauptgrund dafür, dass GenAI-Projekte nach dem Proof of Concept aufgegeben werden; die Abbruchentscheidung fällt dann spät und teuer. Dazu kommen Glaubwürdigkeitskosten: Ein Controlling, das einmal aufgeblasene KI-Renditen entdeckt, diskontiert künftig auch die echten. Die METR-Studie von 2025 zeigt die Fallhöhe: Beteiligte fühlten sich 20 Prozent schneller und waren 19 Prozent langsamer.

Dürfen wir vermiedene Einstellungen oder Personalabbau als KI-Nutzen einrechnen?

Nur konservativ, belegt und rechtlich sauber vorbereitet. Eine vermiedene Nachbesetzung ist als Substitutionseffekt zurechenbar, wenn die Stelle konkret geplant war und die Aufgaben nachweislich vom System übernommen werden. Geplanter Stellenabbau kann eine mitbestimmungspflichtige Betriebsänderung sein und erfordert frühe Einbindung des Betriebsrats. Wer Substitution großzügig rechnet, riskiert doppelt: arbeitsrechtliche Konflikte und einen Case, der bei der ersten Prüfung zusammenfällt. Im Zweifel gehört der Effekt in den Downside, nicht in den Base Case.

Womit fangen wir an, wenn bisher nur Zufriedenheitsumfragen und Demo-Erfolge existieren?

Mit genau einem Prozess, einer Kennzahl und einer Baseline. Wählen Sie einen Vorgang mit hoher Stückzahl, messen Sie vier Wochen den Ist-Durchsatz oder die Fehlerquote, und benennen Sie einen Realisierungsowner im Fachbereich. Danach wird der KI-Einsatz eingeführt und dieselbe Größe weiter gemessen. Nach einem Quartal liegt ein erster ehrlicher Vorher-nachher-Vergleich vor. Das ist kein Forschungsprojekt, sondern zwei Spalten im bestehenden Berichtswesen, und es ersetzt Anekdoten durch eine belastbare Zahl.

Evidenz und Grenzen

Belegt sind die zentralen empirischen Aussagen: die geringe Durchschlagskraft von Zeitersparnis auf Löhne und Stunden samt Entstehung neuer Aufgaben (Humlum/Vestergaard, NBER 2025), die Wahrnehmungslücke zwischen gefühlter und gemessener Produktivität (METR 2025), der sauber gemessene Durchsatzeffekt im Kundenservice (Brynjolfsson/Li/Raymond, QJE 2025), die Lücke zwischen Nutzung und Ergebniswirkung (MIT NANDA 2025; McKinsey 2025) und die Messschwäche in Unternehmen (Deloitte 2024). Redaktionelle Einschätzung sind die Vier-Mechanismen-Systematik, die Pflichtangaben-Regel und die Liste der fünf Selbsttäuschungen. Die zitierten Studien stammen aus spezifischen Kontexten, dänischer Arbeitsmarkt, erfahrene Softwareentwickler, Callcenter, und sind nicht eins zu eins auf jeden Prozess übertragbar. Der Artikel ersetzt keine unternehmensindividuelle Wirtschaftlichkeits- oder Rechtsberatung, insbesondere nicht zu Mitbestimmungsfragen.

Quellen und Methodik

  1. Humlum, A.; Vestergaard, E.: „Large Language Models, Small Labor Market Effects“, NBER Working Paper 33777 / Becker Friedman Institute WP 2025-56, 2025, bfi.uchicago.edu/working-papers/large-language-models-small-labor-market-effects/.
  2. METR: „Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity“, Juli 2025, arxiv.org/abs/2507.09089.
  3. Brynjolfsson, E.; Li, D.; Raymond, L.: „Generative AI at Work“, The Quarterly Journal of Economics, 2025 (zuerst NBER Working Paper 31161, 2023).
  4. MIT Media Lab, Project NANDA: „The GenAI Divide: State of AI in Business 2025“, Juli 2025.
  5. McKinsey & Company: „The State of AI: Global Survey“, November 2025, mckinsey.com/capabilities/quantumblack/our-insights/the-state-of-ai.
  6. Deloitte AI Institute: „The State of Generative AI in the Enterprise“, dritte Quartalsausgabe, 2024 (2.770 Befragte in 14 Ländern).
  7. Gartner: „Gartner Predicts 30% of Generative AI Projects Will Be Abandoned After Proof of Concept By End of 2025“, Pressemitteilung, 29.07.2024.

Methodik: Recherchebasierter Redaktionsbeitrag. Alle Studienangaben wurden per Web-Recherche gegen Originalveröffentlichungen oder Herausgeberseiten verifiziert. Die Erstfassung entstand mit KI-Unterstützung; Faktenprüfung und redaktionelle Freigabe erfolgen durch Menschen vor Veröffentlichung.

Änderungsprotokoll

Datum Änderung
2026-07-23 Erstfassung Launch-Korpus (Status: draft)
2026-07-23 Vollständige Neufassung nach Qualitäts-Spec: Studienlage 2025, Vier-Mechanismen-Tabelle, Attributionslogik, fünf Selbsttäuschungen, FAQ

Das Entscheider-Briefing

Ein Briefing pro Woche: Entscheidungsfragen, eingeordnete Zahlen und Fristen. Ihre Adresse geben wir nicht weiter.

Sie erhalten zuerst eine E-Mail mit einem Bestätigungslink. Erst nach dem Klick nehmen wir Sie auf. Abmeldung mit einem Klick in jeder Ausgabe.

Weiterführend im Themenfeld