100-Claims-Datenbank: Übersicht
1 Min. Lesezeit
Jetzt lesenDiese Familie prüft Zahlen zum Muster „KI macht Beschäftigte X Prozent schneller“. Fast jede dieser Zahlen stammt aus einer echten Messung — aber aus einem engen Setting: eine Aufgabe, ein Unternehmen, ein Werkzeugstand. Auf Folien verlieren sie Stichprobe und Kontext und werden zu Generalversprechen; dieselbe Verkürzu
Diese Familie prüft Zahlen zum Muster „KI macht Beschäftigte X Prozent schneller“. Fast jede dieser Zahlen stammt aus einer echten Messung, aber aus einem engen Setting: eine Aufgabe, ein Unternehmen, ein Werkzeugstand. Auf Folien verlieren sie Stichprobe und Kontext und werden zu Generalversprechen; dieselbe Verkürzung tritt auch in der Gegenrichtung auf.
Wortlaut: „GitHub Copilot macht Entwickler 55 Prozent schneller.“ Kursiert als Generalaussage über Software-Entwicklung.
Ursprung: Peng, Kalliamvakou, Cihon, Demirer: „The Impact of AI on Developer Productivity: Evidence from GitHub Copilot“, kontrolliertes Experiment (GitHub/Microsoft/MIT), arXiv, Februar 2023.
Was die Quelle wirklich sagt: Das Experiment (2023) ließ 95 über Upwork rekrutierte Entwickler genau eine abgegrenzte Aufgabe lösen: einen HTTP-Server in JavaScript bauen. Die Copilot-Gruppe war 55,8 Prozent schneller, mit weitem Konfidenzintervall von 21 bis 89 Prozent. Am stärksten profitierten weniger erfahrene Entwickler; über reale Projektarbeit in gewachsenen Codebasen sagt das Setting nichts.
Urteil: eingeschränkt belegt, die Messung existiert, gilt aber für eine einzelne Standardaufgabe und trägt keine Generalaussage.
Führungsfolge: Nur mit eigener Messung übernehmen: Durchlaufzeiten im eigenen Entwicklungsprozess vor und nach Einführung messen.
Wortlaut: „KI-Werkzeuge machen Entwickler in Wahrheit 19 Prozent langsamer.“ Die Gegenrichtungs-Verkürzung desselben Musters.
Ursprung: METR: „Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity“, randomisiertes Experiment, Juli 2025.
Was die Quelle wirklich sagt: METR (2025) maß in einem randomisierten Experiment 16 sehr erfahrene Open-Source-Entwickler bei 246 realen Aufgaben in reifen, großen Codebasen mit durchschnittlich fünf Jahren Projekterfahrung. Mit KI-Erlaubnis brauchten sie 19 Prozent länger, obwohl sie sich hinterher 20 Prozent schneller fühlten. Die Autoren betonen selbst: Momentaufnahme des Werkzeugstands Anfang 2025 in einem speziellen Setting, keine Generalaussage über Entwickler.
Urteil: eingeschränkt belegt, der Befund ist sauber gemessen, gilt aber für ein enges Setting; als Pauschalaussage „KI verlangsamt“ ist er dieselbe Verkürzung wie der 55-Prozent-Claim.
Führungsfolge: Den übertragbaren Kern übernehmen: gefühlte Produktivität nie als Messgröße akzeptieren, Wirkung nur über Baseline und gemessene Zeiten bewerten.
Wortlaut: „KI-Assistenten steigern die Produktivität im Kundenservice um 14 Prozent.“
Ursprung: Brynjolfsson, Li, Raymond: „Generative AI at Work“, NBER Working Paper 31161 (2023), publiziert im Quarterly Journal of Economics (2025).
Was die Quelle wirklich sagt: Die Studie (2023/2025) untersuchte die gestaffelte Einführung eines KI-Assistenten bei 5.172 Kundendienst-Agenten eines einzelnen Software-Unternehmens. Gelöste Anliegen pro Stunde stiegen im Schnitt um 14 bis 15 Prozent; Neulinge und schwächere Agenten verbesserten sich um rund 34 Prozent, die erfahrensten kaum, teils mit leichten Qualitätseinbußen. Es ist eine der solidesten Feldmessungen, aber aus einem Unternehmen und einem Aufgabentyp.
Urteil: eingeschränkt belegt, sauber gemessen, doch der Durchschnitt verdeckt, dass der Effekt fast ganz bei Berufsanfängern liegt und aus einem Einzelfall stammt.
Führungsfolge: Als Hypothese für eigene Support-Prozesse übernehmen und nach Erfahrungsniveau getrennt nachmessen.
Wortlaut: „Beim BCG-Experiment lieferten Berater mit GPT-4 um 40 Prozent bessere Ergebnisse.“
Ursprung: Dell’Acqua et al.: „Navigating the Jagged Technological Frontier“, Harvard Business School Working Paper 24-013 mit BCG, September 2023.
Was die Quelle wirklich sagt: Das präregistrierte Experiment (2023) mit 758 BCG-Beratern fand bei 18 Aufgaben innerhalb der KI-Fähigkeitsgrenze 12,2 Prozent mehr erledigte Aufgaben, 25,1 Prozent höheres Tempo und über 40 Prozent bessere Qualitätsbewertungen. Bei einer Aufgabe außerhalb dieser Grenze lieferten KI-Nutzer 19 Prozentpunkte seltener die korrekte Lösung. Der Kernbefund ist die „zerklüftete Grenze“, nicht ein pauschaler 40-Prozent-Gewinn.
Urteil: eingeschränkt belegt, die 40 Prozent gelten für Qualitätsbewertungen ausgewählter Aufgaben innerhalb der Frontier; ohne den Gegenbefund zitiert wird die Studie sinnentstellt.
Führungsfolge: Nur mit eigener Messung übernehmen und je Aufgabentyp prüfen, ob er innerhalb oder außerhalb der Fähigkeitsgrenze liegt.
Wortlaut: „Mit ChatGPT erledigen Fachkräfte Schreibaufgaben 40 Prozent schneller und in höherer Qualität.“
Ursprung: Noy, Zhang: „Experimental evidence on the productivity effects of generative artificial intelligence“, Science, Juli 2023.
Was die Quelle wirklich sagt: Das präregistrierte Online-Experiment (2023) gab 453 hochschulgebildeten Berufstätigen berufsnahe Schreibaufgaben von 20 bis 30 Minuten Länge. Die ChatGPT-Gruppe brauchte 40 Prozent weniger Zeit, die Qualitätsbewertung stieg um 18 Prozent, schwächere Schreiber profitierten am meisten. Die Aufgaben verlangten keine Faktenprüfung und keinen Firmenkontext; auf reale, kontextreiche Arbeit ist der Effekt nicht direkt übertragbar.
Urteil: eingeschränkt belegt, für kurze, kontextarme Schreibaufgaben gemessen, als Aussage über Büroarbeit insgesamt nicht gedeckt.
Führungsfolge: Für eng umrissene Textroutinen als Startpunkt übernehmen, Wirkung im eigenen Dokumentenprozess nachmessen.
Wortlaut: „Generative KI steigert die Produktivität um 40 Prozent.“ Beliebte Folienzahl ohne Quellenangabe in Vertriebs- und Beratungsdecks.
Ursprung: Quellgattung Folien-Claim: meist eine Vermengung der Noy/Zhang-Zeitersparnis (40 Prozent bei Schreibaufgaben, 2023) oder des BCG-Qualitätsbefunds (40 Prozent Qualitätsbewertung, 2023) zu einer allgemeinen Produktivitätszahl.
Was die Quelle wirklich sagt: Eine Studie, die 40 Prozent allgemeine Produktivitätssteigerung durch GenAI misst, ist nicht auffindbar. Noy/Zhang (2023) messen 40 Prozent Zeitersparnis bei kurzen Schreibaufgaben, Dell’Acqua et al. (2023) 40 Prozent höhere Qualitätsbewertung bei ausgewählten Beratungsaufgaben. Registerbasierte Messungen wie Humlum/Vestergaard (2025) finden dagegen durchschnittliche Zeitersparnisse von unter 3 Prozent.
Urteil: unbelegt, für die Pauschalaussage existiert keine Primärquelle; die anklingenden echten Zahlen messen etwas Engeres.
Führungsfolge: Verwerfen und bei Anbietern Stichprobe, Baseline und Messmethode für jedes Wirkversprechen einfordern.
Wortlaut: „KI spart jedem Mitarbeiter eine Stunde pro Tag.“ Vendor- und Konferenzfassung, inzwischen auch als „zwei Stunden pro Tag“ im Umlauf.
Ursprung: Adecco Group, „Global Workforce of the Future“-Befragung (2024: rund 35.000 Beschäftigte in 27 Ländern; Folgeausgabe 2025), medial verdichtet.
Was die Quelle wirklich sagt: Die Adecco-Befragung (2024) erhob Selbstauskünfte: KI-Nutzer schätzten ihre Ersparnis im Mittel auf eine Stunde pro Tag, 2025 auf zwei Stunden. Der 2025er-Bericht vermerkt selbst, dass diese Wahrnehmung von der bei Arbeitgebern messbaren Produktivität abweicht. Registerbasierte Messungen (Humlum/Vestergaard, 2025) finden bei Nutzern nur rund 3 Prozent Zeitersparnis, also etwa 15 Minuten pro Achtstundentag.
Urteil: irreführend, eine Selbstauskunft von Nutzern wird zur Messung für „jeden Mitarbeiter“ umgedeutet, während harte Messungen ein Mehrfaches darunter liegen.
Führungsfolge: Verwerfen als Business-Case-Grundlage; Zeiteffekte nur aus eigenen Prozessmessungen ableiten.
Wortlaut: „Ökonomen zeigen: KI hat auf dem Arbeitsmarkt bisher gar nichts verändert.“
Ursprung: Humlum, Vestergaard: „Large Language Models, Small Labor Market Effects“, NBER Working Paper 33777, Mai 2025.
Was die Quelle wirklich sagt: Die Studie (2025) verknüpft Befragungen von 25.000 Beschäftigten in 7.000 dänischen Betrieben (elf exponierte Berufe) mit Registerdaten. Sie findet präzise Nulleffekte auf Löhne und erfasste Stunden, Effekte über 2 Prozent sind ausgeschlossen, auch bei Intensivnutzern. Zugleich dokumentiert sie erhebliche Aufgaben-Umschichtung und neue KI-Tätigkeiten; „gar nichts verändert“ sagt die Quelle ausdrücklich nicht.
Urteil: eingeschränkt belegt, der Nulleffekt auf Löhne und Stunden ist für Dänemark 2023 bis 2024 solide belegt, die Ausweitung auf „keinerlei Wirkung“ widerspricht der Quelle selbst.
Führungsfolge: Als Dämpfer für kurzfristige Einsparungs-Business-Cases übernehmen, Stillstands-Rhetorik daraus verwerfen.
Wortlaut: „Wegen KI ist die Beschäftigung von Berufseinsteigern bereits um 13 Prozent eingebrochen.“
Ursprung: Brynjolfsson, Chandar, Chen: „Canaries in the Coal Mine?“, Stanford Digital Economy Lab, August 2025 (revidierte Fassung November 2025), auf Basis von ADP-Lohndaten.
Was die Quelle wirklich sagt: Die Studie (2025) findet in US-Payroll-Daten für 22- bis 25-Jährige in den am stärksten KI-exponierten Berufen einen relativen Beschäftigungsrückgang von 13 Prozent (revidiert 16 Prozent nach Kontrolle von Firmeneffekten) gegenüber wenig exponierten Gruppen. Ältere Beschäftigte derselben Berufe blieben stabil oder wuchsen; der Effekt läuft über weniger Einstellungen, nicht über Löhne. Die Autoren nennen die Befunde konsistent mit einer KI-Wirkung, beanspruchen aber keinen vollständigen Kausalbeweis; es sind US-Daten, relative Werte, kein absoluter Einbruch.
Urteil: eingeschränkt belegt, der relative Befund ist datenstark, die Kurzfassung unterschlägt „relativ“, „USA“ und die vorsichtige Kausalaussage der Autoren.
Führungsfolge: Als Frühindikator für die eigene Nachwuchs- und Einstellungsplanung beobachten, nicht als bewiesene Pauschalwirkung zitieren.
Wortlaut: „Bei JPMorgan hat der KI-Coding-Assistent die Effizienz der Entwickler um 10 bis 20 Prozent gesteigert.“ Häufig als Beleg dafür zitiert, dass sich Coding-KI im Konzernmaßstab rechnet.
Ursprung: Aussage der JPMorgan-CIO Lori Beer gegenüber Reuters, 13. März 2025; Quellgattung Anbieter-/Managementaussage.
Was die Quelle wirklich sagt: Reuters (2025) zitiert die Managementaussage, zehntausende Entwickler der Bank hätten mit dem hauseigenen Assistenten 10 bis 20 Prozent Produktivität gewonnen. Wie „Effizienz“ definiert, gegen welche Baseline und mit welcher Methode gemessen wurde, ist nicht veröffentlicht. Es ist eine unabhängig nicht prüfbare Selbstauskunft eines Unternehmens mit Interesse am eigenen KI-Narrativ.
Urteil: unbelegt, die Aussage ist als Zitat dokumentiert, eine prüfbare Messung dahinter ist nicht auffindbar.
Führungsfolge: Verwerfen als Beleg; solche Konzernbeispiele nur als Anekdote kennzeichnen und eigene Pilotmessung vorschalten.
Ein Briefing pro Woche: Entscheidungsfragen, eingeordnete Zahlen und Fristen. Ihre Adresse geben wir nicht weiter.
1 Min. Lesezeit
Jetzt lesen7 Min. Lesezeit
Jetzt lesen7 Min. Lesezeit
Jetzt lesen