DACH-KI-Transformationsmonitor: Methodik, Stichprobe und offener Fragebogen
13 Min. Lesezeit
Jetzt lesenVon „KI ersetzt 300 Millionen Jobs“ bis „95 Prozent aller Piloten scheitern“: Die wiederkehrenden Behauptungen aus Vertrieb, Beratung und Presse, geprüft gegen die Primärquellen. Zehn Claim-Familien, ein Prüfraster, eine wachsende Liste.
Wiederkehrende KI-Behauptungen aus Vertrieb, Beratung und Presse sind selten frei erfunden. Sie sind verkürzt: Eine echte Quelle existiert, sagt aber etwas Engeres oder anderes. Die berühmten 300 Millionen Jobs von Goldman Sachs messen Exposition gegenüber Automatisierung, nicht Ersatz. Die 95 Prozent Scheiterquote von MIT NANDA beruht auf 52 Interviews und 153 Fragebögen mit selbst dokumentierten Grenzen. Gartners 30 Prozent Projektabbrüche sind eine Prognose aus 2024, keine Messung. Dieser Beitrag liefert das Prüfraster der Redaktion und die zehn häufigsten Claim-Familien mit Urteil; die fortlaufende Liste bis zur Nummer 100 wächst als lebendes Format auf dieser Seite weiter.
Im Sommer 2025 lief dieselbe Zahl durch Fachpresse, Vorstandsfolien und Verkaufsgespräche: 95 Prozent aller KI-Piloten scheitern. Der zugrunde liegende Bericht von MIT Project NANDA beruhte auf 52 Interviews und 153 Fragebögen, bezog sich auf eine enge Teilfrage und listete seine Grenzen selbst auf. Geprüft haben das die wenigsten Zitierenden; unabhängige Nachrecherchen fanden für die Kernzahl keine tragfähige Datenbasis im Bericht. Zur gleichen Zeit wurde Gartners Prognose von mindestens 30 Prozent abgebrochenen GenAI-Projekten (Pressemitteilung Juli 2024) regelmäßig als gemessene Abbruchquote wiedergegeben. Beide Fälle zeigen dasselbe Muster: Zahlen entkoppeln sich von ihrem Gegenstand und werden Budgetwahrheiten. Für Geschäftsführungen ist das kein akademisches Problem. Auf solchen Zahlen stehen Investitionsentscheidungen, Personalplanungen und Erwartungen an Renditen.
Jeder Claim durchläuft in der Redaktion dieselbe Prüfung. Das Raster ist bewusst schlicht, damit es auch intern in Unternehmen funktioniert.
Erstens: Behauptung im Wortlaut festhalten, inklusive Zahl und Geltungsanspruch. Zweitens: Claim-Typ bestimmen; Zahl, Kausalaussage, Rechtsaussage oder Best-Practice-Behauptung brauchen unterschiedliche Belege. Drittens: Primärquelle suchen; existiert keine, endet die Prüfung mit „unbelegt“. Viertens: Methodenkasten lesen: Stichprobe, Rekrutierung, Zeitraum, Definitionen. Fünftens: Originalaussage mit der zitierten Fassung vergleichen; hier fallen die meisten Claims. Sechstens: Übertragbarkeit auf das eigene Umfeld bewerten, für dieses Journal auf Unternehmen mit 250 bis 2.000 Beschäftigten im deutschsprachigen Raum. Siebtens: Urteil in vier Stufen dokumentieren: belegt, eingeschränkt belegt, unbelegt, irreführend. Dazu kommt die Führungsfolge: übernehmen, nur mit eigener Messung übernehmen oder verwerfen.
Die meisten KI-Claims sterben nicht an der Quelle, sondern am Vergleich mit ihr: Die Quelle existiert, sagt aber nicht das, wofür sie zitiert wird.
Die folgende Tabelle prüft die zehn Familien, aus denen fast alle Gremienzitate stammen. Jede Zeile steht für dutzende Varianten; die Formulierungen sind typisierte Beispiele, keine Zitate benannter Firmen.
| Claim-Familie | Typischer Ursprung | Was die Quelle wirklich sagt | Urteil |
|---|---|---|---|
| „KI ersetzt 300 Millionen Jobs“ | Goldman Sachs (2023), medial verkürzt | 300 Mio. Vollzeitäquivalente sind der Automatisierung „ausgesetzt“; die meisten Berufe nur teilweise, eher Ergänzung als Ersatz | Irreführend verkürzt |
| „95 Prozent der KI-Projekte scheitern“ | MIT NANDA (2025), medial verkürzt | Enge Teilaussage zu maßgeschneiderten Unternehmens-Tools; 52 Interviews, 153 Fragebögen, Grenzen selbst dokumentiert | Unbelegt in dieser Form |
| „30 Prozent der GenAI-Projekte werden abgebrochen“ | Gartner (2024) | Prognose („werden bis Ende 2025“), keine Messung; Gründe: Datenqualität, Kosten, unklarer Nutzen | Eingeschränkt: als Prognose belegt, als Messung falsch |
| „KI macht Entwickler X Prozent schneller“ | Anbieterstudien, Selbstauskünfte | METR-RCT (2025): erfahrene Entwickler mit KI 19 Prozent langsamer, obwohl sie sich 20 Prozent schneller fühlten; Kontext: reife Codebasen | Eingeschränkt: stark kontextabhängig |
| „KI zahlt bereits aufs Unternehmensergebnis ein“ | Beratungs- und Vendor-Folien | McKinsey (2025): über 80 Prozent sehen keinen spürbaren GenAI-Effekt auf das Unternehmensergebnis; nur Minderheit berichtet überhaupt Ergebniswirkung | Eingeschränkt: auf Use-Case-Ebene ja, unternehmensweit selten |
| „Die Konkurrenz ist schon viel weiter“ | Selektives Studien-Zitieren | Bitkom (2025): 36 Prozent Nutzung ab 20 Beschäftigten; KfW: 20 Prozent im Mittelstand 2022 bis 2024; McKinsey global: 88 Prozent. Die Spannweite ist Definitionssache | Eingeschränkt: ohne Vergleichsgruppe wertlos |
| „KI verändert in Wahrheit gar nichts“ | Skeptiker-Essays | NBER-Registerdaten (2025): Nulleffekte auf Löhne und Stunden, aber massiver Umbau von Aufgaben und neuen Tätigkeiten | Irreführend: Stillstand ist es nicht |
| „Der Betriebsrat blockiert KI grundsätzlich“ | Anekdoten, Projektfrust | WSI-Betriebsrätebefragung: mitbestimmte Betriebe führen KI ein, begleitet von umfangreicher Weiterbildung; Rechtsprechung differenziert nach Einzelfall | Unbelegt |
| „Ohne CAIO/CoE/eigenes LLM geht es nicht“ | Beratungs- und Kongressrhetorik | Keine belastbare Primärstudie stützt einen Organisations- oder Technikzwang; Erfolgsfaktoren-Listen beruhen auf Korrelationen in Selbstauskünften | Unbelegt |
| „Studie zeigt: fast alle erzielen ROI“ | Anbieternahe Befragungen | Deloitte (Q4 2024): befragt wurden nur Unternehmen mit aktiver KI-Implementierung; Positiv-Auswahl per Zulassungskriterium | Eingeschränkt: gilt nur für die Vorauswahl |
Drei Muster ziehen sich durch. Erstens die Gegenstandsverschiebung: „ausgesetzt“ wird zu „ersetzt“, „Prognose“ zu „Messung“, „Teilstichprobe“ zu „alle“. Zweitens die Stichproben-Blindheit: Wer nur KI-aktive Unternehmen befragt, findet KI-Erfolge; wer Führungskräfte fragt, erhält Selbstbilder. Drittens die Richtungs-Symmetrie: Verkürzung tritt bei Optimisten und Pessimisten gleichermaßen auf. Ein Faktencheck, der nur Hype prüft, ist selbst einer.
Prognose als Messung: die Gartner-30. Die Pressemitteilung vom Juli 2024 kündigt an, dass mindestens 30 Prozent der GenAI-Projekte nach dem Proof of Concept bis Ende 2025 aufgegeben würden, wegen Datenqualität, Risikokontrollen, Kosten oder unklarem Nutzen. Das ist eine begründete Erwartung eines Marktforschers, keine Erhebung von Abbruchquoten. Wer sie als Ist-Zahl zitiert, verwechselt Wetterbericht und Thermometer. Führungsfolge: als Risikohinweis ernst nehmen, als Messwert verwerfen, eigene Abbruchkriterien definieren.
Mediale Eigendynamik: die NANDA-95. Der Bericht nennt 95 Prozent „ohne messbaren Ergebniseffekt“ und beschreibt zugleich, dass Werkzeuge wie allgemeine Chat-Assistenten breit genutzt werden. Die Scheiter-Zahl bezieht sich auf spezialisierte Unternehmens-Tools in einem Sechs-Monats-Fenster; die Datengrundlage ist schmal, die Limitationsliste der Autoren lang. Unabhängige Prüfungen, darunter von Wissenschaftlern und Fachmedien, fanden keine tragfähige Herleitung der Kernzahl. Führungsfolge: das qualitative Muster (Pilot-Stau, fehlendes Lernen der Systeme) ist diskutierenswert, die Zahl nicht zitierfähig.
Wahrnehmung gegen Messung: das METR-Paradox. In einem randomisierten Experiment mit 16 erfahrenen Open-Source-Entwicklern und 246 realen Aufgaben waren Teilnehmer mit KI-Werkzeugen 19 Prozent langsamer, prognostizierten vorher aber 24 Prozent Beschleunigung und glaubten hinterher an 20 Prozent. Das Setting ist speziell: sehr erfahrene Entwickler in reifen, großen Codebasen, Werkzeugstand Anfang 2025. Der übertragbare Befund ist nicht „KI verlangsamt“, sondern: Gefühlte Produktivität ist als Messgröße unbrauchbar. Führungsfolge: Wirkung nur über Baseline und gemessene Durchlaufzeiten bewerten, nie über Zufriedenheitsumfragen allein.
Wenn eine Zahl gleichzeitig auf einer Vertriebsfolie, in einer Boulevard-Schlagzeile und in einer Vorstandsvorlage steht, ist die Wahrscheinlichkeit hoch, dass niemand der drei die Quelle gelesen hat.
Der Titel verspricht hundert geprüfte Behauptungen, und dieses Versprechen wird als System eingelöst statt als einmaliger Kraftakt. Die zehn Familien oben bilden das Ordnungsraster; jede neu geprüfte Variante erhält eine laufende Nummer, das dokumentierte Urteil und das Prüfdatum. Die Liste wächst mit jeder Ausgabe und mit Leserhinweisen: Wer einem Claim begegnet, der hier fehlt, kann ihn mit Fundstelle an die Redaktion geben. Gegenbelege werden genauso behandelt wie neue Claims; ändert sich eine Beleglage, wird das Urteil datiert korrigiert statt still überschrieben.
Drei Regeln sichern die Qualität des Formats. Keine erfundenen Zitate: Typisierte Formulierungen werden als solche gekennzeichnet, wörtliche Zitate nur mit Fundstelle und nie fiktiv einer benannten Firma zugeschrieben. Anbieterstudien sind zulässig, aber mit Interessenvermerk und dem Hinweis, wen die Stichprobe abbildet. Und ein Claim ohne auffindbare Primärquelle wird nicht wohlwollend umformuliert, sondern als unbelegt geführt, bis jemand eine Quelle liefert.
30 Tage
60 Tage
90 Tage
Nein, diese Zahl ist in ihrer verbreiteten Form nicht belegt. Sie stammt aus dem Bericht „The GenAI Divide“ von MIT Project NANDA (2025), der auf 52 Interviews und 153 Fragebögen beruht und dessen 95-Prozent-Aussage sich auf ausbleibenden Ergebniseffekt maßgeschneiderter Unternehmens-Tools bezieht, nicht auf KI-Projekte insgesamt. Die Autoren listen die Grenzen selbst auf: kleine Stichprobe, mögliche Selektionsverzerrung, kurzes Messfenster. Als Warnung vor Pilot-Stau ist der Bericht nützlich. Als Beleg für eine allgemeine Scheiterquote taugt er nicht, und seriöse Gegenprüfungen kommen zum selben Schluss.
Zitierfähig ist jede Zahl, zu der Sie Herausgeber, Jahr, Stichprobe und den geprüften Originalsatz angeben können; alles andere gehört nicht in eine Vorlage. Praktisch heißt das: Primärquelle öffnen, Methodenkasten lesen, die Aussage im Wortlaut übernehmen und Einschränkungen mitzitieren. Belastbar nutzbar sind etwa Bitkom- und KfW-Zeitreihen zur Verbreitung oder die NBER-Registerdaten zu Arbeitsmarkteffekten, jeweils mit ihrem Geltungsbereich. Nicht zitierfähig sind Zahlen aus Vendor-Folien ohne auffindbare Quelle. Eine einfache Hausregel wirkt sofort: keine Zahl ohne Fußnote in Entscheidungsvorlagen.
Deutlich weniger als eine einzige Fehlinvestition auf Basis eines verkürzten Claims. Mit einem festen Prüfraster braucht eine geübte Stabsfunktion pro Claim erfahrungsgemäß unter eine Stunde: Quelle finden, Methodenkasten lesen, Aussage und Übertragbarkeit bewerten, Urteil dokumentieren. Für ein Gremium mit monatlich einer Handvoll neuer Zahlen ist das ein überschaubarer laufender Aufwand. Die Alternative ist teurer: Budgets, die auf eine Prognose als vermeintliche Messung gebaut werden, und Erwartungen an Produktivitätsgewinne, die keine kontrollierte Studie in dieser Höhe stützt.
Das Investitionsrisiko ist Fehlallokation: Wer etwa flächige Personaleinsparungen einplant, weil eine Expositionszahl als Ersatzquote gelesen wurde, baut Business Cases, die im Betrieb nicht eintreten. Das Kommunikationsrisiko ist mindestens so ernst: Wer ungeprüfte Wirkzahlen in Werbung oder Kundenkommunikation übernimmt, riskiert wettbewerbsrechtliche Angriffe wegen irreführender Angaben; das ist eine Orientierung, keine Rechtsberatung. Intern kommt Glaubwürdigkeitsverlust dazu, wenn versprochene Effekte ausbleiben. Alle drei Risiken haben dieselbe Wurzel und dieselbe Abhilfe: Claims vor Verwendung gegen die Primärquelle prüfen.
Mit einem Claim-Log und einer einzigen Verfahrensregel: Jede Zahl, die eine Entscheidung beeinflussen soll, bekommt vor der Sitzung einen Prüfvermerk. Das Log hält fest: Behauptung im Wortlaut, Quelle, was die Quelle wirklich sagt, Urteil, Datum. Die ersten Einträge liefern die Klassiker aus diesem Beitrag, danach wächst das Log mit dem eigenen Gremienbetrieb. Nach wenigen Monaten entsteht ein Nebeneffekt, der den Aufwand rechtfertigt: Vortragende zitieren vorsichtiger, weil sie wissen, dass geprüft wird.
Belegt sind sämtliche Aussagen über die geprüften Studien: Wortlaut, Stichproben und Methodengrenzen stammen aus den unten gelisteten Primärquellen, die Kritik an der NANDA-Zahl zusätzlich aus dokumentierten unabhängigen Nachprüfungen. Redaktionelle Einschätzung sind die Urteile in der Vierer-Skala, die Auswahl der zehn Familien und die empfohlenen Verfahrensregeln. Der Beitrag leistet keine Vollprüfung aller kursierenden Behauptungen; die Nummerierung bis 100 wächst fortlaufend und ist zum Publikationszeitpunkt nicht abgeschlossen. Aussagen zu rechtlichen Folgen irreführender Werbung sind Orientierung, keine Rechtsberatung. Die Befunde zu Produktivität und Arbeitsmarkt beschreiben den Stand der Messungen von 2023 bis 2025 und können sich mit neuen Studien verschieben.
Methodik: Jede in diesem Beitrag bewertete Behauptung wurde im Juli 2026 per Web-Recherche gegen die genannte Primärquelle geprüft; Wortlaut, Stichprobe und Einschränkungen sind den Methodenteilen entnommen. Typisierte Claim-Formulierungen sind als solche gekennzeichnet und keinem benannten Unternehmen zugeschrieben. Erstfassung mit KI-Unterstützung erstellt, menschliche Faktenprüfung und redaktionelle Freigabe vor Veröffentlichung.
| Datum | Änderung |
|---|---|
| 2026-07-23 | Erstfassung Launch-Korpus (Status: draft) |
| 2026-07-23 | Vollständige Neufassung: zehn Claim-Familien gegen Primärquellen geprüft, drei Tiefenprüfungen, lebendes Listenformat definiert, FAQ- und Maßnahmenblock ergänzt |
Ein Briefing pro Woche: Entscheidungsfragen, eingeordnete Zahlen und Fristen. Ihre Adresse geben wir nicht weiter.
13 Min. Lesezeit
Jetzt lesen