Ausgabe 39/2026 · Stand: Mittwoch, 23. September 2026 Das Fachmagazin für KI-Transformation im Mittelstand
Briefing abonnieren
Evidenz & Methodik

100 KI-Claims im Faktencheck

Von „KI ersetzt 300 Millionen Jobs“ bis „95 Prozent aller Piloten scheitern“: Die wiederkehrenden Behauptungen aus Vertrieb, Beratung und Presse, geprüft gegen die Primärquellen. Zehn Claim-Familien, ein Prüfraster, eine wachsende Liste.

Veröffentlicht · Aktualisiert · 12 Min. Lesezeit
Qualitätstechniker führt einen Tastkopf über ein Bauteil auf der Granitplatte einer Messmaschine.
Ohne Messmethode bleibt jede Wirkungszahl eine Behauptung. Symbolbild, KI-generiert für KIONIER.

Kurzantwort

Wiederkehrende KI-Behauptungen aus Vertrieb, Beratung und Presse sind selten frei erfunden. Sie sind verkürzt: Eine echte Quelle existiert, sagt aber etwas Engeres oder anderes. Die berühmten 300 Millionen Jobs von Goldman Sachs messen Exposition gegenüber Automatisierung, nicht Ersatz. Die 95 Prozent Scheiterquote von MIT NANDA beruht auf 52 Interviews und 153 Fragebögen mit selbst dokumentierten Grenzen. Gartners 30 Prozent Projektabbrüche sind eine Prognose aus 2024, keine Messung. Dieser Beitrag liefert das Prüfraster der Redaktion und die zehn häufigsten Claim-Familien mit Urteil; die fortlaufende Liste bis zur Nummer 100 wächst als lebendes Format auf dieser Seite weiter.

Die Kernaussagen

  • Die dominante Fehlerart ist der vertauschte Gegenstand: Exposition wird als Ersatz zitiert, Prognose als Messung, Teilstichprobe als Gesamtmarkt.
  • Pessimismus verkauft sich so gut wie Hype: Scheiter-Claims verbreiten sich ungeprüft schneller als die Studien, die sie angeblich stützen.
  • Selbstauskunft überschätzt Wirkung messbar: Entwickler in der METR-Studie fühlten sich 20 Prozent schneller und waren 19 Prozent langsamer.
  • Kontrollierte Messungen und Registerdaten zeigen bisher kleinere, langsamere Effekte als Befragungen und Anbieterstudien.
  • Zehn Claim-Familien decken den Großteil dessen ab, was in Gremien zitiert wird; wer sie kennt, erkennt neue Varianten sofort.
  • Ein Claim, dessen Methodenkasten sich nicht finden lässt, ist kein Argument, sondern ein offener Rechercheauftrag.

Warum die Frage jetzt zählt

Im Sommer 2025 lief dieselbe Zahl durch Fachpresse, Vorstandsfolien und Verkaufsgespräche: 95 Prozent aller KI-Piloten scheitern. Der zugrunde liegende Bericht von MIT Project NANDA beruhte auf 52 Interviews und 153 Fragebögen, bezog sich auf eine enge Teilfrage und listete seine Grenzen selbst auf. Geprüft haben das die wenigsten Zitierenden; unabhängige Nachrecherchen fanden für die Kernzahl keine tragfähige Datenbasis im Bericht. Zur gleichen Zeit wurde Gartners Prognose von mindestens 30 Prozent abgebrochenen GenAI-Projekten (Pressemitteilung Juli 2024) regelmäßig als gemessene Abbruchquote wiedergegeben. Beide Fälle zeigen dasselbe Muster: Zahlen entkoppeln sich von ihrem Gegenstand und werden Budgetwahrheiten. Für Geschäftsführungen ist das kein akademisches Problem. Auf solchen Zahlen stehen Investitionsentscheidungen, Personalplanungen und Erwartungen an Renditen.

Das Prüfraster: sieben Schritte je Claim

Jeder Claim durchläuft in der Redaktion dieselbe Prüfung. Das Raster ist bewusst schlicht, damit es auch intern in Unternehmen funktioniert.

Erstens: Behauptung im Wortlaut festhalten, inklusive Zahl und Geltungsanspruch. Zweitens: Claim-Typ bestimmen; Zahl, Kausalaussage, Rechtsaussage oder Best-Practice-Behauptung brauchen unterschiedliche Belege. Drittens: Primärquelle suchen; existiert keine, endet die Prüfung mit „unbelegt“. Viertens: Methodenkasten lesen: Stichprobe, Rekrutierung, Zeitraum, Definitionen. Fünftens: Originalaussage mit der zitierten Fassung vergleichen; hier fallen die meisten Claims. Sechstens: Übertragbarkeit auf das eigene Umfeld bewerten, für dieses Journal auf Unternehmen mit 250 bis 2.000 Beschäftigten im deutschsprachigen Raum. Siebtens: Urteil in vier Stufen dokumentieren: belegt, eingeschränkt belegt, unbelegt, irreführend. Dazu kommt die Führungsfolge: übernehmen, nur mit eigener Messung übernehmen oder verwerfen.

Die meisten KI-Claims sterben nicht an der Quelle, sondern am Vergleich mit ihr: Die Quelle existiert, sagt aber nicht das, wofür sie zitiert wird.

Zehn Claim-Familien im Urteil

Die folgende Tabelle prüft die zehn Familien, aus denen fast alle Gremienzitate stammen. Jede Zeile steht für dutzende Varianten; die Formulierungen sind typisierte Beispiele, keine Zitate benannter Firmen.

Claim-Familie Typischer Ursprung Was die Quelle wirklich sagt Urteil
„KI ersetzt 300 Millionen Jobs“ Goldman Sachs (2023), medial verkürzt 300 Mio. Vollzeitäquivalente sind der Automatisierung „ausgesetzt“; die meisten Berufe nur teilweise, eher Ergänzung als Ersatz Irreführend verkürzt
„95 Prozent der KI-Projekte scheitern“ MIT NANDA (2025), medial verkürzt Enge Teilaussage zu maßgeschneiderten Unternehmens-Tools; 52 Interviews, 153 Fragebögen, Grenzen selbst dokumentiert Unbelegt in dieser Form
„30 Prozent der GenAI-Projekte werden abgebrochen“ Gartner (2024) Prognose („werden bis Ende 2025“), keine Messung; Gründe: Datenqualität, Kosten, unklarer Nutzen Eingeschränkt: als Prognose belegt, als Messung falsch
„KI macht Entwickler X Prozent schneller“ Anbieterstudien, Selbstauskünfte METR-RCT (2025): erfahrene Entwickler mit KI 19 Prozent langsamer, obwohl sie sich 20 Prozent schneller fühlten; Kontext: reife Codebasen Eingeschränkt: stark kontextabhängig
„KI zahlt bereits aufs Unternehmensergebnis ein“ Beratungs- und Vendor-Folien McKinsey (2025): über 80 Prozent sehen keinen spürbaren GenAI-Effekt auf das Unternehmensergebnis; nur Minderheit berichtet überhaupt Ergebniswirkung Eingeschränkt: auf Use-Case-Ebene ja, unternehmensweit selten
„Die Konkurrenz ist schon viel weiter“ Selektives Studien-Zitieren Bitkom (2025): 36 Prozent Nutzung ab 20 Beschäftigten; KfW: 20 Prozent im Mittelstand 2022 bis 2024; McKinsey global: 88 Prozent. Die Spannweite ist Definitionssache Eingeschränkt: ohne Vergleichsgruppe wertlos
„KI verändert in Wahrheit gar nichts“ Skeptiker-Essays NBER-Registerdaten (2025): Nulleffekte auf Löhne und Stunden, aber massiver Umbau von Aufgaben und neuen Tätigkeiten Irreführend: Stillstand ist es nicht
„Der Betriebsrat blockiert KI grundsätzlich“ Anekdoten, Projektfrust WSI-Betriebsrätebefragung: mitbestimmte Betriebe führen KI ein, begleitet von umfangreicher Weiterbildung; Rechtsprechung differenziert nach Einzelfall Unbelegt
„Ohne CAIO/CoE/eigenes LLM geht es nicht“ Beratungs- und Kongressrhetorik Keine belastbare Primärstudie stützt einen Organisations- oder Technikzwang; Erfolgsfaktoren-Listen beruhen auf Korrelationen in Selbstauskünften Unbelegt
„Studie zeigt: fast alle erzielen ROI“ Anbieternahe Befragungen Deloitte (Q4 2024): befragt wurden nur Unternehmen mit aktiver KI-Implementierung; Positiv-Auswahl per Zulassungskriterium Eingeschränkt: gilt nur für die Vorauswahl

Drei Muster ziehen sich durch. Erstens die Gegenstandsverschiebung: „ausgesetzt“ wird zu „ersetzt“, „Prognose“ zu „Messung“, „Teilstichprobe“ zu „alle“. Zweitens die Stichproben-Blindheit: Wer nur KI-aktive Unternehmen befragt, findet KI-Erfolge; wer Führungskräfte fragt, erhält Selbstbilder. Drittens die Richtungs-Symmetrie: Verkürzung tritt bei Optimisten und Pessimisten gleichermaßen auf. Ein Faktencheck, der nur Hype prüft, ist selbst einer.

Drei Tiefenprüfungen als Muster

Prognose als Messung: die Gartner-30. Die Pressemitteilung vom Juli 2024 kündigt an, dass mindestens 30 Prozent der GenAI-Projekte nach dem Proof of Concept bis Ende 2025 aufgegeben würden, wegen Datenqualität, Risikokontrollen, Kosten oder unklarem Nutzen. Das ist eine begründete Erwartung eines Marktforschers, keine Erhebung von Abbruchquoten. Wer sie als Ist-Zahl zitiert, verwechselt Wetterbericht und Thermometer. Führungsfolge: als Risikohinweis ernst nehmen, als Messwert verwerfen, eigene Abbruchkriterien definieren.

Mediale Eigendynamik: die NANDA-95. Der Bericht nennt 95 Prozent „ohne messbaren Ergebniseffekt“ und beschreibt zugleich, dass Werkzeuge wie allgemeine Chat-Assistenten breit genutzt werden. Die Scheiter-Zahl bezieht sich auf spezialisierte Unternehmens-Tools in einem Sechs-Monats-Fenster; die Datengrundlage ist schmal, die Limitationsliste der Autoren lang. Unabhängige Prüfungen, darunter von Wissenschaftlern und Fachmedien, fanden keine tragfähige Herleitung der Kernzahl. Führungsfolge: das qualitative Muster (Pilot-Stau, fehlendes Lernen der Systeme) ist diskutierenswert, die Zahl nicht zitierfähig.

Wahrnehmung gegen Messung: das METR-Paradox. In einem randomisierten Experiment mit 16 erfahrenen Open-Source-Entwicklern und 246 realen Aufgaben waren Teilnehmer mit KI-Werkzeugen 19 Prozent langsamer, prognostizierten vorher aber 24 Prozent Beschleunigung und glaubten hinterher an 20 Prozent. Das Setting ist speziell: sehr erfahrene Entwickler in reifen, großen Codebasen, Werkzeugstand Anfang 2025. Der übertragbare Befund ist nicht „KI verlangsamt“, sondern: Gefühlte Produktivität ist als Messgröße unbrauchbar. Führungsfolge: Wirkung nur über Baseline und gemessene Durchlaufzeiten bewerten, nie über Zufriedenheitsumfragen allein.

Wenn eine Zahl gleichzeitig auf einer Vertriebsfolie, in einer Boulevard-Schlagzeile und in einer Vorstandsvorlage steht, ist die Wahrscheinlichkeit hoch, dass niemand der drei die Quelle gelesen hat.

Wie die Liste auf 100 wächst

Der Titel verspricht hundert geprüfte Behauptungen, und dieses Versprechen wird als System eingelöst statt als einmaliger Kraftakt. Die zehn Familien oben bilden das Ordnungsraster; jede neu geprüfte Variante erhält eine laufende Nummer, das dokumentierte Urteil und das Prüfdatum. Die Liste wächst mit jeder Ausgabe und mit Leserhinweisen: Wer einem Claim begegnet, der hier fehlt, kann ihn mit Fundstelle an die Redaktion geben. Gegenbelege werden genauso behandelt wie neue Claims; ändert sich eine Beleglage, wird das Urteil datiert korrigiert statt still überschrieben.

Drei Regeln sichern die Qualität des Formats. Keine erfundenen Zitate: Typisierte Formulierungen werden als solche gekennzeichnet, wörtliche Zitate nur mit Fundstelle und nie fiktiv einer benannten Firma zugeschrieben. Anbieterstudien sind zulässig, aber mit Interessenvermerk und dem Hinweis, wen die Stichprobe abbildet. Und ein Claim ohne auffindbare Primärquelle wird nicht wohlwollend umformuliert, sondern als unbelegt geführt, bis jemand eine Quelle liefert.

Maßnahmen für die Geschäftsführung

30 Tage

  • Claim-Log einführen: Jede entscheidungsrelevante KI-Zahl wird mit Wortlaut, Quelle, Prüfurteil und Datum erfasst. Owner: Stabsfunktion oder CIO-Office.
  • Die drei meistzitierten Zahlen aus den letzten Gremienunterlagen nachprüfen und das Ergebnis im Führungskreis vorstellen. Owner: CIO.
  • Hausregel beschließen: keine Zahl ohne Quellenangabe in Entscheidungsvorlagen. Owner: Geschäftsführung.

60 Tage

  • Das siebenstufige Prüfraster als verbindlichen Anhang für Investitionsvorlagen mit KI-Bezug einführen. Owner: Geschäftsführung mit Controlling.
  • Vendor-Angebote mit Wirkversprechen systematisch um Belege bitten: Stichprobe, Baseline, Messmethode. Owner: Einkauf mit Fachbereich.
  • Externe Kommunikation prüfen: Werden eigene KI-Wirkaussagen nach außen getragen, die keine eigene Messung stützt? Owner: Marketing-Leitung mit Rechtsberatung.

90 Tage

  • Eigene Messstandards festschreiben: Jedes KI-Vorhaben erhält Baseline, Zielgröße und Abbruchkriterium vor dem Start. Owner: Portfoliogremium.
  • Claim-Log-Review als festen Tagesordnungspunkt im Quartalsrhythmus etablieren. Owner: Geschäftsführung.
  • Erfahrungswerte dokumentieren: gemessene eigene Effekte den extern zitierten gegenüberstellen und Abweichungen erklären. Owner: Controlling.

Was Führung jetzt entscheiden muss

  • Gilt ab sofort die Regel: keine KI-Zahl ohne Quellenangabe in Entscheidungsvorlagen?
  • Ist ein Claim-Log mit Owner eingerichtet, und wer prüft neue Zahlen vor Gremiensitzungen?
  • Sind die aktuell in unseren Business Cases verbauten Studienzahlen gegen ihre Primärquellen geprüft?
  • Verlangen wir von Anbietern Belege mit Stichprobe und Messmethode für Wirkversprechen?
  • Haben unsere eigenen KI-Vorhaben Baseline, Zielgröße und Abbruchkriterium vor dem Start?
  • Ist geprüft, dass unsere Außenkommunikation keine ungestützten Wirkzahlen enthält?
  • Gibt es einen Kanal, über den Mitarbeitende zweifelhafte Claims zur Prüfung melden können?

Häufige Fragen (FAQ)

Stimmt es, dass 95 Prozent aller KI-Projekte scheitern?

Nein, diese Zahl ist in ihrer verbreiteten Form nicht belegt. Sie stammt aus dem Bericht „The GenAI Divide“ von MIT Project NANDA (2025), der auf 52 Interviews und 153 Fragebögen beruht und dessen 95-Prozent-Aussage sich auf ausbleibenden Ergebniseffekt maßgeschneiderter Unternehmens-Tools bezieht, nicht auf KI-Projekte insgesamt. Die Autoren listen die Grenzen selbst auf: kleine Stichprobe, mögliche Selektionsverzerrung, kurzes Messfenster. Als Warnung vor Pilot-Stau ist der Bericht nützlich. Als Beleg für eine allgemeine Scheiterquote taugt er nicht, und seriöse Gegenprüfungen kommen zum selben Schluss.

Welche Studienzahlen dürfen wir intern in Gremienvorlagen zitieren?

Zitierfähig ist jede Zahl, zu der Sie Herausgeber, Jahr, Stichprobe und den geprüften Originalsatz angeben können; alles andere gehört nicht in eine Vorlage. Praktisch heißt das: Primärquelle öffnen, Methodenkasten lesen, die Aussage im Wortlaut übernehmen und Einschränkungen mitzitieren. Belastbar nutzbar sind etwa Bitkom- und KfW-Zeitreihen zur Verbreitung oder die NBER-Registerdaten zu Arbeitsmarkteffekten, jeweils mit ihrem Geltungsbereich. Nicht zitierfähig sind Zahlen aus Vendor-Folien ohne auffindbare Quelle. Eine einfache Hausregel wirkt sofort: keine Zahl ohne Fußnote in Entscheidungsvorlagen.

Was kostet es uns, KI-Claims systematisch zu prüfen?

Deutlich weniger als eine einzige Fehlinvestition auf Basis eines verkürzten Claims. Mit einem festen Prüfraster braucht eine geübte Stabsfunktion pro Claim erfahrungsgemäß unter eine Stunde: Quelle finden, Methodenkasten lesen, Aussage und Übertragbarkeit bewerten, Urteil dokumentieren. Für ein Gremium mit monatlich einer Handvoll neuer Zahlen ist das ein überschaubarer laufender Aufwand. Die Alternative ist teurer: Budgets, die auf eine Prognose als vermeintliche Messung gebaut werden, und Erwartungen an Produktivitätsgewinne, die keine kontrollierte Studie in dieser Höhe stützt.

Welches Risiko gehen wir ein, wenn wir auf einen falschen Claim hin investieren oder werben?

Das Investitionsrisiko ist Fehlallokation: Wer etwa flächige Personaleinsparungen einplant, weil eine Expositionszahl als Ersatzquote gelesen wurde, baut Business Cases, die im Betrieb nicht eintreten. Das Kommunikationsrisiko ist mindestens so ernst: Wer ungeprüfte Wirkzahlen in Werbung oder Kundenkommunikation übernimmt, riskiert wettbewerbsrechtliche Angriffe wegen irreführender Angaben; das ist eine Orientierung, keine Rechtsberatung. Intern kommt Glaubwürdigkeitsverlust dazu, wenn versprochene Effekte ausbleiben. Alle drei Risiken haben dieselbe Wurzel und dieselbe Abhilfe: Claims vor Verwendung gegen die Primärquelle prüfen.

Womit fangen wir an, wenn unser Vorstand ständig neue KI-Zahlen zitiert bekommt?

Mit einem Claim-Log und einer einzigen Verfahrensregel: Jede Zahl, die eine Entscheidung beeinflussen soll, bekommt vor der Sitzung einen Prüfvermerk. Das Log hält fest: Behauptung im Wortlaut, Quelle, was die Quelle wirklich sagt, Urteil, Datum. Die ersten Einträge liefern die Klassiker aus diesem Beitrag, danach wächst das Log mit dem eigenen Gremienbetrieb. Nach wenigen Monaten entsteht ein Nebeneffekt, der den Aufwand rechtfertigt: Vortragende zitieren vorsichtiger, weil sie wissen, dass geprüft wird.

Evidenz und Grenzen

Belegt sind sämtliche Aussagen über die geprüften Studien: Wortlaut, Stichproben und Methodengrenzen stammen aus den unten gelisteten Primärquellen, die Kritik an der NANDA-Zahl zusätzlich aus dokumentierten unabhängigen Nachprüfungen. Redaktionelle Einschätzung sind die Urteile in der Vierer-Skala, die Auswahl der zehn Familien und die empfohlenen Verfahrensregeln. Der Beitrag leistet keine Vollprüfung aller kursierenden Behauptungen; die Nummerierung bis 100 wächst fortlaufend und ist zum Publikationszeitpunkt nicht abgeschlossen. Aussagen zu rechtlichen Folgen irreführender Werbung sind Orientierung, keine Rechtsberatung. Die Befunde zu Produktivität und Arbeitsmarkt beschreiben den Stand der Messungen von 2023 bis 2025 und können sich mit neuen Studien verschieben.

Quellen und Methodik

  1. Gartner: Pressemitteilung „Gartner Predicts 30% of Generative AI Projects Will Be Abandoned After Proof of Concept By End of 2025“, Juli 2024. https://www.gartner.com/en/newsroom/press-releases/2024-07-29-gartner-predicts-30-percent-of-generative-ai-projects-will-be-abandoned-after-proof-of-concept-by-end-of-2025
  2. MIT Project NANDA: The GenAI Divide, State of AI in Business 2025 (Methodik: 52 Interviews, 153 Survey-Antworten, dokumentierte Limitationen). https://mlq.ai/media/quarterly_decks/v0.1_State_of_AI_in_Business_2025_Report.pdf
  3. McKinsey & Company: The State of AI, 2025, u. a. Befund, dass über 80 Prozent der Befragten keinen spürbaren GenAI-Effekt auf das Unternehmensergebnis sehen. https://www.mckinsey.com/capabilities/quantumblack/our-insights/the-state-of-ai
  4. METR: Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity, 2025 (randomisiertes Experiment, 16 Entwickler, 246 Aufgaben). https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/
  5. Goldman Sachs Global Investment Research (Briggs/Kodnani): The Potentially Large Effects of Artificial Intelligence on Economic Growth, März 2023. https://www.gspublishing.com/content/research/en/reports/2023/03/27/d64e052b-0f6e-45d7-967b-d7be35fabd16.pdf
  6. Humlum, A. / Vestergaard, E.: Still Waters, Rapid Currents, Early Labor Market Transformation under Generative AI. NBER Working Paper 33777, 2025. https://www.nber.org/papers/w33777
  7. Bitkom Research: Künstliche Intelligenz 2025, telefonische Befragung von 604 Unternehmen ab 20 Beschäftigten. https://bitkom-research.de/studien/kuenstliche-intelligenz-2025
  8. KfW Research: Fokus Volkswirtschaft Nr. 533, KI-Nutzung im Mittelstand (Sonderauswertung KfW-Mittelstandspanel), Februar 2026. https://www.kfw.de/PDF/Download-Center/Konzernthemen/Research/PDF-Dokumente-Fokus-Volkswirtschaft/Fokus-2026/Fokus-Nr.-533-Februar-2026-KI-Mittelstand.pdf
  9. Deloitte AI Institute: The State of Generative AI in the Enterprise, Q4 2024, 2.773 Führungskräfte, Zulassung nur bei aktiver KI-Implementierung. https://www.deloitte.com/us/en/about/press-room/state-of-generative-ai.html
  10. Hans-Böckler-Stiftung: Böckler Impuls, Noch kein abrupter Wandel der Arbeitswelt (WSI-Betriebsrätebefragungen 2023 und 2025). https://www.boeckler.de/de/boeckler-impuls-noch-kein-abrupter-wandel-der-arbeitswelt-76591.htm

Methodik: Jede in diesem Beitrag bewertete Behauptung wurde im Juli 2026 per Web-Recherche gegen die genannte Primärquelle geprüft; Wortlaut, Stichprobe und Einschränkungen sind den Methodenteilen entnommen. Typisierte Claim-Formulierungen sind als solche gekennzeichnet und keinem benannten Unternehmen zugeschrieben. Erstfassung mit KI-Unterstützung erstellt, menschliche Faktenprüfung und redaktionelle Freigabe vor Veröffentlichung.

Änderungsprotokoll

Datum Änderung
2026-07-23 Erstfassung Launch-Korpus (Status: draft)
2026-07-23 Vollständige Neufassung: zehn Claim-Familien gegen Primärquellen geprüft, drei Tiefenprüfungen, lebendes Listenformat definiert, FAQ- und Maßnahmenblock ergänzt

Das Entscheider-Briefing

Ein Briefing pro Woche: Entscheidungsfragen, eingeordnete Zahlen und Fristen. Ihre Adresse geben wir nicht weiter.

Sie erhalten zuerst eine E-Mail mit einem Bestätigungslink. Erst nach dem Klick nehmen wir Sie auf. Abmeldung mit einem Klick in jeder Ausgabe.

Weiterführend im Themenfeld