100 KI-Claims im Faktencheck
12 Min. Lesezeit
Jetzt lesenKIONIER plant eine eigene, wiederholte Erhebung zum Stand der KI-Transformation im Mittelstand. Dieser Beitrag legt das Design vorab offen: Stichprobe, Rekrutierung, Fragebogen, Bias-Risiken und Publikationsregeln.
KIONIER baut ein eigenes Erhebungsformat für den Stand der KI-Transformation in Unternehmen mit 250 bis 2.000 Beschäftigten im deutschsprachigen Raum. Der Monitor ist geplant, nicht durchgeführt: Es gibt noch keine Ergebnisse, und dieser Beitrag behauptet keine. Stattdessen legt er das komplette Design vor der ersten Feldwelle offen: Zielpopulation, Rekrutierungsweg, Fragebogenblöcke, bekannte Verzerrungen und Publikationsregeln. Der Anspruch dahinter ist überprüfbar begründet: Die verfügbaren KI-Studien liefern je nach Methode Adoptionswerte zwischen 20 und 88 Prozent. Wer Investitionen an solchen Zahlen ausrichtet, sollte wissen, wie sie zustande kommen, und braucht einen Vergleichsmaßstab mit offener Methodik.
Ein Geschäftsführer, der sich 2026 einordnen will, findet vier seriöse Quellen mit vier Welten. Bitkom meldet 36 Prozent KI-Nutzung in Unternehmen ab 20 Beschäftigten, fast eine Verdopplung binnen eines Jahres (2025, 604 telefonisch befragte Unternehmen). Das KfW-Mittelstandspanel kommt für den Zeitraum 2022 bis 2024 auf 20 Prozent im gesamten Mittelstand, bei größeren Mittelständlern ab 50 Beschäftigten auf 36 Prozent (KfW Research 2026). McKinsey berichtet global 88 Prozent Nutzung in mindestens einer Funktion, aber nur 39 Prozent mit irgendeinem Ergebniseffekt (State of AI, 2025). Deloitte wiederum fand fast durchgängig positive Renditemeldungen, befragte dafür aber ausschließlich Unternehmen, die bereits KI implementieren (State of Generative AI, Q4 2024). Alle vier Befunde sind korrekt erhoben. Sie messen nur verschiedene Dinge. Wer daraus ohne Methodikblick Budgets ableitet, steuert mit fremden Koordinaten.
Die meisten Erhebungen fragen, ob KI genutzt wird. Für eine Geschäftsführung ist das die uninteressanteste Frage, denn ein einzelner Copilot-Vertrag macht aus einem Unternehmen keinen Transformationsfall. Der Monitor fragt stattdessen nach Steuerungsfähigkeit, in sechs Blöcken:
Portfolio: Existiert ein vollständiges Inventar der KI-Vorhaben und -Systeme mit benannten Verantwortlichen? Gibt es ein Gremium mit durchgesetztem Stopprecht?
Betrieb: Wie viele Systeme sind produktiv, und werden sie regelmäßig evaluiert? Gibt es einen definierten Vorfallspfad?
Governance: Sind Freigabeprozesse, Risikoklassifizierung und Zuständigkeiten dokumentiert und im Review vorzeigbar?
Daten: Werden Berechtigungen zur Laufzeit geprüft? Ist geklärt, welche Daten in welche Systeme fließen dürfen?
Wertbeitrag: Welcher Anteil der Vorhaben hat eine Baseline-Messung und definierte Abbruchkriterien?
Arbeit: Sind Aufgabenumbau, Qualifizierung und Beteiligungspfade für betroffene Rollen geregelt?
Die Indikatoren sind binär oder als Anteil skaliert, mit ausgeschriebener Definition im Fragebogen. Das macht sie weniger elegant als einen Reife-Score von 1 bis 100, aber prüfbar. Ein Index, dessen Gewichtung niemand kennt, lässt sich weder kritisieren noch replizieren.
Ein Reifegrad-Score ohne offengelegte Berechnung ist keine Messung, sondern eine Meinung mit Nachkommastelle.
Hier steht der unbequemste Teil des Designs, absichtlich vor der Erhebung. Die Zielpopulation sind Unternehmen mit 250 bis 2.000 Beschäftigten in Deutschland, Österreich und der Schweiz, branchenoffen mit Ausweis des Branchenmixes. Befragt werden Geschäftsführung, CIO oder eine benannte Führungskraft mit Auskunftsfähigkeit über die sechs Blöcke.
Die Rekrutierung der ersten Welle läuft über die KIONIER-Leserschaft und deren Netzwerke. Das ist der realistische Weg für ein junges Format, und er hat einen bekannten Preis: Selbstselektion. Wer ein Fachjournal für KI-Entscheider liest und freiwillig 30 Minuten investiert, beschäftigt sich überdurchschnittlich intensiv mit dem Thema. Die erste Welle wird den Mittelstand daher vermutlich reifer zeichnen, als er ist. Der Monitor behauptet deshalb keine Repräsentativität. Er weist stattdessen aus, wie sich die Stichprobe zusammensetzt, und vergleicht sie mit bekannten Verteilungen aus Bitkom- und KfW-Daten, um die Schieflage sichtbar zu machen.
Dazu kommen zwei weitere Verzerrungen, die jede Führungsbefragung trifft. Erstens Selbstauskunft: Führungskräfte überschätzen dokumentierte Kontrollen regelmäßig. Der Fragebogen mildert das durch Dokumentationschecks, die nach konkreten Artefakten fragen, etwa nach den Feldern des Inventars statt nach dessen Existenz. Zweitens Survivorship: Unternehmen mit abgebrochenen KI-Vorhaben antworten seltener. Beide Effekte lassen sich benennen und eingrenzen, aber nicht wegrechnen. Genau deshalb bleibt die erste Welle deskriptiv: Verteilungen und Anteile, keine Kausalaussagen, keine Erfolgsformeln.
Der Monitor tritt nicht gegen die etablierten Erhebungen an, er füllt eine Lücke zwischen ihnen. Die faire Einordnung:
| Studie | Methode und Stichprobe | Stärke | Grenze für den Mittelstands-Vergleich |
|---|---|---|---|
| Bitkom, KI 2025 | 604 Unternehmen ab 20 Beschäftigten, telefonisch, repräsentativ angelegt | Konsistente Zeitreihe für Deutschland | Breite KI-Definition, Selbstauskunft, 250 bis 2.000 Beschäftigte nicht separat ausgewiesen |
| KfW-Mittelstandspanel 2025/2026 | Repräsentatives Panel, KI-Nutzung 2022 bis 2024, Probit-Analyse | Sauberste Mittelstands-Abdeckung, Panelqualität | Erhebungszeitraum liegt zurück; enge KI-Definition dämpft Werte |
| Deloitte, State of GenAI Q4 2024 | 2.773 Führungskräfte in 14 Ländern, nur Unternehmen mit aktiver KI-Implementierung | Tiefe bei Skalierungs- und Governance-Fragen | Zulassungskriterium erzeugt Positiv-Auswahl; ROI-Meldungen nicht auf Nicht-Nutzer übertragbar |
| McKinsey, State of AI 2025 | Rund 2.000 Befragte in über 100 Ländern, Online-Panel | Global vergleichbare Funktions- und Wirkungsfragen | Globale Mischung, Selbstauskunft, kein DACH-Mittelstandsfokus |
| MIT NANDA, GenAI Divide 2025 | 52 Interviews, 153 Survey-Antworten, 300+ öffentliche Initiativen | Ehrlich dokumentierte eigene Limitationen | Kleine Gelegenheitsstichprobe; die zitierte 95-Prozent-Zahl trägt die mediale Last nicht |
| Humlum/Vestergaard, NBER 2025 | Dänische Registerdaten, verknüpft mit Adoptionsbefragungen | Goldstandard: Verwaltungsdaten statt Selbstauskunft | Dänemark, Beschäftigtenperspektive; keine Unternehmens-Steuerungsfragen |
Die Tabelle zeigt das Muster: Es gibt exzellente Zeitreihen, exzellente Panels und exzellente Registerdaten. Was fehlt, ist eine Erhebung, die Steuerungsfähigkeit im Größenband 250 bis 2.000 misst und ihr Instrument komplett offenlegt. Diese Lücke soll der Monitor schließen, in seiner ersten Welle bescheiden, ab der zweiten Welle mit Zeitvergleich.
Die wichtigste Zeile jeder Studie steht nicht in der Pressemitteilung, sondern im Methodenkasten. Wer den nicht findet, sollte die Zahl nicht zitieren.
Damit die späteren Ergebnisse zitierfähig sind, gelten fünf vorab fixierte Regeln. Erstens: Vor Feldende erscheinen keine Ergebniszahlen, auch keine Zwischenstände. Zweitens: Gruppenvergleiche werden nur oberhalb einer Mindestzellengröße publiziert; kleinere Zellen werden zusammengelegt oder entfallen. Drittens: Der Fragebogen ist versioniert; Änderungen zwischen Wellen werden dokumentiert und im Zeitvergleich ausgewiesen. Viertens: Korrekturen erscheinen datiert im Änderungsprotokoll statt als stille Überschreibung. Fünftens: Es gibt keine Anbieter-Ranglisten und kein Sponsoring mit Einfluss auf Fragen oder Auswertung; sollte je eine Förderung nötig sein, wird sie ausgewiesen und bleibt von der Auswertung getrennt.
Ebenso wichtig ist, was der Monitor nicht leisten kann. Er misst keine Kausalität: Wenn reifere Unternehmen bessere Ergebnisse berichten, beweist das keine Wirkrichtung. Er ersetzt keine Prüfung: Ein Fragebogen verifiziert keine Kontrollen, auch mit Dokumentationschecks nicht. Er liefert in Welle eins keine Repräsentativität und keine belastbaren Branchenschnitte, wenn die Zellen zu klein bleiben. Und er trifft keine Prognosen. Wer diese Grenzen als Schwäche liest, vergleiche sie mit dem Alternativangebot: Zahlen ohne Methodenkasten.
Unternehmen im Zielband, die teilnehmen oder den Fragebogen vorab als Selbstaudit nutzen wollen, können sich bei der Redaktion melden. Der Fragebogen wird mit Feldstart in versionierter Form frei zugänglich publiziert.
30 Tage
60 Tage
90 Tage
Nein, nicht direkt, denn diese Studien messen unterschiedliche Grundgesamtheiten mit unterschiedlichen KI-Definitionen. Bitkom befragt Unternehmen ab 20 Beschäftigten telefonisch (36 Prozent Nutzung, 2025), das KfW-Mittelstandspanel kommt für 2022 bis 2024 auf 20 Prozent, McKinsey meldet global 88 Prozent Nutzung in mindestens einer Funktion (2025). Ihr Unternehmen liegt je nach Studie also gleichzeitig vorn und hinten. Belastbar ist nur ein Vergleich mit Unternehmen ähnlicher Größe, Branche und Definition. Genau diese Vergleichbarkeit soll der Monitor mit offener Methodik herstellen.
Die Teilnahme kostet kein Geld, sondern 20 bis 30 Minuten Arbeitszeit einer auskunftsfähigen Führungskraft plus etwas Vorbereitung beim Zusammensuchen von Fakten wie Inventar und Gremienstruktur. Dafür erhalten Teilnehmer den vollständigen Fragebogen als internes Selbstaudit-Werkzeug und nach Feldende den deskriptiven Ergebnisreport mit allen Methodikgrenzen. Einen individuellen Beratungsreport gibt es nicht, das wäre eine andere Gattung. Der eigentliche Wert liegt im strukturierten Selbstbild: Die meisten Teilnehmer wissen nach dem Ausfüllen präziser, wo ihre Steuerungslücken liegen.
Das Hauptrisiko wäre Re-Identifikation in kleinen Auswertungszellen, und genau dagegen richten sich die Publikationsregeln. Ergebnisse erscheinen nur aggregiert; Vergleiche zwischen Gruppen werden nur oberhalb einer Mindestzellengröße publiziert, kleinere Zellen werden zusammengelegt oder weggelassen. Einzelantworten werden nicht veröffentlicht, nicht an Anbieter weitergegeben und nicht für Vertriebszwecke verwendet. Firmennamen sind für die Auswertung nicht erforderlich. Wer sensible Angaben auslassen will, kann Fragen überspringen; ein Teilausfall wird als solcher ausgewiesen statt aufgefüllt.
Mit dem Fragebogen als internem Selbstaudit, denn dafür braucht es keine Vergleichsdaten. Die Indikatoren sind bewusst als Ja/Nein- und Anteilsfragen gebaut: Existiert ein vollständiges KI-Inventar mit Owner? Hat ein Gremium ein durchgesetztes Stopprecht? Welcher Anteil der Vorhaben hat Baseline und Abbruchkriterien? Ein Nachmittag mit CIO, Fachbereichs- und HR-Vertretung ergibt ein ehrliches Ist-Bild und eine priorisierte Lückenliste. Der spätere Monitor-Report liefert dann die Einordnung, wie verbreitet diese Lücken im Mittelstand sind.
Weil die Reihenfolge das Ergebnis diszipliniert: Wer das Instrument vorab festschreibt, kann es hinterher nicht unbemerkt an gewünschte Befunde anpassen. Die Vorab-Registrierung von Fragebogen und Auswertungsregeln ist in der empirischen Forschung der anerkannte Schutz gegen nachträgliches Zurechtbiegen. Sie erlaubt außerdem Kritik, solange sie noch etwas ändern kann. Der Preis ist sichtbare Unfertigkeit: Dieser Artikel enthält bewusst keine einzige Ergebniszahl. Das ist kein Mangel, sondern die Bedingung dafür, dass die späteren Zahlen zitierfähig sind.
Belegt sind in diesem Beitrag ausschließlich die Aussagen über fremde Studien: deren Stichproben, Methoden und publizierte Werte, jeweils mit Quelle in der Liste unten. Redaktionelle Setzung sind: der Zuschnitt der sechs Indikatorblöcke, die Publikationsregeln und die Einschätzung, welche Lücke der Monitor füllt. Der Monitor selbst ist ein geplantes Format ohne Felddaten; sämtliche Aussagen über seine künftige Stichprobe sind Absichtserklärungen, deren Einlösung am publizierten Fragebogen und am ersten Ergebnisreport überprüfbar sein wird. Dieser Artikel ist bewusst ein Methoden-Hub. Er belegt keinen Transformationsstand und ersetzt keine eigene Erhebung im Unternehmen.
Methodik: Alle Angaben zu fremden Studien wurden im Juli 2026 per Web-Recherche gegen die genannten Primärquellen geprüft; Stichproben und Erhebungszeiträume sind den Methodenteilen der Quellen entnommen. Der Monitor selbst ist als geplantes Format gekennzeichnet, Ergebniszahlen existieren nicht und werden nicht behauptet. Erstfassung mit KI-Unterstützung erstellt, menschliche Faktenprüfung und redaktionelle Freigabe vor Veröffentlichung.
| Datum | Änderung |
|---|---|
| 2026-07-23 | Erstfassung Launch-Korpus (Status: draft) |
| 2026-07-23 | Vollständige Neufassung: Studienvergleich mit Primärquellen, ehrliche Stichproben-Offenlegung, Publikationsregeln, FAQ- und Maßnahmenblock ergänzt |
Ein Briefing pro Woche: Entscheidungsfragen, eingeordnete Zahlen und Fristen. Ihre Adresse geben wir nicht weiter.
12 Min. Lesezeit
Jetzt lesen