Mitbestimmung und Job Redesign
12 Min. Lesezeit
Jetzt lesenLizenzen und Logins sagen nichts über Wirkung. Ein Messsystem aus zwölf Kennzahlen auf fünf Ebenen trennt Neugier von Nutzung und Nutzung von Ergebnis — und schützt zugleich vor der Überwachungsfalle.
Adoption wird auf fünf Ebenen gemessen: Zugang, aktive Nutzung, Qualität der Nutzung, Prozesswirkung und Ergebnisbeitrag. Zwölf Kennzahlen bilden diese Ebenen als Radar ab, jede mit Definition, Datenquelle, Zielkorridor und bekannter Fehlmessung. Frühindikatoren wie Nutzungstiefe lösen bei Schwellenbruch Coaching und Ablaufkorrekturen aus; rote Wirkungsindikatoren lösen ein Exit-Review aus. Gemessen wird aggregiert auf Team- oder Prozessebene, nicht je Person — sonst wird das Messsystem selbst mitbestimmungspflichtig und zerstört das Vertrauen, das es messen soll. Login-Statistiken allein sind keine Steuerungsgrundlage.
Die Diskrepanz zwischen Nutzung und Wirkung ist inzwischen gut dokumentiert. In der globalen McKinsey-Erhebung 2025 berichten 88 Prozent der Organisationen von regelmäßiger KI-Nutzung in mindestens einer Funktion, aber nur 39 Prozent von irgendeinem Ergebnisbeitrag auf Unternehmensebene; nur rund 6 Prozent erreichen signifikante Wirkung (McKinsey 2025). Die MIT-Untersuchung zum GenAI-Einsatz kommt 2025 zum selben Muster: Trotz Investitionen von 30 bis 40 Milliarden US-Dollar bleiben 95 Prozent der Unternehmensinitiativen ohne messbaren Gewinn-und-Verlust-Effekt (MIT Project NANDA 2025). In Deutschland verdoppelte sich der Unternehmenseinsatz binnen eines Jahres auf 36 Prozent (Bitkom Research 2025). Genau in dieser Phase entscheiden Gremien über Skalierung oder Abbruch, und zwar auf Basis der Zahlen, die ihnen vorgelegt werden. Sind das Login-Statistiken, wird systematisch falsch entschieden.
Das Messsystem folgt einer einfachen Kausalkette. Zugang kommt vor Nutzung: Wer keinen Zugriff hat, kann nicht adoptieren. Aktive Nutzung kommt vor Qualität: Erst regelmäßige Anwendung erzeugt beurteilbare Ergebnisse. Qualität der Nutzung kommt vor Prozesswirkung: Nur Ausgaben, die ohne große Nacharbeit übernommen werden, verändern den Ablauf. Prozesswirkung kommt vor Ergebnisbeitrag: Erst wenn Durchlaufzeit, Fehlerquote oder Aufwand im Zielprozess messbar sinken, kann daraus Geld werden. Und Ergebnisbeitrag ist die einzige Ebene, die eine Investitionsentscheidung trägt.
Die Ebenen eins bis drei sind Frühindikatoren. Sie reagieren schnell und eignen sich für operatives Gegensteuern: Coaching, Ablaufkorrektur, Schulung. Die Ebenen vier und fünf sind Wirkungsindikatoren. Sie reagieren träge, oft erst nach Monaten, und gehören in Portfolio- und Investitionsentscheidungen. Die häufigste Fehlsteuerung besteht darin, Frühindikatoren wie Wirkungsbelege zu behandeln, steigende Nutzungszahlen werden als Erfolg berichtet, während der Zielprozess unverändert läuft.
Eine steigende Nutzungskurve ist kein Erfolgsnachweis, sondern eine offene Wette darauf, dass aus Aktivität irgendwann Wirkung wird.
Die Tabelle definiert das vollständige Radar. Die Zielkorridore sind redaktionelle Startwerte zur Kalibrierung im ersten Betriebsjahr, keine Branchennormen; verbindlich wird der Korridor erst durch den eigenen Business Case.
| Nr. | Kennzahl | Definition | Datenquelle | Zielkorridor (Startwert) | Typische Fehlmessung |
|---|---|---|---|---|---|
| 1 | Zugriffsquote | Anteil der Zielgruppe mit eingerichtetem, funktionierendem Zugang | Berechtigungs-/Lizenzverwaltung | Nahe 100 % der definierten Zielrollen | Gesamtbelegschaft statt Zielgruppe als Nenner |
| 2 | Aktive Nutzung | Anteil der Zielgruppe mit mindestens einer echten Anwendung pro Woche | Plattform-Nutzungsstatistik, aggregiert | Aufbauphase steigend, dann stabil über 60 % | Einmal-Logins und Neugier-Klicks als „aktiv“ gezählt |
| 3 | Nutzungstiefe | Abgeschlossene Vorgänge je aktiv Nutzendem und Woche | Plattformdaten je Prozess, aggregiert | Use-Case-abhängig; Trend zählt | Prompts statt abgeschlossener Vorgänge gezählt |
| 4 | Prozessabdeckung | Anteil der Vorgänge im Zielprozess, die mit KI-Unterstützung laufen | Prozess-/Fallsystem (ERP, Ticketing) | Wachsend Richtung definierter Soll-Abdeckung | Nutzung außerhalb des Zielprozesses mitgezählt |
| 5 | Abschlussquote | Anteil KI-gestützter Vorgänge, die ohne Medienbruch abgeschlossen werden | Prozesssystem | Deutlich über der Hälfte, steigend | Abbrüche als „Teilnutzung“ schöngerechnet |
| 6 | Korrekturquote | Anteil der KI-Ausgaben, die wesentlich nachbearbeitet werden | Stichproben-Review, Zweitprüfung | Sinkt nach Einführungsphase; Bruch = Alarm | Nur Selbstauskunft statt Stichprobe erhoben |
| 7 | Eskalationsquote | Anteil der Vorgänge, die vom System an Menschen zurückgehen | Workflow-/Fallsystem | Stabil im geplanten Band; null ist verdächtig | Null-Eskalation als Qualität statt als Blindstelle gelesen |
| 8 | Zeit bis Erstnutzen | Tage von Zugang bis zur ersten produktiven Anwendung | Plattformdaten, aggregiert je Kohorte | Wenige Tage bis zwei Wochen | Schulungsteilnahme mit Erstnutzung gleichgesetzt |
| 9 | Qualifizierungsgrad | Anteil kritischer Rollen mit abgeschlossener, rollenbezogener Qualifizierung | Lernplattform, HR | Vor Skalierung nahe 100 % der kritischen Rollen | Kurskatalog-Klicks statt nachgewiesener Anwendung |
| 10 | Nutzervertrauen | Wiederkehrende Kurzbefragung zu Nutzen und Verlässlichkeit | Anonyme Pulsbefragung | Stabil positiv; Absturz = Frühwarnung | Einmalbefragung direkt nach dem Kickoff |
| 11 | Prozesskennzahl vs. Baseline | Durchlaufzeit, Fehlerquote oder Aufwand im Zielprozess gegen Vorher-Messung | Prozesssystem, Controlling | Signifikante Verbesserung gegen Baseline | Baseline fehlt oder wurde nachträglich geschätzt |
| 12 | Realisierter Ergebnisbeitrag | Dem Use Case zurechenbarer, kassenwirksamer Effekt mit benanntem Mechanismus | Controlling, Business-Case-Review | Business-Case-Korridor des Use Case | Hochgerechnete Zeitersparnis ohne Kapazitätswirkung |
Drei Lesehinweise. Erstens: Die Kennzahlen 1 bis 3 sind reine Frühindikatoren; sie rechtfertigen keine Skalierungsentscheidung. Zweitens: Kennzahl 12 verlangt einen Mechanismus, eingesparte Minuten werden erst zum Ergebnisbeitrag, wenn sie in weniger Fremdvergabe, mehr Durchsatz am Engpass oder vermiedene Neueinstellung übersetzt sind. Drittens: Die Kennzahlen 6 und 7 sind bewusst doppeldeutig. Eine hohe Korrekturquote kann schlechte Modellqualität bedeuten, aber auch unpassenden Scope oder fehlende Schulung. Sie ist Diagnoseanlass, nie Bestrafungsgrundlage.
Drei Verzerrungen ruinieren Adoptionsberichte regelmäßig.
Vanity-Metriken. Beschaffte Lizenzen, registrierte Konten und Roh-Promptzahlen wachsen fast von selbst und bedeuten fast nichts. Sie gehören allenfalls in den Anhang. Ein Gremium, das skalieren soll, verlangt die Ebenen vier und fünf, und akzeptiert dort auch ein ehrliches „noch nicht messbar“ mit Datum der nächsten Messung.
Schatten-Nutzung. Der Work Trend Index 2024 von Microsoft und LinkedIn fand, dass 75 Prozent der Wissensarbeitenden generative KI einsetzen und 78 Prozent der Nutzenden eigene, private Werkzeuge mitbringen (Microsoft/LinkedIn 2024). Für die Messung heißt das: Die offizielle Plattformstatistik unterschätzt die tatsächliche Adoption und überschätzt zugleich den Anteil der offiziellen Systeme an beobachteten Produktivitätseffekten. Wer im Zielprozess Verbesserungen misst, sollte wissen, welches Werkzeug sie erzeugt hat. Eine anonyme, sanktionsfreie Erhebung der realen Werkzeugnutzung gehört deshalb in jedes Messdesign.
Gaming und Signalverlust. Sobald Kennzahlen Konsequenzen für Personen haben, werden sie bewirtschaftet. Beschäftigte, die Nachteile fürchten, korrigieren still statt dokumentiert, eskalieren nicht mehr und geben in Befragungen das Erwünschte an. Damit sterben genau die Signale, die das Radar braucht. Mehr als die Hälfte der KI-Nutzenden verschweigt die Nutzung bei wichtigen Aufgaben bereits heute (Microsoft/LinkedIn 2024). Die Gegenmaßnahme ist Konstruktion, nicht Appell: aggregierte Messung, zugesicherte Sanktionsfreiheit und der sichtbare Umgang mit Befunden als Lernanlass.
Wer Adoptionskennzahlen an individuelle Leistungsbewertung koppelt, bekommt exakt die Zahlen, die er verdient, und keine, denen er trauen kann.
Das Messsystem selbst ist eine technische Einrichtung, die Verhalten und Leistung sichtbar machen kann. Damit ist es nach § 87 Abs. 1 Nr. 6 BetrVG regelmäßig mitbestimmungspflichtig, sobald es personenbeziehbare Nutzungsdaten des Arbeitgebers auswertet; auf die Absicht kommt es nicht an, die objektive Eignung genügt. Die Entscheidung des Arbeitsgerichts Hamburg vom 16. Januar 2024 (24 BVGa 1/24) bestätigt die Grenze von der anderen Seite: Mitbestimmungsfrei blieb dort gerade die Konstellation, in der der Arbeitgeber keinen Zugriff auf Nutzungsdaten hatte. Ein Adoptions-Dashboard mit Nutzerauflösung liegt auf der anderen Seite dieser Linie.
Dazu kommt die DSGVO: Zweckbindung und Datenminimierung (Artikel 5) verlangen, dass für Adoptionssteuerung nur erhoben wird, was Adoptionssteuerung braucht. Das ist praktisch nie die Einzelperson. Der belastbare Standard lautet deshalb: Aggregation auf Team-, Rollen- oder Prozessebene mit Mindestgruppengrößen, ein schriftliches Auswertungsverbot für Leistungs- und Verhaltensbewertung sowie transparente Information der Beschäftigten über Zweck und Grenzen der Messung. Wer das Messdesign gemeinsam mit dem Betriebsrat aufsetzt, gewinnt doppelt: Rechtssicherheit und einen Fürsprecher für die Datenerhebung. Alle Rechtsangaben dienen der Orientierung und ersetzen keine Rechtsberatung.
Ein Radar ohne Reaktionslogik ist Dekoration. Deshalb erhält jede Kennzahl drei Attribute: eine Schwelle, einen Owner und eine definierte Konsequenz. Bewährt hat sich eine zweistufige Logik. Reißen Frühindikatoren (Kennzahlen 1 bis 10), handelt der Adoptions-Owner im Fachbereich: Ursachenanalyse, Coaching, Ablaufkorrektur, gegebenenfalls Scope-Anpassung. Reißen Wirkungsindikatoren (11 und 12) über zwei Quartale trotz grüner Frühindikatoren, geht der Fall ins Portfoliogremium, mit den Optionen Ablauf-Redesign, Neuverhandlung des Business Case oder geordneter Ausstieg.
Diese Trennung diszipliniert beide Seiten. Der Fachbereich kann nicht mit Aktivitätszahlen um Budget werben, und das Gremium kann nicht wegen einer schwachen Einführungswoche ein tragfähiges Vorhaben beerdigen. Der McKinsey-Befund, dass Organisationen mit signifikanter Wirkung fast dreimal so häufig ihre Abläufe grundlegend umgebaut haben (McKinsey 2025), liefert dazu die Standard-Diagnose: Wenn Nutzung grün und Wirkung rot ist, liegt das Problem meist im unveränderten Ablauf, nicht im Werkzeug.
Zur Abgrenzung: Wie Einführung, Arbeitsgestaltung und Beteiligung organisiert werden, behandelt der Beitrag zu Arbeit und Mitbestimmung in diesem Hub. Hier geht es um das Messsystem, mit dem Führung beurteilt, ob diese Einführung wirkt. Beide gehören zusammen: Das beste Radar misst nur, was eine gute Einführung erzeugt.
In 30 Tagen:
In 60 Tagen:
In 90 Tagen:
Vier genügen für die ersten 90 Tage: aktive Nutzung, Prozessabdeckung, Korrekturquote und eine Prozesskennzahl gegen Baseline. Diese Kombination deckt alle fünf Ebenen mindestens grob ab und zeigt die häufigsten Fehlentwicklungen, Werkzeuge ohne Nutzer, Nutzung außerhalb des Zielprozesses und Aktivität ohne Wirkung. Wichtig ist, die Baseline vor dem Rollout zu erheben; nachträglich ist sie kaum rekonstruierbar. Die übrigen Kennzahlen folgen, sobald Datenquellen und Betriebsvereinbarung stehen. Ein unvollständiges Radar mit klaren Schwellen schlägt ein vollständiges ohne Konsequenzen.
Für ein mittelständisches Portfolio von drei bis fünf KI-Anwendungen sind wenige Personenwochen für das Design und ein laufender Aufwand von etwa einem halben Tag pro Monat und Anwendung realistisch. Die meisten Datenquellen existieren bereits: Nutzungsstatistiken der Plattform, Prozesskennzahlen aus ERP oder Ticketsystem, kurze Pulsbefragungen. Teuer wird es nur bei zwei Fehlern: personenbezogene Messungen, die Betriebsvereinbarung und Datenschutzprüfung nachträglich erzwingen, und fehlende Baselines, die später aufwendige Rekonstruktionen nötig machen. Beides ist durch Design vermeidbar, nicht durch Budget.
Nur in engen Grenzen und praktisch nie ohne Beteiligung des Betriebsrats. Ein Messsystem, das individuelle Nutzung sichtbar macht, ist eine technische Einrichtung mit Überwachungseignung und damit nach § 87 Abs. 1 Nr. 6 BetrVG zwingend mitbestimmungspflichtig. Zusätzlich verlangt die DSGVO Zweckbindung und Datenminimierung; ein Adoptions-Dashboard rechtfertigt keine Leistungsbewertung Einzelner. Der praktikable Weg ist Aggregation auf Team- oder Prozessebene mit Mindestgruppengrößen plus ein schriftliches Auswertungsverbot für Leistungskontrolle. Das ist Orientierung, keine Rechtsberatung. Die Ausgestaltung gehört zu Datenschutzbeauftragtem und Fachanwalt.
Belastbare externe Benchmarks gibt es nicht, und gekaufte Vergleichszahlen messen fast immer anderes als Sie. Aussagekräftig ist nur der eigene Korridor: Welche Nutzungstiefe muss erreicht sein, damit der Business Case des konkreten Use Case aufgeht? Daraus entsteht je Anwendung ein Zielband, gegen das monatlich berichtet wird. Externe Studien taugen als Kontext, nicht als Zielwert: Sie zeigen etwa, dass hohe Nutzungszahlen und ausbleibende Ergebniswirkung branchenweit gleichzeitig auftreten. Wer fremde Quoten zum Ziel erklärt, steuert auf eine Zahl ohne Mechanismus zu.
Am Auseinanderlaufen von Aktivitäts- und Wirkungsebene über mehrere Messperioden. Typisches Muster: Aktive Nutzung und Vorgangszahlen steigen, aber Durchlaufzeit, Fehlerquote oder Kosten im Zielprozess bewegen sich nicht gegen die Baseline. Häufige Ursachen sind Nutzung außerhalb des Zielprozesses, Doppelarbeit durch fehlendes Vertrauen in die Ergebnisse oder Zeitgewinne, die in keinem Engpass ankommen. Genau dieses Muster beschreibt die Forschung breit: Nutzung ist inzwischen fast überall, messbarer Ergebnisbeitrag bleibt die Ausnahme. Die Konsequenz ist ein Ablauf-Review, kein Kommunikationsprogramm.
Belegt sind die Diskrepanz zwischen Nutzung und Ergebniswirkung (McKinsey 2025; MIT Project NANDA 2025), das Ausmaß von Nutzung und Schatten-Nutzung (Microsoft/LinkedIn 2024), die deutsche Verbreitungszahl (Bitkom Research 2025) sowie die rechtlichen Leitplanken aus § 87 Abs. 1 Nr. 6 BetrVG, der Entscheidung des Arbeitsgerichts Hamburg 2024 und Artikel 5 DSGVO. Redaktionelle Einschätzung sind der Zuschnitt der zwölf Kennzahlen, die Startwert-Korridore der Tabelle und die zweistufige Reaktionslogik; sie verallgemeinern etablierte Produkt- und Prozessmesspraxis und sind je Use Case zu kalibrieren. Der Beitrag liefert keine universellen Zielwerte, keine Werkzeugempfehlung und keine Rechtsberatung. Er misst Adoption, nicht die Gesamtwirtschaftlichkeit eines KI-Portfolios, dafür braucht es zusätzlich Kosten- und Risikogrößen.
Methodik: Recherchestand 23. Juli 2026; Studienzahlen und Rechtsangaben wurden gegen die genannten Herausgeberquellen geprüft. Die Erstfassung entstand mit KI-Unterstützung; Kennzahlen-Zuschnitt, Startwerte und Reaktionslogik sind redaktionell, die menschliche Faktenprüfung und Freigabe erfolgt vor Veröffentlichung.
| Datum | Änderung |
|---|---|
| 2026-07-23 | Erstfassung Launch-Korpus (Status: draft) |
| 2026-07-23 | Komplett-Neufassung nach Qualitäts-Spec: Web-Recherche (McKinsey, MIT NANDA, Work Trend Index, Bitkom, BetrVG, DSGVO), Zwölf-Kennzahlen-Tabelle mit Fehlmessungen, Messfallen, Reaktionslogik, FAQ |
Ein Briefing pro Woche: Entscheidungsfragen, eingeordnete Zahlen und Fristen. Ihre Adresse geben wir nicht weiter.
12 Min. Lesezeit
Jetzt lesen14 Min. Lesezeit
Jetzt lesen12 Min. Lesezeit
Jetzt lesen