Ausgabe 39/2026 · Stand: Donnerstag, 24. September 2026 Das Fachmagazin für KI-Transformation im Mittelstand
Briefing abonnieren
Glossar

Glossar: Daten

Zwölf Begriffe rund um die Datenbasis, an der KI-Vorhaben in der Praxis scheitern oder tragen. Die meisten KI-Probleme im Mittelstand sind Datenprobleme in technischer Verkleidung. Diese Einträge helfen, sie vor der Investition zu erkennen.

Veröffentlicht · Aktualisiert · 6 Min. Lesezeit
Compliance-Verantwortliche mit aufgeschlagenem Kommentarband und einer Prüfliste am Schreibtisch.
Regelwerk wird erst brauchbar, wenn es jemand auf den eigenen Fall anwendet. Symbolbild, KI-generiert für KIONIER.

Zwölf Begriffe rund um die Datenbasis, an der KI-Vorhaben in der Praxis scheitern oder tragen. Die meisten KI-Probleme im Mittelstand sind Datenprobleme in technischer Verkleidung. Diese Einträge helfen, sie vor der Investition zu erkennen.

Datenqualität

Definition: Datenqualität beschreibt, wie vollständig, korrekt, aktuell und konsistent Datenbestände gemessen am jeweiligen Verwendungszweck sind.

Führungsrelevanz: Datenqualität begrenzt die erreichbare Qualität jedes darauf aufsetzenden KI-Systems, unabhängig vom Modellpreis. Vor jeder Investitionsfreigabe gehört deshalb eine Stichprobenprüfung der relevanten Bestände, mit ehrlichem Befund. Nachträgliche Bereinigung ist regelmäßig der teuerste und am meisten unterschätzte Projektteil.

Typisches Missverständnis: Die KI werde schlechte Daten schon ausgleichen. Sie tut das Gegenteil: Sie macht Datenfehler schneller, sichtbarer und in Kundenprozessen wirksam.

Siehe auch: „Daten- und Architekturentscheidungen für Unternehmens-KI“ (Launch-Artikel); Datenreife (Glossar).

Datenreife

Definition: Datenreife bezeichnet den Entwicklungsstand einer Organisation im Erfassen, Verwalten und Nutzbarmachen ihrer Daten, von verstreuten Ablagen bis zur gesteuerten Datenplattform.

Führungsrelevanz: Die Datenreife bestimmt, welche KI-Vorhaben jetzt realistisch sind und welche erst nach Vorarbeiten. Ein ehrliches Reife-Assessment vor der Roadmap verhindert, dass Leuchtturmprojekte auf Sand gebaut werden. Reife entsteht durch Verantwortlichkeiten und Prozesse, nicht durch Werkzeugkauf.

Typisches Missverständnis: Geringe Datenreife gilt als Grund, mit KI zu warten. Richtig ist die Umkehrung: Anwendungsfälle mit vorhandener Datenbasis starten, Reife parallel gezielt aufbauen.

Siehe auch: „Was zählt als KI-Transformation? Ein prüfbares Reifegradmodell“ (Launch-Artikel); Data Governance (Glossar).

Data Governance

Definition: Data Governance ist das Regelwerk aus Zuständigkeiten, Standards und Prozessen, mit dem ein Unternehmen Qualität, Zugriff und rechtmäßige Nutzung seiner Daten steuert.

Führungsrelevanz: Ohne Governance bleibt jede KI-Freigabe eine Einzelfallentscheidung ohne Grundlage: Niemand kann sagen, welche Daten ein System nutzen darf. Benannte Datenverantwortliche je Domäne sind die Voraussetzung für schnelle, wiederholbare Freigaben. Governance ist damit ein Beschleuniger, kein Bremsklotz.

Typisches Missverständnis: Data Governance gilt als Konzernthema. Gerade bei 250 bis 2.000 Beschäftigten reichen schlanke Zuständigkeiten, aber null Governance rächt sich beim ersten Vorfall.

Siehe auch: „KI-Governance mit nachweisbaren Kontrollen“ (Launch-Artikel); Datenklassifizierung (Glossar).

Datenklassifizierung

Definition: Datenklassifizierung ist die Einstufung von Informationen in Schutzstufen wie öffentlich, intern, vertraulich und streng vertraulich als Grundlage für Zugriffs- und Verarbeitungsregeln.

Führungsrelevanz: Erst die Klassifizierung macht KI-Richtlinien vollziehbar: Welche Stufe darf in welches Werkzeug, welche nie in externe Dienste? Ohne diese Einstufung entscheidet jeder Beschäftigte selbst, was er in ein KI-System eingibt. Eine grobe, gelebte Klassifizierung schlägt ein perfektes, ungenutztes Schema.

Typisches Missverständnis: Klassifizierung wird als einmaliges Archivprojekt verstanden. Sie wirkt nur, wenn sie beim Erstellen neuer Dokumente und in Systemen automatisch mitläuft.

Siehe auch: „Vom KI-Inventar zum Kontrollsystem“ (Launch-Artikel); Berechtigungsvererbung (Glossar).

Wissensmanagement

Definition: Wissensmanagement umfasst die Strukturen und Prozesse, mit denen ein Unternehmen sein dokumentiertes und personengebundenes Wissen erfasst, pflegt und auffindbar macht.

Führungsrelevanz: KI-Assistenten machen den Zustand des Wissensmanagements schonungslos sichtbar: Veraltete, doppelte und widersprüchliche Dokumente werden zu falschen Antworten mit Ansage. Wer einen Unternehmens-Assistenten plant, budgetiert die Kuratierung der Quellen gleich mit. Der Nebeneffekt ist real: Der KI-Anlass erzwingt die Aufräumarbeit, die seit Jahren aufgeschoben wurde.

Typisches Missverständnis: Die KI mache Wissensmanagement überflüssig, weil sie ja alles durchsuche. Sie findet auch jede veraltete Version, und zitiert sie überzeugend.

Siehe auch: „Use-Case-first-Datenarchitektur“ (Launch-Artikel); Retrieval-Augmented Generation (RAG) (Glossar).

Berechtigungsvererbung

Definition: Berechtigungsvererbung bedeutet, dass ein KI-System bei jeder Antwort die Zugriffsrechte der Quellsysteme durchsetzt, sodass Nutzer nur Inhalte erhalten, die sie auch dort sehen dürften.

Führungsrelevanz: Ohne Berechtigungsvererbung wird der Unternehmens-Assistent zur Umgehung aller gewachsenen Zugriffskontrollen: Gehälter, M&A-Unterlagen und Personalakten sind plötzlich erfragbar. Die Fähigkeit dazu ist ein hartes Ausschlusskriterium in jeder Anbieterauswahl. Sie muss vor dem Rollout getestet werden, nicht nach dem ersten Vorfall.

Typisches Missverständnis: Die Rechte im Quellsystem gälten automatisch auch in der KI-Suche. Viele Systeme indexieren mit einem technischen Sammelkonto und heben Beschränkungen dabei stillschweigend auf.

Siehe auch: „Berechtigungen in Unternehmens-KI“ (Launch-Artikel); Vektordatenbank (Glossar).

Datenresidenz und EU-Hosting

Definition: Datenresidenz bezeichnet die vertraglich zugesicherte geografische Begrenzung, wo Daten gespeichert und verarbeitet werden, etwa ausschließlich in Rechenzentren innerhalb der EU.

Führungsrelevanz: Für DSGVO-Konformität, Kundenverträge und Auditfähigkeit ist der Verarbeitungsort eine Vertragsfrage mit Nachweispflicht. Entscheidend ist das Kleingedruckte: Gilt die Zusage auch für Support-Zugriffe, Telemetrie und die eigentliche Modellverarbeitung? EU-Region allein schützt zudem nicht vor Drittstaaten-Zugriffsrechten auf den Anbieterkonzern.

Typisches Missverständnis: Ein EU-Rechenzentrum gilt als vollständige Antwort auf die Datenschutzfrage. Speicherort, Verarbeitungsort und rechtlicher Zugriff auf den Anbieter sind drei getrennte Prüfpunkte.

Siehe auch: „Deutschland, Österreich, Schweiz: Drei Governance-Regime“ (Launch-Artikel); API-Nutzung vs. Eigenbetrieb (Glossar).

Anonymisierung vs. Pseudonymisierung

Definition: Anonymisierung entfernt den Personenbezug von Daten unumkehrbar, während Pseudonymisierung ihn nur durch getrennt verwahrte Zuordnungsschlüssel ersetzt und damit personenbezogene Daten im Sinne der DSGVO belässt.

Führungsrelevanz: Der Unterschied entscheidet, ob die DSGVO auf einen Datenbestand anwendbar bleibt, und damit über Rechtsgrundlagen, Betroffenenrechte und Bußgeldrisiko. Wer pseudonymisierte Daten als anonym deklariert, baut seine KI-Nutzung auf eine falsche Rechtsannahme. Echte Anonymisierung ist bei reichhaltigen Datensätzen schwer erreichbar und gehört fachlich geprüft.

Typisches Missverständnis: Namen entfernen gelte als Anonymisierung. Wenn die Person aus Restmerkmalen wie Rolle, Standort und Zeitraum re-identifizierbar ist, bleibt es personenbezogene Verarbeitung.

Siehe auch: „KI-Governance mit nachweisbaren Kontrollen“ (Launch-Artikel); DSGVO-Rechtsgrundlagen (Glossar).

Synthetische Daten

Definition: Synthetische Daten sind künstlich erzeugte Datensätze, die statistische Eigenschaften realer Bestände nachbilden, ohne deren Originaleinträge zu enthalten.

Führungsrelevanz: Synthetische Daten können Tests, Entwicklung und Anbietererprobung ermöglichen, wo echte Daten rechtlich oder vertraglich gesperrt sind. Sie sind aber ein Werkzeug mit Qualitätsrisiko: Schlecht erzeugte Bestände verzerren Modelle oder lassen Rückschlüsse auf Originaldaten zu. Erzeugungsverfahren und Restrisiko gehören dokumentiert, bevor Compliance-Zusagen darauf gestützt werden.

Typisches Missverständnis: Synthetisch gilt automatisch als datenschutzfrei. Ohne geprüftes Verfahren können Einzelfälle aus den Originaldaten durchschimmern.

Siehe auch: „KI-Business-Case unter Unsicherheit: Base, Downside und Abbruchkriterien“ (Launch-Artikel); Trainingsdaten (Glossar).

Datenleck

Definition: Ein Datenleck ist der unbeabsichtigte Abfluss geschützter Informationen, der bei KI-Nutzung typischerweise über Eingaben in externe Dienste, übergriffige Berechtigungen oder ausgespielte Trainingsinhalte entsteht.

Führungsrelevanz: KI schafft neue Leck-Pfade neben den klassischen: Beschäftigte fügen Vertrauliches in Prompts ein, Assistenten zeigen Inhalte jenseits der Zugriffsrechte. Meldepflichten nach Artikel 33 DSGVO mit 72-Stunden-Frist gelten auch für diese Fälle. Prävention heißt freigegebene Werkzeuge anbieten, sonst weicht die Belegschaft auf private Konten aus.

Typisches Missverständnis: Ein Verbot externer KI-Dienste gelte als Schutz. Ohne erlaubte Alternative erzeugt es Schatten-Nutzung, die kein Monitoring mehr sieht.

Siehe auch: „KI-Servicebetrieb: SLA, Evaluation, Incident Response“ (Launch-Artikel); Datenklassifizierung (Glossar).

Data Act

Definition: Der Data Act (Verordnung (EU) 2023/2854) regelt seit dem 12. September 2025 den Zugang zu Daten aus vernetzten Produkten und erleichtert den Wechsel zwischen Cloud-Anbietern.

Führungsrelevanz: Für Hersteller vernetzter Maschinen begründet der Data Act Herausgabepflichten für Nutzungsdaten gegenüber Kunden, was Servicemodelle und Wettbewerbsposition berührt. Als Datennutzer eröffnet er umgekehrt Zugang zu Maschinendaten der eigenen Lieferanten und Flotten, ein möglicher Rohstoff für KI-Anwendungen. Die Cloud-Wechselregeln stärken zudem die Verhandlungsposition gegenüber Hosting-Anbietern.

Typisches Missverständnis: Der Data Act wird als reines Verpflichtungsthema gelesen. Er ist zugleich ein Anspruchskatalog, den einkaufende Unternehmen aktiv nutzen können.

Siehe auch: „Daten- und Architekturentscheidungen für Unternehmens-KI“ (Launch-Artikel); Datenresidenz und EU-Hosting (Glossar).

DSGVO-Rechtsgrundlagen

Definition: DSGVO-Rechtsgrundlagen sind die in Artikel 6 der Verordnung (EU) 2016/679 abschließend aufgezählten Erlaubnistatbestände, ohne die keine Verarbeitung personenbezogener Daten zulässig ist, auch nicht durch KI.

Führungsrelevanz: Jeder KI-Anwendungsfall mit Personenbezug braucht vor dem Start eine benannte Rechtsgrundlage, häufig berechtigtes Interesse mit dokumentierter Abwägung. Fehlt sie, drohen Untersagung und Bußgelder bis 20 Millionen Euro oder vier Prozent des weltweiten Jahresumsatzes (Artikel 83 DSGVO). Die Prüfung gehört an den Anfang der Use-Case-Bewertung, nicht ans Ende.

Typisches Missverständnis: Interne Nutzung gelte als unkritisch. Auch Beschäftigtendaten in KI-Systemen sind voll DSGVO-pflichtig, mit Mitbestimmung als zweiter Baustelle.

Siehe auch: „Mitbestimmung und Job Redesign“ (Launch-Artikel); Anonymisierung vs. Pseudonymisierung (Glossar).

Das Entscheider-Briefing

Ein Briefing pro Woche: Entscheidungsfragen, eingeordnete Zahlen und Fristen. Ihre Adresse geben wir nicht weiter.

Sie erhalten zuerst eine E-Mail mit einem Bestätigungslink. Erst nach dem Klick nehmen wir Sie auf. Abmeldung mit einem Klick in jeder Ausgabe.

Weiterführend im Themenfeld