Use-Case-first-Datenarchitektur
13 Min. Lesezeit
Jetzt lesenSechs Grundsatzentscheidungen bestimmen, ob KI-Projekte skalieren oder sich in Piloten erschöpfen. Keine davon ist technisch — alle landen am Ende auf dem Tisch der Geschäftsführung.
Sechs Entscheidungen müssen vor der Skalierung verbindlich sein. Erstens der Modellzugang, mit API-Nutzung statt Eigenbetrieb als Regelfall. Zweitens Hosting und Datensouveränität je Datenklasse. Drittens die Datenzugriffsschicht mit Berechtigungen, die mit den Daten wandern. Viertens ein zentrales Integrationsmuster über ein Gateway. Fünftens Evaluations- und Betriebsdaten als Pflichtbestandteil jedes Systems. Sechstens die Exit-Fähigkeit je Anbieter. Alle sechs sind Führungsentscheidungen mit langfristigen Kostenfolgen. Werden sie nicht getroffen, trifft sie jeder Fachbereich selbst — unterschiedlich, undokumentiert und teuer in der späteren Konsolidierung.
Die Investitionen laufen, die Wirkung bleibt aus, und die Ursache ist selten das Modell. Die MIT-Studie „The GenAI Divide“ (Project NANDA, Juli 2025) beziffert das Muster. Unternehmen haben weltweit geschätzt 30 bis 40 Milliarden Dollar in generative KI investiert. Trotzdem sehen 95 Prozent der Organisationen keinen messbaren Effekt in der Ergebnisrechnung. Nur 5 Prozent der unternehmensspezifischen Werkzeuge erreichen überhaupt den Produktivbetrieb. Als Hauptgründe nennt die Studie brüchige Integration in Arbeitsabläufe und fehlende Lernfähigkeit der Systeme, nicht Modellqualität und nicht Regulierung.
McKinseys „State of AI“ 2025 bestätigt das von der anderen Seite. 88 Prozent der Organisationen nutzen KI in mindestens einer Funktion. Über 80 Prozent sehen aber keinen spürbaren Effekt auf das Betriebsergebnis. Der stärkste Unterschied zwischen den wenigen Hochleistern und dem Rest liegt im grundlegenden Neuzuschnitt von Arbeitsabläufen. Genau den macht erst eine tragfähige Daten- und Integrationsbasis möglich. Daraus folgt die Führungsfrage dieses Beitrags. Welche wenigen Grundsatzentscheidungen verhindern, dass das eigene Haus die Statistik bestätigt?
Jede der sechs Entscheidungen lässt sich auf Führungsebene in einer Sitzung vorbereiten und in einer zweiten beschließen. Die Tabelle zeigt Optionen, Leitfrage und den jeweils häufigsten Fehler.
| Entscheidung | Optionen | Leitfrage für die Wahl | Typischer Fehler |
|---|---|---|---|
| 1. Modellzugang | Anbieter-API, offenes Modell im Eigenbetrieb, fertiges Produkt | Differenziert uns das Modell, oder nur die Daten dahinter? | Eigenbetrieb aus Prinzip, ohne Team und Volumen |
| 2. Hosting und Souveränität | US-Cloud, EU-Region eines Anbieters, eigener Betrieb | Welche Datenklasse darf wohin, und was ist vertraglich zugesichert? | Eine Pauschalregel für alle Datenklassen |
| 3. Datenzugriffsschicht | Retrieval (RAG), Nachtrainieren (Fine-Tuning), reine Kontextmitgabe | Wandern die Berechtigungen des Nutzers bis in die Antwort mit? | Rechteprüfung erst nach dem Piloten |
| 4. Integrationsmuster | Zentrales Gateway, Punktlösungen je Fachbereich | Können wir Kosten, Protokolle und Modellwechsel an einer Stelle steuern? | Jeder Use Case mit eigenem Anbieterkonto |
| 5. Evaluations- und Betriebsdaten | Pflicht-Evalset plus Logging je System, oder Verzicht | Woran erkennen wir Qualitätsverfall vor den Kunden? | Qualität per Anekdote statt per Testset |
| 6. Exit-Fähigkeit | Exportpfade und Wechselszenario je Anbieter, oder Lock-in akzeptieren | Was kostet uns der Wechsel in zwölf Monaten? | Abhängigkeit entsteht unbemerkt statt entschieden |
Die Reihenfolge ist bewusst gewählt: Die ersten beiden Entscheidungen begrenzen das Spielfeld, die mittleren beiden bestimmen die Bauweise, und die letzten beiden sichern die Steuerbarkeit im Betrieb.
Beim Modellzugang ist die Ausgangslage für den Mittelstand klar. Große Sprachmodelle veralten in Monaten, und ihr Betrieb bindet rares Spezialwissen. Der API-Zugang, also die Nutzung fremd betriebener Modelle über eine Schnittstelle, ist deshalb der Regelfall. Eigenbetrieb offener Modelle ist die begründungspflichtige Ausnahme für hohe Vertraulichkeit oder sehr große Volumina. Entscheidend ist nicht die Wahl selbst, sondern ihre Revidierbarkeit. Die Architektur muss den Modellwechsel vorsehen. Dann kann die Entscheidung jährlich neu geprüft werden.
Beim Hosting hilft eine Denkfigur: nicht „Cloud ja oder nein“, sondern Datenklassen mal Verarbeitungsorte. Öffentliche Informationen, interne Dokumente, personenbezogene Daten und besonders schützenswerte Bestände haben unterschiedliche zulässige Orte. Für personenbezogene Daten setzen die Artikel 44 folgende der DSGVO den Rahmen für Übermittlungen in Drittländer. Der aktuelle Angemessenheitsbeschluss für die USA ist dabei eine politische Größe mit Restrisiko, keine Naturkonstante. Der Markt reagiert darauf. Die großen Anbieter bieten EU-Regionen mit vertraglicher Datenbindung, europäische Anbieter positionieren sich über Souveränität. Die Präferenz ist messbar. Laut Bitkom 2025 bevorzugen 93 Prozent der deutschen Unternehmen KI-Lösungen aus Deutschland. Eine sachliche Linie für den Mittelstand: EU-Verarbeitung als Standard. Abweichungen werden je Datenklasse dokumentiert und jährlich überprüft.
Die teuerste Architekturentscheidung ist die, die niemand trifft. Gebaut wird sie trotzdem, von jedem Fachbereich anders, und die Rechnung kommt gesammelt bei der Konsolidierung.
Die wertvollste Schicht der Unternehmens-KI ist nicht das Modell, sondern der geordnete Zugang zum eigenen Wissen. Drei Muster stehen zur Wahl. Beim Retrieval-Ansatz (RAG, Retrieval Augmented Generation) sucht das System vor jeder Antwort in freigegebenen Dokumenten und zitiert daraus. Das Wissen bleibt in den Quellen und ist aktuell. Beim Fine-Tuning wird ein Modell mit eigenen Beispielen nachtrainiert. Das lohnt für Ton und Format, nicht für Fakten, die sich ändern. Die reine Kontextmitgabe, Nutzer fügen Dokumente manuell ein, ist der Startpunkt, aber kein Zielbild. Für die meisten Wissensanwendungen im Mittelstand ist Retrieval der Standard, Fine-Tuning die Ergänzung.
Die Führungsfrage dahinter ist keine technische, sondern eine der Zugriffsrechte. Ein Assistent, der über alle indexierten Dokumente antwortet, hebelt jede gepflegte Berechtigungsstruktur aus. Der Sachbearbeiter fragt, das System antwortet aus dem Gehaltsordner der Geschäftsleitung. Die Regel muss deshalb lauten: Berechtigungen wandern mit den Daten, bis in die einzelne Antwort. Wer eine Quelle nicht öffnen dürfte, bekommt auch keine Antwort daraus. Das ist aufwendig, weil Quellsysteme ihre Rechte unterschiedlich führen. Genau deshalb gehört es zentral gelöst, nicht sechsmal verschieden je Fachbereich.
Wer Berechtigungen erst nach dem Piloten klärt, hat keinen Piloten gebaut, sondern ein Datenleck mit Demo-Termin.
Zur Datenzugriffsschicht gehört schließlich die Qualität der Quellen, dosiert, nicht total. Bereinigt wird, was der jeweilige Anwendungsfall braucht: veraltete Richtlinien raus aus dem Index, Dubletten zusammengeführt, Verantwortliche je Quelle benannt. Ein unternehmensweites Datenqualitätsprogramm vor dem ersten Nutzen ist dagegen die häufigste Form, Skalierung auf unbestimmte Zeit zu vertagen.
Das Integrationsmuster entscheidet über die Steuerbarkeit im Betrieb. Ein zentrales Gateway ist ein gemeinsamer Zugangspunkt, über den alle internen Anwendungen Modelle ansprechen. Es bündelt vier Funktionen: Protokollierung aller Anfragen, Kostenzuordnung je Bereich, einheitliche Sicherheitsregeln, Modellwechsel an einer Stelle. Ohne Gateway verhandelt jeder Fachbereich eigene Konten. Niemand kann dann sagen, was das Haus insgesamt ausgibt oder welche Daten wohin fließen. Für Hochrisiko-Systeme wird die Protokollfrage zudem regulatorisch. Die Verordnung (EU) 2024/1689 verlangt von Betreibern ab August 2026 die Aufbewahrung automatisch erzeugter Protokolle über mindestens sechs Monate.
Evaluationsdaten sind der am meisten unterschätzte Baustein. Gemeint ist ein versioniertes Set echter Fälle aus dem eigenen Betrieb: Fragen, Dokumente, erwartete Antworten. Gegen dieses Set wird jede neue Systemversion geprüft. Es beantwortet die Frage, die sonst niemand beantworten kann: Ist das System nach dem letzten Anbieter-Update noch gut genug? Die MIT-Studie führt das Scheitern der Mehrheit gerade auf fehlende Lern- und Rückkopplungsfähigkeit zurück. Ein gepflegtes Evalset mit Nutzer-Feedback-Schleife ist die organisatorische Antwort darauf. Das BSI empfiehlt in seiner Publikation zu generativen KI-Modellen (2025) ohnehin eine Risikoanalyse über den gesamten Lebenszyklus. Evaluationsdaten sind ihr operatives Werkzeug.
Bleibt der Exit. Anbieterabhängigkeit ist bei KI nicht per se falsch, aber sie muss entschieden werden statt zu entstehen. Je Anbieter gehören drei Fragen ins Protokoll: Welche Daten und Konfigurationen lassen sich exportieren? Was kostet ein Wechsel in Personenmonaten? Welche Kündigungsfristen und Preisänderungsklauseln gelten? Eine Architektur mit Gateway und Retrieval-Schicht macht den Modellwechsel zur Routine. Eine Landschaft aus Punktlösungen macht ihn zum Projekt. Auch die Frage Eigenbau oder Partner gehört hierher. Die MIT-Studie liefert dazu eine deutliche Zahl. Extern und partnerschaftlich umgesetzte Lösungen kommen auf rund 67 Prozent Erfolgsquote. Reine Eigenentwicklungen erreichen nur 33 Prozent. Wer intern baut, sollte es aus gutem Grund tun, mit denselben Exit- und Evaluationspflichten wie jeder Externe.
Bis Tag 30, Entscheidungen vorbereiten
Bis Tag 60, Rahmen beschließen und bauen
Bis Tag 90, Referenzmuster verankern
Für die meisten Mittelständler reicht der API-Zugang, also die Nutzung fremd betriebener Modelle über eine Schnittstelle. Eigenbetrieb lohnt sich nur in drei Fällen: sehr hohe Vertraulichkeit, sehr große Volumina oder echter Differenzierungsbedarf im Kernprozess. Der Grund ist ökonomisch. Modelle veralten in Monaten, und der Betrieb bindet rares Spezialwissen. Wettbewerbsvorteil entsteht nicht im Modell, sondern in den eigenen Daten, den Prozessen und der Integration. Die Architektur sollte das Modell deshalb austauschbar halten. Dann ist die Frage später jederzeit revidierbar.
Die Grundbausteine sind überschaubar, die versteckten Kosten liegen im Datenzugriff. Gateway, Identitätsanbindung, Logging und ein erstes Evaluationsset sind mit vorhandener Cloud-Infrastruktur und wenigen Personenmonaten aufbaubar. Die laufenden Modellkosten sind nutzungsabhängig und anfangs meist klein gegenüber den Personalkosten. Teuer wird die Datenseite: Quellen anbinden, Berechtigungen sauber abbilden, Dokumentbestände bereinigen. Diese Arbeit skaliert mit der Zahl der Quellsysteme, nicht mit der Zahl der Use Cases. Deshalb lohnt es, sie einmal ordentlich zu machen. Ungesteuert entstehen dieselben Kosten trotzdem, verteilt, doppelt und ohne Wiederverwendung.
Eine pauschale Pflicht gibt es nicht, aber der Entscheidungsrahmen ist eng. Sobald personenbezogene Daten verarbeitet werden, greifen die DSGVO-Regeln für Drittlandübermittlungen nach Artikel 44 folgende. Übermittlungen in die USA stützen sich derzeit auf einen Angemessenheitsbeschluss, dessen Bestand nicht garantiert ist. Für Hochrisiko-Systeme kommen ab August 2026 Betreiberpflichten der Verordnung (EU) 2024/1689 hinzu, etwa zur Log-Aufbewahrung. Viele Anbieter bieten inzwischen EU-Regionen mit vertraglicher Datenbindung an. Pragmatische Linie: EU-Verarbeitung als Standard, Abweichungen nur dokumentiert und je Datenklasse entschieden. Orientierung, keine Rechtsberatung.
Kurzfristig nichts Sichtbares, genau das ist die Falle. Jeder Fachbereich wählt eigene Werkzeuge, eigene Anbieter und eigene Datenwege. Nach einem Jahr existieren mehrere unverbundene Lösungen mit unklaren Berechtigungen und ohne Vergleichbarkeit der Qualität. Die MIT-Studie von 2025 beschreibt das Muster. Über 80 Prozent der Organisationen pilotieren, aber nur 5 Prozent der unternehmensspezifischen Werkzeuge erreichen den Produktivbetrieb. Hauptgründe sind brüchige Integration und fehlende Lernfähigkeit. Die Konsolidierung solcher Insellösungen kostet erfahrungsgemäß mehr als der frühe Architekturrahmen. Und sie trifft das Unternehmen mitten im Betrieb.
Mit einem Use Case, aber gegen die Architekturfragen geprüft. Ein generalstabsmäßiges Datenaufräumprogramm vor dem ersten Nutzen verbrennt Budget und Geduld. Vollständige Datenqualität ist ohnehin ein bewegliches Ziel. Umgekehrt erzeugt ein Use Case ohne Rahmen die beschriebenen Grundschulden. Der praktikable Mittelweg: einen wertigen, begrenzten Anwendungsfall wählen. An ihm werden die sechs Entscheidungen konkret getroffen, Modellzugang, Hosting, Datenzugriff, Gateway, Evaluationsset, Exit. So entsteht in 90 Tagen ein Referenzmuster, an dem sich alle folgenden Vorhaben ausrichten. Aufgeräumt werden zuerst nur die Datenquellen, die dieser Fall wirklich braucht.
Belegt sind die Scheiter- und Wirkungszahlen (MIT Project NANDA 2025; McKinsey 2025) sowie die deutsche Anbieterpräferenz (Bitkom 2025). Belegt sind ebenso der DSGVO-Rahmen für Drittlandübermittlungen und die Betreiberpflichten der Verordnung (EU) 2024/1689. Redaktionelle Einschätzung sind der Zuschnitt auf sechs Entscheidungen, die Empfehlung „Retrieval als Standard“ und die 90-Tage-Sequenz. Sie folgen aus Architektur-Praxis, nicht aus kontrollierten Studien. Die MIT-Zahlen beruhen auf einer begrenzten Stichprobe aus Interviews, Umfragen und Initiativen-Reviews. Sie sind als Größenordnung zu lesen, nicht als Punktschätzung. Der Artikel leistet keine Anbieter- oder Produktauswahl, keine Referenzarchitektur auf Werkzeugebene und keine Rechtsberatung zu Datenübermittlungen im Einzelfall.
Methodik: Erstellt mit KI-Unterstützung und redaktioneller Web-Recherche; alle Zahlenangaben wurden gegen die genannten Herausgeberquellen geprüft, Studienzahlen sind als Größenordnungen eingeordnet. Menschliche Faktenprüfung und redaktionelle Freigabe erfolgen vor Veröffentlichung. Rechtliche Aussagen dienen der Orientierung und ersetzen keine Rechtsberatung.
| Datum | Änderung |
|---|---|
| 2026-07-23 | Erstfassung Launch-Korpus (Status: draft) |
| 2026-07-23 | Vollständige Neufassung nach Qualitäts-Spec 95: sechs Grundsatzentscheidungen mit Entscheidungstabelle, MIT-/McKinsey-Evidenz, Berechtigungs- und Gateway-Kapitel, FAQ, 30/60/90-Maßnahmen |
Ein Briefing pro Woche: Entscheidungsfragen, eingeordnete Zahlen und Fristen. Ihre Adresse geben wir nicht weiter.
13 Min. Lesezeit
Jetzt lesen13 Min. Lesezeit
Jetzt lesen13 Min. Lesezeit
Jetzt lesen