Daten- und Architekturentscheidungen für Unternehmens-KI
13 Min. Lesezeit
Jetzt lesenDrei technische Wege, eine Führungsfrage: Welcher Ansatz trägt Aktualität, Nachvollziehbarkeit, Kosten und Datenschutz für den konkreten Anwendungsfall — und wann ist die richtige Antwort keiner von dreien?
Die Technikwahl für den KI-Zugriff auf Unternehmenswissen folgt fünf Kriterien: Datenaktualität, Nachvollziehbarkeit, Kosten, Datenschutz und Pflegeaufwand. Enterprise-Suche genügt, wenn Menschen Dokumente finden und selbst bewerten sollen. RAG — die Kombination aus Suche und Sprachmodell — ist richtig, wenn formulierte Antworten mit Quellenangabe auf wechselnden Beständen gebraucht werden. Fine-Tuning, also das Nachtrainieren eines Modells, eignet sich für stabile Stil- und Formataufgaben, nicht als Wissensspeicher. Für alle drei gilt dieselbe Sperrbedingung: Ohne Berechtigungsdurchsetzung je Nutzer ist keine Variante freigabefähig.
Die Entscheidung steht in vielen Häusern gerade an, und sie fällt oft unter Zeitdruck. 36 Prozent der deutschen Unternehmen setzen bereits KI ein, fast doppelt so viele wie im Vorjahr (Bitkom 2025). Zugleich zeigt die MIT-Studie „The GenAI Divide“ (2025), dass nur fünf Prozent der unternehmensspezifischen KI-Werkzeuge den Produktivbetrieb erreichen, als Hauptursache nennt die Studie fehlende Passung zum Arbeitsablauf, nicht Modellqualität. Genau hier entstehen die teuren Fehlgriffe: Fine-Tuning auf Beständen, die nach drei Monaten veraltet sind. RAG-Piloten ohne Berechtigungsfilter, die kurz vor dem Go-live gestoppt werden. Assistenten, wo eine gute Suche gereicht hätte. Ein neutraler Entscheidungsbaum ist deshalb kein Technikthema. Er ist Investitionsschutz.
Bevor der Baum greift, braucht es Begriffsklarheit, viele Fehlentscheidungen beginnen damit, dass die drei Ansätze als austauschbar gelten.
Enterprise-Suche findet Dokumente und Passagen und zeigt sie dem Menschen. Moderne Varianten nutzen semantische Verfahren, die Bedeutung statt nur Stichwörter abgleichen. Die Antwortarbeit bleibt beim Leser. Das ist eine Stärke: Der Nutzer sieht das Original, den Kontext und das Datum. Nichts wird erfunden, nichts umformuliert.
RAG (Retrieval-Augmented Generation) schaltet der Textgenerierung eine Suche vor: Das System holt passende Passagen aus den Unternehmensquellen und lässt ein Sprachmodell daraus eine Antwort mit Quellenverweis formulieren. Das Verfahren wurde 2020 von Lewis et al. vorgestellt, gerade um zwei Schwächen reiner Sprachmodelle zu beheben: fehlende Herkunftsnachweise und veraltetes Wissen. Aktualisiert wird der Index, nicht das Modell, Faktenänderungen sind damit ein Pflegevorgang, kein Trainingslauf.
Fine-Tuning trainiert ein bestehendes Modell mit eigenen Beispielen nach. Das verändert Verhalten: Tonalität, Fachvokabular, Ausgabeformate, Klassifikationslogik. Als Wissensspeicher taugt es schlecht. Der kontrollierte Vergleich von Ovadia et al. (EMNLP 2024) zeigt, dass Retrieval das Nachtrainieren bei Wissensaufgaben konsistent übertrifft, sowohl bei bekanntem als auch bei völlig neuem Faktenwissen. Sprachmodelle lernen neue Fakten durch Nachtraining schlicht unzuverlässig.
Wer Fine-Tuning kauft, um dem Modell „unser Wissen beizubringen“, kauft das falsche Produkt. Wissen gehört in den Index, Verhalten ins Training, wer das verwechselt, bezahlt beides doppelt.
Der Baum arbeitet die fünf Führungskriterien in fester Reihenfolge ab. Die Reihenfolge ist Absicht: Datenschutz und Nachvollziehbarkeit sind Sperrkriterien, Kosten und Pflege sind Optimierungskriterien.
Regel 1, Berechtigungen zuerst. Kann das System Zugriffsrechte je Nutzer zur Abfragezeit durchsetzen? Wenn nein: Stopp, egal welche Technik. Die OWASP-Risikoliste für LLM-Anwendungen führt schwache Zugriffskontrolle in Vektorspeichern als eigenes Top-10-Risiko (OWASP 2025, LLM08).
Regel 2, Aufgabentyp klären. Sollen Menschen Dokumente selbst lesen und bewerten? Dann Suche. Soll das System Antworten formulieren? Dann weiter zu Regel 3. Geht es um Form, Ton oder Klassifikation bei stabilem Wissen? Dann Fine-Tuning prüfen.
Regel 3, Aktualität prüfen. Ändern sich die relevanten Fakten wöchentlich bis monatlich? Dann scheidet Fine-Tuning als Wissensweg aus; RAG oder Suche übernehmen. Ändern sie sich seltener als jährlich und ist das Volumen klein, kann auch strukturierter Kontext direkt im Prompt genügen.
Regel 4, Nachvollziehbarkeit gewichten. Müssen Antworten auf die Originalquelle verweisen, etwa für Audits oder Kundenzusagen? Dann RAG mit Pflicht-Quellenangabe oder reine Suche. Ein nachtrainiertes Modell kann prinzipbedingt nicht belegen, woher eine Aussage stammt.
Regel 5, Kosten und Pflege über 24 Monate rechnen. Suche ist im Betrieb am günstigsten. RAG kostet Modellaufrufe plus Index- und Evaluationspflege. Fine-Tuning kostet je Trainingszyklus, und bei jeder Faktenänderung erneut.
| Kriterium | Enterprise-Suche | RAG | Fine-Tuning |
|---|---|---|---|
| Datenaktualität | Sofort nach Indexlauf | Sofort nach Indexlauf | Erst nach neuem Trainingslauf |
| Nachvollziehbarkeit | Maximal: Nutzer liest Original | Hoch, wenn Quellenangabe erzwungen wird | Gering: keine Herkunft je Aussage |
| Anfangskosten | Niedrig bis mittel | Mittel | Mittel bis hoch (Daten + Training) |
| Laufende Kosten | Niedrig | Mittel (Modell + Indexpflege + Evaluation) | Wiederkehrend bei jeder Wissensänderung |
| Datenschutz | Rechteprüfung etabliert | Rechtefilter zur Abfragezeit nötig | Eintrainiertes ist nicht löschbar oder filterbar |
| Pflegeaufwand | Quellen + Index | Quellen + Index + Prompts + Messset | Trainingsdaten + Läufe + Drift-Kontrolle |
| Typischer Einsatz | Recherche, Wissensnavigation | Assistenten mit Antwortpflicht | Tonalität, Formate, Klassifikation |
Die Praxis ist selten sortenrein. Drei Hybridmuster sind sachlich gut begründbar, ein viertes Muster ist eine Warnung.
Hybrid eins: Suche als Fundament, RAG als Aufsatz. Die häufigste sinnvolle Kombination. Die Suche wird zuerst gebaut, mit Berechtigungen und sauberer Indexpflege. RAG nutzt später dieselbe Retrieval-Schicht. Wer so vorgeht, kann den Assistenten jederzeit abschalten, ohne den Suchnutzen zu verlieren.
Hybrid zwei: RAG plus leichtes Fine-Tuning. Das Wissen kommt aus dem Index, das Nachtraining regelt nur Ton und Format, etwa normgerechte Prüfberichte oder konsistente Angebotstexte. Beide Teile haben getrennte Update-Zyklen und getrennte Owner. Diese Trennung muss vertraglich und organisatorisch festgehalten sein, sonst verschwimmt bei jedem Qualitätsproblem die Verantwortung.
Hybrid drei: Regelwerk plus Sprachmodell als Assistenz. Für Aufgaben mit hartem Richtigkeitsanspruch (Preisberechnung, Fristenkontrolle, Compliance-Prüfung) bleibt die Entscheidung in klassischer, testbarer Software. Das Sprachmodell erklärt, fasst zusammen oder schlägt vor, entscheidet aber nicht.
Das Warnmuster: Hybrid als Ausweichbewegung. Wenn ein Projekt nacheinander Suche, RAG und Fine-Tuning stapelt, weil die Qualität nicht steigt, liegt das Problem fast nie in der fehlenden vierten Technik. Es liegt in den Quellen, den Rechten oder dem fehlenden Messset. Mehr Architektur heilt keine kranke Datenbasis.
Ein Eval-Set aus 50 echten Fällen ist mehr wert als jede Anbieter-Benchmark. Wer ohne eigenes Messset entscheidet, delegiert die Technikwahl an die Vertriebsfolien des Anbieters.
Wann ist keiner der drei Wege richtig? Erstens bei deterministischen Aufgaben, Berechnungen und regelbasierte Prüfungen gehören in klassische Software. Zweitens bei ungeklärter Datenlage: veraltete, widersprüchliche oder rechtlich ungeprüfte Bestände macht jede der drei Techniken nur schneller verfügbar, nicht besser. Drittens bei fehlender Betriebsfähigkeit: Ohne benannten Owner für Qualitätsmessung und Quellenpflege verfällt jedes der drei Systeme. Das BSI empfiehlt für generative KI ausdrücklich eine systematische Risikoanalyse vor der Integration in Arbeitsabläufe (BSI 2024). Die ehrlichste Antwort darauf ist manchmal ein Nein zur Technik und ein Ja zur Vorarbeit.
Ein Praxisbeleg für die Kosten übersprungener Vorarbeit: In einer Gartner-Befragung von 132 IT-Verantwortlichen verzögerten 40 Prozent die Einführung ihres KI-Assistenten um drei Monate oder mehr, weil zu weit gefasste Freigaben interne Dokumente auffindbar machten; 64 Prozent nannten Informations-Governance als erheblichen Aufwandstreiber (Gartner 2024). Die Reihenfolge „erst Rechte und Quellen, dann Technikwahl“ ist also keine Vorsicht. Sie ist der schnellere Weg.
Bis Tag 30:
Bis Tag 60:
Bis Tag 90:
RAG liegt bei den laufenden Kosten in der Regel zwischen Suche und Fine-Tuning, mit einem oft unterschätzten Pflegeanteil. Zu den Modellkosten je Anfrage kommen Indexpflege, Quellenanbindung, Berechtigungsabgleich und regelmäßige Qualitätsmessung. Enterprise-Suche ist im Betrieb am günstigsten, weil kein Sprachmodell je Anfrage antwortet. Fine-Tuning verlagert Kosten nach vorn: Trainingsdaten aufbereiten, Trainingsläufe, Evaluation und bei jeder Faktenänderung erneut. Rechnen Sie alle drei Wege über 24 Monate mit Pflegeaufwand, nicht nur mit den Lizenz- und Modellkosten des ersten Quartals.
Das Hauptrisiko ist der Kontrollverlust: Einmal eintrainierte Informationen lassen sich nicht selektiv löschen oder je Nutzer filtern. Personenbezogene Daten im Trainingsmaterial kollidieren damit strukturell mit Löschpflichten und Auskunftsrechten der DSGVO; die Datenschutzkonferenz verlangt geprüfte Rechtsgrundlagen und technisch-organisatorische Maßnahmen für den KI-Einsatz (DSK 2024). Zudem warnt das BSI, dass Sprachmodelle Trainingsinhalte in Ausgaben reproduzieren können (BSI 2024). Wer Fine-Tuning nutzt, sollte deshalb nur bereinigte, rechtlich geprüfte Daten ohne Personenbezug eintrainieren, und Faktenwissen stattdessen über Retrieval anbinden.
Mit einer sauberen Enterprise-Suche über die wichtigsten Dokumentbestände, inklusive geklärter Berechtigungen. Das ist der schnellste belastbare Einstieg. Sie liefert sofort Nutzen, erzwingt die Aufräumarbeit an Quellen und Rechten und ist die technische Vorstufe von RAG: Wer gute Suche hat, kann RAG später aufsetzen, ohne neu zu beginnen. Parallel bauen Sie ein kleines Evaluationsset aus 50 bis 100 echten Fragen mit erwarteten Antworten. Erst wenn die Suche steht und das Messset existiert, lohnt die Entscheidung über generierte Antworten.
Begründet ist Fine-Tuning nur, wenn die Aufgabe stabil ist und es um Verhalten statt Wissen geht: Tonalität, Fachformat, wiederkehrende Klassifikation. Drei Prüffragen entlarven schwache Empfehlungen. Erstens: Ändern sich die relevanten Fakten monatlich oder öfter? Dann scheidet Fine-Tuning als Wissensweg aus. Zweitens: Kann der Anbieter zeigen, wie Berechtigungen je Nutzer durchgesetzt werden? Ein Modell kennt keine Zugriffsrechte. Drittens: Liegt ein Vergleichstest gegen eine RAG-Lösung auf Ihren eigenen Fällen vor? Die Forschung zeigt RAG bei Wissensaufgaben konsistent vorn (Ovadia et al. 2024). Die Beweislast liegt beim Anbieter.
Wenn die Aufgabe deterministisch korrekt sein muss oder die Datenbasis fehlt. Berechnungen, Fristenkontrollen und regelbasierte Prüfungen gehören in klassische Software; ein Sprachmodell macht sie langsamer und unzuverlässiger. Ebenso gilt: Sind die Quelldokumente veraltet, widersprüchlich oder ohne geklärte Rechte, verstärkt jede der drei Techniken das Problem nur. Und wenn niemand die Antwortqualität regelmäßig messen kann, fehlt die Betriebsvoraussetzung. In diesen Fällen ist die richtige Reihenfolge: erst Datenbasis und Zuständigkeit klären, dann Technik wählen.
Belegt sind: die Herkunft und Funktionsweise von RAG (Lewis et al. 2020), der Leistungsvergleich zwischen Retrieval und Nachtraining bei Wissensaufgaben (Ovadia et al. 2024), die Einstufung von Vektorspeicher-Schwächen als Top-10-Risiko (OWASP 2025), die Verzögerungszahlen aus der Gartner-Befragung (2024) sowie die Adoptions- und Produktivzahlen von Bitkom (2025) und MIT (2025). Redaktionelle Einschätzung sind der fünfstufige Entscheidungsbaum, die Kriterien-Gewichtung und die Hybridmuster; sie verdichten dokumentierte Projekterfahrung, sind aber keine kontrollierte Studie. Der Beitrag leistet keine Modell- oder Anbieterempfehlung und keine unternehmensspezifische Kostenrechnung. Die Kostenaussagen sind bewusst relativ formuliert, weil belastbare branchenübergreifende Preisvergleiche schnell veralten.
Methodik: Recherche und Erstfassung entstanden mit KI-Unterstützung; alle Zahlen- und Studienangaben wurden gegen die genannten Quellen geprüft. Der Entscheidungsbaum ist bewusst anbieterneutral gehalten: Modellnamen veralten, Aufgabentypen bleiben. Die menschliche Faktenprüfung und redaktionelle Freigabe erfolgen vor Veröffentlichung.
| Datum | Änderung |
|---|---|
| 2026-07-23 | Vollständige Neufassung nach Qualitäts-Spec: fünf Kriterien, Wenn-dann-Regeln, Vergleichstabelle, Hybridfälle, Ausschlussfälle, web-verifizierte Quellen, FAQ |
| 2026-07-23 | Erstfassung Launch-Korpus (Status: draft) |
Ein Briefing pro Woche: Entscheidungsfragen, eingeordnete Zahlen und Fristen. Ihre Adresse geben wir nicht weiter.
13 Min. Lesezeit
Jetzt lesen13 Min. Lesezeit
Jetzt lesen13 Min. Lesezeit
Jetzt lesen