Ausgabe 39/2026 · Stand: Mittwoch, 23. September 2026 Das Fachmagazin für KI-Transformation im Mittelstand
Briefing abonnieren
Daten & Architektur

RAG, Suche oder Fine-Tuning? Neutraler Entscheidungsbaum

Drei technische Wege, eine Führungsfrage: Welcher Ansatz trägt Aktualität, Nachvollziehbarkeit, Kosten und Datenschutz für den konkreten Anwendungsfall — und wann ist die richtige Antwort keiner von dreien?

Veröffentlicht · Aktualisiert · 13 Min. Lesezeit
Zwei Entwickler am Messplatz mit eingespanntem Prüfling und Messgeräteschrank.
Der Messplatz trennt die Annahme vom belegten Wert. Symbolbild, KI-generiert für KIONIER.

Kurzantwort

Die Technikwahl für den KI-Zugriff auf Unternehmenswissen folgt fünf Kriterien: Datenaktualität, Nachvollziehbarkeit, Kosten, Datenschutz und Pflegeaufwand. Enterprise-Suche genügt, wenn Menschen Dokumente finden und selbst bewerten sollen. RAG — die Kombination aus Suche und Sprachmodell — ist richtig, wenn formulierte Antworten mit Quellenangabe auf wechselnden Beständen gebraucht werden. Fine-Tuning, also das Nachtrainieren eines Modells, eignet sich für stabile Stil- und Formataufgaben, nicht als Wissensspeicher. Für alle drei gilt dieselbe Sperrbedingung: Ohne Berechtigungsdurchsetzung je Nutzer ist keine Variante freigabefähig.

Die Kernaussagen

  • Der Aufgabentyp entscheidet: finden, beantworten oder formatieren sind drei verschiedene Probleme mit drei verschiedenen Werkzeugen.
  • Fine-Tuning ist kein Wissensspeicher. Bei Faktenwissen schlägt Retrieval das Nachtrainieren in kontrollierten Vergleichen konsistent.
  • Enterprise-Suche ist die unterschätzte Option: maximale Nachvollziehbarkeit, niedrigste Betriebskosten, kein Halluzinationsrisiko.
  • Häufig wechselnde Fakten disqualifizieren Fine-Tuning als alleinigen Weg — jede Änderung erzwingt einen neuen Trainingslauf.
  • Hybride sind legitim, brauchen aber je Stufe einen Owner und ein eigenes Fehlerbudget.
  • Manchmal ist keiner der drei Wege richtig: Deterministische Aufgaben gehören in klassische Software.

Warum die Frage jetzt zählt

Die Entscheidung steht in vielen Häusern gerade an, und sie fällt oft unter Zeitdruck. 36 Prozent der deutschen Unternehmen setzen bereits KI ein, fast doppelt so viele wie im Vorjahr (Bitkom 2025). Zugleich zeigt die MIT-Studie „The GenAI Divide“ (2025), dass nur fünf Prozent der unternehmensspezifischen KI-Werkzeuge den Produktivbetrieb erreichen, als Hauptursache nennt die Studie fehlende Passung zum Arbeitsablauf, nicht Modellqualität. Genau hier entstehen die teuren Fehlgriffe: Fine-Tuning auf Beständen, die nach drei Monaten veraltet sind. RAG-Piloten ohne Berechtigungsfilter, die kurz vor dem Go-live gestoppt werden. Assistenten, wo eine gute Suche gereicht hätte. Ein neutraler Entscheidungsbaum ist deshalb kein Technikthema. Er ist Investitionsschutz.

Drei Werkzeuge, drei Aufgabentypen

Bevor der Baum greift, braucht es Begriffsklarheit, viele Fehlentscheidungen beginnen damit, dass die drei Ansätze als austauschbar gelten.

Enterprise-Suche findet Dokumente und Passagen und zeigt sie dem Menschen. Moderne Varianten nutzen semantische Verfahren, die Bedeutung statt nur Stichwörter abgleichen. Die Antwortarbeit bleibt beim Leser. Das ist eine Stärke: Der Nutzer sieht das Original, den Kontext und das Datum. Nichts wird erfunden, nichts umformuliert.

RAG (Retrieval-Augmented Generation) schaltet der Textgenerierung eine Suche vor: Das System holt passende Passagen aus den Unternehmensquellen und lässt ein Sprachmodell daraus eine Antwort mit Quellenverweis formulieren. Das Verfahren wurde 2020 von Lewis et al. vorgestellt, gerade um zwei Schwächen reiner Sprachmodelle zu beheben: fehlende Herkunftsnachweise und veraltetes Wissen. Aktualisiert wird der Index, nicht das Modell, Faktenänderungen sind damit ein Pflegevorgang, kein Trainingslauf.

Fine-Tuning trainiert ein bestehendes Modell mit eigenen Beispielen nach. Das verändert Verhalten: Tonalität, Fachvokabular, Ausgabeformate, Klassifikationslogik. Als Wissensspeicher taugt es schlecht. Der kontrollierte Vergleich von Ovadia et al. (EMNLP 2024) zeigt, dass Retrieval das Nachtrainieren bei Wissensaufgaben konsistent übertrifft, sowohl bei bekanntem als auch bei völlig neuem Faktenwissen. Sprachmodelle lernen neue Fakten durch Nachtraining schlicht unzuverlässig.

Wer Fine-Tuning kauft, um dem Modell „unser Wissen beizubringen“, kauft das falsche Produkt. Wissen gehört in den Index, Verhalten ins Training, wer das verwechselt, bezahlt beides doppelt.

Der Entscheidungsbaum mit fünf Kriterien

Der Baum arbeitet die fünf Führungskriterien in fester Reihenfolge ab. Die Reihenfolge ist Absicht: Datenschutz und Nachvollziehbarkeit sind Sperrkriterien, Kosten und Pflege sind Optimierungskriterien.

Regel 1, Berechtigungen zuerst. Kann das System Zugriffsrechte je Nutzer zur Abfragezeit durchsetzen? Wenn nein: Stopp, egal welche Technik. Die OWASP-Risikoliste für LLM-Anwendungen führt schwache Zugriffskontrolle in Vektorspeichern als eigenes Top-10-Risiko (OWASP 2025, LLM08).

Regel 2, Aufgabentyp klären. Sollen Menschen Dokumente selbst lesen und bewerten? Dann Suche. Soll das System Antworten formulieren? Dann weiter zu Regel 3. Geht es um Form, Ton oder Klassifikation bei stabilem Wissen? Dann Fine-Tuning prüfen.

Regel 3, Aktualität prüfen. Ändern sich die relevanten Fakten wöchentlich bis monatlich? Dann scheidet Fine-Tuning als Wissensweg aus; RAG oder Suche übernehmen. Ändern sie sich seltener als jährlich und ist das Volumen klein, kann auch strukturierter Kontext direkt im Prompt genügen.

Regel 4, Nachvollziehbarkeit gewichten. Müssen Antworten auf die Originalquelle verweisen, etwa für Audits oder Kundenzusagen? Dann RAG mit Pflicht-Quellenangabe oder reine Suche. Ein nachtrainiertes Modell kann prinzipbedingt nicht belegen, woher eine Aussage stammt.

Regel 5, Kosten und Pflege über 24 Monate rechnen. Suche ist im Betrieb am günstigsten. RAG kostet Modellaufrufe plus Index- und Evaluationspflege. Fine-Tuning kostet je Trainingszyklus, und bei jeder Faktenänderung erneut.

Kriterium Enterprise-Suche RAG Fine-Tuning
Datenaktualität Sofort nach Indexlauf Sofort nach Indexlauf Erst nach neuem Trainingslauf
Nachvollziehbarkeit Maximal: Nutzer liest Original Hoch, wenn Quellenangabe erzwungen wird Gering: keine Herkunft je Aussage
Anfangskosten Niedrig bis mittel Mittel Mittel bis hoch (Daten + Training)
Laufende Kosten Niedrig Mittel (Modell + Indexpflege + Evaluation) Wiederkehrend bei jeder Wissensänderung
Datenschutz Rechteprüfung etabliert Rechtefilter zur Abfragezeit nötig Eintrainiertes ist nicht löschbar oder filterbar
Pflegeaufwand Quellen + Index Quellen + Index + Prompts + Messset Trainingsdaten + Läufe + Drift-Kontrolle
Typischer Einsatz Recherche, Wissensnavigation Assistenten mit Antwortpflicht Tonalität, Formate, Klassifikation

Hybridfälle, und wann keiner der drei Wege trägt

Die Praxis ist selten sortenrein. Drei Hybridmuster sind sachlich gut begründbar, ein viertes Muster ist eine Warnung.

Hybrid eins: Suche als Fundament, RAG als Aufsatz. Die häufigste sinnvolle Kombination. Die Suche wird zuerst gebaut, mit Berechtigungen und sauberer Indexpflege. RAG nutzt später dieselbe Retrieval-Schicht. Wer so vorgeht, kann den Assistenten jederzeit abschalten, ohne den Suchnutzen zu verlieren.

Hybrid zwei: RAG plus leichtes Fine-Tuning. Das Wissen kommt aus dem Index, das Nachtraining regelt nur Ton und Format, etwa normgerechte Prüfberichte oder konsistente Angebotstexte. Beide Teile haben getrennte Update-Zyklen und getrennte Owner. Diese Trennung muss vertraglich und organisatorisch festgehalten sein, sonst verschwimmt bei jedem Qualitätsproblem die Verantwortung.

Hybrid drei: Regelwerk plus Sprachmodell als Assistenz. Für Aufgaben mit hartem Richtigkeitsanspruch (Preisberechnung, Fristenkontrolle, Compliance-Prüfung) bleibt die Entscheidung in klassischer, testbarer Software. Das Sprachmodell erklärt, fasst zusammen oder schlägt vor, entscheidet aber nicht.

Das Warnmuster: Hybrid als Ausweichbewegung. Wenn ein Projekt nacheinander Suche, RAG und Fine-Tuning stapelt, weil die Qualität nicht steigt, liegt das Problem fast nie in der fehlenden vierten Technik. Es liegt in den Quellen, den Rechten oder dem fehlenden Messset. Mehr Architektur heilt keine kranke Datenbasis.

Ein Eval-Set aus 50 echten Fällen ist mehr wert als jede Anbieter-Benchmark. Wer ohne eigenes Messset entscheidet, delegiert die Technikwahl an die Vertriebsfolien des Anbieters.

Wann ist keiner der drei Wege richtig? Erstens bei deterministischen Aufgaben, Berechnungen und regelbasierte Prüfungen gehören in klassische Software. Zweitens bei ungeklärter Datenlage: veraltete, widersprüchliche oder rechtlich ungeprüfte Bestände macht jede der drei Techniken nur schneller verfügbar, nicht besser. Drittens bei fehlender Betriebsfähigkeit: Ohne benannten Owner für Qualitätsmessung und Quellenpflege verfällt jedes der drei Systeme. Das BSI empfiehlt für generative KI ausdrücklich eine systematische Risikoanalyse vor der Integration in Arbeitsabläufe (BSI 2024). Die ehrlichste Antwort darauf ist manchmal ein Nein zur Technik und ein Ja zur Vorarbeit.

Ein Praxisbeleg für die Kosten übersprungener Vorarbeit: In einer Gartner-Befragung von 132 IT-Verantwortlichen verzögerten 40 Prozent die Einführung ihres KI-Assistenten um drei Monate oder mehr, weil zu weit gefasste Freigaben interne Dokumente auffindbar machten; 64 Prozent nannten Informations-Governance als erheblichen Aufwandstreiber (Gartner 2024). Die Reihenfolge „erst Rechte und Quellen, dann Technikwahl“ ist also keine Vorsicht. Sie ist der schnellere Weg.

Maßnahmen für die Geschäftsführung

Bis Tag 30:

  • Die zwei wichtigsten Anwendungsfälle nach Aufgabentyp klassifizieren: finden, beantworten oder formatieren. Owner: CIO mit Fachbereichsleitung.
  • Aktualitätsprofil je Anwendungsfall dokumentieren: Wie oft ändern sich die relevanten Fakten? Owner: Fachbereichsleitung.
  • Berechtigungslage der betroffenen Quellsysteme prüfen lassen, vor jeder Anbieterauswahl. Owner: IT-Leitung mit Informationssicherheit.
  • Aufbau eines Evaluationssets aus 50 bis 100 realen Fragen beauftragen. Owner: Fachbereichsleitung.

Bis Tag 60:

  • Entscheidungsbaum je Anwendungsfall durchlaufen und Ergebnis schriftlich begründen. Owner: CIO.
  • Kostenmodell über 24 Monate je Option rechnen, inklusive Pflege und Evaluation. Owner: CFO mit IT-Leitung.
  • Bei Anbieterangeboten Vergleichstest auf eigenen Fällen einfordern, nicht auf Anbieter-Benchmarks. Owner: Einkauf mit CIO.
  • Für Hybridansätze Owner und Fehlerbudget je Stufe festlegen. Owner: CIO.

Bis Tag 90:

  • Pilot der gewählten Option gegen das Evaluationsset messen und berichten. Owner: Fachbereichsleitung.
  • Berechtigungsdurchsetzung mit Negativtests prüfen: Findet ein Unberechtigter gesperrte Inhalte? Owner: Informationssicherheit.
  • Go-live-Entscheidung mit dokumentierten Kriterien treffen: fortsetzen, umsteuern oder stoppen. Owner: Geschäftsführung.
  • Regeltermin für Qualitäts- und Kostenreview im Betrieb festlegen. Owner: CIO.

Was Führung jetzt entscheiden muss

  • Ist der Aufgabentyp je Anwendungsfall geklärt: finden, beantworten oder formatieren?
  • Ist dokumentiert, wie oft sich die relevanten Fakten ändern?
  • Kann die gewählte Technik Berechtigungen je Nutzer zur Abfragezeit durchsetzen?
  • Existiert ein eigenes Evaluationsset, bevor die Architektur festgelegt wird?
  • Sind die Kosten aller Optionen über 24 Monate gerechnet, inklusive Pflege?
  • Ist bei Hybridansätzen je Stufe ein Owner mit Fehlerbudget benannt?
  • Wurde geprüft, ob die Aufgabe in klassische Software statt in KI gehört?

Häufige Fragen (FAQ)

Was kostet uns RAG im Betrieb wirklich, verglichen mit Suche und Fine-Tuning?

RAG liegt bei den laufenden Kosten in der Regel zwischen Suche und Fine-Tuning, mit einem oft unterschätzten Pflegeanteil. Zu den Modellkosten je Anfrage kommen Indexpflege, Quellenanbindung, Berechtigungsabgleich und regelmäßige Qualitätsmessung. Enterprise-Suche ist im Betrieb am günstigsten, weil kein Sprachmodell je Anfrage antwortet. Fine-Tuning verlagert Kosten nach vorn: Trainingsdaten aufbereiten, Trainingsläufe, Evaluation und bei jeder Faktenänderung erneut. Rechnen Sie alle drei Wege über 24 Monate mit Pflegeaufwand, nicht nur mit den Lizenz- und Modellkosten des ersten Quartals.

Welches rechtliche Risiko gehen wir ein, wenn wir Unternehmensdaten in ein Fine-Tuning geben?

Das Hauptrisiko ist der Kontrollverlust: Einmal eintrainierte Informationen lassen sich nicht selektiv löschen oder je Nutzer filtern. Personenbezogene Daten im Trainingsmaterial kollidieren damit strukturell mit Löschpflichten und Auskunftsrechten der DSGVO; die Datenschutzkonferenz verlangt geprüfte Rechtsgrundlagen und technisch-organisatorische Maßnahmen für den KI-Einsatz (DSK 2024). Zudem warnt das BSI, dass Sprachmodelle Trainingsinhalte in Ausgaben reproduzieren können (BSI 2024). Wer Fine-Tuning nutzt, sollte deshalb nur bereinigte, rechtlich geprüfte Daten ohne Personenbezug eintrainieren, und Faktenwissen stattdessen über Retrieval anbinden.

Womit sollten wir als Mittelständler anfangen, wenn wir heute bei null stehen?

Mit einer sauberen Enterprise-Suche über die wichtigsten Dokumentbestände, inklusive geklärter Berechtigungen. Das ist der schnellste belastbare Einstieg. Sie liefert sofort Nutzen, erzwingt die Aufräumarbeit an Quellen und Rechten und ist die technische Vorstufe von RAG: Wer gute Suche hat, kann RAG später aufsetzen, ohne neu zu beginnen. Parallel bauen Sie ein kleines Evaluationsset aus 50 bis 100 echten Fragen mit erwarteten Antworten. Erst wenn die Suche steht und das Messset existiert, lohnt die Entscheidung über generierte Antworten.

Unser Anbieter empfiehlt Fine-Tuning auf unseren Daten. Woran erkennen wir, ob das begründet ist?

Begründet ist Fine-Tuning nur, wenn die Aufgabe stabil ist und es um Verhalten statt Wissen geht: Tonalität, Fachformat, wiederkehrende Klassifikation. Drei Prüffragen entlarven schwache Empfehlungen. Erstens: Ändern sich die relevanten Fakten monatlich oder öfter? Dann scheidet Fine-Tuning als Wissensweg aus. Zweitens: Kann der Anbieter zeigen, wie Berechtigungen je Nutzer durchgesetzt werden? Ein Modell kennt keine Zugriffsrechte. Drittens: Liegt ein Vergleichstest gegen eine RAG-Lösung auf Ihren eigenen Fällen vor? Die Forschung zeigt RAG bei Wissensaufgaben konsistent vorn (Ovadia et al. 2024). Die Beweislast liegt beim Anbieter.

Wann ist keiner der drei Wege der richtige?

Wenn die Aufgabe deterministisch korrekt sein muss oder die Datenbasis fehlt. Berechnungen, Fristenkontrollen und regelbasierte Prüfungen gehören in klassische Software; ein Sprachmodell macht sie langsamer und unzuverlässiger. Ebenso gilt: Sind die Quelldokumente veraltet, widersprüchlich oder ohne geklärte Rechte, verstärkt jede der drei Techniken das Problem nur. Und wenn niemand die Antwortqualität regelmäßig messen kann, fehlt die Betriebsvoraussetzung. In diesen Fällen ist die richtige Reihenfolge: erst Datenbasis und Zuständigkeit klären, dann Technik wählen.

Evidenz und Grenzen

Belegt sind: die Herkunft und Funktionsweise von RAG (Lewis et al. 2020), der Leistungsvergleich zwischen Retrieval und Nachtraining bei Wissensaufgaben (Ovadia et al. 2024), die Einstufung von Vektorspeicher-Schwächen als Top-10-Risiko (OWASP 2025), die Verzögerungszahlen aus der Gartner-Befragung (2024) sowie die Adoptions- und Produktivzahlen von Bitkom (2025) und MIT (2025). Redaktionelle Einschätzung sind der fünfstufige Entscheidungsbaum, die Kriterien-Gewichtung und die Hybridmuster; sie verdichten dokumentierte Projekterfahrung, sind aber keine kontrollierte Studie. Der Beitrag leistet keine Modell- oder Anbieterempfehlung und keine unternehmensspezifische Kostenrechnung. Die Kostenaussagen sind bewusst relativ formuliert, weil belastbare branchenübergreifende Preisvergleiche schnell veralten.

Quellen und Methodik

  1. Lewis, P. et al.: „Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks“, NeurIPS 2020, arxiv.org/abs/2005.11401, Ursprungsarbeit zu RAG, Motivation: Herkunftsnachweis und Wissensaktualisierung.
  2. Ovadia, O. et al. (Microsoft): „Fine-Tuning or Retrieval? Comparing Knowledge Injection in LLMs“, EMNLP 2024, aclanthology.org/2024.emnlp-main.15, RAG übertrifft unüberwachtes Fine-Tuning bei Wissensaufgaben konsistent.
  3. OWASP: „Top 10 for LLM Applications 2025“, genai.owasp.org, LLM08: Vector and Embedding Weaknesses; LLM02: Sensitive Information Disclosure.
  4. BSI: „Generative KI-Modelle: Chancen und Risiken für Industrie und Behörden“, aktualisierte Fassung 2024/2025, bsi.bund.de, Risikoanalyse vor Integration, Reproduktion von Trainingsinhalten.
  5. Gartner-Befragung von 132 IT-Verantwortlichen, Juni 2024, berichtet via Computerworld, 40 Prozent Rollout-Verzögerung um drei und mehr Monate wegen Oversharing, 64 Prozent Governance-Aufwand.
  6. Bitkom Research: „Künstliche Intelligenz 2025“, 604 Unternehmen, 2025, bitkom.org, 36 Prozent KI-Nutzung in Deutschland.
  7. MIT NANDA: „The GenAI Divide: State of AI in Business 2025“, Juli 2025, 5 Prozent Produktivquote unternehmensspezifischer KI-Werkzeuge.
  8. Datenschutzkonferenz (DSK): Orientierungshilfe „Künstliche Intelligenz und Datenschutz“, Version 1.0, Mai 2024, datenschutzkonferenz-online.de.

Methodik: Recherche und Erstfassung entstanden mit KI-Unterstützung; alle Zahlen- und Studienangaben wurden gegen die genannten Quellen geprüft. Der Entscheidungsbaum ist bewusst anbieterneutral gehalten: Modellnamen veralten, Aufgabentypen bleiben. Die menschliche Faktenprüfung und redaktionelle Freigabe erfolgen vor Veröffentlichung.

Änderungsprotokoll

Datum Änderung
2026-07-23 Vollständige Neufassung nach Qualitäts-Spec: fünf Kriterien, Wenn-dann-Regeln, Vergleichstabelle, Hybridfälle, Ausschlussfälle, web-verifizierte Quellen, FAQ
2026-07-23 Erstfassung Launch-Korpus (Status: draft)

Das Entscheider-Briefing

Ein Briefing pro Woche: Entscheidungsfragen, eingeordnete Zahlen und Fristen. Ihre Adresse geben wir nicht weiter.

Sie erhalten zuerst eine E-Mail mit einem Bestätigungslink. Erst nach dem Klick nehmen wir Sie auf. Abmeldung mit einem Klick in jeder Ausgabe.

Weiterführend im Themenfeld