Ausgabe 39/2026 · Stand: Donnerstag, 24. September 2026 Das Fachmagazin für KI-Transformation im Mittelstand
Briefing abonnieren
Glossar

Glossar: Modelle und Technik

Dreizehn technische Begriffe, die in Architektur- und Anbietergesprächen fallen. Sie entscheiden über Kosten, Abhängigkeiten und Betriebsrisiken. Wer sie kennt, kann Angebote vergleichen, statt sie zu glauben.

Veröffentlicht · Aktualisiert · 7 Min. Lesezeit
Qualitätstechniker führt einen Tastkopf über ein Bauteil auf der Granitplatte einer Messmaschine.
Ohne Messmethode bleibt jede Wirkungszahl eine Behauptung. Symbolbild, KI-generiert für KIONIER.

Dreizehn technische Begriffe, die in Architektur- und Anbietergesprächen fallen. Sie entscheiden über Kosten, Abhängigkeiten und Betriebsrisiken. Wer sie kennt, kann Angebote vergleichen, statt sie zu glauben.

Foundation Model

Definition: Ein Foundation Model ist ein auf breiten Datenmengen vortrainiertes Basismodell, das ohne aufgabenspezifisches Neutraining für viele unterschiedliche Anwendungen eingesetzt oder angepasst werden kann.

Führungsrelevanz: Foundation Models verschieben die Make-or-Buy-Frage: Kaum ein Mittelständler trainiert Basismodelle selbst, fast alle bauen auf eingekauften auf. Die strategische Entscheidung liegt in der Anpassungsschicht darüber, denn dort entsteht der unterscheidende Wert. Anbieterbindung, Preisänderungen und Modellabkündigungen sind die relevanten Vertragsrisiken.

Typisches Missverständnis: Ein Foundation Model gilt als fertige Lösung. Ohne Datenanbindung, Zugriffskontrolle und Prozessintegration bleibt es ein Werkzeug ohne Unternehmensbezug.

Siehe auch: „Bauen, kaufen oder mit Partner führen“ (Launch-Artikel); GPAI-Modell (Glossar).

Open-Weights-Modell

Definition: Ein Open-Weights-Modell ist ein KI-Modell, dessen trainierte Gewichte veröffentlicht sind, sodass Unternehmen es auf eigener oder gemieteter Infrastruktur selbst betreiben können.

Führungsrelevanz: Offene Gewichte ermöglichen Eigenbetrieb ohne Datenabfluss an einen Modellanbieter, was für sensible Daten und Auditanforderungen relevant ist. Der Preis dafür sind eigene Betriebsverantwortung, Sicherheitspflege und Hardwarekosten. Die Lizenz ist genau zu prüfen: offene Gewichte bedeuten nicht automatisch freie kommerzielle Nutzung.

Typisches Missverständnis: Open Weights wird mit Open Source gleichgesetzt. Oft fehlen Trainingsdaten und Trainingscode, und Lizenzen können Nutzungsgrenzen enthalten.

Siehe auch: „Daten- und Architekturentscheidungen für Unternehmens-KI“ (Launch-Artikel); API-Nutzung vs. Eigenbetrieb (Glossar).

Kontextfenster

Definition: Das Kontextfenster ist die maximale Menge an Tokens, die ein Sprachmodell je Anfrage als Eingabe und Ausgabe zusammen verarbeiten kann.

Führungsrelevanz: Das Kontextfenster begrenzt, wie viel Dokumentenwissen ein System pro Vorgang berücksichtigt, und bestimmt damit Architekturentscheidungen wie den Einsatz von RAG. Große Fenster wirken bequem, kosten aber je Anfrage mehr und garantieren keine gleichmäßige Beachtung aller Inhalte. Für Vertragsprüfung und lange Akten ist das eine Qualitätsfrage.

Typisches Missverständnis: Ein großes Kontextfenster gilt als Ersatz für Datenarchitektur. Modelle gewichten Inhalte in sehr langen Eingaben ungleich; Relevanzsteuerung bleibt nötig.

Siehe auch: „RAG, Suche oder Fine-Tuning? Neutraler Entscheidungsbaum“ (Launch-Artikel); Token (Glossar).

Fine-Tuning

Definition: Fine-Tuning ist das Nachtrainieren eines vortrainierten Modells mit eigenen Beispieldaten, um Stil, Format oder Fachverhalten dauerhaft in den Modellgewichten zu verankern.

Führungsrelevanz: Fine-Tuning ist eine Investitionsentscheidung: Es kostet Datenaufbereitung, Rechenzeit und wiederkehrende Pflege bei jedem Modellwechsel. Es lohnt sich für stabile, wiederkehrende Aufgabenmuster, nicht für schnell veränderliches Faktenwissen. Wer aktuelle Inhalte braucht, fährt mit Datenanbindung zur Laufzeit meist günstiger.

Typisches Missverständnis: Fine-Tuning gilt als Weg, dem Modell Firmenwissen beizubringen. Für Wissenszugriff ist RAG in der Regel das passendere und wartbarere Instrument.

Siehe auch: „RAG, Suche oder Fine-Tuning? Neutraler Entscheidungsbaum“ (Launch-Artikel); Trainingsdaten (Glossar).

Retrieval-Augmented Generation (RAG)

Definition: Retrieval-Augmented Generation ist ein Architekturmuster, bei dem ein System zu jeder Anfrage passende Unternehmensdokumente sucht und dem Sprachmodell als Antwortgrundlage mitgibt.

Führungsrelevanz: RAG ist der Standardweg, generative KI mit eigenem Wissen zu verbinden, ohne Daten in ein Modell zu trainieren. Die Antwortqualität hängt dabei mehr an Dokumentenpflege, Suche und Berechtigungen als am Modell selbst. Budget und Verantwortung gehören deshalb in die Datenseite, nicht nur in die Modelllizenz.

Typisches Missverständnis: RAG gilt als Garantie gegen Halluzinationen. Es senkt das Risiko deutlich, ersetzt aber weder Quellenpflege noch Prüfprozesse für kritische Ausgaben.

Siehe auch: „RAG, Suche oder Fine-Tuning? Neutraler Entscheidungsbaum“ (Launch-Artikel); Vektordatenbank (Glossar).

Embedding

Definition: Ein Embedding ist die numerische Darstellung eines Textes oder Objekts als Vektor, in der inhaltliche Ähnlichkeit als räumliche Nähe abgebildet wird.

Führungsrelevanz: Embeddings sind die technische Grundlage semantischer Suche und damit der Qualität jedes RAG-Systems. Die Wahl des Embedding-Modells beeinflusst Trefferqualität, Mehrsprachigkeit und Wechselkosten, denn ein Modellwechsel erzwingt die Neuberechnung aller Bestände. Das ist ein stiller Posten in der Betriebskalkulation.

Typisches Missverständnis: Embeddings gelten als anonymisierte Daten. Aus Vektoren können Inhalte teilweise rekonstruiert werden; sie brauchen denselben Schutz wie die Ursprungstexte.

Siehe auch: „Use-Case-first-Datenarchitektur“ (Launch-Artikel); Vektordatenbank (Glossar).

Vektordatenbank

Definition: Eine Vektordatenbank speichert Embeddings und findet zu einer Anfrage in Millisekunden die inhaltlich ähnlichsten Einträge großer Dokumentbestände.

Führungsrelevanz: Die Vektordatenbank ist eine neue Infrastrukturkomponente mit eigenen Kosten-, Sicherheits- und Hostingfragen. Entscheidend ist, ob sie Zugriffsrechte der Quellsysteme durchsetzt, sonst hebelt die KI-Suche gewachsene Berechtigungen aus. Auch der Speicherort bestimmt, ob EU-Datenresidenz-Zusagen eingehalten werden.

Typisches Missverständnis: Die Vektordatenbank gilt als Nebensache der Modellwahl. In der Praxis entscheidet sie über Suchqualität, Berechtigungssicherheit und einen Teil der Betriebskosten.

Siehe auch: „Berechtigungen in Unternehmens-KI“ (Launch-Artikel); Berechtigungsvererbung (Glossar).

Systemprompt

Definition: Der Systemprompt ist die vorgeschaltete, für Nutzer unsichtbare Instruktion, die Rolle, Regeln und Grenzen eines KI-Assistenten für alle Interaktionen festlegt.

Führungsrelevanz: Der Systemprompt ist die Betriebsanweisung des Systems und gehört unter Versionskontrolle und Freigabeprozess wie eine Arbeitsanweisung. Hier stehen Tonalität, verbotene Auskünfte und Eskalationsregeln, also unmittelbar haftungsrelevante Festlegungen. Änderungen ohne Test können das Verhalten im Kundenkontakt schlagartig verändern.

Typisches Missverständnis: Der Systemprompt gilt als verlässliche Sicherheitsschranke. Er ist umgehbar und ersetzt keine technischen Kontrollen bei Berechtigungen und Datenzugriff.

Siehe auch: „KI-Governance mit nachweisbaren Kontrollen“ (Launch-Artikel); Prompt (Glossar).

Temperatur

Definition: Die Temperatur ist ein Steuerparameter generativer Modelle, der festlegt, wie stark die Ausgabe zwischen vorhersagbar und variantenreich streut.

Führungsrelevanz: Der Parameter übersetzt eine Geschäftsanforderung in Technik: Prozesse mit Reproduzierbarkeitsanspruch brauchen niedrige Temperatur, kreative Aufgaben vertragen hohe. Für Audits und Tests muss die Einstellung je Anwendungsfall dokumentiert sein. Uneinheitliche Einstellungen erklären oft, warum dieselbe Lösung in Abteilungen unterschiedlich bewertet wird.

Typisches Missverständnis: Temperatur null wird als vollständige Determinismus-Garantie verstanden. Auch dann können Ausgaben zwischen Läufen und Modellversionen leicht variieren.

Siehe auch: „KI-Servicebetrieb: SLA, Evaluation, Incident Response“ (Launch-Artikel); Benchmark (Glossar).

Modell-Drift

Definition: Modell-Drift bezeichnet die schleichende Verschlechterung der Ergebnisqualität eines KI-Systems, weil sich Daten, Nutzung oder das zugrunde liegende Modell verändern.

Führungsrelevanz: Drift macht aus einem abgenommenen System ein Überwachungsobjekt: Ohne laufende Qualitätsmessung fällt die Verschlechterung erst auf, wenn Kunden oder Prüfer sie bemerken. Das Betriebsbudget muss Monitoring, Referenztests und Nachsteuerung enthalten. Bei API-Diensten kommt Drift auch durch stille Modellupdates des Anbieters.

Typisches Missverständnis: Ein einmal erfolgreicher Pilot gilt als dauerhaft valide. Die Pilotqualität ist eine Momentaufnahme, keine Eigenschaft des Systems.

Siehe auch: „Wann ein KI-System abgeschaltet oder ein Anbieter gewechselt werden muss“ (Launch-Artikel); Benchmark (Glossar).

Benchmark

Definition: Ein Benchmark ist ein standardisierter Aufgabensatz, mit dem die Leistung von KI-Modellen vergleichbar gemessen und in Ranglisten ausgewiesen wird.

Führungsrelevanz: Öffentliche Benchmarks taugen zur Vorauswahl, nicht zur Kaufentscheidung: Sie messen generische Aufgaben, nicht Ihre Dokumente, Ihre Sprache, Ihre Fehlerkosten. Vor der Einführung gehört ein eigener Testsatz aus realen Firmenvorgängen aufgebaut. Dieser Testsatz ist zugleich die Grundlage für Abnahme und spätere Drift-Erkennung.

Typisches Missverständnis: Ein Spitzenplatz im Ranking gilt als Eignungsnachweis. Modelle können auf bekannte Benchmarks optimiert sein und im Fachkontext trotzdem enttäuschen.

Siehe auch: „100 KI-Claims im Faktencheck“ (Launch-Artikel); Modell-Drift (Glossar).

GPU und Compute

Definition: Compute bezeichnet die für Training und Betrieb von KI benötigte Rechenleistung, die überwiegend von Grafikprozessoren (GPUs) erbracht wird.

Führungsrelevanz: Compute ist ein Markt mit knappen Kapazitäten und beweglichen Preisen, der Cloud-Kosten und Eigenbetriebs-Investitionen direkt bestimmt. Wer Eigenbetrieb erwägt, entscheidet über Hardware mit kurzen Innovationszyklen und entsprechendem Abschreibungsrisiko. In Cloud-Verträgen sind Kapazitätszusagen und Preisgleitklauseln die kritischen Stellen.

Typisches Missverständnis: Rechenkosten gelten als Detail der IT-Abteilung. Bei skalierten KI-Anwendungen werden sie zu einem eigenen Block der Kostenrechnung mit Steuerungsbedarf.

Siehe auch: „Der tatsächliche KI-TCO: 24 Kostenpositionen“ (Launch-Artikel); Inferenz (Glossar).

API-Nutzung vs. Eigenbetrieb

Definition: API-Nutzung bedeutet den Bezug von KI-Leistung als Dienst über die Schnittstelle eines Anbieters, Eigenbetrieb das Ausführen von Modellen auf selbst verantworteter Infrastruktur.

Führungsrelevanz: Die Wahl ist eine Abwägung aus Datenkontrolle, Kostenstruktur und Personalbedarf: APIs starten schnell mit variablen Kosten, Eigenbetrieb bindet Investitionen und Fachkräfte, hält aber Daten im Haus. Für viele Unternehmen ist ein Mischmodell realistisch, getrennt nach Sensibilität der Daten. Die Entscheidung sollte pro Anwendungsfall fallen, nicht pauschal.

Typisches Missverständnis: Eigenbetrieb gilt als automatisch sicherer. Ohne gelebten Sicherheits- und Patch-Betrieb ist ein selbst gehostetes Modell riskanter als ein geprüfter EU-Dienst.

Siehe auch: „Bauen, kaufen oder mit Partner führen“ (Launch-Artikel); Datenresidenz und EU-Hosting (Glossar).

Das Entscheider-Briefing

Ein Briefing pro Woche: Entscheidungsfragen, eingeordnete Zahlen und Fristen. Ihre Adresse geben wir nicht weiter.

Sie erhalten zuerst eine E-Mail mit einem Bestätigungslink. Erst nach dem Klick nehmen wir Sie auf. Abmeldung mit einem Klick in jeder Ausgabe.

Weiterführend im Themenfeld