Ich habe 1,4 Millionen abgeschrieben, bevor ich die richtige Frage gestellt habe
8 Min. Lesezeit
Jetzt lesenBeides, je nach Sitzung. Der Vorteil: Ich weiß, wie die zweite Verteidigungslinie denkt, also Risikocontrolling und Compliance, die unabhängig vom Geschäft prüfen, ob Modelle und Prozesse tragen. Ich war acht Jahre lang derjenige, der Modelle anderer Leute zerpflückt hat. Wenn ich heute ein Vorhaben aufsetze, schreibe
| Steckbrief | |
|---|---|
| Branche | Finanzdienstleistung (Konsumenten- und Mittelstandskredite, Leasing) |
| Unternehmensgröße | ca. 900 Mitarbeitende |
| Rolle | Head of AI, seit zweieinhalb Jahren; davor Modellvalidierung im Risikocontrolling |
| KI-Stand | Scoring-Modelle seit Jahren produktiv, GenAI-Assistenz im Kundenservice pilotiert, KI-Inventar und Modellakten im Aufbau |
Dieses Gespräch ist ein typisiertes, redaktionell verdichtetes Interview: Person und Unternehmen sind fiktiv, die geschilderten Situationen, Zahlen und Konflikte folgen dokumentierten Mustern aus Studien und Rechtsprechung (Quellen am Ende).
Beides, je nach Sitzung. Der Vorteil: Ich weiß, wie die zweite Verteidigungslinie denkt, also Risikocontrolling und Compliance, die unabhängig vom Geschäft prüfen, ob Modelle und Prozesse tragen. Ich war acht Jahre lang derjenige, der Modelle anderer Leute zerpflückt hat. Wenn ich heute ein Vorhaben aufsetze, schreibe ich die Validierungsfragen im Kopf schon mit. Das Handicap: Der Vertrieb hält mich für einen verkappten Prüfer, der Innovation nur verwaltet. Es gab in meinem ersten Jahr eine Sitzung, in der ein Bereichsleiter gesagt hat, mit mir habe man „den Bock zum Gärtner gemacht, nur umgekehrt“. Ich fand das Bild schief, aber die Botschaft kam an. Inzwischen sehe ich meine Rolle nüchtern als Übersetzer: Ich übersetze Aufsichtserwartung in Architekturentscheidungen und Fachbereichswünsche in etwas, das eine Prüfung übersteht. Das klingt unglamourös. In einem beaufsichtigten Haus ist es der einzige Weg, auf dem KI dauerhaft überlebt.
Nichts Exotisches, und genau das wird unterschätzt. Die Aufsicht hat mit ihrer Orientierungshilfe zu IKT-Risiken beim KI-Einsatz Ende 2025 klargestellt: KI ist kein Sonderthema mit eigener Parallelwelt, sondern Teil des normalen IKT-Risikomanagements unter DORA, also der EU-Verordnung zur digitalen Betriebsstabilität. Übersetzt heißt das: KI-Systeme gehören ins Asset-Inventar, in die Drittdienstleistersteuerung, ins Auslagerungsregister, wenn sie aus der Cloud kommen. Keine neue KI-Behördenlogik, sondern Einbettung ins Bestehende, ausdrücklich auch ins Modell der drei Verteidigungslinien. Dazu kommt die alte Welt, die nie weg war: Unsere Scoring-Modelle unterliegen seit jeher den MaRisk, inklusive Validierungspflichten. Der häufigste Denkfehler, den ich in Branchengesprächen höre, ist: „Wir warten mal, was der AI Act bringt.“ Für ein beaufsichtigtes Finanzhaus ist das rückwärts gedacht. Die Aufsicht kann heute prüfen, mit dem Instrumentarium, das sie seit Jahren hat. Der AI Act legt eine Schicht obendrauf, er ersetzt nichts.
„Der häufigste Denkfehler der Branche: Wir warten mal, was der AI Act bringt. Die Aufsicht kann heute prüfen.“
Weniger, als die Schlagzeilen suggerieren, und mehr, als manche Kollegen wahrhaben wollen. Anhang III Nummer 5 Buchstabe b erfasst KI-Systeme zur Kreditwürdigkeitsprüfung natürlicher Personen, mit der Omnibus-Verschiebung greifen die Pflichten für Anhang-III-Systeme nun zum 2. Dezember 2027, wobei das Amtsblatt noch aussteht, wir planen intern trotzdem auf dieses Datum. Faktisch neu ist für uns vor allem dreierlei: die Grundrechte-Folgenabschätzung nach Artikel 27, die für Kreditwürdigkeits-Betreiber ausdrücklich vorgeschrieben ist, die formalisierte Protokollierung und die technische Dokumentation nach Vorgabe. Der Rest, Validierung, Monitoring, menschliche Letztentscheidung, ist für uns keine Zukunftsmusik, sondern Tagesgeschäft, spätestens seit der EuGH 2023 im SCHUFA-Verfahren klargestellt hat, dass ein Score, der die Kreditentscheidung maßgeblich bestimmt, eine automatisierte Einzelentscheidung nach Artikel 22 DSGVO sein kann. Das Urteil hat uns damals mehr Umbauarbeit beschert als bisher der gesamte AI Act. Wir mussten Prozesse nachweisbar so gestalten, dass der Mensch wirklich entscheidet und nicht nur abnickt.
Das ist die härteste Frage im ganzen Feld, weil sie sich nicht mit einem Formular beantworten lässt. Ein Genehmigungsknopf neben dem Score ist keine menschliche Aufsicht, das ist Dekoration. Wir haben drei Dinge eingezogen. Erstens: Ablehnungen in definierten Konstellationen, etwa bei Scores nahe der Schwelle, gehen zwingend in eine qualifizierte Zweitprüfung, mit Zugriff auf die Einflussfaktoren des Scores, nicht nur auf die Zahl. Zweitens messen wir die Abweichungsquote je Sachbearbeiter. Wenn jemand über Monate in hundert Prozent der Fälle dem System folgt, ist das kein Beweis für Modellqualität, sondern ein Warnsignal für Automatisierungsgläubigkeit, und dann reden wir, nicht sanktionierend, aber ehrlich. Drittens schulen wir die Kreditentscheider auf die Schwächen des Modells, mit echten Fehlklassifikationen aus der Vergangenheit. Nichts erdet so zuverlässig wie ein Fall, in dem das Modell danebenlag und ein Mensch es gemerkt hat. Perfekt ist das nicht. Aber es ist prüfbar, und das ist der Maßstab, an dem wir gemessen werden.
Regelmäßig, und ich sage bewusst: zum Glück. Der klassische Konflikt lief bei uns über den GenAI-Assistenten im Kundenservice. Der Fachbereich wollte ihn in vier Monaten live haben, der Business Case war solide, die Demo überzeugend. Die zweite Linie hat den Start zweimal verweigert. Beim ersten Mal wegen der Drittdienstleisterfrage, Modell aus der Cloud, Datenfluss unklar dokumentiert, Exit-Szenario nicht beschrieben, das ist unter DORA keine Formalie. Beim zweiten Mal, weil unsere Testabdeckung für Halluzinationen, also für frei erfundene, aber plausibel klingende Auskünfte, schlicht nicht überzeugend war. Ich stand dazwischen und habe beide Ablehnungen mitgetragen, was mir im Fachbereich den Ruf eingebracht hat, ich sei „Compliance mit anderem Türschild“. Der Punkt ist: Ein falsch beauskunfteter Kunde im Kreditgeschäft ist kein Übungsfall. Beim dritten Anlauf ging der Assistent live, mit eingeschränktem Themenkorridor und Eskalation an Menschen. Er läuft seit acht Monaten ohne meldepflichtigen Vorfall. Langsamer als geplant, aber er läuft, und niemand muss ihn vor der Aufsicht verstecken.
„Ein Genehmigungsknopf neben dem Score ist keine menschliche Aufsicht. Das ist Dekoration.“
Ja, und eines davon tat richtig weh. Der Vertrieb wollte ein Modell zur Kündigungsfrüherkennung im Bestandsgeschäft, angereichert um Verhaltensdaten aus dem Online-Banking, welche Seiten ein Kunde ansieht, wie oft er den Rechner für Umschuldungen nutzt. Prognostisch war das Gold, die ersten Analysen zeigten deutliche Signale. Ich habe es trotzdem gestoppt, aus zwei Gründen. Erstens war die datenschutzrechtliche Grundlage für diese Zweckänderung bestenfalls wacklig, und ich hatte keine Lust, das vor einer Datenschutzbehörde auszutesten. Zweitens, und das war mir wichtiger: Wenn öffentlich wird, dass wir aus dem Klickverhalten im Banking Vertriebssignale ziehen, ist der Vertrauensschaden größer als jeder Kampagnenerfolg. Der Bereichsleiter hat eskaliert, bis zum Vorstand. Der Vorstand hat mir recht gegeben, allerdings, das gehört zur Wahrheit, erst nachdem die Rechtsabteilung meine Einschätzung geteilt hat. Auf mein Wort allein hätte er sich nicht verlassen. Daran arbeite ich noch.
Das Inventar, so banal das klingt. Als wir vor zwei Jahren angefangen haben, alle Systeme mit KI-Komponenten zu erfassen, hatte ich mit etwa fünfzehn gerechnet. Es wurden über vierzig. Betrugserkennung im Zahlungsverkehr, Dokumentenklassifikation in der Poststelle, das Dialer-Modul im Inkasso mit „intelligenter“ Priorisierung, ein Übersetzungstool, das eine Fachabteilung als Browser-Erweiterung nutzte, von der IT hatte davon niemand Kenntnis. Jedes dieser Systeme braucht eine Einordnung: Ist es KI im Sinne der Verordnung, ist es Hochrisiko, wer ist Anbieter, wer Betreiber, welche Modellakte existiert. Bei zugekauften Systemen hängt man an der Auskunftsfreude des Herstellers, und die reicht von vorbildlich bis, sagen wir, ausbaufähig. Meine Lehre: Die Inventarisierung ist keine Compliance-Fleißarbeit, sie ist der Moment, in dem ein Haus zum ersten Mal ehrlich sieht, wie viel Entscheidungsautomatik längst im Betrieb ist. Das Ergebnis hat den Vorstand mehr beeindruckt als jede Strategiefolie von mir.
„Ich hatte mit fünfzehn KI-Systemen gerechnet. Es wurden über vierzig, eines davon kannte die IT gar nicht.“
Mit einem Portfolio-Trick, den ich jedem in regulierten Branchen empfehle: Wir trennen strikt nach Eingriffstiefe. Kategorie eins sind Werkzeuge ohne Kundenwirkung, interne Textassistenz, Recherche, Protokolle. Da sind wir bewusst schnell, mit Standardfreigabe in Wochen, sonst erstickt jede Neugier im Haus. Kategorie zwei wirkt auf Kunden, entscheidet aber nicht, der Service-Assistent zum Beispiel. Da gilt der volle Prüfpfad, aber mit realistischem Zeithorizont. Kategorie drei entscheidet über Menschen, Scoring, Betrugsverdacht, Konditionen. Da bin ich konservativ, da kommt nichts Neues in Produktion, was wir nicht validieren, erklären und protokollieren können, und zwar bevor der Vertrag mit dem Anbieter unterschrieben ist. Der Fachbereich nennt Kategorie drei intern „das Hochsicherheitsressort“, halb spöttisch. Ich nehme das als Kompliment. Die ehrliche Bilanz nach zweieinhalb Jahren: In Kategorie eins sind wir schneller als die meisten, in Kategorie drei langsamer als der Vertrieb möchte. Genau so herum soll es sein.
Erstens: Suchen Sie in der ersten Woche das Gespräch mit der zweiten Linie und der Revision, nicht erst, wenn das erste Projekt feststeckt. Wer die Prüferlogik früh einbaut, baut nur einmal. Zweitens: Machen Sie das Inventar vor der Strategie. Eine KI-Strategie ohne Kenntnis der real laufenden Systeme ist Prosa. Drittens: Übersetzen Sie Aufsichtstexte in Architektur, bevor es andere für Sie tun, Orientierungshilfe, MaRisk, DORA und AI Act ergeben zusammen ein konsistentes Bild, wenn man sie als Schichten liest statt als Widersprüche. Viertens: Verlieren Sie nie den Satz aus dem Blick, dass Governance dem Vertrauen dient, nicht dem Papier. An dem Tag, an dem Ihre Modellakte nur noch für die Prüfung gepflegt wird und nicht mehr, weil jemand die Antworten wissen will, haben Sie organisatorisch verloren, auch wenn das Audit grün ist. Und fünftens, ganz praktisch: Rechnen Sie damit, dass Sie unbeliebt sind, bei beiden Seiten, abwechselnd. Wenn beide Seiten gleichzeitig mit Ihnen zufrieden sind, machen Sie vermutlich etwas falsch.
Ein Briefing pro Woche: Entscheidungsfragen, eingeordnete Zahlen und Fristen. Ihre Adresse geben wir nicht weiter.
8 Min. Lesezeit
Jetzt lesen8 Min. Lesezeit
Jetzt lesen8 Min. Lesezeit
Jetzt lesen