Die Evaluierungstätigkeiten (z. B. Tests mit zurückgestellten Daten, Stressszenarien), die bestätigen, dass ein KI-Modell seinen vorgesehenen Zweck und die Leistungskriterien erfüllt.
Ein Satz von Prüfungen vor der Bereitstellung, einschließlich: Backtesting mit bislang ungesehenen Daten, Stresstests unter extremen oder adversarialen Bedingungen, Fairness- und Kalibrierungsbewertungen sowie Sensitivitätsanalysen. Validierungsberichte dokumentieren Methodiken, Ergebnisse und etwaige Einschränkungen. Die Governance erfordert unabhängige Validierer, klare Validierungskriterien und eine formale Freigabe vor der Produktionsveröffentlichung.
Ein Kredit-Scoring-Modell wird von einem unabhängigen Team validiert: Es testet das Modell anhand eines zweimonatigen Hold-out-Datensatzes, simuliert wirtschaftliche Abschwungsszenarien, bewertet die Fairness über Einkommensklassen hinweg und bestätigt, dass Leistungs- und Fairnesskennzahlen die in den Richtlinien der Bank festgelegten Schwellenwerte erfüllen, bevor es für den Live-Betrieb freigegeben wird.




