Zuletzt aktualisiert am:
Der systematische Prozess der Evaluierung von KI-Modellen anhand von Benchmarks, Grenzfällen und Belastungstests, um sicherzustellen, dass sie die Kriterien für Leistung, Sicherheit und Compliance erfüllen.
Dies umfasst Unit-Tests für einzelne Komponenten, Integrationstests für Daten-Pipelines, Regressionstests mit historischen Daten, Edge-Case-Szenarien (kontradiktorische, seltene Ereignisse) sowie Stresstests hinsichtlich Skalierbarkeit und Sicherheit. Die Validierung schließt statistische Leistungskennzahlen, Fairness-Audits und Compliance-Prüfungen ein. Die Governance stellt sicher, dass kein Modell in die Produktion übergeht, ohne eine umfassende, von unabhängigen Prüfern freigegebene Test- und Validierungs-Checkliste erfolgreich durchlaufen zu haben.
Praxisbeispiel:
Die Testumgebung eines Kreditrisikomodells umfasst: eine Hold-Out-Validierung anhand aktueller Darlehensdaten, Stresstests mit simulierten wirtschaftlichen Abschwungszenarien, Bias-Tests über verschiedene Einkommens- und Demografiegruppen hinweg sowie API-Auslastungstests. Erst nach dem erfolgreichen Durchlaufen aller Phasen erhält das Modell die endgültige Freigabe für den Produktiveinsatz.




