Die Fähigkeit von KI-Systemen und deren unterstützender Infrastruktur, Störungen oder widrigen Ereignissen vorherzusehen, ihnen standzuhalten, sich davon zu erholen und sich anzupassen.
Umfasst Redundanz (Failover-Server), Notfallwiederherstellungspläne (Backups, Warm-Standby-Cluster), Autoskalierung zur Bewältigung von Lastspitzen sowie Chaos-Engineering-Übungen zur Prüfung der Systemrobustheit. Die Governance erfordert die Definition von Resilienz-SLAs (RTO, RPO), die Durchführung regelmäßiger Übungen und die Verankerung von Resilienzanforderungen im Systemdesign und in der Beschaffung.
Eine KI-Lösung für die Überwachung in der Intensivmedizin wird in einer Active-Active-Cloud-Bereitstellung über zwei Regionen hinweg betrieben. Fällt eine Region aus, wird der Datenverkehr nahtlos auf die andere umgeleitet. Vierteljährliche Chaos-Tests simulieren den Ausfall von Regionen und verifizieren das automatische Failover innerhalb der SLA von einer Minute – so wird eine unterbrechungsfreie Patientenüberwachung gewährleistet.




