Die Fähigkeit eines KI-Systems, auch dann korrekt weiterzuarbeiten, wenn einige Komponenten ausfallen oder Fehler produzieren.
Umfasst Architekturmuster – redundante Komponenten, graceful Degradation, Checkpointing und Transaktions-Rollbacks –, die sicherstellen, dass KI-Services bei teilweisen Ausfällen verfügbar und sicher bleiben. Die Governance schreibt Fault-Injection-Tests (Chaos Engineering), Analysen von Fehlermodi sowie klare Service-Level-Ziele für Wiederherstellungszeit und Servicekontinuität vor.
Eine cloudbasierte API zur Bildklassifizierung läuft auf mehreren Container-Instanzen hinter einem Load Balancer. Wenn während eines Ereignisses mit hohem Volumen eine Instanz ausfällt, wird der Datenverkehr automatisch auf fehlerfreie Pods umgeleitet, und ausgefallene Instanzen werden ohne Auswirkungen auf die Benutzer neu gestartet. Das Ops-Team führt regelmäßig Chaos-Tests durch, um die Fehlertoleranzmechanismen zu validieren.




