Zuletzt aktualisiert am:
Die Fähigkeit eines KI-Systems, auch dann korrekt weiterzufunktionieren, wenn einzelne Komponenten ausfallen oder Fehler verursachen.
Dazu gehören Architekturmuster – redundante Komponenten, schrittweiser Funktionsabbau (Graceful Degradation), Checkpoints und Transaktions-Rollbacks –, die sicherstellen, dass KI-Dienste auch bei Teilausfällen verfügbar und sicher bleiben. Die Governance schreibt Fehlereinschleusungstests (Chaos Engineering), Fehlermöglichkeitsanalysen und klare Service-Level-Objectives für Wiederherstellungszeiten und Servicekontinuität vor.
Praxisbeispiel:
Eine cloudbasierte API zur Bildklassifizierung wird auf mehreren Container-Instanzen hinter einem Loadbalancer betrieben. Wenn eine Instanz während einer Phase mit hohem Datenverkehr ausfällt, wird der Traffic automatisch auf fehlerfreie Pods umgeleitet, und die ausgefallenen Instanzen starten ohne Auswirkungen für die Benutzer neu. Das Operations-Team führt regelmäßig Chaos-Tests durch, um die Fehlertoleranzmechanismen zu validieren.




