La capacité d'un système d'IA à continuer de fonctionner correctement même lorsque certains composants échouent ou produisent des erreurs.
Implique des modèles d’architecture — composants redondants, dégradation progressive, points de contrôle et annulations de transactions — qui garantissent que les services d’IA demeurent disponibles et sûrs en cas de défaillances partielles. La gouvernance prescrit des tests d’injection de pannes (ingénierie du chaos), des analyses des modes de défaillance et des objectifs de niveau de service clairs pour le temps de reprise et la continuité du service.
Une API de classification d’images basée sur le cloud s’exécute sur plusieurs instances de conteneurs derrière un équilibreur de charge. Si une instance tombe en panne pendant un événement à fort volume, le trafic est automatiquement redirigé vers des pods sains, et les instances défaillantes redémarrent sans impact pour les utilisateurs. L’équipe des opérations effectue régulièrement des tests de chaos afin de valider les mécanismes de tolérance aux pannes.




