Dernière mise à jour :
La capacité d'un système d'intelligence artificielle à continuer de fonctionner correctement même lorsque certains composants tombent en panne ou génèrent des erreurs.
Cela implique des modèles architecturaux (composants redondants, dégradation progressive, points de contrôle et annulations de transactions) qui garantissent que les services d'IA restent disponibles et sûrs en cas de pannes partielles. La gouvernance prescrit des tests d'injection de pannes (ingénierie du chaos), des analyses de modes de défaillance, ainsi que des objectifs de niveau de service clairs pour le temps de rétablissement et la continuité de l'activité.
Exemple concret :
Une API de classification d'images basée sur le cloud s'exécute sur plusieurs instances de conteneurs derrière un répartiteur de charge. Si une instance tombe en panne lors d'un événement à fort volume, le trafic est automatiquement redirigé vers des pods sains, et les instances défaillantes redémarrent sans impact pour l'utilisateur. L'équipe des opérations effectue régulièrement des tests de chaos afin de valider les mécanismes de tolérance aux pannes.




