La capacité des systèmes d'intelligence artificielle et de leur infrastructure de soutien à anticiper, résister, se rétablir et s'adapter aux perturbations ou aux événements défavorables.
Cela implique de la redondance (serveurs de basculement), des plans de reprise après sinistre (sauvegardes, clusters en veille à chaud), l’autoscaling pour gérer les pics de trafic, ainsi que des exercices de chaos engineering afin de tester la robustesse du système. La gouvernance exige de définir des SLA de résilience (RTO, RPO), de mener des exercices réguliers et d’intégrer les exigences de résilience dans la conception des systèmes et les processus d’approvisionnement.
Une IA de santé destinée à la surveillance des soins critiques fonctionne dans un déploiement cloud actif-actif réparti sur deux régions. Si une région tombe en panne, le trafic bascule de manière transparente vers l’autre. Des tests de chaos trimestriels simulent des pannes régionales et vérifient le basculement automatique dans le délai SLA d’une minute, garantissant ainsi une surveillance continue des patients.




