Dernière mise à jour :
La capacité des systèmes d'IA et de leur infrastructure de support à anticiper, résister, se rétablir et s'adapter aux perturbations ou événements indésirables.
Cela implique la redondance (serveurs de basculement), des plans de reprise après sinistre (sauvegardes, clusters de secours actifs), la mise à l'échelle automatique pour gérer les pics de trafic, ainsi que des exercices d'ingénierie du chaos pour tester la robustesse du système. La gouvernance exige de définir des accords de niveau de service (SLA) de résilience (RTO, RPO), de mener des exercices réguliers et d'intégrer les exigences de résilience dans la conception et l'acquisition des systèmes.
Exemple concret :
Une intelligence artificielle médicale destinée à la surveillance en soins intensifs fonctionne au sein d'un déploiement cloud actif-actif réparti sur deux régions. En cas de défaillance d'une région, le trafic est redirigé de manière transparente vers l'autre. Des tests de chaos trimestriels simulent des pannes de région, vérifiant ainsi le basculement automatique dans le respect de l'accord de niveau de service (SLA) d'une minute, ce qui garantit une surveillance ininterrompue des patients.




