AIシステムおよびそれを支えるインフラストラクチャが予測し、耐え、回復し、そして混乱や不利な事象に適応する能力。
これには、冗長化(フェイルオーバーサーバー)、災害復旧計画(バックアップ、ウォームスタンバイクラスタ)、トラフィックスパイクに対応するオートスケーリング、ならびにシステムの堅牢性を検証するためのカオスエンジニアリング演習が含まれます。ガバナンスにおいては、レジリエンスに関するSLA(RTO、RPO)の定義、定期的な演習の実施、そしてシステム設計および調達プロセスへのレジリエンス要件の組み込みが求められます。
重症患者モニタリング向けの医療AIは、2つのリージョンにまたがるアクティブ・アクティブのクラウド構成で稼働しています。いずれかのリージョンで障害が発生した場合、トラフィックはシームレスにもう一方のリージョンへ切り替わります。四半期ごとのカオステストではリージョン障害をシミュレーションし、1分以内というSLA内で自動フェイルオーバーが実行されることを検証することで、患者モニタリングの継続性を確保します。




