最終更新日:
AIシステムおよびそれを支えるインフラストラクチャが、障害や予期せぬ事態を予測し、耐え、そこから回復し、さらに適応していく能力。
これには、冗長性(フェイルオーバーサーバー)、災害復旧計画(バックアップ、ウォームスタンバイクラスタ)、トラフィックの急増に対応する自動スケーリング、およびシステムの堅牢性をテストするためのカオスエンジニアリング訓練が含まれます。ガバナンスにおいては、レジリエンスのSLA(RTO、RPO)の定義、定期的な訓練の実施、そしてシステム設計および調達プロセスにおけるレジリエンス要件の組み込みが求められます。
実際の導入事例:
重症患者モニタリング用の医療用AIは、2つのリージョンにまたがるアクティブ/アクティブ構成のクラウド環境でデプロイされています。万が一、一方のリージョンで障害が発生した場合でも、トラフィックはもう一方のリージョンへとシームレスに移行します。四半期ごとに実施されるカオスエンジニアリングテストでは、リージョンの停止をシミュレートし、1分間のSLA(サービス品質保証)内での自動フェイルオーバーを検証することで、患者のモニタリングが中断されることなく継続されることを保証しています。




