AIシステムがいくつかのコンポーネントで故障やエラーが発生した場合でも、正しく動作し続ける能力。
これには、冗長コンポーネント、グレースフル・デグラデーション、チェックポイント化、トランザクション・ロールバックといったアーキテクチャ・パターンが含まれ、部分的な障害下でもAIサービスの可用性と安全性を維持します。ガバナンスでは、フォールトインジェクション試験(カオスエンジニアリング)、故障モード分析、ならびに復旧時間およびサービス継続性に関する明確なサービスレベル目標の設定を規定します。
クラウドベースの画像分類APIは、ロードバランサーの背後で複数のコンテナインスタンス上で稼働しています。高トラフィック時のイベント中に1つのインスタンスがクラッシュした場合でも、トラフィックは自動的に正常なPodへ切り替わり、クラッシュしたインスタンスはユーザーへの影響なく再起動します。運用チームは、フォールトトレランスの仕組みを検証するために、定期的にカオステストを実施しています。




