最終更新日:
一部のコンポーネントで障害やエラーが発生した場合でも、AIシステムが正常に動作し続けることができる能力。
これには、一部のコンポーネントが機能停止した場合でも、AIサービスの可用性と安全性を維持するためのアーキテクチャパターン(冗長コンポーネント、グレースフルデグラデーション、チェックポインティング、トランザクションのロールバックなど)が含まれます。ガバナンスにおいては、障害注入テスト(カオスエンジニアリング)、故障モード影響解析、および目標復旧時間とサービス継続性に関する明確なサービスレベル目標(SLO)の策定が規定されています。
実際の導入事例:
クラウドベースの画像分類APIは、ロードバランサーの背後にある複数のコンテナインスタンス上で実行されます。アクセス集中時に1つのインスタンスがクラッシュした場合、トラフィックは自動的に正常なポッドに移行し、クラッシュしたインスタンスはユーザーに影響を与えることなく再起動します。運用チームは、耐障害性メカニズムを検証するために、定期的にカオスシステムテストを実施しています。




