最終更新日:
効果的なモニタリングとトラブルシューティングを実現するために、ログ、メトリクス、および出力の収集と分析を通じて、AIシステムの内部状態と動作を推論する機能。
基本的なモニタリングの枠を超え、システム健全性に関する深い洞察を提供します。オブザーバビリティパイプラインは、データ取り込み、トレーニング、および推論サービスから、構造化ログ(リクエスト、エラー)、メトリクス(レイテンシ、リソース使用状況)、およびトレース(実行パス)を収集します。相関関係の分析とダッシュボードにより、チームは問題の根本原因を正確に特定し、イベントを再現し、事後分析(ポストモーテム)を実施することができます。ガバナンスでは、システムの信頼性とコンプライアンスを維持するために、収集すべきシグナル、データ保持ポリシー、およびアラートのしきい値を定義します。
実際の導入事例:
ある不正検知プラットフォームでは、OpenTelemetryを統合してすべてのトランザクションのトレースを出力し、モデルの判定結果を信頼度スコアとともにログに記録し、さらにCPUおよびGPUの使用率を追跡しています。レイテンシーが急上昇した際、SREチームはトレースを詳細に分析して機能ストア(feature-store)へのクエリ遅延を特定し、インデックス処理を修正することで、わずか15分以内に通常のパフォーマンスを回復させました。




