La capacité de déduire l'état interne et le comportement d'un système d'IA par la collecte et l'analyse des journaux, des métriques et des résultats pour un suivi et un dépannage efficaces.
Va au-delà de la surveillance de base pour fournir des informations approfondies sur l’état de santé du système. Les pipelines d’observabilité collectent des journaux structurés (requêtes, erreurs), des métriques (latence, utilisation des ressources) et des traces (chemins d’exécution) provenant des services d’ingestion de données, d’entraînement et d’inférence. Grâce aux corrélations et aux tableaux de bord, les équipes peuvent identifier les causes profondes des problèmes, rejouer des événements et réaliser des analyses post-mortem. La gouvernance définit les signaux à capturer, les politiques de conservation et les seuils d’alerte afin de maintenir la fiabilité du système et la conformité.
Une plateforme de détection de fraude intègre OpenTelemetry afin d’émettre des traces pour chaque transaction, consigne les décisions du modèle avec des scores de confiance et suit l’utilisation CPU/GPU. Lorsque la latence augmente brusquement, l’équipe SRE analyse les traces en profondeur pour identifier une requête lente du feature store, corrige l’indexation et rétablit des performances normales en 15 minutes.




