Dernière mise à jour :
La capacité de déduire l'état interne et le comportement d'un système d'IA grâce à la collecte et à l'analyse de journaux, de métriques et de résultats, afin d'assurer une surveillance et un dépannage efficaces.
Va au-delà de la simple surveillance pour fournir des informations approfondies sur l'état du système. Les pipelines d'observabilité collectent des journaux structurés (requêtes, erreurs), des métriques (latence, utilisation des ressources) et des traces (chemins d'exécution) provenant des services d'ingestion de données, d'entraînement et d'inférence. Grâce aux corrélations et aux tableaux de bord, les équipes peuvent identifier les causes profondes des incidents, rejouer les événements et réaliser des analyses post-mortem. La gouvernance définit les signaux à capturer, les politiques de rétention ainsi que les seuils d'alerte afin de garantir la fiabilité du système et sa conformité.
Exemple concret :
Une plateforme de détection de la fraude intègre OpenTelemetry pour émettre des traces pour chaque transaction, enregistre les décisions du modèle avec des scores de confiance et suit l'utilisation du processeur (CPU) et du processeur graphique (GPU). En cas de pic de latence, l'équipe d'ingénierie de fiabilité des sites (SRE) analyse les traces pour identifier une requête lente dans le magasin de fonctionnalités (feature store), corrige l'indexation et rétablit les performances normales en moins de 15 minutes.




