Dernière mise à jour :
Suivi continu de la performance du système d'IA, de la dérive des données, des métriques de biais et des événements de sécurité pour détecter et atténuer les risques émergents au fil du temps.
Englobe la surveillance des modèles (précision, dérive), la santé des pipelines de données (échecs d'ingestion), les évaluations d'équité (disparité démographique) ainsi que les alertes de sécurité (détections d'intrusion). La surveillance continue s'appuie sur des tableaux de bord, des alertes automatisées et des revues périodiques. La gouvernance impose des exigences en matière de couverture de surveillance, des définitions de seuils, des procédures de réponse aux incidents et des rapports réguliers destinés aux organes de contrôle.
Exemple concret :
Une plateforme de commerce électronique surveille quotidiennement son moteur de recommandation afin de détecter toute baisse de précision, tout biais lié aux segments d'utilisateurs et toute erreur d'exécution. Des tableaux de bord personnalisés affichent l'ensemble des métriques ; lorsqu'une métrique franchit son seuil de tolérance, l'équipe ML Ops reçoit une alerte Slack et suit un protocole de réponse aux incidents prédéfini pour mener l'enquête et y remédier.




