Dernière mise à jour :
Une investigation structurée visant à déterminer les causes sous-jacentes des défaillances ou des comportements imprévus des systèmes d'IA, afin de guider les mesures correctives.
Une méthodologie post-incident (5 pourquoi, diagrammes de causes et effets) qui retrace les événements de défaillance (par exemple, les erreurs de classification des modèles, les pannes de système) à travers les pipelines de données, la logique des modèles et les couches d'infrastructure afin d'identifier le défaut principal. L'analyse des causes profondes documente les conclusions et les plans d'action, garantit que les mesures correctives traitent les problèmes systémiques et prévient toute récidive. La gouvernance exige une telle analyse pour tout incident de gravité élevée, avec une revue des résultats par la direction.
Exemple concret :
Après qu'un moteur de recommandation a commencé à suggérer du contenu inapproprié, l'équipe a procédé à une analyse des causes profondes : elle a découvert qu'un script d'ingestion de données avait fusionné les données de test et de production, faussant ainsi l'entraînement. L'équipe a corrigé le script, revalidé le modèle et ajouté des tests unitaires au pipeline d'ingestion, éliminant ainsi tout risque futur de contamination entre environnements.




