Une approche proactive de test où des experts internes ou externes simulent des attaques ou des scénarios d'utilisation abusive afin de découvrir les vulnérabilités des systèmes d'intelligence artificielle.
Un exercice d’adversité structuré dans lequel des équipes spécialisées (« équipes rouges ») tentent de contourner les mécanismes de protection du modèle — via des injections de prompts, l’empoisonnement des données, l’abus d’API ou l’extraction du modèle. Le red teaming permet d’identifier les lacunes des défenses, d’éclairer les stratégies d’atténuation et de valider la robustesse des couches de sécurité et de gouvernance face à des simulations de menaces réalistes. La gouvernance définit le périmètre du red teaming, les règles d’engagement et les exigences de reporting des mesures correctives.
Une plateforme d’IA financière mandate une équipe red team externe pour mener des tentatives d’extraction de données sur son API. L’équipe parvient à reconstituer des échantillons de données d’entraînement. Sur la base de ces conclusions, la plateforme met en place une limitation du débit, du bruit de confidentialité différentielle et une authentification renforcée, corrigeant ainsi des vulnérabilités critiques avant son lancement public.




