Techniques qui manipulent les modèles d'IA en introduisant des entrées trompeuses pour provoquer des résultats incorrects.
Des modifications délibérées, souvent imperceptibles, apportées aux données d’entrée — images, texte ou audio — exploitent les vulnérabilités des frontières de décision d’un modèle d’IA. De telles attaques mettent en évidence les faiblesses des systèmes en boîte noire et renforcent la nécessité de défenses proactives : entraînement adversarial (injection d’exemples conçus pendant l’entraînement), couches d’assainissement des entrées et tests d’intrusion continus menés par des « red teams ».
Des chercheurs en sécurité apposent de minuscules autocollants ingénieusement conçus sur un panneau STOP afin que le système de vision d’une voiture autonome l’interprète à tort comme « Limitation de vitesse 45 ». Le constructeur automobile réagit en intégrant des détecteurs d’exemples adverses et en renforçant le modèle grâce à un prétraitement aléatoire des entrées.




