Dernière mise à jour :
Techniques consistant à manipuler les modèles d'IA en y introduisant des données trompeuses afin de générer des résultats erronés.
Des modifications délibérées et souvent imperceptibles des données d'entrée — images, textes ou fichiers audio — qui exploitent les vulnérabilités des frontières de décision d'un modèle d'IA. Ces attaques mettent en évidence les faiblesses des systèmes de type boîte noire et soulignent la nécessité de défenses proactives : l'entraînement contradictoire (injection d'exemples optimisés lors de l'entraînement), les couches d'assainissement des entrées, ainsi que des tests d'intrusion réguliers menés par des équipes d'attaquants (« red-teaming »).
Exemple concret :
Des chercheurs en sécurité apposent de minuscules autocollants astucieusement conçus sur un panneau d'arrêt, de sorte que le système de vision d'un véhicule autonome l'interprète de manière erronée comme une limitation de vitesse à 45. Le constructeur automobile réagit en intégrant des détecteurs d'exemples contradictoires et en renforçant le modèle grâce à un prétraitement aléatoire des données d'entrée.




