Contraintes prédéfinies ou vérifications (techniques et politiques) intégrées dans les systèmes d'intelligence artificielle pour prévenir les comportements dangereux ou non conformes pendant l'exécution.
Des couches défensives — à la fois algorithmiques (seuils de confiance, assainissement des entrées, détecteurs d’attaques adversariales) et procédurales (paliers d’approbation, intervention humaine dans la boucle) — qui appliquent les limites de la politique. Les garde-fous limitent les sorties (p. ex., absence de discours haineux), restreignent les domaines de décision et déclenchent des actions de sécurité en cas de défaillance. Une gouvernance efficace des garde-fous exige de réviser et de mettre à jour les contraintes à mesure que de nouvelles menaces apparaissent, ainsi que de surveiller les tentatives de contournement.
Une IA de modération de contenu dispose de garde-fous qui bloquent les propos injurieux et les contenus extrémistes. Lorsque le niveau de confiance du filtre NLP est inférieur à 70 %, le système transmet la publication à un modérateur humain au lieu de la publier automatiquement, garantissant ainsi qu’aucun contenu dangereux n’atteigne le fil sans supervision.




