Dernière mise à jour :
Contraintes ou vérifications prédéfinies (techniques et de conformité) intégrées aux systèmes d'IA afin de prévenir tout comportement dangereux ou non conforme lors de l'exécution.
Couches défensives - tant algorithmiques (seuils de confiance, désinfection des entrées, détecteurs d'attaques contradictoires) que procédurales (portes d'approbation, intervention humaine) - qui imposent le respect des limites politiques. Les garde-fous limitent les résultats (par exemple, pas de discours de haine), restreignent les domaines de décision et déclenchent des actions de sécurité intégrées. Une gouvernance efficace de ces garde-fous nécessite de réviser et de mettre à jour les contraintes à mesure que de nouvelles menaces apparaissent, ainsi que de surveiller les tentatives de contournement.
Exemple concret :
Une intelligence artificielle de modération de contenu dispose de garde-fous qui bloquent les grossièretés et les contenus extrémistes. Lorsque le niveau de confiance du filtre NLP est inférieur à 70 %, le système redirige la publication vers un modérateur humain plutôt que de la publier automatiquement, garantissant ainsi qu'aucun contenu inapproprié ne parvienne au fil d'actualité sans supervision.




