La conception des structures de récompense et des objectifs afin que les buts des systèmes d'IA restent en adéquation avec les valeurs humaines et les priorités organisationnelles.
La pratique consistant à élaborer des fonctions objectif ou de récompense qui encouragent les comportements souhaités (par ex., la sécurité, l’équité) et évitent les incitations perverses. Elle implique des boucles de rétroaction humaine, une optimisation sous contraintes (par ex., l’apprentissage par renforcement sûr) et des audits périodiques afin de garantir que les incitations apprises par l’IA ne s’écartent pas des intentions des parties prenantes.
Une IA de recommandation de contenu maximisait à l’origine le temps de visionnage, ce qui favorisait les pièges à clics. L’équipe produit ajoute une récompense secondaire pour la « diversité des contenus » et pénalise les titres sensationnalistes. Après le déploiement, l’audience des contenus de type piège à clics diminue de 50 % et l’engagement global des utilisateurs augmente, reflétant un meilleur alignement des incitations.




