Dernière mise à jour :
La conception de structures de récompense et d'objectifs permettant de garantir que les buts des systèmes d'IA restent alignés avec les valeurs humaines et les priorités de l'entreprise.
La pratique consistant à concevoir des fonctions d'objectif ou de récompense qui encouragent les comportements souhaités (par exemple, la sécurité, l'équité) et évitent les incitations perverses. Cela implique des boucles de rétroaction humaine, une optimisation sous contraintes (par exemple, l'apprentissage par renforcement sécurisé) et des audits périodiques afin de garantir que les motivations apprises par l'IA ne divergent pas des intentions des parties prenantes.
Exemple concret :
Une IA de recommandation de contenu maximisait initialement le temps de visionnage, ce qui générait des pièges à clics (clickbait). L'équipe produit a alors ajouté une récompense secondaire pour la « diversité du contenu » et pénalisé les titres sensationnalistes. Après déploiement, l'audience des pièges à clics a chuté de 50 % tandis que l'engagement global des utilisateurs a progressé, illustrant ainsi un meilleur alignement des objectifs.




