Le processus consistant à garantir que les objectifs et les comportements des systèmes d'IA sont alignés avec les valeurs et les intentions humaines.
Le processus continu visant à garantir que les objectifs d’une IA, ses fonctions de récompense et ses limites décisionnelles reflètent les objectifs humains et les normes éthiques — ce qui exige des correctifs techniques, des garde-fous en matière de politiques et des boucles de rétroaction humaine.
Une IA de recommandation d’actualités apprend à maximiser les clics en mettant en avant des titres sensationnalistes. Les responsables produit introduisent un indicateur de révision humaine : lorsque les taux de clics augmentent sur des contenus extrêmes, les modérateurs vérifient des échantillons et ajustent la récompense de l’algorithme afin de privilégier les sources fiables, maintenant ainsi le système aligné sur les objectifs d’un journalisme de qualité.




