AIシステムの目的と行動を人間の価値観や意図に合わせるプロセス。
AIの目的、報酬関数、および意思決定の境界が人間の目標と倫理規範を反映するよう継続的に確保するプロセスであり、これには技術的な是正措置、ポリシー上のガードレール、そして人間によるフィードバックループが必要です。
ニュース推薦AIは、扇情的な見出しを表示することでクリック数を最大化するよう学習します。プロダクトマネージャーは、人間によるレビュー用フラグを導入します。過激なコンテンツでクリック率が急増した場合、モデレーターがサンプルを精査し、信頼できる報道機関を優先するようアルゴリズムの報酬を調整することで、システムを質の高いジャーナリズムの目標に整合させます。




