最終更新日:
AIシステムの目標が、人間の価値観や組織の優先事項と常に一致するように、インセンティブ構造や目標を設計すること。
望ましい動作(安全性、公平性など)を促進し、不適切なインセンティブを回避する目的関数または報酬関数を設計する手法。これには、AIが学習したインセンティブがステークホルダーの意図から逸脱しないようにするための、人間によるフィードバックループ、制約付き最適化(安全な強化学習など)、および定期的な監査が含まれます。
実際の導入事例:
当初、コンテンツ推奨AIは視聴時間を最大化するように設計されていたため、クリックベイト(釣り見出し)の増加を招きました。そこで製品チームは、「コンテンツの多様性」に対する副次的な報酬を追加し、扇情的な見出しにペナルティを課すようにしました。導入後、クリックベイトの視聴数は50%減少し、全体のユーザーエンゲージメントが向上しました。これは、インセンティブ設計の整合性が高まったことを示しています。




