Die Gestaltung von Belohnungsstrukturen und Zielen, sodass die Zielsetzungen von KI-Systemen mit menschlichen Werten und organisatorischen Prioritäten übereinstimmen.
Die Praxis der Gestaltung von Ziel- oder Belohnungsfunktionen, die gewünschte Verhaltensweisen (z. B. Sicherheit, Fairness) fördern und perverse Anreize vermeiden. Sie umfasst menschliche Feedback-Schleifen, eingeschränkte Optimierung (z. B. sicheres RL) sowie regelmäßige Audits, um sicherzustellen, dass die vom KI-System erlernten Anreize nicht von den Absichten der Stakeholder abweichen.
Eine KI zur Inhaltsempfehlung maximierte ursprünglich die Wiedergabezeit, was zu Clickbait führte. Das Produktteam ergänzt eine sekundäre Belohnung für „Inhaltsvielfalt“ und sanktioniert reißerische Überschriften. Nach der Bereitstellung sinkt die Clickbait-Zuschauerschaft um 50 %, und das allgemeine Nutzerengagement steigt, was eine bessere Anreizausrichtung widerspiegelt.




