Zuletzt aktualisiert am:
Die Gestaltung von Anreizstrukturen und Zielsetzungen, um sicherzustellen, dass die Ziele von KI-Systemen stets im Einklang mit menschlichen Werten und organisatorischen Prioritäten stehen.
Die Praxis der Gestaltung von Ziel- oder Belohnungsfunktionen, die erwünschte Verhaltensweisen (z. B. Sicherheit, Fairness) fördern und Fehlreize vermeiden. Sie umfasst menschliche Feedbackschleifen, eingeschränkte Optimierung (z. B. sicheres Reinforcement Learning) sowie regelmäßige Audits, um sicherzustellen, dass die gelernten Anreize der KI nicht von den Absichten der Stakeholder abweichen.
Praxisbeispiel:
Eine KI zur Inhaltsempfehlung maximierte ursprünglich die Sehdauer, was zu Clickbait führte. Das Produktteam fügt eine sekundäre Belohnung für „Inhaltsvielfalt“ hinzu und penalisiert sensationelle Schlagzeilen. Nach der Bereitstellung sinken die Clickbait-Zuschauerzahlen um 50 % und das allgemeine Nutzerengagement steigt, was eine bessere Abstimmung der Anreize widerspiegelt.




