Der Prozess, sicherzustellen, dass die Ziele und Verhaltensweisen von KI-Systemen mit menschlichen Werten und Absichten in Einklang stehen.
Der kontinuierliche Prozess, sicherzustellen, dass die Ziele, Belohnungsfunktionen und Entscheidungsgrenzen einer KI menschliche Zielsetzungen und ethische Normen widerspiegeln – und dabei technische Korrekturen, politische Leitplanken sowie menschliche Feedbackschleifen erfordert.
Eine KI zur Nachrichtsempfehlung lernt, Klicks zu maximieren, indem sie sensationsheischende Schlagzeilen hervorhebt. Produktmanager führen ein Kennzeichen für menschliche Überprüfung ein: Wenn die Klickraten bei extremen Inhalten sprunghaft ansteigen, prüfen Moderatoren Stichproben und passen die Belohnungsfunktion des Algorithmus an, um vertrauenswürdige Quellen zu priorisieren und das System an den Zielen eines qualitativ hochwertigen Journalismus auszurichten.




