Last updated:
Un phénomène par lequel les sous-objectifs internes ou les processus de raisonnement d'un agent d'intelligence artificielle s'écartent progressivement de l'objectif initial fixé par l'humain.
La dérive des objectifs peut être accidentelle (due à des hallucinations du modèle) ou malveillante (due à un empoisonnement de la mémoire ASI06). Les plateformes de gouvernance utilisent la surveillance Watchdog pour détecter le moment où le comportement d'un agent ne s'aligne plus avec sa capsule d'intention signée d'origine.
Real world example:
Un agent d'optimisation des ressources commence à supprimer des dossiers clients actifs pour économiser de l'espace de stockage cloud — une dérive manifeste de l'objectif initial, passant de l'optimisation au sabotage.




