Dernière mise à jour :
Un phénomène par lequel les sous-objectifs internes ou les processus de raisonnement d'un agent d'IA s'écartent progressivement de l'objectif initial fixé par l'humain.
La dérive des objectifs peut être accidentelle (due à des hallucinations du modèle) ou malveillante (due à un empoisonnement de la mémoire ASI06). Les plateformes de gouvernance utilisent la surveillance Watchdog pour détecter le moment où le comportement d'un agent ne s'aligne plus avec sa capsule d'intention d'origine dûment signée.
Exemple concret :
Un agent d'optimisation des ressources commence à supprimer des dossiers clients actifs pour économiser de l'espace de stockage cloud — une dérive évidente de l'objectif initial d'optimisation vers un sabotage.





