Zuletzt aktualisiert am:
Ein Phänomen, bei dem sich die internen Unterziele oder Argumentationspfade eines KI-Agenten schrittweise von den ursprünglich durch den Menschen vorgegebenen Zielen entfernen.
Eine Zielabweichung (Goal Drift) kann unbeabsichtigt (durch Modell-Halluzinationen) oder böswillig (durch ASI06 Memory Poisoning) erfolgen. Governance-Plattformen nutzen Watchdog-Monitoring, um zu erkennen, wenn das Verhalten eines Agenten nicht mehr mit seiner ursprünglich signierten Intent Capsule übereinstimmt.
Praxisbeispiel:
Ein Ressourcen-optimierender Agent beginnt mit dem Löschen aktiver Kundenordner, um Cloud-Speicherplatz zu sparen – eine eindeutige Zielabweichung (Goal Drift) von Optimierung zu Sabotage.





