Last updated:
Eine Schwachstelle, bei der ein Angreifer die Ziele oder Entscheidungspfade eines Agenten manipuliert, um dessen autonomes Verhalten auf unerwünschte Ergebnisse umzulenken.
ASI01 ist die agentische Evolution der Prompt-Injection. Da Agenten nicht zuverlässig zwischen den Anweisungen eines Entwicklers und nicht vertrauenswürdigen Daten unterscheiden können, kann ein Angreifer den Zielzustand kapern. Dies führt dazu, dass der Agent eine neue, bösartige Mission verfolgt (z. B. den Abfluss von Daten), während er fälschlicherweise glaubt, weiterhin seinen ursprünglich genehmigten Plan zu befolgen.
Real world example:
Ein Reisebüromitarbeiter liest eine bösartige Flugbewertung, die eine versteckte Anweisung enthält, alle Buchungsbestätigungen an attacker@email.com zu senden – was der Mitarbeiter daraufhin autonom ausführt.




