Zuletzt aktualisiert am:
Techniken zur Manipulation von KI-Modellen durch das Einschleusen irreführender Eingabedaten, um fehlerhafte Ergebnisse zu provozieren.
Gezielte, oft nicht wahrnehmbare Modifikationen von Eingabedaten – Bildern, Texten oder Audiodateien –, die Schwachstellen in den Entscheidungsgrenzen eines KI-Modells ausnutzen. Solche Angriffe verdeutlichen die Schwächen von Black-Box-Systemen und unterstreichen die Notwendigkeit proaktiver Schutzmaßnahmen: Adversarial Training (das Einbringen manipulierter Beispiele während des Trainings), Bereinigungsebenen für Eingabedaten (Input Sanitization) sowie kontinuierliche Penetrationstests durch „Red Teams“.
Praxisbeispiel:
Sicherheitsforscher platzieren winzige, kunstvolle Aufkleber auf einem Stoppschild, sodass das Bilderkennungssystem eines selbstfahrenden Autos dieses fälschlicherweise als „Geschwindigkeitsbegrenzung 45“ interpretiert. Der Automobilhersteller reagiert darauf mit der Integration von Detektoren für adversariale Beispiele und der Härtung des Modells durch randomisierte Eingabevorverarbeitung.




