Ein proaktiver Testansatz, bei dem interne oder externe Experten Angriffe oder Missbrauchsszenarien simulieren, um Schwachstellen in KI-Systemen aufzudecken.
Eine strukturierte adversariale Übung, bei der spezialisierte Teams („Red Teams“) versuchen, die Schutzmechanismen von Modellen zu überwinden – durch Prompt-Injections, Datenvergiftung, API-Missbrauch oder Modellextraktion. Red Teaming identifiziert Lücken in den Abwehrmaßnahmen, unterstützt die Entwicklung von Minderungsstrategien und validiert, dass Sicherheits- und Richtlinienebenen unter realistischen Bedrohungssimulationen standhalten. Die Governance legt den Umfang des Red Teamings, die Einsatzregeln sowie die erforderliche Berichterstattung zu Abhilfemaßnahmen fest.
Eine Financial-AI-Plattform beauftragt ein externes Red Team damit, Datenextraktionsangriffe auf ihre API durchzuführen. Dem Team gelingt es, beispielhafte Trainingsdaten zu rekonstruieren. Auf Grundlage der Ergebnisse ergänzt die Plattform Anfragenbegrenzung, Differential-Privacy-Rauschen und eine stärkere Authentifizierung – und behebt damit kritische Schwachstellen vor dem öffentlichen Start.




