AIシステムの脆弱性を発見するために、内部または外部の専門家が攻撃や悪用シナリオを模擬するプロアクティブなテストアプローチ。
専門チーム(「レッドチーム」)が、プロンプトインジェクション、データポイズニング、APIの不正利用、モデル抽出などを通じて、モデルのセーフガードを突破しようと試みる、構造化された敵対的演習です。レッドチーミングは防御上のギャップを特定し、緩和戦略の策定に資するとともに、現実的な脅威シミュレーション下でセキュリティ層およびポリシー層が有効に機能することを検証します。ガバナンスは、レッドチームの対象範囲、実施ルール、ならびに必要な是正報告を規定します。
ある金融AIプラットフォームは、自社APIに対するデータ抽出攻撃を試みるため、外部のレッドチームを起用しました。チームはサンプル学習データの再構築に成功しました。調査結果に基づき、同プラットフォームはレート制限、差分プライバシー・ノイズ、およびより強固な認証を導入し、一般公開前に重大な脆弱性へ対処しました。




