最終更新日:
AIシステムの脆弱性を発見するために、社内外の専門家が攻撃や悪用のシナリオをシミュレートする、予防的なテストアプローチ。
プロンプトインジェクション、データポイズニング、APIの不正利用、モデルの抽出などを通じて、専門チーム(「レッドチーム」)がモデルの防御策の突破を試みる、構造化された敵対的演習です。レッドチームによる演習(レッドチーミング)は、防御におけるギャップを特定し、緩和策を導き出し、現実的な脅威シミュレーションの下でセキュリティおよびポリシーレイヤーが有効に機能することを確認します。ガバナンスによって、レッドチームの活動範囲、交戦規定、および義務付けられる是正措置レポートが規定されます。
実際の導入事例:
金融分野に特化したAIプラットフォームを提供する企業が、外部のレッドチームを雇用し、自社APIに対するデータ抽出攻撃のシミュレーションを実施しました。その結果、チームはトレーニングデータのサンプルの復元に成功しました。この調査結果に基づき、同プラットフォームは、一般公開前にレート制限の導入、差分プライバシーによるノイズの追加、および認証の強化を実施し、重大な脆弱性に対処しました。




