最終更新日:
AIモデルに欺瞞的な入力を導入することにより、モデルを操作して誤った出力を生成させる手法。
AIモデルの決定境界における脆弱性を突くために、画像、テキスト、音声などの入力データに加えられる、意図的で、多くの場合には検知困難な改ざんのことです。こうした攻撃は、ブラックボックスシステムの脆弱性を浮き彫りにし、敵対的学習(トレーニング中に作成したサンプルを注入する手法)、入力サニタイジング(無害化)レイヤー、継続的な「レッドチーム」によるペネトレーションテストといった、プロアクティブな防御策の必要性を促します。
実際の導入事例:
セキュリティ研究者が一時停止の標識に芸術的とも言える極小のステッカーを貼ることで、自動運転車のビジョンシステムにそれを「制限速度45マイル」と誤認識させます。自動車メーカーは、敵対的サンプルの検出器を統合し、ランダム化された入力の事前処理によってモデルを堅牢化することでこれに対応します。




