不正な出力を引き起こすために、誤解を招く入力を導入してAIモデルを操作する技術です。
入力データ(画像・テキスト・音声)に対して、意図的かつ多くの場合は知覚されにくい改変を加え、AIモデルの意思決定境界の脆弱性を突く手法です。こうした攻撃はブラックボックス型システムの弱点を浮き彫りにし、先回りした防御の必要性を高めます。具体的には、敵対的学習(学習時に細工したサンプルを注入)、入力サニタイズ層、そして継続的な「レッドチーム」による侵入テストが挙げられます。
セキュリティ研究者は、自動運転車の視覚システムがそれを「速度制限45」と誤認するよう、停止標識に小さく巧妙なステッカーを貼り付けます。これに対し、自動車メーカーは、敵対的サンプル検知機構を統合し、ランダム化された入力前処理によってモデルの堅牢性を強化します。




