最終更新日:
モデルの重みや構造を検査し、改ざんや意図しない挙動を示す可能性のある、異常、バックドア、またはバイアスを検出します。
モデルのパラメータを詳細に分析し、不規則な分布、隠れたトリガー(バックドアパターンなど)、および機密性の高い特徴に関連する不均衡な重みの大きさを検出するディープインスペクション(詳細検査)プロセス。ガバナンスにおいては、重みのヒストグラムをスキャンし、異常値パラメータを検出し、セキュリティと公平性の審査のために不審なパターンをフラグ付けする自動化ツールが活用され、破損したモデルや悪意をもって操作されたモデルのデプロイを防止します。
実際の導入事例:
セキュリティチームが顧客セグメンテーションモデルに対してウェイト監査ツールを実行したところ、暗号化されたバックドア機能に関連するウェイトの急激な上昇を検出しました。チームは直ちにそのモデルを隔離し、フォレンジック分析を実施してポイズニング攻撃(データ汚染攻撃)を特定した上で、クリーンなチェックポイントから再学習を行いました。これにより、本番環境への導入前に悪意のあるバックドアを排除することに成功しました。




