アドバーサリアル・トレーニング(敵対的学習)
意味・解説
AIモデルに対し、あえて誤認識を誘発するような「敵対的サンプル」を学習データに混ぜることで、AIの堅牢性(耐攻撃性)を高める手法。
AIの弱点を突く攻撃(アドバーサリアル・アタック)を逆手に取り、それらを克服するように再学習させる。画像認識の誤魔化しや、不正な入力に対するAIの防御力を向上させる。
くわしく
「AIという『ガードマン』に、わざと泥棒の変装パターンを見せて鍛える」特訓です。
1.攻撃の仕組み:
人間には分からない程度の僅かなノイズを加えるだけで、AIはパンダをテナガザルと誤認することがあります。
2.防御の仕組み:
そうした『わざと間違えさせるデータ』をあらかじめ学習させることで、多少のノイズがあっても正しく判断できる「タフなAI」を作ります。ポイントは、自動運転の標識認識や顔認証システムが、シール一枚の細工で突破されるようなリスク(AIの脆弱性)を防ぐためです。
例文
自動運転システムの安全性を担保するため、道路標識に細工を施した画像を用いたアドバーサリアル・トレーニングを実施した。
同義語: 敵対的学習 / 堅牢化トレーニング
分類: AIセキュリティ