AIモデルとプラットフォーム

TextFooler アルゴリズムは NLP AI を欺く

mm
Unite.AI を Google の優先ソースに追加

自然言語処理アルゴリズムとシステムは近年驚くほど進化してきたが、まだ「アドバーサリアルな例」と呼ばれる種類のエクスプロイトに対して脆弱である。アドバーサリアルな例は、NLP システムが予期せぬ方法で動作するように設計された慎重に設計されたフレーズである。AI プログラムはこれらの奇妙な例によって誤動作することができ、結果として、AI 研究者はアドバーサリアルな例の影響に対して保護する方法を設計しようとしている。

最近、香港大学とシンガポールの科学技術庁の研究者チームは、アドバーサリアルな例の危険性を示すアルゴリズムを作成するために共同で作業した。Wired が報告したように、アルゴリズムは研究チームによって TextFooler と命名され、文の特定の部分を微妙に変更することで機能し、NLP 分類器が文を解釈する方法に影響を与える。例として、アルゴリズムは一つの文を別の類似の文に変換し、レビューが否定的か肯定的かを判断するように設計された分類器にその文を入力した。元の文は次の通りだった。

「登場人物は、あり得ないほど 作り付けられた 状況に置かれ、完全に現実から断絶している。」

これは次の文に変換された。

「登場人物は、あり得ないほど 工夫された 状況に置かれ、完全に現実から断絶している。」

これらの微妙な変更により、テキスト分類器はレビューを否定的ではなく肯定的として分類した。研究チームは、同様のアプローチ(特定の単語を同義語と交換する)を複数のデータセットとテキスト分類アルゴリズムでテストし、アルゴリズムの分類精度を 90% から 10% に低下させることができたと報告している。これは、人間がこれらの文を読んでも同じ意味を理解することとは対照的である。

これらの結果は、NLP アルゴリズムと AI がより頻繁に、そして重要なタスク(医療請求の評価や法的文書の分析など)に使用されている時代に懸念を引き起こしている。アドバーサリアルな例が現在使用されているアルゴリズムに与える危険性の程度は不明である。世界中の研究チームはまだその影響を調査しようとしている。スタンフォード大学の Human-Centered AI グループが最近発表した報告書によると、アドバーサリアルな例は AI アルゴリズムを欺くことができ、税金詐欺を犯すために使用される可能性がある。

この研究にはいくつかの限界がある。例えば、UC Irvine のコンピューターサイエンスの助教授である Sameer Singh は、アドバーサリアルな方法が有効であったことを指摘しているが、それは AI のアーキテクチャに関するある程度の知識に依存している。AI は、効果的な単語のグループを見つけるまで繰り返しプローブされる必要があり、そんな繰り返し攻撃はセキュリティプログラムによって検知される可能性がある。Singh とその同僚は、この主題に関する独自の研究を行っており、OpenAI のような高度なシステムは、特定のトリガー句に促されて人種差別的な、有害なテキストを生成することができることを発見した。

アドバーサリアルな例は、写真やビデオのような視覚的なデータを扱う場合にも潜在的な問題となる。有名な例としては、特定のデジタル変換をネコの画像に適用し、画像分類器がそれをモニターまたはデスクトップ PC として解釈するように促すことができる。別の例として、UC Berkeley の教授である Dawn Song が行った研究では、アドバーサリアルな例は、コンピュータビジョンシステムが道路標識を認識する方法を変更するために使用でき、自動運転車にとって危険となる可能性がある。

香港とシンガポールのチームが行ったような研究は、AI エンジニアが AI アルゴリズムの脆弱性をよりよく理解し、潜在的にそれらの脆弱性を防御する方法を設計するのに役立つ可能性がある。例えば、アンサンブル分類器を使用して、アドバーサリアルな例がコンピュータビジョンシステムを欺く可能性を低減することができる。この技術では、複数の分類器が使用され、入力画像にわずかな変換が行われる。分類器のほとんどは、画像の真の内容の側面を通常は認識し、それらをまとめる。結果として、分類器の何らかが欺かれるとしても、ほとんどは欺かれず、画像は適切に分類される。

ブログ作家およびプログラマーで、 Machine Learning Deep Learning のトピックを専門としています。Danielは、AIの力を社会のために利用する手助けを他者に与えることを希望しています。