Andersonの視点

自然言語処理システムに対するアドバーサリアル・エクサンプルを用いた攻撃

mm
Unite.AI を Google の優先ソースに追加

イギリスとカナダの研究者は、Google 、Facebook 、IBM、Microsoftなどの幅広い人気のある言語処理フレームワークに対して有効なブラックボックス・アドバーサリアル・アタックのシリーズを開発しました。この攻撃は、機械学習翻訳システムを無力化したり、トレーニングを妨げたり、有害なコンテンツを誤分類させたり、検索エンジンの結果を損なったり、検索エンジンが悪意のあるコンテンツを検出できないようにしたり、さらにはNLPフレームワークに対するサービス拒否攻撃を引き起こしたりする可能性があります。

研究者は、NLP業界がアドバーサリアル・アタックに対する防御に遅れていると考えています。論文では、次のように述べられています。

‘これらの攻撃は、インビジブル・キャラクターやホモグリフなどの言語コーディング・フィーチャーを利用しています。過去にはスパムやフィッシング詐欺でまれにみられたことがありますが、現在広く展開されている多くのNLPシステムの設計者は、これらを完全に無視しているようです。’

いくつかの攻撃は、APIコールを介してMLaaSシステムにアクセスすることで、可能な限りブラックボックス環境で実行されました。システムの総合的な有効性について、研究者は次のように書いています。

‘すべての実験は、無制限のモデル評価が許可されるが、評価されたモデルの重みや状態にアクセスすることは許可されないブラックボックス環境で実行されました。これは、ほとんどの設定、商用のMachine-Learning-as-a-Service(MLaaS)オファリングを含む、可能な攻撃の最も強力な脅威モデルを表します。検査されたすべてのモデルは、認識できないパートurbation攻撃に対して脆弱でした。 ‘

‘我々は、これらの攻撃の適用可能性は、適切な防御が施されていない場合、理論的にはあらゆるテキストベースのNLPモデルに一般化するはずだと考えています。’

論文は、Bad Characters: Imperceptible NLP Attacksと題され、ケンブリッジ大学、エジンバラ大学、トロント大学の研究者によって執筆されています。

論文のタイトルは、実に適切です。タイトルには、研究者が採用した4つの主要な攻撃方法の1つを形成する「認識できない」ユニコード文字が含まれています。

論文のタイトルには、隠された謎が含まれています。

論文のタイトルには、隠された謎が含まれています。

方法

論文では、3つの主要な有効な攻撃方法を提案しています。インビジブル・キャラクタホモグリフリオーダリングです。これらは、ブラックボックスのシナリオでNLPフレームワークに広く適用可能な「ユニバーサル」方法です。削除文字を使用する追加の方法は、クリップボードを使用してテキストをコピーおよびペーストする不通常のNLPパイプラインにのみ適しています。

1: インビジブル・キャラクタ

この攻撃では、フォントにマップされない符号化文字を使用します。ユニコードシステムは、電子テキストを標準化するために設計され、現在は143,859の文字をカバーし、複数の言語とシンボル・グループを含みます。これらのマッピングの多くは、フォントには表示可能な文字が含まれていません(フォントには、ユニコードのすべての可能なエントリを含めることはできないため)。

論文からの仮説的な例。インビジブル・キャラクタを使用した攻撃により、単語をセグメントに分割し、NLPシステムには何も意味をなさないか、慎重に作成すると別の意味になる可能性があります。一般的な読者にとって、元のテキストは正しいです。

論文からの仮説的な例。インビジブル・キャラクタを使用した攻撃により、単語をセグメントに分割し、NLPシステムには何も意味をなさないか、慎重に作成すると別の意味になる可能性があります。一般的な読者にとって、元のテキストは正しいです。ソース:https://arxiv.org/pdf/2106.09898.pdf

通常、ゼロ幅スペースを作成するためにこれらの非文字の1つを使用することはできません。なぜなら、ほとんどのシステムは、認識できない文字を表すために「プレイスホルダー」シンボル(角形のボックス内の正方形または疑問符など)をレンダリングするからです。

しかし、論文では、現在のコンピューティング・シーンを支配するフォントはわずか数種類で、当然ながらユニコード標準に従っていることが観察されています。

したがって、研究者は実験にGNUのUnifontグリフを選択しました。Unifontはユニコードのカバレッジが「堅牢」であることと、多くの「標準」フォントに似ているためです。Unifontから生成されるインビジブル・キャラクタはレンダリングされませんが、テストされたNLPシステムによっては可視化された文字としてカウントされます。

アプリケーション
論文のタイトルに戻ります。タイトルは「作成された」ものです。選択したテキストからGoogle検索を実行すると、期待される結果が得られません。

これはクライアント側の効果ですが、サーバー側の影響は少し深刻です。論文では、次のように述べられています。

‘パートurbationされたドキュメントは、検索エンジンのクローラーによってクロールされる可能性がありますが、インデックスに使用される用語は、パートurbationの影響を受けるため、検索エンジンによって検出される可能性は低くなります。したがって、検索エンジンからドキュメントを「目に見えている」状態で隠すことが可能です。 ‘

‘たとえば、不正な会社は、専門家の分析家が使用する検索エンジンがそれを検出できないように、財務報告書に否定的な情報をマスクすることができます。 ‘

インビジブル・キャラクタの攻撃があまり効果的でなかったのは、有害なコンテンツ、固有表現認識、感情分析モデルのみでした。研究者は、これは、これらのモデルがすでにインビジブル・キャラクタを含むデータでトレーニングされたか、モデルのトークナイザ(生の言語入力をモジュラーなコンポーネントに分割する)がすでにこれらを無視するように構成されていたためであると推測しています。

2: ホモグリフ

ホモグリフは、別の文字と見分けがつかない文字です。2000年に、この弱点は、PayPalの支払い処理ドメインのスキャム・レプリカ (PYPL ) を作成するために利用されました。

論文からの仮説的な例。ホモグリフ攻撃により、一般的なラテン文字に視覚的に区別できないホモグリフ(赤で囲まれた)を代入することで、翻訳の意味を変更します。

論文からの仮説的な例。ホモグリフ攻撃により、一般的なラテン文字に視覚的に区別できないホモグリフ(赤で囲まれた)を代入することで、翻訳の意味を変更します。

研究者は、次のように述べています。

‘我々は、ユーザーが提供したテキストを処理する機械学習モデル、たとえばニューラル機械翻訳システムが、この種の攻撃に対して特に脆弱であることを発見しました。たとえば、市場で優位性を誇るGoogle Translateサービスを考えてみましょう。執筆時点で、英語からロシア語のモデルに「paypal」と入力すると、「PayPal」と出力されますが、入力のラテン文字「a」をキリル文字「а」に置き換えると、「папа」(英語では「父」)と出力されます。 ‘

研究者は、NLPパイプラインでは、言語固有の辞書にない文字が「」(未知)トークンに置き換えられることが多いと観察しています。ただし、パイプラインに有毒なテキストを召喚するソフトウェア・プロセスは、安全対策が機能する前に未知の単語を評価するために伝播する可能性があると述べています。研究者は、これが「驚くほど大きな攻撃面」を開くことを示しています。

3: リオーダリング

ユニコードでは、左から右に書かれた言語を許可し、順序はユニコードの双方向(BIDI)アルゴリズムによって処理されます。右から左と左から右の文字を1つの文字列に組み合わせることは混乱を招きます。ユニコードは、BIDIを特殊な制御文字でオーバーライドすることを許可することでこれに対処しています。これらの制御文字により、固定のエンコード順序に対してほぼ任意のレンダリングが可能になります。

論文からの別の仮説的な例。翻訳メカニズムは、翻訳されたテキストのすべての文字を間違った順序で配置するように指示されます。これは、右から左と左から右のエンコード順序が間違っているためです。

論文からの別の仮説的な例。翻訳メカニズムは、翻訳されたテキストのすべての文字を間違った順序で配置するように指示されます。これは、右から左と左から右のエンコード順序が間違っているためです。

研究者は、執筆時点で、この方法はChromiumウェブブラウザのユニコード実装、GoogleのChromeブラウザ、MicrosoftのEdgeブラウザ、他のフォークに対して有効であったと述べています。

その他: 削除

結果グラフが明確になるようにここに含められているが、削除攻撃には、バックスペースやテキストに影響を与えるコントロール/コマンドを表す文字が含まれ、これはテキスト・マクロと同様の方法で実装されます。

研究者は、次のように述べています。

‘ユニコードには、隣接するテキストを削除することができる制御文字が数個あります。最も単純な例は、バックスペース(BS)と削除(DEL)文字です。また、テキスト・レンダリング・アルゴリズムが行の先頭に戻り、内容を上書きするキャリッジ・リターン(CR)があります。 ‘

‘たとえば、「CRGoodbye World」というテキストは「Goodbye World」とレンダリングされます。 ‘

これは、不可能なほどのアクセスを必要とするため、完全に有効になることはありません。ただし、テキストをクリップボード経由でコピーおよびペーストする不通常のNLPパイプラインで有効です。

研究者はそれでもテストし、最初の3つの方法と同等のパフォーマンスを発見しました。ただし、最初の3つの方法を使用した攻撃は、ドキュメントまたはウェブページをアップロードするだけで実装できます(検索エンジンおよびウェブ・スクラピングNLPパイプラインに対する攻撃の場合)。

削除攻撃では、作成された文字がそれに先行するものを消去したり、単行のテキストを2行目に強制したりしますが、どちらの場合も、一般的な読者には明らかではありません。

削除攻撃では、作成された文字がそれに先行するものを消去したり、単行のテキストを2行目に強制したりしますが、どちらの場合も、一般的な読者には明らかではありません。

現在のNLPシステムに対する有効性

研究者は、Facebook、IBM、Microsoft 、Google、HuggingFaceの5つの人気のあるクローズドソース・モデル、および3つのオープンソース・モデルに対して、標的のない攻撃と標的のある攻撃の両方を実行しました。

また、‘スポンジ’攻撃をモデルに対してテストしました。スポンジ攻撃は、NLPシステムに対するサービス拒否攻撃です。ここで、入力テキストは「計算されない」ため、トレーニングが大幅に遅くなるはずです(通常、データの事前処理によってこれは不可能になるはずです)。

評価されたNLPタスクは、機械翻訳、有害なコンテンツの検出、テキスト的包含分類、固有表現認識、感情分析でした。

実験は、Tesla P100 GPUの不特定の数、Intel Xeon Silver 4110 CPU、Ubuntuで実行されました。サービス利用規約に違反しないように、APIコールの場合、実験は一貫して0(影響を受けないソーステキスト)から5(最大の妨害)までのパートurbation予算で繰り返されました。研究者は、より多くのイテレーションが許可された場合、得られた結果を超えることができると主張しています。

FacebookのFairseq EN-FRモデルに対するアドバーサリアル・エクサンプルを適用した結果。

FacebookのFairseq EN-FRモデルに対するアドバーサリアル・エクサンプルを適用した結果。

IBMの有害なコンテンツ・クラスファイアとGoogleのPerspective APIに対する攻撃の結果。

IBMの有害なコンテンツ・クラスファイアとGoogleのPerspective APIに対する攻撃の結果。

FacebookのFairseqに対する2つの攻撃: 「untargeted」は妨害を目的とし、「targeted」は翻訳された言語の意味を変更することを目的としています。

FacebookのFairseqに対する2つの攻撃: 「untargeted」は妨害を目的とし、「targeted」は翻訳された言語の意味を変更することを目的としています。

研究者は、以前のフレームワークに対してシステムをテストし、これらのシステムは同じ方法で「人間が読める」パートurbationテキストを生成できなかったことに気付きました。システムはこれらのシステムとほぼ同等で、多くの場合はるかに優れており、ステルス性の大きな利点を保持していました。

すべての方法、攻撃ベクトル、ターゲットに対する平均的な有効性は、わずかなイテレーションで約80%です。

結果について、研究者は次のように述べています。

‘我々の認識できないパートurbation攻撃の最も心配な側面は、その広範な適用可能性です。すべてのテキストベースのNLPシステムが脆弱です。実際、ユーザーが提供したテキストを入力として処理するすべての機械学習モデルは、理論的にはこの攻撃に対して脆弱です。 ‘

‘アドバーサリアルな意味合いは、アプリケーションやモデルによって異なる可能性がありますが、すべてのテキストベースのモデルは符号化されたテキストに基づいており、符号化が適切に制限されていない限り、すべてのテキストはアドバーサリアルな符号化に対して脆弱です。 ‘

ユニバーサル・オプティカル・キャラクタ・レコグニション

これらの攻撃は、実質的にユニコードの「脆弱性」に依存しており、NLPパイプラインでテキストをラスタライズし、オプティカル・キャラクタ・レコグニション(OCR)をサニタイズ・メジャーとして使用することで回避できます。その場合、同じ非悪性な意味が、人間がこれらのパートurbation攻撃を読むのと同じように、NLPシステムに渡されます。

ただし、研究者がこの理論をテストするためにOCRパイプラインを実装したとき、BLEU(Bilingual Evaluation Understudy)スコアは、ベースラインの精度を6.2%低下させ、改善されたOCRテクノロジーがこの問題を解決する必要があることを示唆しました。

また、BIDI制御文字をデフォルトで入力から削除し、不通常なホモグリフをマッピングおよびインデックス化する(これを「難しい」と表現しています)こと、およびトークナイザーや他のインジェスト・メカニズムをインビジブル・キャラクタに対して武装することを提案しています。

結論として、研究グループは、NLPセクターがアドバーサリアル・アタックの可能性に対してより注意を払う必要があると主張しています。

‘[私たちは]、テキストベースのNLPシステムを構築および展開するすべての企業が、悪意のあるアクターに対してアプリケーションをロバストにするためには、这种防御を実装することをお勧めします。 ‘

 

 

* 私のインライン引用のハイパーリンクへの変換

18:08 14日 2021年 – IBMの重複した言及を削除し、引用からの自動内部リンクを移動しました – MA

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai