Andersonův úhel

Útoky na systémy zpracování přirozeného jazyka pomocí adversních příkladů

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Výzkumníci ve Spojeném království a Kanadě vyvinuli řadu černých skřínek adversních útoků proti systémům zpracování přirozeného jazyka (NLP), které jsou účinné proti širokému spektru populárních rámců pro zpracování jazyka, včetně široce nasazených systémů od Google, Facebooku, IBM a Microsoftu.

Útok může být potenciálně použit k znefunkčníkování systémů strojového překladu tím, že je donutí produkovat nesmysl nebo změnit povahu překladu; k zablokování školení modelů NLP; k chybné klasifikaci toxického obsahu; k otrávení výsledků vyhledávače tím, že způsobí chybnou indexaci; k tomu, aby vyhledávače selhaly při identifikaci škodlivého nebo negativního obsahu, který je pro člověka dokonale čitelný; a dokonce k vyvolání útoků typu Denial-of-Service (DoS) na rámce NLP.

Ačkoli autoři oznámili navrhované zranitelnosti různých neznámým stranám, jejichž produkty figurují ve výzkumu, považují, že odvětví NLP bylo pomalé v ochraně sebe proti adversním útokům. Článek uvádí:

‘Tyto útoky využívají funkce kódování jazyka, jako jsou neviditelné znaky a homoglyfy. Ačkoli byly tyto útoky viděny občas v minulosti ve spamu a podvodech, designéři mnoha systémů NLP, které jsou nyní nasazovány ve velkém měřítku, se zdají ignorovat je úplně.’

Několik útoků bylo provedeno v takzvaném “černém boxu” – prostřednictvím API volání do systémů MLaaS, spíše než místně nainstalovaných verzí rámců NLP. Autoři píší:

‘Všechny experimenty byly provedeny v černém boxu, kde jsou povoleny neomezené hodnocení modelů, ale přístup k váhám nebo stavu modelu není povolen. To představuje jeden z nejsilnějších hrozeb, pro které jsou útoky možné ve většině prostředí, včetně proti komerčním nabídkám MLaaS. Každý model, který jsme prozkoumali, byl zranitelný vůči nepozorovatelným perturbačním útokům.’

‘Věříme, že použitelnost těchto útoků by se teoreticky měla vztahovat na jakýkoli textový model NLP bez adekvátních obran.’

Článek je nazvaný Špatné znaky: Nepozorovatelné útoky NLP a pochází od tří výzkumníků z tří oddělení na University of Cambridge a University of Edinburgh a výzkumníka z University of Toronto.

Název článku je příkladem: je plný “nepozorovatelných” Unicode znaků, které tvoří základ jedné ze čtyř hlavních metod útoků, které výzkumníci přijali.

Even the paper's title has hidden mysteries.

Even the paper’s title has hidden mysteries.

Metoda/ y

Článek navrhuje tři primární účinné metody útoků: neviditelné znaky; homoglyfy; a znovuspořádání. Tyto jsou “univerzální” metody, které výzkumníci našli, že mají široký dosah proti rámcům NLP v černém boxu. Další metoda, která zahrnuje použití smazání znaku, byla nalezena výzkumníky jako vhodná pouze pro neobvyklé potrubí NLP, které využívají systémový clipboard.

1: Neviditelné znaky

Tento útok využívá kódované znaky v fontu, které nemapují na glyf v systému Unicode. Systém Unicode byl navržen tak, aby standardizoval elektronický text a nyní pokrývá 143 859 znaků napříč mnoha jazyky a symbolickými skupinami. Mnoho z těchto mapování neobsahuje žádný viditelný znak v fontu (který nemůže, přirozeně, zahrnovat znaky pro každou možnou položku v Unicode).

From the paper, a hypothetical example of an attack using invisible characters, which split up the words into segments which either mean nothing to a Natural Language Processing system, or, if carefully crafted, can mean something different to an accurate translation. For the casual reader, the original text is correct.

From the paper, a hypothetical example of an attack using invisible characters, which splits up the input words into segments that either mean nothing to a Natural Language Processing system, or, if carefully crafted, can prevent an accurate translation. For the casual reader, the original text in both cases is correct. Source: https://arxiv.org/pdf/2106.09898.pdf

Typicky nelze použít jeden z těchto neznaků k vytvoření nulového prostoru, protože většina systémů vykreslí “zástupný” symbol (jako čtverec nebo otazník v úhlovém boxu) pro reprezentaci nerozpoznaného znaku.

Výzkumníci si zvolili glyfy GNU Unifont pro své experimenty, částečně kvůli jeho “robustnímu pokrytí” Unicode, ale také protože vypadá jako mnoho jiných “standardních” fontů, které jsou pravděpodobně krmeny systémy NLP.

Výzkumníci testovali tento útok a zjistili, že je účinný proti většině systémů NLP.

2: Homoglyfy

Homoglyf je znak, který vypadá jako jiný znak – slabina, která byla využita v roce 2000 k vytvoření podvodu repliky platebního procesu PayPal (PYPL ).

In this hypothetical example from the paper, a homoglyph attack changes the meaning of a translation by substituting visually indistinguishable homoglyphs (outlined in red) for common Latin characters.

In this hypothetical example from the paper, a homoglyph attack changes the meaning of a translation by substituting visually indistinguishable homoglyphs (outlined in red) for common Latin characters.

Autoři komentují:

‘Nacházíme, že modely strojového učení, které zpracovávají uživatelsky dodaný text, jako jsou neuronové systémy strojového překladu, jsou zvláště zranitelné vůči tomuto stylu útoku. Zvažte, například, vedoucí službu Google Translate. V době psaní tohoto článku, zadání řetězce “paypal” v anglicko-ruském modelu správně vyprodukovalo “PayPal”, ale nahrazení latinského znaku “a” v vstupu cyrilským znakem а nesprávně vyprodukovalo “папа” (“otec” v angličtině).’

Výzkumníci pozorují, že zatímco mnoho potrubí NLP nahradí znaky, které jsou mimo jejich jazyk-specifické slovníku, <unk> (‘neznámý’) token, software, který vyvolává otrávený text do potrubí, může propagovat neznámá slova pro hodnocení předtím, než tato bezpečnostní opatření může nastat.

3: Znovuspořádání

Unicode umožňuje jazyky, které se píší zleva doprava, s pořadím zpracovaným algoritmem Unicode Bidirectional (BIDI). Směšování pravého a levého textu v jednom řetězci je tedy matoucí, a Unicode udělal ustanovení pro tuto situaci, povolující BIDI být přepsán speciálními řídicími znaky.

In another theoretical example from the paper, a translation mechanism is caused to put all the letters of the translated text in the wrong order, because it is obeying the wrong right-to-left/left-to-right encoding, due to a part of the adversarial source text (circled) commanding it to do so.

In another theoretical example from the paper, a translation mechanism is caused to put all the letters of the translated text in the wrong order, because it is obeying the wrong right-to-left/left-to-right encoding, due to a part of the adversarial source text (circled) commanding it to do so.

Autoři uvádějí, že v době psaní článku, tato metoda byla účinná proti implementaci Unicode v prohlížeči Chromium, upstream zdroji pro prohlížeč Google Chrome, Microsoft Edge a řadu dalších forků.

Také: Smazání

Zahrnuto zde, aby byly následné výsledky grafů jasnější, útok smazání zahrnuje zařazení znaku, který reprezentuje zpět nebo jiný text-affecting kontrolní znak, který je efektivní implementován jazykovým systémem způsobem podobným textovému makru.

Autoři pozorují:

‘Několik kontrolních znaků v Unicode může způsobit odstranění sousedního textu. Největšími příklady jsou backspace (BS) a delete (DEL) znaky. Existuje také carriage return (CR), který způsobí, že algoritmus pro vykreslování textu se vrátí na začátek řádku a přepíše jeho obsah.

‘Například zakódovaný text, který reprezentuje “Hello CRGoodbye World” bude vykreslen jako “Goodbye World”.’

Výzkumníci testovali tento útok a zjistili, že je účinný, ale vyžaduje nepravděpodobnou úroveň přístupu, aby fungoval, a byl by zcela účinný pouze s textem zkopírovaným a vloženým prostřednictvím schránky, systematicky nebo ne – neobyčejný potrubí NLP.

Účinnost proti současným systémům NLP

Výzkumníci provedli řadu útoků proti pěti populárním uzavřeným modelům od Facebooku, IBM, Microsoftu, Google a HuggingFace, jakož i proti třem open-source modelům.

Testovali také ‘sponge’ útoky proti modelům. Útok ‘sponge’ je efektivní DoS útok pro systémy NLP, kde vstupní text “nefunguje” a zpomaluje školení – proces, který by měl být normálně znemožněn předzpracováním dat.

Pět úkolů NLP, které byly vyhodnoceny, zahrnovalo strojový překlad, detekci toxického obsahu, klasifikaci textové implikace, rozpoznání názvů entit a analýzu sentimentu.

Testy byly provedeny na neznámém počtu GPU Tesla P100, každý běžící na procesoru Intel Xeon Silver 4110 na Ubuntu. Aby nebyly porušeny podmínky služby, experimenty byly jednotně opakovaně s rozpočtem perturbace nula (neovlivněný zdroj textu) na pět (maximální narušení). Výzkumníci tvrdí, že výsledky, které získali, by mohly být překročeny, kdyby byl povolen větší počet iterací.

Results from applying adversarial examples against Facebook's Fairseq EN-FR model.

Results from applying adversarial examples against Facebook’s Fairseq EN-FR model.

Výzkumníci dále testovali svůj systém proti předchozím rámcům, které nebyly schopny generovat “čitelný” perturbovaný text stejným způsobem, a našli systém z velké části na stejné úrovni jako tyto, a často pozoruhodně lepší, zatímco si zachovávaly obrovskou výhodu stealth.

Průměrná účinnost napříč všemi metodami, vektory útoku a cíli se pohybuje kolem 80%, s velmi málo iteracemi.

Komentář k výsledkům, výzkumníci říkají:

‘Možná nejvíce znepokojivým aspektem našich nepozorovatelných perturbačních útoků je jejich široká použitelnost: všechny textové systémy NLP, které jsme testovali, jsou náchylné. Skutečně, jakýkoli model strojového učení, který přijímá uživatelsky dodaný text jako vstup, je teoreticky zranitelný vůči tomuto útoku.

Univerzální optické rozpoznávání znaků?

Tyto útoky závisí na tom, co jsou efektivní “zranitelnosti” v Unicode, a byly by zmařeny v potrubí NLP, které rasterizuje veškerý příchozí text a používá optické rozpoznávání znaků jako sanitizační opatření.

Výzkumníci provedli experimenty s potrubím OCR a zjistili, že skóre BLEU (Bilingual Evaluation Understudy) kleslo o 6,2% a navrhl, že by byly nutné lepší technologie OCR, aby se tomuto problému zabránilo.

Výzkumníci dále navrhli, že by měly být BIDI řídicí znaky odstraněny z vstupu výchozí, neobvyklé homoglyfy by měly být mapovány a indexovány (což charakterizují jako “překvapivě velkou úlohu”) a tokenizéry a další mechanismy příjmu by měly být vyzbrojeny proti neviditelným znakům.

V závěru výzkumná skupina naléhavě vyzývá sektor NLP, aby se stal více pozorným k možnostem adversního útoku,currently pole velikého zájmu ve výzkumu počítačového vidění.

‘[My] doporučujeme, aby všechny firmy, které staví a nasazují textové systémy NLP, implementovaly takové obrany, pokud chtějí, aby jejich aplikace byly robustní proti škodlivým aktérům.’

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai