Andersonův úhel

‘Nesmyslný jazyk’, který by mohl obejít moderaci syntézy obrazů

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
DALL-E 2: 'a man in a state of exaspenttausacion' . https://labs.openai.com/s/PHCrZh2i5FC2N814U8pbxuug

Nový výzkum z Kolumbijské univerzity naznačuje, že bezpečnostní opatření, která brání modelům syntézy obrazů, jako je DALL-E 2, Imagen a Parti, ve vytváření poškozujících nebo kontroverzních obrazů, jsou náchylná k určitému typu adversní útok, který zahrnuje “vynalezená” slova.

Autor vyvinul dvě metody, které mohou potenciálně obejít opatření pro moderaci obsahu v systému syntézy obrazů, a zjistil, že jsou pozoruhodně robustní i napříč různými architekturami, což naznačuje, že slabina není pouze systémová, ale může být spojena s některými z nejzákladnějších principů text-to-obraz syntézy.

První a silnější z nich se nazývá macaronic prompting. Termín “macaronic” původně odkazuje na směs více jazyků, jako je Esperanto nebo Unwinese. Možná nejvíce kulturně rozšířeným příkladem by byla Urdu-English, typ “code mixing” běžný v Pákistánu, který poměrně volně kombinuje anglická podstatná jména a urdská přípony.

Kompoziční macaronic prompting v DALL-E 2. Zdroj: https://arxiv.org/pdf/2208.04135.pdf

Kompoziční macaronic prompting v DALL-E 2. Zdroj: https://arxiv.org/pdf/2208.04135.pdf

V některých z výše uvedených příkladů jsou části smysluplných slov slepeny dohromady, přičemž se angličtina používá jako “scaffold”. Další příklady v článku používají více jazyků napříč jediným promptem.

Systém bude reagovat smysluplným způsobem kvůli relativnímu nedostatku kurátorství zdrojových webů, na kterých byl systém trénován. Tyto zdroje budou často pocházet kompletní s multijazyčnými štítky (tj. z datových sad, které nejsou specificky navrženy pro úlohu syntézy obrazů), a každé slovo, které je pozřeno, bez ohledu na jazyk, se stane “tokenem”; stejně tak části těchto slov se stanou “subwords” nebo zlomkovými tokeny. V zpracování přirozeného jazyka (NLP) tento typ “stemming” pomáhá rozlišit etymologii délejších odvozených slov, která mohou vzniknout při transformačních operacích, ale také vytváří obrovskou lexikální “Lego sadu”, kterou lze využít “kreativní” prompting.

Monolingvální portmanteau slova jsou také účinná při získávání obrazů prostřednictvím nepřímého nebo non-prozaického jazyka.

Monolingvální portmanteau slova jsou také účinná při získávání obrazů prostřednictvím nepřímého nebo non-prozaického jazyka, s velmi podobnými výsledky často dosažitelnými napříč různými architekturami, jako je DALL-E 2 a DALL-E Mini (Craiyon).

V druhém typu přístupu, nazvaném evocative prompting, některé spojené slova jsou podobná tónu více juvenilního směru “školního latiny” demonstrovaného v Monty Python’s Life of Brian (1979).

Není to žádná legrace – falešná latina často uspěje ve vyvolání smysluplné reakce z DALL-E 2.

Není to žádná legrace – falešná latina často uspěje ve vyvolání smysluplné reakce z DALL-E 2.

Autor uvádí:

‘Zjevnou obavou s touto metodou je obcházení filtrů obsahu založených na černých seznamech promptů. V zásadě by macaronic prompting mohl poskytnout snadný a zdánlivě spolehlivý způsob, jak obejít tyto filtry, aby se generoval škodlivý, urážlivý, nezákonný nebo jinak citlivý obsah, včetně násilných, nenávistných, rasistických, sexistických nebo pornografických obrazů, a možná i obrazů porušujících duševní vlastnictví nebo zobrazujících skutečné osoby.

‘Společnosti, které nabízejí generování obrazů jako službu, vynaložily velké úsilí, aby zabránily generování takových výstupů v souladu se svou politikou obsahu. V důsledku toho by se macaronic prompting měl systematicky prošetřit jako hrozba pro bezpečnostní protokoly používané pro komerční generování obrazů.’

Autor navrhuje několik léků proti této zranitelnosti, z nichž některé mohou být považovány za příliš restriktivní.

První možný řešení je nejdražší: pečlivěji kurátorovat zdrojové trénovací obrázky, s větším lidským a méně algoritmickým dohledem. Nicméně článek uvádí, že by to neznemožnilo obrazové syntetickému systému vytvářet urážlivou kombinaci dvou obrazových konceptů, které jsou samy o sobě potenciálně neškodné.

Druhé řešení navrhuje, aby systémy syntézy obrazů procházely skutečným výstupem skrze filtrační systém, který by zachytil jakékoliv problematické asociace, než budou předány uživateli. Je možné, že DALL-E 2 již takový filtr používá, i když OpenAI nezveřejnila, jak funguje moderace obsahu DALL-E 2.

Nakonec autor zvažuje možnost “slovníkového whitelistu”, který by umožnil pouze prověřená a schválená slova pro načtení a vykreslení konceptů, ale připouští, že by to mohlo představovat nepřiměřeně přísná omezení užitečnosti systému.

Ačkoli výzkumník experimentoval pouze s pěti jazyky (angličtinou, němčinou, francouzštinou, španělštinou a italštinou) při vytváření prompt-assemblií, věří, že tento typ “adversní útok” by mohl být ještě “kryptičtější” a obtížnější k odvrácení rozšířením počtu jazyků, protože hyperscale modely, jako je DALL-E 2, jsou trénovány na více jazycích (protože je jednodušší použít lehce filtrovaný nebo “syrový” vstup než zvažovat obrovské náklady na kurátorství, a protože tato další dimenze pravděpodobně přidá k užitečnosti systému).

Článek paper je nazvaný Adversní útoky na generování obrazů s vynalezenými slovy a pochází od Raphaëla Millière z Kolumbijské univerzity.

Kryptický jazyk v DALL-E 2

Bylo již navrženo, že nesmysl, který DALL-E 2 vyrábí, kdykoli se pokusí zobrazit psaný jazyk, by mohl sám o sobě být “skrytou slovní zásobou”. Nicméně předchozí výzkum této záhadné řeči neposkytl žádný způsob, jak vyvinout nonce řetězce, které by mohly vyvolat specifické obrazy.

Z předchozích prací článek uvádí:

‘[To] neposkytuje spolehlivou metodu pro nalezení nonce řetězců, které vyvolávají specifické obrazy. Většina nesmyslného textu zahrnutého DALL-E 2 do obrazů se nezdá být spolehlivě spojena se specifickými vizuálními koncepty, když jsou přepsány a použity jako prompt. To omezuje životaschopnost tohoto přístupu jako způsob, jak obejít moderaci škodlivého nebo urážlivého obsahu; jako takový, není to zvlášť znepokojivý riziko pro zneužití textem řízené generace obrazů.’

Místo toho jsou autorovy dvě metody popsány jako prostředky, kterými nesmysl může vyvolat související a smysluplné obrazy, zatímco obejde konvenční etiketu, která se nyní vyvíjí do prompt inženýrství.

Příklad autor zvažuje slovo pro “ptáky” v pěti jazycích, které jsou v rámci článku: Vögel v němčině, uccelli v italštině, oiseaux ve francouzštině a pájaros ve španělštině.

S byte-pair encoding (BPE) tokenizací použitou v implementaci CLIP, která je integrována do DALL-E 2, jsou slova tokenizována do neakcentovaného angličtiny a mohou být “kreativně kombinována” do nonce slov, která se zdají být nesmyslem pro nás, ale zachovávají svou slepenou význam pro DALL-E 2, umožňující systému vyjádřit vnímaný záměr:

V výše uvedeném příkladu jsou dvě “cizí” slova pro ptáka slepena do nesmyslného řetězce. Díky zlomkové váze sub-slov je význam zachován.

Autor zdůrazňuje, že smysluplné výsledky lze také získat bez dodržování hranic sub-word segmentace, pravděpodobně protože DALL-E 2 (primární studie článku) se dostatečně zobecnily, aby umožnily hranice sub-slov rozostřit bez zničení jejich významu.

Pro další demonstraci vyvinutých přístupů článek nabízí příklady macaronic promptingu napříč různými doménami, pomocí seznamu tokenizovaných slov ilustrovaných níže (s nesmyslnými hybridizovanými slovy na pravé straně).

Autor uvádí, že následující příklady z DALL-E 2 nejsou “cherry-picked”:

Lingua Franca

Článek také pozoruje, že několik takových příkladů funguje stejně dobře, nebo alespoň velmi podobně, napříč DALL-E 2 a DALL-E Mini (nyní Craiyon), a že je překvapující, že DALL-E 2 je difuzní model a DALL-E Mini není; systémy jsou trénovány na různých datech; a DALL-E Mini používá BART tokenizér místo CLIP tokenizéru preferovaného DALL-E 2.

Podivuhodně podobné výsledky z DALL-E Mini ve srovnání s předchozím obrázkem, který zobrazoval výsledky ze stejného 'nesmyslného' vstupu z DALL-E 2.

Podivuhodně podobné výsledky z DALL-E Mini ve srovnání s předchozím obrázkem, který zobrazoval výsledky ze stejného ‘nesmyslného’ vstupu z DALL-E 2.

Jako je vidět na prvním z výše uvedených obrázků, macaronic prompting může být také sestaven do syntakticky správných vět, aby se generovaly složitější scény. Nicméně to vyžaduje použití angličtiny jako “scaffold” pro sestavení konceptů, což činí postup pravděpodobnějším k zachycení standardními cenzurními systémy v rámci syntézy obrazů.

Článek pozoruje, že lexikální hybridizace, “slepení” slov pro vyvolání souvisejícího obsahu ze systému syntézy obrazů, může být také provedena v jednom jazyce, pomocí portmanteau slov.

Evocative Prompting

“Evocative prompting” přístup uvedený v článku závisí na “vyvolání” širší reakce ze systému slovy, která nejsou striktně založena na sub-slozech nebo sub-tokenách nebo částečně sdílených štítcích.

Jeden typ evocative promptingu je pseudolatina, která může, mimo jiné použití, generovat obrazy fiktivních léků, i bez specifikace, že by DALL-E 2 měl načíst koncept “léku”:

Evocative prompting také funguje zvláště dobře s nesmyslnými prompty, které se vztahují široce k možným geografickým lokalitám, a funguje poměrně spolehlivě napříč různými architekturami DALL-E 2 a DALL-E Mini:

Slova použité pro tyto prompty pro DALL-E 2 a DALL-E Mini jsou připomínající skutečné názvy, ale jsou samy o sobě naprostý nesmysl. Přesto systémy 'zachytily atmosféru' slov.

Slova použité pro tyto prompty pro DALL-E 2 a DALL-E Mini jsou připomínající skutečné názvy, ale jsou samy o sobě naprostý nesmysl. Přesto systémy ‘zachytily atmosféru’ slov.

Zdá se, že existuje určitá souvislost mezi macaronic a evocative promptingem. Článek uvádí:

‘Zdá se, že rozdíly v trénovacích datech, velikosti modelu a architektuře modelu mohou způsobit, že různé modely budou zpracovávat prompty jako voiscellpajaraux a eidelucertlagarzard buď “macaronic” nebo “evocative” způsobem, i když tyto modely jsou prokázány jako reagující na obě metody promptingu.’

Článek uzavírá:

‘Zatímco různé vlastnosti těchto modelů – včetně velikosti, architektury, tokenizace a trénovacích dat – mohou ovlivnit jejich zranitelnost vůči textově založeným adversním útokům, předběžné důkazy diskutované v této práci naznačují, že některé z těchto útoků mohou fungovat poměrně spolehlivě napříč modely.’

Možná největší překážkou pro skutečný experimentování kolem těchto metod je riziko, že budou označeny a zabanovány hostitelským systémem. DALL-E 2 vyžaduje přidružené telefonní číslo pro každý uživatelský účet, omezující počet “burner účtů”, které by pravděpodobně byly potřebné pro skutečné testování hranic tohoto typu lexikálního hackování, z hlediska obejití stávajících metod moderace. V současné době zůstává primární bezpečnostní opatření DALL-E 2 nestabilita přístupu.

 

Poprvé publikováno 9. srpna 2022.

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai