Unghiul lui Anderson

Limbajul “fără sens” care ar putea subverti sistemele de moderare a sintezei de imagini

mm
Adaugă Unite.AI la sursele tale preferate pe Google
DALL-E 2: 'a man in a state of exaspenttausacion' . https://labs.openai.com/s/PHCrZh2i5FC2N814U8pbxuug

Noi cercetări de la Universitatea Columbia sugerează că sistemele de moderare care previn modelele de sinteză de imagini, cum ar fi DALL-E 2, Imagen și Parti, să producă imagini dăunătoare sau controversate, sunt susceptibile la un tip de atac adversarial care implică “cuvinte inventate”.

Autorul a dezvoltat două abordări care pot potențial să anuleze măsurile de moderare a conținutului într-un sistem de sinteză de imagini și a constatat că acestea sunt remarcat de robuste, chiar și în diferite arhitecturi, ceea ce indică faptul că slăbiciunea este mai mult decât sistemică și poate fi legată de unele dintre principiile fundamentale ale sintezei de text în imagine.

Prima abordare, și cea mai puternică dintre cele două, se numește macaronic prompting. Termenul “macaronic” se referă inițial la o combinație de multiple limbi, așa cum se găsește în Esperanto sau Unwinese. Poate că cel mai răspândit exemplu ar fi Urdu-English, un tip de “cod mixt” comun în Pakistan, care amestecă liber substantivele englezești și sufixele urdu.

Compositional macaronic prompting în DALL-E 2. Sursă: https://arxiv.org/pdf/2208.04135.pdf

Compositional macaronic prompting în DALL-E 2. Sursă: https://arxiv.org/pdf/2208.04135.pdf

În unele dintre exemplele de mai sus, fracțiuni de cuvinte semnificative au fost lipite împreună, folosind engleza ca “schelet”. Alte exemple din lucrare folosesc multiple limbi într-o singură promptă.

Sistemul va răspunde într-un mod semantic semnificativ din cauza lipsei relative de curățenie în sursele web pe care sistemul a fost antrenat. Astfel de surse vor avea adesea etichete multilingve (de exemplu, din seturi de date care nu au fost proiectate în mod special pentru o sarcină de sinteză de imagini), iar fiecare cuvânt ingestat, în orice limbă, va deveni un “token”; dar, de asemenea, părți ale acelor cuvinte vor deveni “subcuvinte” sau tokeni fracționali. În procesarea limbajului natural (NLP), acest tip de “stemming” ajută la distingerea etimologiei cuvintelor derivate mai lungi care pot apărea în operațiuni de transformare, dar creează și un set lexical “Lego” masiv, pe care “promptarea creativă” îl poate exploata.

Cuvintele portmanteau monolingve sunt, de asemenea, eficiente în obținerea de imagini prin limbaj indirect sau neprosaic.

Cuvintele portmanteau monolingve sunt, de asemenea, eficiente în obținerea de imagini prin limbaj indirect sau neprosaic, cu rezultate foarte asemănătoare, obținute adesea în arhitecturi diferite, cum ar fi DALL-E 2 și DALL-E Mini (Craiyon).

În a doua abordare, numită evocative prompting, unele dintre cuvintele conjoincte sunt similare ca ton cu “latina școlară” prezentată în Monty Python’s Life of Brian (1979).

Nu este o glumă – latinul fals adesea reușește să evince o răspuns semnificativ din DALL-E 2.

Nu este o glumă – latinul fals adesea reușește să evince o răspuns semnificativ din DALL-E 2.

Autorul afirmă:

‘O preocupare evidentă cu această metodă este ocolirea filtrelor de conținut bazate pe prompturi blacklistate. În principiu, macaronic prompting ar putea oferi o modalitate ușoară și aparent fiabilă de a ocoli astfel de filtre pentru a genera conținut dăunător, ofensator, ilegal sau altfel sensibil, inclusiv imagini violente, urâte, rasiste, sexiste sau pornografice, și poate imagini care încalcă drepturile de proprietate intelectuală sau care înfățișează persoane reale.

‘Companiile care oferă servicii de generare de imagini au depus o mare grijă pentru a preveni generarea unor astfel de ieșiri, în conformitate cu politica lor de conținut. Prin urmare, macaronic prompting ar trebui să fie investigat sistematic ca o amenințare la protocoalele de siguranță utilizate pentru generarea comercială de imagini.’

Autorul sugerează o serie de remedii împotriva acestei vulnerabilități, unele dintre care el recunoaște că ar putea fi considerate excesiv de restrictive.

Prima soluție posibilă este cea mai scumpă: să se curateze mai atent imaginile sursă, cu mai multă supraveghere umană și mai puțină supraveghere algoritmică. Cu toate acestea, lucrarea concedes că acest lucru nu ar preveni sistemul de sinteză de imagini să creeze o conjuncție ofensatoare între două concepte de imagini care, în sine, sunt potențial inofensive.

În al doilea rând, lucrarea sugerează că sistemele de sinteză de imagini ar putea să-și ruleze ieșirile reale printr-un sistem de filtre, interceptând orice asocieri problematice înainte de a fi prezentate utilizatorului. Este posibil ca DALL-E 2 să opereze un astfel de filtru, deși OpenAI nu a dezvăluit exact cum funcționează moderarea conținutului DALL-E 2.

În cele din urmă, autorul examinează posibilitatea unui “dicționar whitelist”, care ar permite doar cuvintele verificate și aprobate să recupereze și să redea concepte, dar concedes că acest lucru ar putea reprezenta o restricție excesiv de severă asupra utilității sistemului.

Deși cercetătorul a experimentat doar cu cinci limbi (engleză, germană, franceză, spaniolă și italiană) la crearea de prompturi, el crede că acest tip de “atac adversarial” ar putea deveni și mai “criptic” și dificil de ocolit, extinzând numărul de limbi, având în vedere că modelele hyperscale, cum ar fi DALL-E 2, sunt antrenate pe multiple limbi (pur și simplu pentru că este mai ușor să se utilizeze intrări ușor filtrate sau “brute” decât să se ia în considerare cheltuielile enorme de curățare și pentru că dimensiunea suplimentară este probabil să adauge la utilitatea sistemului).

Lucrarea paper se numește Atacuri adverse asupra generării de imagini cu cuvinte inventate și provine de la Raphaël Millière de la Universitatea Columbia.

Limbajul criptic în DALL-E 2

S-a sugerat anterior “gibberish”-ul pe care DALL-E 2 îl produce atunci când încearcă să reprezinte limbajul scris ar putea fi în sine un “vocabular ascuns”. Cu toate acestea, cercetările anterioare asupra acestui limbaj misterios nu au oferit nicio modalitate de a dezvolta șiruri nonce care să poată evoca imagini specifice.

Dintre lucrările anterioare, lucrarea afirmă:

‘[Aceasta] nu oferă o metodă fiabilă de a găsi șiruri nonce care să evince imagini specifice. Cele mai multe dintre textul “gibberish” inclus de DALL-E 2 în imagini nu pare să fie asociat în mod fiabil cu concepte vizuale specifice atunci când este transcris și utilizat ca prompt. Acest lucru limitează viabilitatea acestei abordări ca modalitate de a ocoli moderarea conținutului dăunător sau ofensator; astfel, nu este un risc deosebit de îngrijorător pentru utilizarea abuzivă a modelelor de generare de imagini ghidate de text.’

În schimb, cele două metode ale autorului sunt elaborate ca modalități prin care “nonsensul” poate evoca imagini semnificative și legate, ocolind eticheta convențională care se dezvoltă acum în ingineria prompturilor.

Prin exemplu, autorul examinează cuvântul pentru “păsări” în cele cinci limbi care sunt în domeniul de aplicare al lucrării: Vögel în germană, uccelli în italiană, oiseaux în franceză și pájaros în spaniolă.

Cu codificarea pereche de octeți (BPE) tokenizată utilizată de implementarea CLIP care este integrat în DALL-E 2, cuvintele sunt tokenizate în engleză fără accente și pot fi “combinate creativ” pentru a forma cuvinte nonce care par a fi “gibberish” pentru noi, dar păstrează sensul lipit împreună pentru DALL-E 2, permițând sistemului să exprime intenția percepută:

În exemplul de mai sus, două dintre “cuvintele străine” pentru păsări sunt lipite împreună într-un șir fără sens. Datorită greutății fractionale a subcuvintelor, sensul este păstrat.

Autorul subliniază că rezultate semnificative pot fi obținute și fără a se conforma granițelor segmentării subcuvintelor, probabil pentru că DALL-E 2 (studiu principal al lucrării) s-a generalizat suficient de bine pentru a lăsa granițele subcuvintelor să se estompeze fără a distruge sensul lor.

Pentru a demonstra în continuare abordările dezvoltate, lucrarea oferă exemple de promptări macaronice în diferite domenii, utilizând lista de cuvinte tokenizate ilustrate mai jos (cu cuvinte hibride fără sens în partea dreaptă).

Autorul afirmă că exemplele de mai jos de la DALL-E 2 nu sunt “selectate”:

Lingua Franca

Lucrarea observă, de asemenea, că mai multe exemple funcționează la fel de bine, sau cel puțin foarte asemănător, atât în DALL-E 2, cât și în DALL-E Mini (acum Craiyon), și că acest lucru este surprinzător, deoarece DALL-E 2 este un model de difuzie, iar DALL-E Mini nu; cele două sisteme sunt antrenate pe seturi de date diferite; și DALL-E Mini utilizează un tokenizer BART în locul tokenizerului CLIP preferat de DALL-E 2.

Rezultate remarcabil de asemănătoare de la DALL-E Mini, comparativ cu imaginea anterioară, care a prezentat rezultate de la aceeași intrare 'fără sens' de la DALL-E 2.

Rezultate remarcabil de asemănătoare de la DALL-E Mini, comparativ cu imaginea anterioară, care a prezentat rezultate de la aceeași intrare ‘fără sens’ de la DALL-E 2.

În prima dintre imaginile de mai sus, promptarea macaronică poate fi, de asemenea, asamblată în propoziții sintactic corecte pentru a genera scene mai complexe. Cu toate acestea, acest lucru necesită utilizarea englezei ca “schelet” pentru a asambla conceptele, făcând procedura mai probabilă să fie interceptată de sistemele standard de cenzură într-un cadru de sinteză de imagini.

Lucrarea observă că hibridizarea lexicală, “lipirea” cuvintelor pentru a evoca conținut legat dintr-un sistem de sinteză de imagini, poate fi realizată și într-o singură limbă, prin utilizarea cuvintelor portmanteau.

Promptarea evocativă

Abordarea “promptării evocative” prezentată în lucrare depinde de “evocarea” unui răspuns mai larg din partea sistemului, utilizând cuvinte care nu se bazează strict pe subcuvinte sau subtokeni sau etichete parțial împărtășite.

Un tip de promptare evocativă este pseudolatina, care poate, printre alte utilizări, genera imagini de medicamente fictive, chiar și fără specificarea că DALL-E 2 ar trebui să recupereze conceptul de “medicament”:

Promptarea evocativă funcționează, de asemenea, foarte bine cu prompturi fără sens care se referă în mod general la locații geografice posibile și funcționează destul de fiabil în arhitecturi diferite, cum ar fi DALL-E 2 și DALL-E Mini:

Cuvintele utilizate pentru aceste prompturi către DALL-E 2 și DALL-E Mini sunt redolente de nume reale, dar sunt în sine nonsens.

Cuvintele utilizate pentru aceste prompturi către DALL-E 2 și DALL-E Mini sunt redolente de nume reale, dar sunt în sine nonsens. Cu toate acestea, sistemele au “prins atmosfera” cuvintelor.

Există o suprapunere aparentă între promptarea macaronică și cea evocativă. Lucrarea afirmă:

‘Pare că diferențele în datele de antrenare, dimensiunea modelului și arhitectura modelului pot face ca diferite modele să parseze prompturi precum voiscellpajaraux și eidelucertlagarzard într-un mod “macaronic” sau “evocativ”, chiar și atunci când aceste modele sunt dovedite a fi receptive la ambele metode de promptare.’

Lucrarea conchide:

‘În timp ce diversele proprietăți ale acestor modele – incluzând dimensiunea, arhitectura, procedura de tokenizare și datele de antrenare – pot influența vulnerabilitatea lor la atacuri adverse bazate pe text, dovezi preliminare discutate în această lucrare sugerează că unele dintre aceste atacuri pot funcționa într-o oarecare măsură în mod fiabil în diferite modele.’

Probabil cel mai mare obstacol în calea experimentării adevărate a acestor metode este riscul de a fi marcat și interzis de sistemul gazdă. DALL-E 2 necesită un număr de telefon asociat cu fiecare cont de utilizator, limitând numărul de “conturi de ars” care ar fi probabil necesare pentru a testa cu adevărat limitele acestui tip de “hacking” lexical, în ceea ce privește subvertirea metodelor de moderare existente. În prezent, principala garanție a DALL-E 2 rămâne volatilitatea accesului.

 

Publicat pentru prima dată pe 9 august 2022.

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai