Unghiul lui Anderson
Soluția unică a DALL-E 2 pentru duble sensuri

Oricine care a învățat italiana învață devreme să acorde atenție contextului atunci când descrie o mătură, deoarece cuvântul italian pentru acest obiect casnic banal are un al doilea sens extrem de neadecvat ca verb*. Deși învățăm devreme să desfacem harta semantică și aplicabilitatea cuvintelor cu multiple sensuri, această abilitate nu este ușor de transmis sistemelor de sinteză de imagine la scară largă, cum ar fi DALL-E 2 și Stable Diffusion, deoarece acestea se bazează pe modulul de pre-antrenare a limbajului și imaginii Contrastive (CLIP) al OpenAI, care tratează obiectele și proprietățile lor mult mai liber (dar care câștigă tot mai mult teren în spațiul de sinteză a imaginilor și videourilor difuzive latente).
Studiind această lacună, o nouă colaborare de cercetare de la Universitatea Bar-Ilan și Institutul de Inteligență Artificială Allen oferă un studiu extins privind măsura în care DALL-E 2 este predispus la astfel de erori semantice:

Duble sensuri separate în multiple interpretări în DALL-E 2 – deși orice sistem de difuzie latentă poate produce astfel de exemple. În imaginea din dreapta sus, eliminarea ‘aur’ din prompt schimbă specia de pește, în timp ce în cazul ‘trecerii de pietoni’, este necesar să se specifice explicit suprafața drumului pentru a elimina asocierea duplicată. Sursă: https://export.arxiv.org/pdf/2210.10606
Autorii au constatat că această tendință de a interpreta cuvintele și frazele în mod dublu pare să nu fie numai comună tuturor modelelor de difuzie ghidate de CLIP, dar că se înrăutățește pe măsură ce modelele sunt antrenate cu cantități tot mai mari de date. Articolul notează că “versiunile reduse” ale modelelor de text-la-imagine, inclusiv DALL-E Mini (acum Craiyon), produc aceste tipuri de erori cu o frecvență mult mai mică, și că Stable Diffusion greșește și mai puțin – deși numai pentru că, foarte des, nu urmează promptul deloc, ceea ce este un alt tip de eroare.

Promptul simplu ‘dată’ forțează DALL-E 2 să invoce două dintre sensurile cuvântului, în timp ce cuvântul ‘suport’ se separă și el în două dintre sensurile sale, și, în a treia imagine, fraza ‘con’ se transformă în mod fiabil în înghețată, care este asociată cu ‘con’.
Explicând modul în care realizăm separări lexicale eficiente, articolul afirmă:
‘În timp ce simbolurile – precum și structurile de propoziție – pot fi ambigue, după ce o interpretare este construită, această ambiguitate este deja rezolvată. De exemplu, în timp ce simbolul “liliac” într-un “liliac care zboară” poate fi interpretat ca o trestie de lemn sau un animal, interpretările noastre posibile ale propoziției sunt fie un “liliac de lemn care zboară” sau un “animal care zboară”, dar niciodată ambele în același timp. Odată ce cuvântul “liliac” a fost folosit în interpretare pentru a denota un obiect (de exemplu, o trestie de lemn), el nu poate fi refolosit pentru a denota un alt obiect (un animal) în aceeași interpretare.’
DALL-E 2, observă articolul, nu este limitat în acest fel:

‘Un liliac zboară peste un stadion de baseball’ – prima imagine este din articol, celelalte trei obținute prin simpla introducere a aceluiași prompt în DALL-E 2.
Această proprietate a fost denumită sensibilitate la resurse.
Autorii identifică trei comportamente anormale ale DALL-E 2: că un cuvânt sau o frază poate fi interpretat și efectiv bifurcat în două entități distincte, reprezentând un obiect sau un concept pentru fiecare în aceeași scenă; că un cuvânt poate fi interpretat ca un modificator al două entități diferite (a se vedea exemplele ‘pește de aur’ și altele de mai sus); și că un cuvânt poate fi interpretat simultan ca un modificator și o entitate alternativă – exemplificat de promptul ‘o sigilă deschide o scrisoare’:

‘O sigilă deschide o scrisoare’ – prima ilustrație este din articol, cele trei alăturate, reproduceri identice din DALL-E 2. Exemplele fotorealiste de mai jos aveau textul suplimentar ‘fotografie, Canon50, 85mm, F5.6, fotografie premiată’.
Autorii identifică două moduri de eșec pentru modelele de difuzie în acest sens: că rezultatele promt-urilor utilizatorilor cu cuvinte ambigue vor exhiba adesea cuvântul concretizat împreună cu o manifestare a conceptului; și scurgerea conceptului, unde proprietățile unui obiect “se scurg” într-un alt obiect redat.
‘Luând împreună, fenomenele pe care le examinăm oferă dovezi pentru limitările capacităților lingvistice ale DALLE-2 și deschid căi pentru cercetări viitoare care ar descoperi dacă acestea provin din probleme cu codificarea textului, modelul generativ sau ambele. Mai general, abordarea propusă poate fi extinsă la alte scenarii în care procesul de decodare este utilizat pentru a descoperi prejudecățile inductive și limitările modelelor de text-la-imagine.’
Utilizând 17 cuvinte care vor face DALL-E 2 să separe intrarea în multiple ieșiri, autorii au observat că omografia a avut loc în peste 80% din 216 de imagini generate.
Cercetătorii au folosit perechi de stimuli-control pentru a examina măsura în care limbajul specific și, în mod evident, supraspecificat, este necesar pentru a preveni aceste duplicări. Pentru testele de la entitate la proprietate, au fost create 10 astfel de perechi, iar autorii notează că prompturile de stimuli provoacă proprietatea comună în 92,5% din cazuri, în timp ce promptul de control o provoacă doar în 6,6% din cazuri.
‘[Pentru] a demonstra, considerați o zebrenă și o stradă, aici, zebrenă este o entitate, dar modifică strada, și DALLE-2 generează în mod constant treceri de pietoni, posibil din cauza asemănării dungi de zebrenă cu o trecere de pietoni. Și în conformitate cu coniectura noastră, controlul unei zebrene și o stradă cu pietriș specifică un tip de stradă care de obicei nu are treceri de pietoni, și, într-adevăr, toate mostrele noastre de control pentru acest prompt nu conțin o trecere de pietoni.’













