Unghiul lui Anderson

Este DALL-E 2 doar “lipind lucruri împreună” fără a înțelege relațiile lor?

mm
Adaugă Unite.AI la sursele tale preferate pe Google

O nouă lucrare de cercetare de la Universitatea Harvard sugerează că framework-ul text-la-imagine DALL-E 2 al OpenAI are dificultăți notabile în reproducerea relațiilor dintre elementele pe care le compune în fotografii sintetizate, în ciuda sofisticării uluitoare a multor dintre rezultatele sale.

Cercetătorii au efectuat un studiu cu participanți de 169 de persoane, care au fost prezentate cu imagini DALL-E 2 create pe baza principiilor de bază ale relațiilor semantice umane, împreună cu prompt-urile text care le-au generat. Când li s-a cerut să spună dacă prompt-urile și imaginile erau legate, mai puțin de 22% dintre imagini au fost considerate pertinente pentru prompt-urile asociate, în ceea ce privește relațiile foarte simple pe care DALL-E 2 a fost solicitat să le vizualizeze.

O captură de ecran din încercările efectuate pentru noul articol. Participanții au fost solicitați să selecteze toate imaginile care corespundeau prompt-ului. În ciuda avertismentului de la partea inferioară a interfeței, în toate cazurile, imaginile, fără știrea participanților, au fost generate din prompt-ul afișat.

O captură de ecran din încercările efectuate pentru noul articol. Participanții au fost solicitați să selecteze toate imaginile care corespundeau prompt-ului. Source: https://arxiv.org/pdf/2208.00005.pdf

Rezultatele sugerează, de asemenea, că abilitatea aparentă a DALL-E de a conjuga elemente disparate poate scădea pe măsură ce aceste elemente devin mai puțin probabil să fi apărut în datele de antrenament din lumea reală care alimentează sistemul.

De exemplu, imaginile pentru prompt-ul “copil atingând o farfurie” au obținut un procent de acord de 87% (adică participanții au dat clic pe majoritatea imaginilor ca fiind relevante pentru prompt), în timp ce renderurile fotorealiste ale “unui maimuță atingând un iguană” au obținut doar 11% acord:

DALL-E are dificultăți în a reprezenta evenimentul puțin probabil al unui 'maimuță atingând un iguană', probabil din cauza lipsei de imagini din lumea reală care să ilustreze acest eveniment.

DALL-E are dificultăți în a reprezenta evenimentul puțin probabil al unui ‘maimuță atingând un iguană’.

În cel de-al doilea exemplu, DALL-E 2 obține frecvent scala și chiar specia greșită, probabil din cauza lipsei de imagini din lumea reală care să ilustreze acest eveniment. În schimb, este rezonabil să ne așteptăm la un număr mare de fotografii de antrenament legate de copii și alimente, și că această subdomeniu/clasă este bine dezvoltată.

Dificultatea DALL-E de a juxtapune elemente de imagine puternic contrastante sugerează că publicul este atât de uimit de capacitățile fotorealiste și interpretative ale sistemului, încât nu a dezvoltat încă un ochi critic pentru cazurile în care sistemul a “lipit” efectiv un element puternic pe altul, așa cum se întâmplă în aceste exemple de pe site-ul oficial DALL-E 2:

Sinteză de tip

Sinteză de tip “decupaj și lipire”, de pe exemplele oficiale pentru DALL-E 2. Source: https://openai.com/dall-e-2/

Noul articol afirmă*:

‘Înțelegerea relațională este o componentă fundamentală a inteligenței umane, care se manifestă devreme în dezvoltare și este calculată rapid și automat în percepție.

‘Dificultatea DALL-E 2 cu relațiile spațiale de bază (cum ar fi în, pe, sub) sugerează că, orice ar fi învățat, nu a învățat încă reprezentările care permit oamenilor să structureze lumea în mod flexibil și robust.

‘O interpretare directă a acestei dificultăți este că sistemele precum DALL-E 2 nu au încă compoziționalitate relațională.’

Autorii sugerează că sistemele de generare a imaginilor ghidate de text, cum ar fi seria DALL-E, ar putea beneficia de algoritmi comuni în robotică, care modelează identități și relații simultan, din cauza nevoii agentului de a interacționa efectiv cu mediul, și nu doar de a fabrica o combinație de elemente diverse.

Una dintre astfel de abordări, intitulată CLIPort, utilizează același mecanism CLIP care servește ca element de evaluare a calității în DALL-E 2:

CLIPort, o colaborare din 2021 între Universitatea Washington și NVIDIA, utilizează CLIP într-un context atât de practic, încât sistemele antrenate pe el trebuie să dezvolte în mod necesar o înțelegere a relațiilor fizice, un motivator care lipsește în DALL-E 2 și în alte cadre de sinteză de imagini 'fantastice'.

CLIPort, o colaborare din 2021 între Universitatea Washington și NVIDIA, utilizează CLIP într-un context atât de practic, încât sistemele antrenate pe el trebuie să dezvolte în mod necesar o înțelegere a relațiilor fizice. Source: https://arxiv.org/pdf/2109.12098.pdf

Autorii sugerează, de asemenea, că o altă îmbunătățire plauzibilă ar putea fi să incorporeze efecte multiplicative într-un singur strat de calcul, permițând calculul relațiilor într-un mod inspirat de capacitățile de procesare a informației ale sistemelor biologice.

Noul articol, intitulat Testarea înțelegerii relaționale în generarea de imagini ghidate de text, provine de la Colin Conwell și Tomer D. Ullman de la Departamentul de Psihologie al Universității Harvard.

Dincolo de critica timpurie

Comentând “trucul” din spatele realismului și integrității rezultatelor DALL-E 2, autorii notează lucrări anterioare care au găsit lipsuri în sistemele generative de imagini de tip DALL-E.

În luna iunie a acestui an, Universitatea Berkeley a remarcat dificultatea DALL-E în a gestiona reflexiile și umbrele; în aceeași lună, un studiu din Coreea a investigat “unicitatea” și originalitatea rezultatelor de tip DALL-E 2, cu o privire critică; o analiză preliminară a imaginilor DALL-E 2, imediat după lansare, de la NYU și Universitatea Texas, a găsit diverse probleme cu compoziționalitatea și alte factori esențiali în imaginile DALL-E 2; și în luna trecută, o lucrare comună între Universitatea Illinois și MIT a oferit sugestii pentru îmbunătățiri arhitecturale ale unor astfel de sisteme în ceea ce privește compoziționalitatea.

Cercetătorii notează, de asemenea, că personalități DALL-E, cum ar fi Aditya Ramesh, au recunoscut problemele framework-ului cu legarea, dimensiunea relativă, textul și alte provocări.

Dezvoltatorii din spatele sistemului de sinteză de imagini rival al Google, Imagen, au propus, de asemenea, DrawBench, un sistem de comparație nou care măsoară acuratețea imaginilor în diferite cadre cu metrici diverse.

În schimb, autorii noului articol sugerează că un rezultat mai bun ar putea fi obținut prin compararea estimării umane – și nu a metricilor algoritmice – cu imaginile rezultate, pentru a stabili unde se află slăbiciunile și ce ar putea fi făcut pentru a le mitigă.

Studiul

Pentru aceasta, noul proiect se bazează pe principii psihologice și își propune să se retragă din valul actual de interes în “ingineria prompt-urilor” (care, în esență, este o concesie a limitărilor DALL-E 2 sau a oricărui sistem comparabil), pentru a investiga și a aborda limitările care fac necesare astfel de “soluții”.

Articolul afirmă:

‘Lucrarea noastră se concentrează pe un set de 15 relații de bază descrise anterior, examinate sau propuse în literatura cognitivă, de dezvoltare sau lingvistică. Setul conține atât relații spațiale încorporate (de exemplu, “X pe Y”), cât și relații agențice mai abstracte (de exemplu, “X ajutând pe Y”).

‘Prompt-urile sunt intenționat simple, fără complexitate de atribute sau elaborare. Adică, în loc de un prompt ca “un măgar și un octopod joacă un joc. Măgarul ține o frânghie în gură, octopodul ține de cealaltă parte. Măgarul ține frânghia în gură. O pisică sare peste frânghie”, folosim “o cutie pe un cuțit”.

‘Simplificarea încă capturează o gamă largă de relații din diverse subdomenii ale psihologiei umane și face ca eventualele eșecuri ale modelului să fie mai evidente și specifice.’

Pentru studiul lor, autorii au recrutat 169 de participanți de la Prolific, toți localizați în SUA, cu o vârstă medie de 33 de ani și 59% femei.

Participanților li s-au prezentat 18 imagini organizate într-o grilă 3×6, cu prompt-ul la partea superioară și un avertisment la partea inferioară care afirma că toate, unele sau niciuna dintre imagini nu ar fi putut fi generate din prompt-ul afișat, și li s-a cerut să selecteze imaginile pe care le considerau legate de prompt.

Imaginile prezentate indivizilor au fost bazate pe literatura lingvistică, de dezvoltare și cognitivă, cuprinzând un set de opt relații fizice și șapte relații “agențice” (aceasta va deveni clar într-un moment).

Relații fizice
în, pe, sub, acoperind, lângă, ascuns de, atârnând peste, și legat de.

Relații agențice
împingând, trăgând, atingând, lovind, împingând, ajutând, și împiedicând.

Toate aceste relații au fost extrase din domenii non-CS menționate anterior.

Au fost derivate douăsprezece entități pentru utilizare în prompt-uri, cu șase obiecte și șase agenți:

Obiecte
cutie, cilindru, pătură, farfurie, ceainic, și cuțit.

Agenți
om, femeie, copil, robot, maimuță, și iguană.

(Cercetătorii recunosc că includerea iguanei, nu un element de bază în cercetarea sociologică sau psihologică, a fost “o plăcere”)

Pentru fiecare relație, au fost create cinci prompt-uri diferite prin eșantionarea aleatorie a două entități de cinci ori, rezultând 75 de prompt-uri totale, fiecare dintre ele fiind trimis către DALL-E 2, și pentru fiecare dintre ele au fost utilizate primele 18 imagini furnizate, fără variante sau șanse suplimentare.

Rezultate

Articolul afirmă*:

‘Participanții au raportat, în medie, un nivel scăzut de acord între imaginile DALL-E 2 și prompt-urile utilizate pentru a le genera, cu o medie de 22,2% [18,3, 26,6] pe cele 75 de prompt-uri distincte.

‘Prompt-urile agențice, cu o medie de 28,4% [22,8, 34,2] pe cele 35 de prompt-uri, au generat un nivel mai mare de acord decât prompt-urile fizice, cu o medie de 16,9% [11,9, 23,0] pe cele 40 de prompt-uri.’

Rezultatele studiului. Punctele negre reprezintă toate prompt-urile, cu fiecare punct reprezentând un prompt individual, iar culorile separă prompt-urile în funcție de subiectul lor agențic sau fizic (de exemplu, un obiect).

Rezultatele studiului. Punctele negre reprezintă toate prompt-urile.

Pentru a compara diferența dintre percepția umană și cea algoritmică a imaginilor, cercetătorii au rulat render-urile lor prin framework-ul CLIP bazat pe ViT-L/14 al OpenAI. Prin medierea scorurilor, au găsit o “relație moderată” între cele două seturi de rezultate, ceea ce este, poate, surprinzător, având în vedere măsura în care CLIP însuși ajută la generarea imaginilor.

Rezultatele comparației CLIP (ViT-L/14) cu răspunsurile umane.

Rezultatele comparației CLIP (ViT-L/14) cu răspunsurile umane.

Cercetătorii sugerează că alte mecanisme din arhitectură, poate combinate cu o preponderență (sau lipsă) de date în setul de antrenament, ar putea explica modul în care CLIP poate recunoaște limitările DALL-E fără a putea face prea multe despre problema respectivă.

Autorii concluzionează că DALL-E 2 are doar o abilitate notională, dacă are una, de a reproduce imagini care incorporează înțelegerea relațională, o componentă fundamentală a inteligenței umane care se dezvoltă devreme la oameni.

‘Ideea că sisteme precum DALL-E 2 nu au compoziționalitate poate veni ca o surpriză pentru oricine care a văzut răspunsurile rezonabile ale DALL-E 2 la prompt-uri precum “un desen animat al unui copil daikon radish într-un tutu, plimbând un poodle”. Prompt-uri de acest fel adesea generează o aproximare sensibilă a unui concept compozițional, cu toate părțile prompt-ului prezente și prezente în locurile potrivite.

‘Compoziționalitatea, însă, nu este doar capacitatea de a lipi lucruri împreună – chiar și lucruri pe care nu le-ai văzut niciodată împreună. Compoziționalitatea necesită o înțelegere a regulilor care leagă lucrurile împreună. Relațiile sunt astfel de reguli.’

Omul mușcă T-Rex

Opinie Pe măsură ce OpenAI extinde accesul la DALL-E 2, după monetizarea recentă a sistemului, și deoarece acum trebuie să plătești pentru majoritatea generărilor, limitările DALL-E 2 în ceea ce privește înțelegerea relațională pot deveni mai evidente, deoarece fiecare “încercare eșuată” are o greutate financiară și nu există rambursări.

Cei care am primit o invitație puțin mai devreme am avut timp (și, până de curând, mai mult timp de joacă cu sistemul) să observăm unele dintre “glitch-urile de relație” pe care DALL-E 2 le poate produce.

De exemplu, pentru un fan al Parcului Jurasic, este foarte greu să obții un dinozaur care să urmărească o persoană în DALL-E 2, chiar dacă conceptul de “urmărire” nu pare să fie în sistemul de cenzură al DALL-E 2 și chiar dacă istoria lungă a filmelor cu dinozauri ar trebui să ofere exemple suficiente de antrenament (cel puțin sub forma trailerelor și a fotografiilor de publicitate) pentru acest eveniment imposibil de întâlnire între specii.

Un răspuns tipic al DALL-E 2 la prompt-ul 'O fotografie color a unui T-Rex urmărind un om pe o stradă'.

Un răspuns tipic al DALL-E 2 la prompt-ul ‘O fotografie color a unui T-Rex urmărind un om pe o stradă’. Source: DALL-E 2

Am constatat că imaginile de mai sus sunt tipice pentru variațiile prompt-ului “[dinozaur] urmărind [o persoană]”, și că nicio elaborare a prompt-ului nu poate face ca T-Rex să se conformeze. În primele și cele două fotografii, omul este (mai mult sau mai puțin) urmărind T-Rex; în a treia, se apropie de el cu o nepăsare pentru siguranță; și în ultima imagine, pare a fi alergând în paralel cu bestia. În aproximativ 10-15 încercări cu acest tema, am găsit că dinozaurul este similar “distras”.

Ar putea fi că singurele date de antrenament la care DALL-E 2 a avut acces au fost de genul “om luptând cu dinozaur”, de la fotografii de publicitate pentru filme mai vechi, cum ar fi Un milion de ani înainte de Hristos (1966), și că zborul celebru al lui Jeff Goldblum de la regele prădătorilor este doar un outlier în acea mică tranșă de date.

 

* Conversia mea a citărilor inline ale autorilor în legături hipertext.

Publicat pentru prima dată pe 4 august 2022.

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: [email protected]