Unghiul lui Anderson

Cum să opriți AI-ul să înfățișeze iPhone-uri în epoci trecute

mm
Adaugă Unite.AI la sursele tale preferate pe Google
A montage of various selected illustrations from the paper 'Synthetic History: Evaluating Visual Representations of the Past in Diffusion Models' (https://arxiv.org/abs/2505.17064)

Cum imaginează generatorii de imagini AI trecutul? O nouă cercetare arată că aceștia introduc smartphone-uri în secolul al XVIII-lea, laptopuri în scene din anii 1930 și aspiratoare în case din secolul al XIX-lea, ridicând întrebări despre modul în care aceste modele imaginează istoria – și dacă sunt capabile să obțină acuratețe istorică contextuală.

 

La începutul anului 2024, capacitățile de generare a imaginilor modelului multimodal AI Gemini de la Google au fost criticate pentru impunerea demografică a echității în contexte inadecvate, cum ar fi generarea de soldați germani din al Doilea Război Mondial cu o proveniență neplauzibilă:

Personal militar german cu o probabilitate demografică scăzută, așa cum a fost imaginat de modelul multimodal Gemini de la Google în 2024. Sursă: Gemini AI/Google via The Guardian

Personal militar german cu o probabilitate demografică scăzută, așa cum a fost imaginat de modelul multimodal Gemini de la Google în 2024. Sursă: Gemini AI/Google via The Guardian

Acesta a fost un exemplu în care eforturile de a remedia sesizarea a prejudecăților în modelele AI au eșuat în a lua în considerare contextul istoric. În acest caz, problema a fost abordată în curând. Cu toate acestea, modelele bazate pe difuzie rămân predispuse la a genera versiuni ale istoriei care confundă aspectele și artefactele moderne și istorice.

Acest lucru se datorează în parte încurcăturii, unde calitățile care apar frecvent împreună în datele de antrenare devin încurcate în ieșirea modelului. De exemplu, dacă obiectele moderne, cum ar fi smartphone-urile, apar frecvent împreună cu actul de a vorbi sau a asculta în setul de date, modelul poate învăța să asocieze aceste activități cu dispozitive moderne, chiar și atunci când promptul specifică un context istoric. Odată ce aceste asocieri sunt încorporate în reprezentările interne ale modelului, devine dificil să separați activitatea de contextul său contemporan, conducând la rezultate istoric inexacte.

O nouă lucrare din Elveția, care examinează fenomenul generațiilor istorice încurcate în modelele de difuzie latentă, observă că cadrele AI care sunt capabile să creeze imagini fotorealistice preferă totuși să reprezinte figuri istorice în moduri istorice:

Din noua lucrare, reprezentări diverse prin LDM a promptului 'O imagine fotorealistă a unei persoane care râde cu un prieten în [perioada istorică]', cu fiecare perioadă indicată în fiecare ieșire. Așa cum se poate vedea, mijlocul epocii a devenit asociat cu conținutul.

Din noua lucrare, reprezentări diverse prin LDM a promptului ‘O imagine fotorealistă a unei persoane care râde cu un prieten în [perioada istorică]’, cu fiecare perioadă indicată în fiecare ieșire. Așa cum se poate vedea, mijlocul epocii a devenit asociat cu conținutul. Sursă: https://arxiv.org/pdf/2505.17064

Pentru promptul ‘O imagine fotorealistă a unei persoane care râde cu un prieten în [perioada istorică]’, unul dintre cele trei modele testate a ignorat adesea promptul negativ ‘monocrom’ și a folosit în schimb tratamente de culoare care reflectă mijloacele vizuale ale epocii respective, de exemplu imitând nuanțele mute ale filmului de celuloid din anii 1950 și 1970.

La testarea celor trei modele pentru capacitatea lor de a crea anacronisme (lucruri care nu sunt din perioada țintă, sau ‘în afara timpului’ – care pot fi din viitorul sau trecutul perioadei țintă), s-a constatat o tendință generală de a confunda activitățile eterne (cum ar fi ‘cântat’ sau ‘gătit’) cu contexte și echipamente moderne:

Activități diverse care sunt perfect valabile pentru secolele anterioare sunt reprezentate cu tehnologie și accesorii actuale sau mai recente, împotriva spiritului imaginilor solicitate.

Activități diverse care sunt perfect valabile pentru secolele anterioare sunt reprezentate cu tehnologie și accesorii actuale sau mai recente, împotriva spiritului imaginilor solicitate.

De remarcat este faptul că smartphone-urile sunt deosebit de greu de separat de idiomul fotografiei, și de multe alte contexte istorice, deoarece proliferarea și reprezentarea lor sunt bine reprezentate în seturi de date hiperscale influente, cum ar fi Common Crawl:

În modelul generativ text-Imagine Flux, comunicațiile și smartphone-urile sunt concepte strâns asociate – chiar și atunci când contextul istoric nu permite acest lucru.

În modelul generativ text-Imagine Flux, comunicațiile și smartphone-urile sunt concepte strâns asociate – chiar și atunci când contextul istoric nu permite acest lucru.

Pentru a determina amploarea problemei și pentru a oferi eforturilor de cercetare viitoare o cale de a aborda această problemă, autorii noii lucrări au dezvoltat un set de date special pentru a testa sistemele generative. În curând, vom examina această nouă lucrare, care se intitulează Istoria sintetică: Evaluarea reprezentărilor vizuale ale trecutului în modelele de difuzie și provine de la doi cercetători de la Universitatea din Zurich. Setul de date și codul sunt disponibile public.

O “adevăr” fragil

Unele dintre temele din lucrare ating probleme sensibile din punct de vedere cultural, cum ar fi subreprezentarea raselor și a genului în reprezentările istorice. În timp ce impunerea de către Gemini a egalității rasiale în al Treilea Reich este o revizuire istorică absurdă și jignitoare, restaurarea reprezentărilor “tradiționale” (unde modelele de difuzie au “actualizat” acestea) ar duce adesea la “albirea” istoriei.

Multe emisiuni istorice recente de succes, cum ar fi Bridgerton, estompează precizia demografică istorică în moduri care sunt probabil să influențeze seturile de date de antrenare viitoare, complicând eforturile de a alinia imagini generate de LLM cu standardele tradiționale. Cu toate acestea, aceasta este o temă complexă, având în vedere tendința istorică a (istoriei occidentale) de a favoriza bogăția și albețea și de a lăsa atâtea “povești mai mici” nespuse.

Ţinând cont de aceste parametri culturale sensibile și în schimbare, să examinăm abordarea noilor cercetători.

Metodă și teste

Pentru a testa cum interpretează modelele generative contextul istoric, autorii au creat HistVis, un set de date de 30.000 de imagini generate din 100 de prompturi care reprezintă activități umane comune, fiecare reprezentat în 10 perioade istorice distincte:

Un exemplu din setul de date HistVis, pe care autorii l-au făcut disponibil pe Hugging Face. Sursă: https://huggingface.co/datasets/latentcanon/HistVis

Un exemplu din setul de date HistVis, pe care autorii l-au făcut disponibil pe Hugging Face. Sursă: https://huggingface.co/datasets/latentcanon/HistVis

Activitățile, cum ar fi gătit, rugăciune sau ascultarea muzicii, au fost alese pentru universalitatea lor și formulate într-un format neutru pentru a evita ancorarea modelului într-o anumită estetică. Perioadele de timp pentru setul de date variază de la secolul al XVII-lea până în prezent, cu accent suplimentar pe cinci decenii individuale din secolul al XX-lea.

30.000 de imagini au fost generate folosind trei modele de difuzie deschise și larg utilizate: Stable Diffusion XL; Stable Diffusion 3; și FLUX.1. Prin izolarea perioadei de timp ca singura variabilă, cercetătorii au creat o bază structurată pentru evaluarea modului în care modelele vizuale istorice sunt codificate sau ignorate de aceste sisteme.

Dominația stilului vizual

Autorul a examinat inițial dacă modelele generative se bazează pe stiluri vizuale specifice atunci când reprezintă perioade istorice; deoarece părea că, chiar și atunci când prompturile nu conțineau nicio mențiune despre mijloc sau estetică, modelele adesea asociau secolele cu stiluri caracteristice:

Stiluri vizuale prezise pentru imagini generate din promptul “O persoană care dansează cu alta în [perioada istorică]” (stânga) și din promptul modificat “O imagine fotorealistă a unei persoane care dansează cu alta în [perioada istorică]” cu “imagine monocromă” setată ca prompt negativ (dreapta).

Stiluri vizuale prezise pentru imagini generate din promptul ‘O persoană care dansează cu alta în [perioada istorică]’ (stânga) și din promptul modificat ‘O imagine fotorealistă a unei persoane care dansează cu alta în [perioada istorică]’ cu ‘imagine monocromă’ setată ca prompt negativ (dreapta).

Pentru a măsura această tendință, autorii au antrenat o rețea neuronală convoluvională (CNN) pentru a clasifica fiecare imagine din setul de date HistVis în una dintre cinci categorii: desen; gravură; ilustrație; pictură; sau fotografie. Aceste categorii au fost menite să reflecte modele comune care apar de-a lungul perioadelor de timp și care susțin comparații structurate.

Clasificatorul a fost bazat pe un model VGG16 preantrenat pe ImageNet și reglat cu 1.500 de exemple pe clasă dintr-un set de date derivat din WikiArt. Deoarece WikiArt nu distinge între fotografia monocromă și color, s-a utilizat un scor de colorare separat pentru a eticheta imagini cu saturație scăzută ca monocrome.

Clasificatorul antrenat a fost apoi aplicat setului de date complet, iar rezultatele au arătat că toate cele trei modele impun stiluri default consistente pe perioadă: SDXL asociază secolele al XVII-lea și al XVIII-lea cu gravuri, în timp ce SD3 și FLUX.1 tind spre picturi. În deceniile secolului al XX-lea, SD3 favorizează fotografia monocromă, în timp ce SDXL adesea returnează ilustrații moderne.

Aceste preferințe au fost găsite să persiste în ciuda ajustărilor promptului, sugerând că modelele codifică legături încorporate între stil și context istoric.

Stiluri vizuale prezise ale imaginilor generate de-a lungul perioadelor istorice pentru fiecare model de difuzie, pe baza a 1.000 de mostre pe perioadă pe model.

Stiluri vizuale prezise ale imaginilor generate de-a lungul perioadelor istorice pentru fiecare model de difuzie, pe baza a 1.000 de mostre pe perioadă pe model.

Pentru a cuantifica cât de puternic un model leagă o perioadă istorică de un anumit stil vizual, autorii au dezvoltat o metrică pe care o numesc Dominația stilului vizual (VSD). Pentru fiecare model și perioadă de timp, VSD este definită ca proporția ieșirilor prezise care împărtășesc cel mai comun stil:

Exemple de prejudecăți stilistice în diferite modele.

Exemple de prejudecăți stilistice în diferite modele.

Un scor mai mare indică faptul că un singur stil domină ieșirile pentru acea perioadă, în timp ce un scor mai mic indică o variație mai mare. Acest lucru face posibilă compararea modului în care fiecare model se conformează convențiilor stilistice specifice de-a lungul timpului.

Aplicată setului de date HistVis complet, metrica VSD revelează niveluri diferite de convergență, ajutând la clarificarea modului în care fiecare model îngustează interpretarea sa vizuală a trecutului:

Tabelul de rezultate de mai sus arată scorurile VSD de-a lungul perioadelor istorice pentru fiecare model. În secolele al XVII-lea și al XVIII-lea, SDXL tinde să producă gravuri cu o consistență ridicată, în timp ce SD3 și FLUX.1 favorizează pictura. În secolele al XX-lea și al XXI-lea, SD3 și FLUX.1 se îndreaptă spre fotografia, în timp ce SDXL arată mai multă variație, dar adesea se bazează pe ilustrații.

Toate cele trei modele demonstrează o preferință puternică pentru imagini monocrome în deceniile mai timpurii ale secolului al XX-lea, în special în anii 1910, 1930 și 1950.

Pentru a testa dacă aceste modele ar putea fi mitigate, autorii au utilizat ingineria promptului, solicitând în mod explicit fotorealismul și descurajând ieșirile monocrome utilizând un prompt negativ. În unele cazuri, scorurile de dominanță au scăzut, iar stilul principal a fost modificat, de exemplu de la monocrom la pictură, în secolele al XVII-lea și al XVIII-lea.

Cu toate acestea, aceste intervenții rareori au produs imagini cu adevărat fotorealistice, indicând faptul că stilurile default ale modelelor sunt profund încorporate.

Consistență istorică

Următoarea linie de analiză a examinat consistența istorică: dacă imaginile generate conțin obiecte care nu se potrivesc perioadei de timp. În loc de a utiliza o listă fixă de obiecte interzise, autorii au dezvoltat o metodă flexibilă care a utilizat modele de limbaj mare (LLM) și modele de vizualizare a limbajului (VLM) pentru a detecta elemente care păreau în afara contextului istoric.

Metoda de detectare a urmat același format ca și setul de date HistVis, unde fiecare prompt a combinat o perioadă istorică cu o activitate umană. Pentru fiecare prompt, GPT-4o a generat o listă de obiecte care ar fi fost în afara perioadei de timp specificate; și pentru fiecare obiect propus, GPT-4o a produs o întrebare da sau nu menită să verifice dacă acel obiect apărea în imaginea generată.

De exemplu, dat fiind promptul ‘O persoană care ascultă muzică în secolul al XVIII-lea’, GPT-4o ar putea identifica dispozitive audio moderne ca fiind istoric inexacte și ar produce întrebarea Este persoana folosind căști sau un smartphone care nu a existat în secolul al XVIII-lea?.

Aceste întrebări au fost transmise înapoi la GPT-4o într-un sistem de întrebări și răspunsuri vizuale, unde modelul a examinat imaginea și a returnat un da sau nu pentru fiecare. Acest flux de lucru a permis detectarea conținutului istoric implauzibil fără a se baza pe o taxonomie predefinită a obiectelor moderne:

Exemple de imagini generate marcate de metoda de detectare în două etape, arătând elemente anacronice: căști în secolul al XVIII-lea; o aspiratoare în secolul al XIX-lea; un laptop în anii 1930; și un smartphone în anii 1950.

Exemple de imagini generate marcate de metoda de detectare în două etape, arătând elemente anacronice: căști în secolul al XVIII-lea; o aspiratoare în secolul al XIX-lea; un laptop în anii 1930; și un smartphone în anii 1950.

Pentru a măsura cât de des apar anacronismele în imaginile generate, autorii au introdus o metodă simplă de evaluare a frecvenței și gravității. Mai întâi, au luat în considerare diferențele minore de formulare în care GPT-4o descria același obiect.

De exemplu, dispozitivul audio modern și dispozitivul audio digital au fost tratați ca echivalente. Pentru a evita dubla contabilizare, s-a utilizat un sistem de potrivire difuză pentru a grupa variațiile de suprafață fără a afecta concepte cu adevărat distincte.

Odată ce toate anacronismele propuse au fost normalizate, au fost calculate două metrice: frecvență a măsurat cât de des apărea un anumit obiect în imagini pentru o perioadă de timp specifică și un model; și gravitate a măsurat cât de sigur apărea acel obiect odată ce a fost sugerat de model.

Dacă un telefon modern a fost marcat de zece ori și a apărut în zece imagini generate, a primit un scor de gravitate de 1,0. Dacă a apărut doar în cinci, scorul de gravitate a fost 0,5. Aceste scoruri au ajutat la identificarea nu numai a apariției anacronismelor, ci și a modului în care erau încorporate în ieșirile modelului pentru fiecare perioadă:

Primele cincisprezece elemente anacronice pentru fiecare model, reprezentate grafic prin frecvență pe axa x și gravitate pe axa y. Cercurile marchează elemente clasate în primele cincisprezece după frecvență, triunghiurile după gravitate, și diamantele după ambele.

Primele cincisprezece elemente anacronice pentru fiecare model, reprezentate grafic prin frecvență pe axa x și gravitate pe axa y. Cercurile marchează elemente clasate în primele cincisprezece după frecvență, triunghiurile după gravitate, și diamantele după ambele.

În figura de mai sus, vedem primele cincisprezece anacronisme pentru fiecare model, clasate după frecvență și consistență.

Îmbrăcămintea a fost frecventă dar răspândită, în timp ce articole precum dispozitivele audio și echipamentele de călcat au apărut mai rar, dar cu o consistență ridicată – modele care sugerează că modelele răspund mai mult la activitatea din prompt decât la perioada de timp.

SD3 a arătat cea mai mare rată de anacronisme, în special în imagini din secolul al XIX-lea și din anii 1930, urmată de FLUX.1 și SDXL.

Pentru a testa cât de bine metoda de detectare se potrivea cu judecata umană, autorii au efectuat un studiu cu utilizatori care a implicat 1.800 de imagini eșantionate aleator din SD3 (modelul cu cea mai mare rată de anacronisme), cu fiecare imagine evaluată de trei lucrători din mulțime. După filtrarea pentru răspunsuri fiabile, 2.040 de judecăți de la 234 de utilizatori au fost incluse, iar metoda a fost de acord cu votul majoritar în 72% din cazuri.

Interfață grafică pentru studiul de evaluare umană, arătând instrucțiunile pentru sarcină, exemple de imagini corecte și anacronice, și întrebări da sau nu pentru identificarea incoerențelor temporale în ieșirile generate.

Interfață grafică pentru studiul de evaluare umană, arătând instrucțiunile pentru sarcină, exemple de imagini corecte și anacronice, și întrebări da sau nu pentru identificarea incoerențelor temporale în ieșirile generate.

Demografie

Ultima analiză a examinat modul în care modelele reprezintă rasa și genul de-a lungul timpului. Utilizând setul de date HistVis, autorii au comparat ieșirile modelului cu estimări de bază generate de un model de limbaj. Aceste estimări nu au fost precise, dar au oferit o idee aproximativă a plauzibilității istorice, ajutând la revelarea modului în care modelele adaptează reprezentările la perioada intenționată.

Pentru a evalua aceste reprezentări la scară, autorii au construit o linie de flux care compară demografia generată de model cu așteptările aproximative pentru fiecare perioadă și activitate. Ei au folosit mai întâi clasificatorul FairFace, un instrument bazat pe ResNet34 antrenat pe peste o sută de mii de imagini, pentru a detecta genul și rasa în ieșirile generate, permițând măsurarea frecvenței cu care fețele din fiecare scenă au fost clasificate ca masculine sau feminine și urmărirea categoriilor rasiale de-a lungul perioadelor:

Exemple de imagini generate care arată suprareprezentarea demografică în diferite modele, perioade de timp și activități.

Exemple de imagini generate care arată suprareprezentarea demografică în diferite modele, perioade de timp și activități.

Rezultatele cu încredere scăzută au fost filtrate pentru a reduce zgomotul, iar predicțiile au fost mediate pentru toate imaginile legate de o perioadă și activitate specifică. Pentru a verifica fiabilitatea citirilor FairFace, un al doilea sistem bazat pe DeepFace a fost utilizat pe un eșantion de 5.000 de imagini. Cele două clasificatoare au arătat un acord puternic, susținând consistența citirilor demografice utilizate în studiu.

Pentru a compara ieșirile modelului cu plauzibilitatea istorică, autorii au solicitat GPT-4o să estimeze distribuția așteptată de gen și rasă pentru fiecare activitate și perioadă de timp. Aceste estimări au servit ca repere aproximative, mai degrabă decât adevărul absolut. Două metrice au fost utilizate: subreprezentare și suprareprezentare, măsurând cât de mult ieșirile modelului se abat de la așteptările LLM-ului.

Rezultatele au arătat modele clare: FLUX.1 a suprareprezentat adesea bărbații, chiar și în scenarii cum ar fi gătit, unde femeile erau așteptate; SD3 și SDXL au arătat tendințe similare în categorii cum ar fi muncă, educație și religie; fețele albe au apărut mai mult decât era de așteptat în general, deși această prejudecată a scăzut în perioadele mai recente; și unele categorii au arătat creșteri neașteptate în reprezentarea non-albă, sugerând că comportamentul modelului poate reflecta corelații din setul de date mai degrabă decât contextul istoric:

Suprareprezentarea și subreprezentarea genului și rasei în ieșirile FLUX.1 de-a lungul secolelor și activităților, arătate ca diferențe absolute de la estimările demografice GPT-4o.

Suprareprezentarea și subreprezentarea genului și rasei în ieșirile FLUX.1 de-a lungul secolelor și activităților, arătate ca diferențe absolute de la estimările demografice GPT-4o.

Autorii concluzionează:

‘Analiza noastră arată că [Text-to-image/TTI] modelele se bazează pe codări stilistice limitate, mai degrabă decât pe înțelegeri nuanțate ale perioadelor istorice. Fiecare epocă este puternic legată de un anumit stil vizual, rezultând în reprezentări unidimensionale ale istoriei.

‘În mod semnificativ, reprezentările fotorealistice ale oamenilor apar doar din secolul al XX-lea înainte, cu excepții rare în FLUX.1 și SD3, sugerând că modelele întăresc asocierile învățate mai degrabă decât se adaptează flexibil la contexte istorice, perpetuând noțiunea că realismul este o trăsătură modernă.

‘În plus, anacronismele frecvente sugerează că perioadele istorice nu sunt separate curat în spațiile latente ale acestor modele, deoarece artefactele moderne apar adesea în setări premoderne, subminând fiabilitatea sistemelor TTI în contexte de educație și patrimoniu cultural.’

Concluzie

În timpul antrenării unui model de difuzie, noțiunile noi nu se așează în mod ordonat în sloturi predefinite în spațiul latent. În schimb, ele formează clusteruri modelate de frecvența lor de apariție și de proximitatea lor față de idei înrudite. Rezultatul este o structură slab organizată în care noțiunile există în raport cu frecvența și contextul lor tipic, mai degrabă decât prin separare curată sau empirică.

Acest lucru face dificilă izolarea a ceea ce contează ca “istoric” într-un set de date mare și general. Așa cum sugerează rezultatele din noua lucrare, multe perioade de timp sunt reprezentate mai degrabă prin aspectul mijloacelor utilizate pentru a le reprezenta decât prin orice detaliu istoric mai profund.

Acesta este unul dintre motivele pentru care rămâne dificil să generați o imagine fotorealistă de calitate din 2025 a unei figuri din secolul al XIX-lea; în majoritatea cazurilor, modelul se va baza pe tropi vizuali din filme și televiziune. Când acestea nu se potrivesc cererii, există puțin altceva în date pentru a compensa. Podirea acestei lacune va depinde probabil de îmbunătățirile viitoare în disocierea conceptelor suprapuse.

 

Publicat pentru prima dată luni, 26 mai 2025

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai