Unghiul lui Anderson

Aducerea analogiilor vizuale în inteligența artificială

mm
Adaugă Unite.AI la sursele tale preferate pe Google
AI-generated image: comparative cross-sections of a peach and the planet Earth. GPT-image-1, Firefly 3.

actuale de inteligență artificială nu recunosc “similitudinile relationale” dintre imagini, cum ar fi modul în care straturile Pământului sunt similare cu cele ale unei piersici, lipsindu-le un aspect cheie al modului

 

Deși există multe Modelele în care oamenii percepează imaginile. modele de viziune computerizată capabile să compareze imagini și să găsească similitudini între ele, generația actuală de sisteme comparative are versuri o capacitate de imaginație redusă sau inexistentă. Luați în considerare câteva cântecul clasic din aniidin

“obiecte”, dezvoltăm o Ca un carusel care se învârte, alergând în jurul lunii Ca un ceas a cărui mâini se mișcă pe fețele sale Și lumea este ca o măr care se învârte în liniște în

1960, : Windmills of Your Mind Asemenea comparații reprezintă un domeniu de aluzie poetică care este semnificativ pentru oameni într-un mod mult dincolo de expresia artistică; mai degrabă, este legat de modul în care dezvoltăm sistemele noastre perceptive; pe măsură ce creăm domeniul nostru de spațiu capacitate de similitudinevizuală , astfel încât – de exemplu – secțiunile care prezintă o piersică și planeta Pământ, sau recurențele fractale cum ar fi spiralele de cafea și ramurile galaxiilor, înregistrează ca analogice pentru noi. În acest fel, putem deduce legături între obiecte și tipuri de obiecte aparent neconectate și infernăm sisteme (cum ar fi gravitația, impulsul și coeziunea suprafeței) care pot fi aplicate la diverse domenii la diverse scară.

Viziunea

Chiar și cele mai recente generații de sisteme de comparație a imaginilor, cum ar fiLPIPSși DINO, care sunt informate de feedback-ul uman, efectuează doar comparații literale de suprafață. Capacitatea lor de a găsi fețe care nu există – adică pareidolie – nu reprezintă mecanismele de similitudine vizuală pe care le dezvoltă oamenii, ci se datorează faptului că algoritmii de căutare a fețelor utilizează caracteristici

Exemple de rezultate false pozitive pentru recunoașterea facială în setul de date 'Faces with Things'. Sursă - https://arxiv.org/pdf/2409.16143 de structură de bază a feței care uneori corespund cu obiecte aleatorii: Exemple de

rezultate false pozitive pentru recunoașterea facială în setul de date ‘Faces with Things’. Sursă Pentru a determina dacă mașinile pot dezvolta cu adevărat capacitatea noastră destinat să formezede a recunoaște similitudini vizuale, cercetătorii din SUA au efectuat un studiu despre , creând și antrenând un nou set de date

Cele mai multe modele de IA recunosc similitudinea doar atunci când imaginile au trăsături de suprafață comune, cum ar fi formă sau culoare, ceea ce face ca ele să lege doar Grupul B (de mai sus) de referință. Oamenii, pe de altă parte, văd și Grupul A ca fiind similar - nu pentru că imaginile arată la fel, ci pentru că urmează aceeași logică subiacentă, cum ar fi prezentarea unei transformări în timp. Noul studiu încearcă să reproducă acest tip de similitudine structurală sau relațională, cu scopul de a aduce percepția mașinilor mai aproape de raționamentul uman. Sursă: https://arxiv.org/pdf/2512.07833 relații abstracte între obiecte diferite, dar legate printr-o relație abstractă: Similitudine Vizuală Relațională Cele mai multe modele de IA recunosc similitudinea doar atunci când imaginile au trăsături de suprafață comune, cum ar fi formă sau culoare, ceea ce face ca ele să lege doar Grupul B (de mai sus) de referință. Oamenii, pe de altă parte, văd și Grupul A ca fiind similar – nu pentru că imaginile arată la fel, ci pentru că urmează aceeașilogică subiacentă, cum ar fi prezentarea unei transformări în timp. Noul studiu încearcă să reproducă acest tip de similitudine structurală sau relațională, cu scopul de a aduce percepția mașinilor mai aproape

Capționările prezise 'anonime' care contribuie la metrica 'relsim' a autorilor. de raționamentul uman. Sursă: https://arxiv.org/pdf/2512.07833 Sistemul de captare a textului

dezvoltat pentru setul de date facilitează annotații neobișnuit de abstracte, proiectate pentru a forța sistemele de IA se concentreze pe caracteristici de bază,maidegrabă

De pe site-ul proiectului asociat, un exemplu de similitudine relațională. Sursă - https://thaoshibe.github.io/relsim/ decât pe detalii locale specifice: Capționările prezise ‘anonime’ care contribuie la metrica ‘relsim’ a autorilor. Sistemul nou propus se bazează pe metodologii

din știința cognitivă, în special teoria Structurii-Mapping (un studiu despre analogie) și definiția lui Amos Tversky despre similitudine relațională și similitudine de atribut . De pe site-ul proiectului asociat, un

Metadate pentru o intrare în colecția LAION-2B. Sursă - https://huggingface.co/datasets/laion/laion2B-en-aesthetic/viewer/default/train exemplu de similitudine relațională . Sursă Autorii afirmă: Noul‘(Oamenii) procesează

similitudinea de atribut

dar similitudinea relațională necesită abstracție conceptuală, adesea susținută de limbaj sau cunoștințe anterioare. Acest lucru sugerează că recunoașterea similitudinii relationale necesită mai întâi înțelegerea imaginii, apelând la cunoștințe și abstractizând structura sa subiacentă.’ articol

perceptual, se intitulează și vine Relațională site alcu un Similitudine Vizuală proiectului (a se vedea videoul încorporat la sfârșitul acestui articol).

Metodă

Cercetătorii au folosit unul dintre cele mai cunoscute seturi de date hiperscalabile ca punct de plecare pentru colecția lor –

Sistemul relsim este antrenat în trei etape: filtrarea imaginilor din LAION-2B pentru conținut relațional; atribuirea fiecărui grup a unei capționări anonime partajate care captează logica sa subiacentă; și învățarea să asocieze imagini cu aceste capționări utilizând o pierdere contrastivă. LAION-2B : Metadate pentru o intrare în colecția LAION-2B. Sursă

Au fost extrase 114.000 de imagini care conțin probabil structuri relationale elastice din LAION-2B, implicând filtrarea multor imagini de calitate scăzută prezente în setul de date minim curat. Pentru a crea o conductă pentru acest proces de selecție, autorii au utilizat Qwen2.5-VL-7B , folosind 1.300de exemple pozitive și 11.000 de exemple negative etichetate de oameni:

Compararea performanței de recuperare, evaluată de GPT-4o, arătând scorul mediu de similitudine relațională pentru fiecare metodă. Metricile de similitudine convenționale, cum ar fi LPIPS, DINO și CLIP-I, au obținut scoruri mai mici, inclusiv atunci când au fost ajustate. Bazele bazate pe capționări, Qwen-T și CLIP-T, au performant și mai slab. Cel mai mare scor a fost obținut de relsim (6,77, coloana albastră din dreapta), indicând faptul că ajustarea pe baza modelelor relationale a îmbunătățit alinierea cu evaluările GPT-4o. Sistemul relsim este antrenat în trei etape: filtrarea imaginilor din LAION-2B pentru conținut relațional; atribuirea fiecărui grup a unei capționări anonime partajate care captează logica sa subiacentă; și învățarea să asocieze imagini cu aceste capționări utilizând o pierdere contrastivă.

Articolul afirmă: Pentru

vreun model relațional, logică sau structură în această imagine care ar putea fi utilă pentru crearea sau legarea de o altă imagine?”. Modelul finetuned obține 93% acord cu judecățile umane, și atunci când este aplicat la LAION-2B, produce N = 114k imagini identificate ca fiind relațional interesante.’ Rezultatele au arătat

a genera etichete relationale, cercetătorii au solicitat modelului Qwen să descrie logica comună din spatele seturilor de imagini fără a numi obiecte specifice. Această abstracție a fost dificil de obținut atunci când modelul a văzut doar o imagine, dar a devenit fezabilă atunci când multiple exemple au demonstrat modelul subiacent. ‘Annotatorii au fost instruiți: “Puteți vedea care grupuri când sunt combinate.corespund diferitelor tipuri de similitudine: unele imagini erau atât relațional, cât și vizual similare, altele împărtășeau logică relațională, dar nu aparență; restul nu a prezentat niciunul dintre acestea. Această analiză sugerează că cele două tipuri de similitudine joacă roluri distincte și oferă o structură mai bogată atunci

Date și Teste

După extragerea caracteristicilor relationale cu Qwen2.5-VL-7B, un model a fost finetuned pe date utilizând LoRA, timp de 15.000 de pași, prin opt A100 GPU*. Pentru partea de text, capționările relationale au fost încorporate utilizând all-MiniLM-L6-v2 din biblioteca Sentence-Transformers . Setul de date de 114.000 de imagini cu capționări a fostîmpărțit în 100.000 pentru antrenare și 14.000 pentru evaluare. Pentru a testa sistemul, a fost utilizată o configurație de recuperare: dată o imagine de întrebare, modelul trebuia să găsească o altă imagine dintr-un set de 28.000 de articole care să exprime aceeași idee relațională. Setul de recuperare a inclus 14.000 de imagini de evaluare și 14.000 de exemple suplimentare din LAION-2B, cu 1.000 de întrebări selectate aleator din setul de evaluare pentru benchmarking. Pentru a evalua calitatea recuperării, GPT-4o a fost utilizat pentru a evalua similitudinea relațională între fiecare imagine de întrebare și imagine recuperată pe o scară de la 0 la 10. Un studiu uman separat a fost efectuat și pentru a evalua preferința utilizatorilor (a se vedea mai jos). Fiecare participant a fost prezentat cu o imagine de întrebare anonimă, împreună cu două candidați, unul recuperat de metoda propusă și celălalt de o bază. Participanții au fost rugați să spună care imagine este mai relațional similară cu imaginea de întrebare, sau dacă ambele sunt la fel de apropiate. Pentru fiecare bază, au fost create 300 de tripleți și evaluate de cel puțin trei persoane, ceea ce a dus la aproximativ 900 de răspunsuri. Abordarea relsim a fost comparată cu mai multe metode de similitudine de imagine stabilite, inclusiv LPIPSși DINO menționateanterior, precum și Două variante de recuperare au fost evaluate, cu CLIP bazat pe recuperarea text-Imagine (CLIP-T) utilizat pentru recuperarea text-Imagine, și Qwen-T utilizând recuperarea text-text. Ambele metode bazate pe capționări au utilizat modelul Qwen preantrenat original, și nu versiunea finetuned pe logică relațională. Acest lucru a permis autorilor să izoleze efectul antrenamentului pe baza grupului, deoarece modelul finetuned fusese expus la seturi de imagini, și nu la exemple izolate. dreamsim și CLIP-I . În plus față de bazele care calculează direct scoruri de similitudine între perechi de imagini, cum ar fi LPIPS, DINO, dreamsim și CLIP-I, autorii au testat și metode bazate pe capționări în care Qwen a fost utilizat pentru a genera o capționare anonimă sau abstractă pentru fiecare imagine; aceasta a servit apoi ca întrebare de recuperare.

Metrici Existente și Similitudine Relațională

Autorii au testat inițial dacă metricile existente ar putea capta similitudinea relațională:

Scoruri de similitudine relațională atribuite de GPT-4o pentru fiecare metodă. Metricile de similitudine standard, cum ar fi LPIPS, DINO și CLIP-I, au obținut scoruri mai mici, iar variantele bazate pe capționări, Qwen-T și CLIP-T, au performant și mai slab. Chiar și versiunile ajustate ale DINO și CLIP nu au reușit să închidă decalajul. Cel mai mare scor, 6,77, a fost obținut de modelul propus, antrenat cu supraveghere pe baza grupului. Compararea performanței de recuperare, evaluată de GPT-4o, arătând scorul mediu de similitudine relațională pentru fiecare metodă. Metricile de similitudine convenționale, cum ar fi LPIPS, DINO și CLIP-I, au obținut scoruri mai mici. Bazele bazate pe capționări, Qwen-T și CLIP-T, au performant și mai slab. Cel mai mare scor a fost obținut de relsim (6,77, coloana albastră din dreapta), indicând faptul că ajustarea pe baza modelelor relationale a îmbunătățit alinierea cu evaluările GPT-4o. În legătură cu aceste

rezultate, autorii afirmă: ‘(LPIPS), care se concentrează

pur pe similitudinea perceptuală, obține cel mai mic scor (4,56). (DINO) performează doar puțin mai bine (5,14), probabil pentru că este antrenat în mod autosuficient pe date de imagine. (CLIP-I) oferă cele mai bune rezultate dintre baze (5,91), probabil pentru că unele abstracții sunt uneori prezente în capționările de imagini. În studiul cu participanți umani, oamenii au preferat constant metoda relsim

noastră, deoarece obținerea unui scor mai bun poate necesita capacitatea de a ajunge la abstracții și mai înalte, cum ar fi cele din capționările anonime.’ Scoruri de similitudine relațională atribuite de GPT-4o pentru

față de toate bazele: ‘Cu toate acestea, CLIP-I tot subperformează în comparație cu metoda

Vizualizarea comună a spațiului de similitudine vizuală utilizând axe relationale și de atribut. O singură imagine de întrebare, care prezintă un câine folosind o cameră, a fost comparată cu 3.000 de altele. Rezultatele au fost organizate după similitudine relațională (vertical) și similitudine de atribut (orizontala). Regiunea din dreapta-sus conține imagini care seamănă cu imaginea de întrebare atât în logică, cât și în aparență, cum ar fi alte câini folosind unelte. Regiunea din stânga-sus conține cazuri semantic legate, dar distincte vizual, cum ar fi animale diferite care efectuează acțiuni legate de camere. Cele mai multe exemple rămase se grupează mai jos în spațiu, reflectând o similitudine mai slabă. Dispunerea ilustrează modul în care modelele relationale și de atribut evidențiază aspecte complementare ale datelor vizuale. Vă rugăm să consultați articolul sursă pentru o rezoluție mai bună. fiecare metodă. Metricile de similitudine standard, cum ar fi LPIPS, DINO și CLIP-I, au obținut scoruri mai mici, iar variantele bazate pe capționări, Qwen-T și CLIP-T, au performant și mai slab. Chiar și versiunile ajustate ale DINO și CLIP nu au reușit să închidă decalajul. Cel mai mare scor, 6,77, a fost obținut de modelul relsim, antrenat cu supraveghere pe baza grupului. Autorii notează: Pentru a explora modul în care

similitudinea relațională și

foarte încurajator, deoarece demonstrează nu numai că modelul nostru, , poate recupera cu succes esteimagini relațional similare, ci și confirmă, din nou, faptul că oamenii percep similitudinea relațională – și nu doar similitudinea de atribut!’ )

cea de atribut pot completa una alta, cercetătorii au utilizat o metodă de visualizare combinată. O singură imagine de întrebare ( relsim ‘Acest lucruatribut: ‘Un câine ținând oa fost comparată cu 3.000 de imagini aleatorii, iar similitudinea a fost calculată utilizând atât modele relationale, cât și de

Având în vedere o imagine de intrare și un prompt relațional, modelelor li sa cerut să genereze o nouă imagine care exprimă același concept de bază. Modelele proprietare au produs analogii mai fidele, păstrând logica structurală prin schimbări mari de formă, iar modelele cu sursă deschisă au avut tendința de a regresa la potriviri literale sau stilistice, nereușind să transfere ideea mai profundă. Rezultatele au fost comparate cu analogii îngrijite de oameni, care au exemplificat transformarea intenționată. cameră’ Vizualizarea comună a spațiului de similitudine vizuală utilizând axe relationale și de atribut. O singură imagine de întrebare, care prezintă un câine folosind o cameră, a fost comparată cu 3.000 de altele. Rezultatele au fost organizate după similitudine relațională (vertical) și similitudine de atribut (orizontala). Regiunea din dreapta-sus conține imagini care seamănă cu imaginea de întrebare atât în logică, cât și în aparență, cum ar fi alte câini folosind unelte. Regiunea din stânga-sus conține cazuri semantic legate, dar distincte vizual, cum ar fi animale diferite care efectuează acțiuni legate de camere. Cele mai multe exemple rămase se grupează mai jos în spațiu, reflectând o similitudine mai slabă. Dispunerea ilustrează modul în care modelele relationale și de atribut evidențiază aspecte complementare ale datelor

vizuale. Vă rugăm să consultați articolul sursă pentru o rezoluție mai bună. Rezultatele au arătat grupuri care corespund diferitelor tipuri de similitudine: unele imagini erau atât relațional, cât și vizual similare, altele împărtășeau logică relațională, dar nu aparență; restul nu a prezentat niciunul dintre acestea. Această analiză sugerează că cele două tipuri de similitudine joacă roluri distincte și oferă o structură mai bogată atunci când sunt combinate.

Cazuri de Utilizare

Articolul explorează și câteva posibile cazuri de utilizare pentru similitudinea relațională, inclusiv , care Recuperarea relațională returnează imaginipermite căutarea de imagini mai aliniată cu modul creativ în care oamenii privesc lumea: recuperarea de imagini relationale

Recuperarea relațională returnează imagini care împărtășesc o structură conceptuală mai profundă cu imaginea de întrebare, mai degrabă decât să se potrivească cu caracteristici de suprafață. De exemplu, un aliment stilizat pentru a semăna cu o față recuperează alte mese antropomorfe; un obiect tăiat produce alte forme tăiate; și scenele de interacțiune adult-descendent returnează imagini cu roluri relationale similare, chiar și atunci când specia și compoziția diferă. care împărtășesc o structură conceptuală mai profundă cu imaginea de întrebare, mai degrabă decât să se potrivească cu caracteristici de suprafață. De exemplu, un aliment stilizat pentru a semăna cu o față recuperează alte mese antropomorfe; un obiect tăiat produce alte forme tăiate; și scenele de interacțiune adult-descendent returnează imagini cu roluri relationale similare, chiar și atunci când specia și compoziția

diferă. O altă imagine de întrebareposibilitate este , care ar permite sinteza de întrebări care utilizează structuri relationale în loc de descrieri directe. Într-o comparație a rezultatelor obținute de la generația actuală de modele de text-la-imagine de ultimă oră, putem vedea că rezultatele unei astfel de abordări sunt probabil să fie mai diverse: generarea de imagini analogice Dată o

Dată o imagine de întrebare și o întrebare relațională, modelele au fost solicitate să genereze o nouă imagine care exprimă aceeași idee subiacentă. Modelele proprietare au produs analogii mai fidele, păstrând logica structurală în schimbări mari de formă, în timp ce modelele cu sursă deschisă au tendința de a regresa la potriviri literale sau stilistice, eșuând în a transfera ideea mai profundă. Rezultatele au fost comparate cu analogii curate de oameni, care exemplifică transformarea intenționată. și o întrebare relațională, modelele au fost solicitate să genereze o nouă imagine care exprimă aceeași idee subiacentă. Modelele proprietare au produs analogii mai fidele, păstrând logica structurală în schimbări mari de formă, în timp ce modelele cu sursă deschisă au tendința de a regresa la potriviri literale sau stilistice, eșuând în a transfera ideea mai profundă. Rezultatele au fost comparate cu analogii curate de oameni, care exemplifică transformarea intenționată.

Concluzie

Sistemele generative de inteligență artificială ar fi, pare-se, notabil îmbunătățite prin capacitatea de a incorpora reprezentări abstracte în conceptualizările lor. Așa cum stau lucrurile, solicitarea de imagini bazate pe concepte, cum ar fi “furie” sau “fericire”, are tendința de a returna imagini stilizate din imaginile cele mai populare sau mai numeroase care aveau aceste asocieri în setul de date; ceea ce este memorare mai degrabă decât abstracție. Probabil că acest principiu ar putea fi și mai benefic dacă ar putea fi aplicat la scrierea generativă – în special la outputul analitic, speculativ sau ficțional. (/video) Apăsați pentru a juca. Sursă

* Un A100 avea

 

 

poate 40Gb sau 80GB de VRAM; acest lucru nu este specificat în articol. ** Citările autorilor sunt

redundante și excluse. Publicat pentru

prima dată marți, 16 decembrie 2025

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai