Andersonin kulma

Visuaalisten analogioiden tuominen tekoÃĪlyyn

mm
LisÃĪÃĪ Unite.AI suosikkilÃĪhteisiisi Google-palvelussa
AI-generated image: comparative cross-sections of a peach and the planet Earth. GPT-image-1, Firefly 3.

Nykyiset tekoÃĪlymallit eivÃĪt pysty tunnistamaan “relaatiivisia” kuvien yhtÃĪlÃĪisyyksiÃĪ, kuten sitÃĪ, miten maapallon kerrokset ovat samanlaiset kuin persikka, ja ne puuttuvat avainaspektista, jolla ihmiset havaitsevat kuvia.

 

Vaikka on olemassa monia tietokoneen nÃĪkÃķmalli, jotka pystyvÃĪt vertailemaan kuvia ja lÃķytÃĪmÃĪÃĪn niiden vÃĪlisiÃĪ yhtÃĪlÃĪisyyksiÃĪ, nykyisen vertailujÃĪrjestelmien uusi sukupolvi ei ole juuri lainkaan mielikuvituksellista kapasiteettia. Tarkastellaan joitakin klassisen 1960-luvun laulun, Windmills of Your Mind, sanoja:

Kuten karuselli, joka pyÃķrii, juoksemassa ympyrÃĪÃĪ kuun ympÃĪrillÃĪ
Kuten kello, jonka kÃĪdet liikkuvat minuuttien yli sen kasvojen
Ja maailma on kuin omena, joka pyÃķrii hiljaa avaruudessa

TÃĪllaiset vertailut edustavat runollista viittauksen aluetta, joka on merkittÃĪvÃĪÃĪ ihmisille tavalla, joka on paljon taiteellisen ilmaisun tuolla puolen; se on sidottu siihen, miten kehittÃĪmme havaintojÃĪrjestelmiÃĪmme; kun luomme “objektin” alueen, kehittÃĪmme visuaalisen yhtÃĪlÃĪisyyden kapasiteetin, joten esimerkiksi persikka- ja maapallon poikkileikkauskuvat tai fraktaalisten toistojen kuten kahvin kierteiden ja galaksien haarojen kaltaiset, rekisterÃķityvÃĪt meillÃĪ analogisina.

TÃĪllÃĪ tavalla voimme johtaa yhteyksiÃĪ nÃĪennÃĪisesti yhdistÃĪmÃĪttÃķmiin objekteihin ja objektityyppiin, ja johtaa jÃĪrjestelmiÃĪ (kuten gravitaatio, liike ja pinnan koheesio), jotka voivat soveltaa useisiin alueisiin eri skaaloissa.

NÃĪkeminen

Jopa uusimman sukupolven kuvien vertailujÃĪrjestelmistÃĪ, kuten LPIPS ja DINO, jotka perustuvat ihmisen palautteeseen, suorittavat vain kirjaimellisen pinnan vertailuja.

Niiden kyky lÃķytÃĪÃĪ kasvoja, joita ei ole olemassa – ts. pareidolia – ei edusta visuaalisen yhtÃĪlÃĪisyyden mekanismeja, joita ihmiset kehittÃĪvÃĪt, vaan se johtuu siitÃĪ, ettÃĪ kasvoja etsivÃĪt algoritmit kÃĪyttÃĪvÃĪt matalan tason kasvojen rakenteen ominaisuuksia, jotka joskus sopivat sattumalta muihin objekteihin:

EsimerkkejÃĪ vÃĪÃĪristÃĪ positiivisista tuloksista kasvojen tunnistamisessa 'Faces with Things' -aineistossa. LÃĪhde - https://arxiv.org/pdf/2409.16143

EsimerkkejÃĪ vÃĪÃĪristÃĪ positiivisista tuloksista kasvojen tunnistamisessa ‘Faces with Things’ -aineistossa. LÃĪhde

MÃĪÃĪrittÃĪÃĪkseen, voivatko koneet todella kehittÃĪÃĪ meidÃĪn mielikuvituksellisen kapasiteettimme tunnistaa visuaalinen yhtÃĪlÃĪisyys eri alueilla, tutkijat Yhdysvalloissa ovat suorittaneet tutkimuksen Relaatiivisen visuaalisen yhtÃĪlÃĪisyyden ympÃĪrillÃĪ, ja kuratoivat ja kouluttivat uuden aineiston, joka on suunniteltu pakottamaan abstraktit suhteet muodostumaan eri objektiiden vÃĪlille, jotka ovat kuitenkin sidottuja abstraktiin suhteeseen:

Useimmat tekoÃĪlymallit tunnistavat yhtÃĪlÃĪisyyden vain, kun kuvat jakavat pinnan piirteitÃĪ, kuten muotoa tai vÃĪriÃĪ, joten ne linkittÃĪvÃĪt vain ryhmÃĪ B (yllÃĪ) viiteen. Ihmiset sen sijaan nÃĪkevÃĪt myÃķs ryhmÃĪ A samanlaisena – ei siksi, ettÃĪ kuvat nÃĪyttÃĪvÃĪt samanlaisilta, vaan siksi, ettÃĪ ne seuraavat samaa perustavaa logiikkaa, kuten esimerkiksi muutosta ajan myÃķtÃĪ. Uusi tyÃķ pyrkii jÃĪljittelemÃĪÃĪn tÃĪllaista rakenteellista tai relaatiivista yhtÃĪlÃĪisyyttÃĪ, pyrkien lÃĪhentÃĪmÃĪÃĪn koneen havaintoa ihmisen pÃĪÃĪttelyyn. LÃĪhde: https://arxiv.org/pdf/2512.07833

Useimmat tekoÃĪlymallit tunnistavat yhtÃĪlÃĪisyyden vain, kun kuvat jakavat pinnan piirteitÃĪ, kuten muotoa tai vÃĪriÃĪ, joten ne linkittÃĪvÃĪt vain ryhmÃĪ B (yllÃĪ) viiteen. Ihmiset sen sijaan nÃĪkevÃĪt myÃķs ryhmÃĪ A samanlaisena – ei siksi, ettÃĪ kuvat nÃĪyttÃĪvÃĪt samanlaisilta, vaan siksi, ettÃĪ ne seuraavat samaa perustavaa logiikkaa, kuten esimerkiksi muutosta ajan myÃķtÃĪ. Uusi tyÃķ pyrkii jÃĪljittelemÃĪÃĪn tÃĪllaista rakenteellista tai relaatiivista yhtÃĪlÃĪisyyttÃĪ, pyrkien lÃĪhentÃĪmÃĪÃĪn koneen havaintoa ihmisen pÃĪÃĪttelyyn. LÃĪhde: https://arxiv.org/pdf/2512.07833

Kuvien kuvailujÃĪrjestelmÃĪ, joka on kehitetty aineistoa varten, mahdollistaa epÃĪtavallisen abstraktit kuvailut, jotka on suunniteltu pakottamaan tekoÃĪlyjÃĪrjestelmiÃĪ keskittymÃĪÃĪn perusominaisuuksiin eikÃĪ paikallisiin yksityiskohtiin:

Ennustetut 'anonyymit' kuvailut, jotka osallistuvat kirjoittajien 'relsim' -mittariin.

Ennustetut ‘anonyymit’ kuvailut, jotka osallistuvat kirjoittajien ‘relsim’ -mittariin.

Kuratoitu kokoelma ja sen epÃĪtavallinen kuvailutyyli ruokkivat kirjoittajien uuden ehdotetun mittarin relsim, jonka kirjoittajat ovat hienosÃĪÃĪdetty nÃĪkemys-kieli-malliin (VLM).

Vertailu tyypillisten aineistojen kuvailutyylistÃĪ, joka keskittyy attribuuttiyhtÃĪlÃĪisyyteen, kun taas relsim -lÃĪhestymistapa (alareuna) korostaa relaatiivista yhtÃĪlÃĪisyyttÃĪ.

Vertailu tyypillisten aineistojen kuvailutyylistÃĪ, joka keskittyy attribuuttiyhtÃĪlÃĪisyyteen, kun taas relsim -lÃĪhestymistapa (alareuna) korostaa relaatiivista yhtÃĪlÃĪisyyttÃĪ.

Uusi lÃĪhestymistapa perustuu kognitiivisen tieteen metodologioihin, erityisesti Dedre Gentnerin Rakenteen karttaminen -teoriaan (analogian tutkimus) ja Amos Tverskyn mÃĪÃĪritelmÃĪÃĪn relaatiivisesta yhtÃĪlÃĪisyydestÃĪ ja attribuuttiyhtÃĪlÃĪisyydestÃĪ.

LiittymÃĪn verkkosivuilta, esimerkki relaatiivisesta yhtÃĪlÃĪisyydestÃĪ. LÃĪhde - https://thaoshibe.github.io/relsim/

LiittymÃĪn verkkosivuilta, esimerkki relaatiivisesta yhtÃĪlÃĪisyydestÃĪ. LÃĪhde

Kirjoittajat toteavat:

‘[Ihmiset] prosessoi attribuuttiyhtÃĪlÃĪisyyttÃĪ havainnoivasti, mutta relaatiivinen yhtÃĪlÃĪisyys vaatii konseptuaalista abstraktiota, usein tuettuna kielellÃĪ tai aiemmin saadulla tiedolla. TÃĪmÃĪ osoittaa, ettÃĪ relaatiivisen yhtÃĪlÃĪisyyden tunnistaminen edellyttÃĪÃĪ ensin kuvan ymmÃĪrtÃĪmistÃĪ, tiedon kÃĪyttÃĪmistÃĪ ja sen perustavanlaatuisten rakenteiden abstrahointia.’

Uusi artikkeli on nimeltÃĪÃĪn Relaatiivinen visuaalinen yhtÃĪlÃĪisyys, ja siihen liittyy projektisivusto (ks. video tÃĪmÃĪn artikkelin lopussa).

MenetelmÃĪ

Tutkijat kÃĪyttivÃĪt yhtÃĪ tunnetuimmista hyperskaaladataseteista oman kokoelmansa lÃĪhtÃķkohtana – LAION-2B:

LAION-2B -kokoelman yksittÃĪisen merkinnÃĪn metadata. LÃĪhde - https://huggingface.co/datasets/laion/laion2B-en-aesthetic/viewer/default/train

LAION-2B -kokoelman yksittÃĪisen merkinnÃĪn metadata. LÃĪhde

114 000 kuvaa, joissa on todennÃĪkÃķisesti joustavia relaatiivisia rakenteita, on poimittu LAION-2B:stÃĪ, mukaan lukien monien matalan laatuisen kuvien suodatus, jotka ovat lÃĪsnÃĪ vÃĪhÃĪisesti kuratoidussa aineistossa.

Luoakseen putken tÃĪtÃĪ valintaprosessia varten, kirjoittajat kÃĪyttivÃĪt Qwen2.5-VL-7B:tÃĪ, hyÃķdyntÃĪen 1 300 positiivista ja 11 000 negatiivista ihmisten tekemÃĪÃĪ merkintÃĪÃĪ:

RelSim-jÃĪrjestelmÃĪ on koulutettu kolmessa vaiheessa: kuvien suodatus LAION-2B:stÃĪ relaatiivista sisÃĪltÃķÃĪ varten; kunkin ryhmÃĪn jaettu anonyymi kuvailu, joka sieppaa niiden perustavanlaatuisen logiikan; ja oppiminen kuvien liittÃĪmisestÃĪ nÃĪihin kuvailuihin kontrastiivisen menetelmÃĪn avulla.

RelSim-jÃĪrjestelmÃĪ on koulutettu kolmessa vaiheessa: kuvien suodatus LAION-2B:stÃĪ relaatiivista sisÃĪltÃķÃĪ varten; kunkin ryhmÃĪn jaettu anonyymi kuvailu, joka sieppaa niiden perustavanlaatuisen logiikan; ja oppiminen kuvien liittÃĪmisestÃĪ nÃĪihin kuvailuihin kontrastiivisen menetelmÃĪn avulla.

Artikkelissa todetaan:

‘MerkinnÃĪnantajat ohjeistettiin: “Voitko nÃĪhdÃĪ relaatiivista mallia, logiikkaa tai rakennetta tÃĪssÃĪ kuvassa, joka voisi olla hyÃķdyllistÃĪ luodaksesi tai linkittÃĪÃĪksesi toiseen kuvaan?” Koulutettu malli saavuttaa 93 prosentin sopimuksen ihmisten arvioissa, ja kun se sovelletaan LAION-2B:hen, se tuottaa N = 114k kuvia, joita pidetÃĪÃĪn relaatiivisesti kiinnostavina.’

Relaatiivisten etikettien generointiin tutkijat pyysivÃĪt Qwen-mallia kuvaamaan jaettua logiikkaa kuvaryhmien takana ilman nimeÃĪmistÃĪ tiettyjÃĪ objekteja. TÃĪmÃĪ abstrahointi oli vaikeaa, kun malli nÃĪki vain yhden kuvan, mutta se tuli toimivaksi, kun useat esimerkit osoittivat perustavanlaatuisen mallin.

Tuloksena olevat ryhmÃĪtason kuvailut korvasivat tiettyjÃĪ termejÃĪ paikkaajilla, kuten ‘{Aihe}’ tai ‘{Liikkeen tyyppi}’, mikÃĪ teki niistÃĪ laajasti sovellettavissa.

Ihmisten vahvistettuaan kunkin kuvailun, se parittiin kaikkien kuvien kanssa ryhmÃĪssÃĪ. Yli 500 tÃĪllaista ryhmÃĪÃĪ kÃĪytettiin mallin kouluttamiseen, jota sovellettiin sitten 114 000 suodatettuun kuvaan, jotta saataisiin aikaan suuri joukko abstrakteja, relaatiivisesti annotoituja nÃĪytteitÃĪ.

Data ja testit

Relaatiivisten piirteiden extraktio Qwen2.5-VL-7B:llÃĪ, malli koulutettiin aineistoa kÃĪyttÃĪen LoRA:a, 15 000 askelella, kahdeksan A100 GPU:n kautta*. Tekstipuolelle relaatiiviset kuvailut upotettiin kÃĪyttÃĪen all-MiniLM-L6-v2:ta Sentence-Transformers -kirjastosta.

114 000 kuvan aineisto jaettiin 100 000:een koulutukseen ja 14 000:een arviointiin. JÃĪrjestelmÃĪn testaamiseksi kÃĪytettiin hakujÃĪrjestelmÃĪÃĪ: annettuaan kyselykuvan, mallin piti lÃķytÃĪÃĪ toinen kuva 28 000:sta kohteesta, joka ilmaisi saman relaatiivisen idean. Hakupooli sisÃĪlsi 14 000 arviointikuva ja 14 000 lisÃĪÃĪ LAION-2B:stÃĪ, ja 1 000 kyselyÃĪ valittiin satunnaisesti arviointijoukosta benchmarkkaamiseksi.

Arvioidakseen hakutuloksen laatua, GPT-4o kÃĪytettiin arvioimaan relaatiivisen yhtÃĪlÃĪisyyden arvoa kussakin kysely- ja haetussa kuvaparissa asteikolla 0-10. Erillinen ihmisten tutkimus tehtiin myÃķs arvioidakseen kÃĪyttÃĪjien preferenssejÃĪ (ks. alla).

Kunkin osallistujan nÃĪytettiin anonyymi kyselykuva kahden ehdokkaan kanssa, joista toinen haettiin ehdotetulla menetelmÃĪllÃĪ ja toinen vertailumallilla. Osallistujilta kysyttiin, kumpi kuva oli relaatiivisesti lÃĪhempÃĪnÃĪ kyselyÃĪ, tai jos ne olivat yhtÃĪ lÃĪhellÃĪ. Kussakin vertailumallissa luotiin 300 triplettiÃĪ ja arvioitiin vÃĪhintÃĪÃĪn kolme kertaa, mikÃĪ tuotti noin 900 vastausta.

RelSim-lÃĪhestymistapaa verrattiin useisiin vakiintuneisiin kuvien vÃĪlisten yhtÃĪlÃĪisyyden menetelmiin, mukaan lukien mainittu LPIPS ja DINO, sekÃĪ dreamsim ja CLIP-I. LisÃĪksi suoraan kuvaparien vÃĪlisiÃĪ yhtÃĪlÃĪisyyden laskentamenetelmiÃĪ, kuten LPIPS, DINO, dreamsim ja CLIP-I, tutkijat testasivat myÃķs kuvailupohjaisia menetelmiÃĪ, joissa Qwen kÃĪytettiin luomaan anonyymi tai abstrakti kuvailu kullekin kuvalle; tÃĪmÃĪ toimi sitten hakukyselynÃĪ.

Kaksi hakuvaihtoehtoa arvioitiin, joissa CLIP-pohjainen teksti-kuvahaku (CLIP-T) kÃĪytettiin teksti-kuvahakuun ja Qwen-T teksti-tekstihakuun. Molemmat kuvailupohjaiset vertailumallit kÃĪyttivÃĪt alkuperÃĪistÃĪ esikoulutettua Qwen-mallia eikÃĪ versiota, jota oli hienosÃĪÃĪdetty relaatiivisella logiikalla. TÃĪmÃĪ mahdollisti tutkijoiden erottaa ryhmÃĪperÃĪisen koulutuksen vaikutuksen, koska hienosÃĪÃĪdetty malli oli altistunut kuvaryhmille eikÃĪ erillisiin esimerkkeihin.

Olemassa olevat mittarit ja relaatiivinen yhtÃĪlÃĪisyys

Tutkijat testasivat aluksi, voivatko olemassa olevat mittarit sieppaa relaatiivisen yhtÃĪlÃĪisyyden:

Vertailu hakutuloksen suorituskyvystÃĪ GPT-4o:n arvioimana, osoittaa keskimÃĪÃĪrÃĪisen relaatiivisen yhtÃĪlÃĪisyyden arvon kullekin menetelmÃĪlle. Perinteiset yhtÃĪlÃĪisyyden mittarit, kuten LPIPS, DINO ja CLIP-I, saavuttivat alhaisemmat arvot, myÃķs kun ne oli sÃĪÃĪtelty. Kuvailupohjaiset vertailumallit Qwen-T ja CLIP-T suorittivat myÃķs heikommin. Korkein arvo (6,77) saavutettiin relsim-menetelmÃĪllÃĪ (oikeanpuoleisin sininen palkki), osoittaen, ettÃĪ koulutus ryhmÃĪperÃĪisillÃĪ relaatiivisilla malleilla paransi yhdenmukaisuutta GPT-4o:n arvioiden kanssa.

Vertailu hakutuloksen suorituskyvystÃĪ GPT-4o:n arvioimana, osoittaa keskimÃĪÃĪrÃĪisen relaatiivisen yhtÃĪlÃĪisyyden arvon kullekin menetelmÃĪlle. Perinteiset yhtÃĪlÃĪisyyden mittarit, kuten LPIPS, DINO ja CLIP-I, saavuttivat alhaisemmat arvot, myÃķs kun ne oli sÃĪÃĪtelty. Kuvailupohjaiset vertailumallit Qwen-T ja CLIP-T suorittivat myÃķs heikommin. Korkein arvo (6,77) saavutettiin relsim-menetelmÃĪllÃĪ (oikeanpuoleisin sininen palkki), osoittaen, ettÃĪ koulutus ryhmÃĪperÃĪisillÃĪ relaatiivisilla malleilla paransi yhdenmukaisuutta GPT-4o:n arvioiden kanssa.

Tutkijat toteavat**:

‘[LPIPS], joka keskittyy pelkÃĪstÃĪÃĪn havainnolliseen yhtÃĪlÃĪisyyteen, saavuttaa alhaisimman arvon (4,56). [DINO] suorittaa vain hieman paremmin (5,14), luultavasti siksi, ettÃĪ se on koulutettu ainoastaan itseohjautuvasti kuvadatalle. [CLIP-I] tuottaa vahvimman tuloksen vertailumalleista (5,91), luultavasti siksi, ettÃĪ joissain tapauksissa on abstraktio kuvailuissa.

‘Mutta [CLIP-I] suorittaa silti heikommin kuin meidÃĪn menetelmÃĪmme, mikÃĪ saattaa edellyttÃĪÃĪ kykyÃĪ saavuttaa vielÃĪ korkeampia abstraktioita, kuten anonyymien kuvailujen kaltainen.’

Ihmisten tutkimuksessa ihmiset suosivat johdonmukaisesti relsim-menetelmÃĪÃĪ kaikkia vertailumalleja vastaan:

Relaatiivisen yhtÃĪlÃĪisyyden arvot, jotka GPT-4o on arvioinut kullekin menetelmÃĪlle. Perinteiset yhtÃĪlÃĪisyyden mittarit, kuten LPIPS, DINO ja CLIP-I, saavuttivat alhaisemmat arvot, ja kuvailupohjaiset variantit Qwen-T ja CLIP-T suorittivat vain hieman paremmin. Jopa sÃĪÃĪteltyjen DINO- ja CLIP-mallien versiot eivÃĪt kyenneet sulkemaan eroa. Korkein arvo, 6,77, saavutettiin relsim-mallilla, joka oli koulutettu ryhmÃĪperÃĪisellÃĪ valvonnalla.

Relaatiivisen yhtÃĪlÃĪisyyden arvot, jotka GPT-4o on arvioinut kullekin menetelmÃĪlle. Perinteiset yhtÃĪlÃĪisyyden mittarit, kuten LPIPS, DINO ja CLIP-I, saavuttivat alhaisemmat arvot, ja kuvailupohjaiset variantit Qwen-T ja CLIP-T suorittivat vain hieman paremmin. Jopa sÃĪÃĪteltyjen DINO- ja CLIP-mallien versiot eivÃĪt kyenneet sulkemaan eroa. Korkein arvo, 6,77, saavutettiin relsim-mallilla, joka oli koulutettu ryhmÃĪperÃĪisellÃĪ valvonnalla.

Tutkijat huomauttavat:

‘TÃĪmÃĪ on erittÃĪin lupaavaa, koska se osoittaa, ettÃĪ mallimme, relsim, pystyy onnistuneesti hakemaan relaatiivisesti samanlaisia kuvia, ja myÃķs vahvistaa, ettÃĪ ihmiset havaitsevat relaatiivisen yhtÃĪlÃĪisyyden – ei pelkÃĪstÃĪÃĪn attribuuttiyhtÃĪlÃĪisyyttÃĪ!’

Tutkijat tutkivat, miten relaatiivinen ja attribuuttiyhtÃĪlÃĪisyys voivat tÃĪydentÃĪÃĪ toisiaan. He kÃĪyttivÃĪt yhdistettyÃĪ visualisointimenetelmÃĪÃĪ, jossa yksittÃĪinen kyselykuva (“koira, joka pitÃĪÃĪ kameraa”) verrattiin 3 000:aan satunnaiseen kuvaan, ja yhtÃĪlÃĪisyys laskettiin sekÃĪ relaatiivisella ettÃĪ attribuuttipohjaisella mallilla:

Visuaalisen yhtÃĪlÃĪisyyden tilan yhdistetty visualisointi relaatiivisella ja attribuuttiakselilla. YksittÃĪinen kyselykuva, jossa koira kÃĪyttÃĪÃĪ kameraa, verrattiin 3 000:aan muuhun. Tulokset jÃĪrjestettiin relaatiivisen yhtÃĪlÃĪisyyden (pysty) ja attribuuttiyhtÃĪlÃĪisyyden (vaaka) mukaan. YlÃĪ-oikea alue sisÃĪltÃĪÃĪ kuvia, jotka muistuttavat kyselyÃĪ sekÃĪ logiikassa ettÃĪ ulkonÃĪÃķssÃĪ, kuten muita koiria, jotka kÃĪyttÃĪvÃĪt tyÃķkaluja. YlÃĪ-vasen alue sisÃĪltÃĪÃĪ semanttisesti liittyviÃĪ, mutta visuaalisesti erilaisia tapauksia, kuten eri elÃĪimiÃĪ, jotka suorittavat kameran liittyviÃĪ toimintoja. Useimmat loput esimerkit ryhmittÃĪvÃĪt alemmaksi tilaan, heijastaen heikompaa yhtÃĪlÃĪisyyttÃĪ. Layout osoittaa, miten relaatiiviset ja attribuuttimallit korostavat visuaalisten tietojen eri puolia. LÃĪhde: https://arxiv.org/pdf/2512.07833

Visuaalisen yhtÃĪlÃĪisyyden tilan yhdistetty visualisointi relaatiivisella ja attribuuttiakselilla. YksittÃĪinen kyselykuva, jossa koira kÃĪyttÃĪÃĪ kameraa, verrattiin 3 000:aan muuhun. Tulokset jÃĪrjestettiin relaatiivisen yhtÃĪlÃĪisyyden (pysty) ja attribuuttiyhtÃĪlÃĪisyyden (vaaka) mukaan. YlÃĪ-oikea alue sisÃĪltÃĪÃĪ kuvia, jotka muistuttavat kyselyÃĪ sekÃĪ logiikassa ettÃĪ ulkonÃĪÃķssÃĪ, kuten muita koiria, jotka kÃĪyttÃĪvÃĪt tyÃķkaluja. YlÃĪ-vasen alue sisÃĪltÃĪÃĪ semanttisesti liittyviÃĪ, mutta visuaalisesti erilaisia tapauksia, kuten eri elÃĪimiÃĪ, jotka suorittavat kameran liittyviÃĪ toimintoja. Useimmat loput esimerkit ryhmittÃĪvÃĪt alemmaksi tilaan, heijastaen heikompaa yhtÃĪlÃĪisyyttÃĪ. Layout osoittaa, miten relaatiiviset ja attribuuttimallit korostavat visuaalisten tietojen eri puolia.

TÃĪmÃĪ analyysi osoittaa, ettÃĪ nÃĪmÃĪ kaksi yhtÃĪlÃĪisyyden tyyppiÃĪ palvelevat eri rooleja ja tuottavat rikkaamman rakenteen, kun ne yhdistetÃĪÃĪn.

KÃĪyttÃķtapaukset

Artikkeli tutkii myÃķs joitain relaatiivisen yhtÃĪlÃĪisyyden lopullisia kÃĪyttÃķtapauksia, mukaan lukien relaatiivinen kuva-haku, joka mahdollistaa kuvahakua, joka on lÃĪhempÃĪnÃĪ ihmisten luovaa tapaa katsella maailmaa:

Relaatiivinen haku palauttaa kuvia, jotka jakavat syvemmÃĪn konseptuaalisen rakenteen kyselyllÃĪ, eikÃĪ pelkÃĪstÃĪÃĪn pinnan piirteitÃĪ. Esimerkiksi ruoka, joka on muotoiltu muistuttamaan kasvoja, palauttaa muita antropomorfisia aterioita; viipaleinen objekti tuottaa muita viipaleisia muotoja; ja aikuisten ja jÃĪlkelÃĪisten vÃĪlisiÃĪ vuorovaikutuksia esittÃĪvÃĪt kohtaukset palauttavat kuvia, joissa on samanlaiset relaatiiviset roolit, riippumatta lajista ja koostumuksesta.

Relaatiivinen haku palauttaa kuvia, jotka jakavat syvemmÃĪn konseptuaalisen rakenteen kyselyllÃĪ, eikÃĪ pelkÃĪstÃĪÃĪn pinnan piirteitÃĪ. Esimerkiksi ruoka, joka on muotoiltu muistuttamaan kasvoja, palauttaa muita antropomorfisia aterioita; viipaleinen objekti tuottaa muita viipaleisia muotoja; ja aikuisten ja jÃĪlkelÃĪisten vÃĪlisiÃĪ vuorovaikutuksia esittÃĪvÃĪt kohtaukset palauttavat kuvia, joissa on samanlaiset relaatiiviset roolit, riippumatta lajista ja koostumuksesta.

Toinen mahdollisuus on analoginen kuva-generointi, joka mahdollistaisi kyselyiden luomisen, jotka kÃĪyttÃĪvÃĪt relaatiivisia rakenteita eikÃĪ suoria kuvauksia. Vertaamalla tuloksia, jotka saadaan nykyisistÃĪ valmiista teksti-kuvamalleista, voidaan nÃĪhdÃĪ, ettÃĪ tÃĪllaisen lÃĪhestymistavan tulokset ovat todennÃĪkÃķisesti monipuolisempia:

Kun annettiin syÃķtekuva ja relaatiivinen ohje, mallit pyydettiin generoimaan uusi kuva, joka ilmaisi saman perustavanlaatuisen konseptin. Omistajien mallit tuottivat uskollisempia analogioita, jotka sÃĪilyttivÃĪt rakenteellisen logiikan suurten muodonmuutosten yli, ja avoimen lÃĪhdekoodin mallit taipuivat kirjaimellisiin tai tyyliin perustuviin vastaavuuksiin, eivÃĪtkÃĪ onnistuneet siirtÃĪmÃĪÃĪn syvempÃĪÃĪ ideaa. Tulokset verrattiin ihmisten kuratoimiin analogioihin, jotka edustivat tarkoitettua muunnosta.

Kun annettiin syÃķtekuva ja relaatiivinen ohje, mallit pyydettiin generoimaan uusi kuva, joka ilmaisi saman perustavanlaatuisen konseptin. Omistajien mallit tuottivat uskollisempia analogioita, jotka sÃĪilyttivÃĪt rakenteellisen logiikan suurten muodonmuutosten yli, ja avoimen lÃĪhdekoodin mallit taipuivat kirjaimellisiin tai tyyliin perustuviin vastaavuuksiin, eivÃĪtkÃĪ onnistuneet siirtÃĪmÃĪÃĪn syvempÃĪÃĪ ideaa. Tulokset verrattiin ihmisten kuratoimiin analogioihin, jotka edustivat tarkoitettua muunnosta.

JohtopÃĪÃĪtÃķs

Generatiiviset tekoÃĪlyjÃĪrjestelmÃĪt olisivat ilmeisesti huomattavasti parantuneita, jos ne kykenisivÃĪt sisÃĪllyttÃĪmÃĪÃĪn abstraktin edustamisen konseptioihinsa. NykyisellÃĪÃĪn pyytÃĪminen konseptipohjaisia kuvia, kuten “viha” tai “onnellisuus”, palauttaa kuvia, jotka on tyyliteltu suosituimmista tai runsaimmista kuvista, joilla on nÃĪmÃĪ assosiaatiot aineistossa; tÃĪmÃĪ on muistinvaraisuutta eikÃĪ abstraktiota.

TodennÃĪkÃķisesti tÃĪmÃĪ periaate voisi olla vielÃĪ hyÃķdyllisempi, jos se voisi soveltaa generatiiviseen kirjoittamiseen – erityisesti analyyttiseen, spekulatiiviseen tai kaunokirjalliseen tuotantoon.

Paina toistamaan. LÃĪhde

 

 

* A100:lla voi olla 40 Gt tai 80 Gt VRAM:ia; tÃĪmÃĪ ei ole mÃĪÃĪritelty artikkelissa.

** Kirjoittajien viittaukset ovat tarpeettomia ja poistettu.

Julkaistu ensimmÃĪisen kerran tiistaina 16. joulukuuta 2025

Kirjailija tekoÃĪlystÃĪ, alan erikoismies ihmisen kuvien synteesistÃĪ. Entinen tutkimussisÃĪllÃķn johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttÃĪ: [email protected]