Andersonin kulma
Havaitsemisjärjestelmä puhtaalle kuvasynteesirungolle, kuten DALL-E 2:lle

Uusi tutkimus Kalifornian yliopistosta Berkeleyssä tarjoaa menetelmän, jolla voidaan määrittää, voidaanko uuden sukupolven kuvasynteesirunkojen tuottamaa dataa havaita “epäaidoksi”, tutkimalla geometriaa, varjoja ja heijastuksia, jotka näkyvät syntetisoiduissa kuvissa.
Tutkijat ovat tutkineet DALL-E 2:sta tekstin ohjaamalla luotuja kuvia ja havainneet, että vaikka arkkitehtuuri pystyy tuottamaan vaikuttavan realismin, siinä ilmenee jatkuvia epäjohdonmukaisuuksia, jotka liittyvät globaalin perspektiivin renderöintiin, varjojen luomiseen ja erityisesti heijastettujen objektien renderöintiin.
Tutkimusraportti toteaa:
‘[Geometriset] rakenteet, heittämät varjot ja heijastukset peilipinnoissa eivät ole täysin yhdenmukaisia luonnollisten kohtauksien odotetun perspektiivigeometrian kanssa. Geometriset rakenteet ja varjot ovat yleensä paikallisesti yhdenmukaisia, mutta globaalisti yhdenmukaisia.
‘Heijastukset, toisaalta, ovat usein esitettyä epätodellisesti, luultavasti, koska niitä on vähemmän koulutuskuva-aineistossa.’

DALL-E 2 -kuvan renderöinti, jossa on epäjohdonmukainen yhteys renderöidyn olion ja sen heijastuksen välillä, on tällä hetkellä luotettava tapa havaita DALL-E 2 -kuva, kuten uudessa tutkimuksessa todetaan. Lähde: https://arxiv.org/pdf/2206.14617.pdf
Tutkimus edustaa varhaisen yrityksen alalla, josta voi tulevaisuudessa tulla merkittävä suuntaus kuvansynteesin tutkimuksessa – kuvansynteesin havaitseminen.
Deepfaken kehittymisen jälkeen vuonna 2017 deepfaken havaitseminen (pääasiassa autoencoder -tuotosta, kuten DeepFaceLab ja FaceSwap) on muodostunut aktiiviseksi ja kilpailukkyväksi akateemiseksi suunnaksi, jossa on useita tutkimuksia ja menetelmiä, jotka kohdistuvat syntetisoitujen kasvojen “merkkejä” todellisissa videoklippeissä.
Kuitenkin vasta äskettäin kehittyneiden hyperskaalaisen koulutuksen kuvageneraattorijärjestelmien myötä tekstiprompttijärjestelmien, kuten CLIP, tuottama data ei ole aiheuttanut uhkaa “valokuvarealismille”. Tutkimuksen tekijät uskovat, että tämä on muuttumassa, ja että heidän löytämänsä epäjohdonmukaisuudet DALL-E 2 -tuotoksissa eivät välttämättä merkitse paljonkaan tuotoksiensa potentiaalille hämätä katsojia.
Tutkijat toteavat:
‘[Nämä] epäonnistumiset eivät välttämättä merkitse paljonkaan ihmisen visuaalijärjestelmälle, joka on osoittautunut yllättävän kyvyttömäksi tekemään tiettyjä geometrisiä arvioita, kuten valaistuksen, varjojen, heijastusten, katselukohdan ja perspektiivin vääristymisen.
Kadonneiden uskottavuuden havaitseminen
Tutkijoiden ensimmäinen DALL-E 2 -tuotosten tarkastelu liittyy perspektiiviprojektiota – tapaa, jolla lähellä olevien objektien suorien reunojen ja tekstuurien on oltava yhdenmukaisia “katoamispisteessä”.

Vasemmalla, samalla tasolla olevat suorat reunat ovat yhdenmukaisia yhdessä katoamispisteessä; oikealla, useat katoamispisteet samalla ja rinnakkaisilla tasolla määrittävät katoamislinjan (punainen).
Tutkijat käyttivät DALL-E 2:ta luomaan 25 syntetisoitua kuvaa keittiöistä – tutusta tilasta, joka on usein riittävän pieni tarjoamaan useita mahdollisia katoamispisteitä eri objekteille ja tekstureille.
Tutkijat huomasivat, että vaikka jokainen kuva oli yleisesti vakuuttava, niissä ei ollut oikein suppeita katoamispisteitä.

Tutkijat toteavat, että vaikka jokainen suora reuna tiilikuviosta on yhdenmukainen ja leikkaa toisensa yhdessä katoamispisteessä (sininen kuvassa), katoamispiste vastaavan tasoa (syan) ei vastaa katoamislinjoja (punainen) eikä tiilien katoamispistettä.

Tutkijat huomauttavat, että vaikka vastaava taso ei välttämättä ollut tiilien kanssa samaa tasoa, syan-värisen katoamispisteen olisi pitänyt olla (punaisen) katoamislinjan mukainen, joka määritellään lattian tiilien katoamispisteillä.
Tutkimusraportti toteaa:
‘Vaikka näiden kuvien perspektiivi on – vaikuttavasti – paikallisesti yhdenmukainen, se ei ole globaalisti yhdenmukainen. Tämä sama malli havaittiin jokaisessa 25 syntetisoidussa keittiökuvasa.
Varjojen forensiikka
Kuten kaikki, jotka ovat kosketuksissa ray-tracingin kanssa, tietävät, myös varjot voivat olla yksittäisen tai useamman valonlähteen kohdistumispisteitä. Ulkoisissa varjoissa, kuten auringonpaisteessa, odotetaan, että varjot ympäri kuvaa ovat yhdenmukaisia yhden valonlähteen (aurinko) suhteen.
Tutkijat loivat 25 DALL-E 2 -kuvaa, joissa oli kolme kuutioita jalankulkijan kävelytiellä, valokuvattuna aurinkoisena päivänä, sekä 25 kuvaa, joissa kolme kuutioita jalankulkijan kävelytiellä, valokuvattuna pilvisenä päivänä.

Ylärivillä kuvat, jotka on luotu tutkijoiden ohjeella “kolme kuutioita jalankulkijan kävelytiellä, valokuvattuna pilvisenä päivänä”; alarivillä kuvat, jotka on luotu ohjeella “kolme kuutioita jalankulkijan kävelytiellä, valokuvattuna aurinkoisena päivänä”.
Tutkijat huomauttavat, että pilvisissä olosuhteissa DALL-E 2 pystyy tuottamaan vakuuttavan ja uskottavan varjon, joka liittyy tähän tyyppiseen valaistukseen, luultavasti, koska tällainen varjo on todennäköisesti yleisempi koulutuskuva-aineistossa.
Kuitenkin joissakin “aurinkoisista” valokuvista tutkijat löysivät epäjohdonmukaisuuksia yhden valonlähteen kanssa.

Edellä olevassa kuvassa generoitu on muunnettu harmaasävyiseksi selkeyden vuoksi, ja jokainen objekti on varustettu omalla “aurinkonsa”.
Vaikka keskivertokatsoja ei välttämättä huomaa tällaisia anomaliatuotteita, joissakin generoituissa kuvissa oli ilmeisempiä “varjon epäonnistumisia”:

Heijastukset DALL-E 2:ssa
Eniten kritiikkiä herättävät tulokset forensisen analyysin kannalta saatiin, kun tutkijat testasivat DALL-E 2:n kykyä luoda erittäin heijastavia pinnoja, joka on myös raskas laskenta perinteisissä renderöintialgoritmeissa.
Tutkijat loivat 25 DALL-E 2 -kuvaa, joissa oli leludinosaurus ja sen heijastus peilissä.
Kaikissa tapauksissa tutkijat ilmoittivat, että peilin kuva renderöidystä leludinosauruksesta oli jollakin tavoin irrotettu “oikean” dinosauruksen ulkonäöstä ja asennosta. Tutkijat toteavat, että ongelma oli vastustuskykyinen muutoksille tekstipromptissa, ja näyttää olevan perimmäinen heikkous järjestelmässä.
Näyttää olevan jokin logiikka joissakin virheissä – ensimmäinen ja kolmas esimerkki ylärivillä näyttävät osoittavan dinosauruksen, joka on duplisoitu hyvin, mutta ei peilattu.
Tutkijat toteavat:
‘Toisin kuin heittämät varjot ja geometriset rakenteet edellisissä osioissa, DALL·E-2 kamppailee uskottavien heijastusten syntetisoinnissa, luultavasti, koska tällaiset heijastukset ovat vähemmän yleisiä sen koulutuskuva-aineistossa.’
Tällaiset virheet saattavat olla korjattavissa tulevaisuuden teksti-kuvamuunnosmallissa, jotka pystyvät tarkastamaan tehokkaammin tuotoksensa yleisen semanttisen logiikan ja joissa voidaan asettaa abstraktit fyysiset säännöt kohtauksiin, jotka on kootettu sanapohjaisista piirteistä järjestelmän latenttiavaruudessa.
Tutkijat toteavat:
‘[Se] saattaa olla vain ajan kysymys, ennen kuin maalaukselliset teksti-kuvamuunnosmoottorit oppivat renderöimään kuvia, joissa on täysin perspektiivinen johdonmukaisuus. Siihen asti geometriset forensiset analyysit saattavat osoittautua hyödyllisiksi näiden kuvien analyysissä.’
* Minun muunnos kirjoittajien sisäisistä viittauksista hyperlinkkeihin.
Julkaistu ensimmäisen kerran 30. kesäkuuta 2022.













