Andersonin kulma

DALL-E 2:n ainutlaatuinen ratkaisu kaksoismerkityksille

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Kuka tahansa, joka on opiskellut italiaa, oppii pian kiinnittämään huomiota kontekstiin, kun kuvaillaan luudan vastaavaa, koska italian kielen sana tälle jokapäiväiselle kotitalousvälineelle on erittäin epäsopiva toinen merkitys verbinä*. Vaikka opimme varhain erottamaan semanttisen kartan ja (sovellettavuuden) soveltamisen monimerkityksellisille sanoille, tämä ei ole taito, jota voidaan helposti välittää hyperskaalaisiin kuvansynteesijärjestelmiin, kuten DALL-E 2:een ja Stable Diffusioniin, koska ne perustuvat OpenAI:n Kontrastisen kieli- ja kuva-esikoulutusmoduuliin (CLIP), joka käsittelee objekteja ja niiden ominaisuuksia paljon löyhemmin (vaikka se saa yhä enemmän jalansijaa latenteissa diffuusiokuvan ja videon synteesitilassa.

Tutkimalla tätä puutetta, uusi tutkimusyhteistyö Bar-Ilanin yliopistosta ja Allenin tekoälyinstituutista tarjoaa laajan tutkimuksen siitä, kuinka paljon DALL-E 2 on altis tällaisille semanttisille virheille:

Kaksoismerkitykset jaetaan useisiin objekteihin DALL-E 2:ssa - vaikka mikä tahansa latenti diffuusiojärjestelmä voi tuottaa tällaisia esimerkkejä. Ylänurkassa olevassa kuvassa 'gold'-sanan poistaminen muuttaa kalalajia, kun taas 'zebra-ylitys'-tapauksessa on pakko mainita tien pinta, jotta kaksoisassosiaatio voidaan poistaa. Lähde: https://export.arxiv.org/pdf/2210.10606

Kaksoismerkitykset jaetaan useisiin tulkintoihin DALL-E 2:ssa – vaikka mikä tahansa latenti diffuusiojärjestelmä voi tuottaa tällaisia esimerkkejä. Ylänurkassa olevassa kuvassa ‘gold’-sanan poistaminen muuttaa kalalajia, kun taas ‘zebra-ylitys’-tapauksessa on pakko mainita tien pinta, jotta kaksoisassosiaatio voidaan poistaa. Lähde: https://export.arxiv.org/pdf/2210.10606

Kirjoittajat ovat havainneet, että tämä taipumus tulkita sanoja ja lauseita kaksoismerkityksellisesti näyttää olevan yleinen kaikille CLIP-ohjatuille diffuusiomalleille, ja se pahenee, kun malleja koulutetaan suuremmilla ja suuremmilla datamäärillä. Tutkimusraportti toteaa, että “vähennetyt” teksti-kuvamalleja, mukaan lukien DALL-E Mini (nykyään Craiyon), tuottavat näitä virheitä paljon harvemmin, ja että Stable Diffusion virheilee vähemmän – vaikka usein se ei seuraa ohjeistusta ollenkaan, mikä on toinenlainen virhe.

Yksinkertainen ohje 'date' pakottaa DALL-E 2:n kutsumaan kaksi sanaa useista merkityksistä, kun taas sana 'fan' jakautuu kahteen semanttiseen karttaan, ja kolmannessa kuvassa lause 'cone' muuttaa määrittelemättömän ruoan ohjeessa luonnollisesti jäädytettyksi, joka liittyy 'cone'-sanaan.

Yksinkertainen ohje ‘date’ pakottaa DALL-E 2:n kutsumaan kaksi sanaa useista merkityksistä, kun taas sana ‘fan’ jakautuu kahteen semanttiseen karttaan, ja kolmannessa kuvassa lause ‘cone’ muuttaa määrittelemättömän ruoan ohjeessa luonnollisesti jäädytettyksi, joka liittyy ‘cone’-sanaan.

Selittäessään, kuinka teemme tehokkaita leksikaalisen erottelua, tutkimusraportti toteaa:

‘Vaikka symbolit – sekä lauseen rakenteet – voivat olla epäselviä, kun tulkinta on muodostettu, tämä epäselvyys on jo ratkaistu. Esimerkiksi, kun symboli “bat” lentävässä “bat”:ssa voidaan tulkita joko puiseksi keppiksi tai eläimeksi, mahdolliset tulkinnat lauseesta ovat joko lentävä puinen keppi tai lentävä eläin, mutta ei kumpaakaan samaan aikaan. Kun sana “bat” on käytetty tulkinnassa merkitsemään objektia (esim. puista keppiä), sitä ei voida uudelleen käyttää merkitsemään toista objektia (eläintä) samassa tulkinnassa.’

DALL-E 2:ssa, tutkimusraportti toteaa, ei ole tämänkaltaista rajoitusta:

'Lentävä 'bat' ylittää baseball-stadionia' - ensimmäinen kuva on tutkimusraportista, muut kolme saatiin syöttämällä sama ohje DALL-E 2:een.

‘Lentävä ‘bat’ ylittää baseball-stadionia’ – ensimmäinen kuva on tutkimusraportista, muut kolme saatiin syöttämällä sama ohje DALL-E 2:een.

Tämä ominaisuus on nimetty resurssien herkkyydeksi.

Tutkimusraportti tunnistaa kolme poikkeavaa käyttäytymistä, joita DALL-E 2:ssa esiintyy: sana tai lause voidaan tulkita ja käytännössä jakaa kahteen erilliseen entiteettiin, jolloin objekti tai käsite renderöidään kummallekin samassa kohtauksessa; sana voidaan tulkita modifieriksi kahdelle eri entiteetille (ks. ‘goldfish’ ja muut edellä mainitut esimerkit); ja sana voidaan tulkita samanaikaisesti sekä modifieriksi että vaihtoehtoiseksi entiteetiksi – esimerkkinä ohje ‘a seal is opening a letter’:

'A seal is opening a letter' - ensimmäinen kuva on tutkimusraportista, kolme muuta ovat identtisiä reproduktioita DALL-E 2:sta. Alhaalla olevat fotorealistiset esimerkit sisälsivät lisäksi tekstin 'photo, Canon50, 85mm, F5.6, award-winning photo'.

‘A seal is opening a letter’ – ensimmäinen kuva on tutkimusraportista, kolme muuta ovat identtisiä reproduktioita DALL-E 2:sta. Alhaalla olevat fotorealistiset esimerkit sisälsivät lisäksi tekstin ‘photo, Canon50, 85mm, F5.6, award-winning photo’.

Tutkijat tunnistavat kaksi epäonnistumisen muotoa diffuusiomalleille tässä suhteessa: käyttäjän ohjeiden tulokset, joissa on merkityksellisiä sanoja, usein näyttävät konkreettisen sanan yhdessä jonkin käsitteen ilmentymän kanssa; ja käsitteen vuoto, jossa toisen objektin ominaisuudet “vuotavat” toiseen renderöityyn objektiin.

‘Ottaen kaiken huomioon, tutkimamme ilmiöt antavat näytön DALLE-2:n kielellisten taitojen rajoituksista ja avaavat tietä tuleville tutkimuksille, jotka selvittävät, johtuvatko nämä rajoitukset tekstien koodauksesta, generatiivisesta mallista vai molemmista. Laajemmin, ehdotettu lähestymistapa voidaan soveltaa muihin tilanteisiin, joissa dekoodausprosessia käytetään paljastamaan induktiivinen harha ja teksti-kuvamallien puutteet.’

Käyttämällä 17 sanaa, jotka aiheuttavat DALL-E 2:n jakamisen useisiin tuloksiin, tutkijat totesivat, että homonyymin moninkertaistuminen tapahtui yli 80 %:ssa 216:sta renderöidystä kuvasta.

Tutkijat käyttivät ärsykkeen-ohjauspareja tutkimaan, kuinka paljon tarkkaa ja kiistanalaisesti yliaikaisesti määriteltyä kieltä tarvitaan estämään nämä moninkertaistumiset. Entiteetin-ominaisuustesteissä luotiin 10 tällaista paria, ja tutkijat toteavat, että ärsykkeen-ohjeet herättävät jaetun ominaisuuden 92,5 %:ssa tapauksista, kun taas ohjausohje herättää sen vain 6,6 %:ssa tapauksista.

‘[T]o demonstrate, consider a zebra and a street, here, zebra is an entity, but it modifies street, and DALLE-2 onstantly generates crosswalks, possibly because of the zebra-stripes’ likeness to a crosswalk. And in line with our conjecture, the control a zebra and a gravel street specifies a type of street that typically does not have crosswalks, and indeed, all of our control samples for this prompt do not contain a crosswalk.’

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai