AI-mallit ja alustat

SHOW-O: Yhdistetty muuntaja, joka yhdistää monimodaalisen ymmärtämisen ja luomisen

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Merkitsevät edistysaskelet suurissa kielimalleissa (LLM) ovat innoittaneet monimodaalisten suurten kielimallien (MLLM) kehittämistä. Varhaiset MLLM-yritykset, kuten LLaVA, MiniGPT-4 ja InstructBLIP, osoittavat merkittäviä monimodaalisia ymmärtämiskykyjä. LLMien integroimiseksi monimodaalisiin aloihin nämä tutkimukset tutkivat ominaisuuksien projisointia esivalmistellusta modaalikohtaisesta kooderista, kuten CLIP, LLMien syötetilaan, mahdollistaen monimodaalisen ymmärtämisen ja päättelyn transformer-rungossa. Vaikka MLLM: lle on useita suunnitteluvaihtoehtoja, kuten näkökohtaiset kooderit, ominaisuusjärjestelmän sovittimet ja tietokannat, useimpien näiden mallien koulutus noudattaa autoregressiivisen luomisen paradigman, joka on osoittautunut tehokkaaksi tekstin luomisessa LLM: ssä. Vaikka nämä mallit ovat vahvoja monimodaalisia ymmärtämiskykyjä, ne keskittyvät pääasiassa visuaaliseen havainnointiin ja puuttuvat monimodaalisen ulostulon luomisesta tekstin ulkopuolella.

Transformer-mallit ovat osoittaneet suurta menestystä autoregressiivisessa mallinnuksessa luonnollisen kielen prosessoinnissa. Inspiroituneena tästä edistyksestä aiemmat tutkimukset ovat soveltaneet suoraan samaa autoregressiivista mallinnusta oppiakseen kuvapikseleiden riippuvuuden kuvan ja videon luomiseksi. Esimerkiksi VideoPoet käyttää dekooderi-vain transformer-rakennetta syntetisoidakseen korkealaatuisia videoita monimodaalisista syötteistä. Viimeaikaisemmin LlamaGen on osoittanut, että suuren kielimallin arkkitehtuuri, kuten Llama, voi autoregressiivisesti mallintaa kuvatokeneja, saavuttaen kohtuullisen suorituskyvyn luokka-ehdon mukaisessa kuvan luomisessa.

Tässä artikkelissa tarkastelemme Show-O: ta, yhdistettyä transformeria, joka yhdistää monimodaalisen ymmärtämisen ja luomisen. Toisin kuin täysin autoregressiiviset mallit, Show-O yhdistää autoregressiivisen ja diskreetin diffuusiomallinnuksen sopeutumaan syötteiden ja tulosteen eri ja sekoittuneiden modaalien käsittelyyn. Yhdistetty malli tukee joustavasti laajaa valikoimaa visio-kieli-tehtäviä, mukaan lukien visuaalinen kysymyksen vastaus, tekstin kuvaksi muuttaminen, tekstin ohjaama täydentäminen / extrapolointi ja sekoitetun modaalisen luominen. Erilaisilla vertailuilla Show-O osoittaa vertailukelpoisen tai paremman suorituskyvyn kuin olemassa olevat yksittäiset mallit, joilla on vastaava tai suurempi määrä parametreja, korostaen sen potentiaalia seuraavan sukupolven perusmallina.

Tässä kehyksessä malli on tehtävänä ennustaa gaussian noise, joka on lisätty jatkuviin latenttiesityksiin. Toisaalta mallit, kuten D3PM, Mask-predict, ARDM ja MaskGIT, käyttävät diskreettiä korruptioprosessia vaihtoehtona gaussian diffuusiolle. Nimenomaan kuva esitetään kuvatokenien jono, joista jokainen on liitetty kategoriaan. Token-kohtainen jakauma muunnetaan yhdenmukaiseksi jakaumaksi stokastisen otantaprosessin kautta. Koulutuksen aikana osa näistä tokenista on satunnaisesti maskattu, ja malli on koulutettu ennustamaan maskattujen tokenien alkuperäiset arvot. Tässä työssä Show-O ottaa käyttöön diskreetin diffuusiomallinnuksen visuaalisen luomisen mallintamiseksi.

SHOW-O: Yhdistetty muuntaja monimodaalisen ymmärtämisen ja luomisen yhdistämiseksi

Viime vuosina on tapahtunut merkittäviä edistysaskeleita monimodaalisen älymystön kahdessa pilarissa: ymmärtämisessä ja luomisessa. Monimodaalisen ymmärtämisen osalta Monimodaaliset suuret kielimallit (MLLM), kuten LLaVA, osoittavat poikkeuksellisia kykyjä visio-kieli-tehtävissä, kuten visuaalisessa kysymyksen vastauksessa (VQA). Visuaalisen luomisen osalta denoising diffuusioprobabilistiset mallit (DDPM) ovat mullistaneet perinteiset luomismallit ja saavuttaneet ennennäkemättömän suorituskyvyn tekstin kuvaksi muuttamisessa ja videon luomisessa.

Näiden saavutusten perusteella on luonnollista tutkia näiden kahden eri alan yhdistämisen potentiaalia. Viimeaikaiset tutkimukset ovat yrittäneet koota asiantuntijamalleja näistä kahdesta eri alasta yhdistetyksi järjestelmäksi, joka voi käsitellä sekä monimodaalista ymmärtämistä että luomista. Kuitenkin olemassa olevat yritykset usein käyttävät erillisiä malleja ymmärtämiseen ja luomiseen. Esimerkiksi NExT-GPT käyttää peruskielimallia monimodaaliselle ymmärtämiselle, mutta vaatii lisäksi esikoulutetun diffuusiomallin kuvan luomiseen. Tämä herättää kysymyksen: voiko yksittäinen transformer käsitellä sekä monimodaalista ymmärtämistä että luomista?

Viimeaikaisesti Chameleon on osoittanut, että tämä on mahdollista. Nimenomaan Chameleon mahdollistaa eri modaalien yhdistämisen sekä tekstin että kuvan tokenien luomiseen autoregressiivisen mallinnuksen kautta. Vaikka on järkevää mallintaa tekstin tokenia autoregressiivisesti, ei ole selvää, onko kuvapiirrosten tai pikselien mallintaminen samalla tavalla optimaalista. Kuvan autoregressiivisen ennustamisen avainpullonkaula on suuri määrä otantavaiheita, erityisesti korkearesoluutioisissa kuvissa. Jatkuva diffuusiomallit ovat osoittaneet parempaa suorituskykyä visuaalisessa luomisessa kuin autoregressiiviset mallit.

Tämä johtaa meidät tutkimaan, voitaisiinko yksittäinen transformer yhdistää sekä autoregressiivisen että diffuusiomallinnuksen. Show-O näkee uuden paradigman, jossa teksti esitetään diskreetteinä tokenina ja mallinnetaan autoregressiivisesti, kun taas jatkuva kuvapikseli mallinnetaan denoising diffuusion avulla. Kuitenkin näiden kahden eri tekniikan yhdistäminen yhteen verkkoon on epätriviaali johtuen teksti- ja kuvatodennäköisyyden eroista. Diffuusiomallit usein riippuvat kahdesta eri mallista: tekstin kooderista ja denoising-verkosta.

Tätä varten Show-O esittää uuden yhdistetyn mallin, joka voi käsitellä sekä monimodaalista ymmärtämistä että luomista tehtäviä yhdistämällä autoregressiivisen ja diffuusiomallinnuksen. Show-O perustuu esikoulutettuun LLM:ään ja hyödyntää sen autoregressiivista mallinnuskykyä tekstin perusteella. Inspiroituneena aiemmista tutkimuksista Show-O käyttää diskreettiä denoising-diffuusiota kuvatokenien mallintamiseen jatkuvaan esitystapaan. Lisäksi Show-O sisäänrakentaa tekstin ehdollisen tiedon, poistaa tarpeen lisäksi tekstin kooderille. Käyttämällä tekstin ja kuvan tokenoijia Show-O voi käsitellä monimuotoista syötettä ja tehtäviä, antaen vastauksia autoregressiivisesti visio-kieli-tehtäville ja luoden kuvia diskreetin denoising-diffuusion avulla.

Show-O osoittaa vertailukelpoisen tai jopa paremman suorituskyvyn kuin yksittäiset mallit, joilla on vastaava tai suurempi määrä parametreja, useilla vertailuilla. Toisin kuin autoregressiivinen kuvan luominen, Show-O: n kehys vaatii noin 20 kertaa vähemmän otantavaiheita, mikä tekee siitä luonnostaan nopeamman. Lisäksi Show-O: n kehys tukee alihankkijoita, kuten tekstin ohjaama täydentäminen ja extrapolointi, ilman uudelleenkoulutusta, kuten seuraavassa kuvassa näkyy. 

Show-O: lla on myös potentiaalia sekoitetun modaalisen luomiselle, kuten esimerkiksi videon avainkehyksen luominen tekstin kuvausten kanssa, ja se näyttää lupaavaa pitkän videon luomiselle. Lisäksi Show-O: n kehys tutkii diskreetin ja jatkuvaan kuvan esitysten vaikutusta monimodaaliseen ymmärtämiseen, tarjoten näkemyksiä tulevien yhdistetyn mallin suunnittelulle.

Seuraava kuva esittää vertailun mallin ominaisuuksien välillä Show-O: n kehyksen ja olemassa olevien menetelmien välillä eri aloilla. Show-O: erottuu yhdistetyn mallina, joka yhdistää edistyneitä tekniikoita sekä monimodaalisen ymmärtämisen että luomisen. 

Yhteenvetona tämän tutkimuksen pääsaavutukset ovat seuraavat:

  • Show-O on yhdistetty malli, joka yhdistää monimodaalisen ymmärtämisen ja luomisen yhden transformerin avulla.
  • Show-O yhdistää autoregressiivisen ja diskreetin diffuusiomallinnuksen yhden transformerin, käsitellen sekä tekstiä että kuvia tehokkaasti.
  • Show-O: n kehys suoriutuu vertailukelpoisesti tai paremmin kuin yksittäiset vertailumallit, joilla on vastaava tai suurempi määrä parametreja, monimodaalisen ymmärtämisen ja luomisen vertailuilla.
  • Show-O tukee alihankkijoita, kuten tekstin ohjaama täydentäminen ja extrapolointi, ilman uudelleenkoulutusta, ja osoittaa potentiaalia sekoitetun modaalisen luomiselle.
  • Show-O tutkii eri esitystyyppien vaikutusta, tarjoten arvokkaita näkemyksiä monimodaalisen ymmärtämisen parantamiseksi yhdistetyissä malleissa.

Viime vuosina on ollut kasvava määrä tutkimuksia, jotka ovat keskittyneet yhdistettyihin monimodaalisiin kielimalleihin, joilla on sekä ymmärtämisen että luomisen kyky. Jotkut tutkimukset käyttävät jatkuvia kuvan esityksiä, joita yhdistetään tekstin tokenien kanssa autoregressiiviseen mallinnukseen kuvan luomiseksi. SEED-X esittää yhdistetyn ja monipuolisen perusjärjestelmän, joka voi käsitellä sekä monimodaalista ymmärtämistä että luomista. Tässä lähestymistavassa jatkuva kuvan esitys yhdistetään tekstin tokenien kanssa ja syötetään suurelle kielimallille (LLM) seuraavan sanan ennustamiseksi ja kuvan esityksen regressioksi. Chameleon esittää tokenipohjaisen sekoitetun mallin perheen, joka voi sekä ymmärtää että luoda kuvia. Tässä lähestymistavassa kaikki modaaliset esitetään diskreetteinä tokenina, ja yhdistetty transformer-pohjainen arkkitehtuuri koulutetaan alusta alkaen loppuun asti. Vertailussa Show-O: kin ottaa käyttöön diskreettejä tokenien esityksiä kaikille modaalisille, mutta käyttää diskreettiä diffuusioprosessia autoregressiivisen mallinnuksen sijaan visuaalisen luomisen.

SHOW-O: Metodologia ja arkkitehtuuri

Show-O: n kehyksen tärkein tavoite on kehittää yhdistetty malli, joka yhdistää autoregressiivisen ja diffuusiomallinnuksen monimodaalisen ymmärtämisen ja luomisen yhdistämiseksi. Tällaisen yhdistetyn mallin kehittäminen asettaa merkittäviä haasteita, ja keskeiset ongelmat liittyvät seuraaviin: i) määrittely mallin syöte- ja tulostilaan; ii) eri modaalisista tietoja yhdistäminen; iii) autoregressiivisen ja diffuusiomallinnuksen yhdistäminen yhteen transformeriin; ja iv) yhdistetyn mallin tehokas koulutus.

Show-O vastaa näihin haasteisiin seuraavilla ratkaisuilla:

  • Show-O rakentaa syöte- ja tulostilan tokenoimalla tekstin ja kuvan tiedot diskreeteiksi tokeneiksi.
  • Show-O esittää oletusarkkitehtuurin ja yhdistetyn ohjausstrategian syötteen ja modaalisuuden järjestämiseksi.
  • Show-O osoittaa, miten autoregressiivista ja diffuusiomallinnusta voidaan yhdistää yhteen transformeriin.
  • Show-O esittää kolmivaiheisen koulutusputken yhdistetyn mallin tehokkaaseen koulutukseen.

Tokenisointi

Koska ehdotettu Show-O perustuu esikoulutettuihin LLM:ään, on luonnollista suorittaa yhdistetty oppiminen diskreetissä tilassa. Ylläpitämällä yhdistettyä sanastoa, joka sisältää sekä tekstin että kuvan tokenit, Show-O on vastuussa samasta oppimistavoitteesta: diskreettisten tokenien ennustaminen.

Tekstin tokenisointi

Show-O perustuu esikoulutettuun LLM:ään, ja sama tokenoija käytetään tekstin tokenisoinnissa ilman muutoksia.

Kuvan tokenisointi

MAGVIT-v2: n mukaisesti Show-O kouluttaa etsintävapautta 35 miljoonan kuvan aineistolla. Kvanttori ylläpitää 8 192:n kokoista koodikirjaa ja koodaa 256×256-resoluution kuvat 16×16 diskreeteiksi tokeneiksi. MAGVIT-v2 on valittu helposti mukautettavuutensa vuoksi, mikä tekee siitä soveltuvan myös videon tokenoijaksi, jolla on aikaisempi pakkauskyky, jonka Show-O aikoo tutkia tulevaisuudessa. Vaihtoehtoinen lähestymistapa on käyttää eri tokenoijia ymmärtämiseen ja luomiseen. Inspiroituneena aiemmista tutkimuksista Show-O ottaa myös jatkuva kuvan esityksiä esikoulutetusta MAGVIT-v2: sta ja CLIP-ViT-kooderista tutkimaan parannuksia monimodaalisen ymmärtämiskyvyn.

Arkkitehtuuri

Show-O perii olemassa olevien LLM:ien arkkitehtuurin ilman arkkitehtuurin muutoksia, paitsi että jokaiseen huomioon otettavaan kerrokseen on lisätty QK-Norm-operaatio. Show-O on alkuun esikoulutetun LLM:än painoina ja laajentaa upotuskerroksen kokoja ottamalla 8 192 uutta opittavaa upotusta diskreeteille kuvatokeneille. Toisin kuin valmistuneet diffuusiomallit, jotka vaativat lisäksi tekstin kooderin, Show-O sisäänrakentaa tekstin ehdollisen tiedon tekstin-kuvan luomiseksi.

Yhdistetty ohjaus 

Yhdistetyn oppimisen suorittamiseksi monimodaalisen ymmärtämisen ja luomisen, Show-O käyttää yhdistettyä ohjausstrategiaa syötteen ja modaalisuuden järjestämiseksi. Kun on kuvan ja tekstin pari (x, y), se on ensin tokenisoitu M kuvatokeneiksi ja N tekstin tokeneiksi kuvan ja tekstin tokenoijien avulla. Tokenit muodostetaan syötesarjaksi tehtävän tyypin mukaan, kuten seuraavassa kuvassa näkyy. 

Käyttämällä tätä ohjausmuotoa Show-O voi tehokkaasti koodata erilaisia syötteitä monimodaalisen ymmärtämisen, tekstin-kuvan luomisen ja sekoitetun modaalisen luomisen sekä peräkkäisiä tietoja. Tämä asettelu mahdollistaa yhdistetyn oppimisen toimimisen sujuvasti eri tehtävien sekä peräkkäisten tietojen yli. Kun Show-O on koulutettu, se voidaan ohjata käsittelemään laajaa valikoimaa visio-kieli-tehtäviä, mukaan lukien visuaalinen kysymyksen vastaus ja tekstin-kuvan luominen.

Omni-huomio 

Toisin kuin olemassa olevat työt, jotka mallintavat peräkkäisiä signaaleja autoregressiivisesti, Show-O esittää omni-huomio-mekanismin, joka mahdollistaa eri signaaleja eri tavoilla. Tämä kattava huomio-mekanismi kykenee vaihtamaan kausaalisen ja täydellisen huomion peräkkäisen syötteen muodon perusteella. Seuraava kuva esittää omni-huomion esimerkkejä eri syötesarjoille.

Nimenomaan Show-O käsittelee tekstin tokenit sarjassa kausaalisella huomiolla, kun taas kuvatokenit käsitellään täydellä huomiolla, jolloin jokainen token voi tehokkaasti vuorovaikuttaa kaikkien muiden kanssa. Monimodaalisen ymmärtämisen osalta tekstin tokenit voivat huomioida kaikki edelliset kuvatokenit, kun taas tekstin-kuvan luomisessa kuvatokenit voivat vuorovaikuttaa kaikkien edeltävien tekstin tokenien kanssa. Omni-huomio säilyttää tekstin päättelytiedon esikoulutetusta LLM:stä ja parantaa kuvan luomisen tehokkuutta vähentämällä otantavaiheita. Lisäksi se tukee eri sovelluksia, kuten täydentämistä ja extrapolointia, ilman uudelleenkoulutusta. Kun syötetään vain tekstin tokenit, mekanismi oletusarvoisesti kausaaliseen huomioon.

SHOW-O: Kokeet ja tulokset

Seuraava taulukko esittää Show-O: n monimodaalisen ymmärtämiskyvyn julkisilla vertailuilla, kuten kuvan kuvaus- ja visuaalisen kysymyksen vastaus-tehtävillä. 

Nykyinen Show-O on rakennettu Phi-1.5: lle, ja siten Show-O: n ymmärtäminen vastaava, LLaVA-v1.5-Phi-1.5, toimii suoraan vertailukohtana. Show-O osoittaa vertailukelpoisen suorituskyvyn kaikissa arviointimittareissa vertailukohdassa LLaVA-v1.5-Phi-1.5, joka on omistettu yksinomaan monimodaalisen ymmärtämiseen. Tämä osoittaa Show-O: n suuren potentiaalin yhdistää monimodaalisen ymmärtämisen ja luomisen yhteen transformerissa. Kun verrataan ymmärtämiseen erikoistuneisiin malleihin, kuten InstructBLIP, Qwen-VL-Chat ja mPLUG-Owl2, Show-O, jolla on paljon pienempi mallikoko, saavuttaa kilpailukykyisen suorituskyvyn POPE-, MME-, Flickr30k- ja VQAv2-vertailuilla, ja suorittaa paremmin GQA-vertailulla. Kun verrataan yhdistettyihin malleihin, joilla on merkittävästi enemmän parametreja, kuten NExT-GPT-13B ja Chameleon-34B, Show-O saavuttaa vahvan suorituskyvyn Flickr30k-vertailulla ja suorittaa paljon paremmin VQAv2-vertailulla.

Näiden lupaavien tuloksien perusteella Show-O on nähtävissä potentiaalisena seuraavan sukupolven perusmallina yhdistämään ymmärtämisen ja luomisen. Näiden tuloksien osoittaa myös Show-O: n skaalautumismahdollisuuksia saavuttaa valmistuneiden tulokset.

Laadulliset vertailut

Esitämme laadulliset vertailut diffuusiopohjaisiin malleihin, kuten SDv1.5, SDXL, ja autoregressiiviseen malliin LlamaGen, sekä yhdistettyihin malleihin, kuten LWM ja SEED-X, kuten seuraavassa kuvassa näkyy. 

Show-O osoittaa kyvyn luoda realistisia kuvia, joiden sisältö on johdonmukainen sekä lyhyissä että pitkissä tekstin ohjauksissa. Vertailussa SDv1.5:een ja LlamaGeniin Show-O osoittaa parempaa visuaalista laatua ja vahvempaa kuvan ja tekstin yhteyttä. Esimerkiksi toisessa sarakkeessa sekä SDv1.5 että LlamaGen eivät täysin ymmärrä tekstin ohjausta ja puuttuvat ominaisuuksista, kuten “auringonlasku” ja “siniset kupolit”, luodussa kuvassa. Vertailussa SDXL:ään Show-O tarjoaa vertailukelpoisen visuaalisen laadun ja yhteyden, kuten esimerkeissä “ralliautojen kilpailu” ja “upea kontrasti vasten elävää auringonlaskua”. 

Tekstin ohjaama täydentäminen ja extrapolointi 

Show-O tukee luonnostaan tekstin ohjaamaa täydentämistä ja extrapolointia ilman uudelleenkoulutusta. Seuraava kuva esittää useita esimerkkejä. 

Kuvan yläosassa, kun syötetään syötekuvaa ja täydentämismaskia, Show-O voi muuttaa punaisen trolleysvaunun siniseksi urheiluautoksi, jossa on sujuvat kaaret ja tummennetut ikkunat, käyttäjän antamien tekstin ohjausten perusteella. Show-O voi myös extrapoloida alkuperäisen kuvan vaakasuunnassa tai pystysuunnassa annettujen tekstin ohjausten perusteella. Esimerkiksi toisessa rivissä Show-O extrapoloi kuvaa lisäämällä uusia esineitä, kuten “punaisia villikukkia”. Pikselit sekä täydennetyissä että extrapoloiduissa alueissa ovat yhdenmukaisia alkuperäisen kuvan kanssa. Nämä esimerkit osoittavat selvästi Show-O: n sisäiset edut autoregressiivisiin malleihin nähden alihankkeissa.

Lopputajat

Tässä artikkelissa olemme puhuneet Show-O: sta, yhdistetystä transformerista, joka yhdistää monimodaalisen ymmärtämisen ja luomisen. Toisin kuin täysin autoregressiiviset mallit, Show-O yhdistää autoregressiivisen ja diskreetin diffuusiomallinnuksen sopeutumaan syötteiden ja tulosteen eri ja sekoittuneiden modaalien käsittelyyn. Yhdistetty malli tukee joustavasti laajaa valikoimaa visio-kieli-tehtäviä, mukaan lukien visuaalinen kysymyksen vastaus, tekstin kuvaksi muuttaminen, tekstin ohjaama täydentäminen / extrapolointi ja sekoitetun modaalisen luominen. Erilaisilla vertailuilla Show-O osoittaa vertailukelpoisen tai paremman suorituskyvyn kuin olemassa olevat yksittäiset mallit, joilla on vastaava tai suurempi määrä parametreja, korostaen sen potentiaalia seuraavan sukupolven perusmallina. Tässä kehyksessä malli on tehtävänä ennustaa gaussian noise, joka on lisätty jatkuviin latenttiesityksiin. Toisaalta mallit, kuten D3PM, Mask-predict, ARDM ja MaskGIT, käyttävät diskreettiä korruptioprosessia vaihtoehtona gaussian diffuusiolle. Show-O on ensimmäinen, joka yhdistää autoregressiivisen ja diskreetin diffuusiomallinnuksen, mahdollistaen eri modaalisuuden käsittelyn eri tavoilla. Laajat kokeelliset tulokset osoittavat, että Show-O on vertailukelpoinen tai jopa parempi kuin yksittäiset asiantuntijamallit laajalla valikoimalla visio-kieli-tehtävillä. Tämä korostaa sen potentiaalia seuraavan sukupolven perusmallina.

Ammattina insinööri, sydämen vuoksi kirjailija. Kunal on tekninen kirjailija, jolla on syvä rakkaus ja ymmärrys AI: sta ja ML: stä, omistautunut yksinkertaistamaan monimutkaisia käsitteitä näissä aloissa hänen viihdyttävän ja informatiivisen dokumentaationsa kautta.