AI-mallit ja alustat

Osprey: Pikselitason Ymmärtäminen Visuaalisen Ohjausmallinnuksen Kautta

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Viimeaikaisen visuaalisen ohjausmallinnuksen menetelmien parantamisen myötä, monimodaliset suuret kielen mallit (MLLM) ovat osoittaneet merkittäviä yleispäteviä visuaalisen kielen ominaisuuksia. Nämä ominaisuudet tekevät niistä tärkeitä rakennuspalikoita modernille yleispäteville visuaalisille avustajille. Viimeaikaiset mallit, kuten MiniGPT-4, LLaVA, InstructBLIP ja muut, osoittavat vaikuttavia visuaalisen päättelyn ja ohjeiden seuraamisen kykyjä. Vaikka useimmat niistä riippuvat kuvatekstipareista kuvan tasolla visuaalisen kielen säätelyssä, ne suoriutuvat hyvin tässä alueessa. Kuitenkin niiden riippuvuus laatikko- ja kuvatasolla on pääsyy sille, että MLLM:t eivät pysty toistamaan suorituskykyään hienojakoisissa visuaalisen kielen säätelytehtävissä pikselitasolla. Lisäksi maskipohjaisen ohjeistuksen aineiston rajoitettu saatavuus koulutuksessa aiheuttaa haasteita MLLM:iin edelleen kehittämiseen.

Osprey on maski-teksti ohjausmallinnuksen menetelmä, jonka tavoitteena on laajentaa MLLM:iä. Se sisällyttää hienojakoiset maskitut alueet kielellisiin ohjeisiin saavuttaakseen pikselitasolla visuaalisen kielen ymmärtämisen. Tämän saavuttamiseksi Osprey-kehys kokoaa maskipohjaisen alue-teksti aineiston, jossa on yli 700 000 otosta. Se injektoi pikselitasoisen edustamisen suuriin kielimalleihin suunnittelemaan visuaalisen kielen mallia. Huomattavasti, Osprey-kehys ottaa käyttöön konvoluution perusteella olevan CLIP-mallin näkökohteena ja integroi maskitietoisen visuaalisen extractorin arkkitehtuuriinsa. Tämä mahdollistaa tarkan visuaalisen maskin ominaisuuksien poistamisen korkearesoluutioisista syötteistä.

Tässä artikkelissa tarkastelemme Osprey-kehystä ja syvennymme sen arkkitehtuuriin. Tarkastelemme myös kokoamaamme alue-teksti aineistoa, jossa on yli 700 000 otosta, ja vertailemme sen suorituskykyä erilaisissa alueen ymmärtämistehtävissä. Joten, aloitetaan.

Osprey: Pikselitason Ymmärtäminen Visuaalisen Ohjausmallinnuksen Kautta

Monimodaliset suuret kielen mallit, kuten MiniGPT-4, Otter, Qwen-LV, InstructBLIP ja muut, ovat edelläkävijöitä yleispätevien visuaalisten avustajien kehittämisessä, ja ne ovat tunnettuja poikkeuksellisista monimodalisista ja visuaalisista generoivista ominaisuuksistaan. Kuitenkin monimodaliset suuret kielen mallit kärsivät suuresta haasteesta, sillä ne antavat tyydyttämättömiä tuloksia hienojakoisissa kuvan ymmärtämistehtävissä, kuten kuvauksessa, alueen luokittelussa ja päättelyssä. Suureksi osaksi heikon suorituskyvyn syy hienojakoisissa kuvan ymmärtämistehtävissä on puute aluekohtaisesta säätelystä. Viimeaikaiset MLLM:t, kuten GPT4RoI, Shikra ja muut, pyrkivät mahdollistamaan aluekohtaisen ymmärtämisen visuaalisen kielen malleissa prosessoiden rajoittimella määritellyt alueet ja hyödyntäen visuaalista ohjausmallinnusta tila-ominaisuuksilla objektin tasolla.

Vaikka aluekohtaisen ymmärtämisen mahdollistamiseen tähtäävä lähestymistapa saattaa parantaa suorituskykyä, käyttäminen harvassa rajoittimessa määritellyistä alueista suoraan viittaamisalueena saattaa aiheuttaa epätarkkoja taustaan liittyviä ominaisuuksia, mikä johtaa virheelliseen alue-teksti parin säätelyyn visuaalisen ohjausmallinnuksessa suurissa kielimalleissa. Inferenssiprosessin aikana rajoittimen määrittely saattaa olla kykenemätön havaitsemaan ja edustamaan objektia tarkasti, mikä voi johtaa semanttiseen poikkeamaan, kuten seuraavassa kuvassa näkyy.

Vertailussa käyttäminen hienojakoisia maskeja karkeiden rajoittimien sijaan viittaamisalueena saattaa pystyä edustamaan objekteja tarkemmin. Viimeksi kehitetty SAM eli Segment Anything Model koulutetaan miljardeissa korkealaatuisissa maskeissa, osoittaa merkittävää segmentointilaatua nollasilmäobjekteissa ja tukee pisteiden tai yksinkertaisten rajoittimien käyttöä ohjeistuksena. Kuitenkin SAM-kehys ei voi generoida ensisijaisia semanttisia etikettejä eikä voi tarjota yksityiskohtaisia semanttisia kuvauksia ja attribuutteja. Tämän seurauksena olemassa olevat mallit puuttuvat sisäänrakennetusta monimodalisesta hienojakoisesta tiedosta ja ovat rajoittuneita ymmärtämään kohtauksia todellisessa maailmassa.

Osprey on uudenlainen maski-teksti ohjausmallinnuksen menetelmä, jonka tavoitteena on laajentaa monimodalisia suuria kielimalleja hienojakoiselle ymmärtämismenetelmälle pikselitasolla. Osprey esittelee maskitietoisen visuaalisen extractorin, joka havaitsee visuaalisia maskin ominaisuuksia tarkasti. Kehys sitten yhdistää visuaaliset ominaisuudet kielellisiin ohjeisiin generoimaan syötejonon suurelle kielimallille ja hyödyntää konvoluution perusteella olevaa CLIP-mallia mahdollistaakseen korkearesoluutioisen syötteen käytön. Osprey-kehys on kykeneväinen saavuttamaan hienojakoiset semanttiset ymmärtämisen objekti- ja osittaisalueilla ja tarjoaa yksityiskohtaiset objektiattribuutit yhdessä ensisijaisen objektiluokan ja monimutkaisten kohtauksien parannetuilla kuvauksilla.

Osprey: Menetelmä ja Arkkitehtuuri

Seuraava kuva osoittaa Osprey-kehysarkkitehtuuriin liittyvän yleiskatsauksen, joka koostuu suuresta kielimallista, pikselitasoista maskitietoista visuaalista extractorista ja kuvatasoista näkökohteesta.

Annetaan kuvaa, kielisyötettä ja viittaamisalueita, kehys suorittaa muunnoksen ja tokenisoinnin generoimaan upotukset ennen lähettämistä kielisyötejonon ja yhdistettyjen maskin ominaisuuksien suurelle kielimallille saadakseen hienojakoiset semanttiset ymmärtämisen.

konvoluution Perusteella Oleva CLIP Näkökohteiden Muokkaaja

Näkökohteiden muokkaaja, jota käytetään useimmissa monimodalisissa suurissa kielimalleissa, on esitetty ViT-pohjaisella CLIP-mallilla. Tämän seurauksena kehys ottaa käyttöön kuvaresoluution, joka on joko 224×224 pikseliä tai 336 x 336 pikseliä. Kuitenkin ViT-pohjaisen CLIP-mallin käyttäminen tekee vaikeaksi mallille saavuttaa hienojakoinen kuvan ymmärtäminen pikselitasolla, ongelmaa, jota voidaan vahvistaa edelleen pienillä alueilla. Lisäksi ViT-arkkitehtuuriin liittyvä laskennallinen kuormitus estää mahdollisuuden lisätä syötekuvan resoluutiota.

Haasteen ratkaisemiseksi Osprey-kehys toteuttaa konvoluution perusteella olevan CLIP-mallin näkökohteena arkkitehtuurissaan. Perinteisesti konvoluution perusteella olevat CLIP-mallit ovat osoittaneet merkittäviä yleistymiskykyjä eri syöteresoluutioissa verrattuna visiotransformatoripohjaisiin CLIP-malleihin. Konvoluution perusteella olevan CLIP-mallin toteuttaminen mahdollistaa nopean inferenssin ja tehokkaan koulutuksen ilman kompromisseja mallin suorituskyvystä. Lisäksi konvoluution perusteella oleva CLIP-malli pystyy generoimaan moniskaalaisia ominaisuuskarttoja, joita kehys käyttää suoraan ominaisuuden poistamiseen jokaisessa seuraavassa objektialueessa.

Maskitietoinen Visuaalinen Extractor

Toisin kuin olemassa olevat aluepohjaiset mallit, jotka käyttävät harvassa rajoittimia viittaamisalueena, Osprey-kehys käyttää yksityiskohtaisia maskialueita objektipohjaisiin edustamisiin. Osprey-malli käyttää maskitietoista visuaalista extractor-komponenttia havaitsemaan pikselitasoisen ominaisuuden jokaisessa objektialueessa. Maskitietoinen visuaalinen extractor-komponentti koodaa maskitasoisen visuaalisen ominaisuuden ja kerää myös jokaisen alueen paikannusinformaation.

Tämän toteuttamiseksi Osprey käyttää monitasoista kuvaoiminaisuuksia, jotka on generoitu näkökohteella, ja soveltaa maskipoolausoperaatiota, ja jokaiselle yksittäiselle tasolle, kehys poolaa kaikki ominaisuudet, jotka sijaitsevat maskialueella. Malli koodaa ominaisuudet eri kerroksilla ohjaamalla jokaisen ominaisuuden lineaarisen projektiokerroksen kautta, joka generoi aluekohtaiset upotukset, ja yhdistää monitasoiset ominaisuudet summalla. Malli käyttää myös MLP-kerrosta generoimaan visuaalisen maskitokenin. Lisäksi Osprey säilyttää objektialueen spatialisen geometrian koodaamalla pikselitasoisen paikkasuhteen binäärimaskin avulla jokaiselle objektialueelle. Lopulta Osprey sisällyttää visuaalisen maskitokenin ja sen vastaavan spatial tokenin jokaiselle maskialueen upotukselle.

LLM Tokenisointi

Kuten mainittiin aiemmin, malli havaitsee kuvatasoisen upotuksen kuvasta syöttämällä sen esikoulutetun konvoluution perusteella olevaan visuaaliseen encoderiin. Tekstuaalisessa informaatiota varten malli käyttää esikoulutettua LLM-tokenointia tokenisoidakseen tekstijonot, ja projektoi tokenisoidut tekstijonot tekstiupotuksiin. Maskipohjaisille alueille malli määrittää erityisen tokenin paikkaajaksi, ja korvaa sen spatial tokenin ja maskitokenin. Kun malli viittaa objektialueeseen tekstisyötteessä, se liittää paikkaajan sen jälkeen, mikä mahdollistaa maskialueiden sekoittamisen tekstin kanssa hyvin, tuloksena täydelliset lauseet ilman tokenisointitilaa. Lisäksi, ohjeiden lisäksi, malli sisällyttää etuliitteen, erityisen tokenin, joka toimii paikkaajana, joka korvataan näkökohteiden kuvatasoisen upotuksen avulla. Lopulta kehys yhdistää alue- ja kuvatasoisen visuaalisen tokenin teksti-tokenien kanssa ja syöttää sen suurelle kielimallille ymmärtämään käyttäjän ohjeet ja kuvan eri alueilla objektissa.

Osprey: Kolme Vaihetta Koulutusprosessi

Osprey-kehys käyttää kolmea vaihetta koulutusprosessissa, jossa jokainen koulutusvaihe on valvottu minimoiden seuraavan tokenin ennustusvirhettä.

Vaihe 1: Kuvateksti Säätely Koulutus

Ensimmäisessä vaiheessa Osprey-kehys käyttää konvoluution perusteella olevaa CLIP-näkökohteen mallia kouluttaakseen kuvatasoisen ominaisuuden ja kielen yhdistäjän kouluttaakseen mallin kuvan ja tekstin ominaisuuksien säätelyyn. Ensimmäisessä vaiheessa kehys käyttää kolmea komponenttia: esikoulutettua suurta kielimallia, esikoulutettua näkökohteen mallia ja kuvatasoista projektoria. Kehys käyttää myös MLP-kerrosta toimimaan visuaalisen kielen yhdistäjänä, joka auttaa parantamaan Osprey:n monimodaalista generoivaa kykyä.

Vaihe 2: Maski-teksti Säätely Esikoulutus

Toisessa vaiheessa Osprey lataa painot, jotka on koulutettu ensimmäisessä vaiheessa, ja käyttää maskitietoista visuaalista extractor-komponenttia havaitsemaan pikselitasoisen alueen ominaisuuden. Toisessa vaiheessa kehys kouluttaa vain maskitietoista visuaalista extractor-komponenttia säätämään kielen upotuksia maskipohjaisiin alueen ominaisuuksiin. Lisäksi malli kerää pikselitasoisen maskiparin ja lyhyen tekstin osittais- ja julkisesti saatavilla olevista objektitasoisista aineistoista ja muuttaa ne ohjeiden seuraamiseen tarkoitetuksi aineistoksi kouluttaakseen mallia.

Vaihe 3: Loppuvaiheen Hienosäätö

Kolmannessa ja viimeisessä vaiheessa malli kiinnittää näkökohteen painot, ja hienosäätää suurta kielimallia, maskipohjaista alueen ominaisuuden extractor-komponenttia ja kuvatasoista projektoria komponentteja arkkitehtuurissaan. Ensivaiheen koulutuksen tärkein tavoite on laajentaa mallin kykyä seurata käyttäjän ohjeita tarkasti ja suorittaa pikselitasoisen alueen ymmärtämistehtäviä tehokkaasti.

Kolmen koulutusvaiheen toteuttamisen jälkeen Osprey-kehys on kykeneväinen ymmärtämään monimutkaisia skenaarioita, jotka on määritelty käyttäjän ohjeiden perusteella ja pikselitasoisten maskialueiden perusteella.

Osprey: Kokeelliset Tulokset

Arvioidakseen suorituskykyään, Osprey-kehys suorittaa laajan joukon kokeita osoittamaan mallin kykyjä luokittelussa, pikselitasoisen alueen tunnistamisessa ja monimutkaisten kuvauksissa.

Avoin Sanastoon Perustuva Segmentointi

Avoin sanastoon perustuvan segmentoinnin tärkein tavoite on generoida maskipohjaisen alueen tunnistaminen ja sen vastaava luokka eksplisiittisesti. Saavuttaakseen avoimen sanastoon perustuvan segmentoinnin, Osprey käyttää syöte-tekstiä, jota seuraa maailmanlaajuinen maskialueiden interferenssi arvioidakseen mallin suorituskykyä avoimen sanastoon perustuvissa tunnistustehtävissä. Perustuen monimodaliselle suurelle kielimallille generoituun lausevastaukseen, Osprey laskee semanttisen samankaltaisuuden sanastolistojen ja jokaisen aineiston tulosteen välillä. Seuraava kuva vertaa Osprey:tä nykyisiin monimodalisiiin suuriin kielimalleihin.

Kuten voidaan havaita, Osprey-kehys ylittää olemassa olevat menetelmät merkittävällä marginaalilla sekä Cityscapes- että ADE20K-150-aineistossa. Tulokset osoittavat Osprey:n kyvyn ylittää olemassa olevat lähestymistavat ja saavuttaa vankka ymmärtäminen ja tunnistaminen hienojakoisilla objektialueilla.

Viittaamisobjektin Luokittelu

Viittaamisobjektin luokittelutehtävässä malli on luokiteltava objekti tietyn alueen sisällä kuvassa. Arvioidakseen luokittelukykyään, Osprey-kehys käyttää kahta semanttista merkityksellisyyden mittaria, mukaan lukien semanttisen IoU (S-IoU) ja semanttisen samankaltaisuuden (SS). Semanttinen IoU edustaa sanastojen yhteensopimista maailmanlaajuisten ja ennustettujen luokitusluokkien välillä, kun taas semanttinen samankaltaisuus mittaa ennustettujen ja maailmanlaajuisten luokitusluokkien samankaltaisuutta semanttisessa tilassa. Seuraava kuva osoittaa Osprey:n suorituskyvyn viittaamisobjektin luokittelutehtävässä verrattuna malleihin, jotka käyttävät laatikko- ja kuvatasoista lähestymistapaa.

Yksityiskohtainen Alueen Kuvaus

Yksityiskohtaisessa alueen kuvaustehtävässä malli arvioi suorituskykyään ohjeiden seuraamisessa yksityiskohtaisissa kuvauksissa yhdessä muiden aluekohtaisilla lähestymistavoilla. Malli valitsee satunnaisesti syöte-inferenssipromptin ennalta määritellystä promptilistasta ja käyttää GPT-4 LLM-kehystä mittaakseen vastauksen laadun, joka on generoitu mallilla verrattuna viittaamisalueisiin. Käyttäen ohjeiden generoimisputkea, malli generoi kysymyksiä ja etsii GPT-4:n vastauksia, ja arvioi sitten semanttisen oikeellisuuden ja viittaamisalueen tarkkuuden. Seuraava taulukko osoittaa Osprey:n suorituskyvyn yksityiskohtaisissa alueen kuvaustehtävissä verrattuna nykyisiin malleihin.

Aluekohtainen Kuvauksen Luominen

Osprey-kehys ylittää myös nykyiset lähestymistavat aluekohtaisissa kuvauksen luomistehtävissä, tulokset sisältyvät seuraavaan kuvaan.

Loppupäätelmät

Tässä artikkelissa olemme keskustelleet Osprey:stä, maski-teksti ohjausmallinnuksen menetelmästä, jonka tavoitteena on laajentaa monimodalisia suuria kielimalleja hienojakoiselle ymmärtämismenetelmälle pikselitasolla. Osprey-kehys kokoaa maskipohjaisen alue-teksti aineiston, jossa on yli 700 000 otosta, ja injektoi pikselitasoisen edustamisen suuriin kielimalleihin suunnittelemaan visuaalisen kielen mallia. Osprey-kehys pyrkii parantamaan monimodalisia suuria kielimalleja hienojakoiselle visuaaliselle ymmärtämismenetelmälle merkittävästi, ja toteuttaa konvoluution perusteella olevan CLIP-mallin ja maskitietoisen visuaalisen extractorin, Osprey saavuttaa kyvyn ymmärtää kuvia sekä osittais- että objektitasolla.

Ammattina insinööri, sydämen vuoksi kirjailija. Kunal on tekninen kirjailija, jolla on syvä rakkaus ja ymmärrys AI: sta ja ML: stä, omistautunut yksinkertaistamaan monimutkaisia käsitteitä näissä aloissa hänen viihdyttävän ja informatiivisen dokumentaationsa kautta.