AI-mallit ja alustat
Ferret: Ylivoimainen suorituskyky viittaamis- ja perustamistehtävissä
Spatiaalisen ymmärryksen mahdollistaminen visuaalisen kielen oppimismalleissa on edelleen yksi keskeisistä haasteista tutkimuksessa. Tämä ymmärrys on välttämätöntä kahdelle tärkeälle kyvylle: viittaamiselle ja perustamiselle. Viittaaminen mahdollistaa mallin tarkkaan tulkitsemisen tiettyjen alueiden semantiikkaa, kun taas perustaminen edellyttää semanttisten kuvausten käyttämistä näiden alueiden lokalisoimiseen.
Kehittäjät ovat esittäneet Ferretin, monimodaalisen suuren kielen mallin (MLLM), joka pystyy ymmärtämään spatiaalista viittaamista minkä tahansa alueen kokoisena tai muotona kuvassa ja tarkasti perustamaan avoimen sanastoon perustuvia kuvauksia. Ferret käyttää uudenlaista hybridiesitystä, joka yhdistää jatkuvat visuaaliset ominaisuudet diskreettisiin koordinaatteihin edustamaan kuvan alueita. Sen spatiaalinen visuaalinen otin käsittelee muuttuvaa harvuutta muodoissa, mikä mahdollistaa sen käsittelemisen monimuotoisia alueita, kuten vapaamuotoisia muotoja, bounding boxeja ja pisteitä.
Ferretin lähestymistapa mahdollistaa sen menestyksen perinteisissä perustamis- ja viittaamistehtävissä ja ylittää muita MLLM-malleja lokalisaatiosta vaativissa ja aluepohjaisissa monimodaalisissa viestintätehtävissä. Tässä artikkelissa tutkimme Ferretin arkkitehtuuriin ja menetelmiin, korostamalla sen vaikuttavaa suorituskykyä erilaisissa monimodaalisissa kielitehtävissä. Tutustumme tähän aiheeseen tarkemmin.
Ferret: Ylivoimainen suorituskyky viittaamis- ja perustamistehtävissä
Viittaaminen mallissa on kyky, joka mahdollistaa mallin ymmärtämisen tiettyjen alueiden semantiikkaa tarkasti, kun taas perustaminen edellyttää mallilta semanttisten kuvausten käyttämistä näiden alueiden lokalisoimiseen. Vaikka ne voivat poiketa tehtävistään, sekä viittaaminen että perustaminen perustuvat samaan peruskäsitteeseen: spatiaalisen semantiikan ja tiedon kohdistamiseen. Kuitenkin, vaikka ne jakavat saman käsitteen, olemassa olevat mallit oppivat perustamista ja viittaamista erikseen. Vaikka menetelmä toimii, se asettaa esteen saavuttamisessa ihmismäisissä kyvyissä, koska ihmiset voivat oppia yhdestä tehtävästä ja soveltaa oppimistaan helposti muihin tehtäviin ja yhdistää perustamisen/viittaamisen kyvyt vaivattomasti päättelyyn ja päivittäiseen vuorovaikutukseen. Ferret-kehyksen inspiroivat mainitut aukot olemassa olevissa MLLM-kehyksissä ja tutkii kolmea pääkysymystä:
- Miten yhdistää perustamis- ja viittaamiskyvyt kehyksessä, ja miten niiden yhdistäminen hyödyttäisi toisiaan?
- Miten edustaa monimuotoisia alueita, kuten bokseja, pisteitä ja vapaamuotoisia muotoja, joita ihmiset käyttävät viittaamiseen?
- Miten tehdä perustamisesta ja viittaamisesta ohjeiden mukaisia, luotettavia ja avoimen sanaston mukaisia, mikä on kriittinen niiden käytännön ja reaaliaikaisen soveltamisen kannalta?
Ferret-kehyksen on uudenlainen viittaamis- ja perustamismalli, joka pyrkii vastaamaan näihin kysymyksiin. Ferret-kehyksen valitsee monimodaalisen suuren kielen mallin perustaksi, johtuen niiden huomattavasta globaalista näkemystä ja kielen ymmärtämiskyvystä. Lisäksi yhdistääkseen perustamis- ja viittaamiskyvyt, Ferret-kehyksen edustaa alueiden koordinaatteja luonnollisessa kielen numeromuodossa. Käytännössä on kuitenkin epätarkoituksenmukaista käyttää boksin koordinaatteja tai jopa yksittäisiä pisteitä edustamaan monimuotoisia alueen muotoja, kuten vapaamuotoisia muotoja, koska nämä muodot ovat kriittisiä parantuneen tarkin ja universaalemmalle ihmismalliviestinnälle. Ratkaisemaan tämän ongelman, Ferret-kehyksen käyttää spatiaalista visuaalista otinta, joka hankkii visuaaliset alueet alueista riippumatta muodosta, neuvottelemalla muuttuvan harvuuden näissä muodoissa. Keheyksen yhdistää sitten jatkuvat visuaaliset ominaisuudet diskreettisiin koordinaatteihin edustamaan visuaalisia alueita syötteenä, johtaen hybridisen alueen edustamiseen Ferretissä.
Ferret-kehyksen käyttää edellä mainittuja menetelmiä ratkaisemaan syötteen, joka yhdistää vapaamuotoisen tekstin viitattuihin alueisiin, ja pystyy vaivattomasti generoimaan koordinaatit kullekin maadoitettavalle objektille luomalla teksti maadoittaa mainittuja objekteja tulosteessa. Tekemällä näin, Ferret on ensimmäinen kehyksen, joka käsittelee vapaamuotoisia syötealueita monimodaalisissa suurissa kielen malleissa. Lisäksi Ferret-kehyksen omaksuu huomattavat avoimen sanaston kyvyt spatiaalisessa lokalisaatiossa ja ymmärtämisessä, mahdollistaen kehyksen saavuttamaan ylivoimaisen suorituskyvyn perinteisissä perustamis- ja viittaamistehtävissä.
Jatkaen, Ferret-kehyksen etsii inspiraatiota kolmesta olemassa olevasta AI-kehyksestä, mukaan lukien monimodaaliset suuret kielen mallit, MLLM:t viittaamiseen ja perustamiseen, ja yhdistäminen perustamiseen ja visuaaliseen ymmärtämiseen.
Suurten kielen mallien, kuten GPT, DALL-E, PaLM, LLaMA ja BLOOM, esittely on muuttanut tutkimuksen maiseman luonnollisen kielen prosessoinnissa, johtaen merkittäviin edistysaskeliin monimodaalisissa kielen malleissa. Aikaisemmat monimodaaliset kielen mallit keskittyivät pääasiassa suurten mittakaavojen kuvan ja tekstin generointiin, joista mainittavia esimerkkejä ovat PaLI, SimVLM, GIT, BLIP-2, FLAMINGO, CM3 ja PaLI-X. Kuitenkin, kun Flamingo-kehyksen saavutti tehokkaan integraation LLM:ien ja esikoulutetun CLIP-kuva-encoderin välillä ristigatted- huomioimalla, johtaen merkittäviin monimodaalisiin few-shot-oppimiskykyihin. Nykyinen tutkimus etsii keinoja hyödyntääksesi esikoulutettuja suuria kielen malleja visuaaliseen ohjeisiin, joista mainittavia esimerkkejä ovat MiniGPT-4, Otter, InstructBLIP ja lisää. Mitä enemmän, mallit kuten Emu ja GILL ovat osoittaneet merkittävää menestystä MLLM:ien käytössä kuvan generoinnissa ja kuvan hakemisessa. Ferret-kehyksen viittaa myös aikaisempaan tutkimukseen, joka keskittyy yhdistämään tekstin ja bounding box -tulosteen visuaalisen kielen malleissa.
Ferret: Menetelmä ja Arkkitehtuuri
Hybridialueiden Edustus
Piste, boksi ja vapaamuotoinen muoto ovat kolme hallitsevaa muotoa, joita kielen malli käyttää viitatessaan tiettyihin alueisiin. Toisaalta, piste- ja boksimuodot voidaan edustaa tarkasti koordinaateilla, mutta vapaamuotoisten muotojen kartoittaminen on haasteellista, koska vapaamuotoiset muodot voivat kattaa laajan valikoiman alueita, mukaan lukien maskit, polygonit ja vapaamuotoiset muodot. Vapaamuotoisten muotojen edustaminen koordinaateilla on monimutkainen tehtävä, joka haittaa mallin kykyä oppia luomaan korrelaation alueiden ja niiden koordinaattien välille. Lisäksi vapaamuotoisten muotojen edustaminen koordinaateilla on laskennallisesti kallista ja epäselvää.
Ratkaisemaan tämän ongelman ja yleistämään kaikkiin kolmeen muotoon, Ferret-kehyksen ehdottaa hybridialueen edustusta, joka yhdistää jatkuvat visuaaliset ominaisuudet diskreettisiin koordinaatteihin viittaamaan tiettyyn alueeseen.

Jatkuvien visuaalisten ominaisuuksien osalta, annetun alueen kohdalla Ferret-kehyksen ensin rakentaa 2D-binaarisen maskin, joka on samaa kokoa kuin kuva, ja merkitsee arvon 1 kohdistetussa alueessa ja arvon 0 alueen ulkopuolella. Malli sitten poistaa binaarisen maskin yhdessä poistetun kuvan ominaisuuskartan kanssa ja lähettää sen spatiaaliseen visuaaliseen ottimeen.
Arkkitehtuuri
Ferret-mallin arkkitehtuuri koostuu kolmesta pääkomponentista
- Kuvan kooderin poistamaan kuvan upotukset.
- Spatiaalinen visuaalinen otin poistamaan alueelliset jatkuvat ominaisuudet.
- Suuri kielen malli mallintamaan tekstiä, kuvaa ja alueen ominaisuuksia yhdessä.

Kuva syötetään ensin esikoulutettuun visuaaliseen kooderiin poistamaan kuvan upotukset. Tekstisyötteessä kehyksen käyttää esikoulutettua LLM-tokeneria tokenoida tekstirivi, ja sitten projektoi nämä tokenit tekstiupotuksiin. Viitattuihin alueisiin, Ferret liittää erityisen tokenin ja koordinaatit paikkaa jatkuvia ominaisuuksia alueen nimen jälkeen. Jos alueen nimi on tuntematon tai on monimutkainen kuvailla, kehyksen käyttää vain alueen nimeä.
Yksi suurimmista haasteista, joita viitattuihin alueisiin liittyy, on se, että niiden muoto voi olla hyvin muuttuva, eli ne voivat olla eri muotoisia eivätkä rajoitu pelkästään suorakaiteisiin bokseihin tai pisteisiin. Viitattuihin alueisiin, joilla on epäsäännöllisiä muotoja, ei voida käsitellä perinteisillä menetelmillä, kuten ruutupohjaisella prosessoinnilla, patch-huomion tai konvoluutio-tekniikalla. Ratkaisemaan tämän ongelman, Ferret-kehyksen ehdottaa spatiaalista visuaalista otinta. Poistetun ominaisuuskartan ja binaarisen alueen maskin kohdalla, Ferret-malli ensin satunnaiseen ottaa N-lukuisia pisteitä binaarisesta alueen maskista.
Kunkin pisteen kohdalla, malli saa ominaisuutensa suorittamalla bilineaarisen interpoloinnin. N pisteet syötetään sitten vesiputouksen blokkeihin, joista kunkin kulkee kolme eri vaihetta: näyte, kerääminen ja pooling. Näytteiden vaiheessa, kiinteä määrä pisteitä otetaan N-lukuisista pisteistä käyttäen FPS- tai kauimman pisteen etsintäalgoritmi, joka takaa riittävän peittävyyden. Toisessa vaiheessa, kunkin näytteen kohdalla, kehyksen etsii lähimmät naapuripisteet N-lukuisista pisteistä. Kunkin ryhmän kohdalla, malli sitten yhdistää näytteen ominaisuudet naapuripisteiden ominaisuuksien kanssa. Lopullisessa vaiheessa, Ferret-kehyksen suorittaa maksimipoolingin yhdistämään naapuripisteiden ominaisuudet yhdeksi ominaisuudeksi, joka toimii näytteen edustajana. Suorittamalla nämä kolme vaihetta, Ferret-kehyksen jää vähemmän pisteillä, mutta ominaisuuksien avaruudessa on korkeampi tiheys, koska se sisällyttää sekä paikallisten naapurien ominaisuudet että niiden suhteelliset sijainnit.
GPT-Avustettu Visuaalisen Datagenerointi
Vuorovaikutusohjeiden koulutusdata on kriittistä monimodaalisten suurten kielen mallien kehittämisessä, koska ne auttavat mallia ymmärtämään ihmisen aikomusta ja generoimaan sopivan vastauksen. Useimmat MLLM:t käyttävät few-shot-ohjausta saadakseen visuaalisen ohjausdatan, jossa malli antaa tekstikuvauksen kohtauksesta kuvassa yhdessä ihmisen annotoiden dialogien kanssa few-shot-esimerkkeinä. Kuitenkin, olemassa olevat ohjausmenetelmät keskittyvät pääasiassa koko kuvan kuvaamiseen ilman spatiaalisen tietojen nimeämistä. Ferret-kehyksen korostaa aluepohjaista tietoa kerätäkseen viittaamis- ja perustamisohjeita seuraavissa kolmessa vaiheessa.
- Lisäksi globaalikuvauksia ja objekteja, kehyksen antaa symbolisen kohtauksen kuvaus, joka kuvailee fyysistä suhdetta alueen kuvausten ja objektiiden välillä sekä niiden koordinaatteja.
- Ihmisen annotoiduissa dialogeissa, kehyksen lisää koordinaatit maadoitettavien objektiiden tai alueiden jälkeen syötteenä tai tulosteena tai molemmilla, ja dialogit keskittyvät pääasiassa tiettyihin alueisiin, mikä auttaa mallia seuraamaan samanlaista mallia uusien dialogien generoimisessa.
- On mahdollista, että dialogi, jonka malli generoi, ei seuraa ohjeiden mukaista mallia, ja järjestelmä käyttää sitten kielen mallia dialogin viimeistelyyn.
Spatiaalinen Negatiivinen Kaivuu
Aikaisemmat tutkimukset ovat osoittaneet, että monimodaaliset suuret kielen mallit ovat alttiita hallucinaatioille vastatessaan kyllä/ei-kysymyksiin. Varmistamaan, että Ferret-malli ei hallucinoi samanlaisissa tilanteissa, kehyksen käyttää spatiaalista negatiivista kaivuuta Image-Conditioned Category Localization ja Semantics-Conditioned Category Localization menetelmin. Molemmat menetelmät pyytävät mallilta lokalisoimaan tiettyjä objektiluokkia, mikä mahdollistaa mallille tunnistaa objektiensa puuttumisen kuvasta.
Ferret: Tulokset ja Kokeilu
Arvioidakseen suorituskykyään, Ferret-kehyksen arvioidaan perinteisissä perustamis- ja viittaamisbenchmarkkeissa, ja sitten kehyksen arvioidaan monimodaalisissa keskustelutehtävissä ja testataan sen viittaamis- ja perustamiskykyjä.

Mallin kyky ymmärtää viittaamista arvioidaan sen tarkkuuden perusteella, kun se ymmärtää viitattujen alueiden semantiikkaa. Objektit, perustavat semantiikat, otetaan ensin huomioon, koska ne ovat sekä perustavia että helppoja määritellä. Jäljitelläkseen ihmismäisen monimuotoisuuden, kehyksen korvaa objektiin sijainnin kuvassa vapaamuotoisella muodolla, boksilla ja pisteellä. Vapaamuotoisen muodon kohdalla, malli satunnaiseen generoi viivat Ground Truth -objektin sisällä simulaatiota varten. Boksin kohdalla, Ferret-kehyksen käyttää Ground Truth -boksin, jonka LVIS-komponentti tarjoaa. Lopulta, pisteessä, malli satunnaiseen ottaa pisteen Ground Truth -objektin sisällä, joka on myös lähellä Ground Truth -objektin reunaa. Tulokset näistä kolmesta viittaamisen tyypistä on esitetty seuraavassa kuvassa.

Ferret-kehyksen osoittaa merkittävää suorituskykyä viittaamisdialogeissa, jättäen tilaa integroida erilaisiin visuaalisiin oppimistehtäviin, erityisesti niihin, joissa on perustamis tulostus. Arvioidakseen perustamiskykyään, Ferret-kehyksen asettaa itsensä benchmark-visuaalisiin perustamistehtäviin generatiivisella paradigmana. Keheyksen arvioi sitten sen kykyä perustettujen kuvauksien tehtävissä mittaamalla alueiden ja sanojen välistä suhdetta.
Visuaalisissa perustamistehtävissä, kehyksen tavoittelee perustaa kielen kysymyksiä kuvan alueisiin, ja kuten voidaan nähdä seuraavasta kuvasta, Ferret-kehyksen osoittaa merkittävää suorituskykyä kaikissa benchmarkkeissa, ja suorituskyky on vertailukelpoinen siihen, mitä saavutetaan erikoistuneilla hienosäätömenetelmillä.

Perustettujen kuvauksien tehtävissä, malli tarvitsee generoida kuvaus ja sitten perustaa generoidut substantiivit kuvan alueisiin. Lopullinen ennuste, jonka malli tekee, koostuu kolmesta osasta: visuaalisista alueista boksina, tekstikuvauksina ja perustamissuhteina boksien ja sanojen välillä. Tulokset on esitetty seuraavassa kuvassa, ja kuten voidaan nähdä, kehyksen toimittaa suorituskyky, joka on vertailukelpoinen nykyisimpiin menetelmiin.

Lopulta, monimodaalinen keskustelu on yksi eniten toivottuja kykyjä monimodaalisissa suurissa kielen malleissa, ja olemassa olevat MLLM:t arvioivat pääasiassa yksityiskohtaisia kuvauksia, keskustelua ja monimutkaisia päättelyjä kielen mallin tuomarina. Kuitenkin, koska ei ole olemassa tietokokoelmaa, joka arvioi monimodaalista keskustelua pakollisten viittaamis- tai perustamistehtävien kanssa, jää aukko. Täyttämään tämän aukon, Ferret-kehyksen kattaa kolme aluepohjaista kysymystä arvioidakseen sen viittaamis- ja perustamiskykyjä monimodaalisissa keskustelutehtävissä. Tulokset on esitetty seuraavassa kuvassa.

Lopulta, Ferret-kehyksen verrataan suoraan nykyisimpiin GPT-kehyksiin, ja tulokset on esitetty alla.

Lopputulet
Tässä artikkelissa, olemme puhuneet Ferretistä, monimodaalisesta suuresta kielen mallista, joka osoittaa merkittävää perustamis- ja viittaamiskykyä. Ferret-kehyksen pystyy viittaamaan kuvan alueisiin riippumatta niiden muodosta, ja se pystyy perustamaan tekstiä, jonka malli ennustaa automaattisesti. Ferret käyttää spatiaalista visuaalista otinta, joka pystyy käsittelemään muuttuvaa harvuutta, jota eri muodot esittävät, ja se pystyy poistamaan jatkuvat ominaisuudet monimuotoisista alueista. Tämän seurauksena, Ferret-kehyksen pystyy syöttämään monimuotoisia alueita, mukaan lukien vapaamuotoiset muodot, boksit ja pisteet.












