AI-mallit ja alustat

LLaVA-UHD: Tehokas tapa havainnoida kuvia minkä tahansa kuvasuhteen ja korkean resoluution kanssa

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Suurten kielen mallien edistyminen on johtanut merkittäviin parannuksiin visuaalisen päättelyn, ymmärtämisen ja vuorovaikutuksen osalla. Nykyaikaisissa kehyksissä tämä saavutetaan syöttämällä visuaalisia signaaleja suurille kielen malleille, jotta ne voivat tulkita maailmaa visuaalisesti, moninaisia skenaarioita, jotka riippuvat visuaalisista koodausstrategioista. Kuvien todelliset skenaariot eivät kuitenkaan sisällä ainoastaan moninaisia tilanteita, vaan ne vaihtelevat myös merkittävästi resoluution ja kuvasuhteen suhteen, mikä aiheuttaa suuria haasteita suurille kielen malleille eri aloilla ja tehtävissä. Nykyaikaiset suuret kielen mallit havainnoivat kuvia matalassa resoluutiossa, esimerkiksi 224×224, ja kiinteässä kuvasuhteessa, esimerkiksi 1:1. Vaikka tämä kompromissi on hyödyllinen varmistaakseen suurten kielen mallien yleispätevyyden todellisissa sovelluksissa, se usein johtaa epäselviin kuvien sisältöihin ja aiheuttaa vakavia muodonvääristymiä. Tämä kompromissi vaikuttaa erityisesti suurten monimodaalisten mallien kykyihin, erityisesti niiden, jotka on optimoitu hienojakoisille tehtäville, kuten optiseen merkintunnistamiseen ja pienten objektien ymmärtämiseen. Koska resoluutio ja kuvasuhde on ennalta määritetty, mallit voivat ainoastaan arvailla sumea kuvaa, mikä johtaa mallin harhaan, tilanteeseen, jossa malli tuottaa tekstipohjaisia vastauksia, jotka eivät perustu tosiasioihin kuvissa.

Tässä artikkelissa keskitymme LLaVA-UHD:han, joka on uudenlainen lähestymistapa, joka ottaa LLaVA-1.5- ja GPT-4V-kehykset edustavina esimerkkeinä ja yrittää paljastaa systemaattiset virheet, jotka ovat juontuneet niiden visuaalisesta koodausstrategiasta. LLaVA-UHD-kehys on monimodaalinen malli, joka yrittää ratkaista haasteita. LLaVA-UHD-kehys voi havainnoida kuvia korkeassa resoluutiossa ja minkä tahansa kuvasuhteen kanssa. LLaVA-UHD-kehys perustuu kolmeen avainkomponenttiin. Ensinnäkin, kuva-modulaarinen strategia, joka jakaa alkuperäisen resoluution kuvat pienempiin muuttuvakokoisiin palasiin tehokkuuden ja koodauksen laajentamiseksi. Seuraavaksi, pakkausmoduuli, joka tiivistää visuaalisten tokenien tuottamisen visuaalisilla koodareilla. Lopuksi, spatial schema, joka järjestää palasten tokenit suurille kielen malleille. Kattavat kokeet osoittavat, että LLaVA-UHD-kehys pystyy ylittämään valmiiden suurten kielen mallien tulokset yhdeksällä mittarilla. Lisäksi, käyttämällä ainoastaan 94%:ia inference-laskentaa, LLaVA-UHD-kehys pystyy tukemaan kuvia, joilla on 6 kertaa suurempi resoluutio, esimerkiksi 672×1088.

LLaVA-UHD: Tehokas tapa havainnoida kuvia minkä tahansa kuvasuhteen ja korkean resoluution kanssa

Visuaalisen päättelyn, ymmärtämisen ja vuorovaikutuksen kehittyminen on edennyt merkittävästi viime aikoina, suurelta osin suurten kielen mallien kehittymisen ansiosta. Nykyaikaisissa kehyksissä tämä saavutetaan syöttämällä visuaalisia signaaleja suurille kielen malleille, jotta ne voivat tulkita maailmaa visuaalisesti, moninaisia skenaarioita, jotka riippuvat visuaalisista koodausstrategioista. Kuvien todelliset skenaariot eivät kuitenkaan sisällä ainoastaan moninaisia tilanteita, vaan ne vaihtelevat myös merkittävästi resoluution ja kuvasuhteen suhteen, mikä aiheuttaa suuria haasteita suurille kielen malleille eri aloilla ja tehtävissä. Nykyaikaiset suuret kielen mallit havainnoivat kuvia matalassa resoluutiossa, esimerkiksi 224×224, ja kiinteässä kuvasuhteessa, esimerkiksi 1:1. Vaikka tämä kompromissi on hyödyllinen varmistaakseen suurten kielen mallien yleispätevyyden todellisissa sovelluksissa, se usein johtaa epäselviin kuvien sisältöihin ja aiheuttaa vakavia muodonvääristymiä. Tämä kompromissi vaikuttaa erityisesti suurten monimodaalisten mallien kykyihin, erityisesti niiden, jotka on optimoitu hienojakoisille tehtäville, kuten optiseen merkintunnistamiseen ja pienten objektien ymmärtämiseen. Koska resoluutio ja kuvasuhde on ennalta määritetty, mallit voivat ainoastaan arvailla sumea kuvaa, mikä johtaa mallin harhaan, tilanteeseen, jossa malli tuottaa tekstipohjaisia vastauksia, jotka eivät perustu tosiasioihin kuvissa.

On kaksi merkittävää syytä, miksi vertailumallit eivät pysty havainnoimaan kuvia korkeassa resoluutiossa ja vaihtelevassa kuvasuhteessa. Ensinnäkin, koska visuaaliset koodarit on koulutettu kiinteissä resoluutioissa, se tekee vaikeaksi mallille ja koodarille käsitellä kuvia, joilla on vaihteleva kuvasuhde ja resoluutio, mikä vaikuttaa merkittävästi mallin sopeutumiskykyyn. Toiseksi, korkearesoluutioisten kuvien koodaaminen suoraan visio-transformereilla liittyy merkittäviin laskennallisiin kustannuksiin kuvien koosta riippuen. Lisäksi laskennalliset kustannukset voivat olla merkittävästi suuremmat suurten kielen mallien prosessoinnissa suuren määrän visuaalisia tokenien käsittelyssä korkearesoluutioisissa kuvissa, mikä vaikuttaa merkittävästi mallin tehokkuuteen. LLaVA-UHD-kehys, joka on suuri monimodaalinen malli, joka pystyy havainnoimaan kuvia korkeassa resoluutiossa ja minkä tahansa kuvasuhteen kanssa, ottaa LLaVA-1.5- ja GPT-4V-kehykset edustavina esimerkkeinä ja yrittää paljastaa systemaattiset virheet, jotka ovat juontuneet niiden visuaalisesta koodausstrategiasta.

Yllä oleva kuva heijastaa GPT-4V-kokeiden tuloksia kuvien esineiden määrän tunnistamisessa. LLaVA-UHD-kehyksen ydin koostuu kolmesta komponentista. Ensinnäkin, kuva-modulaarinen strategia, joka jakaa alkuperäisen resoluution kuvat pienempiin muuttuvakokoisiin palasiin tehokkuuden ja koodauksen laajentamiseksi. Toiseksi, pakkausmoduuli, joka tiivistää visuaalisten tokenien tuottamisen visuaalisilla koodareilla. Lopuksi, spatial schema, joka järjestää palasten tokenit suurille kielen malleille.

LLaVA-UHD: Menetelmä ja Arkkitehtuuri

Pilotikokeiden opetuksien perusteella, joissa tutkittiin olemassa olevia kehyksiä, kuten GPT-4V ja LLaVA-1.5, LLaVA-UHD-kehys toteuttaa kolmikomponenttisen arkkitehtuurin, kuten seuraavassa kuvassa näkyy.

Ensinnäkin, kuva-modulaarinen strategia, joka jakaa alkuperäisen resoluution kuvat pienempiin muuttuvakokoisiin palasiin tehokkuuden ja koodauksen laajentamiseksi. Toiseksi, pakkausmoduuli, joka tiivistää visuaalisten tokenien tuottamisen visuaalisilla koodareilla. Lopuksi, spatial schema, joka järjestää palasten tokenit suurille kielen malleille. Tutustumme nyt tarkemmin näihin komponentteihin.

Modulaarinen Visuaalinen Koodaus

Yleinen lähestymistapa korkearesoluutioisten kuvien ja vaihtelevan kuvasuhteen käsittelyyn on interpoloida Vision Transformerin tai ViT:n position-embeddingeja kohdekuvaan suoraan. Kuitenkin tämän lähestymistavan toteutus on usein liitettynä korkeisiin laskennallisiin kustannuksiin, ja poikkeamiset johtavat edelleen heikentymään suorituskyvyssä. LLaVA-UHD-kehys esittää modulaarisen visuaalisen koodausstrategian, joka jakaa alkuperäisen resoluution kuvat pienempiin muuttuvakokoisiin palasiin, joissa kunkin palasin muoto on hyvin lähellä standardin valmistusasettelua visio-trasformerialle. Muuttuvakokoisten palasten käytön ansiosta LLaVA-UHD-kehys pystyy saavuttamaan täydellisen sopeutumiskyvyn alkuperäisen resoluution kuvissa ilman muodonvääristymistä, uudelleenmuokkausta tai täyttämistä. Lisäksi kuva-palastusstrategian tärkein tavoite on määrittää jakautuma korkearesoluutioisille kuville, jossa kunkin palasin resoluutio on mahdollisimman lähellä alkuperäistä resoluutiota.

Lisäksi useimmat olemassa olevat suuret kielen mallit toteuttavat kiinteän resoluution kuva-palastukselle, mikä estää mallin täydellisen sopeutumiskyvyn alkuperäisiin resoluutioihin, koska ne pystyvät käsittelemään ainoastaan joitakin ennalta määritettyjä kiinteitä palasten muotoja. Staattinen palasten resoluutio myös heikentää mallin suorituskykyä, tehokkuutta ja oikeellisuutta, koska se aiheuttaa vääristymistä, uudelleenmuokkausta tai täyttämistä. LLaVA-UHD-kehys ehdottaa kuva-palasten koodaamista kuvasuhteessa, kuten palastusstrategia määrittää. Tarkemmin sanottuna LLaVA-UHD-kehys muokkaa alkuperäistä kuvaa suhteellisesti kuvasuhteen mukaan siten, että palasten määrä sopii visio-trasformerialle ennalta määritetyn aseman siirtymisen budjettiin.

Pakkauskerros

Yleinen ongelma, johon suuret kielen mallit törmäävät korkearesoluutioisten kuvien käsittelyssä, on se, että visuaalisten tokenien määrä, jonka ne on käsiteltävä, on merkittävästi suurempi (esim. LLaVA-1.5-kehys tuottaa noin 3500 visuaalista tokenia yhden 672×1008 resoluution kuvan käsittelyssä), mikä edustaa suurta osaa laskennallisista resursseista ja kustannuksista. LLaVA-UHD-malli toteuttaa jaetun perceiver-resampler-kerroksen visuaalisten tokenien pakkaamiseksi kunkin kuva-palasin osalta. Sitten se toteuttaa joukon kyselyvektoreita ristiriitaisen huomion kautta näyttelemään visuaalisten tokenien tulosta visuaalisten koodareiden toimesta alempaan lukumäärään. Vertailukelpoisissa Multilayer Perceptron -pohjaisiin visuaalisiin projektiomenetelmiin verrattuna LLaVA-UHD:n toteuttama perceiver-näyte-approach on kykenevässä ylläpitämään kohtuullisen, mutta kiinteän visuaalisten tokenien määrän riippumatta kuvan resoluutiosta, mikä tekee LLaVA-UHD-kehyksestä yhteensopivan korkearesoluutioisten kuvien käsittely- ja ymmärtämistehtävien kanssa. Esimerkiksi LLaVA-UHD-kehys tuottaa saman määrän tokenia 672×1008 resoluution kuvan koodaamisessa kuin LLaVA-1.5-kehys 336×336 resoluution kuvan koodaamisessa, lähes 6 kertaa tehokkaammin kuin sen kilpailija.

Spatial Schema Kuva-Palastille

On välttämätöntä ilmoittaa suurelle kielen mallille kuva-palasten spatial-järjestelmä, koska kuvien jakautuminen on dynaaminen eri kuvien välillä. LLaVA-UHD-kehys suunnittelee ja toteuttaa spatial-skeeman, joka käyttää kahta erikoistunta ilmoittamaan LLM:lle kuva-palasten suhteellista sijaintia. Tämän spatial-skeeman puitteissa LLaVA-UHD-kehys käyttää “,”-merkkiä erottamaan palasten edustukset rivissä, ja eri rivit erotetaan “n”-merkillä.

LLaVA-UDH: Kokeet ja Tulokset

LLaVA-UHD-kehys on arvioitu yhdeksällä suositulla mittarilla, mukaan lukien yleiset visuaaliset kysymys-vastaus-mittarit, optiset merkintunnistusperusteiset visuaaliset kysymys-vastaus-mittarit, harha-mittari ja kattavat mittarit. Lisäksi LLaVA-UHD-kehys on verrattu vahvoihin vertailumalliin, mukaan lukien LLaVA-1.5, MiniGPT-v2, InstructBLIP, BLIP-2 ja useita muita.

LLaVA-UHD-kehyksen suorituskyky yhdeksällä suositulla mittarilla on yhteenveto ja verrattu suosittuihin vertailumalleihin seuraavassa taulukossa.

Yllä olevan suorituskyvyn perusteella voidaan todeta, että LLaVA-UHD-kehys pystyy ylittämään vahvat vertailumallit suosituilla mittareilla, mukaan lukien vahvat yleiset vertailumallit, jotka on koulutettu merkittävästi suuremmalla määrällä dataa, sekä ylittämään LLM-mallit, jotka vaativat merkittävästi enemmän laskentaa, kuten Fuyu-8B, Monkey ja useita muita. Toiseksi tulokset osoittavat, että LLaVA-UHD-kehys saavuttaa merkittävästi parempia tuloksia LLaVA-1.5-rakenteeseen verrattuna, ja siinä missä LLaVA-1.5 tukee kiinteää 336×336 resoluutiota, LLaVA-UHD-kehys tukee 672×1088 resoluution kuvia minkä tahansa kuvasuhteen kanssa ja saman määrän visuaalisia tokenia.

Lopputulet

Tässä artikkelissa olemme keskittyneet LLaVA-UHD:han, joka on uudenlainen lähestymistapa, joka ottaa LLaVA-1.5- ja GPT-4V-kehykset edustavina esimerkkeinä ja yrittää paljastaa systemaattiset virheet, jotka ovat juontuneet niiden visuaalisesta koodausstrategiasta. LLaVA-UHD-kehys on monimodaalinen malli, joka yrittää ratkaista haasteita. LLaVA-UHD-kehys voi havainnoida kuvia korkeassa resoluutiossa ja minkä tahansa kuvasuhteen kanssa. LLaVA-UHD-kehys perustuu kolmeen avainkomponenttiin. Ensinnäkin, kuva-modulaarinen strategia, joka jakaa alkuperäisen resoluution kuvat pienempiin muuttuvakokoisiin palasiin tehokkuuden ja koodauksen laajentamiseksi. Toiseksi, pakkausmoduuli, joka tiivistää visuaalisten tokenien tuottamisen visuaalisilla koodareilla. Lopuksi, spatial schema, joka järjestää palasten tokenit suurille kielen malleille. Kattavat kokeet osoittavat, että LLaVA-UHD-kehys pystyy ylittämään valmiiden suurten kielen mallien tulokset yhdeksällä mittarilla. Lisäksi, käyttämällä ainoastaan 94%:ia inference-laskentaa, LLaVA-UHD-kehys pystyy tukemaan kuvia, joilla on 6 kertaa suurempi resoluutio, esimerkiksi 672×1088.

Ammattina insinööri, sydämen vuoksi kirjailija. Kunal on tekninen kirjailija, jolla on syvä rakkaus ja ymmärrys AI: sta ja ML: stä, omistautunut yksinkertaistamaan monimutkaisia käsitteitä näissä aloissa hänen viihdyttävän ja informatiivisen dokumentaationsa kautta.