AI-mallit ja alustat

MiniGPT-5: Vuorovaikutteinen visuaalinen ja kielellinen generointi generatiivisten vokenien avulla

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Viime vuosien aikana suuret kielimallit (LLM) ovat herättäneet kiinnostusta AI-kehittäjien keskuudessa luonnonkielen prosessoinnin (NLP) läpimurtojen ansiosta. Nämä mallit ovat asettaneet uudet mittapuut tekstin generoimisessa ja ymmärtämisessä. Kuitenkin tekstin generoimisen edistymisestä huolimatta, kuvien tuottaminen, jotka vastaavat tekstuaalisia kertomuksia, on edelleen haasteellista. Tätä varten kehittäjät ovat esittäneet innovatiivisen visuaalisen ja kielellisen generointimenetelmän, joka perustuu “generatiivisiin vokeneihin”, ja täyttää kuilun harmonisoiduille teksti- ja kuvatulosteille.

MiniGPT-5:n perusta on kaksivaiheinen koulutusstrategia, joka keskittyy voimakkaasti kuvausten puuttumiseen monimodaalisessa datan generoimisessa, jossa koulutusdataa ei vaadita kattavia kuvauksia. Lisäksi mallin eheyyden vahvistamiseksi malli sisältää luokitteluun perustuvan ohjausjärjestelmän, joka parantaa vokenin tehokkuutta kuvan generoimisessa. Alkuvaiheessa MiniGPT-5-kehys on osoittanut voimakasta suorituskykyä ja merkittävää parannusta verrattuna perus-Divter-malliin, joka on koulutettu MMDialog-aineistolla, ja on jatkuvasti osoittanut kykynsä toimittaa vertailukelpoisia ja jopa parempia monimodaalisia tulosteita ihmisten arvioissa, jotka on tehty VIST-aineistolla, mikä korostaa sen suorituskykyä ja tehokkuutta eri mittareilla.

MiniGPT5: Johdanto

Viimeaikaisen LLM-kehyskehityksen ja sovellusten myötä, multimediaominaisuuksien integrointi on kasvava ala, joka osoittaa olevan tärkeä edistysaskel, joka mahdollistaa laajan sovellusvalikoiman valmistamisen, alkaen valmiista sisällönluontityökaluista ja päättyen älykkäisiin monimodaalisiin vuorovaikutusmalliin. Jatkuva tutkimus ja kehitys ovat tuoneet kieli- ja visiomallit siihen pisteeseen, jossa niiden on tarkoitus tuottaa sekä teksti- että visuaalista dataa sujuvasti. LLM:n kyky generoida monimodaalista dataa sujuvasti parantaa vuorovaikutuksia eri aloilla, kuten elektroniikassa, mediassa ja virtuaalitodellisuudessa.

Lopulta tavoitteena on sallia malleille syntetisoida, tunnistaa ja reagoida johdonmukaisesti ja logisesti sekä tekstuaalisilla että visuaalisilla modaalisilla. Tämä on tärkeää harmonisoidakseen tietovirran ja luodakseen loogisia ja johdonmukaisia kertomuksia. Tarve saavuttaa visuaalisen ja kielellisen modaalisuuden yhdistelmä johtuu ennen kaikkea LLM:n tarpeesta fluidista, integroidusta ja interaktiivisesta monimodaalisesta vuorovaikutuksesta, ja lopulta saavuttamiseksi vuorovaikutteista kielen ja visuaalisen generointia. Kuitenkin saavuttaminen integroiduista ja interaktiivisista monimodaalisista vuorovaikutuksista LLM:ssä on monimutkainen tehtävä, joka on täynnä haasteita, kuten

  1. Vaikka nykyiset LLM:t ovat erittäin tehokkaita ja kykeneviä tekstin generoimisessa ja teksti-kuvaparien prosessoinnissa, ne eivät toimi tyydyttävästi kuvien generoimisessa.
  2. Näiden visio- ja kielimallien kehitys perustuu voimakkaasti aiheeseen keskittyneisiin aineistoihin, mikä tekee mallien vaikeaksi kuvien ja tekstien sovittaminen yhteen.
  3. Lopulta on tarve kehittää tehokkaampia strategioita, koska LLM:n kyky kasvaa, myös muistin vaatimukset kasvavat, erityisesti aineistojen prosessoinnissa.

MiniGPT-5-kehys, joka on vuorovaikutteinen kieli- ja visuaalisen generoinnin algoritmi, joka esittää “generatiivisten vokenien” käsitteen, yrittää ratkaista edellä mainittuja haasteita. MiniGPT-5-kehys ehdottaa uutta lähestymistapaa monimodaalisen datan generoimiseksi yhdistämällä suuret kielimallit ja Stable Diffusion -tekniikat erityisillä visuaalisilla tokeneilla. Ehdotettu kaksivaiheinen koulutusmenetelmä korostaa perustavan vaiheen, joka on vapaa kuvausten tarpeesta, ja valmistaa mallin toimimaan tehokkaasti myös rajoitettujen aineistojen kanssa.

Mutta mikä erottaa MiniGPT-5-mallin nykyisistä kehyksistä on se, että MiniGPT-5-kehyksen yleiset vaiheet eivät koostu domeenispesifisistä annotaatioista. Lisäksi, jotta generoitu teksti ja sen vastaavat kuvat ovat harmoniassa toistensa kanssa, MiniGPT-5-kehys käyttää kaksinkertaista menetelmää, joka parantaa edelleen MiniGPT-5:n lähestymistapaa käyttämällä luokitteluun perustuvaa ohjausta ja generatiivisia vokeneita. MiniGPT-5-kehys optimoi koulutuksen tehokkuuden ja ratkaisee muistirajoitukset ansiostaan parametrin tehokkaasta hienosäätelystä.

Jotta voimme antaa sinulle nopean yhteenvedon, MiniGPT-5-kehys

  1. Ehdottaa menetelmää, joka käyttää monimodaalisia koodareita, jotka edustavat uutta ja yleistä menetelmää, joka on historiallisesti osoittautunut tehokkaammaksi kuin perinteiset LLM:t, ja käyttää generatiivisia tokeneja yhdessä Stable Diffusion -tekniikoiden kanssa generoimaan vuorovaikutteisia kieli- ja visuaalisen tulosteita.
  2. Ehdottaa kaksivaiheista koulutusstrategiaa kuvausten puuttumiseen monimodaalisessa tulosteessa, ja luokitteluun perustuvan ohjauksen käyttöä koulutuksessa parantamaan generoidun datan laatua.

MiniGPT-5-malli perustuu vahvasti aiempaan tutkimukseen ja työhön teksti-kuvan generoimisessa, monimodaalisissa suurissa kielimalleissa ja monimodaalisessa generoimisessa suurilla kielimalleilla.

  • Teksti-kuvan generoiminen: Mahdollistaa tekstikuvauksien muuttaminen visuaalisiin edustuksiin ja teksti-kuvamalleihin.
  • Monimodaaliset suuret kielimallit: Käyttää esikoulutettuja LLM-malleja tutkimaan niiden soveltamista monimodaalisen datan generoimisessa.
  • Monimodaalinen generoiminen suurilla kielimalleilla: Laajentaa LLM:n kykyä yhdistää kieli- ja visuaalisen datan generoimisen.

MiniGPT-5: Menetelmä, Arkkitehtuuri ja Kehys

Mahdollistaakseen suurten kielimallien monimodaalisen datan generoimiskyvyn, MiniGPT-5-malli esittää kehyksen, joka yhdistää teksti-kuvan generoimismalleja ja esikoulutettuja monimodaalisia suuria kielimalleja. MiniGPT-5-kehys esittää myös “generatiiviset vokenit”, erityiset visuaaliset tokenit, jotka mahdollistavat kehittäjien ratkaisemisen eroja eri aihealueilla kouluttamalla suoraan raakakuvista. Kehys parantaa myös generoidun datan laatua käyttämällä luokitteluun perustuvaa strategiaa ja edistynyttä kaksivaiheista koulutusmenetelmää. Tarkastellaan yksityiskohtaisesti MiniGPT-5-kehystä.

Monimodaalinen Syötevaihe

Viimeaikaiset LLM-kehitykset ovat tuoneet LLM:ien monimodaalisen ymmärtämiskyvyn valoon, mahdollistaen kuvien prosessoinnin järjestyksessä. MiniGPT-5-kehys käyttää erityisesti suunniteltuja generatiivisia vokeneita visuaalisten ominaisuuksien tuottamiseksi pyrkien laajentamaan LLM:ien monimodaalista ymmärtämiskykyä monimodaaliseen datan generoimiseen. Lisäksi MiniGPT-5-kehys käyttää parametrin tehokasta hienosäätelyä monimodaalisen tulosteen oppimiseen LLM-kehyksessä.

Monimodaalinen Koodaus

Esikoulutettu visuaalinen koodari MiniGPT-5-kehyksessä muuttaa jokaisen syötekuvan ominaisuudeksi, ja jokainen teksti-token upotetaan vektorina, ja syöteohjeiden ominaisuudet generoidaan, kun nämä upotukset yhdistetään toisiinsa.

Lisääminen Suurissa Kielimalleissa

Perinteisesti suurten kielimallien sanasto koostuu ainoastaan teksti-tokeneista, joten MiniGPT-5-kehyksen kehittäjien on täytettävä kuilu generatiivisten ja perinteisten LLM:ien välillä. MiniGPT-5-kehys esittää joukon erityisiä tokeneja generatiivisina tokeneina LLM:n sanastoon. Kehys hyödyntää LLM:n piilotetun tilan tulostetta näille erityisille vokeneille kuvan generoimiseen, ja kuvien sisättäminen edustetaan vokenien sijainnilla.

PEFT tai Parametrin Tehokas Hienosäätely

PEFT eli parametrin tehokas hienosäätely on tärkeä käsite LLM:ien kouluttamisessa, mutta sen soveltaminen monimodaalisissa ympäristöissä on edelleen vähäistä. MiniGPT-5-kehys käyttää parametrin tehokasta hienosäätelyä MiniGPT-4-kehyksen koodarin yli kouluttaakseen mallin ymmärtämään ohjeita tai käskyjä paremmin ja parantamaan mallin yleistä suorituskykyä nollasoitto- tai uusissa ympäristöissä.

Monimodaalinen Tulosteen Generoiminen

Jotta generatiivinen malli voidaan kohdistaa generatiivisiin tokeneihin tarkasti, MiniGPT-5-kehys muodostaa tiiviin kartoitusmoduulin ulottuvuuksien vastaavuuden ja sisällyttää valvontamenetelmät, kuten latenttisen diffuusion menetelmän ja tekstitilan menetelmän. Latenttinen diffuusio valvoo visuaalisten ominaisuuksien kohdistamista tokenien kanssa suoraan, kun taas tekstitilan menetelmä auttaa mallia oppimaan tokenien oikeat sijainnit. Koska generatiiviset vokenit MiniGPT-5-kehyksessä ohjataan suoraan kuvista, MiniGPT-5-kehys ei vaadi kuvien kattavaa kuvausta, mikä johtaa kuvausten puuttumiseen oppimisessa.

Tekstityön Generoiminen

MiniGPT-5-kehys seuraa kausaalista kielen mallintamisen menetelmää generoimaan sekä vokeneita että tekstejä tekstityössä yhdessä, ja koulutusvaiheessa kehittäjät liittävät vokenit maailmanlaajuisten kuvien sijaintiin ja kouluttavat mallin ennustamaan vokeneita tekstin generoimisessa.

Vokenien Ominaisuuksien Kartoittaminen Kuvan Generoimiseksi

Tekstityön generoimisen jälkeen kehys kohdistaa piilotetun tilan tulosteen teksti-kuvan generoimismallin teksti-ehdonnan ominaisuustilaan. Kehys tukee myös ominaisuuskartoittimia, jotka sisältävät kaksikerroksisen MLP-mallin, oppimiskykyisen dekooderiohjelman, ja nelikerroksisen koodarin-dekooderin transformer-mallin.

Kuvan Generoiminen LDM:llä tai Latenttisella Diffuusiomallilla

Denoising-prosessissa tarvittavien kuvien generoimiseksi kehys käyttää kartoitusominaisuuksia ehdollisena syötteenä. Kehys käyttää myös LDM:ää eli latenttista diffuusiomallia ohjaamiseen, ja koulutusvaiheessa maailmanlaajuinen kuva muutetaan latenttiominaisuudeksi esikoulutetun VAE:n avulla, minkä jälkeen kehittäjät saavat latentin kohinaominaisuuden lisäämällä jonkin verran kohinaa.

MiniGPT-5-kehyksen kattava lähestymistapa mahdollistaa kehittäjien ymmärtää ja generoida sekä visuaalista että tekstuaalista sisältöä erityisten tokenien, esikoulutettujen mallien kykyjen ja innovatiivisten koulutusmenetelmien avulla.

MiniGPT-5: Koulutus ja Tulokset

Työskennellessä MiniGPT-5-kehyksen parissa kehittäjät havaitsivat, että rajoitetun vuorovaikutteisen teksti- ja kuvatietojen koulutusaineiston suora koulutus voi johtaa kuvien heikkoon laatuun ja epäsovittuvuuteen kuvien ja tekstin välillä, johtuen merkittävää aihealueen siirtymää kuvan ja tekstin välillä. Tätä ongelmaa vastaan kehittäjät omaksuivat kaksi erilaista koulutusstrategiaa,

  1. Käyttäen luokitteluun perustuvaa ohjausmenetelmää, joka parantaa generatiivisten tokenien tehokkuutta diffuusioprosessissa.
  2. Toinen strategia on jaettu kahteen vaiheeseen
    1. Alkuvaihe, joka keskittyy karkeiden ominaisuuksien kohdistamiseen.
    2. Hienosäätelyvaihe, joka mahdollistaa ominaisuuksien oppimisen.

CFG tai Luokitteluun Perustuva Ohjaus

Idea hyödyntää CFG:ää monimodaalisessa generoimisessa tuli pyrkimyksestä parantaa johdonmukaisuutta ja logiikkaa generoiden kuvien ja tekstien välillä, ja CFG esitellään teksti-kuvan diffuusioprosessissa. Tämä menetelmä osoittaa, että kouluttamalla ehdollisessa ja ehdottomassa generoimisessa ehdollisen pudottamisen avulla, generatiivinen malli voi saavuttaa parannettuja ehdollisia tuloksia.

Kaksivaiheinen Koulutusstrategia

Kuvien ja tekstin generoimisen välisen merkittävän aihealueen siirtymän vuoksi MiniGPT-5-kehys käyttää kaksivaiheista strategiaa koulutukseen

  1. Yksimodaalinen kohdistusvaihe (UAS),
  2. Monimodaalinen oppimisvaihe (MLS).

Aluksi kehys kohdistaa kuvan generoimisen ominaisuudet vokenin ominaisuuksiin yksittäisissä teksti-kuvapareissa, joissa jokainen aineistokohta sisältää vain yhden tekstin ja yhden kuvan, ja teksti on yleensä kuvan otsikko. Tässä vaiheessa kehys sallii LLM:ille generoida vokeneita käyttämällä otsikkoa LLM:n syötteenä.

Kun UAS on suoritettu onnistuneesti, malli voi generoida kuvia yksittäisille tekstikuvauksille, mutta kamppailee vuorovaikutteisen kielen ja visuaalisen generoimisen kanssa, mukaan lukien teksti-kuvaparit ja monimutkainen päättely vaaditaan kuvan ja tekstin generoimiseen. Tätä haastetta vastaan kehittäjät ovat hienosäätäneet MiniGPT-5-kehystä PEFT-parametreillä vuorovaikutteisilla visio- ja kieliaineistoilla, kuten VIST:llä. Tässä vaiheessa kehys muodostaa kolme eri tehtävää aineistosta

  1. Tekstin vain generoiminen: Generoi liittyvän tekstin seuraavalle kuvalle.
  2. Kuvan vain generoiminen: Generoi liittyvän kuvan seuraavalle tekstille.
  3. Monimodaalinen generoiminen: Generoi teksti-kuvapareja annetun kontekstin avulla.

MiniGPT-5: Mittarit ja Tulokset

Arvioidakseen sen suorituskykyä monimodaalisessa generoimisessa kattavasti, MiniGPT-5-kehyskehittäjät vertaavat sen suorituskykyä muihin merkittäviin vertailumalleihin, kuten Divter, GILL ja hienosäätelty yksimodaalinen generoimismalli, ja vertailu on esitetty taulukossa alla.

MiniGPT-5-kehys ymmärtää, että monimodaalinen tuloste voi olla merkityksellinen kontekstin mukaan, mutta se voi poiketa todellisesta maailmasta, mikä on pääsyy, miksi MiniGPT-5-kehys sisältää myös ihmisten syötteitä arvioidakseen ja arvioimaan mallin suorituskykyä. Yleisesti MiniGPT-5-kehyksen tehokkuus monimodaalisissa tehtävissä mitataan kolmesta näkökulmasta.

  1. Kielen Jatkuvuus: Arvioidaan, onko generoitu sisältö sopusoinnussa annetun kontekstin kanssa.
  2. Kuvan Laatu: Arvioidaan generoidun kuvan merkitystä ja selkeyttä.
  3. Monimodaalinen Kohdentuminen: Määritetään, onko yhdistetty teksti-kuvatuloste sopusoinnussa alkuperäisen kontekstin kanssa.

VIST Lopullinen Arviointivaihe

Kokeiden ensimmäisessä vaiheessa MiniGPT-5-kehys pyrkii generoimaan vastaavat kuvat, ja taulukko alla yhteenvedon tuloksista, jotka saatiin tästä asetelmasta.

Kuten voidaan nähdä, MiniGPT-5-kehys kaikissa kolmessa asetelmassa pystyy ylittämään hienosäätelty SD2-kehyksen, korostaen MiniGPT-5-putken tehokkuutta.

Yllä oleva kuva vertaa MiniGPT-5-kehyksen suorituskykyä hienosääteltyyn MiniGPT-4-kehykseen S-BERT, Rouge-L ja Meteor -suorituskykymittareilla. Tulokset osoittavat, että generatiivisten vokenien käyttö ei vaikuta kehyksen suorituskykyyn negatiivisesti monimodaalisten ymmärtämistehtävissä. Tulokset osoittavat myös, että MiniGPT-5-kehys pystyy hyödyntämään pitkiä vaakasuoria monimodaalisia syöteohjeita laajalla aineistolla generoimaan laadukkaita ja johdonmukaisia kuvia ilman, että se heikentää alkuperäisen mallin monimodaalista ymmärtämiskykyä.

Yllä oleva taulukko vertaa kolmen kehyksen suorituskykyä 5 000 otoksella monimodaalisessa generoimisessa monimodaalisen kohdentumisen, kuvan laadun ja kielen jatkuvuuden näkökulmista. Kuten voidaan nähdä, MiniGPT-5-kehys ylittää kaksi muuta vertailumallia yli 70 prosentissa tapauksista. Toisaalta taulukko alla osoittaa MiniGPT-5-kehyksen suorituskyvyn CC3M-validointidatassa yksittäisten kuvien generoimisessa. Johtuen datarajoituksista, kehittäjät löysivät aukon vokenien kohdistamisessa Stable Diffusionin kanssa. Tästä huolimatta MiniGPT-5-kehys ylittää nykyisen GILL-vertailumallin kaikilla mittareilla.

Johtopäätös

Tässä artikkelissa olemme keskustelleet MiniGPT-5:stä, joka on vuorovaikutteinen kieli- ja visuaalisen generoinnin algoritmi, joka esittää “generatiivisten vokenien” käsitteen pyrkien hyödyntämään LLM:ien kykyä generoida monimodaalista dataa kohdistamalla suuren kielimallin esikoulutettuun teksti-kuvan generoimismalliin. Olemme keskustelleet MiniGPT-5-kehyksen olennaisista osista ja arkkitehtuurista sekä tuloksista, jotka osoittavat merkittäviä parannuksia suorituskyvyssä ja tehokkuudessa verrattuna nykyisiin vertailumalleihin ja nykyiseen tilaan. MiniGPT-5 pyrkii asettamaan uuden mittapuun monimodaalisen sisällön ja datan generoimisen alalla ja ratkaisemaan haasteita, joita aiemmat mallit ovat kohdanneet saman ongelman ratkaisemisessa.

Ammattina insinööri, sydämen vuoksi kirjailija. Kunal on tekninen kirjailija, jolla on syvä rakkaus ja ymmärrys AI: sta ja ML: stä, omistautunut yksinkertaistamaan monimutkaisia käsitteitä näissä aloissa hänen viihdyttävän ja informatiivisen dokumentaationsa kautta.