AI-modeller og plattformer
MiniGPT-5: Interleaved Visjon- Og Språkgenerering via Generative Vokens
Over de siste årene har store språkmodeller (LLM) fått oppmerksomhet fra AI-utviklere verden over på grunn av gjennombrudd i naturlig språkbehandling (NLP). Disse modellene har satt nye standarder for tekstgenerering og forståelse. Likevel, til tross for fremgangen i tekstgenerering, er det fortsatt en utfordring å produsere bilder som sammenhenger med tekstlige narrativer. For å løse dette problemet, har utviklere introdusert en innovativ visjon- og språkgenereringsmetode basert på “generative vokens”, som broer gapet for harmoniserte tekst- og bildeutdata.
Grunnlaget for MiniGPT-5 er en to-trinns treningsstrategi som fokuserer tungt på beskrivingsfri multimodal datagenerering, der treningsdataene ikke krever noen omfattende bildebeskrivelser. Videre, for å forbedre modellens integritet, inkorporerer modellen en klassifikator-fri veiledningssystem som forbedrer effektiviteten av en voken for bildegenerering. I den innledende fasen, har MiniGPT-5-rammen demonstrert kraftig ytelse og en betydelig forbedring over baseline-modellen Divter, som er trent på MMDialog-datasettet, og har konsekvent demonstrert sin evne til å levere sammenlignbare og til og med overlegne multimodale utdata i menneskelige evalueringer utført på VIST-datasettet, som videre høydepunkter sin ytelse og effisiens over forskjellige standarder.
MiniGPT5: En Innføring
Med de nyeste utviklingene av LLM-rammene, og applikasjoner basert på disse LLM-rammene, er multimediainnkapsling et felt som har sett en økning i popularitet, og det er også en vital fremgang som gir kraft til en rekke applikasjoner fra state-of-the-art innholdsskapingsverktøy til cutting-edge multimodale dialogagenter. Med kontinuerlig forskning og utvikling, er språk- og visjonsmodellene nå på et punkt der arbeidet går på å muliggjøre dem å generere både tekst og visuell data sammenhengende. Evnen til LLM å generere multimodal data sammenhengende, vil hjelpe til å forbedre interaksjoner over forskjellige domener, inkludert e-handel, media og virtuell virkelighet.

Til slutt, er målet å tillate modellene å syntetisere, gjenkjenne og respondere på en sammenhengende og logisk måte, ved å bruke både tekstlige og visuelle modaliteter, og spille en avgjørende rolle i å harmonisere informasjonsflyten og skape logiske og sammenhengende narrativer. Behovet for å oppnå en blanding av tekstlige og visuelle modaliteter, er primært drevet av behovet for mer flytende, integrerte og interaktive multimodale interaksjoner i LLM, og til slutt å oppnå den alternerende språk- og visjonsgenerering. Likevel, å oppnå integrerte og interaktive multimodale interaksjoner i LLM, er en komplisert oppgave som er omgitt av mange utfordringer, inkludert
- Selv om nåværende LLM er ekstremt effektive og kapable når det gjelder tekstgenerering og tekst-bilde-par, leverer de ikke tilfredsstillende ytelse når det gjelder å generere bilder.
- Utviklingen av disse visjon- og språkmodellene er avhengig av emne-fokusert data, noe som gjør det vanskelig for modellene å justere den genererte teksten med de respektive bildene.
- Til slutt, er det et behov for å komme opp med mer effektive strategier, ettersom at når deres evner øker, øker også minnekravene til LLM, spesielt når de utfører nedstrømsoppgaver.
MiniGPT-5-rammen, en interleaved språk- og visjonsgenereringsalgoritmeteknikk, introduserer konseptet “generative vokens” i et forsøk på å løse de ovennevnte utfordringene. MiniGPT-5-rammen foreslår en ny tilnærming for multimodal datagenerering ved å kombinere store språkmodeller med Stable Diffusion-teknikker, ved å bruke spesielle visuelle token. Den foreslåtte to-trinns treningsmetoden brukt av MiniGPT-5-rammen, høydepunkter viktigheten av en grunnleggende fase uten beskrivelser, og forbereder modellen til å levere effektiv ytelse, selv i scenarier med begrensede data.

Men det som skiller MiniGPT-5-modellen fra nåværende eksisterende rammeverk, er at de generiske trinnene i MiniGPT-5-rammen ikke består av domene-spesifikke annotasjoner. Videre, for å sikre at den genererte teksten og de respektive bildene er i harmoni med hverandre, deployer MiniGPT-5-rammen en dual-loss-strategi som videre forbedrer MiniGPT-5s tilnærming til å bruke klassifikator-fri veiledning og generative vokens. MiniGPT-5-rammen optimaliserer trenings-effisiens, og løser minnebegrensningene takket være deres parameter-effektive strategi for finjustering av modellen.
For å gi deg en rask sammenfatning, foreslår MiniGPT-5-rammen
- En metode som bruker multimodale koder som representerer en ny og generisk metode som historisk har vist seg å være mer effektiv enn tradisjonelle LLM, og bruker generative token sammen med Stable Diffusion-teknikker for å generere interleaved språk- og visuelle utdata.
- En dual-trinns treningsstrategi for generering av beskrivingsfri multimodal utdata, og inklusjon av klassifikator-fri veiledning under treningsfasen for å videre forbedre kvaliteten på den genererte data.
MiniGPT-5-modellen er inspirert av tidligere forskning og arbeid i feltene
- Tekst-til-bilde-generering: For å fasilitere transformasjonen av tekstlige beskrivelser til deres respektive visuelle representasjoner, og tekst-til-bilde-modeller.
- MLLM eller Multimodale Store Språkmodeller: Bruk av forhånds-trent LLM-modeller for å utforske deres anvendelser og effektivitet i generering av multimodal data.
- Multimodal generering med store språkmodeller: For å forbedre evnene til en LLM til å sammenhengende integrere språk- og visuell datagenerering.
MiniGPT-5: Metode, Arkitektur og Ramme
For å muliggjøre store språkmodeller med multimodale datagenererings-evner, introduserer MiniGPT-5-modellen en ramme som har som mål å integrere tekst-til-bilde-genereringsmodeller og forhånds-trent multimodale store språkmodeller. MiniGPT-5-rammen introduserer videre “generative vokens”, spesielle visuelle token som tillater utviklere å løse diskrepanser som oppstår over forskjellige domener, ved å kunne trenes direkte på rå bilder. For å videre forbedre kvaliteten på den multimodale data som genereres av LLM, introduserer MiniGPT-5-rammen en klassifikator-fri strategi kombinert med en avansert to-trinns treningsmetode. La oss se nærmere på MiniGPT-5-rammen.
Multimodal Inndata-trinn
Utviklingen av LLM i den senere tid har bragt LLMs multimodale forståelsesevner til lys, og muliggjort prosessering av bilder som en sekvensiell inndata. MiniGPT-5-rammen bruker spesielt designet generative vokens for å utgi visuelle egenskaper i et forsøk på å utvide LLMs multimodale forståelsesevner til multimodal datagenerering. Videre, bruker MiniGPT-5-rammen parameter-effektive og avanserte finjusterings-teknikker for multimodal utlæring med LLM-rammen.
Multimodal Koding
Den forhånds-trente visuelle koderen i MiniGPT-5-rammen transformerer hver inndata-bilde til en egenskap, og hver tekst-token er innbettet som en vektor, og inndata-egenskapene genereres når disse innbettelsene er konkatenerert med hverandre.
Tillegg av Vokens i Store Språkmodeller
Tradisjonelt, består store språkmodell-vokabularet bare av tekstlige token, og derfor måtte utviklerne som arbeidet med MiniGPT-5-rammen bro over gapet mellom den generative og den tradisjonelle LLM. MiniGPT-5-rammen introduserer en sett med spesielle token som generative token i vokabularet til LLM. Rammen utnytter deretter den skjulte utgangstilstanden til LLM for disse spesielle vokens for påfølgende bildegenerering, og innsettingen av interleavede bilder representeres av posisjonen til vokens.
PEFT eller Parameter-Effektiv Finjustering
PEFT eller Parameter-Effektiv Finjustering er et kritisk konsept som brukes til å trenere LLM, og likevel er anvendelsen av PEFT i multimodale settinger fortsatt uutforsket i stor utstrekning. MiniGPT-5-rammen bruker Parameter-Effektiv Finjustering over koderen i MiniGPT-4-rammen for å trenere modellen til å forstå instruksjoner bedre, og også forbedre modellens ytelse i en null-skudd- eller ny omgivelse.
Multimodal Utgangsgenerering
For å justere genereringsmodellen med generative token nøyaktig, formulerer MiniGPT-5-rammen en kompakt kartleggingsmodul for å matche dimensjoner, og inkorporerer overvåkings-tap, inkludert latent diffusjon-modell-tap og tekst-rom-tap. Den latente diffusjon-overvåkings-tapen justerer de respektive visuelle egenskapene med token direkte, mens tekst-rom-tapen hjelper modellen til å lære de riktige posisjonene til token. Fordi de generative vokens i MiniGPT-5-rammen er guidet direkte av bildene, trenger MiniGPT-5-rammen ikke bilder å ha en omfattende beskrivelse, noe som resulterer i en beskrivingsfri læring.
Tekst-Rom-Generering
MiniGPT-5-rammen følger den kausale språk-modell-metoden for å generere både vokens og tekst i tekst-rommet sammen, og under treningsfasen, legger utviklerne til vokens på posisjonen til grunn-sannhets-bildene, og trenere modellen til å forutsi vokens innenfor tekstgenerering.
Kartlegging av Voken-Egenskaper for Bildegenerering
Etter å ha generert tekst-rommet, justerer rammen den skjulte utgangstilstanden med tekst-til-bilde-genereringsmodellens tekst-betinget egenskaps-rom. Rammen støtter også en egenskaps-kartleggingsmodul som inkluderer en dual-lag-MPL-modell, en lærbart dekoder-egenskaps-sekvens, og en fire-lag-encoder-dekoder-transformator-modell.
Bildegenerering med LDM eller Latent Diffusjon-Modell
For å generere de nødvendige bildene i den avrensnings-prosessen, bruker rammen kartleggings-egenskapene som en betinget inndata. Rammen bruker også en LDM eller Latent Diffusjon-Modell for veiledning, og under treningsfasen, konverteres grunn-sannhets-bildet først til en latent-egenskap ved hjelp av en forhånds-trent VAE, og utviklerne får deretter den latente støy-egenskapen ved å legge til noen støy.
Den omfattende tilnærmingen som er deployert av MiniGPT-5-rammen, tillater utviklere å ha en sammenhengende forståelse og generering av både visuelle og tekstlige elementer, ved å bruke spesielle token, utnytte evnene til forhånds-trente modeller, og bruke innovative trenings-teknikker.
MiniGPT-5: Trenings- og Resultater
Når utviklerne arbeidet med MiniGPT-5-rammen, observerte de at trenings på en begrenset interleaved tekst- og bilde-datasett direkte, kunne resultere i bilder med redusert kvalitet og misjustering, gitt den betydelige domene-skiftet mellom bilde- og tekst-domener. For å mildne dette problemet, adopterte utviklerne to distinkte trenings-strategier,
- Inkludering av klassifikator-fri veiledningsteknikker som booster effektiviteten av generative token under diffusjons-prosessen.
- Den andre strategien er videre delt inn i to trinn
- En innledende for-trenings-fase som fokuserer primært på å justere grove egenskaper.
- En finjusterings-fase som fasiliteter egenskaps-læring.
CFG eller Klassifikator-Fri Veiledning
Idéen om å først utnytte CFG for multimodal generering, kom som et resultat av et forsøk på å forbedre sammenheng og logikk mellom de genererte bildene og tekstene, og CFG er introdusert under tekst-til-bilde-diffusjons-prosessen. Denne metoden observerer at ved å trenere på både ubetinget og betinget generering med betingelses-avslag, kan den generative modellen oppnå forbedrede betingede resultater.
To-Trinns Trenings-Strategi
Gitt den betydelige domene-skiftet mellom tekst-bilde-generering og ren tekst-generering, bruker MiniGPT-5-rammen en to-trinns strategi for trenings
- Unimodal Justerings-Trinn eller UAS,
- Multimodal Lærings-Trinn eller MLS.
Inledningsvis, justerer rammen bilde-genererings-egenskapene med voken-egenskapen i enkelt tekst-bilde-par-datasett, hvor hver data-eksempel inneholder bare en tekst og bare ett bilde, og teksten er vanligvis bilde-overskriften. I dette trinnet, tillater rammen LLM å generere vokens ved å bruke overskrifter som LLM-inndata.
Når UAS har blitt utført suksessfullt, kan modellen generere bilder for enkelt tekst-beskrivelser, men sliter med interleaved språk- og visjons-generering, inkludert tekst-bilde-par og komplisert resonnering er nødvendig for bilde- og tekst-generering. For å takle denne hindringen, har utviklerne videre finjustert MiniGPT-5-rammen ved å bruke PEFT-parametre ved å bruke interleaved visjon- og språk-datasett som VIST. Under dette trinnet, konstruerer rammen tre forskjellige oppgaver fra datasettet
- Tekst-Kun-Generering: Genererer den relaterte teksten gitt det neste bildet.
- Bilde-Kun-Generering: Genererer det relaterte bildet gitt den neste teksten.
- Multimodal Generering: Genererer tekst-bilde-par ved å bruke den gitte konteksten.
MiniGPT-5: Benchmark og Resultater
For å evaluere sin ytelse i multimodal generering omfattende, sammenligner MiniGPT-5-utviklings-teamet sin ytelse med andre fremtredende baseline-modeller, inkludert Divter, GILL og Fine-Tuned Unimodal Genererings-Modell, og sammenligningen er demonstrert i tabellen nedenfor.

MiniGPT-5-rammen forstår at den multimodale utgangen kan være meningsfull i konteksten, men kan avvike fra den faktiske virkeligheten, og det er derfor MiniGPT-5-rammen også inkorporerer menneskelige inndata for å evaluere og vurdere modellens ytelse. Overordnet, måles effektiviteten av MiniGPT-5-rammen for multimodale oppgaver ved å bruke tre perspektiver.
- Språk-Kontinuitet: Vurderer om den genererte teksten sammenhenger med den gitte konteksten sammenhengende.
- Bilde-Kvalitet: Vurderer eller evaluerer relevansen og klarheten til det genererte bildet.
- Multimodal Sammenheng: Bestemmer om den kombinerte tekst-bilde-utgangen er i harmoni med den innledende konteksten.
VIST Finalt Trinn-Evaluering
I den første fasen av eksperimentene, har MiniGPT-5-rammen som mål å generere de respektive bildene, og tabellen nedenfor summerer resultater fra denne innstillingen.

Som det kan ses, kan MiniGPT-5-rammen i alle tre innstillingene overgå den finjusterte SD2-rammen, og det høydepunkter effektiviteten av MiniGPT-5-pipeline.

Figuren ovenfor sammenligner ytelsen til MiniGPT-5-rammen med den finjusterte MiniGPT-4-rammen på S-BERT, Rouge-L og Meteor-ytelses-målinger. Resultatene indikerer at bruk av generative vokens ikke påvirker rammenes ytelse negativt når det gjelder å utføre multimodale forståelses-oppgaver. Resultatene viser også at MiniGPT-5-rammen er i stand til å utnytte lange horisontale multimodale inndata-eksempler over et bredt spekter av data for å generere høykvalitets- og sammenhengende bilder uten å kompromittere evnene til den opprinnelige modellen for multimodal forståelse.

Tabellen ovenfor sammenligner ytelsen til tre rammeverk på 5 000 eksempler for multimodal generering fra aspektene Multimodal Sammenheng, Bilde-Kvalitet og Språk-Kontinuitet. Som det kan observeres, overgår MiniGPT-5-rammen de to andre baseline-modellene i over 70% av tilfellene. På den andre siden, demonstrerer tabellen nedenfor ytelsen til MiniGPT-5-rammen på CC3M-validerings-datasettet for generering av enkelt-bilder. Takket være data-begrensninger, fant utviklerne en gap for voken-justering når de ble brukt med Stable Diffusion. Til tross for denne begrensningen, overgår MiniGPT-5-rammen den nåværende state-of-the-art-baseline GILL-rammen over alle målinger.


Konklusjon
I denne artikkelen, har vi talt om MiniGPT-5, en interleaved språk- og visjons-genererings-algoritme-teknikk som introduserer konseptet “generative vokens” i et forsøk på å utnytte evnene til store språkmodeller til å generere multimodal data ved å justere den store språkmodellen med en tekst-til-bilde-genereringsmodell som er forhånds-trent. Vi har talt om de essensielle komponentene og den overordnede arkitekturen til MiniGPT-5-rammen, sammen med resultater som indikerer betydelige forbedringer i ytelse og effisiens sammenlignet med nåværende baseline- og state-of-the-art-modeller. MiniGPT-5-rammen aspirerer til å sette en ny standard i multimodal innhold- og datagenererings-domenet, og har som mål å løse utfordringene som tidligere modeller har møtt når de forsøker å løse det samme problemet.












