AI-modeller og plattformer
SHOW-O: En transformer som forener multimodal forståelse og generering
Signifikante fremgang i store språkmodeller (LLM) har inspirert utviklingen av multimodale store språkmodeller (MLLM). Tidlige MLLM-forsøk, som LLaVA, MiniGPT-4 og InstructBLIP, demonstrerer bemerkelsesverdige multimodale forståelsesevner. For å integrere LLM i multimodale domener, har disse studiene utforsket prosjektering av funksjoner fra en forhånds trenet modality-spesifikk encoder, som CLIP, inn i inndatarommet for LLM, og muliggjort multimodal forståelse og resonnering innen transformer-ryggraden. Selv om det finnes ulike designvalg for MLLM, som visjon-encodere, funksjonsjusteringsadaptere og datasett, følger treningen for de fleste av disse modellene den autoregressive genereringsparadigmet, som har vist seg å være effektiv for tekstgenerering i LLM. Til tross for deres sterke multimodale forståelsesevner, fokuserer disse modellene primært på visuell persepsjon og mangler evnen til å generere multimodale utdata beyond tekst.
Transformer-modeller har demonstrert stor suksess i autoregressiv modellering i naturlig språkbehandling. Inspirert av slike fremgang, har tidligere studier direkte anvendt samme autoregressiv modellering for å lære avhengigheten av bildepixel for bilde- og videogenerering. For eksempel, bruker VideoPoet en decoder-only transformer-arkitektur for å syntetisere høykvalitetsvideoer fra multimodale inndata. Mer nylig har LlamaGen vist at en stor språkmodell-arkitektur som Llama kan autoregressivt modellere bilde tokens, og oppnå god ytelse i klassisk betinget bildegenerering.
I denne artikkelen, vil vi diskutere Show-O, en forent transformer som integrerer multimodal forståelse og generering. I motsetning til fullstendig autoregressive modeller, forener Show-O autoregressiv og diskret diffusjonsmodellering for å håndtere inndata og utdata av ulike og blandede modaliteter. Den forente modellen støtter en rekke visjon-språk-oppgaver, inkludert visuell spørsmål besvarelse, tekst-til-bilde-generering, tekst-basert innmalings-/ekstrapolering og blandet-modus-generering. Over ulike benchmark, demonstrerer Show-O sammenlignbar eller overlegen ytelse sammenlignet med eksisterende enkeltmodeller med en tilsvarende eller større antall parametre, og høydepunkter dets potensiale som en neste-generasjons grunnmodell.
I dette rammeverket, er modellen oppgitt å forutsi Gaussisk støy lagt til de kontinuerlige latente representasjonene. I motsetning, bruker andre modeller, som D3PM, Mask-predict, ARDM og MaskGIT, en diskret korrupteringsprosess som en alternativ til Gaussisk diffusjon. Spesifikt, representeres et bilde som en sekvens av diskrete tokens ved hjelp av bilde-tokenisatorer, med hver token assosiert med en kategorisk label. Token-wise distribusjonen transformeres til en uniform distribusjon gjennom en stokastisk sampelingsprosess. Under trening, er en del av disse tokenene tilfeldig maskert, og modellen er trenet for å forutsi de opprinnelige verdiene av de maskerte tokenene. I dette arbeidet, adopterer Show-O diskret diffusjonsmodellering for visuell generering.
SHOW-O: Forener multimodal forståelse og generering
Over de siste årene, har det kommet frem signifikante fremgang i de to nøkkel-pilarer av multimodal intelligens: forståelse og generering. For multimodal forståelse, Multimodale store språkmodeller (MLLM) som LLaVA har demonstrert eksepsjonelle evner i visjon-språk-oppgaver som visuell spørsmål besvarelse (VQA). For visuell generering, har støy-diffusjons-probabilistiske modeller (DDPM) revolusjonert tradisjonelle genererings-paradigmer, og oppnådd utenforliggende ytelse i tekst-til-bilde-/video-generering.
Gitt disse prestasjonene i enkelt-felt, er det naturlig å utforske potensialet for å koble dem sammen. Nylige arbeider har prøvd å samle ekspert-modeller fra disse to ulike domener for å danne en forent system som kan håndtere både multimodal forståelse og generering. Men, eksisterende forsøk involverer ofte separate modeller for forståelse og generering. For eksempel, bruker NExT-GPT en base-språkmodell for multimodal forståelse, men krever en ekstra forhånds-trenet diffusjonsmodell for bilde-generering. Dette stiller spørsmålet: kan en enkelt transformer håndtere både multimodal forståelse og generering?
Nylig, har Chameleon demonstrert at dette er mulig. Spesifikt, har Chameleon muliggjort fusjonen av ulike modaliteter for å generere både tekst- og bilde-tokens gjennom autoregressiv modellering. Mens det har mening å modellere tekst-tokens autoregressivt, er det mindre klart om modellering av bilde-patch eller -pixel på samme måte er optimalt. En nøkkel-bottleneck for autoregressivt å forutsi et bilde, er det store antallet sampling-trinn som kreves, spesielt når man håndterer høyere oppløsning-bilder. Kontinuerlige diffusjonsmodeller har vist overlegen ytelse i visuell generering sammenlignet med autoregressive.
Dette fører oss til å utforske om en enkelt transformer kan integrere både autoregressiv og diffusjonsmodellering. Show-O forestiller en ny paradigme hvor tekst representeres som diskrete tokens og modelleres autoregressivt, mens kontinuerlige bilde-pixel modelleres ved hjelp av støy-diffusjon. Men, å integrere disse to ulike teknikker i en enkelt nettverk er ikke-trivielt på grunn av forskjellene mellom diskrete tekst-tokens og kontinuerlige bilde-representasjoner. I tillegg, avhenger diffusjonsmodeller vanligvis av to separate modeller: en tekst-encoder og en støy-diffusjons-nettverk.
For å håndtere dette, introduserer Show-O en ny forent modell som kan håndtere både multimodal forståelse og generering ved hjelp av blandet autoregressiv og diffusjonsmodellering. Show-O er bygget på en forhånds-trenet LLM og utnytter dens autoregressiv modelleringsevner for tekst-basert resonnering. Inspirert av andre arbeider, bruker Show-O diskret støy-diffusjon for å modellere bilde-tokens i stedet for kontinuerlige representasjoner. I tillegg, kodar Show-O tekst-betinget informasjon innebygget, og eliminerer dermed behovet for ekstra tekst-encodere. Ved å bruke tekst- og bilde-tokenisatorer, kan Show-O håndtere ulike inndata og oppgaver, og gi svar autoregressivt for visjon-språk-oppgaver og generere bilder ved hjelp av diskret støy-diffusjon.
Show-O demonstrerer sammenlignbar eller overlegen ytelse sammenlignet med eksisterende enkelt-modeller med en tilsvarende eller større antall parametre, over ulike benchmark. I motsetning til autoregressiv bilde-generering, krever Show-O-rammeverket omtrent 20 ganger færre sampling-trinn, og er derfor innebygget raskere. I tillegg, støtter Show-O-rammeverket nedstrøms-applikasjoner som tekst-basert innmalings- og ekstrapolering uten å kreve fin-justering, som vist i følgende bilde.

Show-O har også potensialet for blandet-modus-generering, som for eksempel interleaved video-nøkkel-rame-generering med tekst-beskrivelser, og viser løfte for lang-forms video-generering. Videre, undersøker Show-O-rammeverket effekten av diskrete og kontinuerlige bilde-representasjoner på multimodal forståelse, og tilbyr innsikt for fremtidige forente modell-design.
Følgende figur presenterer en sammenligning av modell-karakteristika mellom Show-O-rammeverket og eksisterende metoder over ulike domener. Show-O utmerker seg som en forent modell som integrerer avanserte teknikker for både multimodal forståelse og generering.

I sammenfatning, er hovedbidragene i denne artikkelen følgende:
- Show-O er en forent modell som integrerer multimodal forståelse og generering ved hjelp av en enkelt transformer.
- Show-O forener autoregressiv og diskret diffusjonsmodellering innen en enkelt transformer, og håndterer både tekst og bilder effektivt.
- Show-O-rammeverket overgår eller matcher eksisterende enkelt-modeller med en tilsvarende eller større antall parametre, over ulike multimodale forståelse- og genererings-benchmark.
- Show-O støtter nedstrøms-applikasjoner som tekst-basert innmalings- og ekstrapolering uten å kreve fin-justering, og demonstrerer potensialet for blandet-modus-generering.
- Show-O undersøker effekten av ulike typer representasjoner, og tilbyr verdifulle innsikt for å forbedre multimodal forståelse i forente modeller.
I de siste årene, har en økende mengde studier fokusert på forente multimodale språkmodeller som kan både forstå og generere. Noen forsøk bruker kontinuerlige representasjoner sammen med tekst-tokens for autoregressiv modellering for å generere bilder. SEED-X foreslår en forent og fleksibel grunnmodell som kan håndtere både multimodal forståelse og generering. I denne tilnærmingen, kombineres kontinuerlige bilde-representasjoner fra CLIP ViT-encoderen med tekst-tokens og innføres i en stor språkmodell (LLM) for å utføre neste-ord-forutsielse og bilde-representasjons-regresjon. Chameleon introduserer en familie av token-baserte blandet-modus-modeller som kan både forstå og generere bilder. Denne tilnærmingen representerer alle modaliteter som diskrete tokens, og bruker en forent transformer-basert arkitektur og trener modellen fra scratch i en slutt-til-slutt-måte. I sammenligning, adopterer Show-O også diskrete tokens for å representere alle modaliteter, men bruker en diskret diffusjonsprosess i stedet for autoregressiv modellering for visuell generering.
SHOW-O: Metodologi og Arkitektur
Hovedmålet bak Show-O-rammeverket er å utvikle en forent modell som integrerer autoregressiv og diffusjonsmodellering for felles multimodal forståelse og generering. Å utvikle en slik forent modell stiller betydelige utfordringer, med sentrale problemer som dreier seg om: i) å definere modellens inndata- og utdata-rom; ii) å forene ulike typer inndata fra ulike modaliteter; iii) å integrere både autoregressiv og diffusjonsmodellering innen en enkelt transformer; og iv) å effektivt trene en slik forent modell.
Show-O håndterer disse utfordringene med følgende løsninger:
- Show-O konstruerer inndata- og utdata-rommet ved å tokenisere tekst- og bilde-data til diskrete tokens.
- Show-O introduserer sin standard-arkitektur og en forent prompt-strategi for å strukturere inndata og modaliteter.
- Show-O demonstrerer hvordan å inkorporere både autoregressiv og diffusjonsmodellering innen en enkelt transformer.
- Show-O presenterer en tre-stegs trening-pipeline for å effektivt trene den forente modellen.
Tokenisering
Gitt at den foreslåtte Show-O er bygget på forhånds-trente LLM, er det naturlig å utføre forent læring i det diskrete rommet. Ved å opprettholde en forent vokabular som inkluderer diskrete tekst- og bilde-tokens, er Show-O oppgitt å forutsi diskrete tokens.
Tekst-Tokenisering
Show-O er basert på en forhånds-trenet LLM, og samme tokenisator brukes for tekst-data-tokenisering uten noen modifikasjoner.
Bilde-Tokenisering
Følger MAGVIT-v2, trener Show-O en lookup-fri kvantiserer ved hjelp av omtrent 35M bilde-data. Kvantisereren opprettholder en kodebok på størrelse 8.192 og koder bilder av 256×256 oppløsning til 16×16 diskrete tokens. MAGVIT-v2 er valgt for sin enkelhet ved fin-justering, og er derfor egnet som en video-tokenisator med tids-komprimerings-evne, et aspekt Show-O planlegger å utforske i fremtiden. En alternativ tilnærming er å bruke ulike tokenisatorer for forståelse og generering. Inspirert av eksisterende studier, trekker Show-O også kontinuerlige bilde-representasjoner fra den forhånds-trente MAGVIT-v2 og CLIP-ViT-encoder for å utforske forbedringer i multimodal forståelse. I de følgende seksjonene, bruker standard-Show-O diskrete bilde-tokens som inndata for både multimodal forståelse og generering. For enkelhet, vil metodologi-seksjonene kun utdype standard-Show-O.

Arkitektur
Show-O arver arkitekturen til eksisterende LLM uten noen arkitektur-modifikasjoner, bortsett fra å forhånds-sette en QK-Norm-operasjon til hver oppmerksomhets-lag. Show-O er initialisert med vekter fra en forhånds-trenet LLM og utvider størrelsen på innlejring-laget ved å inkorporere 8.192 nye lærbare innlejring-er for diskrete bilde-tokens. I motsetning til state-of-the-art diffusjonsmodeller som krever en ekstra tekst-encoder, kodar Show-O tekst-betinget informasjon innebygget for tekst-til-bilde-generering.
Forent Prompting
For å utføre forent læring på multimodal forståelse og generering, bruker Show-O en forent prompt-strategi for å formatere ulike typer inndata. Gitt en bilde-tekst-par (x, y), er det først tokenisert til M bilde-tokens og N tekst-tokens av bilde- og tekst-tokenisatorer, henholdsvis. Tokenene er deretter formet til en inndata-sekvens i henhold til oppgave-typen, som vist i følgende figur.

Ved å bruke denne prompt-designen, kan Show-O effektivt kode ulike inndata for multimodal forståelse, tekst-til-bilde-generering og blandet-modus-generering som sekvensielle data. Denne oppsettet muliggjør forent læring å operere sammenhengende over sekvenser for disse ulike oppgavene. Når den er trenet, kan Show-O bli promptet for å håndtere en rekke visjon-språk-oppgaver, inkludert visuell spørsmål besvarelse og tekst-til-bilde-generering.
Omnisjons-mekanisme
I motsetning til eksisterende arbeider som kun modellerer sekvenser autoregressivt, introduserer Show-O en omnisjons-mekanisme som muliggjør modellering av ulike typer signaler på ulike måter. Denne omfattende oppmerksomhets-mekanismen skifter adaptivt mellom kausale og fullstendige oppmerksomheter basert på formatet på inndata-sekvensen. Følgende figur illustrerer eksempler på omnisjons-mekanisme for ulike inndata-sekvenser.

Spesifikt, håndterer Show-O tekst-tokens innen sekvensen via kausale oppmerksomheter, mens bilde-tokens håndteres ved hjelp av fullstendige oppmerksomheter, og lar hver token omfattende samhandle med alle andre. I multimodal forståelse, kan tekst-tokens oppmerke alle forrige bilde-tokens, mens i tekst-til-bilde-generering kan bilde-tokens samhandle med alle forrige tekst-tokens. Omnisjons-mekanismen beholder tekst-resonnerings-kunnskapen fra den forhånds-trente LLM og forbedrer effektiviteten av bilde-generering ved å redusere sampling-trinn. Videre, støtter den ulike nedstrøms-applikasjoner, som innmalings- og ekstrapolering, uten å kreve fin-justering. Når det bare gis tekst-tokens, standardiserer mekanismen til kausale oppmerksomheter.
SHOW-O: Eksperimenter og Resultater
Følgende tabell presenterer multimodal forståelses-evnen til Show-O på offentlige benchmark, som bilde-underskrift og visuell spørsmål besvarelse-oppgaver.

Den nåværende versjonen av Show-O er bygget på Phi-1.5, og derfor, tjener Show-Os forståelse-kun motpart, LLaVA-v1.5-Phi-1.5, som direkte sammenlignings-grunnlag. Show-O demonstrerer sammenlignbar ytelse i alle evaluering-målinger sammenlignet med LLaVA-v1.5-Phi-1.5, som er dedikert kun til multimodal forståelse. Dette demonstrerer det store potensialet for Show-O-rammeverket til å forene multimodal forståelse og generering innen en enkelt transformer. Når sammenlignet med forståelse-kun modeller som InstructBLIP, Qwen-VL-Chat og mPLUG-Owl2, oppnår Show-O, til tross for en mye mindre modell-størrelse, konkurrerende ytelse på POPE, MME, Flickr30k og VQAv2-benchmark, og utfører bedre på GQA-benchmark. Når sammenlignet med forente modeller med betydelig flere parametre, som NExT-GPT-13B og Chameleon-34B, oppnår Show-O også sterk ytelse på Flickr30k-benchmark og utfører mye bedre på VQAv2-benchmark.
Gitt disse lovende resultater, er Show-O forestilt som en potensiell neste-generasjons grunnmodell for å forene forståelse og generering. Disse resultater demonstrerer også potensialet for å skalerer Show-O for å oppnå state-of-the-art-ytelse.
Kvalitative Sammenligninger
Vi presenterer kvalitative sammenligninger med diffusjons-baserte modeller, som SDv1.5, SDXL og den autoregressiv-baserte modellen LlamaGen, samt forente modeller som LWM og SEED-X, som vist i følgende figur.

Show-O demonstrerer evnen til å generere realistiske bilder med konsistent innhold beskrevet i både korte og lange tekst-prompts. Sammenlignet med SDv1.5 og LlamaGen, viser Show-O bedre visuell kvalitet og sterkere bilde-tekst-sammenheng. For eksempel, i den andre kolonnen, feiler både SDv1.5 og LlamaGen i å fullstendig forstå tekst-prompten og mangler attributter som “solnedgang” og “blå kupler” i de genererte bildene. I sammenligning med SDXL, tilbyr Show-O sammenlignbar visuell kvalitet og sammenheng, som vist i eksempler som “en rally-bil-race” og “stunning kontrast mot den vibrerende solnedgangen.”

Tekst-basert Innmalings- og Ekstrapolering
Show-O støtter naturlig tekst-basert innmalings- og ekstrapolering uten å kreve noen fin-justering. Følgende figur illustrerer flere eksempler.

Øverst i figuren, gitt et inndata-bilde og en innmalings-maske, kan Show-O transformere en rød vogn til en blå sportsbil med elegante kurver og tonede vinduer basert på en bruker-tilbudt tekst-prompt. Show-O kan også ekstrapolere det opprinnelige bildet horisontalt eller vertikalt basert på den gitte tekst-prompten. For eksempel, i den andre raden, ekstrapolerer Show-O bildet ved å legge til nye objekter, som “røde ville blomster.” Pixelene i både innmalte og ekstrapolerte regioner forblir konsistente med det opprinnelige bildet. Disse eksemplene demonstrerer tydelig de innebygde fordeler med Show-O sammenlignet med autoregressiv modellering for nedstrøms-applikasjoner.
Slutt-tanker
I denne artikkelen har vi diskutert Show-O, en forent transformer som integrerer multimodal forståelse og generering. I motsetning til fullstendig autoregressive modeller, forener Show-O autoregressiv og diskret diffusjonsmodellering for å håndtere inndata og utdata av ulike og blandede modaliteter. Den forente modellen støtter en rekke visjon-språk-oppgaver, inkludert visuell spørsmål besvarelse, tekst-til-bilde-generering, tekst-basert innmalings- og ekstrapolering, og blandet-modus-generering. Over ulike benchmark, demonstrerer Show-O sammenlignbar eller overlegen ytelse sammenlignet med eksisterende enkelt-modeller med en tilsvarende eller større antall parametre, og høydepunkter dets potensiale som en neste-generasjons grunnmodell. I dette rammeverket, er modellen oppgitt å forutsi Gaussisk støy lagt til de kontinuerlige latente representasjonene. I motsetning, bruker andre modeller, som D3PM, Mask-predict, ARDM og MaskGIT, en diskret korrupteringsprosess som en alternativ til Gaussisk diffusjon. Show-O er den første til å forene autoregressiv og diskret diffusjonsmodellering, og muliggjør håndtering av ulike modaliteter på ulike måter. Omfattende eksperimentelle resultater demonstrerer at Show-O er sammenlignbar med, eller til og med bedre enn, enkelt-ekspert-modeller over en rekke visjon-språk-oppgaver, og høydepunkter dets potensiale som en neste-generasjons grunnmodell.












