AI-modeller og platforme
SHOW-O: En transformer, der integrerer multimodal forståelse og generering
Signifikante fremskridt i store sprogmodeller (LLM’er) har inspireret udviklingen af multimodale store sprogmodeller (MLLM’er). Tidlige MLLM-forsøg, såsom LLaVA, MiniGPT-4 og InstructBLIP, demonstrerer bemærkelsesværdige multimodale forståelsesevner. For at integrere LLM’er i multimodale domæner har disse studier undersøgt projektion af funktioner fra en prætrænet modality-specifik encoder, såsom CLIP, ind i inputrummet for LLM’er, hvilket muliggør multimodal forståelse og resonnering inden for transformer-baggrunden. Selvom der er forskellige designvalg for MLLM’er, såsom vision-encodere, feature-alignment-adaptorer og datasæt, følger træningen af de fleste af disse modeller autoregressivt generationsparadigmet, som har vist sig effektivt for tekstgenerering i LLM’er. Trods deres stærke multimodale forståelsesevner fokuserer disse modeller primært på visuel perception og mangler evnen til at generere multimodale outputs ud over tekst.
Transformer-modeller har demonstreret stor succes i autoregressiv modeling i naturlig sprogbehandling. Inspireret af sådanne fremskridt har tidligere studier direkte anvendt den samme autoregressive modeling til at lære afhængigheden af billedpixels for billed- og video-generering. For eksempel anvender VideoPoet en decoder-only transformer-arkitektur til at syntetisere højkvalitetsvideoer fra multimodale inputs. Mere nyligt har LlamaGen vist, at en stor sprogmodel-arkitektur som Llama kan autoregressivt modelere billedtokens, og opnåde acceptable præstationer i klassen-betinget billedgenerering.
I denne artikel vil vi diskutere Show-O, en integreret transformer, der integrerer multimodal forståelse og generering. I modsætning til fuldt autoregressive modeller integrerer Show-O autoregressive og diskret diffusion-modelering til at adaptivt håndtere inputs og outputs af forskellige og blandede modaliteter. Den integrerede model støtter fleksibelt en bred vifte af vision-sprog-opgaver, herunder visuel spørgsmålssvar, tekst-til-billed-generering, tekst-guidet inpainting/extrapolation og mixed-modality-generering. Over forskellige benchmarks demonstrerer Show-O sammenlignelige eller overlegne præstationer i forhold til eksisterende enkeltmodeller med en tilsvarende eller større antal parametre, hvilket fremhæver dens potentiale som en næste-generations grundmodel.
I dette rammeværk er modellen opgaven at forudsige Gaussisk støj tilføjet til de kontinuerte latente repræsentationer. I modsætning hertil anvender andre modeller, såsom D3PM, Mask-predict, ARDM og MaskGIT, en diskret korruptionsproces som alternativ til Gaussisk diffusion. Specifikt repræsenteres et billede som en sekvens af diskrete tokens ved hjælp af billedtokenisatorer, hvor hver token er associeret med en kategorisk label. Token-vis distributionen omdannes til en uniform distribution gennem en stokastisk sampling-proces. Under træning maskeres en del af disse tokens tilfældigt, og modellen trænes til at forudsige de originale værdier af de masked tokens. I dette arbejde anvender Show-O diskret diffusion-modelering til visuel generering.
SHOW-O: Integrerende multimodal forståelse og generering
Over de seneste år er der opstået betydelige fremskridt i de to nøglepiller for multimodal intelligens: forståelse og generering. For multimodal forståelse har Multimodale store sprogmodeller (MLLM’er) som LLaVA demonstreret exceptionelle evner i vision-sprog-opgaver såsom visuel spørgsmålssvar (VQA). For visuel generering har støj-diffusion-sandsynlighedsmodeller (DDPM’er) revolutioneret traditionelle generative paradigmer og opnået uhørt præstationer i tekst-til-billede/video-generering.
Givet disse præstationer i enkeltfag, er det naturligt at udforske potentialet for at kombinere dem. Senere arbejder har forsøgt at samle ekspermodeller fra disse to forskellige domæner til at danne en integreret system, der kan håndtere både multimodal forståelse og generering. Men eksisterende forsøg involverer ofte separate modeller for forståelse og generering. For eksempel anvender NExT-GPT en basis-sprogmodel for multimodal forståelse, men kræver en ekstra prætrænet diffusion-model for billedgenerering. Dette rejser spørgsmålet: kan en enkelt transformer håndtere både multimodal forståelse og generering?
For nyligt har Chameleon demonstreret, at dette er muligt. Specifikt tillader Chameleon fusionen af forskellige modaliteter til at generere både tekst- og billedtokens gennem autoregressiv modeling. Men det er mindre klart, om det er optimalt at modelere billed-patches eller -pixels på samme måde. En nøglebottleneck for autoregressivt at forudsige et billede er det store antal sampling-trin, der kræves, især når man har med højopløsningsbilleder at gøre. Kontinuerte diffusion-modeller har vist overlegne præstationer i visuel generering i forhold til autoregressive modeller.
Dette fører os til at udforske, om en enkelt transformer kan integrere både autoregressiv og diffusion-modelering. Show-O forestiller sig et nyt paradigm, hvor tekst repræsenteres som diskrete tokens og modeleres autoregressivt, mens kontinuerte billed-pixels modeleres ved hjælp af støj-diffusion. Men at integrere disse to forskellige teknikker i en enkelt netværk er ikke trivialt på grund af forskellene mellem diskrete tekst-tokens og kontinuerte billed-repræsentationer. Yderligere afhænger diffusion-modeller typisk af to separate modeller: en tekst-encoder og en støj-reduktions-netværk.
For at løse dette introducerer Show-O en ny integreret model, der kan håndtere både multimodal forståelse og generering-opgaver ved hjælp af blandet autoregressiv og diffusion-modelering. Show-O er bygget på en prætrænet LLM og udnytter dens autoregressive modeleringsevner til tekst-baseret resonnering. Inspireret af andre arbejder anvender Show-O diskret støj-diffusion til at modelere billed-tokens i stedet for kontinuerte repræsentationer. Yderligere eliminerer Show-O behovet for en ekstra tekst-encoder ved at indekodere tekst-betinget information. Ved at anvende tekst- og billed-tokenisatorer kan Show-O behandle forskellige input-data og opgaver og give svar autoregressivt for vision-sprog-opgaver og generere billeder ved hjælp af diskret støj-diffusion.
Show-O demonstrerer sammenlignelige eller bedre præstationer end enkelt-modeller med en tilsvarende eller større antal parametre over forskellige benchmarks. I modsætning til autoregressiv billedgenerering kræver Show-O-rammeværket omkring 20 gange færre sampling-trin, hvilket gør det inherent hurtigere. Yderligere understøtter Show-O-rammeværket downstream-applikationer som tekst-guidet inpainting og extrapolation uden krav om finjustering, som demonstreret i følgende billede.

Show-O har også potentialet for mixed-modality-generering, såsom interleave-video-keyframe-generering med tekstbeskrivelser, og viser løfte for lang-forms-video-generering. Yderligere udforsker Show-O-rammeværket impakten af diskrete og kontinuerte billed-repræsentationer på multimodal forståelse og tilbyder indsigt i fremtidige integrerede model-designs.
Følgende figur præsenterer en sammenligning af model-karakteristika mellem Show-O-rammeværket og eksisterende metoder over forskellige domæner. Show-O står ud som en integreret model, der integrerer avancerede teknikker til både multimodal forståelse og generering.

I sammenfattende form er hovedbidragene i denne artikel følgende:
- SHOW-O er en integreret model, der integrerer multimodal forståelse og generering ved hjælp af en enkelt transformer.
- SHOW-O integrerer autoregressiv og diskret diffusion-modelering inden for en enkelt transformer, der håndterer både tekst og billeder effektivt.
- SHOW-O-rammeværket overgår eller matcher enkelt-baselinje-modeller med en tilsvarende eller større antal parametre over multimodal forståelse og genererings-benchmarks.
- SHOW-O understøtter downstream-applikationer som tekst-guidet inpainting og extrapolation uden krav om finjustering og demonstrerer potentialet for mixed-modality-generering.
- SHOW-O udforsker impakten af forskellige typer af repræsentationer og tilbyder værdifuld indsigt i forbedring af multimodal forståelse i integrerede modeller.
I de seneste år er der blevet fokuseret på integrerede multimodale sprogmodeller, der kan håndtere både forståelse og generering. Nogle forsøg anvender kontinuerte repræsentationer afbilder, der er interleave med tekst-tokens for autoregressiv modeling til at generere billeder. SEED-X foreslår en integreret og fleksibel grund-model, der kan håndtere både multimodal forståelse og generering-opgaver. I denne tilgang kombineres kontinuerte billed-repræsentationer fra CLIP-ViT-encoderen med tekst-tokens og føres ind i en stor sprogmodel (LLM) for at udføre næste-ord-forudsigelse og billed-repræsentations-regression. Chameleon introducerer en familie af token-baserede mixed-modal-modeller, der kan både forstå og generere billeder. Denne tilgang repræsenterer alle modaliteter som diskrete tokens og anvender en integreret transformer-baseret arkitektur og træner modellen fra scratch i en end-to-end-måde. I sammenligning anvender Show-O også diskrete tokens til at repræsentere alle modaliteter, men anvender en diskret diffusion-proces i stedet for autoregressiv modeling til visuel generering.
SHOW-O: Metodologi og Arkitektur
Det primære mål bag Show-O-rammeværket er at udvikle en integreret model, der kan håndtere både multimodal forståelse og generering. At udvikle en sådan integreret model stiller betydelige udfordringer, med kerneproblemer, der drejer sig om: i) definition af modellens input/output-rum; ii) integration af forskellige typer input-data fra forskellige modaliteter; iii) integration af både autoregressiv og diffusion-modelering inden for en enkelt transformer; og iv) effektiv træning af en sådan integreret model.
Show-O løser disse udfordringer med følgende løsninger:
- Show-O konstruerer input/output-rummet ved at tokenisere tekst- og billed-data til diskrete tokens.
- Show-O introducerer en standard-arkitektur og en integreret prompt-strategi til at strukturere input-data og modaliteter.
- Show-O demonstrerer, hvordan man kan inkorporere både autoregressiv og diffusion-modelering inden for en enkelt transformer.
- Show-O præsenterer en tre-trins træningspipeline til at træne den integrerede model effektivt.
Tokenisering
Givet, at den foreslåede Show-O er bygget på prætrænede LLM’er, er det naturligt at udføre integreret læring i det diskrete rum. Ved at opretholde en integreret ordforråd, der inkluderer diskrete tekst- og billed-tokens, er Show-O opgaven at forudsige diskrete tokens.
Tekst-Tokenisering
Show-O er baseret på en prætrænet LLM, og den samme tokenisator anvendes til tekst-data-tokenisering uden nogen ændringer.
Billed-Tokenisering
Følgende MAGVIT-v2 træner Show-O en lookup-fri kvantizer ved hjælp af omkring 35M billed-data. Kvantoren opretholder en kodebog på størrelse 8.192 og encoder billeder af 256×256 opløsning til 16×16 diskrete tokens. MAGVIT-v2 er valgt for sin lette finjustering, hvilket gør det egnet som video-tokenisator med tidskomprimeringsfunktion, et aspekt, som Show-O planlægger at udforske i fremtiden. En alternativ tilgang er at anvende forskellige tokenisatorer til forståelse og generering. Inspireret af eksisterende studier anvender Show-O også kontinuerte billed-repræsentationer fra den prætrænede MAGVIT-v2 og CLIP-ViT-encoder til at udforske forbedringer af multimodal forståelse.

Arkitektur
Show-O arver arkitekturen fra eksisterende LLM’er uden nogen arkitektur-ændringer, bortset fra at forhænge en QK-Norm-operation til hver attention-lag. Show-O er initialiseret med vægten af en prætrænet LLM og udvider størrelsen af indlejring-laget ved at inkorporere 8.192 nye lærbare indlejringer til diskrete billed-tokens. I modsætning til state-of-the-art diffusion-modeller, der kræver en ekstra tekst-encoder, indekoderer Show-O tekst-betinget information for tekst-til-billed-generering.
Integreret Prompt-strategi
For at udføre integreret læring på multimodal forståelse og generering anvender Show-O en integreret prompt-strategi til at strukturere forskellige typer input-data. Givet en billed-tekst-par (x, y) er det først tokeniseret til M billed-tokens og N tekst-tokens af billed- og tekst-tokenisatorerne. Tokensene er derefter formet til en input-sekvens i henhold til opgave-typen, som illustreret i følgende figur.

Ved at anvende denne prompt-design kan Show-O effektivt indekodere forskellige input-data til multimodal forståelse, tekst-til-billed-generering og mixed-modality-generering som sekventielle data. Dette setup muliggør integreret læring til at operere sammenhængende over sekvenser for disse forskellige opgaver. Når den er trænet, kan Show-O promptes til at håndtere en bred vifte af vision-sprog-opgaver, herunder visuel spørgsmålssvar og tekst-til-billed-generering.
Omnipotent Attention-mekanisme
I modsætning til eksisterende arbejder, der kun modelerer sekvenser autoregressivt, introducerer Show-O en omnipotent attention-mekanisme, der muliggør modelering af forskellige typer signaler på forskellige måder. Denne omfattende attention-mekanisme skifter adaptivt mellem kausale og fulde attention-baseret på input-sekvensens format. Følgende figur illustrerer eksempler på omnipotent attention for forskellige input-sekvenser.

Specifikt behandler Show-O tekst-tokens i sekvensen via kausale attention, mens billed-tokens behandles ved hjælp af fuld attention, hvilket tillader hver token at omfattende interagere med alle andre. I multimodal forståelse kan tekst-tokens opmærke alle forudgående billed-tokens, mens i tekst-til-billed-generering kan billed-tokens interagere med alle forudgående tekst-tokens. Omnipotent attention fastholder tekst-reasoneringskundskaben fra den prætrænede LLM og forbedrer effektiviteten af billed-generering ved at reducere sampling-trin. Yderligere understøtter det forskellige downstream-applikationer, såsom inpainting og extrapolation, uden krav om finjustering. Når kun tekst-tokens er til stede, returnerer mekanismen til kausale attention.
SHOW-O: Eksperimenter og Resultater
Følgende tabel præsenterer multimodal forståelsesevnen for Show-O på offentlige benchmarks, såsom billed-underskrift og visuel spørgsmålssvar-opgaver.

Den aktuelle version af Show-O er bygget på Phi-1.5, og derfor fungerer Show-O’s forståelses-konterpart, LLaVA-v1.5-Phi-1.5, som den direkte baseline. Show-O demonstrerer sammenlignelige præstationer i alle evaluering-målinger i forhold til baseline LLaVA-v1.5-Phi-1.5, der er dedikeret udelukkende til multimodal forståelse. Dette demonstrerer det store potentiale for Show-O-rammeværket til at integrere multimodal forståelse og generering inden for en enkelt transformer. Når sammenlignet med forståelses-modeller som InstructBLIP, Qwen-VL-Chat og mPLUG-Owl2, opnår Show-O, på trods af at have en meget mindre modelstørrelse, konkurrencedygtige præstationer på POPE-, MME-, Flickr30k- og VQAv2-benchmarks og performer bedre på GQA-benchmarket. Når sammenlignet med integrerede modeller med betydeligt flere parametre, såsom NExT-GPT-13B og Chameleon-34B, opnår Show-O også stærke præstationer på Flickr30k-benchmarket og performer meget bedre på VQAv2-benchmarket.
Givet disse lovende resultater ses Show-O som et potentiale næste-generations grundmodel for at integrere forståelse og generering. Disse resultater demonstrerer også potentialet for at skala Show-O til at opnå state-of-the-art-præstationer.
Kvalitative Sammenligninger
Vi præsenterer kvalitative sammenligninger med diffusion-baserede modeller, såsom SDv1.5, SDXL og den autoregressive-baserede model LlamaGen, samt integrerede modeller som LWM og SEED-X, som demonstreret i følgende figur.

Show-O demonstrerer evnen til at generere realistiske billeder med konsistent indhold beskrevet i både korte og lange tekstprompts. I sammenligning med SDv1.5 og LlamaGen viser Show-O bedre visuel kvalitet og stærkere billed-tekst-alignment. For eksempel i den anden kolonne fejler både SDv1.5 og LlamaGen at fuldt ud forstå tekstprompten og mangler attributter såsom “sunset” og “blå kupler” i de genererede billeder. I sammenligning med SDXL viser Show-O sammenlignelige visuelle kvaliteter og alignment, som set i eksempler som “en rally-bil-race” og “stunning kontrast mod den vibrerende solnedgang.”

Tekst-guidet Inpainting og Extrapolation
Show-O understøtter naturligt tekst-guidet inpainting og extrapolation uden krav om finjustering. Følgende figur illustrerer flere eksempler.

Øverst i figuren kan Show-O, givet et input-billede og en inpainting-maske, omdanne en rød vogn til en blå sportsvogn med glatte kurver og tonede vinduer baseret på en brugerdefineret tekstprompt. Show-O kan også extrapolere det originale billede horisontalt eller vertikalt baseret på den givne tekstprompt. For eksempel i den anden række extrapolerer Show-O et billede ved at tilføje nye objekter, såsom “røde vilde blomster.” Pixelene i både inpainted og extrapolatede regioner forbliver konsistente med det originale billede. Disse eksempler demonstrerer tydeligt de indbyggede fordelene ved Show-O i forhold til autoregressive modeller for downstream-applikationer.
Endelige Tanker
I denne artikel har vi talt om Show-O, en integreret transformer, der integrerer multimodal forståelse og generering. I modsætning til fuldt autoregressive modeller integrerer Show-O autoregressiv og diskret diffusion-modelering til at adaptivt håndtere inputs og outputs af forskellige og blandede modaliteter. Den integrerede model støtter fleksibelt en bred vifte af vision-sprog-opgaver, herunder visuel spørgsmålssvar, tekst-til-billed-generering, tekst-guidet inpainting/extrapolation og mixed-modality-generering. Over forskellige benchmarks demonstrerer Show-O sammenlignelige eller overlegne præstationer i forhold til eksisterende enkeltmodeller med en tilsvarende eller større antal parametre, hvilket fremhæver dens potentiale som en næste-generations grundmodel. I dette rammeværk er modellen opgaven at forudsige Gaussisk støj tilføjet til de kontinuerte latente repræsentationer. I modsætning hertil anvender andre modeller, såsom D3PM, Mask-predict, ARDM og MaskGIT, en diskret korruptionsproces som alternativ til Gaussisk diffusion. Show-O er den første til at integrere autoregressiv og diskret diffusion-modelering, hvilket muliggør håndtering af forskellige modaliteter på forskellige måder. Omfattende eksperimentelle resultater demonstrerer, at Show-O er sammenlignelig med eller endda bedre end enkelt-ekspert-modeller over en bred vifte af vision-sprog-opgaver. Dette fremhæver dens potentiale som en næste-generations grundmodel.












