AI-modeller och plattformar
SHOW-O: En enda transformer som förenar multimodal förståelse och generering
Signifikanta framsteg inom stora språkmodeller (LLM) har inspirerat utvecklingen av multimodala stora språkmodeller (MLLM). Tidiga MLLM-försök, såsom LLaVA, MiniGPT-4 och InstructBLIP, visar notabel multimodal förståelseförmåga. För att integrera LLM i multimodala domäner har dessa studier undersökt projicering av funktioner från en förtränad modalspecifik encoder, såsom CLIP, in i LLM:s ingångsrum, vilket möjliggör multimodal förståelse och resonemang inom transformer-ryggraden. Trots att det finns olika designval för MLLM, såsom vision-encoders, funktionella justeringsadapter och datamängder, följer utbildningen för de flesta av dessa modeller den autoregressiva generationsparadigmen, som har visat sig vara effektiv för textgenerering i LLM. Trots deras starka multimodala förståelseförmåga fokuserar dessa modeller främst på visuell perception och saknar förmågan att generera multimodala utdata utöver text.
Transformer-modeller har visat sig vara mycket framgångsrika i autoregressiv modellering inom naturligt språkbehandling. Inspirerade av sådan framgång har tidigare studier direkt tillämpat samma autoregressiva modellering för att lära sig beroendet av bildpixlar för bild- och videogenerering. Till exempel använder VideoPoet en decoder-endast transformer-arkitektur för att syntetisera högkvalitativa videor från multimodala ingångar. Mer nyligen har LlamaGen visat att en stor språkmodellarkitektur som Llama kan autoregressivt modellera bildtoken, med god prestanda i klass-villkorlig bildgenerering.
I den här artikeln kommer vi att diskutera Show-O, en enhetlig transformer som integrerar multimodal förståelse och generering. Till skillnad från fullt autoregressiva modeller förenar Show-O autoregressiv och diskret diffusionsmodellering för att anpassningsvis hantera ingångar och utgångar av olika och blandade modaliteter. Den enhetliga modellen stöder flexibelt en bred range av vision-språk-uppgifter, inklusive visuell frågebesvarande, text-till-bild-generering, text-styrd inmålning/extrapolering och blandad modalitet generering. Över olika benchmark-tester visar Show-O jämförbar eller överlägsen prestanda jämfört med existerande enskilda modeller med en ekvivalent eller större antal parametrar, vilket lyfter fram dess potential som en nästa generations grundmodell.
I den här ramen är modellen uppgiften att förutsäga Gaussiskt brus som lagts till de kontinuerliga latenta representationerna. I kontrast använder andra modeller, såsom D3PM, Mask-predict, ARDM och MaskGIT, en diskret korruptionsprocess som ett alternativ till Gaussisk diffusion. Specifikt representeras en bild som en sekvens av diskreta token med hjälp av bild-tokenisatorer, där varje token är associerad med en kategorisk etikett. Token-vis fördelningen omvandlas till en enhetlig fördelning genom en stokastisk urvalsprocess. Under utbildning maskeras en del av dessa token slumpmässigt, och modellen tränas för att förutsäga de ursprungliga värdena för de maskerade token. I det här arbetet antar Show-O diskret diffusionsmodellering för visuell generering.
SHOW-O: Förenar multimodal förståelse och generering
Under de senaste åren har signifikanta framsteg skett inom de två viktigaste pelarna för multimodal intelligens: förståelse och generering. För multimodal förståelse har Multimodala stora språkmodeller (MLLM) som LLaVA visat exceptionell förmåga i vision-språk-uppgifter såsom visuell frågebesvarande (VQA). För visuell generering har störningsdiffusionsmodeller (DDPM) revolutionerat traditionella generativa paradigm, med enastående prestanda i text-till-bild/videogenerering.
Givet dessa prestationer inom enskilda områden är det naturligt att undersöka potentialen att koppla samman dem. Nya arbeten har försökt att montera expertmodeller från dessa två olika domäner för att bilda en enhetlig modell som kan hantera både multimodal förståelse och generering. Men existerande försök involverar ofta separata modeller för förståelse och generering. Till exempel använder NExT-GPT en bas-språkmodell för multimodal förståelse men kräver en extra förtränad diffusionsmodell för bildgenerering. Detta väcker frågan: kan en enda transformer hantera både multimodal förståelse och generering?
Nyligen har Chameleon visat att detta är möjligt. Specifikt möjliggör Chameleon fusionen av olika modaliteter för att generera både text- och bildtoken genom autoregressiv modellering. Medan det är logiskt att modellera texttoken autoregressivt är det mindre klart om modellering av bildpixlar eller pixlar på samma sätt är optimalt. En viktig flaskhals för att förutsäga en bild autoregressivt är det stora antalet sampelsteg som krävs, särskilt när man hanterar högupplösta bilder. Kontinuerliga diffusionsmodeller har visat överlägsen prestanda i visuell generering jämfört med autoregressiva.
Detta leder oss att undersöka om en enda transformer kan integrera både autoregressiv och diffusionsmodellering. Show-O föreställer sig ett nytt paradigm där text representeras som diskreta token och modelleras autoregressivt, medan kontinuerliga bildpixlar modelleras med hjälp av störningsdiffusion. Men att integrera dessa två distinkta tekniker i en enda nätverksarkitektur är inte trivialt på grund av skillnaderna mellan diskreta texttoken och kontinuerliga bildrepresentationer. Dessutom förlitar sig diffusionsmodeller vanligtvis på två distinkta modeller: en text-encoder och en störningsnätverksmodell.
För att hantera detta introducerar Show-O en ny enhetlig modell som kan hantera både multimodal förståelse och generering med hjälp av blandad autoregressiv och diffusionsmodellering. Show-O byggs på en förtränad LLM och utnyttjar dess autoregressiva modelleringsegenskaper för textbaserat resonemang. Inspirerad av andra arbeten använder Show-O diskret störningsdiffusion för att modellera bildtoken istället för kontinuerliga representationer. Dessutom kodar Show-O implicit text-villkorsinformation, vilket eliminerar behovet av extra text-encoders. Genom att använda text- och bild-tokenisatorer kan Show-O bearbeta olika ingångsdata och uppgifter, och ge svar autoregressivt för vision-språk-uppgifter och generera bilder med hjälp av diskret störningsdiffusion.
Show-O visar jämförbar eller bättre prestanda än enskilda modeller med en ekvivalent eller större antal parametrar över olika benchmark-tester. Till skillnad från autoregressiv bildgenerering kräver Show-O-ramverket cirka 20 gånger färre sampelsteg, vilket gör det inneboende snabbare. Dessutom stöder Show-O-ramverket nedströmsapplikationer som text-styrd inmålning och extrapolering utan krav på finjustering, som visas i följande bild.

Show-O har också potentialen för blandad modalitet generering, såsom växelvis video-nyckelbildsgenerering med textbeskrivningar, vilket visar löfte för långformad videogenerering. Dessutom undersöker Show-O-ramverket effekten av diskreta och kontinuerliga bildrepresentationer på multimodal förståelse, vilket erbjuder insikter för framtida enhetliga modell-design.
Följande figur presenterar en jämförelse av modellkaraktäristika mellan Show-O-ramverket och existerande metoder över olika domäner. Show-O står ut som en enhetlig modell som integrerar avancerade tekniker för både multimodal förståelse och generering.

Sammanfattningsvis är de viktigaste bidragen i den här artikeln följande:
- Show-O är en enhetlig modell som integrerar multimodal förståelse och generering med en enda transformer.
- Show-O förenar autoregressiv och diskret diffusionsmodellering inom en enda transformer, hanterar både text och bilder effektivt.
- Show-O-ramverket presterar bättre eller lika bra som enskilda baseline-modeller med en ekvivalent eller större antal parametrar över multimodal förståelse och genereringsbenchmark-tester.
- Show-O stöder nedströmsapplikationer som text-styrd inmålning och extrapolering utan finjustering och visar potential för blandad modalitet generering.
- Show-O undersöker effekten av olika typer av representationer, vilket erbjuder värdefulla insikter för att förbättra multimodal förståelse i enhetliga modeller.
På senare tid har ett ökande antal studier fokuserat på enhetliga multimodala språkmodeller som kan hantera både förståelse och generering. Vissa ansträngningar använder kontinuerliga representationer växelvis med texttoken för autoregressiv modellering för att generera bilder. SEED-X föreslår ett enhetligt och mångsidigt grundsystem som kan hantera både multimodal förståelse och generering. I det här tillvägagångssättet kombineras kontinuerliga bildrepresentationer från CLIP-ViT-encodern med texttoken och matas in i en stor språkmodell (LLM) för att utföra nästa-ord-prediktion och bild-representations-regression. Chameleon introducerar en familj av token-baserade blandade modeller som kan både förstå och generera bilder. Detta tillvägagångssätt representerar alla modaliteter som diskreta token, använder en enhetlig transformer-baserad arkitektur och tränar modellen från scratch i en ände-till-ände-manner. I jämförelse antar Show-O också diskreta token för att representera alla modaliteter men använder en diskret störningsprocess istället för autoregressiv modellering för visuell generering.
SHOW-O: Metodik och Arkitektur
Det primära målet bakom Show-O-ramverket är att utveckla en enhetlig modell som integrerar autoregressiv och diffusionsmodellering för gemensam multimodal förståelse och generering. Att utveckla en sådan enhetlig modell medför betydande utmaningar, med centrala frågor som rör: i) definitionen av modellens ingångs/utgångsrum; ii) förening av olika typer av ingångsdata från olika modaliteter; iii) integration av både autoregressiv och diffusionsmodellering inom en enda transformer; och iv) effektiv utbildning av en sådan enhetlig modell.
Show-O hanterar dessa utmaningar med följande lösningar:
- Show-O konstruerar ingångs/utgångsrummet genom att tokenisera text- och bilddata till diskreta token.
- Show-O introducerar sin standard-arkitektur och en enhetlig prompt-strategi för att strukturera ingångsdata och modaliteter.
- Show-O visar hur man kan inkorporera både autoregressiv och diffusionsmodellering inom en enda transformer.
- Show-O presenterar en tre-stegs utbildningspipeline för att effektivt utbilda den enhetliga modellen.
Tokenisering
Eftersom den föreslagna Show-O byggs på förtränade LLM, är det naturligt att utföra enhetlig inlärning i det diskreta rummet. Genom att upprätthålla ett enhetligt ordförråd som inkluderar diskreta text- och bildtoken, är Show-O uppgiften att förutsäga diskreta token.
Text-tokenisering
Show-O byggs på en förtränad LLM, och samma tokenisator används för textdata-tokenisering utan några ändringar.
Bild-tokenisering
Följande MAGVIT-v2 tränar Show-O en sök-fri kvantifierare med hjälp av cirka 35M bilddata. Kvantifieraren upprätthåller en kod-bok på storlek 8 192 och kodar bilder med 256×256 upplösning till 16×16 diskreta token. MAGVIT-v2 väljs på grund av dess lätthet att finjustera, vilket gör den lämplig som en video-tokenisator med tidskomprimeringsförmåga, en aspekt som Show-O planerar att undersöka i framtiden. Ett alternativt tillvägagångssätt är att använda olika tokenisatorer för förståelse och generering. Inspirerad av existerande studier extraherar Show-O också kontinuerliga bildrepresentationer från den förtränade MAGVIT-v2 och CLIP-ViT-encodern för att undersöka förbättringar i multimodal förståelseförmåga. I följande avsnitt använder standard-Show-O diskreta bildtoken som ingång för både multimodal förståelse och generering. För enkelhetens skull kommer metodik-avsnitten att förklara endast standard-Show-O.

Arkitektur
Show-O ärver arkitekturen från existerande LLM utan några arkitektur-ändringar, förutom att en QK-Norm-operation läggs till i varje uppmärksamhetslager. Show-O initieras med vikterna från en förtränad LLM och utökar storleken på inbäddningslagret genom att inkorporera 8 192 nya lärande inbäddningar för diskreta bildtoken. Till skillnad från state-of-the-art diffusionsmodeller som kräver en extra text-encoder, kodar Show-O implicit text-villkorsinformation för text-till-bild-generering.
Enhetlig Prompt-strategi
För att utföra enhetlig inlärning på multimodal förståelse och generering använder Show-O en enhetlig prompt-strategi för att strukturera ingångsdata och modaliteter. Givet en bild-text-par (x, y) tokeniseras det först till M bildtoken och N texttoken av bild- och text-tokenisatorer. Token formar sedan en ingångssekvens enligt uppgiftstypen, som visas i följande figur.

Genom att använda den här prompt-designen kan Show-O effektivt koda olika typer av ingångsdata för multimodal förståelse, text-till-bild-generering och blandad modalitet generering som sekventiella data. Den här inställningen möjliggör enhetlig inlärning för att fungera smidigt över sekvenser för dessa olika uppgifter. När Show-O väl är tränad kan den.promptas för att hantera en bred range av vision-språk-uppgifter, inklusive visuell frågebesvarande och text-till-bild-generering.
Omnis-Attention Mekanism
Till skillnad från existerande arbeten som modellerar sekvenser autoregressivt endast, introducerar Show-O en omni-uppmärksamhetsmekanism, som möjliggör modellering av olika typer av signaler på olika sätt. Den här omfattande uppmärksamhetsmekanismen växlar adaptivt mellan orsakande och fullständig uppmärksamhet beroende på formatet på ingångssekvensen. Följande figur visar exempel på omni-uppmärksamhet för olika ingångssekvenser.

Specifikt bearbetar Show-O texttoken inom sekvensen via orsakande uppmärksamhet, medan bildtoken hanteras med hjälp av fullständig uppmärksamhet, vilket tillåter varje token att omfattande interagera med alla andra. I multimodal förståelse kan texttoken uppmärksamma alla tidigare bildtoken, medan i text-till-bild-generering kan bildtoken interagera med alla föregående texttoken. Omni-uppmärksamhet behåller text-reasoning-kunskapen från den förtränade LLM och förbättrar effektiviteten i bildgenerering genom att minska antalet sampelsteg. Dessutom stöder den olika nedströmsapplikationer, såsom inmålning och extrapolering, utan krav på finjustering. När endast texttoken ges, växlar mekanismen till orsakande uppmärksamhet.
SHOW-O: Experiment och Resultat
Följande tabell presenterar den multimodala förståelseförmågan hos Show-O på offentliga benchmark-tester, såsom bild-kapitels- och visuell frågebesvarande-uppgifter.

Den nuvarande versionen av Show-O byggs på Phi-1.5, och därför fungerar Show-O:s förståelse-endast motsvarighet, LLaVA-v1.5-Phi-1.5, som direkt baseline. Show-O visar jämförbar prestanda i alla utvärderings-mått jämfört med baseline LLaVA-v1.5-Phi-1.5, som är dedikerad enbart till multimodal förståelse. Detta visar den stora potentialen hos Show-O-ramverket för att förena multimodal förståelse och generering inom en enda transformer. När jämfört med förståelse-endast modeller som InstructBLIP, Qwen-VL-Chat och mPLUG-Owl2, visar Show-O, trots att den har en mycket mindre modellstorlek, konkurrenskraftig prestanda på POPE-, MME-, Flickr30k- och VQAv2-benchmark-testerna, och presterar bättre på GQA-benchmark-testet. När jämfört med enhetliga modeller med betydligt fler parametrar, såsom NExT-GPT-13B och Chameleon-34B, visar Show-O också stark prestanda på Flickr30k-benchmark-testet och presterar mycket bättre på VQAv2-benchmark-testet.
Givet dessa lovande resultat ses Show-O som en potentiell nästa generations grundmodell för att förena förståelse och generering. Dessa resultat visar också potentialen för att skala Show-O för att uppnå state-of-the-art-prestanda.
Kvalitativa Jämförelser
Vi presenterar kvalitativa jämförelser med diffusions-baserade modeller, såsom SDv1.5, SDXL och autoregressiv-baserade modeller som LlamaGen, samt enhetliga modeller som LWM och SEED-X, som visas i följande figur.

Show-O visar förmågan att generera realistiska bilder med konsekvent innehåll beskrivet i både korta och långa text-prompt. Jämfört med SDv1.5 och LlamaGen visar Show-O bättre visuell kvalitet och starkare bild-text-alignment. Till exempel i den andra kolumnen misslyckas både SDv1.5 och LlamaGen med att fullständigt förstå text-prompten och missar attribut som “solnedgång” och “blå kupoler” i de genererade bilderna. I jämförelse med SDXL visar Show-O jämförbar visuell kvalitet och alignment, som visas i exempel som “en rally-bil-tävling” och “stunning kontrast mot den vibrerande solnedgången”.

Text-styrd Inmålning och Extrapolering
Show-O stöder naturligt text-styrd inmålning och extrapolering utan krav på finjustering. Följande figur visar flera exempel.

Överst i figuren, givet en ingångs-bild och en inmålning-mask, kan Show-O omvandla en röd vagn-bil till en blå sport-bil med släta kurvor och tonade fönster baserat på en användar-angiven text-prompt. Show-O kan också extrapolera den ursprungliga bilden horisontellt eller vertikalt baserat på den givna text-prompten. Till exempel i den andra raden extrapolerar Show-O bilden genom att lägga till nya objekt, som “röda vilda blommor”. Pixel i både inmålade och extrapolerade områden förblir konsekventa med den ursprungliga bilden. Dessa exempel visar tydligt de inneboende fördelarna med Show-O jämfört med autoregressiva modeller för nedströmsapplikationer.
Slutliga Tankar
I den här artikeln har vi diskuterat Show-O, en enhetlig transformer som integrerar multimodal förståelse och generering. Till skillnad från fullt autoregressiva modeller förenar Show-O autoregressiv och diskret diffusionsmodellering för att anpassningsvis hantera ingångar och utgångar av olika och blandade modaliteter. Den enhetliga modellen stöder flexibelt en bred range av vision-språk-uppgifter, inklusive visuell frågebesvarande, text-till-bild-generering, text-styrd inmålning/extrapolering och blandad modalitet generering. Över olika benchmark-tester visar Show-O jämförbar eller bättre prestanda jämfört med existerande enskilda modeller med en ekvivalent eller större antal parametrar, vilket lyfter fram dess potential som en nästa generations grundmodell. I den här ramen är modellen uppgiften att förutsäga Gaussiskt brus som lagts till de kontinuerliga latenta representationerna. I kontrast använder andra modeller, såsom D3PM, Mask-predict, ARDM och MaskGIT, en diskret korruptionsprocess som ett alternativ till Gaussisk diffusion. Show-O är den första som förenar autoregressiv och diskret diffusionsmodellering, vilket möjliggör hantering av olika modaliteter på olika sätt. Omfattande experimentella resultat visar att Show-O är jämförbar med, eller till och med bättre än, enskilda expert-modeller över en bred range av vision-språk-uppgifter, vilket lyfter fram dess potential som en nästa generations grundmodell.












