AI-modellen en platforms
SHOW-O: Een enkele transformer die multimodale begrip en generatie verenigt
Er zijn significante vooruitgangen geboekt in grote taalmodellen (LLM’s). Deze vooruitgangen hebben geleid tot de ontwikkeling van multimodale grote taalmodellen (MLLM’s). Vroege MLLM-pogingen, zoals LLaVA, MiniGPT-4 en InstructBLIP, hebben aanzienlijke multimodale begripsvermogens getoond. Om LLM’s te integreren in multimodale domeinen, hebben deze studies onderzocht hoe kenmerken van een vooraf getrainde modale specifieke encoder, zoals CLIP, in de invoerruimte van LLM’s kunnen worden geprojecteerd, waardoor multimodale begrip en redenering binnen de transformer backbone mogelijk worden. Hoewel er verschillende ontwerpkeuzes zijn voor MLLM’s, zoals visie-encoders, functie-aligneringsadapters en datasets, houdt de training voor de meeste van deze modellen de autoregressieve generatieparadigma aan, wat effectief is gebleken voor tekstgeneratie in LLM’s. Ondanks hun sterke multimodale begripsvermogens, richten deze modellen zich voornamelijk op visuele perceptie en ontbreken ze de mogelijkheid om multimodale uitvoer te genereren die verder gaat dan tekst.
Transformermodellen hebben grote successen behaald in autoregressief modelleren in natuurlijke taalverwerking. Geïnspireerd door deze vooruitgang, hebben eerdere studies hetzelfde autoregressieve modelleren rechtstreeks toegepast om de afhankelijkheid van beeldpixels voor beeld- en videogeneratie te leren. Zo gebruikt VideoPoet een decoder-only transformerarchitectuur om hoge kwaliteit video’s te synthetiseren uit multimodale invoer. Onlangs heeft LlamaGen aangetoond dat een grote taalmodelarchitectuur zoals Llama autoregressief beeldtokens kan modelleren, waardoor een fatsoenlijke prestatie in klasse-voorwaardelijke beeldgeneratie wordt behaald.
In dit artikel zullen we Show-O bespreken, een verenigde transformer die multimodale begrip en generatie integreert. In tegenstelling tot volledig autoregressieve modellen, verenigt Show-O autoregressieve en discrete diffusiemodellering om invoer en uitvoer van verschillende en gemengde modaliteiten aan te passen. Het verenigde model ondersteunt flexibel een breed scala aan visie-taalkundige taken, waaronder visuele vraagbeantwoording, tekst-naar-beeldgeneratie, tekst-geleide inpainting/extrapolatie en gemengde modaliteit generatie. Over verschillende benchmarks heen toont Show-O een vergelijkbare of superieure prestatie ten opzichte van bestaande individuele modellen met een equivalent of groter aantal parameters, waardoor het potentieel heeft als een toekomstig fundamentmodel.
In dit kader wordt het model belast met het voorspellen van Gausiaanse ruis die aan de continue latentrepresentaties wordt toegevoegd. In tegenstelling tot andere modellen zoals D3PM, Mask-predict, ARDM en MaskGIT, gebruikt Show-O discrete diffusiemodellering voor visuele generatie.
SHOW-O: Vereniging van Multimodale Begrip en Generatie
In de afgelopen jaren zijn er significante vooruitgangen geboekt in de twee belangrijkste pijlers van multimodale intelligentie: begrip en generatie. Voor multimodale begrip hebben Multimodale Grote Taalmodellen (MLLM’s) zoals LLaVA aanzienlijke capaciteiten getoond in visie-taalkundige taken zoals visuele vraagbeantwoording (VQA). Voor visuele generatie hebben denoising diffusieprobabilistische modellen (DDPM’s) traditionele generatieparadigma’s gerevolutioneerd, waardoor ongekende prestaties in tekst-naar-beeld/video-generatie worden behaald.
Gezien deze prestaties in individuele domeinen, is het natuurlijk om de mogelijkheden van het verbinden van deze domeinen te onderzoeken. Recent onderzoek heeft geprobeerd om expertmodellen uit deze twee verschillende domeinen te combineren tot een verenigd systeem dat zowel multimodale begrip als generatie kan behandelen. Echter, bestaande pogingen omvatten vaak afzonderlijke modellen voor begrip en generatie. Zo gebruikt NExT-GPT een basis taalmodel voor multimodale begrip, maar vereist een aanvullend vooraf getraind diffusiemodel voor beeldgeneratie. Dit roept de vraag op: kan één enkele transformer zowel multimodale begrip als generatie behandelen?
Onlangs heeft Chameleon aangetoond dat dit mogelijk is. Chameleon maakt het mogelijk om verschillende modaliteiten te combineren om zowel tekst als beeldtokens te genereren door middel van autoregressief modelleren. Hoewel het zinvol is om teksttokens autoregressief te modelleren, is het minder duidelijk of het modelleren van beeldpixels of -patches op dezelfde manier optimaal is. Een belangrijk knelpunt bij het autoregressief voorspellen van een beeld is het grote aantal benodigde steekproeven, vooral bij het omgaan met hogeresolutiebeelden. Continue diffusiemodellen hebben een superieure prestatie getoond in visuele generatie in vergelijking met autoregressieve modellen.
Dit leidt ertoe dat we onderzoeken of een enkele transformer zowel autoregressieve als diffusiemodellering kan integreren. Show-O voorziet een nieuw paradigma waarin tekst wordt weergegeven als discrete tokens en autoregressief wordt gemodelleerd, terwijl continue beeldpixels worden gemodelleerd met behulp van denoising diffusie. Echter, het integreren van deze twee verschillende technieken in één netwerk is niet triviaal vanwege de verschillen tussen discrete teksttokens en continue beeldrepresentaties. Bovendien zijn diffusiemodellen afhankelijk van twee afzonderlijke modellen: een tekstencoder en een denoisingnetwerk.
Om dit aan te pakken, introduceert Show-O een nieuw verenigd model dat zowel multimodale begrip als generatie taken kan behandelen met behulp van gemengde autoregressieve en diffusiemodellering. Show-O is gebouwd op een vooraf getraind LLM en maakt gebruik van de autoregressieve modellering-capaciteiten voor tekstgebaseerde redenering. Geïnspireerd door andere onderzoeken, gebruikt Show-O discrete denoising diffusie om beeldtokens te modelleren in plaats van continue representaties. Bovendien codeert Show-O inherent tekstconditionele informatie, waardoor de noodzaak voor aanvullende tekstencoders wordt geëlimineerd. Door tekst- en beeldtokenizers te gebruiken, kan Show-O diverse invoergegevens en taken verwerken, waardoor het antwoorden kan geven voor visie-taalkundige taken en beelden kan genereren met behulp van discrete denoising diffusie.
Show-O toont een vergelijkbare of betere prestatie dan individuele modellen met een equivalent of groter aantal parameters over verschillende benchmarks, zonder fine-tuning te vereisen. In tegenstelling tot autoregressieve beeldgeneratie, vereist het Show-O-kader ongeveer 20 keer minder steekproeven, waardoor het inherent sneller is. Bovendien ondersteunt het Show-O-kader downstream-toepassingen zoals tekst-geleide inpainting en extrapolatie zonder fine-tuning te vereisen, zoals wordt aangetoond in de volgende afbeelding.

Show-O heeft ook het potentieel voor gemengde modaliteit generatie, zoals het genereren van videokeyframes met tekstbeschrijvingen, waardoor het veelbelovend is voor lange video-generatie. Bovendien onderzoekt het Show-O-kader de impact van discrete en continue beeldrepresentaties op multimodale begrip, waardoor inzichten worden geboden voor toekomstige verenigde modelontwerpen.
De volgende afbeelding toont een vergelijking van modelkenmerken tussen het Show-O-kader en bestaande methoden over verschillende domeinen. Show-O staat uit als een verenigd model dat geavanceerde technieken integreert voor zowel multimodale begrip als generatie.

In samenvatting zijn de belangrijkste bijdragen van dit artikel als volgt:
- SHOW-O is een verenigd model dat multimodale begrip en generatie integreert met behulp van één transformer.
- SHOW-O verenigt autoregressieve en discrete diffusiemodellering binnen één transformer, waardoor het zowel tekst als beelden effectief kan behandelen.
- Het Show-O-kader presteert beter of gelijk aan individuele basismodellen met een equivalent of groter aantal parameters over multimodale begrip- en generatiebenchmarks.
- SHOW-O ondersteunt downstream-toepassingen zoals tekst-geleide inpainting en extrapolatie zonder fine-tuning en toont potentieel voor gemengde modaliteit generatie.
- SHOW-O onderzoekt de impact van verschillende soorten representaties, waardoor waardevolle inzichten worden geboden voor het verbeteren van multimodale begrip in verenigde modellen.
In recente jaren is er een toenemend aantal studies geweest die zich richten op verenigde multimodale taalmodellen die zowel begrip als generatie kunnen behandelen. Sommige inspanningen gebruiken continue representaties die worden geïnterleerd met teksttokens voor autoregressieve modellering om beelden te genereren. SEED-X stelt een verenigd en veelzijdig fundament systeem voor dat zowel multimodale begrip als generatie taken kan behandelen. In deze benadering worden continue beeldrepresentaties van de CLIP ViT-encoder gecombineerd met teksttokens en ingevoerd in een groot taalmodel (LLM) om next-word predictie en beeldrepresentatie regressie uit te voeren. Chameleon introduceert een familie van token-gebaseerde gemengde modellen die zowel begrip als generatie van beelden kunnen behandelen. Deze benadering vertegenwoordigt alle modaliteiten als discrete tokens, waardoor een verenigd transformer-gebaseerd architectuur en een end-to-end trainingsmethode mogelijk worden. In vergelijking daarmee gebruikt Show-O ook discrete tokens om alle modaliteiten te vertegenwoordigen, maar maakt gebruik van een discrete diffusieproces in plaats van autoregressieve modellering voor visuele generatie.
SHOW-O: Methodologie en Architectuur
Het primaire doel van het Show-O-kader is om een verenigd model te ontwikkelen dat autoregressieve en diffusiemodellering integreert voor gezamenlijke multimodale begrip en generatie. Het ontwikkelen van een dergelijk verenigd model stelt significante uitdagingen, met kernproblemen die draaien om: i) het definiëren van de invoer-/uitvoerruimte van het model; ii) het verenigen van verschillende soorten invoergegevens van verschillende modaliteiten; iii) het integreren van zowel autoregressieve als diffusiemodellering in één transformer; en iv) het effectief trainen van een dergelijk verenigd model.
Show-O adresseert deze uitdagingen met de volgende oplossingen:
- Show-O construeert de invoer-/uitvoerruimte door tekst- en beeldgegevens in discrete tokens te tokeniseren.
- Show-O introduceert zijn standaardarchitectuur en een verenigde promptstrategie om invoergegevens en modaliteiten te structureren.
- Show-O demonstreert hoe zowel autoregressieve als diffusiemodellering binnen één transformer kunnen worden geïntegreerd.
- Show-O presenteert een drie-fasentrainingspijplijn om het verenigde model effectief te trainen.
Tokenisatie
Aangezien het voorgestelde Show-O is gebouwd op vooraf getrainde LLM’s, is het natuurlijk om verenigd leren uit te voeren in de discrete ruimte. Door een verenigd vocabulaire te behouden dat discrete tekst- en beeldtokens omvat, wordt Show-O belast met hetzelfde leerdoel: het voorspellen van discrete tokens.
Teksttokenisatie
Show-O is gebaseerd op een vooraf getraind LLM, en dezelfde tokenizer wordt gebruikt voor tekstgegevenstokenisatie zonder enige wijzigingen.
Beeldtokenisatie
Volgend op MAGVIT-v2, traint Show-O een lookup-vrije quantizer met ongeveer 35M beeldgegevens. De quantizer behoudt een codeboek van formaat 8.192 en codeert beelden van 256×256 resolutie in 16×16 discrete tokens. MAGVIT-v2 wordt gekozen vanwege zijn gemak van fine-tuning, waardoor het een geschikte video-tokenizer is met tijdelijke compressiemogelijkheden, een aspect dat Show-O in de toekomst wil onderzoeken. Een alternatieve benadering is om verschillende tokenizers te gebruiken voor begrip en generatie. Geïnspireerd door bestaande onderzoeken, gebruikt Show-O ook continue beeldrepresentaties van de vooraf getrainde MAGVIT-v2 en CLIP-ViT-encoder om verbeteringen in multimodale begripsvermogens te onderzoeken.. In de volgende secties wordt de standaard Show-O beschreven, die discrete beeldtokens als invoer gebruikt voor zowel multimodale begrip als generatie.

Architectuur
Show-O erft de architectuur van bestaande LLM’s zonder enige architectuurwijzigingen, behalve het toevoegen van een QK-Norm-operatie aan elke aandachtlagen. Show-O wordt geïnitialiseerd met de gewichten van een vooraf getraind LLM en breidt de grootte van de embeddinglaag uit door 8.192 nieuwe leerbare embeddings voor discrete beeldtokens toe te voegen. In tegenstelling tot state-of-the-art diffusiemodellen die een aanvullende tekstencoder vereisen, codeert Show-O inherent tekstconditionele informatie voor tekst-naar-beeldgeneratie.
Verenigde Promptstrategie
Om verenigd leren uit te voeren op multimodale begrip en generatie, gebruikt Show-O een verenigde promptstrategie om invoergegevens en modaliteiten te structureren. Gegeven een beeld-tekstpaar (x, y), wordt het eerst getokeniseerd in M beeldtokens en N teksttokens door de beeld- en teksttokenizers, respectievelijk. De tokens worden vervolgens gevormd tot een invoersequentie volgens het taaktype, zoals wordt geïllustreerd in de volgende afbeelding.

Door deze promptontwerp te gebruiken, kan Show-O effectief invoergegevens voor multimodale begrip, tekst-naar-beeldgeneratie en gemengde modaliteit generatie coderen als sequentiële gegevens. Deze instelling maakt het mogelijk om verenigd leren uit te voeren over sequenties voor deze verschillende taken. Eenmaal getraind, kan Show-O worden geprompt om een breed scala aan visie-taalkundige taken te behandelen, waaronder visuele vraagbeantwoording en tekst-naar-beeldgeneratie.
Omni-Aandachtmethode
In tegenstelling tot bestaande werken die sequenties alleen autoregressief modelleren, introduceert Show-O een omni-aandachtmethode, waardoor het verschillende soorten signalen op verschillende manieren kan modelleren. Deze alomvattende aandachtmethode schakelt adaptief tussen causale en volledige aandacht op basis van het formaat van de invoersequentie. De volgende afbeelding toont voorbeelden van omni-aandacht voor verschillende invoersequenties.

Specifiek verwerkt Show-O teksttokens binnen de sequentie via causale aandacht, terwijl beeldtokens worden verwerkt met behulp van volledige aandacht, waardoor elk token uitgebreid met alle andere kan interageren. In multimodale begrip kunnen teksttokens aandacht schenken aan alle voorgaande beeldtokens, terwijl in tekst-naar-beeldgeneratie beeldtokens kunnen interageren met alle voorgaande teksttokens. Omni-aandacht behoudt de tekstredeneringskennis van het vooraf getrainde LLM en verbetert de efficiëntie van beeldgeneratie door het aantal steekproeven te verminderen. Bovendien ondersteunt het verschillende downstream-toepassingen, zoals inpainting en extrapolatie, zonder fine-tuning te vereisen. Wanneer alleen teksttokens worden gegeven, schakelt de methode over naar causale aandacht.
SHOW-O: Experimenten en Resultaten
De volgende tabel toont de multimodale begripscapaciteit van Show-O op openbare benchmarks, zoals beeldonderschriften en visuele vraagbeantwoordingstaken.

De huidige versie van Show-O is gebouwd op Phi-1.5, en daarom dient de begrips-only-tegenhanger van Show-O, LLaVA-v1.5-Phi-1.5, als directe baseline. Show-O toont een vergelijkbare prestatie in alle evaluatiemetrics ten opzichte van de baseline LLaVA-v1.5-Phi-1.5, die zich uitsluitend richt op multimodale begrip. Dit toont het grote potentieel van het Show-O-kader om multimodale begrip en generatie te verenigen binnen één transformer. In vergelijking met begrips-only-modellen zoals InstructBLIP, Qwen-VL-Chat en mPLUG-Owl2, toont Show-O, ondanks een veel kleinere modelgrootte, concurrerende prestaties op de POPE-, MME-, Flickr30k- en VQAv2-benchmarks, en presteert het beter op de GQA-benchmark. In vergelijking met verenigde modellen met aanzienlijk meer parameters, zoals NExT-GPT-13B en Chameleon-34B, toont Show-O ook sterke prestaties op de Flickr30k-benchmark en presteert het veel beter op de VQAv2-benchmark.
Gezien deze veelbelovende resultaten, wordt Show-O gezien als een potentieel toekomstig fundamentmodel voor het verenigen van begrip en generatie. Deze resultaten tonen ook het potentieel van het schalen van Show-O om state-of-the-art-prestaties te behalen.
Kwalitatieve Vergelijkingen
We presenteren kwalitatieve vergelijkingen met diffusie-gebaseerde modellen, zoals SDv1.5, SDXL en het autoregressief-gebaseerde model LlamaGen, naast verenigde modellen zoals LWM en SEED-X, zoals wordt aangetoond in de volgende afbeelding.

Show-O toont de mogelijkheid om realistische beelden te genereren met consistente inhoud die wordt beschreven in zowel korte als lange tekstprompts. In vergelijking met SDv1.5 en LlamaGen, toont Show-O een betere visuele kwaliteit en een sterkere beeld-tekstalignering. Zo missen SDv1.5 en LlamaGen in de tweede kolom beide attributen zoals “zonsopgang” en “blauwe koepels” in de gegenereerde beelden. In vergelijking met SDXL, toont Show-O een vergelijkbare visuele kwaliteit en alignering, zoals te zien is in voorbeelden zoals “een rallyauto-race” en “prachtig contrast tegen de levendige zonsopgang.”

Tekst-Geleide Inpainting en Extrapolatie
Show-O ondersteunt natuurlijk tekst-geleide inpainting en extrapolatie zonder fine-tuning te vereisen. De volgende afbeelding toont verschillende voorbeelden.

Boven aan de afbeelding kan Show-O, gegeven een invoerbeeld en een inpaintingmasker, een rode trolleyauto transformeren in een blauwe sportauto met elegante curves en getinte ramen op basis van een door de gebruiker verstrekte tekstprompt. Show-O kan ook het oorspronkelijke beeld horizontaal of verticaal extrapoleren op basis van de verstrekte tekstprompt. Zo kan Show-O in de tweede rij een beeld extrapoleren door nieuwe objecten toe te voegen, zoals “rode wilde bloemen.” De pixels in zowel de ingepainte als geëxtrapoleerde regio’s blijven consistent met het oorspronkelijke beeld. Deze voorbeelden tonen duidelijk de inherente voordelen van Show-O ten opzichte van autoregressieve modellen voor downstream-toepassingen.
Slotbeschouwing
In dit artikel hebben we het over Show-O gehad, een verenigde transformer die multimodale begrip en generatie integreert. In tegenstelling tot volledig autoregressieve modellen, verenigt Show-O autoregressieve en discrete diffusiemodellering om invoer en uitvoer van verschillende en gemengde modaliteiten aan te passen. Het verenigde model ondersteunt flexibel een breed scala aan visie-taalkundige taken, waaronder visuele vraagbeantwoording, tekst-naar-beeldgeneratie, tekst-geleide inpainting/extrapolatie en gemengde modaliteit generatie. Over verschillende benchmarks heen toont Show-O een vergelijkbare of superieure prestatie ten opzichte van bestaande individuele modellen met een equivalent of groter aantal parameters, waardoor het potentieel heeft als een toekomstig fundamentmodel. In dit kader wordt het model belast met het voorspellen van Gausiaanse ruis die aan de continue latentrepresentaties wordt toegevoegd. In tegenstelling tot andere modellen zoals D3PM, Mask-predict, ARDM en MaskGIT, gebruikt Show-O discrete diffusiemodellering voor visuele generatie. Show-O is het eerste model dat autoregressieve en discrete diffusiemodellering verenigt, waardoor het verschillende modaliteiten op verschillende manieren kan behandelen. Uitgebreide experimentele resultaten tonen aan dat Show-O vergelijkbaar is met, of zelfs beter dan, individuele expertmodellen over een breed scala aan visie-taalkundige taken. Dit toont het potentieel van Show-O als een toekomstig fundamentmodel.












