Modely a platformy AI
SHOW-O: Jednotný Transformer Pro Multimodální Porozumění a Generaci
Významný pokrok v oblasti velkých jazykových modelů (LLM) inspiroval vývoj multimodálních velkých jazykových modelů (MLLM). Rané úsilí v oblasti MLLM, jako je LLaVA, MiniGPT-4 a InstructBLIP, prokázalo pozoruhodné multimodální porozumění. Aby se LLM integrovaly do multimodálních domén, tyto studie prozkoumaly projekci funkcí z předem trénovaného modality-specifického kodéru, jako je CLIP, do vstupního prostoru LLM, umožňující multimodální porozumění a odůvodňování uvnitř transformerového jádra. Ačkoli existuje několik designových voleb pro MLLM, jako jsou vizuální kodéry, adaptéry pro zarovnání funkcí a datové sady, trénink většiny z těchto modelů dodržuje autoregresivní generativní paradigm, který se ukázal jako efektivní pro textovou generaci v LLM. Navzdory jejich silným multimodálním porozuměním se tyto modely primárně zaměřují na vizuální percepci a postrádají schopnost generovat multimodální výstupy beyond text.
Transformerové modely prokázaly velký úspěch v autoregresivním modelování v přírodním jazykovém zpracování. Inspirováni takovým pokrokem, předchozí studie přímo aplikovaly stejné autoregresivní modelování, aby se naučily závislosti obrazových pixelů pro generaci obrazů a videí. Například VideoPoet využívá architekturu decoder-only transformer k syntéze vysokokvalitních videí z multimodálních vstupů. Nedávno LlamaGen prokázal, že architektura velkého jazykového modelu, jako je Llama, může autoregresivně modelovat obrazové tokeny, dosahující přijatelného výkonu v podmíněné generaci obrazů.
V tomto článku budeme diskutovat o Show-O, jednotném transformeru, který integruje multimodální porozumění a generaci. Na rozdíl od plně autoregresivních modelů Show-O sjednocuje autoregresivní a diskrétní difúzní modelování, aby adapťně zpracovával vstupy a výstupy různých a smíšených modalit. Jednotný model flexibilně podporuje širokou škálu vizuálních a jazykových úkolů, včetně vizuálního otázání a odpovědi, text-to-obrázek generace, textem řízené doplnění/extrapolace a smíšené modality generace. Napříč různými benchmarky Show-O prokazuje srovnatelný nebo lepší výkon než stávající individuální modely s ekvivalentním nebo větším počtem parametrů, zdůrazňující jeho potenciál jako budoucího základního modelu.
V tomto rámci je modelovi přiděleno předpovědět Gaussovský šum přidán k nepřetržitým latentním reprezentacím. Na rozdíl od toho ostatní modely, jako D3PM, Mask-predict, ARDM a MaskGIT, využívají diskrétní korekční proces jako alternativu k Gaussovské difúzi. Konkrétně je obraz reprezentován jako sekvence diskrétních tokenů pomocí obrazových tokenizérů, přičemž každý token je spojen s kategoriálním štítkem. Token-wise distribuce je transformována do uniformní distribuce prostřednictvím stochastického vzorkovacího procesu. Během tréninku je část těchto tokenů náhodně maskována a model je trénován k předpovědi původních hodnot maskovaných tokenů. V této práci Show-O采用 diskrétní difúzní modelování pro vizuální generaci.
… (zbytek překladu)












