Modelos e plataformas de IA
SHOW-O: Um Transformador Único Unindo Compreensão Multimodal e Geração
Avanços significativos em grandes modelos de linguagem (LLMs) inspiraram o desenvolvimento de modelos de linguagem multimodal grandes (MLLMs). Esforços iniciais de MLLM, como LLaVA, MiniGPT-4 e InstructBLIP, demonstram capacidades notáveis de compreensão multimodal. Para integrar LLMs em domínios multimodais, esses estudos exploraram a projeção de recursos de um codificador específico de modalidade pré-treinado, como CLIP, no espaço de entrada de LLMs, permitindo compreensão e raciocínio multimodal dentro da estrutura do transformador. Embora haja várias escolhas de design para MLLMs, como codificadores de visão, adaptadores de alinhamento de recursos e conjuntos de dados, o treinamento para a maioria desses modelos segue o paradigma de geração autoregressiva, que se provou eficaz para geração de texto em LLMs. Apesar de suas fortes capacidades de compreensão multimodal, esses modelos se concentram principalmente na percepção visual e carecem da capacidade de gerar saídas multimodais além do texto.
Modelos de transformador demonstraram grande sucesso em modelagem autoregressiva no processamento de linguagem natural. Inspirados por esse progresso, estudos anteriores aplicaram diretamente a mesma modelagem autoregressiva para aprender a dependência de pixels de imagem para geração de imagem e vídeo. Por exemplo, o VideoPoet emprega uma arquitetura de transformador apenas decodificador para sintetizar vídeos de alta qualidade a partir de entradas multimodais. Mais recentemente, o LlamaGen mostrou que uma arquitetura de modelo de linguagem grande como Llama pode modelar tokens de imagem de forma autoregressiva, alcançando um desempenho decente na geração de imagem condicional de classe.
Neste artigo, discutiremos o Show-O, um transformador unificado que integra compreensão multimodal e geração. Ao contrário de modelos completamente autoregressivos, o Show-O une modelagem autoregressiva e modelagem de difusão discreta para lidar adaptativamente com entradas e saídas de várias e mistas modalidades. O modelo unificado suporta flexivelmente uma ampla gama de tarefas de visão-linguagem, incluindo resposta a perguntas visuais, geração de imagem de texto, inpainting/extrapolation orientada por texto e geração de modalidade mista. Em várias benchmarks, o Show-O demonstra um desempenho comparável ou superior a modelos individuais existentes com um número equivalente ou maior de parâmetros, destacando seu potencial como um modelo de fundação de próxima geração.
Nesta estrutura, o modelo é responsável por prever o ruído gaussiano adicionado às representações latentes contínuas. Em contraste, outros modelos, como D3PM, Mask-predict, ARDM e MaskGIT, usam um processo de corrupção discreta como alternativa à difusão gaussiana. Especificamente, uma imagem é representada como uma sequência de tokens discretos usando tokenizadores de imagem, com cada token associado a um rótulo categórico. A distribuição token a token é transformada em uma distribuição uniforme por meio de um processo de amostragem estocástica. Durante o treinamento, uma porção desses tokens é mascarada aleatoriamente, e o modelo é treinado para prever os valores originais dos tokens mascarados. Neste trabalho, o Show-O adota a modelagem de difusão discreta para geração visual.
SHOW-O: Unificando Compreensão Multimodal e Geração
Nos últimos anos, surgiram avanços significativos nos dois pilares principais da inteligência multimodal: compreensão e geração. Para a compreensão multimodal, Modelos de Linguagem Multimodal Grandes (MLLMs) como LLaVA demonstraram capacidades excepcionais em tarefas de visão-linguagem, como resposta a perguntas visuais (VQA). Para a geração visual, os modelos de difusão probabilística de ruído (DDPMs) revolucionaram os paradigmas de geração tradicionais, alcançando um desempenho sem precedentes na geração de imagem e vídeo de texto.
Dada essas conquistas em campos individuais, é natural explorar o potencial de conectar esses dois domínios. Trabalhos recentes tentaram montar modelos especializados desses dois domínios diferentes para formar um sistema unificado que possa lidar com compreensão multimodal e geração. No entanto, as tentativas existentes frequentemente envolvem modelos separados para compreensão e geração. Por exemplo, o NExT-GPT emprega um modelo de linguagem base para compreensão multimodal, mas requer um modelo de difusão pré-treinado adicional para geração de imagem. Isso levanta a questão: um único transformador pode lidar com compreensão multimodal e geração?
Recentemente, o Chameleon demonstrou que isso é possível. Especificamente, o Chameleon permite a fusão de diferentes modalidades para gerar tokens de texto e imagem por meio de modelagem autoregressiva. Embora faça sentido modelar tokens de texto autoregressivamente, é menos claro se modelar patches de imagem ou pixels da mesma forma é ótimo. Um gargalo importante de prever autoregressivamente uma imagem é o grande número de etapas de amostragem necessárias, especialmente ao lidar com imagens de resolução mais alta. Modelos de difusão contínua demonstraram um desempenho superior na geração visual em comparação com os autoregressivos.
Isso nos leva a explorar se um único transformador pode integrar modelagem autoregressiva e de difusão. O Show-O vislumbra um novo paradigma onde o texto é representado como tokens discretos e modelado autoregressivamente, enquanto os pixels de imagem contínuos são modelados usando difusão de ruído. No entanto, integrar essas duas técnicas distintas em uma rede única não é trivial devido às diferenças entre tokens de texto discretos e representações de imagem contínuas. Além disso, os modelos de difusão geralmente dependem de dois modelos distintos: um codificador de texto e uma rede de desruído.
Para resolver isso, o Show-O introduz um modelo unificado capaz de lidar com tarefas de compreensão multimodal e geração usando modelagem autoregressiva e de difusão mista. O Show-O é construído sobre um LLM pré-treinado e aproveita suas capacidades de modelagem autoregressiva para raciocínio baseado em texto. Inspirado por outros trabalhos, o Show-O emprega difusão de ruído discreta para modelar tokens de imagem em vez de representações contínuas. Além disso, o Show-O codifica intrinsicamente informações condicionais de texto, eliminando a necessidade de codificadores de texto adicionais. Ao utilizar tokenizadores de texto e imagem, o Show-O pode processar dados de entrada diversificados e tarefas, fornecendo respostas autoregressivas para tarefas de visão-linguagem e gerando imagens usando difusão de ruído discreta.
O Show-O demonstra um desempenho comparável e, em alguns casos, melhor do que modelos individuais com um número equivalente ou maior de parâmetros em várias benchmarks. Ao contrário da geração de imagem autoregressiva, a estrutura do Show-O requer cerca de 20 vezes menos etapas de amostragem, tornando-a intrinsicamente mais rápida. Além disso, a estrutura do Show-O suporta aplicações downstream, como inpainting e extrapolation orientada por texto, sem necessidade de ajuste fino, como demonstrado na figura a seguir.

O Show-O também tem o potencial para geração de modalidade mista, como geração de quadros-chave de vídeo intercalada com descrições de texto, mostrando promessa para geração de vídeo de longa duração. Além disso, a estrutura do Show-O investiga o impacto de representações de imagem discretas e contínuas na compreensão multimodal, oferecendo insights para futuros designs de modelos unificados.
A figura a seguir apresenta uma comparação das características do modelo entre a estrutura do Show-O e métodos existentes em vários domínios. O Show-O se destaca como um modelo unificado que integra técnicas avançadas para compreensão multimodal e geração.

Em resumo, as principais contribuições deste artigo são as seguintes:
- O Show-O é um modelo unificado que integra compreensão multimodal e geração usando um único transformador.
- O Show-O une modelagem autoregressiva e de difusão discreta dentro de um único transformador, lidando efetivamente com texto e imagens.
- A estrutura do Show-O supera ou iguala os modelos de linha de base individuais com um número equivalente ou maior de parâmetros em benchmarks de compreensão multimodal e geração.
- O Show-O suporta aplicações downstream como inpainting e extrapolation orientada por texto sem ajuste fino e demonstra potencial para geração de modalidade mista.
- O Show-O explora o impacto de diferentes tipos de representações, fornecendo insights valiosos para melhorar a compreensão multimodal em modelos unificados.
Nos últimos anos, um número crescente de estudos se concentrou em modelos de linguagem multimodal unificados capazes de compreensão e geração. Alguns esforços usam representações contínuas intercaladas com tokens de texto para modelagem autoregressiva para gerar imagens. O SEED-X propõe um sistema de fundação unificado e versátil capaz de lidar com tarefas de compreensão multimodal e geração. Nesta abordagem, representações de imagem contínuas do codificador CLIP ViT são combinadas com tokens de texto e alimentadas em um LLM para realizar previsão de palavra e regressão de representação de imagem. O Chameleon introduz uma família de modelos mistos baseados em tokens capazes de compreender e gerar imagens. Essa abordagem representa todas as modalidades como tokens discretos, utilizando uma arquitetura de transformador unificada e treinando o modelo do zero de forma end-to-end. Em comparação, o Show-O também adota tokens discretos para representar todas as modalidades, mas utiliza um processo de difusão discreta em vez de modelagem autoregressiva para geração visual.
SHOW-O: Metodologia e Arquitetura
O objetivo principal por trás da estrutura do Show-O é desenvolver um modelo unificado que integre modelagem autoregressiva e de difusão para compreensão multimodal e geração conjunta. Desenvolver tal modelo unificado apresenta desafios significativos, com questões centrais girando em torno de: i) definir o espaço de entrada/saída do modelo; ii) unificar diferentes tipos de dados de entrada de modalidades distintas; iii) integrar modelagem autoregressiva e de difusão dentro de um único transformador; e iv) treinar efetivamente esse modelo unificado.
O Show-O aborda esses desafios com as seguintes soluções:
- O Show-O constrói o espaço de entrada/saída tokenizando dados de texto e imagem em tokens discretos.
- O Show-O introduz sua arquitetura padrão e uma estratégia de prompting unificada para estruturar dados de entrada e modalidades.
- O Show-O demonstra como incorporar modelagem autoregressiva e de difusão dentro de um único transformador.
- O Show-O apresenta um pipeline de treinamento em três etapas para treinar efetivamente o modelo unificado.
Tokenização
Dado que o Show-O proposto é construído sobre LLMs pré-treinados, é natural realizar aprendizado unificado no espaço discreto. Mantendo um vocabulário unificado que inclui tokens de texto e imagem discretos, o Show-O é responsável pelo mesmo objetivo de aprendizado: prever tokens discretos.
Tokenização de Texto
O Show-O é baseado em um LLM pré-treinado, e o mesmo tokenizador é usado para tokenização de dados de texto sem modificações.
Tokenização de Imagem
Seguindo o MAGVIT-v2, o Show-O treina um quantizador sem lookup usando cerca de 35M de dados de imagem. O quantizador mantém um livro de códigos de tamanho 8.192 e codifica imagens de resolução 256×256 em 16×16 tokens discretos. O MAGVIT-v2 é escolhido por sua facilidade de ajuste fino, tornando-o adequado como um tokenizador de vídeo com capacidade de compressão temporal, um aspecto que o Show-O planeja explorar no futuro. Uma abordagem alternativa é usar diferentes tokenizadores para compreensão e geração, respectivamente. Inspirado por estudos existentes, o Show-O também extrai representações de imagem contínuas do MAGVIT-v2 pré-treinado e do codificador CLIP-ViT para explorar melhorias nas capacidades de compreensão multimodal.. Nas seções de metodologia a seguir, o Show-O padrão emprega tokens de imagem discretos como entrada para compreensão multimodal e geração.

Arquitetura
O Show-O herda a arquitetura de LLMs existentes sem modificações arquiteturais, exceto pela adição de uma operação QK-Norm a cada camada de atenção. O Show-O é inicializado com os pesos de um LLM pré-treinado e expande o tamanho da camada de incorporação incorporando 8.192 novas incorporações aprendíveis para tokens de imagem discretos. Ao contrário dos modelos de difusão de ponta que requerem um codificador de texto adicional, o Show-O codifica intrinsicamente informações condicionais de texto para geração de imagem de texto.
Prompting Unificado
Para realizar aprendizado unificado em compreensão multimodal e geração, o Show-O utiliza uma estratégia de prompting unificada para formatar diferentes tipos de dados de entrada. Dada uma pareja de imagem e texto (x, y), ela é primeiro tokenizada em M tokens de imagem e N tokens de texto pelos tokenizadores de imagem e texto, respectivamente. Os tokens são então formados em uma sequência de entrada de acordo com o tipo de tarefa, como ilustrado na figura a seguir.

Ao empregar esse design de prompt, o Show-O pode codificar efetivamente diferentes dados de entrada para compreensão multimodal, geração de imagem de texto e geração de modalidade mista como dados sequenciais. Essa configuração permite que o aprendizado unificado opere de forma transparente em sequências para essas tarefas variadas. Uma vez treinado, o Show-O pode ser solicitado a lidar com uma ampla gama de tarefas de visão-linguagem, incluindo resposta a perguntas visuais e geração de imagem de texto.
Mecanismo de Atenção Omni
Ao contrário de trabalhos existentes que modelam sequências apenas autoregressivamente, o Show-O introduz um mecanismo de atenção omni, permitindo que ele modele diferentes tipos de sinais de maneiras distintas. Esse mecanismo de atenção abrangente adaptativamente alterna entre atenção causal e atenção completa com base no formato da sequência de entrada. A figura a seguir ilustra exemplos de atenção omni para diferentes sequências de entrada.

Especificamente, o Show-O processa tokens de texto dentro da sequência por meio de atenção causal, enquanto tokens de imagem são tratados usando atenção completa, permitindo que cada token interaja de forma abrangente com todos os outros. Na compreensão multimodal, tokens de texto podem atender a todos os tokens de imagem anteriores, enquanto na geração de imagem de texto, tokens de imagem podem interagir com todos os tokens de texto anteriores. A atenção omni retém o conhecimento de raciocínio de texto do LLM pré-treinado e melhora a eficiência da geração de imagem reduzindo as etapas de amostragem. Além disso, suporta várias aplicações downstream, como inpainting e extrapolation, sem necessidade de ajuste fino. Quando dado apenas tokens de texto, o mecanismo padrão é a atenção causal.
SHOW-O: Experimentos e Resultados
A tabela a seguir apresenta a capacidade de compreensão multimodal do Show-O em benchmarks públicos, como tarefas de caption de imagem e resposta a perguntas visuais.

A versão atual do Show-O é construída sobre o Phi-1.5, e, portanto, o Show-O, que é o equivalente de compreensão apenas, o LLaVA-v1.5-Phi-1.5, serve como a linha de base direta. O Show-O exibe um desempenho comparável em todas as métricas de avaliação em relação à linha de base LLaVA-v1.5-Phi-1.5, que é dedicada exclusivamente à compreensão multimodal. Isso demonstra o grande potencial da estrutura do Show-O para unificar compreensão multimodal e geração dentro de um único transformador. Em comparação com modelos de compreensão apenas, como InstructBLIP, Qwen-VL-Chat e mPLUG-Owl2, o Show-O, apesar de ter um tamanho de modelo muito menor, alcança um desempenho competitivo nos benchmarks POPE, MME, Flickr30k e VQAv2, e apresenta um desempenho melhor no benchmark GQA. Em comparação com modelos unificados com um número significativamente maior de parâmetros, como NExT-GPT-13B e Chameleon-34B, o Show-O também alcança um desempenho forte no benchmark Flickr30k e apresenta um desempenho muito melhor no benchmark VQAv2.
Dadas esses resultados promissores, o Show-O é vislumbrado como um potencial modelo de fundação de próxima geração para unificar compreensão e geração. Esses resultados também demonstram o potencial de escalonar o Show-O para alcançar um desempenho de ponta.
Comparações Qualitativas
Apresentamos comparações qualitativas com modelos baseados em difusão, como SDv1.5, SDXL, e o modelo autoregressivo LlamaGen, ao lado de modelos unificados como LWM e SEED-X, como demonstrado na figura a seguir.

O Show-O demonstra a capacidade de gerar imagens realistas com conteúdo consistente descrito em prompts de texto curtos e longos. Em comparação com o SDv1.5 e o LlamaGen, o Show-O exibe uma melhor qualidade visual e uma alinhamento de imagem-texto mais forte. Por exemplo, na segunda coluna, tanto o SDv1.5 quanto o LlamaGen falham em compreender completamente o prompt de texto e perdem atributos como “pôr do sol” e “domos azuis” nas imagens geradas. Em comparação com o SDXL, o Show-O fornece uma qualidade visual e alinhamento comparáveis, como visto em exemplos como “uma corrida de carros de rally” e “contraste deslumbrante contra o pôr do sol vibrante.”

Inpainting e Extrapolation Orientada por Texto
O Show-O suporta naturalmente inpainting e extrapolation orientada por texto sem necessidade de ajuste fino. A figura a seguir ilustra vários exemplos.

No topo da figura, dado uma imagem de entrada e uma máscara de inpainting, o Show-O pode transformar um carrinho de supermercado vermelho em um carro esportivo azul com curvas elegantes e janelas tintadas com base em um prompt de texto fornecido pelo usuário. O Show-O também pode extrapolar a imagem original horizontal ou verticalmente com base no prompt de texto fornecido. Por exemplo, na segunda linha, o Show-O extrapola a imagem adicionando novos objetos, como “flores silvestres vermelhas.” Os pixels nas regiões inpintadas e extrapoladas permanecem consistentes com a imagem original. Esses exemplos demonstram claramente as vantagens inerentes do Show-O sobre modelos autoregressivos para aplicações downstream.
Pensamentos Finais
Neste artigo, discutimos o Show-O, um transformador unificado que integra compreensão multimodal e geração. Ao contrário de modelos completamente autoregressivos, o Show-O une modelagem autoregressiva e modelagem de difusão discreta para lidar adaptativamente com entradas e saídas de várias e mistas modalidades. O modelo unificado suporta flexivelmente uma ampla gama de tarefas de visão-linguagem, incluindo resposta a perguntas visuais, geração de imagem de texto, inpainting/extrapolation orientada por texto e geração de modalidade mista. Em várias benchmarks, o Show-O demonstra um desempenho comparável ou superior a modelos individuais existentes com um número equivalente ou maior de parâmetros, destacando seu potencial como um modelo de fundação de próxima geração. Nessa estrutura, o modelo é responsável por prever o ruído gaussiano adicionado às representações latentes contínuas. Em contraste, outros modelos, como D3PM, Mask-predict, ARDM e MaskGIT, usam um processo de corrupção discreta como alternativa à difusão gaussiana. O Show-O é o primeiro a unificar modelagem autoregressiva e de difusão discreta, permitindo que ele lide com diferentes modalidades de maneiras distintas. Resultados experimentais extensivos demonstram que o Show-O é comparável ou até melhor do que modelos especializados individuais em uma ampla gama de tarefas de visão-linguagem. Isso destaca seu potencial como um modelo de fundação de próxima geração.












