Modèles et plateformes d’IA

SHOW-O : Un modèle de transformateur unique pour la compréhension et la génération multimodales

mm
Ajouter Unite.AI à vos sources préférées sur Google

Les progrès significatifs réalisés dans les grands modèles de langage (LLM) ont inspiré le développement de modèles de langage multimodaux (MLLM). Les premiers efforts de MLLM, tels que LLaVA, MiniGPT-4 et InstructBLIP, démontrent des capacités de compréhension multimodale notables. Pour intégrer les LLM dans des domaines multimodaux, ces études ont exploré la projection de fonctionnalités à partir d’un encodeur spécifique à une modalité, tel que CLIP, dans l’espace d’entrée des LLM, permettant ainsi la compréhension et la raisonnement multimodaux dans le squelette du transformateur. Bien qu’il existe divers choix de conception pour les MLLM, tels que les encodeurs de vision, les adaptateurs d’alignement de fonctionnalités et les ensembles de données, la formation de la plupart de ces modèles suit le paradigme de génération autoregressive, qui s’est avéré efficace pour la génération de texte dans les LLM. Malgré leurs fortes capacités de compréhension multimodale, ces modèles se concentrent principalement sur la perception visuelle et manquent de la capacité de générer des sorties multimodales au-delà du texte.

Les modèles de transformateur ont démontré un grand succès dans la modélisation autoregressive en traitement du langage naturel. Inspirés par ces progrès, les études précédentes ont appliqué directement la même modélisation autoregressive pour apprendre la dépendance des pixels d’image pour la génération d’images et de vidéos. Par exemple, VideoPoet utilise une architecture de transformateur décodeur-seul pour synthétiser des vidéos de haute qualité à partir d’entrées multimodales. Plus récemment, LlamaGen a montré qu’un modèle de langage grand comme Llama peut modéliser autoregressivement les jetons d’image, atteignant une performance convenable dans la génération d’images conditionnelle à la classe.

Dans cet article, nous allons discuter de Show-O, un modèle de transformateur unifié qui intègre la compréhension et la génération multimodales. Contrairement aux modèles entièrement autoregressifs, Show-O unifie la modélisation autoregressive et la modélisation de diffusion discrète pour gérer de manière adaptative les entrées et les sorties de diverses modalités mélangées. Le modèle unifié prend en charge de manière flexible une large gamme de tâches de vision-langage, notamment la réponse aux questions visuelles, la génération d’images à partir de texte, l’extrapolation et la génération de modalités mélangées. Sur divers benchmarks, Show-O démontre des performances comparables ou supérieures à celles des modèles individuels existants avec un nombre équivalent ou plus grand de paramètres, mettant en évidence son potentiel en tant que modèle de base de nouvelle génération.

Dans ce cadre, le modèle est chargé de prédire le bruit gaussien ajouté aux représentations latentes continues. En revanche, d’autres modèles comme D3PM, Mask-predict, ARDM et MaskGIT utilisent un processus de corruption discret comme alternative à la diffusion gaussienne. Plus précisément, une image est représentée comme une séquence de jetons discrets à l’aide de tokeniseurs d’images, chaque jeton étant associé à une étiquette catégorielle. La distribution des jetons est transformée en une distribution uniforme par un processus d’échantillonnage stochastique. Lors de la formation, une partie de ces jetons est masquée aléatoirement, et le modèle est formé pour prédire les valeurs originales des jetons masqués. Dans ce travail, Show-O adopte la modélisation de diffusion discrète pour la génération d’images visuelles.

SHOW-O : Un modèle de transformateur unifié pour la compréhension et la génération multimodales

Au cours des dernières années, des progrès importants ont émergé dans les deux piliers clés de l’intelligence multimodale : la compréhension et la génération. Pour la compréhension multimodale, les modèles de langage multimodaux (MLLM) comme LLaVA ont démontré des capacités exceptionnelles dans les tâches de vision-langage telles que la réponse aux questions visuelles (VQA). Pour la génération visuelle, les modèles de diffusion de débruitage probabiliste (DDPM) ont révolutionné les paradigmes de génération traditionnels, atteignant des performances sans précédent dans la génération d’images et de vidéos à partir de texte.

Compte tenu de ces réalisations dans des domaines individuels, il est naturel d’explorer le potentiel de les relier. Des travaux récents ont tenté d’assembler des modèles d’experts à partir de ces deux domaines différents pour former un système unifié capable de gérer à la fois la compréhension et la génération multimodales. Cependant, les tentatives existantes impliquent souvent des modèles distincts pour la compréhension et la génération. Par exemple, NExT-GPT emploie un modèle de langage de base pour la compréhension multimodale mais nécessite un modèle de diffusion préformé supplémentaire pour la génération d’images. Cela soulève la question : un seul transformateur peut-il gérer à la fois la compréhension et la génération multimodales ?

Récemment, Chameleon a démontré que c’est possible. Plus précisément, Chameleon permet la fusion de différentes modalités pour générer à la fois des jetons de texte et d’images par modélisation autoregressive. Bien qu’il soit logique de modéliser les jetons de texte de manière autoregressive, il est moins clair si la modélisation des patches ou des pixels d’image de la même manière est optimale. Un goulet d’étranglement important de la prédiction autoregressive d’une image est le grand nombre d’étapes d’échantillonnage requises, en particulier lorsqu’il s’agit d’images de haute résolution. Les modèles de diffusion continus ont montré des performances supérieures dans la génération visuelle par rapport aux modèles autoregressifs.

Cela nous amène à explorer si un seul transformateur peut intégrer à la fois la modélisation autoregressive et la modélisation de diffusion. Show-O imagine un nouveau paradigme dans lequel le texte est représenté comme des jetons discrets et modélisé de manière autoregressive, tandis que les pixels d’image continus sont modélisés à l’aide de la diffusion de débruitage. Cependant, intégrer ces deux techniques distinctes dans un seul réseau n’est pas trivial en raison des différences entre les jetons de texte discrets et les représentations d’images continues. De plus, les modèles de diffusion reposent généralement sur deux modèles distincts : un encodeur de texte et un réseau de débruitage.

Pour répondre à cela, Show-O introduit un modèle unifié capable de gérer à la fois les tâches de compréhension et de génération multimodales en utilisant la modélisation autoregressive et la modélisation de diffusion mélangées. Show-O est construit à partir d’un LLM préformé et exploite ses capacités de modélisation autoregressive pour la raison textuelle. Inspiré par d’autres travaux, Show-O emploie la modélisation de diffusion discrète pour modéliser les jetons d’image au lieu de représentations continues. De plus, Show-O encode de manière inhérente les informations conditionnelles de texte, éliminant ainsi le besoin d’encodeurs de texte supplémentaires. En utilisant des tokeniseurs de texte et d’image, Show-O peut traiter des données d’entrée diverses et des tâches, fournissant des réponses de manière autoregressive pour les tâches de vision-langage et générant des images à l’aide de la diffusion de débruitage discrète.

Show-O démontre des performances comparables, et dans certains cas meilleures, que les modèles individuels avec un nombre équivalent ou plus grand de paramètres sur divers benchmarks. Contrairement à la génération d’images autoregressive, le cadre Show-O nécessite environ 20 fois moins d’étapes d’échantillonnage, ce qui le rend intrinsèquement plus rapide. De plus, le cadre Show-O prend en charge les applications en aval telles que l’extrapolation et la peinture guidées par le texte sans nécessiter de fine-tuning, comme le démontre l’image suivante.

Show-O a également le potentiel pour la génération de modalités mélangées, telle que la génération de keyframes de vidéo avec des descriptions de texte, montrant des promesses pour la génération de vidéos à long terme. De plus, le cadre Show-O explore l’impact des représentations d’images discrètes et continues sur les capacités de compréhension multimodale, offrant des perspectives pour les conceptions futures de modèles unifiés.

La figure suivante présente une comparaison des caractéristiques du modèle entre le cadre Show-O et les méthodes existantes sur divers domaines. Show-O se démarque comme un modèle unifié qui intègre des techniques avancées pour la compréhension et la génération multimodales.

En résumé, les principales contributions de cet article sont les suivantes :

  • SHOW-O est un modèle unifié qui intègre la compréhension et la génération multimodales en utilisant un seul transformateur.
  • SHOW-O unifie la modélisation autoregressive et la modélisation de diffusion discrète dans un seul transformateur, gérant efficacement les entrées et les sorties de diverses modalités.
  • Le cadre Show-O surpasse ou égale les performances des modèles de base individuels avec un nombre équivalent ou plus grand de paramètres sur divers benchmarks de compréhension et de génération multimodales.
  • SHOW-O prend en charge les applications en aval telles que la peinture et l’extrapolation guidées par le texte sans nécessiter de fine-tuning et démontre un potentiel pour la génération de modalités mélangées.
  • SHOW-O explore l’impact de différents types de représentations, fournissant des perspectives précieuses pour améliorer les capacités de compréhension multimodale dans les modèles unifiés.

Récemment, un nombre croissant d’études se sont concentrées sur les modèles de langage multimodaux unifiés capables de compréhension et de génération. Certains efforts utilisent des représentations continues entrelacées avec des jetons de texte pour la modélisation autoregressive afin de générer des images. SEED-X propose un système de base unifié et polyvalent capable de gérer à la fois les tâches de compréhension et de génération multimodales. Dans cette approche, des représentations d’images continues à partir de l’encodeur CLIP ViT sont combinées avec des jetons de texte et alimentées dans un LLM pour effectuer la prédiction du prochain mot et la régression de la représentation d’image. Chameleon introduit une famille de modèles de jetons mixtes basés sur des modalités capables de comprendre et de générer des images. Cette approche représente toutes les modalités comme des jetons discrets, en utilisant une architecture de transformateur unifiée et en formant le modèle de manière end-to-end. En comparaison, Show-O adopte également des jetons discrets pour représenter toutes les modalités mais utilise un processus de diffusion discret au lieu de la modélisation autoregressive pour la génération visuelle.

SHOW-O : Méthodologie et architecture

L’objectif principal derrière le cadre Show-O est de développer un modèle unifié qui intègre la modélisation autoregressive et la modélisation de diffusion pour la compréhension et la génération multimodales conjointes. Développer un tel modèle unifié pose des défis importants, avec des problèmes centraux tournant autour de : i) la définition de l’espace d’entrée/sortie du modèle ; ii) l’unification de différents types de données d’entrée provenant de modalités diverses ; iii) l’intégration de la modélisation autoregressive et de la modélisation de diffusion dans un seul transformateur ; et iv) la formation efficace d’un tel modèle unifié.

Show-O répond à ces défis avec les solutions suivantes :

  • Show-O construit l’espace d’entrée/sortie en tokenisant les données de texte et d’image en jetons discrets.
  • Show-O introduit son architecture par défaut et une stratégie de sollicitation unifiée pour structurer les données d’entrée et les modalités.
  • Show-O démontre comment intégrer à la fois la modélisation autoregressive et la modélisation de diffusion dans un seul transformateur.
  • Show-O présente un pipeline de formation en trois étapes pour former efficacement le modèle unifié.

Tokenisation

Étant donné que le modèle Show-O proposé est construit à partir de LLM préformés, il est naturel de réaliser un apprentissage unifié dans l’espace discret. En maintenant un vocabulaire unifié qui inclut des jetons de texte et d’image discrets, Show-O est chargé de l’objectif d’apprentissage suivant : prédire des jetons discrets.

Tokenisation de texte

Show-O est basé sur un LLM préformé, et le même tokeniseur est utilisé pour la tokenisation des données de texte sans aucune modification.

Tokenisation d’image

En suivant MAGVIT-v2, Show-O forme un quantificateur sans recherche à l’aide d’environ 35 millions de données d’images. Le quantificateur maintient un livre de codes de taille 8 192 et encode des images de résolution 256×256 en 16×16 jetons discrets. MAGVIT-v2 est choisi pour sa facilité de fine-tuning, ce qui le rend adapté en tant que tokeniseur de vidéo avec une capacité de compression temporelle, un aspect que Show-O prévoit d’explorer à l’avenir. Une approche alternative consiste à utiliser différents tokeniseurs pour la compréhension et la génération, respectivement. Inspiré par des études existantes, Show-O extrait également des représentations d’images continues à partir de l’encodeur MAGVIT-v2 préformé et de l’encodeur CLIP-ViT pour explorer les améliorations des capacités de compréhension multimodale. Dans les sections suivantes, le Show-O par défaut emploie des jetons d’image discrets comme entrée pour la compréhension et la génération multimodales. Pour la simplicité, les sections de méthodologie ne décriront que le Show-O par défaut.

Architecture

Show-O hérite de l’architecture des LLM existants sans aucune modification architecturale, à l’exception de la préfixation d’une opération QK-Norm à chaque couche d’attention. Show-O est initialisé avec les poids d’un LLM préformé et étend la taille de la couche d’intégration en incorporant 8 192 nouvelles intégrations apprenables pour les jetons d’image discrets. Contrairement aux modèles de diffusion de pointe qui nécessitent un encodeur de texte supplémentaire, Show-O encode de manière inhérente les informations conditionnelles de texte pour la génération d’images à partir de texte.

Sollicitation unifiée

Pour effectuer un apprentissage unifié sur la compréhension et la génération multimodales, Show-O utilise une stratégie de sollicitation unifiée pour formater divers types de données d’entrée. Étant donné une paire d’image et de texte (x, y), elle est d’abord tokenisée en M jetons d’image et N jetons de texte par les tokeniseurs d’image et de texte, respectivement. Les jetons sont ensuite formés en une séquence d’entrée en fonction du type de tâche, comme illustré dans la figure suivante.

En utilisant cette conception de sollicitation, Show-O peut encoder efficacement diverses données d’entrée pour la compréhension multimodale, la génération d’images à partir de texte et la génération de modalités mélangées en tant que données séquentielles. Ce dispositif permet un apprentissage unifié pour fonctionner sans heurt sur des séquences pour ces diverses tâches. Une fois formé, Show-O peut être sollicité pour gérer une large gamme de tâches de vision-langage, notamment la réponse aux questions visuelles et la génération d’images à partir de texte.

Mécanisme d’attention omni

Contrairement aux travaux existants qui modélisent les séquences uniquement de manière autoregressive, Show-O introduit un mécanisme d’attention omni, lui permettant de modéliser divers types de signaux de manière distincte. Ce mécanisme d’attention complet bascule de manière adaptative entre l’attention causale et l’attention complète en fonction du format de la séquence d’entrée. La figure suivante illustre des exemples de mécanismes d’attention omni pour différentes séquences d’entrée.

Plus précisément, Show-O traite les jetons de texte au sein de la séquence via l’attention causale, tandis que les jetons d’image sont traités en utilisant l’attention complète, permettant à chaque jeton d’interagir de manière approfondie avec tous les autres. Dans la compréhension multimodale, les jetons de texte peuvent prêter attention à tous les jetons d’image précédents, tandis que dans la génération d’images à partir de texte, les jetons d’image peuvent interagir avec tous les jetons de texte précédents. L’attention omni conserve les connaissances de raisonnement de texte du LLM préformé et améliore l’efficacité de la génération d’images en réduisant les étapes d’échantillonnage. De plus, elle prend en charge diverses applications en aval, telles que la peinture et l’extrapolation, sans nécessiter de fine-tuning. Lorsqu’il n’y a que des jetons de texte, le mécanisme revient à l’attention causale.

SHOW-O : Expériences et résultats

Le tableau suivant présente la capacité de compréhension multimodale de Show-O sur des benchmarks publics, tels que les tâches de description d’images et de réponse aux questions visuelles.

La version actuelle de Show-O est construite à partir de Phi-1.5, et par conséquent, le modèle de compréhension uniquement de Show-O, LLaVA-v1.5-Phi-1.5, sert de référence directe. Show-O montre des performances comparables à celles de la référence LLaVA-v1.5-Phi-1.5, qui est dédiée uniquement à la compréhension multimodale. Cela démontre le grand potentiel du cadre Show-O pour unifier la compréhension et la génération multimodales dans un seul transformateur. Lorsqu’il est comparé à des modèles de compréhension uniquement, tels que InstructBLIP, Qwen-VL-Chat et mPLUG-Owl2, Show-O, malgré sa taille de modèle plus petite, atteint des performances compétitives sur les benchmarks POPE, MME, Flickr30k et VQAv2, et se comporte mieux sur le benchmark GQA. Lorsqu’il est comparé à des modèles unifiés avec un nombre significativement plus grand de paramètres, tels que NExT-GPT-13B et Chameleon-34B, Show-O montre également de fortes performances sur le benchmark Flickr30k et se comporte nettement mieux sur le benchmark VQAv2.

Compte tenu de ces résultats prometteurs, Show-O est considéré comme un modèle de base potentiel de nouvelle génération pour unifier la compréhension et la génération. Ces résultats démontrent également le potentiel de mise à l’échelle de Show-O pour atteindre des performances de pointe.

Comparaisons qualitatives

Nous présentons des comparaisons qualitatives avec des modèles basés sur la diffusion, tels que SDv1.5, SDXL, et le modèle autoregressif LlamaGen, ainsi qu’avec des modèles unifiés comme LWM et SEED-X, comme le montre la figure suivante.

Show-O démontre la capacité de générer des images réalistes avec un contenu cohérent décrit dans des invites de texte courtes et longues. Comparé à SDv1.5 et LlamaGen, Show-O montre une meilleure qualité visuelle et une alignement image-texte plus fort. Par exemple, dans la deuxième colonne, SDv1.5 et LlamaGen échouent à comprendre pleinement l’invite de texte et manquent d’attributs tels que “coucher de soleil” et “dômes bleus” dans les images générées. En comparaison avec SDXL, Show-O fournit une qualité visuelle et un alignement comparables, comme le montrent des exemples tels que “une course de rallye” et “un contraste frappant contre le coucher de soleil vibrant.”

Peinture et extrapolation guidées par le texte

Show-O prend en charge naturellement la peinture et l’extrapolation guidées par le texte sans nécessiter de fine-tuning. La figure suivante illustre plusieurs exemples.

Au sommet de la figure, étant donné une image d’entrée et un masque de peinture, Show-O peut transformer une voiture de trolley rouge en une voiture de sport bleue avec des courbes fluides et des fenêtres teintées en fonction d’une invite de texte fournie par l’utilisateur. Show-O peut également extrapoler l’image originale horizontalement ou verticalement en fonction de l’invite de texte donnée. Par exemple, dans la deuxième rangée, Show-O extrapoler l’image en ajoutant de nouveaux objets, comme “des fleurs sauvages rouges.” Les pixels dans les régions peintes et extrapolées restent cohérents avec l’image originale. Ces exemples démontrent clairement les avantages inhérents de Show-O par rapport aux modèles autoregressifs pour les applications en aval.

Pensées finales

Dans cet article, nous avons discuté de Show-O, un modèle de transformateur unifié qui intègre la compréhension et la génération multimodales. Contrairement aux modèles entièrement autoregressifs, Show-O unifie la modélisation autoregressive et la modélisation de diffusion discrète pour gérer de manière adaptative les entrées et les sorties de diverses modalités mélangées. Le modèle unifié prend en charge de manière flexible une large gamme de tâches de vision-langage, notamment la réponse aux questions visuelles, la génération d’images à partir de texte, la peinture et l’extrapolation guidées par le texte, et la génération de modalités mélangées. Sur divers benchmarks, Show-O démontre des performances comparables ou supérieures à celles des modèles individuels existants avec un nombre équivalent ou plus grand de paramètres, mettant en évidence son potentiel en tant que modèle de base de nouvelle génération. Dans ce cadre, le modèle est chargé de prédire le bruit gaussien ajouté aux représentations latentes continues. Contrairement à d’autres modèles comme D3PM, Mask-predict, ARDM et MaskGIT, qui utilisent un processus de corruption discret comme alternative à la diffusion gaussienne, Show-O adopte la modélisation de diffusion discrète pour la génération d’images visuelles. Show-O est le premier à unifier la modélisation autoregressive et la modélisation de diffusion discrète, lui permettant de gérer différentes modalités de manière distincte. Des résultats expérimentaux extensifs démontrent que Show-O est comparable, ou même meilleur, que les modèles d’experts individuels sur une large gamme de tâches de vision-langage, mettant en évidence son potentiel en tant que modèle de base de nouvelle génération.

Un ingénieur de profession, un écrivain de cœur. Kunal est un rédacteur technique avec une profonde affection et une compréhension de l'IA et du ML, dédié à simplifier les concepts complexes dans ces domaines grâce à sa documentation engageante et informative.