Modèles et plateformes d’IA
MiniGPT-5 : Génération de Vision et de Langage Intermédiaire via des Vokens Génératifs
Au cours des dernières années, les grands modèles de langage (LLM) ont attiré l’attention des développeurs d’IA du monde entier en raison des avancées réalisées dans le traitement automatique des langues (NLP). Ces modèles ont établi de nouvelles références en matière de génération de texte et de compréhension. Cependant, malgré les progrès réalisés dans la génération de texte, la production d’images qui correspondent de manière cohérente aux récits textuels reste un défi. Pour répondre à ce défi, les développeurs ont introduit une approche innovante de génération de vision et de langage basée sur des “vokens génératifs”, qui comble le fossé entre les sorties texte-image harmonisées.
Le fondement du MiniGPT-5 repose sur une stratégie de formation en deux étapes qui se concentre fortement sur la génération de données multimodales sans descriptions, où les données de formation ne nécessitent aucune description d’image complète. De plus, pour renforcer l’intégrité du modèle, le modèle intègre un système de guidage sans classeur qui améliore l’efficacité d’un voken pour la génération d’images. Dans la phase initiale, le cadre MiniGPT-5 a démontré des performances puissantes et une amélioration significative par rapport au modèle de base Divter formé sur le jeu de données MMDialog, et a constamment démontré sa capacité à fournir des sorties multimodales comparables et même supérieures dans les évaluations humaines effectuées sur le jeu de données VIST, ce qui met en évidence sa performance et son efficacité dans diverses références.
MiniGPT5 : Une Introduction
Avec les développements récents des cadres LLM, et les applications basées sur ces cadres LLM, l’intégration de fonctionnalités multimédias est un domaine qui a connu une augmentation de popularité, car elle constitue également une avancée vitale qui alimente une large gamme d’applications, allant des outils de création de contenu de pointe aux agents de dialogue multimodaux de pointe. Avec la recherche et le développement continus, les modèles de langage et de vision sont à un stade où les travaux visent à les permettre de générer à la fois des données textuelles et visuelles de manière fluide. La capacité des LLM à générer des données multimodales de manière fluide contribuera à améliorer les interactions dans divers domaines, notamment le commerce électronique, les médias et la réalité virtuelle.

En fin de compte, l’objectif est de permettre aux modèles de synthétiser, de reconnaître et de répondre de manière cohérente et logique en utilisant à la fois des modalités textuelles et visuelles, jouant ainsi un rôle crucial dans l’harmonisation du flux d’informations et la création de récits logiques et cohérents. Le besoin de parvenir à un mélange de modalités textuelles et visuelles est alimenté principalement par le besoin d’interactions multimodales plus fluides, intégrées et interactives dans les LLM, et en fin de compte, par la réalisation de la génération de langage et de vision alternée. Cependant, la réalisation d’interactions multimodales intégrées et interactives dans les LLM est une tâche complexe parsemée de nombreux défis, notamment
- Bien que les LLM actuels soient extrêmement efficaces et capables lorsqu’il s’agit de la génération de texte et du traitement de paires texte-image, ils ne fournissent pas de performances satisfaisantes lorsqu’il s’agit de la génération d’images.
- Le développement de ces modèles de vision et de langage repose fortement sur des données axées sur des sujets qui rendent difficile pour les modèles d’aligner le texte généré avec ses images correspondantes.
- Enfin, il est nécessaire de trouver des stratégies plus efficaces, car avec l’augmentation de leurs capacités, les exigences de mémoire des LLM augmentent également, en particulier lors de l’exécution de tâches en aval.
Le cadre MiniGPT-5, une technique d’algorithme de génération de langage et de vision intercalée qui introduit le concept de “vokens génératifs” pour répondre aux défis mentionnés ci-dessus. Le cadre MiniGPT-5 propose une nouvelle approche pour la génération de données multimodales en combinant les grands modèles de langage avec les techniques de diffusion stable en utilisant des jetons visuels spéciaux. Le méthode de formation en deux étapes proposée par le cadre MiniGPT-5 met en évidence l’importance d’une étape fondamentale sans descriptions et prépare le modèle pour fournir des performances efficaces même dans des scénarios à données limitées.

Mais ce qui distingue le modèle MiniGPT-5 des cadres existants est que les étapes génériques du cadre MiniGPT-5 ne consistent pas en des annotations spécifiques au domaine. De plus, pour garantir que le texte généré et les images correspondantes sont en harmonie les unes avec les autres, le cadre MiniGPT-5 déploie une stratégie à double perte qui améliore encore l’approche du MiniGPT-5 en utilisant un guidage sans classeur et des vokens génératifs. Le cadre MiniGPT-5 optimise l’efficacité de la formation et répond aux contraintes de mémoire grâce à sa stratégie de fine-tuning paramétrique.
Pour vous fournir un résumé rapide, le cadre MiniGPT-5
- Propose une méthode qui utilise des encodeurs multimodaux qui représentent une méthode générique et novatrice qui s’est historiquement avérée plus efficace que les LLM traditionnels, et utilise des jetons génératifs combinés avec des techniques de diffusion stable pour générer des sorties de langage et de vision intercalées.
- Propose une stratégie de formation en deux étapes pour la génération de sortie multimodale sans descriptions, et l’inclusion d’un guidage sans classeur pendant la formation pour affiner encore la qualité des données générées.
Le modèle MiniGPT-5 s’inspire fortement des recherches et travaux précédents dans les domaines de
- Génération d’images à partir de texte : Pour faciliter la transformation de descriptions textuelles en représentations visuelles correspondantes, et les modèles de texte à image.
- MLLM ou Modèles de Langage Multimodaux : En utilisant des modèles LLM pré-formés pour explorer leurs applications et leur efficacité dans la génération de données multimodales.
- Génération Multimodale avec des Modèles de Langage : Pour augmenter les capacités d’un LLM pour intégrer de manière fluide la génération de données de langage et de vision.
MiniGPT-5 : Méthode, Architecture et Cadre
Pour permettre aux grands modèles de langage de générer des données multimodales, le modèle MiniGPT-5 introduit un cadre qui vise à intégrer les modèles de génération de texte à image et les modèles de langage multimodaux pré-formés. Le cadre MiniGPT-5 introduit également les “vokens génératifs”, des jetons visuels spéciaux qui permettent aux développeurs de répondre aux écarts qui apparaissent dans différents domaines en étant en mesure de former directement sur des images brutes. Pour améliorer encore la qualité des données multimodales générées par les LLM, le cadre MiniGPT-5 introduit une stratégie sans classeur couplée avec une méthode de formation avancée en deux étapes. Examinons de plus près le cadre MiniGPT-5.
Étape d’Entrée Multimodale
Les développements récents des LLM ont mis en évidence les capacités de compréhension multimodale des LLM, permettant le traitement d’images comme une entrée séquentielle. Le cadre MiniGPT-5 utilise des vokens génératifs spécialement conçus pour sortir des caractéristiques visuelles dans une tentative d’étendre les capacités de compréhension multimodale des LLM à la génération de données multimodales. De plus, le cadre MiniGPT-5 utilise des techniques de fine-tuning paramétrique et de pointe pour l’apprentissage de sortie multimodale avec le cadre LLM.
Encodage Multimodal
L’encodeur visuel pré-formé dans le cadre MiniGPT-5 transforme chaque image d’entrée en une caractéristique, et chaque jeton de texte est intégré comme un vecteur, et les caractéristiques d’entrée sont générées lorsque ces intégrations sont concaténées les unes avec les autres.
Ajout de Vokens dans les Modèles de Langage
Traditionnellement, le vocabulaire des grands modèles de langage ne consiste qu’en jetons textuels, c’est pourquoi les développeurs travaillant sur le cadre MiniGPT-5 ont dû combler le fossé entre les modèles génératifs et les LLM traditionnels. Le cadre MiniGPT-5 introduit un ensemble de jetons spéciaux comme jetons génératifs dans le vocabulaire du LLM. Le cadre utilise ensuite l’état de sortie caché du LLM pour ces vokens spéciaux pour la génération d’images ultérieure, et l’insertion d’images intercalées est représentée par la position des vokens.
PEFT ou Fine-Tuning Paramétrique
Le PEFT ou Fine-Tuning Paramétrique est un concept crucial utilisé pour former les LLM, et pourtant, les applications du PEFT dans les contextes multimodaux sont encore peu explorées. Le cadre MiniGPT-5 utilise le Fine-Tuning Paramétrique sur l’encodeur du cadre MiniGPT-4 pour former le modèle pour comprendre les instructions mieux, et même améliorer les performances globales du modèle dans des environnements de tir à zero ou nouveaux.
Génération de Sortie Multimodale
Pour aligner le modèle génératif avec les jetons génératifs de manière précise, le cadre MiniGPT-5 formule un module de mappage compact pour correspondre aux dimensions, et incorporer des pertes de supervision, y compris la perte de diffusion latente et la perte d’espace de texte. La perte de diffusion latente aligne les caractéristiques visuelles appropriées avec les jetons directement, tandis que la perte d’espace de texte aide le modèle à apprendre les positions correctes des jetons. Puisque les vokens génératifs dans le cadre MiniGPT-5 sont guidés directement par les images, le cadre MiniGPT-5 n’a pas besoin d’images avec des descriptions complètes, aboutissant à un apprentissage sans descriptions.
Génération d’Espace de Texte
Le cadre MiniGPT-5 suit la méthode de modélisation de langage causal pour générer à la fois des vokens et des textes dans l’espace de texte de manière conjointe, et pendant la phase de formation, les développeurs ajoutent les vokens à la position des images de vérité terrain, et forment le modèle pour prédire les vokens dans la génération de texte.
Mappage des Caractéristiques de Voken pour la Génération d’Images
Après la génération de l’espace de texte, le cadre aligne l’état de sortie caché avec l’espace de caractéristiques conditionnelles du modèle de génération de texte à image. Le cadre prend également en charge un module de mappage de caractéristiques qui comprend un modèle MLP à deux couches, une séquence de décodedur learnable, et un modèle de transformateur encodeur-décodeur à quatre couches.
Génération d’Images avec LDM ou Modèle de Diffusion Latente
Pour générer les images requises dans le processus de débruitage, le cadre utilise les caractéristiques de mappage comme entrée conditionnelle. Le cadre emploie également un LDM ou Modèle de Diffusion Latente pour la guidance, car pendant la phase de formation, l’image de vérité terrain est d’abord convertie en une caractéristique latente en utilisant un VAE pré-formé, après quoi les développeurs obtiennent la caractéristique de bruit latente en ajoutant du bruit.
L’approche globale déployée par le cadre MiniGPT-5 permet aux développeurs de comprendre et de générer de manière cohérente les éléments visuels et textuels, en utilisant des jetons spécialisés, en exploitant les capacités des modèles pré-formés, et en utilisant des techniques de formation innovantes.
MiniGPT-5 : Formation et Résultats
Lorsque les développeurs ont travaillé sur le cadre MiniGPT-5, ils ont observé que la formation sur un jeu de données d’images et de textes intercalés limité peut entraîner des images de qualité réduite et un décalage, étant donné le décalage de domaine important entre les domaines d’images et de textes. Pour atténuer ce problème, les développeurs ont adopté deux stratégies de formation distinctes,
- En comprenant l’intégration de techniques de guidage sans classeur qui améliorent l’efficacité des jetons génératifs pendant le processus de diffusion.
- La deuxième stratégie est divisée en deux étapes
- Une étape de pré-formation initiale qui se concentre principalement sur l’alignement des caractéristiques grossières.
- Une étape de fine-tuning qui facilite l’apprentissage des caractéristiques.
CFG ou Guidage sans Classeur
L’idée de mettre en œuvre le CFG pour la génération multimodale est venue d’une tentative d’améliorer la cohérence et la logique entre les images générées et les textes, et le CFG est introduit pendant le processus de diffusion de texte à image. Cette méthode observe que, en formant sur la génération conditionnelle et inconditionnelle avec une chute de condition, le modèle génératif peut atteindre des résultats conditionnels améliorés.
Stratégie de Formation en Deux Étapes
Étant donné le décalage de domaine important observé entre la génération de texte et d’images et la génération de texte pure, le cadre MiniGPT-5 utilise une stratégie de formation en deux étapes
- Étape d’alignement unimodal ou UAS,
- Étape d’apprentissage multimodal ou MLS.
Initialement, le cadre aligne les caractéristiques de génération d’images avec les caractéristiques de voken dans des jeux de données d’images et de textes uniques où chaque échantillon de données contient une seule image et un seul texte, et le texte est généralement la légende de l’image. Dans cette étape, le cadre permet au LLM de générer des vokens en utilisant les légendes comme entrées du LLM.
Une fois l’UAS exécuté avec succès, le modèle peut générer des images pour des descriptions de texte uniques, mais il a du mal avec la génération de langage et de vision intercalée, y compris les paires de texte et d’image, et une raison complexe est nécessaire pour la génération d’images et de texte. Pour relever ce défi, les développeurs ont affiné le cadre MiniGPT-5 en utilisant des paramètres PEFT en utilisant des jeux de données d’images et de textes intercalés comme VIST. Pendant cette étape, le cadre construit trois tâches différentes à partir du jeu de données
- Génération de texte uniquement : Génère le texte associé à l’image suivante.
- Génération d’image uniquement : Génère l’image associée au texte suivant.
- Génération multimodale : Génère des paires de texte et d’image en utilisant le contexte donné.
MiniGPT-5 : Références et Résultats
Pour évaluer ses performances dans la génération multimodale de manière exhaustive, l’équipe de développement du MiniGPT-5 compare ses performances avec d’autres modèles de référence, notamment Divter, GILL et le modèle de génération unimodale affiné, et la comparaison est présentée dans le tableau ci-dessous.

Le cadre MiniGPT-5 reconnaît que la sortie multimodale peut être significative dans le contexte, mais qu’elle peut différer de la réalité, ce qui est la raison principale pour laquelle le cadre MiniGPT-5 intègre également des entrées humaines pour évaluer et évaluer les performances du modèle. Dans l’ensemble, l’efficacité du cadre MiniGPT-5 pour les tâches multimodales est mesurée à partir de trois perspectives.
- Continuité de Langage : Évaluer si le contenu généré s’aligne de manière fluide sur le contexte fourni.
- Qualité d’Image : Évaluer ou évaluer la pertinence et la clarté de l’image générée.
- Cohérence Multimodale : Déterminer si la sortie combinée de texte et d’image est en phase avec le contexte initial.
Évaluation de l’Étape Finale de VIST
Dans la première étape des expériences, le cadre MiniGPT-5 vise à générer les images correspondantes, et le tableau ci-dessous résume les résultats obtenus dans ce paramètre.

Comme on peut le voir, le cadre MiniGPT-5 dans les trois paramètres peut surpasser le cadre SD2 affiné, mettant ainsi en évidence l’efficacité du pipeline MiniGPT-5.

La figure ci-dessus compare les performances du cadre MiniGPT-5 avec le cadre MiniGPT-4 affiné sur les métriques de performance S-BERT, Rouge-L et Meteor. Les résultats indiquent que l’utilisation de vokens génératifs n’affecte pas négativement les performances du cadre lors de l’exécution de tâches de compréhension multimodale. Les résultats démontrent également que le cadre MiniGPT-5 est capable d’utiliser des invites de sortie multimodale horizontale longue sur une large gamme de données pour générer des images de haute qualité et cohérentes sans compromettre la capacité du modèle d’origine pour la compréhension multimodale.

Le tableau ci-dessus compare les performances de trois cadres sur 5 000 échantillons pour la génération multimodale en termes de cohérence multimodale, de qualité d’image et de continuité de langage. Comme on peut le voir, le cadre MiniGPT-5 surpasse les deux autres modèles de référence dans plus de 70 % des cas. D’un autre côté, le tableau ci-dessous démontre les performances du cadre MiniGPT-5 sur le jeu de données de validation CC3M pour la génération d’images uniques. Grâce aux limitations de données, les développeurs ont trouvé un écart pour l’alignement de voken lorsqu’il est utilisé avec la diffusion stable. Malgré cette limitation, le cadre MiniGPT-5 surpasse le cadre de référence GILL actuel dans tous les indicateurs de performance.


Conclusion
Dans cet article, nous avons discuté du MiniGPT-5, une technique d’algorithme de génération de langage et de vision intercalée qui introduit le concept de “vokens génératifs” pour exploiter les capacités des LLM pour générer des données multimodales en alignant le grand modèle de langage avec un modèle de génération de texte à image pré-formé. Nous avons discuté des composants essentiels et de l’architecture globale du cadre MiniGPT-5, ainsi que des résultats qui indiquent des améliorations significatives en termes de performances et d’efficacité par rapport aux modèles de référence actuels et aux modèles de pointe. Le MiniGPT-5 vise à établir une nouvelle référence dans le domaine de la génération de contenu et de données multimodales, et vise à résoudre les défis auxquels les modèles précédents ont été confrontés lorsqu’ils ont tenté de résoudre le même problème.












