Modèles et plateformes d’IA
EAGLE : Explorer l’espace de conception pour les modèles de langage multimodaux à l’aide d’un mélange de codeurs
La capacité à interpréter avec précision des informations visuelles complexes est un objectif crucial pour les modèles de langage multimodaux (MLLMs). Des travaux récents montrent que l’amélioration de la perception visuelle réduit considérablement les hallucinations et améliore les performances sur des tâches sensibles à la résolution, telles que la reconnaissance optique de caractères et l’analyse de documents. Plusieurs MLLMs récents atteignent cet objectif en utilisant un mélange de codeurs de vision. Malgré leur succès, il existe un manque de comparaisons systématiques et d’études de suppression détaillées qui abordent des aspects critiques, tels que la sélection d’experts et l’intégration de plusieurs experts en vision. Cet article fournit une exploration approfondie de l’espace de conception pour les MLLMs en utilisant un mélange de codeurs de vision et de résolutions, le cadre Eagle qui tente d’explorer l’espace de conception pour les modèles de langage multimodaux à l’aide d’un mélange de codeurs. Les résultats révèlent plusieurs principes sous-jacents communs à différentes stratégies existantes, conduisant à une approche de conception simplifiée mais efficace. Eagle découvre que la simple concaténation de jetons visuels à partir d’un ensemble de codeurs de vision complémentaires est aussi efficace que des architectures de mélange plus complexes ou des stratégies. De plus, Eagle introduit la pré-alignement pour combler le fossé entre les codeurs de vision axés sur la vision et les jetons de langage, améliorant ainsi la cohérence du modèle. La famille de MLLMs résultante, Eagle, dépasse d’autres modèles open-source de pointe sur les principaux benchmarks de MLLM.
Le travail d’Eagle est lié à la conception générale de l’architecture des modèles de langage multimodaux (MLLMs). Outre la lignée de recherches open-source mentionnée précédemment, d’autres familles notables de MLLMs incluent, mais ne sont pas limitées à, MiniGPT-4, Lynx, Otter, QwenVL, CogVLM, VILA, GPT-4V, Gemini et Llama 3.1. Selon la façon dont les signaux de vision sont intégrés dans le modèle de langage, les MLLMs peuvent être largement catégorisés en “modèles d’attention cross-modale” et “modèles de réglage de préfixe”. Les premiers injectent des informations visuelles dans différentes couches de LLMs à l’aide d’une attention cross-modale, tandis que les seconds traitent les jetons visuels comme faisant partie de la séquence de jetons de langage et les appendent directement avec des embeddings de texte. Le modèle d’Eagle appartient à la famille de réglage de préfixe en suivant une architecture multimodale de style LLaVA.
Le travail d’Eagle est étroitement lié à la recherche axée sur l’amélioration de la conception des codeurs de vision pour les MLLMs. Les travaux précoces ont généralement adopté des codeurs de vision pré-entraînés sur des tâches d’alignement vision-langage telles que CLIP et EVA-CLIP. Des codeurs de vision plus puissants, tels que SigLIP et InternVL, ont été proposés pour améliorer les tâches de vision-langage avec de meilleures conceptions, des tailles de modèle plus grandes et des recettes de formation plus efficaces. Puisque les modèles sont souvent pré-entraînés sur des images de basse résolution et peuvent manquer de capacité à encoder des détails fins, une adaptation à une résolution plus élevée est fréquemment effectuée pour augmenter la résolution d’entrée du MLLM. En plus de l’adaptation à une résolution plus élevée, des modèles tels que LLaVA-NeXT, LLaVA-UHD, Monkey, InternLM-XComposer et InternVL utilisent un pavage ou un pavage adaptatif pour gérer les entrées de haute résolution, où les images sont divisées en patches de basse résolution et traitées séparément. Bien que la capacité à gérer des résolutions plus élevées soit rendue possible en introduisant des experts en vision supplémentaires, cette approche diffère légèrement des techniques de pavage, bien que les deux soient compatibles et puissent être combinées.
EAGLE : Utilisation d’un mélange de codeurs pour explorer l’espace de conception des MLLMs
Le succès des modèles de langage (LLMs) a suscité un intérêt considérable pour permettre à ces modèles de percevoir visuellement, leur permettant de voir, de comprendre et de raisonner dans le monde réel. Au cœur de ces modèles de langage multimodaux (MLLMs) se trouve une conception typique où les images sont converties en une série de jetons visuels par les codeurs de vision et appendues avec les embeddings de texte. CLIP est souvent choisi comme codeur de vision car sa représentation visuelle est alignée sur l’espace de texte par pré-entraînement sur des paires d’images et de texte. Selon les architectures, les recettes de formation et la façon dont les jetons de vision sont injectés dans le modèle de langage, des familles notables de MLLMs incluent Flamingo, BLIP, PaLI, PaLM-E et LLaVA. La plupart de ces modèles maintiennent des résolutions d’entrée relativement faibles en raison de limitations dans les codeurs de vision pré-entraînés et la longueur de séquence des LLMs. Le travail d’Eagle est étroitement aligné sur les modèles qui utilisent plusieurs codeurs de vision pour améliorer la perception.
Par exemple, des modèles tels que Mousi et Brave fusionnent des jetons visuels à partir de différents codeurs de vision en les concaténant le long du canal ou de la direction du jeton. RADIO introduit une méthode de distillation multi-enseignant pour unifier les capacités de différents codeurs de vision en un seul modèle. MoAI, IVE et Prismer utilisent la sortie de codeurs de vision experts, tels que la reconnaissance optique de caractères, la détection ou l’estimation de profondeur, pour supplémenter des informations supplémentaires pour les MLLMs pour générer des réponses. MoVA conçoit un réseau de routage pour attribuer un modèle de vision optimal en fonction de l’image et des instructions données.
Des études récentes ont montré que des conceptions de codeurs de vision plus puissantes sont importantes pour réduire les hallucinations des MLLMs et améliorer les performances sur des tâches sensibles à la résolution, telles que la reconnaissance optique de caractères (ROC). Plusieurs travaux se concentrent sur l’amélioration de la capacité du codeur de vision, soit en augmentant les données de pré-entraînement et les paramètres, soit en divisant les images en patches de basse résolution. Cependant, ces approches introduisent souvent de grandes exigences en termes de ressources de formation. Une stratégie efficace mais puissante consiste à mélanger des codeurs de vision pré-entraînés avec différentes tâches et résolutions d’entrée, soit en fusionnant des codeurs de vision de résolution plus élevée avec le codeur CLIP, soit en appendant séquentiellement des fonctionnalités à partir de différents codeurs, soit en adoptant des stratégies de fusion et de routage plus complexes pour maximiser les avantages de différents codeurs. Cette approche de “mélange d’experts en vision” s’est avérée efficace, bien qu’une étude détaillée de son espace de conception avec une suppression rigoureuse soit encore manquante, ce qui motive Eagle à revoir ce domaine. Des questions clés restent : quels codeurs de vision combiner, comment les fusionner et comment ajuster les stratégies de formation avec plusieurs codeurs de vision.
Pour répondre à ces questions, Eagle explore systématiquement l’espace de conception du mélange de codeurs de vision pour améliorer la perception des MLLMs. L’exploration de cet espace de conception implique les étapes suivantes : 1) évaluation de différents codeurs de vision et recherche d’une adaptation à une résolution plus élevée ; 2) comparaison “à armes égales” entre les stratégies de fusion de codeurs de vision ; 3) identification progressive de la combinaison optimale de plusieurs codeurs de vision ; 4) amélioration de la pré-alignement des experts en vision et du mélange de données. Les étapes d’exploration sont illustrées dans l’image suivante.

Eagle étudie les performances de codeurs de vision pré-entraînés sur différentes tâches et résolutions, telles que l’alignement vision-langage, l’apprentissage auto-supervisé, la détection, la segmentation et la reconnaissance optique de caractères. En utilisant une approche de type “tournoi”, Eagle commence avec le codeur de base CLIP et ajoute un expert supplémentaire à la fois, en sélectionnant l’expert qui apporte l’amélioration la plus importante à chaque tour.
Bien que le travail d’Eagle ne soit pas le premier à utiliser plusieurs codeurs de vision dans les MLLMs, l’étude systématique conduit à plusieurs constats clés dans ce contexte :
- Déverrouiller les codeurs de vision pendant la formation du MLLM est important. Cela contraste avec des modèles tels que LLaVA et d’autres qui considèrent plusieurs codeurs de vision ou enseignants, où le gel des codeurs de vision a été une pratique courante.
- Certaines stratégies de fusion proposées récemment ne montrent pas d’avantages significatifs. Au lieu de cela, la concaténation de canal directe émerge comme une stratégie de fusion simple mais compétitive, offrant la meilleure efficacité et les meilleures performances.
- L’intégration d’experts en vision supplémentaires conduit à des gains constants. Cela rend cette approche prometteuse pour améliorer systématiquement la perception des MLLMs, en plus de l’augmentation de la taille des codeurs individuels. L’amélioration est particulièrement prononcée lorsque les codeurs de vision sont déverrouillés.
- La phase de pré-alignement est clé. Eagle introduit une phase de pré-alignement où les experts en vision non alignés sur le texte sont individuellement affinés avec un LLM gelé avant d’être formés ensemble. Cette phase améliore considérablement les performances du MLLM dans le cadre de la conception du mélange de codeurs de vision.
Eagle : Méthodologie et architecture
Contrairement aux méthodes précédentes qui se concentrent sur de nouvelles stratégies de fusion ou des architectures entre les codeurs de vision, l’objectif d’Eagle est d’identifier une conception minimaliste pour fusionner différents codeurs de vision, soutenue par des suppressions détaillées et en supprimant tout composant inutile. Comme le montre la figure suivante, Eagle commence par étendre le codeur de base CLIP à un ensemble d’experts en vision avec différentes architectures, tâches de pré-entraînement et résolutions. Avec ces experts, Eagle compare ensuite différentes architectures de fusion et méthodes, et explore comment optimiser les stratégies de pré-entraînement avec plusieurs codeurs.

Enfin, Eagle combine toutes les constatations et étend l’approche à plusieurs experts en vision avec différentes résolutions et connaissances de domaine. En utilisant les mêmes données de pré-entraînement que LLaVA-1.5, qui se compose de 595 000 paires d’images et de texte, Eagle passe à l’étape de réglage fin suivie en collectant des données à partir d’une série de tâches et en les convertissant en conversations multimodales, y compris LLaVA-1.5, Laion-GPT4V, ShareGPT-4V, DocVQA, synDog-EN, ChartQA, DVQA et AI2D, ce qui donne lieu à 934 000 échantillons.
Le modèle est d’abord pré-entraîné avec des paires d’images et de texte pendant une époque avec une taille de lot de 256, où l’ensemble du modèle est gelé et seul le projecteur est mis à jour. À l’étape suivante, le modèle est réglé fin sur les données de réglage fin pendant une époque avec une taille de lot de 128. Pour cette exploration, Eagle utilise Vicuna-7B comme modèle de langage sous-jacent. Les taux d’apprentissage sont fixés à 1e-3 pour la première étape et 2e-5 pour la deuxième étape.
Codeur CLIP plus puissant
Eagle commence l’exploration avec le modèle CLIP, car il est devenu le choix principal pour de nombreux MLLMs. Bien que les modèles CLIP soient connus pour améliorer les tâches multimodales, leurs limites ont également été bien documentées. Par exemple, de nombreux MLLMs existants utilisent les résolutions de pré-entraînement CLIP (telles que 224 × 224 ou 336 × 336) comme résolutions d’entrée. Dans ces cas, les codeurs de vision ont souvent du mal à capturer des détails fins importants pour les tâches sensibles à la résolution comme la reconnaissance optique de caractères et la compréhension de documents.

Pour gérer une résolution d’entrée plus élevée, une approche courante est le pavage, où les images d’entrée sont divisées en tuiles et encodées séparément. Une autre méthode plus simple consiste à augmenter directement la résolution d’entrée et à interpoler les embeddings de position du modèle de transformateur de vision si nécessaire. Eagle compare ces deux approches avec des codeurs de vision gelés et déverrouillés à différentes résolutions, avec les résultats contenus dans le tableau ci-dessus. Les résultats peuvent être résumés comme suit :
- Déverrouiller le codeur CLIP conduit à une amélioration significative lors de l’interpolation à une résolution d’entrée du MLLM plus élevée qui diffère de la résolution de pré-entraînement CLIP, sans dégradation des performances lorsque les résolutions restent les mêmes.
- Geler le codeur CLIP et l’adapter directement à une résolution d’entrée du MLLM plus élevée nuit considérablement aux performances.
- Parmi les stratégies comparées, l’interpolation directe à 448 × 448 avec un codeur CLIP déverrouillé s’avère à la fois efficace et efficiente en termes de performances et de coût.
- Le meilleur codeur CLIP atteint des performances proches de celles d’InternVL, malgré être un modèle beaucoup plus petit (300M par rapport à 6G) avec moins de données de pré-entraînement.
Eagle : Expériences et résultats
Tâches de questions visuelles
Tâches de reconnaissance optique de caractères et de compréhension de graphiques
Évaluation des benchmarks multimodaux
Pensées finales
Dans cet article, nous avons discuté d’Eagle, une analyse approfondie de l’espace de conception pour l’intégration de codeurs de vision dans les modèles de langage multimodaux. Contrairement aux travaux précédents qui se concentrent sur la conception de nouvelles paradigmes de fusion ou d’architectures entre les codeurs de vision, Eagle constate que des choix de conception systématiques sont importants et découvre une série de techniques utiles. Étape par étape, Eagle optimise la recette de formation des codeurs de vision individuels, identifie une méthode de fusion étendable et efficace, et combine progressivement des codeurs de vision avec différentes connaissances de domaine. Les résultats mettent en évidence l’importance critique des considérations de base de l’espace de conception.












