Modèles et plateformes d’IA
Présentation des Modèles Multimodaux de Grande Échelle : Façonnant le Paysage des Modèles de Langage en 2024
À mesure que nous expérimentons le monde, nos sens (vision, sons, odeurs) nous fournissent une gamme diverse d’informations, et nous nous exprimons en utilisant différents modes de communication, tels que les expressions faciales et les gestes. Ces sens et modes de communication sont collectivement appelés modalités, représentant les différentes manières dont nous percevons et communiquons. S’inspirant de cette capacité humaine, les modèles multimodaux de grande échelle (LMM), une combinaison de modèles génératifs et de modèles d’intelligence artificielle multimodale, sont en cours de développement pour comprendre et créer du contenu en utilisant différents types tels que le texte, les images et l’audio. Dans cet article, nous explorons ce domaine émergent, en découvrant ce que sont les LMM (Modèles Multimodaux de Grande Échelle), comment ils sont construits, les exemples existants, les défis qu’ils rencontrent et les applications potentielles.
Évolution de l’Intelligence Artificielle Générative en 2024 : Des Modèles de Langage de Grande Échelle aux Modèles Multimodaux de Grande Échelle
Dans son dernier rapport, McKinsey a désigné 2023 comme année de percée pour l’intelligence artificielle générative, conduisant à de nombreux progrès dans le domaine. Nous avons été témoins d’une augmentation notable de la prévalence des modèles de langage de grande échelle (LLM) capables de comprendre et de générer un langage similaire à celui des humains. De plus, les modèles de génération d’images ont évolué de manière significative, démontrant leur capacité à créer des visuels à partir de prompts textuels. Cependant, malgré les progrès importants dans les modalités individuelles comme le texte, les images ou l’audio, l’intelligence artificielle générative a rencontré des défis pour combiner de manière transparente ces modalités dans le processus de génération. Comme le monde est inhérentement multimodal par nature, il est crucial pour l’intelligence artificielle de traiter les informations multimodales. C’est essentiel pour un engagement significatif avec les humains et une opération réussie dans les scénarios du monde réel.
Par conséquent, de nombreux chercheurs en intelligence artificielle prévoient l’émergence des LMM comme la prochaine frontière de la recherche et du développement en intelligence artificielle en 2024. Cette frontière évolutive se concentre sur l’amélioration de la capacité de l’intelligence artificielle générative à traiter et à produire des sorties diverses, allant du texte aux images, de l’audio à la vidéo et à d’autres modalités. Il est essentiel de souligner que tous les systèmes multimodaux ne qualifient pas de LMM. Des modèles comme Midjourney et Stable Diffusion, bien qu’ils soient multimodaux, ne rentrent pas dans la catégorie des LMM principalement parce qu’ils manquent de la présence de LLM, qui est un composant fondamental des LMM. En d’autres termes, nous pouvons décrire les LMM comme une extension des LLM, leur fournissant la capacité de gérer de manière efficace diverses modalités.
Comment les LMM fonctionnent-ils ?
Alors que les chercheurs ont exploré diverses approches pour construire les LMM, ils impliquent généralement trois composants et opérations essentielles. Premièrement, des encodeurs sont utilisés pour chaque modalité de données pour générer des représentations de données (appelées embeddings) spécifiques à cette modalité. Deuxièmement, différents mécanismes sont utilisés pour aligner les embeddings de différentes modalités dans un espace d’embedding multimodal unifié. Troisièmement, pour les modèles génératifs, un LLM est employé pour générer des réponses textuelles. Comme les entrées peuvent consister en du texte, des images, des vidéos et des audio, les chercheurs travaillent sur de nouvelles façons de faire considérer les différents modes par les modèles de langage lorsqu’ils donnent des réponses.
Développement des LMM en 2023
Ci-dessous, j’ai brièvement présenté quelques-uns des LMM notables développés en 2023.
- LLaVA est un LMM open-source, développé conjointement par l’Université du Wisconsin-Madison, Microsoft (MSFT ) Research et l’Université de Columbia. Le modèle vise à offrir une version open-source de l’assistant multimodal GPT4. En exploitant le LLM Llama de Meta, il intègre l’encodeur visuel CLIP pour une compréhension visuelle robuste. La variante axée sur la santé de LLaVA, appelée LLaVA-Med, peut répondre à des questions liées à des images biomédicales.
- ImageBind est un modèle open-source créé par Meta, imitant la capacité de la perception humaine à relier des données multimodales. Le modèle intègre six modalités—texte, images/vidéos, audio, mesures 3D, données de température et données de mouvement—apprenant une représentation unifiée à travers ces types de données divers. ImageBind peut relier des objets dans des photos avec des attributs tels que des sons, des formes 3D, des températures et des mouvements. Le modèle peut être utilisé, par exemple, pour générer une scène à partir d’un texte ou d’un son.
- SeamlessM4T est un modèle multimodal conçu par Meta pour favoriser la communication entre les communautés multilingues. SeamlessM4T excelle dans les tâches de traduction et de transcription, supportant la traduction de la parole à la parole, de la parole au texte, du texte à la parole et du texte au texte. Le modèle emploie un décodeur de texte à unité non autoregressif pour effectuer ces traductions. La version améliorée, SeamlessM4T v2, forme la base de modèles tels que SeamlessExpressive et SeamlessStreaming, mettant l’accent sur la préservation de l’expression à travers les langues et fournissant des traductions avec un minimum de latence.
- GPT4, lancé par OpenAI, est une avancée de son prédécesseur, GPT3.5. Bien que les détails architecturaux spécifiques ne soient pas entièrement divulgués, GPT4 est bien considéré pour son intégration fluide des modèles texte-seulement, vision-seulement et audio-seulement. Le modèle peut générer du texte à partir d’entrées écrites et graphiques. Il excelle dans diverses tâches, notamment la description d’humour dans les images, la synthèse de texte à partir de captures d’écran et la réponse adéquate à des questions d’examen comportant des diagrammes. GPT4 est également reconnu pour son adaptabilité à traiter efficacement une large gamme de formats de données d’entrée.
- Gemini, créé par Google DeepMind, se distingue en étant inhérentement multimodal, permettant une interaction transparente à travers diverses tâches sans s’appuyer sur l’assemblage de composants à modalité unique. Ce modèle gère avec facilité à la fois le texte et les entrées audiovisuelles diverses, démontrant sa capacité à générer des sorties dans les formats texte et image.
Défis des Modèles Multimodaux de Grande Échelle
- Incorporer davantage de modalités de données : La plupart des LMM existants fonctionnent avec du texte et des images. Cependant, les LMM doivent évoluer au-delà du texte et des images, en intégrant des modalités telles que les vidéos, la musique et les données 3D.
- Disponibilité de jeux de données divers : L’un des principaux défis dans le développement et la formation de modèles génératifs d’intelligence artificielle multimodale est le besoin de grands jeux de données divers qui incluent plusieurs modalités. Par exemple, pour former un modèle capable de générer du texte et des images ensemble, le jeu de données doit inclure à la fois des entrées textuelles et des images liées.
- Générer des sorties multimodales : Alors que les LMM peuvent gérer des entrées multimodales, générer des sorties diverses, telles que combiner du texte avec des graphiques ou des animations, reste un défi.
- Suivre les instructions : Les LMM sont confrontés au défi de maîtriser les tâches de dialogue et de suivi d’instructions, allant au-delà de la simple complétion.
- Raisonnement multimodal : Alors que les LMM actuels excellent à transformer une modalité en une autre, l’intégration transparente des données multimodales pour des tâches de raisonnement complexes, telles que résoudre des problèmes écrits basés sur des instructions auditives, reste une entreprise difficile.
- Compression des LMM : La nature gourmande en ressources des LMM pose un obstacle significatif, les rendant impraticables pour les appareils de bord à ressources limitées. Compresser les LMM pour améliorer l’efficacité et les rendre adaptés au déploiement sur des appareils à ressources restreintes est un domaine de recherche en cours.
Cas d’utilisation potentiels
- Éducation : Les LMM ont le potentiel de transformer l’éducation en générant des matériaux d’apprentissage divers et engageants qui combinent du texte, des images et de l’audio. Les LMM fournissent des commentaires complets sur les devoirs, favorisent les plateformes d’apprentissage collaboratif et améliorent le développement des compétences à travers des simulations interactives et des exemples du monde réel.
- Santé : Contrairement aux systèmes de diagnostic d’intelligence artificielle traditionnels qui ciblent une seule modalité, les LMM améliorent les diagnostics médicaux en intégrant plusieurs modalités. Ils soutiennent également la communication à travers les barrières linguistiques entre les prestataires de soins de santé et les patients, agissant comme un référentiel centralisé pour diverses applications d’intelligence artificielle au sein des hôpitaux.
- Génération d’art et de musique : Les LMM pourraient exceller dans la création d’art et de musique en combinant différents modes pour des sorties uniques et expressives. Par exemple, un LMM d’art peut combiner des éléments visuels et auditifs, offrant une expérience immersive. De même, un LMM de musique peut intégrer des éléments instrumentaux et vocaux, aboutissant à des compositions dynamiques et expressives.
- Recommandations personnalisées : Les LMM peuvent analyser les préférences des utilisateurs à travers diverses modalités pour fournir des recommandations personnalisées pour la consommation de contenu, telles que des films, de la musique, des articles ou des produits.
- Prévision météorologique et surveillance environnementale : Les LMM peuvent analyser diverses modalités de données, telles que des images satellites, des conditions atmosphériques et des modèles historiques, pour améliorer la précision dans la prévision météorologique et la surveillance environnementale.
En résumé
Le paysage des Modèles Multimodaux de Grande Échelle (LMM) marque une avancée significative dans l’intelligence artificielle générative, promettant des progrès dans divers domaines. Alors que ces modèles intègrent de manière transparente différentes modalités, telles que le texte, les images et l’audio, leur développement ouvre des portes à des applications transformatrices dans les soins de santé, l’éducation, l’art et les recommandations personnalisées. Cependant, des défis, notamment l’intégration de davantage de modalités de données et la compression de modèles gourmands en ressources, soulignent les efforts de recherche continus nécessaires pour la pleine réalisation du potentiel des LMM.












