Modèles et plateformes d’IA

L’intelligence artificielle multimodale évolue avec ChatGPT qui acquiert la vue grâce à GPT-4V(ision)

mm
Ajouter Unite.AI à vos sources préférées sur Google

Dans l’effort constant pour rendre l’IA plus semblable aux humains, les modèles GPT d’OpenAI ont continué à repousser les limites. GPT-4 est maintenant capable d’accepter des invites à la fois textuelles et visuelles.

La multimodalité dans l’IA générative désigne la capacité d’un modèle à produire des sorties variées comme du texte, des images ou de l’audio en fonction de l’entrée. Ces modèles, formés sur des données spécifiques, apprennent les modèles sous-jacents pour générer de nouvelles données similaires, enrichissant ainsi les applications d’IA.

Progrès récents dans l’IA multimodale

Un saut notable récent dans ce domaine est observé avec l’intégration de DALL-E 3 dans ChatGPT, une mise à niveau significative de la technologie text-to-image d’OpenAI. Ce mélange permet une interaction plus fluide où ChatGPT aide à créer des invites précises pour DALL-E 3, transformant les idées des utilisateurs en art vivant généré par l’IA. Ainsi, tandis que les utilisateurs peuvent interagir directement avec DALL-E 3, avoir ChatGPT dans le mélange rend le processus de création d’art d’IA beaucoup plus convivial pour les utilisateurs.

Consultez plus d’informations sur DALL-E 3 et son intégration avec ChatGPT ici. Cette collaboration ne montre pas seulement les progrès de l’IA multimodale, mais rend également la création d’art d’IA un jeu d’enfant pour les utilisateurs.

Google (GOOGL ) a introduit Med-PaLM M en juin de cette année. Il s’agit d’un modèle génératif multimodal capable de coder et d’interpréter diverses données biomédicales. Cela a été réalisé en affinant PaLM-E, un modèle de langage, pour répondre aux domaines médicaux en utilisant un benchmark open source, MultiMedBench. Ce benchmark, composé de plus d’un million d’échantillons à travers 7 types de données biomédicales et 14 tâches comme la réponse aux questions médicales et la génération de rapports de radiologie.

Les diverses industries adoptent des outils d’IA multimodale innovants pour alimenter l’expansion commerciale, rationaliser les opérations et élever l’engagement client. Les progrès dans les capacités d’IA vocale, vidéo et textuelle propulsent la croissance de l’IA multimodale.

Les entreprises recherchent des applications d’IA multimodale capables de révolutionner les modèles et les processus commerciaux, ouvrant des voies de croissance à travers l’écosystème de l’IA générative, des outils de données aux applications émergentes d’IA.

Après le lancement de GPT-4 en mars, certains utilisateurs ont observé une baisse de la qualité des réponses au fil du temps, une préoccupation partagée par des développeurs notables et sur les forums d’OpenAI. Initialement rejetée par OpenAI, une étude ultérieure a confirmé le problème. Elle a révélé une chute de la précision de GPT-4 de 97,6 % à 2,4 % entre mars et juin, indiquant une baisse de la qualité des réponses avec les mises à jour ultérieures du modèle.

chatgpt-ai

ChatGPT (Bleu) & Intelligence artificielle (Rouge) Tendance de recherche Google

L’effervescence autour de Open AI’s ChatGPT est de retour maintenant. Il est maintenant doté d’une fonctionnalité de vision GPT-4V, permettant aux utilisateurs de faire analyser des images par GPT-4. Il s’agit de la fonctionnalité la plus récente qui a été ouverte aux utilisateurs.

L’ajout d’une analyse d’images à de grands modèles de langage (LLM) comme GPT-4 est considéré par certains comme un grand pas en avant dans la recherche et le développement de l’IA. Ce type de LLM multimodale ouvre de nouvelles possibilités, faisant passer les modèles de langage au-delà du texte pour offrir de nouvelles interfaces et résoudre de nouveaux types de tâches, créant ainsi de nouvelles expériences pour les utilisateurs.

La formation de GPT-4V a été achevée en 2022, avec un accès anticipé en mars 2023. La fonctionnalité visuelle de GPT-4V est alimentée par la technologie GPT-4. Le processus de formation est resté le même. Initialement, le modèle a été formé pour prédire le mot suivant dans un texte à l’aide d’un énorme ensemble de données de texte et d’images provenant de diverses sources, y compris Internet.

Par la suite, il a été affiné avec davantage de données, en utilisant une méthode appelée apprentissage par renforcement à partir de la rétroaction humaine (RLHF), pour générer des sorties que les humains préfèrent.

Mécanismes de vision de GPT-4

Les capacités de langage visuel remarquables de GPT-4, bien que impressionnantes, ont des méthodes sous-jacentes qui restent en surface.

Pour explorer cette hypothèse, un nouveau modèle de langage visuel, MiniGPT-4 fut introduit, en utilisant un LLM avancé nommé Vicuna. Ce modèle utilise un encodeur visuel avec des composants pré-entraînés pour la perception visuelle, en alignant les fonctionnalités visuelles codées avec le modèle de langage Vicuna à travers une seule couche de projection. L’architecture de MiniGPT-4 est simple mais efficace, avec un accent sur l’alignement des fonctionnalités visuelles et linguistiques pour améliorer les capacités de conversation visuelle.

MiniGPT-4

L’architecture de MiniGPT-4 comprend un encodeur visuel avec ViT et Q-Former pré-entraînés, une seule couche de projection linéaire et un modèle de langage Vicuna avancé.

La tendance des modèles de langage autoregressifs dans les tâches de langage visuel a également augmenté, en exploitant le transfert intermodal pour partager des connaissances entre les domaines linguistiques et multimodaux.

MiniGPT-4 relie les domaines visuel et linguistique en alignant les informations visuelles d’un encodeur visuel pré-entraîné avec un LLM avancé. Le modèle utilise Vicuna comme décodeur de langage et suit une approche de formation en deux étapes. Initialement, il est formé sur un grand ensemble de données d’appariement image-texte pour acquérir des connaissances de langage visuel, suivi d’un affinement sur un ensemble de données plus petit et de haute qualité pour améliorer la fiabilité et l’utilité de la génération.

Pour améliorer la naturalité et l’utilité du langage généré dans MiniGPT-4, les chercheurs ont développé un processus d’alignement en deux étapes, en réponse au manque de jeux de données d’alignement de langage visuel adéquats. Ils ont créé un ensemble de données spécialisé à cette fin.

Initialement, le modèle a généré des descriptions détaillées des images d’entrée, en améliorant les détails en utilisant une invite de conversation alignée sur le format du modèle de langage Vicuna. Cette étape visait à générer des descriptions d’images plus complètes.

Invite de description d’image initiale:

###Humain: <Img><Caractéristique d’image></Img>Décrivez cette image en détail. Donnez autant de détails que possible. Dites tout ce que vous voyez. ###Assistant:

Pour le post-traitement des données, les incohérences ou les erreurs dans les descriptions générées ont été corrigées en utilisant ChatGPT, suivies d’une vérification manuelle pour assurer une haute qualité.

Invite d’affinement de deuxième étape:

###Humain: <Img><Caractéristique d’image></Img><Instruction>###Assistant:

Cette exploration ouvre une fenêtre sur la compréhension des mécanismes de l’IA générative multimodale comme GPT-4, en éclairant la manière dont les modalités visuelle et linguistique peuvent être intégrées efficacement pour générer des sorties cohérentes et riches en contexte.

Exploration de la vision de GPT-4

Détermination de l’origine des images avec ChatGPT

GPT-4 Vision améliore la capacité de ChatGPT à analyser les images et à identifier leurs origines géographiques. Cette fonctionnalité fait passer les interactions utilisateur de simples textes à un mélange de texte et de visuels, devenant ainsi un outil pratique pour ceux qui sont curieux de différents endroits à travers les données d’images.

Chatgpt-vision-GPT-4

Demander à ChatGPT où une image de monument est prise

Concepts mathématiques complexes

GPT-4 Vision excelle dans l’exploration de concepts mathématiques complexes en analysant des expressions graphiques ou manuscrites. Cette fonctionnalité agit comme un outil utile pour les individus qui cherchent à résoudre des problèmes mathématiques complexes, faisant de GPT-4 Vision un outil notable dans les domaines éducatif et académique.

Chatgpt-vision-GPT-4

Demander à ChatGPT de comprendre un concept mathématique complexe

Conversion d’entrées manuscrites en codes LaTeX

L’une des capacités remarquables de GPT-4V est sa capacité à traduire des entrées manuscrites en codes LaTeX. Cette fonctionnalité est un atout pour les chercheurs, les universitaires et les étudiants qui ont souvent besoin de convertir des expressions mathématiques manuscrites ou d’autres informations techniques en format numérique. La transformation de manuscrit à LaTeX élargit l’horizon de la numérisation de documents et simplifie le processus d’écriture technique.

Capacité de GPT-4V à convertir l'entrée manuscrite en codes LaTeX

Capacité de GPT-4V à convertir l’entrée manuscrite en codes LaTeX

Extraction de détails de tableau

GPT-4V fait preuve de compétence dans l’extraction de détails à partir de tableaux et dans la réponse à des questions connexes, un atout vital dans l’analyse de données. Les utilisateurs peuvent utiliser GPT-4V pour passer au crible les tableaux, rassembler des informations clés et résoudre des questions, ce qui en fait un outil robuste pour les analystes de données et d’autres professionnels.

GPT-4V déchiffre les détails du tableau et répond à des questions connexes

GPT-4V déchiffre les détails du tableau et répond à des questions connexes

Compréhension du pointage visuel

La capacité unique de GPT-4V à comprendre le pointage visuel ajoute une nouvelle dimension à l’interaction utilisateur. En comprenant les indices visuels, GPT-4V peut répondre à des questions avec une compréhension contextuelle plus élevée.

GPT-4V démontre la capacité unique de comprendre le pointage visuel

GPT-4V démontre la capacité unique de comprendre le pointage visuel

Création de sites Web de démonstration simples à l’aide d’un dessin

Motivé par ce tweet, j’ai tenté de créer une maquette pour le site Web unite.ai.

Alors que le résultat n’a pas tout à fait correspondu à ma vision initiale, voici le résultat que j’ai obtenu.

Sortie HTML de l'interface utilisateur de ChatGPT Vision

Sortie HTML de l’interface utilisateur de ChatGPT Vision

Limitations et défauts de GPT-4V(ision)

Pour analyser GPT-4V, l’équipe d’Open AI a mené des évaluations qualitatives et quantitatives. Les évaluations qualitatives comprenaient des tests internes et des examens d’experts externes, tandis que les évaluations quantitatives mesuraient les refus du modèle et la précision dans divers scénarios tels que l’identification de contenu nuisible, la reconnaissance démographique, les préoccupations de confidentialité, la géolocalisation, la cybersécurité et les jailbreaks multimodaux.

Pourtant, le modèle n’est pas parfait.

Le document met en évidence les limites de GPT-4V, telles que des inférences incorrectes et des textes ou des caractères manquants dans les images. Il peut halluciner ou inventer des faits. En particulier, il n’est pas adapté pour identifier les substances dangereuses dans les images, les confondant souvent.

Dans l’imagerie médicale, GPT-4V peut fournir des réponses incohérentes et manque de connaissance des pratiques standard, ce qui peut conduire à des erreurs de diagnostic potentielles.

Performances peu fiables pour des fins médicales.

Performances peu fiables pour des fins médicales (Source)

Il échoue également à comprendre les nuances de certains symboles de haine et peut générer un contenu inapproprié en fonction des entrées visuelles. OpenAI conseille contre l’utilisation de GPT-4V pour des interprétations critiques, en particulier dans des contextes médicaux ou sensibles.

Conclusion

Créé à l'aide de Fast Stable Diffusion XL

Créé à l’aide de Fast Stable Diffusion XL https://huggingface.co/spaces/google/sdxl

L’arrivée de GPT-4 Vision (GPT-4V) apporte un ensemble de possibilités sympas et de nouveaux défis à relever. Avant de le lancer, beaucoup d’efforts ont été consacrés pour s’assurer que les risques, en particulier lorsqu’il s’agit d’images de personnes, sont bien examinés et réduits. Il est impressionnant de voir comment GPT-4V a fait un grand pas en avant, montrant beaucoup de promesses dans des domaines délicats comme la médecine et la science.

Maintenant, il y a de grandes questions sur la table. Par exemple, ces modèles devraient-ils être capables d’identifier des personnalités célèbres à partir de photos ? Devraient-ils deviner le sexe, la race ou les sentiments d’une personne à partir d’une image ? Et devrait-il y avoir des ajustements spéciaux pour aider les personnes ayant des déficiences visuelles ? Ces questions ouvrent une boîte de vers à propos de la confidentialité, de l’équité et de la manière dont l’IA devrait s’intégrer dans notre vie, ce qui est quelque chose que tout le monde devrait avoir son mot à dire.

J'ai passé les cinq dernières années à plonger dans le monde fascinant de l'apprentissage automatique et du deep learning. Ma passion et mon expertise m'ont conduit à contribuer à plus de 50 projets de génie logiciel divers, avec un focus particulier sur l'IA/ML. Ma curiosité continue m'a également attiré vers le traitement automatique des langues, un domaine que je suis impatient d'explorer plus en profondeur.