ModÃĻles et plateformes dâIA
L’intelligence artificielle multimodale ÃĐvolue avec ChatGPT qui acquiert la vue grÃĒce à GPT-4V(ision)
Dans lâeffort constant pour rendre lâIA plus semblable aux humains, les modÃĻles GPT dâOpenAI ont continuÃĐ Ã repousser les limites. GPT-4 est maintenant capable dâaccepter des invites à la fois textuelles et visuelles.
La multimodalitÃĐ dans lâIA gÃĐnÃĐrative dÃĐsigne la capacitÃĐ dâun modÃĻle à produire des sorties variÃĐes comme du texte, des images ou de lâaudio en fonction de lâentrÃĐe. Ces modÃĻles, formÃĐs sur des donnÃĐes spÃĐcifiques, apprennent les modÃĻles sous-jacents pour gÃĐnÃĐrer de nouvelles donnÃĐes similaires, enrichissant ainsi les applications dâIA.
ProgrÃĻs rÃĐcents dans lâIA multimodale
Un saut notable rÃĐcent dans ce domaine est observÃĐ avec lâintÃĐgration de DALL-E 3 dans ChatGPT, une mise à niveau significative de la technologie text-to-image dâOpenAI. Ce mÃĐlange permet une interaction plus fluide oÃđ ChatGPT aide à crÃĐer des invites prÃĐcises pour DALL-E 3, transformant les idÃĐes des utilisateurs en art vivant gÃĐnÃĐrÃĐ par lâIA. Ainsi, tandis que les utilisateurs peuvent interagir directement avec DALL-E 3, avoir ChatGPT dans le mÃĐlange rend le processus de crÃĐation dâart dâIA beaucoup plus convivial pour les utilisateurs.
Consultez plus dâinformations sur DALL-E 3 et son intÃĐgration avec ChatGPT ici. Cette collaboration ne montre pas seulement les progrÃĻs de lâIA multimodale, mais rend ÃĐgalement la crÃĐation dâart dâIA un jeu dâenfant pour les utilisateurs.
Google (GOOGL ) a introduit Med-PaLM M en juin de cette annÃĐe. Il sâagit dâun modÃĻle gÃĐnÃĐratif multimodal capable de coder et dâinterprÃĐter diverses donnÃĐes biomÃĐdicales. Cela a ÃĐtÃĐ rÃĐalisÃĐ en affinant PaLM-E, un modÃĻle de langage, pour rÃĐpondre aux domaines mÃĐdicaux en utilisant un benchmark open source, MultiMedBench. Ce benchmark, composÃĐ de plus dâun million dâÃĐchantillons à travers 7 types de donnÃĐes biomÃĐdicales et 14 tÃĒches comme la rÃĐponse aux questions mÃĐdicales et la gÃĐnÃĐration de rapports de radiologie.
Les diverses industries adoptent des outils dâIA multimodale innovants pour alimenter lâexpansion commerciale, rationaliser les opÃĐrations et ÃĐlever lâengagement client. Les progrÃĻs dans les capacitÃĐs dâIA vocale, vidÃĐo et textuelle propulsent la croissance de lâIA multimodale.
Les entreprises recherchent des applications dâIA multimodale capables de rÃĐvolutionner les modÃĻles et les processus commerciaux, ouvrant des voies de croissance à travers lâÃĐcosystÃĻme de lâIA gÃĐnÃĐrative, des outils de donnÃĐes aux applications ÃĐmergentes dâIA.
AprÃĻs le lancement de GPT-4 en mars, certains utilisateurs ont observÃĐ une baisse de la qualitÃĐ des rÃĐponses au fil du temps, une prÃĐoccupation partagÃĐe par des dÃĐveloppeurs notables et sur les forums dâOpenAI. Initialement rejetÃĐe par OpenAI, une ÃĐtude ultÃĐrieure a confirmÃĐ le problÃĻme. Elle a rÃĐvÃĐlÃĐ une chute de la prÃĐcision de GPT-4 de 97,6 % à 2,4 % entre mars et juin, indiquant une baisse de la qualitÃĐ des rÃĐponses avec les mises à jour ultÃĐrieures du modÃĻle.
Lâeffervescence autour de Open AIâs ChatGPT est de retour maintenant. Il est maintenant dotÃĐ dâune fonctionnalitÃĐ de vision GPT-4V, permettant aux utilisateurs de faire analyser des images par GPT-4. Il sâagit de la fonctionnalitÃĐ la plus rÃĐcente qui a ÃĐtÃĐ ouverte aux utilisateurs.
Lâajout dâune analyse dâimages à de grands modÃĻles de langage (LLM) comme GPT-4 est considÃĐrÃĐ par certains comme un grand pas en avant dans la recherche et le dÃĐveloppement de lâIA. Ce type de LLM multimodale ouvre de nouvelles possibilitÃĐs, faisant passer les modÃĻles de langage au-delà du texte pour offrir de nouvelles interfaces et rÃĐsoudre de nouveaux types de tÃĒches, crÃĐant ainsi de nouvelles expÃĐriences pour les utilisateurs.
La formation de GPT-4V a ÃĐtÃĐ achevÃĐe en 2022, avec un accÃĻs anticipÃĐ en mars 2023. La fonctionnalitÃĐ visuelle de GPT-4V est alimentÃĐe par la technologie GPT-4. Le processus de formation est restÃĐ le mÊme. Initialement, le modÃĻle a ÃĐtÃĐ formÃĐ pour prÃĐdire le mot suivant dans un texte à lâaide dâun ÃĐnorme ensemble de donnÃĐes de texte et dâimages provenant de diverses sources, y compris Internet.
Par la suite, il a ÃĐtÃĐ affinÃĐ avec davantage de donnÃĐes, en utilisant une mÃĐthode appelÃĐe apprentissage par renforcement à partir de la rÃĐtroaction humaine (RLHF), pour gÃĐnÃĐrer des sorties que les humains prÃĐfÃĻrent.
MÃĐcanismes de vision de GPT-4
Les capacitÃĐs de langage visuel remarquables de GPT-4, bien que impressionnantes, ont des mÃĐthodes sous-jacentes qui restent en surface.
Pour explorer cette hypothÃĻse, un nouveau modÃĻle de langage visuel, MiniGPT-4 fut introduit, en utilisant un LLM avancÃĐ nommÃĐ Vicuna. Ce modÃĻle utilise un encodeur visuel avec des composants prÃĐ-entraÃŪnÃĐs pour la perception visuelle, en alignant les fonctionnalitÃĐs visuelles codÃĐes avec le modÃĻle de langage Vicuna à travers une seule couche de projection. Lâarchitecture de MiniGPT-4 est simple mais efficace, avec un accent sur lâalignement des fonctionnalitÃĐs visuelles et linguistiques pour amÃĐliorer les capacitÃĐs de conversation visuelle.

Lâarchitecture de MiniGPT-4 comprend un encodeur visuel avec ViT et Q-Former prÃĐ-entraÃŪnÃĐs, une seule couche de projection linÃĐaire et un modÃĻle de langage Vicuna avancÃĐ.
La tendance des modÃĻles de langage autoregressifs dans les tÃĒches de langage visuel a ÃĐgalement augmentÃĐ, en exploitant le transfert intermodal pour partager des connaissances entre les domaines linguistiques et multimodaux.
MiniGPT-4 relie les domaines visuel et linguistique en alignant les informations visuelles dâun encodeur visuel prÃĐ-entraÃŪnÃĐ avec un LLM avancÃĐ. Le modÃĻle utilise Vicuna comme dÃĐcodeur de langage et suit une approche de formation en deux ÃĐtapes. Initialement, il est formÃĐ sur un grand ensemble de donnÃĐes dâappariement image-texte pour acquÃĐrir des connaissances de langage visuel, suivi dâun affinement sur un ensemble de donnÃĐes plus petit et de haute qualitÃĐ pour amÃĐliorer la fiabilitÃĐ et lâutilitÃĐ de la gÃĐnÃĐration.
Pour amÃĐliorer la naturalitÃĐ et lâutilitÃĐ du langage gÃĐnÃĐrÃĐ dans MiniGPT-4, les chercheurs ont dÃĐveloppÃĐ un processus dâalignement en deux ÃĐtapes, en rÃĐponse au manque de jeux de donnÃĐes dâalignement de langage visuel adÃĐquats. Ils ont crÃĐÃĐ un ensemble de donnÃĐes spÃĐcialisÃĐ Ã cette fin.
Initialement, le modÃĻle a gÃĐnÃĐrÃĐ des descriptions dÃĐtaillÃĐes des images dâentrÃĐe, en amÃĐliorant les dÃĐtails en utilisant une invite de conversation alignÃĐe sur le format du modÃĻle de langage Vicuna. Cette ÃĐtape visait à gÃĐnÃĐrer des descriptions dâimages plus complÃĻtes.
Invite de description dâimage initiale:
###Humain: <Img><CaractÃĐristique dâimage></Img>DÃĐcrivez cette image en dÃĐtail. Donnez autant de dÃĐtails que possible. Dites tout ce que vous voyez. ###Assistant:
Pour le post-traitement des donnÃĐes, les incohÃĐrences ou les erreurs dans les descriptions gÃĐnÃĐrÃĐes ont ÃĐtÃĐ corrigÃĐes en utilisant ChatGPT, suivies dâune vÃĐrification manuelle pour assurer une haute qualitÃĐ.
Invite dâaffinement de deuxiÃĻme ÃĐtape:
###Humain: <Img><CaractÃĐristique dâimage></Img><Instruction>###Assistant:
Cette exploration ouvre une fenÊtre sur la comprÃĐhension des mÃĐcanismes de lâIA gÃĐnÃĐrative multimodale comme GPT-4, en ÃĐclairant la maniÃĻre dont les modalitÃĐs visuelle et linguistique peuvent Être intÃĐgrÃĐes efficacement pour gÃĐnÃĐrer des sorties cohÃĐrentes et riches en contexte.
Exploration de la vision de GPT-4
DÃĐtermination de lâorigine des images avec ChatGPT
GPT-4 Vision amÃĐliore la capacitÃĐ de ChatGPT à analyser les images et à identifier leurs origines gÃĐographiques. Cette fonctionnalitÃĐ fait passer les interactions utilisateur de simples textes à un mÃĐlange de texte et de visuels, devenant ainsi un outil pratique pour ceux qui sont curieux de diffÃĐrents endroits à travers les donnÃĐes dâimages.
Concepts mathÃĐmatiques complexes
GPT-4 Vision excelle dans lâexploration de concepts mathÃĐmatiques complexes en analysant des expressions graphiques ou manuscrites. Cette fonctionnalitÃĐ agit comme un outil utile pour les individus qui cherchent à rÃĐsoudre des problÃĻmes mathÃĐmatiques complexes, faisant de GPT-4 Vision un outil notable dans les domaines ÃĐducatif et acadÃĐmique.
Conversion dâentrÃĐes manuscrites en codes LaTeX
Lâune des capacitÃĐs remarquables de GPT-4V est sa capacitÃĐ Ã traduire des entrÃĐes manuscrites en codes LaTeX. Cette fonctionnalitÃĐ est un atout pour les chercheurs, les universitaires et les ÃĐtudiants qui ont souvent besoin de convertir des expressions mathÃĐmatiques manuscrites ou dâautres informations techniques en format numÃĐrique. La transformation de manuscrit à LaTeX ÃĐlargit lâhorizon de la numÃĐrisation de documents et simplifie le processus dâÃĐcriture technique.
Extraction de dÃĐtails de tableau
GPT-4V fait preuve de compÃĐtence dans lâextraction de dÃĐtails à partir de tableaux et dans la rÃĐponse à des questions connexes, un atout vital dans lâanalyse de donnÃĐes. Les utilisateurs peuvent utiliser GPT-4V pour passer au crible les tableaux, rassembler des informations clÃĐs et rÃĐsoudre des questions, ce qui en fait un outil robuste pour les analystes de donnÃĐes et dâautres professionnels.
ComprÃĐhension du pointage visuel
La capacitÃĐ unique de GPT-4V à comprendre le pointage visuel ajoute une nouvelle dimension à lâinteraction utilisateur. En comprenant les indices visuels, GPT-4V peut rÃĐpondre à des questions avec une comprÃĐhension contextuelle plus ÃĐlevÃĐe.
CrÃĐation de sites Web de dÃĐmonstration simples à lâaide dâun dessin
MotivÃĐ par ce tweet, jâai tentÃĐ de crÃĐer une maquette pour le site Web unite.ai.
Alors que le rÃĐsultat nâa pas tout à fait correspondu à ma vision initiale, voici le rÃĐsultat que jâai obtenu.
Limitations et dÃĐfauts de GPT-4V(ision)
Pour analyser GPT-4V, lâÃĐquipe dâOpen AI a menÃĐ des ÃĐvaluations qualitatives et quantitatives. Les ÃĐvaluations qualitatives comprenaient des tests internes et des examens dâexperts externes, tandis que les ÃĐvaluations quantitatives mesuraient les refus du modÃĻle et la prÃĐcision dans divers scÃĐnarios tels que lâidentification de contenu nuisible, la reconnaissance dÃĐmographique, les prÃĐoccupations de confidentialitÃĐ, la gÃĐolocalisation, la cybersÃĐcuritÃĐ et les jailbreaks multimodaux.
Pourtant, le modÃĻle nâest pas parfait.
Le document met en ÃĐvidence les limites de GPT-4V, telles que des infÃĐrences incorrectes et des textes ou des caractÃĻres manquants dans les images. Il peut halluciner ou inventer des faits. En particulier, il nâest pas adaptÃĐ pour identifier les substances dangereuses dans les images, les confondant souvent.
Dans lâimagerie mÃĐdicale, GPT-4V peut fournir des rÃĐponses incohÃĐrentes et manque de connaissance des pratiques standard, ce qui peut conduire à des erreurs de diagnostic potentielles.

Performances peu fiables pour des fins mÃĐdicales (Source)
Il ÃĐchoue ÃĐgalement à comprendre les nuances de certains symboles de haine et peut gÃĐnÃĐrer un contenu inappropriÃĐ en fonction des entrÃĐes visuelles. OpenAI conseille contre lâutilisation de GPT-4V pour des interprÃĐtations critiques, en particulier dans des contextes mÃĐdicaux ou sensibles.
Conclusion

CrÃĐÃĐ Ã lâaide de Fast Stable Diffusion XL https://huggingface.co/spaces/google/sdxl
LâarrivÃĐe de GPT-4 Vision (GPT-4V) apporte un ensemble de possibilitÃĐs sympas et de nouveaux dÃĐfis à relever. Avant de le lancer, beaucoup dâefforts ont ÃĐtÃĐ consacrÃĐs pour sâassurer que les risques, en particulier lorsquâil sâagit dâimages de personnes, sont bien examinÃĐs et rÃĐduits. Il est impressionnant de voir comment GPT-4V a fait un grand pas en avant, montrant beaucoup de promesses dans des domaines dÃĐlicats comme la mÃĐdecine et la science.
Maintenant, il y a de grandes questions sur la table. Par exemple, ces modÃĻles devraient-ils Être capables dâidentifier des personnalitÃĐs cÃĐlÃĻbres à partir de photos ? Devraient-ils deviner le sexe, la race ou les sentiments dâune personne à partir dâune image ? Et devrait-il y avoir des ajustements spÃĐciaux pour aider les personnes ayant des dÃĐficiences visuelles ? Ces questions ouvrent une boÃŪte de vers à propos de la confidentialitÃĐ, de lâÃĐquitÃĐ et de la maniÃĻre dont lâIA devrait sâintÃĐgrer dans notre vie, ce qui est quelque chose que tout le monde devrait avoir son mot à dire.




















