ModÃĻles et plateformes d’IA

L’intelligence artificielle multimodale ÃĐvolue avec ChatGPT qui acquiert la vue grÃĒce à GPT-4V(ision)

mm
Ajouter Unite.AI à vos sources prÃĐfÃĐrÃĐes sur Google

Dans l’effort constant pour rendre l’IA plus semblable aux humains, les modÃĻles GPT d’OpenAI ont continuÃĐ Ã  repousser les limites. GPT-4 est maintenant capable d’accepter des invites à la fois textuelles et visuelles.

La multimodalitÃĐ dans l’IA gÃĐnÃĐrative dÃĐsigne la capacitÃĐ d’un modÃĻle à produire des sorties variÃĐes comme du texte, des images ou de l’audio en fonction de l’entrÃĐe. Ces modÃĻles, formÃĐs sur des donnÃĐes spÃĐcifiques, apprennent les modÃĻles sous-jacents pour gÃĐnÃĐrer de nouvelles donnÃĐes similaires, enrichissant ainsi les applications d’IA.

ProgrÃĻs rÃĐcents dans l’IA multimodale

Un saut notable rÃĐcent dans ce domaine est observÃĐ avec l’intÃĐgration de DALL-E 3 dans ChatGPT, une mise à niveau significative de la technologie text-to-image d’OpenAI. Ce mÃĐlange permet une interaction plus fluide oÃđ ChatGPT aide à crÃĐer des invites prÃĐcises pour DALL-E 3, transformant les idÃĐes des utilisateurs en art vivant gÃĐnÃĐrÃĐ par l’IA. Ainsi, tandis que les utilisateurs peuvent interagir directement avec DALL-E 3, avoir ChatGPT dans le mÃĐlange rend le processus de crÃĐation d’art d’IA beaucoup plus convivial pour les utilisateurs.

Consultez plus d’informations sur DALL-E 3 et son intÃĐgration avec ChatGPT ici. Cette collaboration ne montre pas seulement les progrÃĻs de l’IA multimodale, mais rend ÃĐgalement la crÃĐation d’art d’IA un jeu d’enfant pour les utilisateurs.

Google (GOOGL ) a introduit Med-PaLM M en juin de cette annÃĐe. Il s’agit d’un modÃĻle gÃĐnÃĐratif multimodal capable de coder et d’interprÃĐter diverses donnÃĐes biomÃĐdicales. Cela a ÃĐtÃĐ rÃĐalisÃĐ en affinant PaLM-E, un modÃĻle de langage, pour rÃĐpondre aux domaines mÃĐdicaux en utilisant un benchmark open source, MultiMedBench. Ce benchmark, composÃĐ de plus d’un million d’ÃĐchantillons à travers 7 types de donnÃĐes biomÃĐdicales et 14 tÃĒches comme la rÃĐponse aux questions mÃĐdicales et la gÃĐnÃĐration de rapports de radiologie.

Les diverses industries adoptent des outils d’IA multimodale innovants pour alimenter l’expansion commerciale, rationaliser les opÃĐrations et ÃĐlever l’engagement client. Les progrÃĻs dans les capacitÃĐs d’IA vocale, vidÃĐo et textuelle propulsent la croissance de l’IA multimodale.

Les entreprises recherchent des applications d’IA multimodale capables de rÃĐvolutionner les modÃĻles et les processus commerciaux, ouvrant des voies de croissance à travers l’ÃĐcosystÃĻme de l’IA gÃĐnÃĐrative, des outils de donnÃĐes aux applications ÃĐmergentes d’IA.

AprÃĻs le lancement de GPT-4 en mars, certains utilisateurs ont observÃĐ une baisse de la qualitÃĐ des rÃĐponses au fil du temps, une prÃĐoccupation partagÃĐe par des dÃĐveloppeurs notables et sur les forums d’OpenAI. Initialement rejetÃĐe par OpenAI, une ÃĐtude ultÃĐrieure a confirmÃĐ le problÃĻme. Elle a rÃĐvÃĐlÃĐ une chute de la prÃĐcision de GPT-4 de 97,6 % à 2,4 % entre mars et juin, indiquant une baisse de la qualitÃĐ des rÃĐponses avec les mises à jour ultÃĐrieures du modÃĻle.

chatgpt-ai

ChatGPT (Bleu) & Intelligence artificielle (Rouge) Tendance de recherche Google

L’effervescence autour de Open AI’s ChatGPT est de retour maintenant. Il est maintenant dotÃĐ d’une fonctionnalitÃĐ de vision GPT-4V, permettant aux utilisateurs de faire analyser des images par GPT-4. Il s’agit de la fonctionnalitÃĐ la plus rÃĐcente qui a ÃĐtÃĐ ouverte aux utilisateurs.

L’ajout d’une analyse d’images à de grands modÃĻles de langage (LLM) comme GPT-4 est considÃĐrÃĐ par certains comme un grand pas en avant dans la recherche et le dÃĐveloppement de l’IA. Ce type de LLM multimodale ouvre de nouvelles possibilitÃĐs, faisant passer les modÃĻles de langage au-delà du texte pour offrir de nouvelles interfaces et rÃĐsoudre de nouveaux types de tÃĒches, crÃĐant ainsi de nouvelles expÃĐriences pour les utilisateurs.

La formation de GPT-4V a ÃĐtÃĐ achevÃĐe en 2022, avec un accÃĻs anticipÃĐ en mars 2023. La fonctionnalitÃĐ visuelle de GPT-4V est alimentÃĐe par la technologie GPT-4. Le processus de formation est restÃĐ le mÊme. Initialement, le modÃĻle a ÃĐtÃĐ formÃĐ pour prÃĐdire le mot suivant dans un texte à l’aide d’un ÃĐnorme ensemble de donnÃĐes de texte et d’images provenant de diverses sources, y compris Internet.

Par la suite, il a ÃĐtÃĐ affinÃĐ avec davantage de donnÃĐes, en utilisant une mÃĐthode appelÃĐe apprentissage par renforcement à partir de la rÃĐtroaction humaine (RLHF), pour gÃĐnÃĐrer des sorties que les humains prÃĐfÃĻrent.

MÃĐcanismes de vision de GPT-4

Les capacitÃĐs de langage visuel remarquables de GPT-4, bien que impressionnantes, ont des mÃĐthodes sous-jacentes qui restent en surface.

Pour explorer cette hypothÃĻse, un nouveau modÃĻle de langage visuel, MiniGPT-4 fut introduit, en utilisant un LLM avancÃĐ nommÃĐ Vicuna. Ce modÃĻle utilise un encodeur visuel avec des composants prÃĐ-entraÃŪnÃĐs pour la perception visuelle, en alignant les fonctionnalitÃĐs visuelles codÃĐes avec le modÃĻle de langage Vicuna à travers une seule couche de projection. L’architecture de MiniGPT-4 est simple mais efficace, avec un accent sur l’alignement des fonctionnalitÃĐs visuelles et linguistiques pour amÃĐliorer les capacitÃĐs de conversation visuelle.

MiniGPT-4

L’architecture de MiniGPT-4 comprend un encodeur visuel avec ViT et Q-Former prÃĐ-entraÃŪnÃĐs, une seule couche de projection linÃĐaire et un modÃĻle de langage Vicuna avancÃĐ.

La tendance des modÃĻles de langage autoregressifs dans les tÃĒches de langage visuel a ÃĐgalement augmentÃĐ, en exploitant le transfert intermodal pour partager des connaissances entre les domaines linguistiques et multimodaux.

MiniGPT-4 relie les domaines visuel et linguistique en alignant les informations visuelles d’un encodeur visuel prÃĐ-entraÃŪnÃĐ avec un LLM avancÃĐ. Le modÃĻle utilise Vicuna comme dÃĐcodeur de langage et suit une approche de formation en deux ÃĐtapes. Initialement, il est formÃĐ sur un grand ensemble de donnÃĐes d’appariement image-texte pour acquÃĐrir des connaissances de langage visuel, suivi d’un affinement sur un ensemble de donnÃĐes plus petit et de haute qualitÃĐ pour amÃĐliorer la fiabilitÃĐ et l’utilitÃĐ de la gÃĐnÃĐration.

Pour amÃĐliorer la naturalitÃĐ et l’utilitÃĐ du langage gÃĐnÃĐrÃĐ dans MiniGPT-4, les chercheurs ont dÃĐveloppÃĐ un processus d’alignement en deux ÃĐtapes, en rÃĐponse au manque de jeux de donnÃĐes d’alignement de langage visuel adÃĐquats. Ils ont crÃĐÃĐ un ensemble de donnÃĐes spÃĐcialisÃĐ Ã  cette fin.

Initialement, le modÃĻle a gÃĐnÃĐrÃĐ des descriptions dÃĐtaillÃĐes des images d’entrÃĐe, en amÃĐliorant les dÃĐtails en utilisant une invite de conversation alignÃĐe sur le format du modÃĻle de langage Vicuna. Cette ÃĐtape visait à gÃĐnÃĐrer des descriptions d’images plus complÃĻtes.

Invite de description d’image initiale:

###Humain: <Img><CaractÃĐristique d’image></Img>DÃĐcrivez cette image en dÃĐtail. Donnez autant de dÃĐtails que possible. Dites tout ce que vous voyez. ###Assistant:

Pour le post-traitement des donnÃĐes, les incohÃĐrences ou les erreurs dans les descriptions gÃĐnÃĐrÃĐes ont ÃĐtÃĐ corrigÃĐes en utilisant ChatGPT, suivies d’une vÃĐrification manuelle pour assurer une haute qualitÃĐ.

Invite d’affinement de deuxiÃĻme ÃĐtape:

###Humain: <Img><CaractÃĐristique d’image></Img><Instruction>###Assistant:

Cette exploration ouvre une fenÊtre sur la comprÃĐhension des mÃĐcanismes de l’IA gÃĐnÃĐrative multimodale comme GPT-4, en ÃĐclairant la maniÃĻre dont les modalitÃĐs visuelle et linguistique peuvent Être intÃĐgrÃĐes efficacement pour gÃĐnÃĐrer des sorties cohÃĐrentes et riches en contexte.

Exploration de la vision de GPT-4

DÃĐtermination de l’origine des images avec ChatGPT

GPT-4 Vision amÃĐliore la capacitÃĐ de ChatGPT à analyser les images et à identifier leurs origines gÃĐographiques. Cette fonctionnalitÃĐ fait passer les interactions utilisateur de simples textes à un mÃĐlange de texte et de visuels, devenant ainsi un outil pratique pour ceux qui sont curieux de diffÃĐrents endroits à travers les donnÃĐes d’images.

Chatgpt-vision-GPT-4

Demander à ChatGPT oÃđ une image de monument est prise

Concepts mathÃĐmatiques complexes

GPT-4 Vision excelle dans l’exploration de concepts mathÃĐmatiques complexes en analysant des expressions graphiques ou manuscrites. Cette fonctionnalitÃĐ agit comme un outil utile pour les individus qui cherchent à rÃĐsoudre des problÃĻmes mathÃĐmatiques complexes, faisant de GPT-4 Vision un outil notable dans les domaines ÃĐducatif et acadÃĐmique.

Chatgpt-vision-GPT-4

Demander à ChatGPT de comprendre un concept mathÃĐmatique complexe

Conversion d’entrÃĐes manuscrites en codes LaTeX

L’une des capacitÃĐs remarquables de GPT-4V est sa capacitÃĐ Ã  traduire des entrÃĐes manuscrites en codes LaTeX. Cette fonctionnalitÃĐ est un atout pour les chercheurs, les universitaires et les ÃĐtudiants qui ont souvent besoin de convertir des expressions mathÃĐmatiques manuscrites ou d’autres informations techniques en format numÃĐrique. La transformation de manuscrit à LaTeX ÃĐlargit l’horizon de la numÃĐrisation de documents et simplifie le processus d’ÃĐcriture technique.

CapacitÃĐ de GPT-4V à convertir l'entrÃĐe manuscrite en codes LaTeX

CapacitÃĐ de GPT-4V à convertir l’entrÃĐe manuscrite en codes LaTeX

Extraction de dÃĐtails de tableau

GPT-4V fait preuve de compÃĐtence dans l’extraction de dÃĐtails à partir de tableaux et dans la rÃĐponse à des questions connexes, un atout vital dans l’analyse de donnÃĐes. Les utilisateurs peuvent utiliser GPT-4V pour passer au crible les tableaux, rassembler des informations clÃĐs et rÃĐsoudre des questions, ce qui en fait un outil robuste pour les analystes de donnÃĐes et d’autres professionnels.

GPT-4V dÃĐchiffre les dÃĐtails du tableau et rÃĐpond à des questions connexes

GPT-4V dÃĐchiffre les dÃĐtails du tableau et rÃĐpond à des questions connexes

ComprÃĐhension du pointage visuel

La capacitÃĐ unique de GPT-4V à comprendre le pointage visuel ajoute une nouvelle dimension à l’interaction utilisateur. En comprenant les indices visuels, GPT-4V peut rÃĐpondre à des questions avec une comprÃĐhension contextuelle plus ÃĐlevÃĐe.

GPT-4V dÃĐmontre la capacitÃĐ unique de comprendre le pointage visuel

GPT-4V dÃĐmontre la capacitÃĐ unique de comprendre le pointage visuel

CrÃĐation de sites Web de dÃĐmonstration simples à l’aide d’un dessin

MotivÃĐ par ce tweet, j’ai tentÃĐ de crÃĐer une maquette pour le site Web unite.ai.

Alors que le rÃĐsultat n’a pas tout à fait correspondu à ma vision initiale, voici le rÃĐsultat que j’ai obtenu.

Sortie HTML de l'interface utilisateur de ChatGPT Vision

Sortie HTML de l’interface utilisateur de ChatGPT Vision

Limitations et dÃĐfauts de GPT-4V(ision)

Pour analyser GPT-4V, l’ÃĐquipe d’Open AI a menÃĐ des ÃĐvaluations qualitatives et quantitatives. Les ÃĐvaluations qualitatives comprenaient des tests internes et des examens d’experts externes, tandis que les ÃĐvaluations quantitatives mesuraient les refus du modÃĻle et la prÃĐcision dans divers scÃĐnarios tels que l’identification de contenu nuisible, la reconnaissance dÃĐmographique, les prÃĐoccupations de confidentialitÃĐ, la gÃĐolocalisation, la cybersÃĐcuritÃĐ et les jailbreaks multimodaux.

Pourtant, le modÃĻle n’est pas parfait.

Le document met en ÃĐvidence les limites de GPT-4V, telles que des infÃĐrences incorrectes et des textes ou des caractÃĻres manquants dans les images. Il peut halluciner ou inventer des faits. En particulier, il n’est pas adaptÃĐ pour identifier les substances dangereuses dans les images, les confondant souvent.

Dans l’imagerie mÃĐdicale, GPT-4V peut fournir des rÃĐponses incohÃĐrentes et manque de connaissance des pratiques standard, ce qui peut conduire à des erreurs de diagnostic potentielles.

Performances peu fiables pour des fins mÃĐdicales.

Performances peu fiables pour des fins mÃĐdicales (Source)

Il ÃĐchoue ÃĐgalement à comprendre les nuances de certains symboles de haine et peut gÃĐnÃĐrer un contenu inappropriÃĐ en fonction des entrÃĐes visuelles. OpenAI conseille contre l’utilisation de GPT-4V pour des interprÃĐtations critiques, en particulier dans des contextes mÃĐdicaux ou sensibles.

Conclusion

CrÃĐÃĐ Ã  l'aide de Fast Stable Diffusion XL

CrÃĐÃĐ Ã  l’aide de Fast Stable Diffusion XL https://huggingface.co/spaces/google/sdxl

L’arrivÃĐe de GPT-4 Vision (GPT-4V) apporte un ensemble de possibilitÃĐs sympas et de nouveaux dÃĐfis à relever. Avant de le lancer, beaucoup d’efforts ont ÃĐtÃĐ consacrÃĐs pour s’assurer que les risques, en particulier lorsqu’il s’agit d’images de personnes, sont bien examinÃĐs et rÃĐduits. Il est impressionnant de voir comment GPT-4V a fait un grand pas en avant, montrant beaucoup de promesses dans des domaines dÃĐlicats comme la mÃĐdecine et la science.

Maintenant, il y a de grandes questions sur la table. Par exemple, ces modÃĻles devraient-ils Être capables d’identifier des personnalitÃĐs cÃĐlÃĻbres à partir de photos ? Devraient-ils deviner le sexe, la race ou les sentiments d’une personne à partir d’une image ? Et devrait-il y avoir des ajustements spÃĐciaux pour aider les personnes ayant des dÃĐficiences visuelles ? Ces questions ouvrent une boÃŪte de vers à propos de la confidentialitÃĐ, de l’ÃĐquitÃĐ et de la maniÃĻre dont l’IA devrait s’intÃĐgrer dans notre vie, ce qui est quelque chose que tout le monde devrait avoir son mot à dire.

J'ai passÃĐ les cinq derniÃĻres annÃĐes à plonger dans le monde fascinant de l'apprentissage automatique et du deep learning. Ma passion et mon expertise m'ont conduit à contribuer à plus de 50 projets de gÃĐnie logiciel divers, avec un focus particulier sur l'IA/ML. Ma curiositÃĐ continue m'a ÃĐgalement attirÃĐ vers le traitement automatique des langues, un domaine que je suis impatient d'explorer plus en profondeur.