Modelli e piattaforme di IA
L’evoluzione dell’AI multimodale con ChatGPT e GPT-4V
Nel continuo sforzo di rendere lâAI piÃđ simile agli esseri umani, i modelli GPT di OpenAI hanno continuamente spinto i confini. GPT-4 ÃĻ ora in grado di accettare prompt di testo e immagini.
La multimodalità nellâAI generativa denota la capacità di un modello di produrre output vari come testo, immagini o audio in base allâinput. Questi modelli, addestrati su dati specifici, imparano a riconoscere pattern sottostanti per generare nuovi dati simili, arricchendo le applicazioni AI.
Recenti progressi nellâAI multimodale
Un recente e notevole balzo in avanti in questo campo si ÃĻ visto con lâintegrazione di DALL-E 3 in ChatGPT, un significativo aggiornamento della tecnologia di testo-immagine di OpenAI. Questa fusione consente unâinterazione piÃđ fluida in cui ChatGPT aiuta a creare prompt precisi per DALL-E 3, trasformando le idee degli utenti in vivide opere dâarte generate dallâAI. Quindi, mentre gli utenti possono interagire direttamente con DALL-E 3, avere ChatGPT nel mix rende il processo di creazione di arte AI molto piÃđ user-friendly.
Scopri di piÃđ su DALL-E 3 e la sua integrazione con ChatGPT qui. Questa collaborazione non solo mostra i progressi nellâAI multimodale, ma rende anche la creazione di arte AI una passeggiata per gli utenti.
Google (GOOGL ), dâaltra parte, ha introdotto Med-PaLM M nel giugno di questâanno. Si tratta di un modello generativo multimodale in grado di codificare e interpretare dati biomedici diversi. CiÃē ÃĻ stato ottenuto addestrando PaLM-E, un modello linguistico, per adattarsi ai domini medici utilizzando un benchmark open-source, MultiMedBench. Questo benchmark consiste in oltre 1 milione di campioni in 7 tipi di dati biomedici e 14 compiti come la risposta a domande mediche e la generazione di rapporti di radiologia.
Varie industrie stanno adottando strumenti AI multimodali innovativi per alimentare lâespansione aziendale, semplificare le operazioni e elevare lâengagement dei clienti. I progressi nelle capacità di voce, video e testo AI stanno trainando la crescita dellâAI multimodale.
Le aziende cercano applicazioni AI multimodali in grado di rivoluzionare i modelli di business e i processi, aprendo vie di crescita in tutto lâecosistema AI generativa, dalle tool di dati alle applicazioni AI emergenti.
Dopo il lancio di GPT-4 nel marzo scorso, alcuni utenti hanno osservato un calo nella qualità delle risposte nel tempo, una preoccupazione condivisa da noti sviluppatori e nei forum di OpenAI. Inizialmente liquidata da OpenAI, uno studio successivo confermÃē il problema. RivelÃē un calo dellâaccuratezza di GPT-4 dal 97,6% al 2,4% tra marzo e giugno, indicando un declino nella qualità delle risposte con gli aggiornamenti del modello successivi.
Lâentusiasmo intorno a Open AIâs ChatGPT ÃĻ tornato. Ora dispone di una funzione di visione GPT-4V, che consente agli utenti di far analizzare immagini a GPT-4. Questa ÃĻ la piÃđ recente funzione resa disponibile agli utenti.
Aggiungere lâanalisi di immagini ai grandi modelli linguistici (LLM) come GPT-4 ÃĻ visto da alcuni come un grande passo avanti nella ricerca e nello sviluppo AI. Questo tipo di LLM multimodale apre nuove possibilità , portando i modelli linguistici oltre il testo per offrire nuove interfacce e risolvere nuovi tipi di compiti, creando esperienze fresche per gli utenti.
Lâaddestramento di GPT-4V ÃĻ stato completato nel 2022, con lâaccesso anticipato avviato nel marzo 2023. La funzione visiva in GPT-4V ÃĻ alimentata dalla tecnologia GPT-4. Il processo di addestramento ÃĻ rimasto lo stesso. Inizialmente, il modello ÃĻ stato addestrato a prevedere la parola successiva in un testo utilizzando un enorme set di dati di testo e immagini da varie fonti, compreso internet.
In seguito, ÃĻ stato perfezionato con piÃđ dati, utilizzando un metodo chiamato apprendimento per rinforzo da feedback umano (RLHF), per generare output che gli esseri umani preferiscono.
Meccanica della visione di GPT-4
Le notevoli capacità linguistiche di visione di GPT-4, sebbene impressionanti, hanno metodi sottostanti che rimangono in superficie.
Per esplorare questa ipotesi, ÃĻ stato introdotto un nuovo modello di linguaggio e visione, MiniGPT-4, che utilizza un avanzato LLM chiamato Vicuna. Questo modello utilizza un encoder visivo con componenti pre-addestrati per la percezione visiva, allineando le caratteristiche visive codificate con il modello linguistico Vicuna attraverso un singolo strato di proiezione. Lâarchitettura di MiniGPT-4 ÃĻ semplice ma efficace, con un focus sullâallineamento delle caratteristiche visive e linguistiche per migliorare le capacità di conversazione visiva.

Lâarchitettura di MiniGPT-4 include un encoder visivo con ViT e Q-Former pre-addestrati, uno strato di proiezione lineare singolo e un avanzato modello linguistico Vicuna.
La tendenza dei modelli linguistici autoregressivi nei compiti di linguaggio e visione ÃĻ anche cresciuta, sfruttando il trasferimento cross-modale per condividere conoscenze tra domini linguistici e multimodali.
MiniGPT-4 collega i domini visivi e linguistici allineando le informazioni visive da un encoder visivo pre-addestrato con un avanzato LLM. Il modello utilizza Vicuna come decoder linguistico e segue un approccio di addestramento a due fasi. Inizialmente, viene addestrato su un grande set di dati di coppie di immagini e testo per acquisire conoscenze di linguaggio e visione, seguito da un perfezionamento su un set di dati piÃđ piccolo e di alta qualità per migliorare lâaffidabilità e lâusabilità della generazione.
Per migliorare la naturalità e lâusabilità del linguaggio generato in MiniGPT-4, i ricercatori hanno sviluppato un processo di allineamento a due fasi, affrontando la mancanza di adeguati set di dati di allineamento linguaggio-visione. Hanno curato un set di dati specializzato a questo scopo.
Inizialmente, il modello generava descrizioni dettagliate delle immagini di input, migliorando i dettagli utilizzando un prompt conversazionale allineato con il formato del modello linguistico Vicuna. Questa fase aveva lo scopo di generare descrizioni di immagini piÃđ complete.
Prompt di descrizione dellâimmagine iniziale:
###Umano: <Img><Caratteristica dellâimmagine></Img>Descrivi questa immagine nel dettaglio. Fornisci tutti i dettagli possibili. Descrivi tutto ciÃē che vedi. ###Assistente:
Per lâelaborazione dei dati post-processing, eventuali incongruenze o errori nelle descrizioni generate sono stati corretti utilizzando ChatGPT, seguiti da una verifica manuale per garantire la qualità .
Prompt di perfezionamento della seconda fase:
###Umano: <Img><Caratteristica dellâimmagine></Img><Istruzione>###Assistente:
Questa esplorazione apre una finestra sulla comprensione della meccanica dellâAI generativa multimodale come GPT-4, gettando luce su come le modalità di visione e linguaggio possano essere integrate efficacemente per generare output coerenti e ricchi di contesto.
Esplorare la visione di GPT-4
Determinare le origini delle immagini con ChatGPT
GPT-4 Vision migliora la capacità di ChatGPT di analizzare le immagini e individuare le loro origini geografiche. Questa funzione trasferisce le interazioni degli utenti da solo testo a una combinazione di testo e immagini, diventando uno strumento utile per coloro che sono curiosi di luoghi diversi attraverso i dati delle immagini.
Concetti matematici complessi
GPT-4 Vision eccelle nellâapprofondire concetti matematici complessi analizzando espressioni grafiche o scritte a mano. Questa funzione agisce come uno strumento utile per gli individui che cercano di risolvere problemi matematici intricati, segnando GPT-4 Vision come un aiuto notevole nei campi educativi e accademici.
Conversione di input scritti a mano in codici LaTeX
Una delle capacità notevoli di GPT-4V ÃĻ la sua capacità di tradurre input scritti a mano in codici LaTeX. Questa funzione ÃĻ un vantaggio per ricercatori, accademici e studenti che spesso devono convertire espressioni matematiche scritte a mano o altre informazioni tecniche in un formato digitale. La trasformazione da scritto a LaTeX allarga lâorizzonte della digitalizzazione dei documenti e semplifica il processo di scrittura tecnica.
Estrazione di dettagli da tabelle
GPT-4V dimostra abilità nellâestrazione di dettagli da tabelle e nel rispondere a domande correlate, un asset vitale nellâanalisi dei dati. Gli utenti possono utilizzare GPT-4V per setacciare tabelle, raccogliere informazioni chiave e rispondere a domande, rendendolo uno strumento robusto per gli analisti di dati e altri professionisti.
Comprensione del puntamento visivo
La capacità unica di GPT-4V di comprendere il puntamento visivo aggiunge una nuova dimensione allâinterazione dellâutente. Comprendendo i segnali visivi, GPT-4V puÃē rispondere a query con una comprensione del contesto piÃđ alta.
Creazione di siti web mock-up semplici utilizzando un disegno
Ispirato da questo tweet, ho cercato di creare un mock-up per il sito web unite.ai.
Mentre il risultato non ha completamente corrisposto alla mia visione iniziale, ecco il risultato che ho ottenuto.
Limitazioni e difetti di GPT-4V(ision)
Per analizzare GPT-4V, il team di Open AI ha condotto valutazioni qualitative e quantitative. Le valutazioni qualitative includevano test interni e recensioni di esperti esterni, mentre le valutazioni quantitative misuravano i rifiuti del modello e lâaccuratezza in vari scenari come lâidentificazione di contenuti dannosi, il riconoscimento demografico, le preoccupazioni sulla privacy, la geolocalizzazione, la sicurezza informatica e le evasioni multimodali.
Tuttavia, il modello non ÃĻ perfetto.
Il documento evidenzia le limitazioni di GPT-4V, come inferenze errate e testo o caratteri mancanti nelle immagini. PuÃē hallucinare o inventare fatti. In particolare, non ÃĻ adatto per lâidentificazione di sostanze pericolose nelle immagini, spesso scambiandole per altre.
Nellâimaging medico, GPT-4V puÃē fornire risposte inconsistenti e manca di consapevolezza delle pratiche standard, portando a potenziali diagnosi errate.

Prestazioni non affidabili per scopi medici (Fonte)
Non riesce inoltre a cogliere le sfumature di alcuni simboli di odio e puÃē generare contenuti inappropriati in base agli input visivi. OpenAI consiglia di non utilizzare GPT-4V per interpretazioni critiche, specialmente in contesti medici o sensibili.
Riassunto

Creata utilizzando Fast Stable Diffusion XL https://huggingface.co/spaces/google/sdxl
Lâarrivo di GPT-4 Vision (GPT-4V) porta con sÃĐ un mucchio di nuove possibilità e nuovi ostacoli da superare. Prima del suo lancio, ÃĻ stato fatto molto per assicurarsi che i rischi, specialmente quando si tratta di immagini di persone, siano stati esaminati e ridotti. à impressionante vedere come GPT-4V abbia fatto un grande passo avanti, mostrando molta promessa in aree difficili come la medicina e la scienza.
Ora, ci sono alcune grandi domande sul tavolo. Ad esempio, questi modelli dovrebbero essere in grado di identificare personaggi famosi dalle foto? Dovrebbero indovinare il genere, la razza o le emozioni di una persona da unâimmagine? E dovrebbero esserci modifiche speciali per aiutare le persone con disabilità visive? Queste domande aprono un vaso di Pandora sulla privacy, lâequità e su come lâAI dovrebbe integrarsi nella nostra vita, su cui tutti dovrebbero avere una parola da dire.




















