Modele și platforme AI

Evoluția Inteligenței Artificiale Multimodale cu GPT-4V(ision)

mm
Adaugă Unite.AI la sursele tale preferate pe Google

În efortul continuu de a face inteligența artificială (IA) mai asemănătoare cu oamenii, modelele GPT ale OpenAI au ÃŪmpins mereu limitele. GPT-4 poate accepta acum prompturi atÃĒt de text, cÃĒt și de imagini.

Multimodalitatea ÃŪn inteligența artificială generativă denotă capacitatea unui model de a produce ieșiri variate, cum ar fi text, imagini sau audio, pe baza intrărilor. Aceste modele, antrenate pe date specifice, ÃŪnvață modelele subiacente pentru a genera date noi similare, ÃŪmbogățind aplicațiile IA.

Progrese Recent ÃŪn IA Multimodală

Un salt notabil recent ÃŪn acest domeniu este integrarea DALL-E 3 ÃŪn ChatGPT, o actualizare semnificativă a tehnologiei text-to-image a OpenAI. Această combinație permite o interacțiune mai fluidă, unde ChatGPT ajută la crearea de prompturi precise pentru DALL-E 3, transformÃĒnd ideile utilizatorilor ÃŪn artă vividă generată de IA. Astfel, ÃŪn timp ce utilizatorii pot interacționa direct cu DALL-E 3, prezența ChatGPT face procesul de creare a artei IA mult mai prietenos cu utilizatorul.

Puteți afla mai multe despre DALL-E 3 și integrarea sa cu ChatGPT aici. Această colaborare nu numai că evidențiază progresele ÃŪn IA multimodală, dar face și crearea de artă IA o experiență ușoară pentru utilizatori.

Google (GOOGL ) a introdus, pe de altă parte, Med-PaLM M ÃŪn luna iunie a acestui an. Acesta este un model generativ multimodal capabil să encodeze și să interpreteze diverse date biomedicale. Acest lucru a fost realizat prin fine-tuning-ul modelului de limbaj PaLM-E pentru a se adapta la domeniile medicale, utilizÃĒnd un benchmark deschis, MultiMedBench. Acest benchmark constă ÃŪn peste 1 milion de exemple din 7 tipuri de date biomedicale și 14 sarcini, cum ar fi generarea de rapoarte de radiologie și răspunsuri la ÃŪntrebări medicale.

În diferite industrii, se adoptă instrumente inovatoare de IA multimodală pentru a stimula extinderea afacerilor, a eficientiza operațiunile și a ÃŪmbunătăți implicarea clienților. Progresele ÃŪn capacitățile de voce, video și text ale IA impulsionează creșterea IA multimodale.

Întreprinderile caută aplicații de IA multimodală capabile să transforme modelele de afaceri și procesele, deschizÃĒnd noi oportunități de creștere ÃŪn ÃŪntregul ecosistem al IA generativă, de la unelte de date la aplicații IA emergente.

În urma lansării GPT-4 ÃŪn martie, unii utilizatori au observat o scădere a calității răspunsurilor sale ÃŪn timp, o preocupare reflectată și de dezvoltatori notabili și pe forumurile OpenAI. Inițial, OpenAI a negat această problemă, dar o studiu ulterioară a confirmat problema. Acesta a arătat o scădere a acurateței GPT-4 de la 97,6% la 2,4% ÃŪntre martie și iunie, indicÃĒnd o scădere a calității răspunsurilor odată cu actualizările ulterioare ale modelului.

chatgpt-ai

ChatGPT (Albastru) & Inteligență Artificială (Roșu) Trend de Căutare Google

Agița ÃŪn jurul Open AI’s ChatGPT este ÃŪnapoi acum. Acesta vine acum cu o funcție de vedere GPT-4V, care permite utilizatorilor să analizeze imagini cu GPT-4. Aceasta este cea mai recentă funcție deschisă utilizatorilor.

Adăugarea analizei de imagini la modelele de limbaj mari (LLM) cum ar fi GPT-4 este văzută de unii ca un pas mare ÃŪnainte ÃŪn cercetarea și dezvoltarea IA. Acest tip de model LLM multimodal deschide noi posibilități, ducÃĒnd modelele de limbaj dincolo de text pentru a oferi noi interfețe și a rezolva noi tipuri de sarcini, creÃĒnd experiențe proaspete pentru utilizatori.

Antrenamentul pentru GPT-4V a fost finalizat ÃŪn 2022, cu acces timpuriu lansat ÃŪn martie 2023. Funcția vizuală din GPT-4V este alimentată de tehnologia GPT-4. Procesul de antrenament a rămas același. Inițial, modelul a fost antrenat pentru a prezice următorul cuvÃĒnt ÃŪntr-un text, utilizÃĒnd un set masiv de date de text și imagini din diverse surse, inclusiv internetul.

Ulterior, a fost ajustat cu mai multe date, utilizÃĒnd o metodă numită ÃŪnvățare prin ÃŪntărire din feedback uman (RLHF), pentru a genera ieșiri preferate de oameni.

Mecanica Viziunii GPT-4

Capacitățile remarcabile de limbaj și viziune ale GPT-4, deși impresionante, au metode subiacente care rămÃĒn la suprafață.

Pentru a explora această ipoteză, a fost introdus un nou model de limbaj și viziune, MiniGPT-4 , care utilizează un model avansat de limbaj numit Vicuna. Acest model folosește un codator de viziune cu componente pre-antrenate pentru percepția vizuală, aliniind caracteristici vizuale codate cu modelul de limbaj Vicuna prin intermediul unei singure straturi de proiecție. Arhitectura MiniGPT-4 este simplă, dar eficientă, cu accent pe alinierea caracteristicilor vizuale și de limbaj pentru a ÃŪmbunătăți capacitățile de conversație vizuală.

MiniGPT-4

Arhitectura MiniGPT-4 include un codator de viziune cu ViT și Q-Former pre-antrenate, o singură strat de proiecție liniară și un model avansat de limbaj Vicuna.

Tendința modelelor autoregresive de limbaj ÃŪn sarcinile de viziune și limbaj a crescut și ea, capitalizÃĒnd pe transferul intermodal pentru a partaja cunoștințe ÃŪntre domeniile limbajului și multimodale.

MiniGPT-4 face podul ÃŪntre domeniul vizual și cel al limbajului, aliniind informațiile vizuale de la un codator de viziune pre-antrenat cu un model avansat de limbaj. Modelul utilizează Vicuna ca decodator de limbaj și urmează o abordare de antrenament ÃŪn două etape. Inițial, este antrenat pe un set mare de date de perechi imagine-text pentru a ÃŪnțelege cunoștințele de viziune și limbaj, urmat de ajustarea pe un set mai mic, de ÃŪnaltă calitate, pentru a ÃŪmbunătăți fiabilitatea și utilitatea generării.

Pentru a ÃŪmbunătăți naturalitatea și utilitatea limbajului generat ÃŪn MiniGPT-4, cercetătorii au dezvoltat un proces de aliniere ÃŪn două etape, abordÃĒnd lipsa de seturi de date adecvate pentru alinierea viziune-limbaj. Ei au creat un set de date specializat pentru acest scop.

Inițial, modelul a generat descrieri detaliate ale imaginilor de intrare, ÃŪmbunătățind detaliile prin utilizarea unui prompt conversațional aliniat cu formatul modelului de limbaj Vicuna. Această etapă a urmărit generarea de descrieri de imagini mai cuprinzătoare.

Prompt Inițial de Descriere a Imaginii:

###Omul: <Img><CaracteristicaImaginii></Img>Descrieți această imagine ÃŪn detaliu. Dați cÃĒt mai multe detalii posibil. Spuneți tot ceea ce vedeți. ###Asistent:

Pentru post-procesarea datelor, orice inconstistențe sau erori ÃŪn descrierile generate au fost corectate utilizÃĒnd ChatGPT, urmate de verificarea manuală pentru a asigura calitatea ridicată.

Prompt de Ajustare a Etapei a Doua:

###Omul: <Img><CaracteristicaImaginii></Img><Instrucțiune>###Asistent:

Această explorare deschide o fereastră spre ÃŪnțelegerea mecanicii inteligenței artificiale multimodale, cum ar fi GPT-4, aruncÃĒnd lumină asupra modului ÃŪn care modalitățile de viziune și limbaj pot fi integrate eficient pentru a genera ieșiri coerente și contextual bogate.

Explorarea Viziunii GPT-4

Determinarea Originea Imaginilor cu ChatGPT

GPT-4 Vision ÃŪmbunătățește capacitatea ChatGPT de a analiza imagini și de a identifica originea lor geografică. Această funcție trece interacțiunile utilizatorilor de la text simplu la o combinație de text și imagini, devenind un instrument util pentru cei curioși despre diferite locuri prin date de imagine.

Chatgpt-vision-GPT-4

Întrebarea lui ChatGPT unde a fost făcută o imagine a unui punct de reper

Concepte Matematice Complexe

GPT-4 Vision excelează ÃŪn a explora idei matematice complexe prin analiza expresiilor grafice sau manuscrise. Această funcție acționează ca un instrument util pentru persoanele care doresc să rezolve probleme matematice intricate, marcÃĒnd GPT-4 Vision ca o ajutor notabil ÃŪn domeniile educaționale și academice.

Chatgpt-vision-GPT-4

Întrebarea lui ChatGPT despre un concept matematic complex

Conversia Intrărilor Manuscrise ÃŪn Coduri LaTeX

Una dintre capacitățile remarcabile ale GPT-4V este posibilitatea de a traduce intrări manuscrise ÃŪn coduri LaTeX. Această funcție este un ajutor pentru cercetători, academicieni și studenți care au nevoie adesea să convertească expresii matematice sau informații tehnice manuscrise ÃŪntr-un format digital. Transformarea de la manuscris la LaTeX extinde orizonturile digitizării documentelor și simplifică procesul de scriere tehnică.

Capacitatea GPT-4V de a converti intrări manuscrise ÃŪn coduri LaTeX

Capacitatea GPT-4V de a converti intrări manuscrise ÃŪn coduri LaTeX

Extragerea Detaliilor din Tabele

GPT-4V demonstrează abilitatea de a extrage detalii din tabele și de a răspunde la ÃŪntrebări legate, o resursă valoroasă ÃŪn analiza datelor. Utilizatorii pot utiliza GPT-4V pentru a căuta prin tabele, a aduna informații cheie și a rezolva ÃŪntrebări, făcÃĒndu-l un instrument robust pentru analiști de date și alți profesioniști.

GPT-4V ÃŪnțelegÃĒnd detalii din tabele și răspunzÃĒnd la ÃŪntrebări legate

GPT-4V ÃŪnțelegÃĒnd detalii din tabele și răspunzÃĒnd la ÃŪntrebări legate

Înțelegerea Indicatorilor Vizuali

Capacitatea unică a GPT-4V de a ÃŪnțelege indicatorii vizuali adaugă o nouă dimensiune interacțiunii utilizatorului. Prin ÃŪnțelegerea semnelor vizuale, GPT-4V poate răspunde la ÃŪntrebări cu o ÃŪnțelegere contextuală mai profundă.

GPT-4V demonstrează capacitatea unică de a ÃŪnțelege indicatorii vizuali

GPT-4V demonstrează capacitatea unică de a ÃŪnțelege indicatorii vizuali

Construirea de Site-uri Mock-Up Simple UtilizÃĒnd o Schiță

Inspirat de acest tweet, am ÃŪncercat să creez o schiță pentru site-ul unite.ai.

Deși rezultatul nu a fost exact așa cum mi-am imaginat, iată ce am reușit să obțin.

Interfață de utilizator HTML generată de ChatGPT Vision

Interfață de utilizator HTML generată de ChatGPT Vision

Limitări și Deficiențe ale GPT-4V(ision)

Pentru a analiza GPT-4V, echipa Open AI a efectuat evaluări calitative și cantitative. Evaluările calitative au inclus teste interne și revizuiri ale experților externi, ÃŪn timp ce evaluările cantitative au măsurat refuzurile modelului și acuratețea ÃŪn diverse scenarii, cum ar fi identificarea conținutului dăunător, recunoașterea demografică, preocupările legate de confidențialitate, geolocalizarea, securitatea cibernetică și ÃŪncălcările multimodale.

Cu toate acestea, modelul nu este perfect.

Documentul documentul subliniază limitările GPT-4V, cum ar fi inferențele incorecte și lipsa de text sau caractere ÃŪn imagini. Poate inventa sau hallucina fapte. În special, nu este potrivit pentru identificarea substanțelor periculoase ÃŪn imagini, adesea identificÃĒndu-le greșit.

În imagistica medicală, GPT-4V poate oferi răspunsuri inconsistente și lipsește de conștientizarea practicilor standard, ceea ce poate duce la posibile diagnostice greșite.

Performanță nesigură pentru scopuri medicale.

Performanță nesigură pentru scopuri medicale (Sursă)

De asemenea, nu reușește să ÃŪnțeleagă nuanțele anumitor simboluri de ură și poate genera conținut inadecvat pe baza intrărilor vizuale. OpenAI sfătuiește ÃŪmpotriva utilizării GPT-4V pentru interpretări critice, ÃŪn special ÃŪn contexte medicale sau sensibile.

Încheiere

Creat utilizÃĒnd Fast Stable Diffusion XL

Creat utilizÃĒnd Fast Stable Diffusion XL https://huggingface.co/spaces/google/sdxl

Sosirea GPT-4 Vision (GPT-4V) aduce o mulțime de posibilități interesante și noi provocări de depășit. Înainte de a fi lansat, s-a depus mult efort pentru a se asigura că riscurile, ÃŪn special cele legate de imagini cu oameni, sunt bine examinate și reduse. Este impresionant să vezi cum GPT-4V a făcut pași importanți, arătÃĒnd mult potențial ÃŪn domenii dificile, cum ar fi medicina și știința.

Acum, există ÃŪntrebări mari pe masă. De exemplu, ar trebui aceste modele să poată identifica persoane celebre din fotografii? Ar trebui să ghicească sexul, rasa sau sentimentele unei persoane dintr-o imagine? Și ar trebui să existe ajustări speciale pentru a ajuta persoanele cu deficiențe de vedere? Aceste ÃŪntrebări deschid o cutie cu viermi despre confidențialitate, echitate și despre cum ar trebui să se ÃŪncadreze IA ÃŪn viețile noastre, ceea ce este ceva la care ar trebui să aibă cuvÃĒntul toată lumea.

Am petrecut ultimii cinci ani scufundÃĒndu-mă ÃŪn lumea fascinantă a Machine Learning și Deep Learning. Pasinea și expertiza mea m-au condus să contribui la peste 50 de proiecte diverse de inginerie software, cu un focus deosebit pe AI/ML. Curiozitatea mea ÃŪn continuare m-a atras și spre Natural Language Processing, un domeniu pe care sunt dornic să ÃŪl explorez mai departe.