Modele Či platforme AI
EvoluČia InteligenČei Artificiale Multimodale cu GPT-4V(ision)
Ãn efortul continuu de a face inteligenČa artificialÄ (IA) mai asemÄnÄtoare cu oamenii, modelele GPT ale OpenAI au ÃŪmpins mereu limitele. GPT-4 poate accepta acum prompturi atÃĒt de text, cÃĒt Či de imagini.
Multimodalitatea ÃŪn inteligenČa artificialÄ generativÄ denotÄ capacitatea unui model de a produce ieČiri variate, cum ar fi text, imagini sau audio, pe baza intrÄrilor. Aceste modele, antrenate pe date specifice, ÃŪnvaČÄ modelele subiacente pentru a genera date noi similare, ÃŪmbogÄČind aplicaČiile IA.
Progrese Recent ÃŪn IA MultimodalÄ
Un salt notabil recent ÃŪn acest domeniu este integrarea DALL-E 3 ÃŪn ChatGPT, o actualizare semnificativÄ a tehnologiei text-to-image a OpenAI. AceastÄ combinaČie permite o interacČiune mai fluidÄ, unde ChatGPT ajutÄ la crearea de prompturi precise pentru DALL-E 3, transformÃĒnd ideile utilizatorilor ÃŪn artÄ vividÄ generatÄ de IA. Astfel, ÃŪn timp ce utilizatorii pot interacČiona direct cu DALL-E 3, prezenČa ChatGPT face procesul de creare a artei IA mult mai prietenos cu utilizatorul.
PuteČi afla mai multe despre DALL-E 3 Či integrarea sa cu ChatGPT aici. AceastÄ colaborare nu numai cÄ evidenČiazÄ progresele ÃŪn IA multimodalÄ, dar face Či crearea de artÄ IA o experienČÄ uČoarÄ pentru utilizatori.
Google (GOOGL ) a introdus, pe de altÄ parte, Med-PaLM M ÃŪn luna iunie a acestui an. Acesta este un model generativ multimodal capabil sÄ encodeze Či sÄ interpreteze diverse date biomedicale. Acest lucru a fost realizat prin fine-tuning-ul modelului de limbaj PaLM-E pentru a se adapta la domeniile medicale, utilizÃĒnd un benchmark deschis, MultiMedBench. Acest benchmark constÄ ÃŪn peste 1 milion de exemple din 7 tipuri de date biomedicale Či 14 sarcini, cum ar fi generarea de rapoarte de radiologie Či rÄspunsuri la ÃŪntrebÄri medicale.
Ãn diferite industrii, se adoptÄ instrumente inovatoare de IA multimodalÄ pentru a stimula extinderea afacerilor, a eficientiza operaČiunile Či a ÃŪmbunÄtÄČi implicarea clienČilor. Progresele ÃŪn capacitÄČile de voce, video Či text ale IA impulsioneazÄ creČterea IA multimodale.
Ãntreprinderile cautÄ aplicaČii de IA multimodalÄ capabile sÄ transforme modelele de afaceri Či procesele, deschizÃĒnd noi oportunitÄČi de creČtere ÃŪn ÃŪntregul ecosistem al IA generativÄ, de la unelte de date la aplicaČii IA emergente.
Ãn urma lansÄrii GPT-4 ÃŪn martie, unii utilizatori au observat o scÄdere a calitÄČii rÄspunsurilor sale ÃŪn timp, o preocupare reflectatÄ Či de dezvoltatori notabili Či pe forumurile OpenAI. IniČial, OpenAI a negat aceastÄ problemÄ, dar o studiu ulterioarÄ a confirmat problema. Acesta a arÄtat o scÄdere a acurateČei GPT-4 de la 97,6% la 2,4% ÃŪntre martie Či iunie, indicÃĒnd o scÄdere a calitÄČii rÄspunsurilor odatÄ cu actualizÄrile ulterioare ale modelului.
AgiČa ÃŪn jurul Open AIâs ChatGPT este ÃŪnapoi acum. Acesta vine acum cu o funcČie de vedere GPT-4V, care permite utilizatorilor sÄ analizeze imagini cu GPT-4. Aceasta este cea mai recentÄ funcČie deschisÄ utilizatorilor.
AdÄugarea analizei de imagini la modelele de limbaj mari (LLM) cum ar fi GPT-4 este vÄzutÄ de unii ca un pas mare ÃŪnainte ÃŪn cercetarea Či dezvoltarea IA. Acest tip de model LLM multimodal deschide noi posibilitÄČi, ducÃĒnd modelele de limbaj dincolo de text pentru a oferi noi interfeČe Či a rezolva noi tipuri de sarcini, creÃĒnd experienČe proaspete pentru utilizatori.
Antrenamentul pentru GPT-4V a fost finalizat ÃŪn 2022, cu acces timpuriu lansat ÃŪn martie 2023. FuncČia vizualÄ din GPT-4V este alimentatÄ de tehnologia GPT-4. Procesul de antrenament a rÄmas acelaČi. IniČial, modelul a fost antrenat pentru a prezice urmÄtorul cuvÃĒnt ÃŪntr-un text, utilizÃĒnd un set masiv de date de text Či imagini din diverse surse, inclusiv internetul.
Ulterior, a fost ajustat cu mai multe date, utilizÃĒnd o metodÄ numitÄ ÃŪnvÄČare prin ÃŪntÄrire din feedback uman (RLHF), pentru a genera ieČiri preferate de oameni.
Mecanica Viziunii GPT-4
CapacitÄČile remarcabile de limbaj Či viziune ale GPT-4, deČi impresionante, au metode subiacente care rÄmÃĒn la suprafaČÄ.
Pentru a explora aceastÄ ipotezÄ, a fost introdus un nou model de limbaj Či viziune, MiniGPT-4Â , care utilizeazÄ un model avansat de limbaj numit Vicuna. Acest model foloseČte un codator de viziune cu componente pre-antrenate pentru percepČia vizualÄ, aliniind caracteristici vizuale codate cu modelul de limbaj Vicuna prin intermediul unei singure straturi de proiecČie. Arhitectura MiniGPT-4 este simplÄ, dar eficientÄ, cu accent pe alinierea caracteristicilor vizuale Či de limbaj pentru a ÃŪmbunÄtÄČi capacitÄČile de conversaČie vizualÄ.

Arhitectura MiniGPT-4 include un codator de viziune cu ViT Či Q-Former pre-antrenate, o singurÄ strat de proiecČie liniarÄ Či un model avansat de limbaj Vicuna.
TendinČa modelelor autoregresive de limbaj ÃŪn sarcinile de viziune Či limbaj a crescut Či ea, capitalizÃĒnd pe transferul intermodal pentru a partaja cunoČtinČe ÃŪntre domeniile limbajului Či multimodale.
MiniGPT-4 face podul ÃŪntre domeniul vizual Či cel al limbajului, aliniind informaČiile vizuale de la un codator de viziune pre-antrenat cu un model avansat de limbaj. Modelul utilizeazÄ Vicuna ca decodator de limbaj Či urmeazÄ o abordare de antrenament ÃŪn douÄ etape. IniČial, este antrenat pe un set mare de date de perechi imagine-text pentru a ÃŪnČelege cunoČtinČele de viziune Či limbaj, urmat de ajustarea pe un set mai mic, de ÃŪnaltÄ calitate, pentru a ÃŪmbunÄtÄČi fiabilitatea Či utilitatea generÄrii.
Pentru a ÃŪmbunÄtÄČi naturalitatea Či utilitatea limbajului generat ÃŪn MiniGPT-4, cercetÄtorii au dezvoltat un proces de aliniere ÃŪn douÄ etape, abordÃĒnd lipsa de seturi de date adecvate pentru alinierea viziune-limbaj. Ei au creat un set de date specializat pentru acest scop.
IniČial, modelul a generat descrieri detaliate ale imaginilor de intrare, ÃŪmbunÄtÄČind detaliile prin utilizarea unui prompt conversaČional aliniat cu formatul modelului de limbaj Vicuna. AceastÄ etapÄ a urmÄrit generarea de descrieri de imagini mai cuprinzÄtoare.
Prompt IniČial de Descriere a Imaginii:
###Omul: <Img><CaracteristicaImaginii></Img>DescrieČi aceastÄ imagine ÃŪn detaliu. DaČi cÃĒt mai multe detalii posibil. SpuneČi tot ceea ce vedeČi. ###Asistent:
Pentru post-procesarea datelor, orice inconstistenČe sau erori ÃŪn descrierile generate au fost corectate utilizÃĒnd ChatGPT, urmate de verificarea manualÄ pentru a asigura calitatea ridicatÄ.
Prompt de Ajustare a Etapei a Doua:
###Omul: <Img><CaracteristicaImaginii></Img><InstrucČiune>###Asistent:
AceastÄ explorare deschide o fereastrÄ spre ÃŪnČelegerea mecanicii inteligenČei artificiale multimodale, cum ar fi GPT-4, aruncÃĒnd luminÄ asupra modului ÃŪn care modalitÄČile de viziune Či limbaj pot fi integrate eficient pentru a genera ieČiri coerente Či contextual bogate.
Explorarea Viziunii GPT-4
Determinarea Originea Imaginilor cu ChatGPT
GPT-4 Vision ÃŪmbunÄtÄČeČte capacitatea ChatGPT de a analiza imagini Či de a identifica originea lor geograficÄ. AceastÄ funcČie trece interacČiunile utilizatorilor de la text simplu la o combinaČie de text Či imagini, devenind un instrument util pentru cei curioČi despre diferite locuri prin date de imagine.
Concepte Matematice Complexe
GPT-4 Vision exceleazÄ ÃŪn a explora idei matematice complexe prin analiza expresiilor grafice sau manuscrise. AceastÄ funcČie acČioneazÄ ca un instrument util pentru persoanele care doresc sÄ rezolve probleme matematice intricate, marcÃĒnd GPT-4 Vision ca o ajutor notabil ÃŪn domeniile educaČionale Či academice.
Conversia IntrÄrilor Manuscrise ÃŪn Coduri LaTeX
Una dintre capacitÄČile remarcabile ale GPT-4V este posibilitatea de a traduce intrÄri manuscrise ÃŪn coduri LaTeX. AceastÄ funcČie este un ajutor pentru cercetÄtori, academicieni Či studenČi care au nevoie adesea sÄ converteascÄ expresii matematice sau informaČii tehnice manuscrise ÃŪntr-un format digital. Transformarea de la manuscris la LaTeX extinde orizonturile digitizÄrii documentelor Či simplificÄ procesul de scriere tehnicÄ.
Extragerea Detaliilor din Tabele
GPT-4V demonstreazÄ abilitatea de a extrage detalii din tabele Či de a rÄspunde la ÃŪntrebÄri legate, o resursÄ valoroasÄ ÃŪn analiza datelor. Utilizatorii pot utiliza GPT-4V pentru a cÄuta prin tabele, a aduna informaČii cheie Či a rezolva ÃŪntrebÄri, fÄcÃĒndu-l un instrument robust pentru analiČti de date Či alČi profesioniČti.
ÃnČelegerea Indicatorilor Vizuali
Capacitatea unicÄ a GPT-4V de a ÃŪnČelege indicatorii vizuali adaugÄ o nouÄ dimensiune interacČiunii utilizatorului. Prin ÃŪnČelegerea semnelor vizuale, GPT-4V poate rÄspunde la ÃŪntrebÄri cu o ÃŪnČelegere contextualÄ mai profundÄ.
Construirea de Site-uri Mock-Up Simple UtilizÃĒnd o SchiČÄ
Inspirat de acest tweet, am ÃŪncercat sÄ creez o schiČÄ pentru site-ul unite.ai.
DeČi rezultatul nu a fost exact aČa cum mi-am imaginat, iatÄ ce am reuČit sÄ obČin.
LimitÄri Či DeficienČe ale GPT-4V(ision)
Pentru a analiza GPT-4V, echipa Open AI a efectuat evaluÄri calitative Či cantitative. EvaluÄrile calitative au inclus teste interne Či revizuiri ale experČilor externi, ÃŪn timp ce evaluÄrile cantitative au mÄsurat refuzurile modelului Či acurateČea ÃŪn diverse scenarii, cum ar fi identificarea conČinutului dÄunÄtor, recunoaČterea demograficÄ, preocupÄrile legate de confidenČialitate, geolocalizarea, securitatea ciberneticÄ Či ÃŪncÄlcÄrile multimodale.
Cu toate acestea, modelul nu este perfect.
Documentul documentul subliniazÄ limitÄrile GPT-4V, cum ar fi inferenČele incorecte Či lipsa de text sau caractere ÃŪn imagini. Poate inventa sau hallucina fapte. Ãn special, nu este potrivit pentru identificarea substanČelor periculoase ÃŪn imagini, adesea identificÃĒndu-le greČit.
Ãn imagistica medicalÄ, GPT-4V poate oferi rÄspunsuri inconsistente Či lipseČte de conČtientizarea practicilor standard, ceea ce poate duce la posibile diagnostice greČite.

PerformanČÄ nesigurÄ pentru scopuri medicale (SursÄ)
De asemenea, nu reuČeČte sÄ ÃŪnČeleagÄ nuanČele anumitor simboluri de urÄ Či poate genera conČinut inadecvat pe baza intrÄrilor vizuale. OpenAI sfÄtuieČte ÃŪmpotriva utilizÄrii GPT-4V pentru interpretÄri critice, ÃŪn special ÃŪn contexte medicale sau sensibile.
Ãncheiere

Creat utilizÃĒnd Fast Stable Diffusion XL https://huggingface.co/spaces/google/sdxl
Sosirea GPT-4 Vision (GPT-4V) aduce o mulČime de posibilitÄČi interesante Či noi provocÄri de depÄČit. Ãnainte de a fi lansat, s-a depus mult efort pentru a se asigura cÄ riscurile, ÃŪn special cele legate de imagini cu oameni, sunt bine examinate Či reduse. Este impresionant sÄ vezi cum GPT-4V a fÄcut paČi importanČi, arÄtÃĒnd mult potenČial ÃŪn domenii dificile, cum ar fi medicina Či ČtiinČa.
Acum, existÄ ÃŪntrebÄri mari pe masÄ. De exemplu, ar trebui aceste modele sÄ poatÄ identifica persoane celebre din fotografii? Ar trebui sÄ ghiceascÄ sexul, rasa sau sentimentele unei persoane dintr-o imagine? Či ar trebui sÄ existe ajustÄri speciale pentru a ajuta persoanele cu deficienČe de vedere? Aceste ÃŪntrebÄri deschid o cutie cu viermi despre confidenČialitate, echitate Či despre cum ar trebui sÄ se ÃŪncadreze IA ÃŪn vieČile noastre, ceea ce este ceva la care ar trebui sÄ aibÄ cuvÃĒntul toatÄ lumea.




















