AI-modeller og platforme
Multimodal AI udvikler sig, da ChatGPT får syn med GPT-4V(ision)
I den pågående bestræbelse på at gøre AI mere menneskelignende, har OpenAIs GPT-modeller konstant presset grænserne. GPT-4 kan nu acceptere prompts af både tekst og billeder.
Multimodalitet i generativ AI betegner en models evne til at producere varierede outputs som tekst, billeder eller lyd baseret på input. Disse modeller, der er trænet på specifikke data, lærer underliggende mønstre for at generere lignende nye data, hvilket beriger AI-applikationer.
Seneste fremskridt i multimodal AI
Et nyligt bemærkelsesværdigt spring i dette felt er set med integrationen af DALL-E 3 i ChatGPT, en betydelig opgradering af OpenAIs tekst-til-billede-teknologi. Denne blanding tillader en glattere interaktion, hvor ChatGPT hjælper med at udforme præcise prompts for DALL-E 3, hvilket omdanner brugerideer til levende AI-genereret kunst. Således kan brugere direkte interagere med DALL-E 3, men med ChatGPT i blandingen gør processen med at oprette AI-kunst meget mere brugervenlig.
Læs mere om DALL-E 3 og dens integration med ChatGPT her. Denne samarbejdsmodel ikke kun viser fremgangen i multimodal AI, men gør også AI-kunstskabelse til en leg for brugere.
Google’s sundhedsafdeling introducerede på den anden side Med-PaLM M i juni dette år. Det er en multimodal generativ model, der er dygtig til at kodificere og fortolke diverse biomedicinske data. Dette blev opnået ved at finjustere PaLM-E, et sprogmodel, til at tilpasse sig medicinske domæner ved hjælp af en open-source benchmark, MultiMedBench. Denne benchmark består af over 1 million eksempler på tværs af 7 biomedicinske datatyper og 14 opgaver som medicinsk spørgsmål-svar og radiologirapportgenerering.
Flere industrier adopterer innovative multimodale AI-værktøjer for at fremme forretningsudvikling, strømlinje operationsprocesser og forbedre kundeengagement. Fremgang i tale-, video- og tekst-AI-kapaciteter driver multimodal AI’s vækst.
Virksomheder søger efter multimodale AI-applikationer, der kan omstrukturere forretningsmodeller og processer, åbner vækstmuligheder på tværs af den generative AI-økosystem, fra data-værktøjer til fremvoksende AI-applikationer.
Efter GPT-4’s lancering i marts observerede nogle brugere en nedgang i dens responskvalitet over tid, en bekymring, der blev gentaget af bemærkelsesværdige udviklere og på OpenAIs fora. Først afvist af OpenAI, blev en senere undersøgelse bekræftet problemet. Den afslørede en nedgang i GPT-4’s nøjagtighed fra 97,6% til 2,4% mellem marts og juni, hvilket indikerer en nedgang i svarkvalitet med efterfølgende modelopdateringer.
Hypen omkring Open AI’s ChatGPT er tilbage nu. Den kommer nu med en visionfunktion GPT-4V, der tillader brugere at få GPT-4 til at analysere billeder, som de giver den. Dette er den nyeste funktion, der er åbnet op for brugere.
Tilføjelse af billedanalyse til store sprogmodeller (LLM’er) som GPT-4 ses af nogle som et stort skridt fremad i AI-forskning og udvikling. Denne type multimodal LLM åbner op for nye muligheder, tager sprogmodellerne ud over tekst til at tilbyde nye grænseflader og løse nye typer opgaver, hvilket skaber nye oplevelser for brugere.
Træningen af GPT-4V blev afsluttet i 2022, med tidlig adgang rullet ud i marts 2023. Den visuelle funktion i GPT-4V er drevet af GPT-4-teknologi. Træningsprocessen forblev den samme. Først blev modellen trænet til at forudsige det næste ord i en tekst ved hjælp af en enorm dataset af både tekst og billeder fra forskellige kilder, herunder internettet.
Senere blev den finjusteret med mere data, ved hjælp af en metode kaldet forstærkning af menneskeligt feedback (RLHF), for at generere outputs, der var foretrukket af mennesker.
GPT-4 Vision Mechanics
GPT-4’s bemærkelsesværdige visionssprog-kapaciteter, selvom imponerende, har underliggende metoder, der forbliver på overfladen.
For at udforske denne hypotese blev en ny visionssprog-model, MiniGPT-4 introduceret, der anvender en avanceret LLM kaldet Vicuna. Denne model anvender en visionencoder med fortrænede komponenter til visuel perception, der aligner encodede visuelle funktioner med Vicuna-sprogmodellen gennem en enkelt projektilagslayer. Arkitekturen af MiniGPT-4 er simpel, men effektiv, med fokus på at alignere visuelle og sprogfunktioner for at forbedre visuel samtalefunktioner.

MiniGPT-4’s arkitektur inkluderer en visionencoder med fortrænede ViT og Q-Former, en enkelt lineær projektilagslayer og en avanceret Vicuna stor sprogmodel.
Trenden med autoregressive sprogmodeller i visionssprog-opgaver er også vokset, udnyttende cross-modal overførsel for at dele viden mellem sprog og multimodale domæner.
MiniGPT-4 brokker den visuelle og sprogdomæne ved at alignere visuelle oplysninger fra en fortrænet visionencoder med en avanceret LLM. Modellen anvender Vicuna som sprogdecoder og følger en to-trins træningsapproach. Først trænes den på en stor dataset af billed-tekstpar til at tilegne sig visionssprog-kundskab, efterfulgt af finjustering på en mindre, højkvalitetsdataset for at forbedre generations troværdighed og brugervenlighed.
For at forbedre naturligheden og brugervenligheden af genereret sprog i MiniGPT-4 udviklede forskere en to-trins alignmentsproces, der adresserede manglen på tilstrækkelige visionssprog-alignmentsdata. De kuraterede en specialdataset til dette formål.
Først genererede modellen detaljerede beskrivelser af inputbilleder, forbedrede detaljen ved at anvende en samtaleprompt, der var aligneret med Vicuna-sprogmodellens format. Dette trin sigtede på at generere mere omfattende billedbeskrivelser.
Initial Billedbeskrivelsesprompt:
###Menneske: <Billede><Billedefunktion></Billede>Beskriv dette billede i detalje. Giv så mange detaljer som muligt. Sig alt, hvad du ser. ###Assistent:
For datapostbehandling blev eventuelle inkonsistenser eller fejl i de genererede beskrivelser korregeret ved hjælp af ChatGPT, efterfulgt af manuel verificering for at sikre høj kvalitet.
Anden-trins finjusteringsprompt:
###Menneske: <Billede><Billedefunktion></Billede><Instruktion>###Assistent:
Denne udforskning åbner et vindue ind i forståelsen af mekanismerne bag multimodal generativ AI som GPT-4, hvilket kaster lys over, hvordan vision og sprogmodi kan integreres effektivt for at generere koherente og kontekst rigelige outputs.
Udforskning af GPT-4 Vision
Bestemmelse af billeders oprindelse med ChatGPT
GPT-4 Vision forbedrer ChatGPT’s evne til at analysere billeder og pege på deres geografiske oprindelse. Denne funktion overgår brugerinteraktioner fra kun tekst til en blanding af tekst og billeder, hvilket gør det til et håndværktøj for dem, der er nysgerrige efter forskellige steder gennem billeddata.
Komplekse matematiske begreber
GPT-4 Vision excellerer i at dykke ned i komplekse matematiske ideer ved at analysere grafiske eller håndskrevne udtryk. Denne funktion fungerer som et nyttigt værktøj for personer, der søger at løse intrikate matematiske problemer, hvilket gør GPT-4 Vision til et bemærkelsesværdigt hjælpemiddel i uddannelses- og akademiske felter.
Omvandling af håndskrevne input til LaTeX-koder
En af GPT-4V’s bemærkelsesværdige evner er dens kapacitet til at oversætte håndskrevne input til LaTeX-koder. Denne funktion er en velsignelse for forskere, akademikere og studerende, der ofte behøver at konvertere håndskrevne matematiske udtryk eller anden teknisk information til en digital format. Transformationen fra håndskrevet til LaTeX udvider horisonten for dokumentdigitalisering og forenkler den tekniske skriveproces.
Ekstraktion af tabeldetaljer
GPT-4V viser evner i at ekstrahere detaljer fra tabeller og besvare relaterede spørgsmål, en væsentlig aktiv for dataanalyse. Brugere kan anvende GPT-4V til at sieve gennem tabeller, samle nøgleindsigter og løse spørgsmål, hvilket gør det til et stærkt værktøj for dataanalytikere og andre fagfolk.
Forståelse af visuel pejling
Den unikke evne af GPT-4V til at forstå visuel pejling tilføjer en ny dimension til brugerinteraktion. Ved at forstå visuelle signaler kan GPT-4V svare på spørgsmål med en højere kontekstuel forståelse.
Opbygning af enkle mock-up-websider ved hjælp af en tegning
Motiveret af denne tweet, forsøgte jeg at opbygge en mock-up for unite.ai-websitet.
mens resultatet ikke helt matcher min oprindelige vision, her er resultatet, jeg opnåede.
Begrænsninger og fejl af GPT-4V(ision)
For at analysere GPT-4V udførte Open AI-holdet kvalitative og kvantitative vurderinger. Kvalitative vurderinger inkluderede interne tests og eksterne ekspertgennemgange, mens kvantitative vurderinger målte modelafvisninger og nøjagtighed i forskellige scenarier såsom identifikation af skadelig indhold, demografisk genkendelse, privatlivsbeskyttelse, geolocation, cybersikkerhed og multimodale fængsler.
Alligevel er modellen ikke perfekt.
Dokumentet højlighter begrænsninger af GPT-4V, såsom forkerte slutninger og manglende tekst eller tegn i billeder. Den kan hallucinere eller opfinde fakta. Specielt er den ikke egnet til at identificere farlige stoffer i billeder, ofte misidentificerer dem.
I medicinsk billedanalyse kan GPT-4V give inkonsistente svar og mangler kendskab til standardpraksis, hvilket kan føre til potentielle misdiagnoser.

Ubetalelse i medicinske formål (Kilde)
Den kan også ikke fatte nuancerne af visse hadesymboler og kan generere upassende indhold baseret på visuelle input. OpenAI råder mod at bruge GPT-4V til kritiske fortolkninger, især i medicinske eller følsomme sammenhænge.
Afslutning

Oprettet med Fast Stable Diffusion XL https://huggingface.co/spaces/google/sdxl
Ankomsten af GPT-4 Vision (GPT-4V) bringer en række nye muligheder og udfordringer med sig. Før dens udgivelse er der gået en stor indsats i at sikre, at risici, især når det kommer til billeder af mennesker, er grundigt undersøgt og reduceret. Det er imponerende at se, hvordan GPT-4V har taget skridt fremad, hvilket viser stor løfte i svære områder som medicin og videnskab.
Der er nu store spørgsmål på bordet. For eksempel, skal disse modeller være i stand til at identificere berømte personer fra billeder? Skal de gætte en persons køn, race eller følelser fra et billede? Og skal der være særlige tilpasninger for at hjælpe personer med synsbesvær? Disse spørgsmål åbner en dåse med orme om privatliv, lighed og hvordan AI skal indgå i vores liv, hvilket er noget, alle skal have noget at sige om.




















