AI-modeller og plattformer

Fleretrinns AI utvikler seg med ChatGPT som får syn med GPT-4V(ision)

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

I den pågående innsatsen for å gjøre AI mer lik mennesker, har OpenAI’s GPT-modeller kontinuerlig presset grensene. GPT-4 kan nå godta både tekst- og bildeprompts.

Multimodalitet i generativ AI betegner en modells evne til å produsere varierende utdata som tekst, bilder eller lyd basert på innputt. Disse modellene, trent på spesifikke data, lærer underliggende mønster for å generere lignende ny data, og beriker AI-applikasjoner.

Seneste fremskritt i multimodal AI

Et nylig bemerkelsesverdig sprang i dette feltet sees med integreringen av DALL-E 3 i ChatGPT, en betydelig oppgradering av OpenAI’s tekst-til-bilde-teknologi. Denne blandingen tillater en jevnere interaksjon hvor ChatGPT hjelper med å lage nøyaktige promptringer for DALL-E 3, og omdanner brukerideer til levende AI-generert kunst. Så, mens brukerne kan interagere direkte med DALL-E 3, gjør tilstedeværelsen av ChatGPT prosessen med å lage AI-kunst mye mer brukervennlig.

Se mer om DALL-E 3 og dens integrering med ChatGPT her. Denne samarbeidet viser ikke bare fremgangen i multimodal AI, men gjør også AI-kunstskapelse enkel for brukerne.

Google’s helse på den andre siden introduserte Med-PaLM M i juni dette året. Det er en multimodal generativ modell dyktig i å kode og tolke diverse biomedisinske data. Dette ble oppnådd ved å finjustere PaLM-E, en språkmodell, for å tilpasse seg medisinske domener ved hjelp av en åpen kilde-benchmark, MultiMedBench. Denne benchmarken består av over 1 million eksempler på 7 biomedisinske datatyper og 14 oppgaver som medisinsk spørsmål-svar og radiologirapportgenerering.

Flere bransjer adopterer innovative multimodale AI-verktøy for å drive forretningsutvikling, strømlinje operasjoner og heve kundeengasjement. Fremgang i tale-, video- og tekst-AI-egenskaper driver multimodal AI’s vekst.

Bedrifter søker etter multimodale AI-applikasjoner som kan omdefinere forretningsmodeller og prosesser, åpner vekstmuligheter over hele den generative AI-økosystemet, fra dataverktøy til nye AI-applikasjoner.

Etter lanseringen av GPT-4 i mars, observerte noen brukere en nedgang i svarkvaliteten over tid, en bekymring som også ble uttrykt av bemerkelsesverdige utviklere og på OpenAI’s fora. Først avvist av OpenAI, bekreftet en senere studie problemet. Den avdekket en nedgang i GPT-4’s nøyaktighet fra 97,6% til 2,4% mellom mars og juni, indikerer en nedgang i svarkvalitet med påfølgende modelloppdateringer.

chatgpt-ai

ChatGPT (Blå) & Kunstig intelligens (Rød) Google Søketrend

Hypeen rundt Open AI’s ChatGPT er tilbake nå. Den kommer nå med en visjonfunksjon GPT-4V, som tillater brukerne å la GPT-4 analysere bilder gitt av dem. Dette er den nyeste funksjonen som er åpnet for brukerne.

Legging til bildeanalyse til store språkmodeller (LLM) som GPT-4 sees av noen som et stort skritt fremover i AI-forskning og -utvikling. Denne typen multimodal LLM åpner opp nye muligheter, tar språkmodeller beyond tekst til å tilby nye grensesnitt og løse nye typer oppgaver, og skaper nye erfaringer for brukerne.

Treningen av GPT-4V ble fullført i 2022, med tidlig tilgang rullet ut i mars 2023. Den visuelle funksjonen i GPT-4V er drevet av GPT-4-teknologi. Treningprosessen forble den samme. Først ble modellen trent for å forutsi neste ord i en tekst ved hjelp av en enorm datasett av både tekst og bilder fra ulike kilder, inkludert internettet.

Senere ble den finjustert med mer data, ved hjelp av en metode kalt forsterkning av menneskelig tilbakemelding (RLHF), for å generere utdata som mennesker foretrakk.

GPT-4 Visjon Mekanismer

GPT-4’s bemerkelsesverdige visjon-språk-egenskaper, selv om imponerende, har underliggende metoder som forblir på overflaten.

For å utforske denne hypotesen, ble en ny visjon-språk-modell, MiniGPT-4, introdusert, som bruker en avansert LLM kalt Vicuna. Denne modellen bruker en visjon-encoder med forhånds-trente komponenter for visuell persepsjon, som sammenfaller med Vicuna-språkmodellen gjennom et enkelt prosjekteringslag. Arkitekturen til MiniGPT-4 er enkel, men effektiv, med fokus på å sammenfalle visuelle og språklige egenskaper for å forbedre visuell samtale-egenskaper.

MiniGPT-4

MiniGPT-4’s arkitektur inkluderer en visjon-encoder med forhånds-trent ViT og Q-Former, et enkelt lineært prosjekteringslag, og en avansert Vicuna stor språkmodell.

Trenden med autoregressive språkmodeller i visjon-språk-oppgaver har også økt, og utnytter kryss-modus overføring for å dele kunnskap mellom språk og multimodale domener.

MiniGPT-4 broer visuelle og språklige domener ved å sammenfalle visuell informasjon fra en forhånds-trent visjon-encoder med en avansert LLM. Modellen bruker Vicuna som språk-dekoder og følger en to-trinns treningstilnærming. Først blir den trent på en stor datasett av bilde-tekst-par for å tilegne seg visjon-språk-kunnskap, fulgt av finjustering på en mindre, høykvalitetsdatasett for å forbedre genererings-pålitelighet og brukervennlighet.

For å forbedre naturlighet og brukervennlighet av generert språk i MiniGPT-4, utviklet forskerne en to-trinns sammenstillingsprosess, som adresserte mangelen på adekvate visjon-språk-sammenstillingsdatasett. De kurerte en spesialisert datasett for dette formålet.

Først genererte modellen detaljerte beskrivelser av inndata-bilder, og forbedret detaljene ved å bruke en samtale-prompt som sammenfalt med Vicuna-språkmodellens format. Dette stadiet hadde som mål å generere mer omfattende bilde-beskrivelser.

Initial Bildebeskrivelse Prompt:

###Menneske: <Bilde><BildeEgenskap></Bilde>Beskriv dette bildet i detalj. Gi så mange detaljer som mulig. Si alt du ser. ###Assistent:

For datapost-prosessering, ble eventuelle inkonsistenser eller feil i de genererte beskrivelsene korrigert ved hjelp av ChatGPT, fulgt av manuell verifisering for å sikre høy kvalitet.

Andre-trinns finjusteringsprompt:

###Menneske: <Bilde><BildeEgenskap></Bilde><Instruks>###Assistent:

Denne utforskningen åpner et vindu inn i å forstå mekanismene til multimodal generativ AI som GPT-4, og kaster lys over hvordan visjon og språk-modaler kan integreres effektivt for å generere koherente og kontekst-rike utdata.

Utforsk GPT-4 Visjon

Bestemme Bildeopphav med ChatGPT

GPT-4 Visjon forbedrer ChatGPT’s evne til å analysere bilder og peke ut deres geografiske opphav. Denne funksjonen overfører brukerinteraksjoner fra bare tekst til en blanding av tekst og visuelle elementer, og blir et nyttig verktøy for de som er nysgjerrige på ulike steder gjennom bilde-data.

Chatgpt-vision-GPT-4

Spør ChatGPT hvor et landemerkebilde er tatt

Komplekse Matematiske Konsepter

GPT-4 Visjon utmerker seg i å dykke ned i komplekse matematiske ideer ved å analysere grafiske eller håndskrevne uttrykk. Denne funksjonen fungerer som et nyttig verktøy for personer som søker å løse intrikate matematiske problemer, og markerer GPT-4 Visjon som en bemerkelsesverdig hjelp i utdannelses- og akademiske felt.

Chatgpt-vision-GPT-4

Spør ChatGPT om å forstå et komplekst matematisk konsept

Omvandling av Håndskrevne Inndata til LaTeX-koder

En av GPT-4V’s bemerkelsesverdige evner er dens evne til å oversette håndskrevne inndata til LaTeX-koder. Denne funksjonen er en velsignelse for forskere, akademikere og studenter som ofte må konvertere håndskrevne matematiske uttrykk eller annen teknisk informasjon til en digital format. Transformasjonen fra håndskrevne til LaTeX utvider horisonten av dokumentdigitalisering og forenkler den tekniske skriveprosessen.

GPT-4V's evne til å konvertere håndskrevne inndata til LaTeX-koder

GPT-4V’s evne til å konvertere håndskrevne inndata til LaTeX-koder

Ekstrahering av TabellDetaljer

GPT-4V viser ferdighet i å ekstrahere detaljer fra tabeller og besvare relaterte spørsmål, en vital tilgjengelighet for dataanalyse. Brukere kan bruke GPT-4V til å si gjennom tabeller, samle inn nøkkelinnsikt og løse spørsmål, og gjør det til et kraftig verktøy for dataanalytikere og andre fagfolk.

GPT-4V kan forstå detaljene i tabellen og besvare relaterte spørsmål

GPT-4V kan forstå detaljene i tabellen og besvare relaterte spørsmål

Forståelse av Visuell Peking

GPT-4V’s unike evne til å forstå visuell peking legger til en ny dimensjon til brukerinteraksjon. Ved å forstå visuelle hint, kan GPT-4V svare på spørsmål med en høyere kontekstuell forståelse.

GPT-4V demonstrerer den unike evnen til å forstå visuell peking

GPT-4V demonstrerer den unike evnen til å forstå visuell peking

Bygging av Enkle Mock-Up Nettsider ved hjelp av en tegning

Motivert av denne tweeten, prøvde jeg å lage en mock-up for unite.ai-nettstedet.

Mens resultatet ikke helt matchet min opprinnelige visjon, her er resultatet jeg oppnådde.

ChatGPT Visjon-basert utgang HTML Frontend

ChatGPT Visjon-basert utgang HTML Frontend

Begrensninger og Feil i GPT-4V(ision)

For å analysere GPT-4V, utførte Open AI-team kvalitative og kvantitative vurderinger. Kvalitative vurderinger inkluderte interne tester og eksterne ekspertvurderinger, mens kvantitative vurderinger målte modellavvisninger og nøyaktighet i ulike scenarioer som identifisering av skadelig innhold, demografisk gjenkjenning, personvernbekymringer, geolokalisering, cybersikkerhet og multimodale fengsler.

Likevel er modellen ikke perfekt.

Den rapporten høydepunkter begrensninger i GPT-4V, som feilaktige slutninger og manglende tekst eller tegn i bilder. Den kan hallucinere eller oppfinne fakta. Spesielt er den ikke egnet for å identifisere farlige stoffer i bilder, og ofte misidentifiserer dem.

I medisinske bilder kan GPT-4V gi inkonsistente svar og mangler kunnskap om standardpraksis, noe som kan føre til potensielle misdiagnoser.

Utilfredsstillende ytelse for medisinske formål.

Utilfredsstillende ytelse for medisinske formål (Kilde)

Den mangler også å forstå nyansene til visse hat-symbolet og kan generere upassende innhold basert på visuelle inndata. OpenAI råder mot å bruke GPT-4V for kritiske tolkninger, spesielt i medisinske eller sensitive sammenhenger.

Oppsummering

Laget med Fast Stable Diffusion XL

Laget med Fast Stable Diffusion XL https://huggingface.co/spaces/google/sdxl

Ankomsten av GPT-4 Visjon (GPT-4V) bringer med seg en rekke nye muligheter og nye utfordringer. Før den ble lansert, ble det lagt ned mye arbeid for å sikre at risikoene, spesielt når det gjelder bilder av mennesker, ble godt undersøkt og redusert. Det er imponerende å se hvordan GPT-4V har steget frem, og viser mye løfte i vanskelige områder som medisin og vitenskap.

Nå er det noen store spørsmål på bordet. For eksempel, bør disse modellene kunne identifisere berømte personer fra bilder? Bør de gjetting en persons kjønn, rase eller følelser fra et bilde? Og, bør det være spesielle tilpasninger for å hjelpe synshemmede personer? Disse spørsmålene åpner opp en boks med ormer om personvernet, rettferdigheten og hvordan AI bør passe inn i våre liv, noe som er noe alle bør ha et ord med å si.

Jeg har brukt de siste fem årene på å dykke ned i den fasiniserende verden av Maskinlæring og Dypt Læring. Min lidenskap og ekspertise har ledet meg til å bidra til over 50 ulike programvareprosjekter, med særlig fokus på AI/ML. Min pågående nysgjørhet har også trukket meg mot Naturlig Språkbehandling, et felt jeg er ivrig etter å utforske videre.