AI-modeller og plattformer
Avdekking av store multimodale modeller: Forming av språkmodell-landskapet i 2024
Mens vi opplever verden, gir sansene våre (syn, lyd, lukter) en mangfoldig mengde informasjon, og vi uttrykker oss ved hjelp av ulike kommunikasjonsmetoder, som ansiktsuttrykk og gester. Disse sansene og kommunikasjonsmetodene kalles kollektivt modaliteter, og representerer de ulike måtene vi oppfatter og kommuniserer på. Inspirert av denne menneskelige evnen, utvikles store multimodale modeller (LMM), en kombinasjon av generative og multimodale AI, for å forstå og generere innhold ved hjelp av ulike typer som tekst, bilder og lyd. I denne artikkelen dykker vi ned i dette nyutviklede feltet, og utforsker hva LMM er, hvordan de konstrueres, eksisterende eksempler, utfordringer de møter, og potensielle anvendelser.
Utviklingen av generativ AI i 2024: Fra store språkmodeller til store multimodale modeller
I sin seneste rapport, har McKinsey utpekt 2023 som et gjennombruddsår for generativ AI, og dette har ført til mange fremskritt i feltet. Vi har sett en merkbar økning i populariteten til store språkmodeller (LLM) som er i stand til å forstå og generere menneskelignende språk. Videre har bildegenereringsmodeller utviklet seg betydelig, og demonstrert sin evne til å generere visuelle uttrykk fra tekstlige instruksjoner. Likevel, til tross for betydelig fremgang i enkeltmodaliteter som tekst, bilder eller lyd, har generativ AI møtt utfordringer i å kombinere disse modalitetene på en sammenhengende måte i genereringsprosessen. Ettersom verden i seg selv er multimodal, er det essensielt for AI å kunne håndtere multimodal informasjon. Dette er nødvendig for meningsfull interaksjon med mennesker og vellykket drift i virkelige scenarier.
Som en følge av dette, forventer mange AI-forskere at LMM vil bli det neste skrittet i AI-forskning og utvikling i 2024. Dette utviklingsområdet fokuserer på å forbedre generativ AI sin evne til å prosessere og generere ulike utdata, inkludert tekst, bilder, lyd, video og andre modaliteter. Det er essensielt å understreke at ikke alle multimodale systemer kvalifiserer som LMM. Modeller som Midjourney og Stable Diffusion, til tross for å være multimodale, passer ikke inn i LMM-kategorien hovedsakelig fordi de mangler LLM, som er en grunnleggende komponent i LMM. Med andre ord kan vi beskrive LMM som en utvidelse av LLM, som gir dem evnen til å håndtere ulike modaliteter på en kompetent måte.
Hvordan fungerer LMM?
Mens forskerne har utforsket ulike tilnærminger til å konstruere LMM, involverer de vanligvis tre essensielle komponenter og operasjoner. Først brukes encodere for hver datamodalitet til å generere datarepresentasjoner (kalt innlejring) spesifikke for den modaliteten. Andre mekanismer brukes for å justere innlejring fra ulike modaliteter inn i en samlet multimodal innlejringsspace. Tredje, for generative modeller, brukes en LLM til å generere tekstlige svar. Ettersom inndata kan bestå av tekst, bilder, videoer og lyd, arbeider forskerne med å finne nye måter å få språkmodellene til å vurdere ulike modaliteter når de gir svar.
Utvikling av LMM i 2023
Under har jeg kort sammenfattet noen av de merkbare LMM som ble utviklet i 2023.
- LLaVA er en åpen kildekode LMM, utviklet i samarbeid med University of Wisconsin-Madison, Microsoft (MSFT ) Research og Columbia University. Modellen har som mål å tilby en åpen kildekodeversjon av multimodal GPT4. Ved å bruke Meta’s Llama LLM, inkorporerer den CLIP visuell encoder for robust visuell forståelse. Den helsefokuserte varianten av LLaVA, kalt LLaVA-Med, kan svare på spørsmål relatert til biomedisinske bilder.
- ImageBind er en åpen kildekode modell utviklet av Meta, som etterligner evnen til menneskelig persepsjon til å relatere multimodal data. Modellen integrerer seks modaliteter—tekst, bilder/videoer, lyd, 3D-målinger, temperaturdata og bevegelsesdata—og lærer en samlet representasjon over disse ulike datatypene. ImageBind kan koble objekter i bilder med attributter som lyd, 3D-former, temperatur og bevegelse. Modellen kan brukes, for eksempel, til å generere scener fra tekst eller lyd.
- SeamlessM4T er en multimodal modell utviklet av Meta for å fremme kommunikasjon mellom flerspråklige samfunn. SeamlessM4T utmerker seg i oversettelse og transkripsjonsoppgaver, og støtter tale-til-tale, tale-til-tekst, tekst-til-tale og tekst-til-tekst oversettelser. Modellen bruker en ikke-autoregressiv tekst-til-enhet-dekoder for å utføre disse oversettelsene. Den forbedrede versjonen, SeamlessM4T v2, danner grunnlaget for modeller som SeamlessExpressive og SeamlessStreaming, og understreker viktigheten av å bevare uttrykk over språk og levere oversettelser med minimal forsinkelse.
- GPT4, lansert av OpenAI, er en forbedring av sin forgjenger, GPT3.5. Selv om detaljerte arkitektoniske spesifikasjoner ikke er fullstendig avdekket, er GPT4 godt kjent for sin smidige integrasjon av tekst-bare, visuell-bare og lyd-bare modeller. Modellen kan generere tekst fra både skrevne og grafiske inndata. Den utmerker seg i ulike oppgaver, inkludert humorbeskrivelse i bilder, sammenfatting av tekst fra skjermbilder og å svare dyktig på eksamensspørsmål med diagrammer. GPT4 er også kjent for sin evne til å prosessere en rekke ulike inndataformater.
- Gemini, skapt av Google DeepMind, skiller seg ut ved å være innebygget multimodal, og tillater sammenhengende interaksjon over ulike oppgaver uten å være avhengig av å sy sammen enkeltmodalitetskomponenter. Denne modellen håndterer både tekst og ulike audiovisuelle inndata på en smidig måte, og viser sin evne til å generere utdata i både tekst og bildeformater.
Utfordringer for store multimodale modeller
- Inkludering av flere datamodaliteter: De fleste eksisterende LMM opererer med tekst og bilder. Likevel, må LMM utvikle seg utover tekst og bilder, og inkludere modaliteter som videoer, musikk og 3D.
- Mangfoldig datasetttilgjengelighet: En av de viktigste utfordringene i å utvikle og trene multimodale generative AI-modeller er behovet for store og mangfoldige datasett som inkluderer flere modaliteter. For eksempel, for å trene en modell til å generere tekst og bilder sammen, må datasettet inkludere både tekst og bildeinndata som er relatert til hverandre.
- Generering av multimodale utdata: Mens LMM kan håndtere multimodale inndata, er generering av ulike utdata, som å kombinere tekst med grafikk eller animasjoner, en utfordring.
- Følging av instruksjoner: LMM møter utfordringen med å mestre dialog og instruksjonsfølging, og gå utover bare fullføring.
- Multimodal resonnement: Mens nåværende LMM utmerker seg i å transformere en modalitet til en annen, er den sammenhengende integreringen av multimodal data for komplekse resonnementoppgaver, som å løse skrevne ordproblemer basert på lydinstruksjoner, en utfordring.
- Komprimering av LMM: Den ressurskrevende naturen til LMM utgjør en betydelig hindring, og gjør dem upraktiske for kantenheter med begrensede beregningsressurser. Komprimering av LMM for å forbedre effisiensen og gjøre dem egnet for distribusjon på ressursbegrensede enheter er et viktig område for pågående forskning.
Potensielle anvendelser
- Utdanning: LMM har potensialet til å transformere utdanning ved å generere mangfoldige og engasjerende læringsmateriell som kombinerer tekst, bilder og lyd. LMM kan gi omfattende tilbakemelding på oppgaver, fremme samarbeidslæringsplattformer og forbedre ferdighetutvikling gjennom interaktive simuleringer og virkelige eksempler.
- Helsevesen: I motsetning til tradisjonelle AI-diagnosesystemer som fokuserer på en enkelt modalitet, forbedrer LMM medisinske diagnoser ved å integrere flere modaliteter. De støtter også kommunikasjon over språkbarrierer mellom helsepersonell og pasienter, og fungerer som et sentralisert repository for ulike AI-applikasjoner innenfor sykehus.
- Kunst og musikkgenerering: LMM kan utmerke seg i kunst og musikkgenerering ved å kombinere ulike modaliteter for unike og uttrykksfulle utdata. For eksempel kan en kunst-LMM blande visuelle og auditive elementer, og gi en immersiv opplevelse. Liksom kan en musikk-LMM integrere instrumentale og vokale elementer, og resultere i dynamiske og uttrykksfulle komposisjoner.
- Personlige anbefalinger: LMM kan analysere brukerpreferanser over ulike modaliteter for å gi personlige anbefalinger for innholdskonsum, som filmer, musikk, artikler eller produkter.
- Værprognose og miljøovervåking: LMM kan analysere ulike modaliteter av data, som satellittbilder, atmosfæriske forhold og historiske mønster, for å forbedre nøyaktigheten i værprognoser og miljøovervåking.
Sluttorden
Landskapet av store multimodale modeller markerer et betydelig gjennombrudd i generativ AI, og lover fremskritt i ulike felt. Mens disse modellene sammenhengende integrerer ulike modaliteter, som tekst, bilder og lyd, åpner deres utvikling dører til transformative anvendelser i helsevesen, utdanning, kunst og personlige anbefalinger. Likevel, utfordringer som å inkludere flere datamodaliteter og komprimere ressurskrevende modeller, understreker de pågående forskningsinnsatsene som er nødvendige for fullt å realisere LMMs potensiale.












