AI-modeller og platforme

Afsløring af Large Multimodal Models: Formning af landskabet for sprogmodeller i 2024

mm
Føj Unite.AI til dine foretrukne kilder på Google

Da vi oplever verden, giver vores sanser (syn, lyd, lugt) os en diversificeret mængde information, og vi udtrykker os ved hjælp af forskellige kommunikationsmetoder, såsom ansigtsudtryk og gestus. Disse sanser og kommunikationsmetoder kaldes kollektivt for modaliteter, der repræsenterer de forskellige måder, vi opfatter og kommunikerer på. Inspireret af denne menneskelige evne udvikles store multimodale modeller (LMM), en kombination af generative og multimodale AI, for at forstå og generere indhold ved hjælp af forskellige typer, såsom tekst, billeder og lyd. I denne artikel dykker vi ned i dette nyligt opståede felt og udforsker, hvad LMM’er (Large Multimodal Models) er, hvordan de konstrueres, eksisterende eksempler, udfordringerne de står over for, og potentielle anvendelser.

Udviklingen af generativ AI i 2024: Fra store sprogmodeller til store multimodale modeller

I sin seneste rapport har McKinsey udpeget 2023 som et gennembrudsår for generativ AI, hvilket har ført til mange fremskridt inden for feltet. Vi har oplevet en betydelig stigning i forekomsten af store sprogmodeller (LLM), der er i stand til at forstå og generere menneskelignende sprog. Desuden er billedgenereringsmodeller betydeligt udviklet, og de har demonstreret deres evne til at generere visuelt indhold fra tekstuelle prompts. Men på trods af betydelige fremskridt inden for enkeltmodaliteter som tekst, billeder eller lyd, har generativ AI stået over for udfordringer i at kombinerer disse modaliteter på en sammenhængende måde i genereringsprocessen. Da verden i sig selv er multimodal, er det afgørende for AI at kunne håndtere multimodal information. Dette er essentielt for meningsfuld interaktion med mennesker og succesfuld drift i virkelige scenarier.

Derfor forventer mange AI-forskere, at LMM’er vil blive den næste front i AI-forskning og -udvikling i 2024. Dette udviklingsområde fokuserer på at forbedre generativ AI’s kapacitet til at behandle og producere diverse outputs, der spænder over tekst, billeder, lyd, video og andre modaliteter. Det er vigtigt at understrege, at ikke alle multimodale systemer kvalificerer sig som LMM’er. Modeller som Midjourney og Stable Diffusion, på trods af at de er multimodale, passer ikke ind i LMM-kategorien, primært fordi de mangler LLM’er, der er en grundlæggende komponent i LMM’er. Med andre ord kan vi beskrive LMM’er som en udvidelse af LLM’er, der giver dem mulighed for at håndtere forskellige modaliteter på en kompetent måde.

Hvordan fungerer LMM’er?

Selvom forskere har udforsket forskellige tilgange til at konstruere LMM’er, involverer de typisk tre essentielle komponenter og operationer. Først anvendes encodere for hver datamodalitet til at generere datarepræsentationer (kaldet embeddings) specifikke for den pågældende modalitet. Anden, anvendes forskellige mekanismer til at justere embeddings fra forskellige modaliteter ind i en samlet multimodal embeddingsrum. Tredje, for generative modeller, anvendes en LLM til at generere tekstrespons. Da input kan bestå af tekst, billeder, videoer og lyd, arbejder forskere på at udvikle nye måder at få sprogmodeller til at tage hensyn til forskellige modaliteter, når de giver respons.

Udviklingen af LMM’er i 2023

Nedenfor har jeg kort sammenfattet nogle af de bemærkelsesværdige LMM’er, der er udviklet i 2023.

  • LLaVA er en open-source LMM, udviklet i samarbejde mellem University of Wisconsin-Madison, Microsoft (MSFT ) Research og Columbia University. Modellen har til formål at tilbyde en open-source version af multimodal GPT4. Ved at anvende Meta’s Llama LLM, integrerer den CLIP-visuelt encoder for robust visuel forståelse. Den sundhedsfokuserede variant af LLaVA, kaldet LLaVA-Med, kan besvare spørgsmål relateret til biomedicinske billeder.
  • ImageBind er en open-source model udviklet af Meta, der efterligner menneskelig perception og kan relaterer multimodal data. Modellen integrerer seks modaliteter – tekst, billeder/videoer, lyd, 3D-mål, temperaturdata og bevægelsesdata – og lærer en samlet repræsentation på tværs af disse forskellige datatyper. ImageBind kan kobler objekter i billeder med attributter som lyd, 3D-former, temperatur og bevægelse. Modellen kan anvendes til at generere scener fra tekst eller lyd.
  • SeamlessM4T er en multimodal model udviklet af Meta til at fremme kommunikation mellem multilingvale samfund. SeamlessM4T excellerer i oversættelse og transskription opgaver, og understøtter tale-til-tale, tale-til-tekst, tekst-til-tale og tekst-til-tekst oversættelser. Modellen anvender en non-autoregressiv tekst-til-enhed-decoder til at udføre disse oversættelser. Den forbedrede version, SeamlessM4T v2, danner grundlag for modeller som SeamlessExpressive og SeamlessStreaming, der fremhæver bevarelse af udtryk på tværs af sprog og leverer oversættelser med minimal forsinkelse.
  • GPT4, lanceret af OpenAI, er en udvikling af dens forgænger, GPT3.5. Selvom detaljerede arkitektoniske specifikationer ikke er fuldt ud afsløret, er GPT4 kendt for sin smidige integration af tekst-, billed- og lydmodeller. Modellen kan generere tekst fra både skrevne og grafiske input. Den excellerer i diverse opgaver, herunder humorbeskrivelse i billeder, sammenfatning af tekst fra skærmbilleder og respons på eksamensspørgsmål med diagrammer. GPT4 er også kendt for sin tilpasningsevne til at behandle en bred vifte af inputdataformater.
  • Gemini, skabt af Google DeepMind, adskiller sig ved at være inherent multimodal, og tillader sammenhængende interaktion på tværs af forskellige opgaver uden at afhænge af at sy sammen enkeltmodalitetskomponenter. Denne model kan håndtere både tekst og diverse audiovisuelle input, og viser sin evne til at generere output i både tekst- og billedform.

Udfordringer for store multimodale modeller

  • Integrering af flere datamodaliteter: De fleste eksisterende LMM’er opererer med tekst og billeder. Men LMM’er skal udvikle sig ud over tekst og billeder, og omfatte modaliteter som video, musik og 3D.
  • Diverse datasættilgængelighed: En af de vigtigste udfordringer i udviklingen og træningen af multimodale generative AI-modeller er behovet for store og diverse datasæt, der omfatter multiple modaliteter. For eksempel, for at træne en model til at generere tekst og billeder sammen, skal datasættet omfatte både tekst- og billedinput, der er relateret til hinanden.
  • Generering af multimodale output: Mens LMM’er kan håndtere multimodale input, er generering af diverse output, såsom kombination af tekst med grafik eller animation, en udfordring.
  • Følge instruktioner: LMM’er står over for udfordringen med at mestre dialog og instruktionsfølging, og gå ud over blot at fuldføre.
  • Multimodal reasoning: Mens nuværende LMM’er excellerer i at omdanne en modalitet til en anden, er den sammenhængende integration af multimodal data til komplekse reasoneringopgaver, som at løse skrevne ordproblemer baseret på auditiv instruktion, en udfordring.
  • Komprimering af LMM’er: Den ressourcekrævende natur af LMM’er udgør en betydelig hindring, og gør dem upraktiske til brug på kantenheder med begrænsede beregningsressourcer. Komprimering af LMM’er for at forbedre effektiviteten og gøre dem egnet til installation på ressourcebegrænsede enheder er et kritisk område for fortsat forskning.

Potentielle anvendelser

  • Uddannelse: LMM’er har potentialet til at transformere uddannelse ved at generere diverse og engagerende læringsmaterialer, der kombinerer tekst, billeder og lyd. LMM’er kan give omfattende feedback på opgaver, fremme samarbejdende læringsplatforme og forbedre færdighedsudvikling gennem interaktive simulationer og virkelige eksempler.
  • Sundhedspleje: I modsætning til traditionelle AI-diagnosesystemer, der fokuserer på en enkelt modalitet, forbedrer LMM’er medicinsk diagnose ved at integrere multiple modaliteter. De understøtter også kommunikation på tværs af sprogbarrierer mellem sundhedsplejepersonale og patienter, og fungerer som en central repository for forskellige AI-applikationer inden for hospitaler.
  • Kunst og musikgeneration: LMM’er kan excellerer i kunst- og musikgeneration ved at kombinere forskellige modaliteter til unikke og udtryksfulde output. For eksempel kan en kunst-LMM kombinere visuelle og auditive elementer, og give en immersiv oplevelse. Ligeledes kan en musik-LMM integrere instrumentale og vokale elementer, og resultere i dynamiske og udtryksfulde kompositioner.
  • Personlige anbefalinger: LMM’er kan analysere brugerpræferencer på tværs af forskellige modaliteter for at give personlige anbefalinger for indhold, såsom film, musik, artikler eller produkter.
  • Vejrforudsigelse og miljøovervågning: LMM’er kan analysere forskellige modaliteter af data, såsom satellitbilleder, atmosfæriske betingelser og historiske mønstre, for at forbedre nøjagtigheden i vejrforudsigelse og miljøovervågning.

Bottom Line

Landskabet for store multimodale modeller (LMM’er) markerer et betydeligt gennembrud i generativ AI, og lover fremskridt i diverse felter. Da disse modeller sammenhængende integrerer forskellige modaliteter, såsom tekst, billeder og lyd, åbner deres udvikling døre til transformative anvendelser i sundhedspleje, uddannelse, kunst og personlige anbefalinger. Men udfordringer, herunder at omfatte flere datamodaliteter og komprimere ressourcekrævende modeller, understreger de fortsatte forskningsindsats, der er nødvendig for at fuldt ud realisere LMM’ers potentiale.

Dr. Tehseen Zia er en fastansat lektor ved COMSATS University Islamabad, med en ph.d. i AI fra Vienna University of Technology, Østrig. Specialiseret i kunstig intelligens, maskinlæring, datavidenskab og computer vision, har han gjort betydelige bidrag med publikationer i anerkendte videnskabelige tidsskrifter. Dr. Tehseen har også ledet forskellige industrielle projekter som hovedundersøger og fungeret som AI-rådgiver.