AI-modeller och plattformar

Avtäckandet av stora multimodala modeller: Formandet av språkmodellernas landskap 2024

mm
Lägg till Unite.AI bland dina föredragna källor på Google

När vi upplever världen, tillhandahåller våra sinnen (syn, ljud, lukter) en mångfaldig mängd information, och vi uttrycker oss med hjälp av olika kommunikationsmetoder, såsom ansiktsuttryck och gester. Dessa sinnen och kommunikationsmetoder kallas kollektivt modaliteter, vilka representerar de olika sätten vi uppfattar och kommunicerar på. Med inspiration från denna mänskliga förmåga utvecklas stora multimodala modeller (LMM), en kombination av generativa och multimodala AI, för att förstå och skapa innehåll med hjälp av olika typer som text, bilder och ljud. I denna artikel dyker vi ner i detta nyutvecklade område och utforskar vad LMM (stora multimodala modeller) är, hur de konstrueras, befintliga exempel, de utmaningar de står inför och potentiella tillämpningar.

Utvecklingen av generativ AI 2024: Från stora språkmodeller till stora multimodala modeller

I sin senaste rapport har McKinsey utnämnt 2023 till ett genombrottsår för generativ AI, vilket har lett till många framsteg inom området. Vi har sett en anmärkningsvärd ökning av förekomsten av stora språkmodeller (LLM) som är skickliga på att förstå och generera mänskligt språk. Dessutom har bildgenereringsmodeller utvecklats avsevärt, och de har visat sin förmåga att skapa visuella representationer från textuella instruktioner. Trots betydande framsteg inom enskilda modaliteter som text, bilder eller ljud, har generativ AI mött utmaningar i att kombinera dessa modaliteter på ett smidigt sätt under genereringsprocessen. Eftersom världen i sig är multimodal till sin natur, är det avgörande för AI att hantera multimodal information. Detta är nödvändigt för meningsfull interaktion med människor och framgångsrik drift i verkliga scenarier.

Följaktligen förutser många AI-forskare uppkomsten av LMM som den nästa fronten inom AI-forskning och utveckling 2024. Denna utvecklingsfront fokuserar på att förbättra generativ AI:s förmåga att bearbeta och producera olika utdata, som omfattar text, bilder, ljud, video och andra modaliteter. Det är viktigt att betona att inte alla multimodala system kvalificerar sig som LMM. Modeller som Midjourney och Stable Diffusion, trots att de är multimodala, passar inte in i LMM-kategorin främst eftersom de saknar närvaron av LLM, som är en grundläggande komponent i LMM. Med andra ord kan vi beskriva LMM som en utvidgning av LLM, som ger dem förmågan att hantera olika modaliteter på ett kompetent sätt.

Hur fungerar LMM?

Medan forskare har utforskat olika tillvägagångssätt för att konstruera LMM, omfattar de vanligtvis tre väsentliga komponenter och operationer. Först används kodare för varje data-modalitet för att generera data-representationer (som kallas inbäddningar) specifika för den modaliteten. Andra mekanismer används för att justera inbäddningar från olika modaliteter till ett enhetligt multimodalt inbäddningsutrymme. Tredje, för generativa modeller, används en LLM för att generera text-svar. Eftersom indata kan bestå av text, bilder, videor och ljud, arbetar forskare med nya sätt att göra språkmodeller som beaktar olika modaliteter när de ger svar.

Utvecklingen av LMM 2023

Nedan har jag kortfattat några av de mest betydande LMM som utvecklats 2023.

  • LLaVA är en öppen källkods-LMM, gemensamt utvecklad av University of Wisconsin-Madison, Microsoft (MSFT ) Research och Columbia University. Modellen syftar till att erbjuda en öppen källkods-version av multimodal GPT4. Genom att utnyttja Meta’s Llama LLM, integrerar den CLIP-visuell kodare för robust visuell förståelse. Den hälsoinriktade varianten av LLaVA, benämnd LLaVA-Med, kan besvara frågor relaterade till biomedicinska bilder.
  • ImageBind är en öppen källkods-modell skapad av Meta, som efterliknar förmågan hos mänsklig perception att relatera multimodal data. Modellen integrerar sex modaliteter – text, bilder/videor, ljud, 3D-mätningar, temperaturdata och rörelsedata – och lär sig en enhetlig representation över dessa olika datatyper. ImageBind kan koppla objekt i foton med attribut som ljud, 3D-former, temperatur och rörelse. Modellen kan användas, till exempel, för att generera en scen från text eller ljud.
  • SeamlessM4T är en multimodal modell utvecklad av Meta för att främja kommunikation mellan multilingvala samhällen. SeamlessM4T excellerar i översättnings- och transkriptionsuppgifter, och stöder tal-till-tal, tal-till-text, text-till-tal och text-till-text-översättningar. Modellen använder en icke-autoregressiv text-till-enhet-dekodare för att utföra dessa översättningar. Den förbättrade versionen, SeamlessM4T v2, utgör grunden för modeller som SeamlessExpressive och SeamlessStreaming, som betonar bevarandet av uttryck över språk och levererar översättningar med minimal fördröjning.
  • GPT4, lanserad av OpenAI, är en utveckling av dess föregångare, GPT3.5. Även om detaljerade arkitekturinformation inte är fullständigt offentliggjorda, är GPT4 väl ansedd för sin smidiga integration av text-baserade, visuella och ljud-baserade modeller. Modellen kan generera text från både skrivna och grafiska indata. Den excellerar i olika uppgifter, inklusive humorbeskrivning i bilder, sammanfattning av text från skärmbilder och svarande på ett adekvat sätt på provfrågor med diagram. GPT4 är också erkänd för sin anpassningsförmåga i att effektivt bearbeta en mängd olika indataformat.
  • Gemini, skapad av Google DeepMind, skiljer sig genom att vara medfödd multimodal, vilket möjliggör smidig interaktion över olika uppgifter utan att behöva kombinera enskilda modalitetskomponenter. Denna modell hanterar lätt både text och olika audio-visuella indata, och visar sin förmåga att generera utdata i både text- och bildformat.

Utmaningar för stora multimodala modeller

  • Inkludering av fler data-modaliteter: De flesta befintliga LMM fungerar med text och bilder. Men LMM behöver utvecklas bortom text och bilder, och omfatta modaliteter som videor, musik och 3D.
  • Mångfaldig datatillgänglighet: En av de viktigaste utmaningarna vid utveckling och träning av multimodala generativa AI-modeller är behovet av stora och mångfaldiga dataset som omfattar flera modaliteter. Till exempel, för att träna en modell att generera text och bilder tillsammans, behöver dataset innehålla både text- och bildinmatningar som är relaterade till varandra.
  • Generering av multimodala utdata: Medan LMM kan hantera multimodala indata, kvarstår utmaningen att generera olika utdata, som att kombinera text med grafik eller animationer.
  • Följande instruktioner: LMM står inför utmaningen att behärska dialog och instruktionsföljande uppgifter, och gå bortom enkel komplettion.
  • Multimodal resonemang: Medan nuvarande LMM excellerar i att omvandla en modalitet till en annan, kvarstår den smidiga integrationen av multimodal data för komplexa resonemangs-uppgifter, som att lösa skrivna ordproblem baserat på auditiva instruktioner, som en utmanande uppgift.
  • Komprimering av LMM: Den resurskrävande naturen hos LMM utgör ett betydande hinder, vilket gör dem opraktiska för kantenheter med begränsade beräkningsresurser. Att komprimera LMM för att förbättra effektivitet och göra dem lämpliga för distribution på resursbegränsade enheter är ett viktigt område för pågående forskning.

Potentiella användningsområden

  • Utbildning: LMM har potentialen att förvandla utbildning genom att generera varierat och engagerande läromaterial som kombinerar text, bilder och ljud. LMM tillhandahåller omfattande feedback på uppgifter, främjar samarbetsinlärningsplattformar och förbättrar färdighetsutveckling genom interaktiva simuleringar och verkliga exempel.
  • Hälsovård: I kontrast till traditionella AI-diagnostiska system som fokuserar på en enda modalitet, förbättrar LMM medicinska diagnostik genom att integrera flera modaliteter. De stöder också kommunikation över språkbarriärer mellan hälsovårdspersonal och patienter, och fungerar som en central repository för olika AI-applikationer inom sjukhus.
  • Konst- och musikgenerering: LMM kunde excellerera i konst- och musikskapande genom att kombinera olika modaliteter för unika och uttrycksfulla utdata. Till exempel, en konst-LMM kan blanda visuella och auditiva element, och ge en immersiv upplevelse. Likaså, en musik-LMM kan integrera instrumentala och vokala element, och resultera i dynamiska och uttrycksfulla kompositioner.
  • Personliga rekommendationer: LMM kan analysera användarpreferenser över olika modaliteter för att tillhandahålla personliga rekommendationer för innehållskonsumtion, som filmer, musik, artiklar eller produkter.
  • Väderprognos och miljöövervakning: LMM kan analysera olika modaliteter av data, som satellitbilder, atmosfäriska förhållanden och historiska mönster, för att förbättra precisionen i väderprognoser och miljöövervakning.

Slutsatsen

Landskapet av stora multimodala modeller (LMM) markerar ett betydande genombrott inom generativ AI, och lovar framsteg inom olika områden. När dessa modeller smidigt integrerar olika modaliteter, som text, bilder och ljud, öppnar deras utveckling dörrar till transformerande tillämpningar inom hälsovård, utbildning, konst och personliga rekommendationer. Men utmaningar, som att omfatta fler data-modaliteter och komprimera resurskrävande modeller, understryker de pågående forskningsinsatser som behövs för fullständig realisering av LMM:s potential.

Dr. Tehseen Zia är en fast anställd biträdande professor vid COMSATS University Islamabad, med en doktorsexamen i AI från Vienna University of Technology, Österrike. Specialiserad på artificiell intelligens, maskinlärning, datavetenskap och datorseende, har han gjort betydande bidrag med publikationer i ansedda vetenskapliga tidskrifter. Dr. Tehseen har också lett olika industriprojekt som huvudutredare och tjänstgjort som AI-konsult.