AI-modellen en platforms
Ontwikkeling van Large Multimodal Models: Vormgeving van de Landschap van Taalmodellen in 2024
Terwijl we de wereld ervaren, bieden onze zintuigen (visie, geluiden, geuren) een gevarieerde hoeveelheid informatie, en we drukken onszelf uit met verschillende communicatiemethoden, zoals gezichtsuitdrukkingen en gebaren. Deze zintuigen en communicatiemethoden worden collectief genoemd modaliteiten, die de verschillende manieren vertegenwoordigen waarop we waarnemen en communiceren. Door inspiratie te putten uit deze menselijke capaciteit, worden grote multimodale modellen (LMM’s), een combinatie van generatieve en multimodale AI, ontwikkeld om inhoud te begrijpen en te creëren met behulp van verschillende typen, zoals tekst, afbeeldingen en audio. In dit artikel gaan we dieper in op dit nieuw opkomende veld, waarin we onderzoeken wat LMM’s (Large Multimodal Models) zijn, hoe ze zijn opgebouwd, bestaande voorbeelden, de uitdagingen waarmee ze worden geconfronteerd en potentiële toepassingen.
Evolutie van Generatieve AI in 2024: Van Grote Taalmodellen tot Grote Multimodale Modellen
In hun laatste rapport heeft McKinsey 2023 aangewezen als een doorbraakjaar voor generatieve AI, wat heeft geleid tot veel vooruitgang in het veld. We hebben een opvallende toename gezien in de prevalentie van grote taalmodellen (LLM’s) die in staat zijn om menselijke taal te begrijpen en te genereren. Bovendien zijn beeldgeneratiemodellen aanzienlijk geëvolueerd, waarbij ze hun vermogen hebben aangetoond om visuals te creëren vanuit tekstuele prompts. Echter, ondanks significante vooruitgang in individuele modaliteiten zoals tekst, afbeeldingen of audio, heeft generatieve AI moeite om deze modaliteiten naadloos te combineren in het generatieproces. Aangezien de wereld inherent multimodaal is, is het essentieel dat AI omgaat met multimodale informatie. Dit is noodzakelijk voor betekenisvolle interactie met mensen en succesvolle werking in real-world scenario’s.
Dientengevolge verwachten veel AI-onderzoekers de opkomst van LMM’s als de volgende frontier in AI-onderzoek en -ontwikkeling in 2024. Deze evoluerende frontier richt zich op het verbeteren van de capaciteit van generatieve AI om diverse uitvoer te verwerken en te produceren, waaronder tekst, afbeeldingen, audio, video en andere modaliteiten. Het is essentieel om te benadrukken dat niet alle multimodale systemen in aanmerking komen als LMM’s. Modellen zoals Midjourney en Stable Diffusion, ondanks dat ze multimodaal zijn, voldoen niet aan de categorie LMM’s, voornamelijk omdat ze ontbreken aan de aanwezigheid van LLM’s, die een fundamenteel onderdeel zijn van LMM’s. Met andere woorden, we kunnen LMM’s beschrijven als een uitbreiding van LLM’s, die hen de mogelijkheid geven om verschillende modaliteiten vaardig te behandelen.
Hoe werken LMM’s?
Terwijl onderzoekers verschillende benaderingen hebben onderzocht om LMM’s te construeren, omvatten ze typisch drie essentiële componenten en operaties. Ten eerste worden encoders gebruikt voor elke gegevensmodaliteit om gegevensrepresentaties (verwezen naar als embeddings) specifiek voor die modaliteit te genereren. Ten tweede worden verschillende mechanismen gebruikt om embeddings van verschillende modaliteiten te aligneren in een uniforme multimodale embeddingruimte. Ten derde, voor generatieve modellen, wordt een LLM gebruikt om tekstuele antwoorden te genereren. Aangezien invoer kan bestaan uit tekst, afbeeldingen, video’s en audio, werken onderzoekers aan nieuwe manieren om taalmodellen te laten overwegen verschillende modaliteiten bij het geven van antwoorden.
Ontwikkeling van LMM’s in 2023
Hieronder heb ik enkele van de opvallende LMM’s die in 2023 zijn ontwikkeld, kort uitgelicht.
- LLaVA is een open-source LMM, gezamenlijk ontwikkeld door de Universiteit van Wisconsin-Madison, Microsoft (MSFT ) Research en Columbia University. Het model heeft als doel een open-source versie van multimodaal GPT4 te bieden. Door Meta’s Llama LLM te gebruiken, integreert het de CLIP-visuele encoder voor robuuste visuele begrip. De op de gezondheidszorg gerichte variant van LLaVA, genaamd LLaVA-Med, kan vragen beantwoorden met betrekking tot biomedische afbeeldingen.
- ImageBind is een open-source model gemaakt door Meta, dat de mogelijkheid van menselijke perceptie nabootst om multimodale gegevens te relateren. Het model integreert zes modaliteiten—tekst, afbeeldingen/video’s, audio, 3D-metingen, temperatuurdata en bewegingsdata—en leert een uniforme representatie over deze diverse gegevenstypen. ImageBind kan objecten in foto’s verbinden met attributen zoals geluid, 3D-vormen, temperatuur en beweging. Het model kan bijvoorbeeld worden gebruikt om een scène te genereren vanuit tekst of geluid.
- SeamlessM4T is een multimodaal model ontworpen door Meta om communicatie tussen meertalige gemeenschappen te faciliteren. SeamlessM4T excelleert in vertaling- en transcriptietaken, met ondersteuning voor spraak-naar-spraak, spraak-naar-tekst, tekst-naar-spraak en tekst-naar-tekstvertalingen. Het model gebruikt een niet-autoregressieve tekst-naar-eenheiddecoder om deze vertalingen uit te voeren. De verbeterde versie, SeamlessM4T v2, vormt de basis voor modellen zoals SeamlessExpressive en SeamlessStreaming, waarbij de nadruk wordt gelegd op het behoud van expressie over talen heen en vertalingen met minimale latentie.
- GPT4, gelanceerd door OpenAI, is een verbetering van zijn voorganger, GPT3.5. Hoewel gedetailleerde architectonische specificaties niet volledig zijn onthuld, wordt GPT4 geroemd om zijn naadloze integratie van tekst-only, visie-only en audio-only modellen. Het model kan tekst genereren vanuit zowel geschreven als grafische invoer. Het excelleert in diverse taken, waaronder humorbeschrijving in afbeeldingen, samenvatting van tekst vanuit screenshots en adequaat reageren op examenvragen met diagrammen. GPT4 wordt ook erkend om zijn aanpasbaarheid in het effectief verwerken van een breed scala aan invoerdataformaten.
- Gemini, gecreëerd door Google DeepMind, onderscheidt zich door inherent multimodaal te zijn, waardoor naadloze interactie over verschillende taken mogelijk is zonder te vertrouwen op het samenstellen van single-modality componenten. Dit model beheert zowel tekst als diverse audiovisuele invoer moeiteloos, waarbij het zijn vermogen aantoont om uitvoer te genereren in zowel tekst als afbeeldingsformaten.
Uitdagingen van Grote Multimodale Modellen
- Meer gegevensmodaliteiten integreren: De meeste bestaande LMM’s werken met tekst en afbeeldingen. Echter, LMM’s moeten evolueren voorbij tekst en afbeeldingen, en accommodatie bieden voor modaliteiten zoals video’s, muziek en 3D.
- Gevarieerde datasetbeschikbaarheid: Een van de belangrijkste uitdagingen bij het ontwikkelen en trainen van multimodale generatieve AI-modellen is de noodzaak voor grote en gevarieerde datasets die meerdere modaliteiten omvatten. Bijvoorbeeld, om een model te trainen om tekst en afbeeldingen samen te genereren, moet de dataset zowel tekst als afbeeldingen bevatten die met elkaar verband houden.
- Multimodale uitvoer genereren: Terwijl LMM’s multimodale invoer kunnen verwerken, blijft het genereren van diverse uitvoer, zoals het combineren van tekst met graphics of animaties, een uitdaging.
- Instructies volgen: LMM’s worden geconfronteerd met de uitdaging om dialoog en instructie-volgende taken te beheersen, waardoor ze verder gaan dan louter voltooiing.
- Multimodale redenering: Terwijl huidige LMM’s uitstekend zijn in het transformeren van één modaliteit naar een andere, blijft de naadloze integratie van multimodale gegevens voor complexe redeneringstaken, zoals het oplossen van geschreven woordproblemen op basis van auditieve instructies, een uitdagende onderneming.
- LMM’s comprimeren: De resource-intensieve aard van LMM’s vormt een aanzienlijke hindernis, waardoor ze onpraktisch zijn voor edge-apparaten met beperkte rekenbronnen. Het comprimeren van LMM’s om efficiëntie te verbeteren en ze geschikt te maken voor implementatie op apparaten met beperkte middelen is een cruciaal onderzoeksgebied.
Mogelijke Toepassingen
- Onderwijs: LMM’s hebben het potentieel om onderwijs te transformeren door diverse en boeiende leerinhoud te genereren die tekst, afbeeldingen en audio combineert. LMM’s bieden uitgebreide feedback op opdrachten, bevorderen samenwerkingsplatforms voor leren en verbeteren vaardigheidsontwikkeling door interactieve simulaties en real-world voorbeelden.
- Gezondheidszorg: In tegenstelling tot traditionele AI-diagnostische systemen die zich richten op één modaliteit, verbeteren LMM’s medische diagnostiek door meerdere modaliteiten te integreren. Ze ondersteunen ook communicatie over taalbarrières tussen zorgverleners en patiënten, en fungeren als een centraal repository voor diverse AI-toepassingen binnen ziekenhuizen.
- Kunst- en Muziekgeneratie: LMM’s kunnen uitstekend zijn in kunst- en muziekcreatie door verschillende modaliteiten te combineren voor unieke en expressieve uitvoer. Bijvoorbeeld, een kunst-LMM kan visuele en auditieve elementen combineren, waardoor een immersieve ervaring ontstaat. Evenzo kan een muziek-LMM instrumentale en vocale elementen integreren, resulterend in dynamische en expressieve composities.
- Geperstoonde Aanbevelingen: LMM’s kunnen gebruikersvoorkeuren analyseren over meerdere modaliteiten om geperstoonde aanbevelingen te bieden voor inhoudsconsumptie, zoals films, muziek, artikelen of producten.
- Weersvoorspelling en Milieumonitoring: LMM’s kunnen verschillende modaliteiten van gegevens analyseren, zoals satellietbeelden, atmosferische omstandigheden en historische patronen, om de nauwkeurigheid van weersvoorspelling en milieumonitoring te verbeteren.
De Bottom Line
Het landschap van Grote Multimodale Modellen (LMM’s) markeert een significante doorbraak in generatieve AI, belovend vooruitgang in diverse gebieden. Aangezien deze modellen verschillende modaliteiten naadloos integreren, zoals tekst, afbeeldingen en audio, opent hun ontwikkeling deuren naar transformatieve toepassingen in de gezondheidszorg, onderwijs, kunst en geperstoonde aanbevelingen. Echter, uitdagingen, waaronder het accommoderen van meer gegevensmodaliteiten en het comprimeren van resource-intensieve modellen, benadrukken de voortdurende onderzoeksinspanningen die nodig zijn voor de volledige realisatie van het potentieel van LMM’s.












