AI-modeller og plattformer

Meta AI’s MILS: En spillvender for nullskudd multimodal AI

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

I årevis har kunstig intelligens (AI) gjort imponerende fremgang, men det har alltid hatt en grunnleggende begrensning i sin evne til å prosessere forskjellige typer data på samme måte som mennesker. De fleste AI-modellene er unimodale, det vil si at de spesialiserer seg i bare én format, som tekst, bilder, video eller lyd. Mens dette er tilstrekkelig for bestemte oppgaver, gjør denne tilnærmingen AI stiv, og hindrer det i å koble punktene over flere datatyper og virkelig forstå konteksten.

For å løse dette, ble multimodal AI introdusert, som tillater modeller å arbeide med flere former for innputt. Imidlertid er bygging av disse systemene ikke enkelt. De krever massive, merkte datasets, som ikke bare er vanskelige å finne, men også dyre og tidskrevende å lage. I tillegg krever disse modellene vanligvis oppgave-spesifikk finjustering, noe som gjør dem ressurskrevende og vanskelige å skalerer til nye domener.

Meta AI’s Multimodal Iterative LLM Solver (MILS) er en utvikling som endrer dette. I motsetning til tradisjonelle modeller som krever omtrening for hver ny oppgave, bruker MILS nullskudd læring for å tolke og prosessere usette dataformater uten førerkunnskap. I stedet for å stole på eksisterende merkinger, finjusterer det sine utdata i sanntid ved hjelp av en iterativ vurderingssystem, og forbedrer kontinuerlig sin nøyaktighet uten å trenge ytterligere trening.

Problemet med tradisjonell multimodal AI

Multimodal AI, som prosesserer og integrerer data fra forskjellige kilder for å skape en samlet modell, har enormt potensial for å forandre hvordan AI samhandler med verden. I motsetning til tradisjonell AI, som avhenger av én type datainnputt, kan multimodal AI forstå og prosessere flere datatyper, som å konvertere bilder til tekst, generere undertekster for videoer eller syntetisere tale fra tekst.

Imidlertid møter tradisjonelle multimodale AI-systemer betydelige utfordringer, inkludert kompleksitet, høye datakrav og vanskeligheter med datajustering. Disse modellene er vanligvis mer komplekse enn unimodale modeller, og krever betydelige beregningsressurser og lengre treningsperioder. Den enorme variasjonen av data som er involvert, stiller betydelige utfordringer for datakvalitet, lagring og redundans, og gjør slike datavolumer dyre å lagre og kostbare å prosessere.

For å fungere effektivt, krever multimodal AI store mengder høykvalitetsdata fra flere modaliteter, og inkonsistent datakvalitet over modaliteter kan påvirke ytelsen til disse systemene. I tillegg er det komplekst å justere meningsfulle data fra forskjellige datatyper, data som representerer samme tid og rom, er komplekst. Integreringen av data fra forskjellige modaliteter er kompleks, da hver modalitet har sin struktur, format og prosesseringskrav, og gjør effektive kombinasjoner vanskelige. Videre er høykvalitetsmerkede datasets som inkluderer flere modaliteter ofte sjeldne, og å samle inn og annotere multimodal data er tidskrevende og dyrt.

Ved å erkjenne disse begrensningene, utnytter Meta AI’s MILS nullskuddlæring, som gjør det mulig for AI å utføre oppgaver det aldri har blitt eksplisitt trent på, og generalisere kunnskap over forskjellige kontekster. Med nullskuddlæring, tilpasser og genererer MILS nøyaktige utdata uten å trenge ytterligere merking, og tar dette konseptet videre ved å iterere over flere AI-genererte utdata og forbedre nøyaktigheten gjennom en intelligent vurderingssystem.

Hvorfor nullskuddlæring er en spillvender

En av de mest betydelige fremgangene i AI er nullskuddlæring, som tillater AI-modeller å utføre oppgaver eller gjenkjenne objekter uten førerkunnskap. Tradisjonell maskinlæring avhenger av store, merkte datasets for hver ny oppgave, noe betyr at modellene må bli eksplisitt trent på hver kategori de må gjenkjenne. Denne tilnærmingen fungerer godt når det er tilstrekkelig med treningsdata tilgjengelig, men det blir en utfordring i situasjoner hvor merket data er sjeldent, dyrt eller umulig å få tak i.

Nullskuddlæring endrer dette ved å gjøre det mulig for AI å anvende eksisterende kunnskap til nye situasjoner, på samme måte som mennesker infererer mening fra tidligere erfaringer. I stedet for å stole kun på merkte eksempler, bruker nullskuddmodeller hjelpeinformasjon, som semantiske attributter eller kontekstuelle relasjoner, for å generalisere over oppgaver. Denne evnen forbedrer skalerbarheten, reduserer dataavhengigheten og forbedrer tilpasningen, og gjør AI langt mer fleksibel i virkelige anvendelser.

For eksempel, hvis en tradisjonell AI-modell som er trent kun på tekst, plutselig blir bedt om å beskrive et bilde, vil den stride uten eksplisitt trening på visuell data. I motsetning kan en nullskuddmodell som MILS prosessere og tolke bildet uten å trenge ytterligere merkte eksempler. MILS forbedrer videre på dette konseptet ved å iterere over flere AI-genererte utdata og finjustere sine svar ved hjelp av en intelligent vurderingssystem.

Dette tilnærmingen er spesielt verdifull i felt hvor annotert data er begrenset eller dyrt å få tak i, som medisinsk bildebehandling, sjeldne språkoversettelser og fremvoksende vitenskapelig forskning. Evnen til nullskuddmodeller til å raskt tilpasse seg nye oppgaver uten omstrening, gjør dem kraftfulle verktøy for en rekke anvendelser, fra bildegjenkjenning til naturleg språkbehandling.

Hvordan Meta AI’s MILS forbedrer multimodal forståelse

Meta AI’s MILS introduserer en smartere måte for AI å tolke og finjustere multimodal data uten å trenge omfattende omstrening. Det oppnår dette gjennom en iterativ to-trinnsprosess, drevet av to nøkkelkomponenter:

  • Generatoren: En stor språkmodell (LLM), som LLaMA-3.1-8B, som skaper flere mulige tolkninger av innputt.
  • Vurdereren: En forhånds-trent multimodal modell, som CLIP, som vurderer disse tolkningene og rangerer dem basert på nøyaktighet og relevans.

Denne prosessen gjentas i en tilbakemeldingsløkke, og finjusterer kontinuerlig utdata til den mest presise og kontekstuell korrekte responsen er oppnådd, uten å endre modellens kjerneparametre.

Hva som gjør MILS unikt, er dens sanntids-optimisering. Tradisjonelle AI-modeller avhenger av faste forhåndstrente vekter og krever tung omstrening for nye oppgaver. I motsetning tilpasser MILS seg dynamisk på testtid, og finjusterer sine svar basert på umiddelbar tilbakemelding fra vurdereren. Dette gjør det mer effektivt, fleksibelt og mindre avhengig av store merkte datasets.

MILS kan håndtere flere multimodale oppgaver, som:

  • Bilde-undertekstning: Iterativt finjustere undertekster med LLaMA-3.1-8B og CLIP.
  • Videoanalyse: Bruke ViCLIP til å generere koherente beskrivelser av visuell innhold.
  • Lydprosessering: Utnytte ImageBind til å beskrive lyder i naturlig språk.
  • Tekst-til-bilde-generering: Forbedre promter før de blir matet inn i diffusjonsmodeller for bedre bildekvalitet.
  • Stil-overføring: Generere optimerte redigeringspromter for å sikre visuelt konsistente transformasjoner.

Ved å bruke forhåndstrente modeller som vurderingsmekanismer i stedet for å trenge dedikert multimodal trening, leverer MILS kraftfulle nullskudd-ytelser over forskjellige oppgaver. Dette gjør det til en transformasjonell tilnærming for utviklere og forskere, og muliggjør integrering av multimodal resonnering i anvendelser uten byrden av omfattende omstrening.

Hvordan MILS overgår tradisjonell AI

MILS overgår tradisjonelle AI-modeller betydelig i flere nøkkelområder, spesielt i trenings-effektivitet og kostnadsreduksjon. Konvensjonelle AI-systemer krever vanligvis separat trening for hver type data, noe som ikke bare krever omfattende merkte datasets, men også medfører høye beregningskostnader. Denne adskillelsen skaper en barriere for tilgjengelighet for mange bedrifter, da ressursene som kreves for trening kan være prohibitive.

I motsetning bruker MILS forhåndstrente modeller og finjusterer utdata dynamisk, og reduserer betydelig disse beregningskostnadene. Denne tilnærmingen gjør det mulig for organisasjoner å implementere avanserte AI-kapasiteter uten den finansielle byrden som vanligvis er forbundet med omfattende modelltrening.

Videre demonstrerer MILS høy nøyaktighet og ytelse sammenlignet med eksisterende AI-modeller på forskjellige benchmark for video-undertekstning. Den iterative finjusteringsprosessen gjør det mulig for det å produsere mer nøyaktige og kontekstuell korrekte resultater enn enkelt-skudd AI-modeller, som ofte sliter med å generere presise beskrivelser fra nye datatyper. Ved å kontinuerlig forbedre sine utdata gjennom tilbakemeldingsløkker mellom generatoren og vurdereren, sikrer MILS at de endelige resultatene ikke bare er av høy kvalitet, men også tilpasset de spesifikke nyansene til hver oppgave.

Skalerbarhet og tilpasning er ytterligere styrker til MILS som skiller det fra tradisjonelle AI-systemer. Fordi det ikke krever omstrening for nye oppgaver eller datatyper, kan MILS integreres i forskjellige AI-drevne systemer over forskjellige industrier. Denne innebygde fleksibiliteten gjør det høyt skalerbart og fremtidsrettet, og gjør det mulig for organisasjoner å utnytte sine kapasiteter når deres behov utvikler seg. Mens bedrifter stadig søker å dra nytte av AI uten begrensningene til tradisjonelle modeller, har MILS oppstått som en transformasjonell løsning som forbedrer effektivitet samtidig som det leverer overlegen ytelse over en rekke anvendelser.

Sluttresultatet

Meta AI’s MILS endrer måten AI håndterer forskjellige typer data. I stedet for å avhenge av massive merkte datasets eller konstant omstrening, lærer og forbedrer det mens det arbeider. Dette gjør AI mer fleksibelt og nyttig over forskjellige felt, enten det er å analysere bilder, prosessere lyd eller generere tekst.

Ved å finjustere sine svar i sanntid, bringer MILS AI nærmere hvordan mennesker prosesserer informasjon, og lærer av tilbakemelding og tar bedre beslutninger med hver enkelt steg. Denne tilnærmingen er ikke bare om å gjøre AI smartere, men også om å gjøre det praktisk og tilpasset virkelige utfordringer.

Dr. Assad Abbas, en fast ansatt associate professor ved COMSATS University Islamabad, Pakistan, oppnådde sin Ph.D. fra North Dakota State University, USA. Hans forskning fokuserer på avanserte teknologier, inkludert sky, fog og edge computing, big data analytics og AI. Dr. Abbas har gjort betydelige bidrag med publikasjoner i anerkjente vitenskapelige tidsskrifter og konferanser. Han er også grunnleggeren av MyFastingBuddy.