AI-modeller og plattformer

Empowerende av store visjonmodeller (LVM) i domenespesifikke oppgaver gjennom overføring av læring

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Datorteknologi er et felt innen kunstig intelligens som har som mål å aktivere maskiner til å forstå og tolke visuell informasjon, som bilder eller videoer. Datorteknologi har mange anvendelser i ulike domener, som medisinske bilder, sikkerhet, selvstyrte kjøretøy og underholdning. Imidlertid er det å utvikle datorteknologisystemer som fungerer godt på ulike oppgaver og domener en utfordring, og krever mye merket data og beregningsressurser.

En måte å møte denne utfordringen på er å bruke overføring av læring, en teknikk som gjenbruker kunnskapen tilegnet fra en oppgave eller domene til en annen. Overføring av læring kan redusere behovet for data og beregning, og forbedre generaliseringen og ytelsen til datorteknologimodellene. Denne artikkelen fokuserer på en spesifikk type datorteknologimodell, kalt store visjonmodeller (LVM), og hvordan de kan utnyttes for domenespesifikke oppgaver gjennom overføring av læring.

Hva er store visjonmodeller (LVM)?

LVM er avanserte AI-modeller som prosesserer og tolker visuell data, vanligvis bilder eller videoer. De kalles “store” fordi de har mange parametre, ofte i millioner eller til og med milliarder, som gjør at de kan lære komplekse mønster og trekk i visuell data. LVM er vanligvis bygget med avanserte neuronale nettverksarkitekturer, som convolusjonelle neuronale nettverk (CNN) eller transformatorer, som kan håndtere pikseldata og detektere hierarkiske mønster.

LVM er trent på en stor mengde visuell data, som Internett-bilder eller videoer, sammen med relevante merker eller annotasjoner. Modellen lærer ved å justere parameterne sine for å minimere forskjellen mellom dens forutsagn og de faktiske merkene. Dette prosessen krever betydelig beregningskraft og en stor, divers datasett for å sikre at modellen kan generalisere godt til nye, usette data.

Flere fremtredende eksempler på LVM er OpenAI ‘s CLIP, som utmerker seg i oppgaver som zero-shot klassifisering og bildehenting ved å forstå bilder gjennom naturlig språkbeskrivelser. Liksom Google’s vision transformer (GOOGL ) tar i bruk en transformator-lignende arkitektur for bildeklassifisering, og oppnår state-of-the-art resultater i ulike benchmark. LandingLens, utviklet av LandingAI, skiller seg ut med sin brukervennlige plattform, som gjør det mulig for brukerne å opprette egne datorteknologiprojekter uten å kode. Den bruker domenespesifikke LVM, og viser robust ytelse i oppgaver som feiloppdaging og objektplassering, selv med begrenset merket data.

Hvorfor overføring av læring for LVM?

LVM har vist bemerkelsesverdige evner i å forstå og generere visuell data, men har også begrensninger. En av de viktigste begrensningene er at de ofte er trent på generelle datasett, som ImageNet eller COCO, som kan være forskjellige fra den spesifikke oppgaven eller domenet brukeren er interessert i. For eksempel kan en LVM trent på Internett-bilder kanskje ikke gjenkjenne sjeldne eller nye objekter, som medisinske instrumenter eller industrielle deler, som er relevante for en spesifikk domene.

I tillegg kan LVM kanskje ikke tilpasse seg variasjoner eller nyanser i ulike domener, som andre lysforhold, kamera-vinkler eller bakgrunner, som kan påvirke kvaliteten og nøyaktigheten av modellens forutsagn.

For å overvinne disse begrensningene kan overføring av læring utnytte kunnskapen tilegnet av en LVM på et generelt datasett til en spesifikk oppgave eller domene. Overføring av læring er finjustering eller tilpasning av en LVM til brukerens behov, ved å bruke en mindre mengde merket data fra mål-oppgaven eller domenet.

Å bruke overføring av læring tilbyr flere fordeler for LVM. En viktig fordel er evnen til å overføre kunnskap fra ulike visuelle data til spesifikke domener, og muliggjør raskere konvergens på mål-oppgaver. I tillegg reduserer det avhengigheten av data ved å bruke forhåndstrentes modellers lært trekk, og minsker behovet for omfattende domenespesifikke merket data.

I tillegg fører initialisering av LVM med forhåndstrentede vekter til raskere konvergens under finjustering, noe som er spesielt gunstig når beregningsressursene er begrensede. Til slutt forbedrer overføring av læring generaliseringen og ytelsen, og tilpasser LVM til spesifikke oppgaver, og sikrer nøyaktige forutsagn, og fremmer bruker-tilfredshet og tillit.

Hvordan overføre læring for LVM?

Ulike tilnærminger og metoder finnes for å utføre overføring av læring for LVM, avhengig av likheten og tilgjengeligheten av data mellom kilde- og mål-oppgaver eller domener. Det finnes to hovedtilnærminger til overføring av læring, nemlig induktiv og transduktiv overføring av læring.

Induktiv overføring av læring antar at kilde- og mål-oppgavene er forskjellige, men kilde- og mål-domenene er like. For eksempel kan kilde-oppgaven være bildeklassifisering, og mål-oppgaven kan være objektdeteksjon, men begge oppgavene bruker bilder fra samme domene, som naturlige scener eller dyr. I dette tilfelle er målet å overføre kunnskapen tilegnet av LVM på kilde-oppgaven til mål-oppgaven ved å bruke noen merket data fra mål-oppgaven til å finjustere modellen. Denne tilnærmningen kalles også oppgave-overføring eller multi-oppgave-læring.

På den andre siden antar transduktiv overføring av læring at kilde- og mål-oppgavene er like, men kilde- og mål-domenene er forskjellige. For eksempel kan kilde- og mål-oppgavene være bildeklassifisering, kilde-domenet kan være Internett-bilder, og mål-domenet kan være medisinske bilder. I dette tilfelle er målet å overføre kunnskapen tilegnet av LVM på kilde-domenet til mål-domenet ved å bruke noen merket eller umerket data fra mål-domenet til å tilpasse modellen. Denne tilnærmingen kalles også domene-overføring eller domene-tilpasning.

Metoder for overføring av læring

Overføring av læring for LVM involverer ulike metoder tilpasset ulike modifiseringsnivåer og tilgang til modellparametre og arkitektur. Egenskaps-uttrekk er en tilnærmning som bruker egenskapene kjent av LVM på en kilde-oppgave som inndata for en ny modell i mål-domenet. Mens det ikke krever modifiseringer av LVMs parametre eller arkitektur, kan det kanskje ikke fange oppgave-spesifikke egenskaper for mål-domenet. På den andre siden innebærer finjustering å justere LVM-parametre ved å bruke merket data fra mål-domenet. Denne metoden forbedrer tilpasningen til mål-oppgaven eller domenet, og krever parameter-tilgang og modifisering.

Til slutt fokuserer meta-læring på å trene en generell modell som kan raskt tilpasse seg nye oppgaver eller domener med minimalt data. Ved å bruke algoritmer som MAML eller Reptile, kan meta-læring tillate LVM å lære fra ulike oppgaver, og muliggjøre effektiv overføring av læring over dynamiske domener. Denne metoden krever tilgang og modifisering av LVM-parametre for effektiv implementering.

Domenespesifikke eksempler på overføring av læring med LVM

Overføring av læring for LVM har demonstrert betydelig suksess over ulike domener. Industri-inspeksjon er et domene som krever høy effektivitet og kvalitet i datorteknologimodeller, ettersom det innebærer å detektere og lokalisere feil eller anomali i ulike produkter og komponenter. Imidlertid møter industri-inspeksjon utfordringer som ulike og komplekse scenarioer, varierende miljøforhold og høye standarder og reguleringer.

Overføring av læring kan hjelpe med å overvinne disse utfordringene ved å utnytte forhåndstrentede LVM på generelle datasett og finjustere dem på domenespesifikke data. For eksempel tillater LandingAI’s LandingLens-plattform brukerne å opprette egne datorteknologiprojekter for industri-inspeksjon uten å kode. Den bruker domenespesifikke LVM for å oppnå høy ytelse på nedstrøms datorteknologiske oppgaver, som feiloppdaging eller objektplassering, med mindre merket data.

Liksom i underholdningsindustrien bidrar overføring av læring til kreativitet og mangfold i datorteknologimodeller. OpenAI’s CLIP-modell, designet for oppgaver som bilde-generering fra tekstbeskrivelser, tillater brukerne å opprette ulike visuelle innhold, som å generere bilder av “en drage” eller “et maleri av Picasso“. Denne anvendelsen viser hvordan overføring av læring muliggjør generering og manipulering av visuelt innhold for kunstneriske og underholdningsformål, og løser utfordringer relatert til bruker-forventninger, etiske overveielser og innholdskvalitet.

Bunnen av saken

I konklusjon fremstår overføring av læring som en transformasjonell strategi for å optimalisere LVM. Ved å tilpasse forhåndstrentede modeller til spesifikke domener, løser overføring av læring utfordringer, reduserer avhengigheten av data og akselererer konvergens. Tilnærmingen forbedrer LVMs effektivitet i domenespesifikke oppgaver. Den markerer et viktig skritt mot å brygge gapet mellom generell trening og spesialiserte anvendelser, og markerer en betydelig fremgang i feltet.

Dr. Assad Abbas, en fast ansatt associate professor ved COMSATS University Islamabad, Pakistan, oppnådde sin Ph.D. fra North Dakota State University, USA. Hans forskning fokuserer på avanserte teknologier, inkludert sky, fog og edge computing, big data analytics og AI. Dr. Abbas har gjort betydelige bidrag med publikasjoner i anerkjente vitenskapelige tidsskrifter og konferanser. Han er også grunnleggeren av MyFastingBuddy.