AI-modeller og plattformer

Avduking av SAM 2: Metas nye åpne kildegrunnmodell for sanntidsobjektsegmentering i videoer og bilder

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

I de siste årene har AI-verdenen sett betydelige fremskritt i grunnleggende AI for tekstbehandling, med fremgang som har forandret bransjer fra kundeservice til juridisk analyse. Likevel, når det kommer til bildebehandling, skraper vi bare overflaten. Kompleksiteten i visuell data og utfordringene med å trene modeller for å nøyaktig tolke og analysere bilder har presentert betydelige hindre. Mens forskere fortsetter å utforske grunnleggende AI for bilder og videoer, har fremtiden for bildebehandling i AI potensial for innovasjoner i helsevesen, autonome kjøretøy og utenfor.

Objektsegmentering, som innebærer å peke ut de eksakte pikslene i et bilde som korresponderer til et objekt av interesse, er en kritisk oppgave i datavisjon. Tradisjonelt har dette involvert å lage spesialiserte AI-modeller, som krever omfattende infrastruktur og store mengder annotert data. Forrige år introduserte Meta Segment Anything Model (SAM), en grunnleggende AI-modell som forenkler denne prosessen ved å tillate brukerne å segmentere bilder med en enkel prompt. Denne innovasjonen reduserte behovet for spesialisert ekspertise og omfattende beregningsressurser, og gjorde bildesegmentering mer tilgjengelig.

Nå tar Meta dette et skritt videre med SAM 2. Denne nye iterasjonen forbedrer ikke bare SAMs eksisterende bildesegmenteringskapasiteter, men utvider dem også til videobehandling. SAM 2 kan segmentere ethvert objekt i både bilder og videoer, selv om det ikke har møtt dem tidligere. Denne fremgangen er et sprang fremover i datavisjons- og bildebehandlingsområdet, og tilbyr et mer fleksibelt og kraftig verktøy for å analysere visuell innhold. Under utforsker vi de spennende fremgangene i SAM 2 og dens potensiale for å omdefinere felt som helsevesen, autonome kjøretøy og interaktivt media.

Introduksjon til Segment Anything Model (SAM)

Tradisjonelle segmenteringsmetoder krever enten manuell finjustering, kjent som interaktiv segmentering, eller omfattende annotert data for automatisk segmentering inn i forhåndsdefinerte kategorier. SAM er en grunnleggende AI-modell som støtter interaktiv segmentering ved hjelp av fleksible promter som klikk, bokser eller tekstinput. Den kan også finjusteres med minimalt data og beregningsressurser for automatisk segmentering. Trenet på over 1 milliard diverse bildeannotasjoner, kan SAM håndtere nye objekter og bilder uten å trenge tilpasset datatinnsamling eller finjustering.

SAM fungerer med to hovedkomponenter: en bildekode som prosesserer bildet og en promptkode som håndterer input som klikk eller tekst. Disse komponentene kommer sammen med en lett dekoder for å forutsi segmenteringsmasker. Når bildet er prosessert, kan SAM opprette et segment på bare 50 millisekunder i en nettleser, og er et kraftig verktøy for sanntids-, interaktive oppgaver. For å bygge SAM, utviklet forskerne en tre-stegs datatinnsamlingprosess: modellstøttet annotering, en blanding av automatisk og assistert annotering, og fullstendig automatisk maskeskaping. Denne prosessen resulterte i SA-1B-datasettet, som inkluderer over 1,1 milliarder masker på 11 millioner lisensiert, privatlivsbeskyttende bilder – noe som gjør det 400 ganger større enn noen eksisterende datasett. SAMs imponerende ytelse stammer fra dette omfattende og diverse datasettet, og sikrer bedre representasjon over ulike geografiske regioner sammenlignet med tidligere datasett.

Avduking av SAM 2: Et sprang fra bilde til videosegmentering

Bygget på SAMs grunnlag, er SAM 2 designet for sanntids-, promptbar objektsegmentering i både bilder og videoer. I motsetning til SAM, som fokuserer utelukkende på statiske bilder, prosesserer SAM 2 videoer ved å behandle hver ramme som en del av en kontinuerlig sekvens. Dette muliggjør SAM 2 å håndtere dynamiske scener og endringer i innhold mer effektivt. For bildesegmentering forbedrer SAM 2 ikke bare SAMs kapasiteter, men opererer også tre ganger raskere i interaktive oppgaver.

SAM 2 beholder samme arkitektur som SAM, men introduserer en minnemekanisme for videobehandling. Denne funksjonen tillater SAM 2 å holde styr på informasjon fra tidligere rammene, og sikrer konsistent objektsegmentering til tross for endringer i bevegelse, lys eller okklusjon. Ved å referere til tidligere rammene, kan SAM 2 finjustere sine maskforutsigelser gjennom hele videoen.

Modellen er trenet på et nyutviklet datasett, SA-V-datasettet, som inkluderer over 600 000 masklet-annotasjoner på 51 000 videoer fra 47 land. Dette diverse datasett dekker både hele objekter og deres deler, og forbedrer SAM 2s nøyaktighet i sanntids videosegmentering.

SAM 2 er tilgjengelig som en åpen kilde-modell under Apache 2.0-lisensen, og gjør det tilgjengelig for ulike formål. Meta har også delt datasettet brukt for SAM 2 under en CC BY 4.0-lisens. I tillegg finnes det en nettbasert demo som lar brukerne utforske modellen og se hvordan den fungerer.

Potensielle bruksområder

SAM 2s kapasiteter for sanntids-, promptbar objektsegmentering for bilder og videoer har låst opp tallrike innovative bruksområder over ulike felt. For eksempel er noen av disse bruksområdene:

  • Helsevesendiagnostikk: SAM 2 kan betydelig forbedre sanntids kirurgisk assistanse ved å segmentere anatomiske strukturer og identifisere anomalier under live videooverføringer i operasjonsrommet. Den kan også forbedre medisinsk bildeanalyse ved å gi nøyaktig segmentering av organer eller svulster i medisinske skanninger.
  • Autonome kjøretøy: SAM 2 kan forbedre autonome kjøretøysystemer ved å forbedre objektgjenkjenningens nøyaktighet gjennom kontinuerlig segmentering og sporings av fotgjengere, kjøretøy og veiskilt over video-rammer. Dens evne til å håndtere dynamiske scener støtter også adaptiv navigasjon og kollisjonsunngåelse ved å gjenkjenne og reagere på miljøendringer i sanntid.
  • Interaktivt media og underholdning: SAM 2 kan forbedre forbedre forbedre forbedre augmented reality (AR)-applikasjoner ved å nøyaktig segmentere objekter i sanntid, og gjøre det enklere for virtuelle elementer å blande seg med den virkelige verden. Den kan også forbedre video-redigering ved å automatisere objektsegmentering i opptak, noe som forenkler prosesser som bakgrunnsfjerning og objekt-erstatning.
  • Miljøovervåking: SAM 2 kan assistere i dyrekollisjons-sporing ved å segmentere og overvåke dyr i video-opptak, og støtte artsforskning og habitat-studier. I katastrofe-respondanse kan den evaluere skader og guide innsatsen ved å nøyaktig segmentere berørte områder og objekter i video-overføringer.
  • Detaljhandel og e-handel: SAM 2 kan forbedre produktvisualisering i e-handel ved å aktivt segmentere produkter i bilder og videoer. Dette kan gi kundene muligheten til å se produkter fra ulike vinkler og sammenhenger. For lagerstyring hjelper det detaljister å spore og segmentere produkter på hyller i sanntid, og strømlinjeformer lagerstyring og forbedrer generell lagerstyring.

Overvinning av SAM 2s begrensninger: Praktiske løsninger og fremtidige forbedringer

Selv om SAM 2 fungerer godt med bilder og korte videoer, har den noen begrensninger som må tas i betraktning for praktisk bruk. Den kan stride med å spore objekter gjennom betydelige perspektivendringer, lange okklusjoner eller i overfylte scener, særlig i utvidede videoer. Manuell korreksjon med interaktive klikk kan hjelpe med å løse disse problemene.

I overfylte miljøer med liknende objekter kan SAM 2 noen ganger misidentifisere mål, men ekstra promter i senere rammene kan løse dette. Selv om SAM 2 kan segmentere multiple objekter, øker effektiviteten når den prosesserer hvert objekt separat. Fremtidige oppdateringer kan dra nytte av å integrere delt kontekstinformasjon for å forbedre ytelsen.

SAM 2 kan også gå glipp av fine detaljer med raskt flyttende objekter, og forutsigelsene kan være ustabile over rammene. Likevel kan videre trening løse denne begrensningen. Selv om automatisk generering av annotasjoner har forbedret, er menneskelige annotatorer fortsatt nødvendige for kvalitetskontroll og rammevalg, og videre automatisering kan forbedre effektiviteten.

Bunnen av saken

SAM 2 representerer et betydelig sprang fremover i sanntidsobjektsegmentering for både bilder og videoer, bygget på grunnlaget lagt av sin forgjenger. Ved å forbedre kapasiteter og utvide funksjonalitet til dynamisk video-innhold, lover SAM 2 å forandre en rekke felt, fra helsevesen og autonome kjøretøy til interaktivt media og detaljhandel. Selv om det fortsatt finnes utfordringer, særlig i håndtering av komplekse og overfylte scener, oppmuntrer den åpne kildekoden til SAM 2 til kontinuerlig forbedring og tilpasning. Med sin kraftige ytelse og tilgjengelighet er SAM 2 godt posisjonert til å drive innovasjon og utvide mulighetene i datavisjon og utenfor.

Dr. Tehseen Zia er en fast ansatt associate professor ved COMSATS University Islamabad, med en PhD i AI fra Vienna University of Technology, Østerrike. Som spesialist i kunstig intelligens, maskinlæring, datavitenskap og datavisjon, har han gjort betydelige bidrag med publikasjoner i anerkjente vitenskapelige tidsskrifter. Dr. Tehseen har også ledet flere industriprosjekter som hovedundersøker og tjenestegjort som AI-konsulent.