AI-modeller og plattformer

Segment Anything Model – Datamaskinens syn får en enorm boost

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Datamaskinens syn (CV) har nådd 99% nøyaktighet fra 50% på bare 10 år. Teknologien forventes å forbedres ytterligere til en utenforliggende nivå med moderne algoritmer og bildesegmenteringsteknikker. Nylig har Metas FAIR-laboratorium lansert Segment Anything Model (SAM) – en game-changer i bildesegmentering. Denne avanserte modellen kan produsere detaljerte objektmasker fra inndata-prompter, og tar datamaskinens syn til nye høyder. Den kan potensielt revolusjonere hvordan vi interagerer med digital teknologi i denne æraen.

La oss utforske bildesegmentering og kort avdekke hvordan SAM påvirker datamaskinens syn.

Hva er bildesegmentering & hva er dens typer?

Bildesegmentering er en prosess i datamaskinens syn som deler et bilde inn i flere regioner eller segmenter, hvor hver representerer et annet objekt eller område av bildet. Denne tilnærmingen tillater eksperter å isolere bestemte deler av et bilde for å få meningsfulle detaljer.

Bildesegmenteringsmodeller er trent for å forbedre utgangen ved å gjenkjenne viktige bilde-detaljer og redusere kompleksitet. Disse algoritmene skiller effektivt mellom ulike regioner av et bilde basert på egenskaper som farge, tekstur, kontrast, skygge og kanter.

Ved å segmentere et bilde, kan vi fokusere vår analyse på områdene av interesse for å få meningsfulle detaljer. Under følger ulike bildesegmenteringsteknikker.

  • Semantisk segmentering innebærer å merke pixler inn i semantiske klasser.
  • Eksemplar-segmentering går videre ved å detektere og avgrense hvert objekt i et bilde.
  • Panoptisk segmentering tildeler unike eksemplar-IDer til individuelle objekt-pixler, noe som resulterer i mer omfattende og kontekstuell merking av alle objekter i et bilde.

Segmentering implementeres ved hjelp av bilde-basert dypt læring-modeller. Disse modellene henter alle verdifulle data-punkter og egenskaper fra treningssettet. Deretter omgjør de denne dataen til vektorer og matriser for å forstå komplekse egenskaper. Noen av de mest brukte dypt læring-modellene bak bilde-segmentering er:

  • Convolutional Neural Networks (CNNs)
  • Fully Connected Networks (FCNs)
  • Recurrent Neural Networks (RNNs)

Hvordan fungerer bilde-segmentering?

I datamaskinens syn, består de fleste bilde-segmenteringsmodellene av en encoder-decoder-nettverk. Encoderen kodar en latent rom-representasjon av inndataene som decoderen dekoder for å danne segment-kart, eller med andre ord, kart som omrissene hver enkelt objekts plassering i bildet.

Vanligvis består segmenteringsprosessen av 3 stadier:

  • En bilde-encoder som transformerer inndata-bildet til en matematisk modell (vektorer og matriser) for prosessering.
  • Encoderen aggregerte vektorene på flere nivåer.
  • En rask mask-decoder tar bilde-embeddingene som inndata og produserer en mask som omrissene ulike objekter i bildet separat.

Tilstanden for bilde-segmentering

Fra 2014, oppstod en bølge av dypt-læring-basert segmenteringsalgoritmer, som CNN+CRF og FCN, som gjorde betydelig fremgang i feltet. I 2015 så vi oppblomstringen av U-Net og Deconvolution Network, som forbedret nøyaktigheten av segmenteringsresultatene.

Deretter, i 2016, forbedret Instance Aware Segmentation, V-Net og RefineNet nøyaktigheten og hastigheten av segmentering. I 2017 introduserte Mark-RCNN og FC-DenseNet objekt-deteksjon og tett prediksjon til segmenteringsoppgaver.

I 2018, var Panoptisk Segmentering, Mask-Lab og Context Encoding Networks i sentrum av scenen, da disse tilnærmingene adresserte behovet for eksemplar-nivå-segmentering. I 2019, introduserte Panoptic FPN, HRNet og Criss-Cross Attention nye tilnærminger for eksemplar-nivå-segmentering.

I 2020, fortsatte trenden med introduksjonen av Detecto RS, Panoptic DeepLab, PolarMask, CenterMask, DC-NAS og Efficient Net + NAS-FPN. Til slutt, i 2023, har vi SAM, som vi skal diskutere neste.

Segment Anything Model (SAM) – Generell bilde-segmentering

Segment Anything Model (SAM) er en ny tilnærming som kan utføre interaktiv og automatisk segmentering i en enkelt modell. Tidligere, tillot interaktiv segmentering segmentering av hvilken som helst objekt-klasse, men krevde en person å guide metoden ved å iterativt finjustere en mask.

Automatisk segmentering i SAM tillater segmentering av bestemte objekt-kategorier definert på forhånd. Dens promotable grensesnitt gjør det svært fleksibelt. Som et resultat, kan SAM håndtere en rekke segmenteringsoppgaver ved å bruke en passende prompt, som klikk, bokser, tekst og mer.

SAM er trent på et diversifisert og innsiktsfullt datasett på over 1 milliard masker, noe som gjør det mulig å gjenkjenne nye objekter og bilder som ikke er tilgjengelige i treningssettet. Denne moderne rammen vil revolusjonere CV-modellene i applikasjoner som selvkjørende biler, sikkerhet og forbedret virkelighet.

SAM kan detektere og segmentere objekter rundt bilen i selvkjørende biler, som andre kjøretøy, fotgjengere og trafikkskilt. I forbedret virkelighet, kan SAM segmentere den virkelige verden for å plassere virtuelle objekter i passende lokasjoner, og skape en mer realistisk og engasjerende brukeropplevelse.

Bilde-segmenteringsutfordringer i 2023

Den økende forskningen og utviklingen i bilde-segmentering bringer også betydelige utfordringer. Noen av de viktigste bilde-segmenteringsutfordringene i 2023 inkluderer:

  • Den økende kompleksiteten av datasett, spesielt for 3D-bilde-segmentering
  • Utviklingen av tolkbare dypt-læring-modeller
  • Bruken av usupervisert læring-modeller som minimerer menneskelig inngripen
  • Behovet for sanntids- og minne-effektive modeller
  • Eliminering av flaskenakken i 3D-punktsky-segmentering

Fremtiden for datamaskinens syn

Den globale datamaskinens syn-markedet påvirker flere industrier og forventes å nå over $41 milliarder i 2030. Moderne bilde-segmenteringsteknikker som Segment Anything Model, kombinert med andre dypt-læring-algoritmer, vil ytterligere styrke fundamentet for datamaskinens syn i det digitale landskapet. Derfor, vil vi se mer robuste datamaskinens syn-modeller og intelligente applikasjoner i fremtiden.

For å lære mer om AI og ML, utforsk Unite.ai – din en-stop-løsning for alle spørsmål om teknologi og dens moderne tilstand.

Haziqa er en dataforsker med omfattende erfaring med å skrive teknisk innhold for AI- og SaaS-selskaper.