AI-modeller och plattformar

Segment Anything Model – Datorseende Får En Massiv Boost

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Datorseende (CV) har nått 99% noggrannhet från 50% på bara 10 år. Teknologin förväntas förbättras ytterligare till en utanför denna världens nivå med moderna algoritmer och bildsegmenteringstekniker. Nyligen har Metas FAIR-laboratorium släppt Segment Anything Model (SAM) – en spelväxlare inom bildsegmentering. Denna avancerade modell kan producera detaljerade objektsmasker från indataprompt, vilket tar datorseende till nya höjder. Det kan potentiellt revolutionera hur vi interagerar med digital teknik i denna era.

Låt oss utforska bildsegmentering och kort avslöja hur SAM påverkar datorseende.

Vad Är Bildsegmentering & Vilka Är Dess Typer?

Bildsegmentering är en process inom datorseende som delar en bild i flera regioner eller segment, var och en representerar ett annat objekt eller område i bilden. Denna metod tillåter experter att isolera specifika delar av en bild för att få meningsfulla insikter.

Bildsegmenteringsmodeller är tränade för att förbättra utdata genom att känna igen viktiga bildinformation och minska komplexitet. Dessa algoritmer differentierar effektivt mellan olika regioner i en bild baserat på funktioner som färg, textur, kontrast, skuggor och kanter.

Genom att segmentera en bild kan vi fokusera vår analys på de områden som är av intresse för insiktsfulla detaljer. Nedan följer olika bildsegmenteringstekniker.

  • Semantisk segmentering innebär att märka pixlar i semantiska klasser.
  • Instanssegmentering går längre genom att upptäcka och avgränsa varje objekt i en bild.
  • Panoptisk segmentering tilldelar unika instans-ID till enskilda objektpixlar, vilket resulterar i mer omfattande och kontextuell märkning av alla objekt i en bild.

Segmentering implementeras med hjälp av bildbaserade djupinlärningsmodeller. Dessa modeller hämtar alla värdefulla datapunkter och funktioner från träningsuppsättningen. Sedan omvandlar de dessa data till vektorer och matriser för att förstå komplexa funktioner. Några av de mest använda djupinlärningsmodellerna bakom bildsegmentering är:

  • Konvolutionsneurala nätverk (CNN)
  • Fully Connected Networks (FCN)
  • Recurrent Neural Networks (RNN)

Hur Fungerar Bildsegmentering?

I datorseende består de flesta bildsegmenteringsmodeller av ett encoder-decoder-nätverk. Encodern kodar en latent utrymme-representation av indata, som decodern dekodar för att bilda segmentkartor, eller med andra ord, kartor som avgränsar varje objekts plats i bilden.

Vanligtvis består segmenteringsprocessen av 3 stadier:

  • En bildencoder som omvandlar indata till en matematisk modell (vektorer och matriser) för bearbetning.
  • Encodern aggregerar vektorerna på flera nivåer.
  • En snabb maskdecodare tar bildinbäddningarna som indata och producerar en mask som avgränsar olika objekt i bilden separat.

Bildsegmenteringens Tillstånd

Från och med 2014 uppstod en våg av djupinlärningsbaserade segmenteringsalgoritmer, såsom CNN+CRF och FCN, som gjorde betydande framsteg inom området. 2015 såg vi uppkomsten av U-Net och Deconvolution Network, som förbättrade noggrannheten i segmenteringsresultaten.

Sedan 2016 förbättrades noggrannheten och hastigheten i segmentering med hjälp av Instance Aware Segmentation, V-Net och RefineNet. År 2017 introducerades Mark-RCNN och FC-DenseNet, som införde objektupptäckt och tät förutsägelse i segmenteringsuppgifter.

År 2018 stod Panoptic Segmentation, Mask-Lab och Context Encoding Networks i centrum, eftersom dessa tillvägagångssätt tillgodosåg behovet av instansnivåsegmentering. År 2019 introducerades Panoptic FPN, HRNet och Criss-Cross Attention, som införde nya tillvägagångssätt för instansnivåsegmentering.

År 2020 fortsatte trenden med introduktionen av Detecto RS, Panoptic DeepLab, PolarMask, CenterMask, DC-NAS och Efficient Net + NAS-FPN. Slutligen, år 2023, har vi SAM, som vi kommer att diskutera nästa.

Segment Anything Model (SAM) – Allmänt Syfte Bildsegmentering

Segment Anything Model (SAM) är en ny tillvägagångssätt som kan utföra interaktiv och automatisk segmentering i en enda modell. Tidigare tillät interaktiv segmentering segmentering av valfri objektklass, men krävde att en person skulle vägleda metoden genom att iterativt förfinna en mask.

Automatisk segmentering i SAM tillåter segmentering av specifika objektkategorier som definierats i förväg. Dess främjande gränssnitt gör det mycket flexibelt. Som ett resultat kan SAM hantera en mängd olika segmenteringsuppgifter med hjälp av en lämplig prompt, såsom klick, rutor, text och mer.

SAM är tränad på en mångfaldig och insiktsfull dataset med över 1 miljard masker, vilket gör det möjligt att känna igen nya objekt och bilder som inte finns i träningsuppsättningen. Detta moderna ramverk kommer att revolutionera CV-modeller i tillämpningar som självkörande bilar, säkerhet och förstärkt verklighet.

SAM kan upptäcka och segmentera objekt runt bilen i självkörande bilar, såsom andra fordon, fotgängare och trafikskyltar. I förstärkt verklighet kan SAM segmentera den verkliga miljön för att placera virtuella objekt på lämpliga platser, vilket skapar en mer realistisk och engagerande användarupplevelse.

Bildsegmenteringsutmaningar 2023

Den ökande forskningen och utvecklingen inom bildsegmentering medför också betydande utmaningar. Några av de främsta bildsegmenteringsutmaningarna 2023 inkluderar:

  • Ökande komplexitet i dataset, särskilt för 3D-bildsegmentering
  • Utveckling av tolkningsbara djupmodeller
  • Användning av oövervakade inlärningsmodeller som minimerar mänskligt ingripande
  • Behov av realtids- och minneseffektiva modeller
  • Eliminering av flaskhalsar i 3D-punktmolnsegmentering

Datorseendets Framtid

Den globala datorseende-marknaden påverkar flera branscher och förväntas nå över $41 miljarder år 2030. Moderna bildsegmenteringstekniker som Segment Anything Model, tillsammans med andra djupinlärningsalgoritmer, kommer att ytterligare stärka datorseendets struktur i det digitala landskapet. Därför kommer vi att se mer robusta datorseendemodeller och intelligenta tillämpningar i framtiden.

För att lära dig mer om AI och ML, utforska Unite.ai – din en-stops-lösning för alla frågor om teknik och dess moderna tillstånd.

Haziqa är en Data Scientist med omfattande erfarenhet av att skriva tekniskt innehåll för AI- och SaaS-företag.