AI-modeller og platforme
Segment Anything Model – Computer Vision Får En Massiv Boost
Computer vision (CV) har nået 99% nøjagtighed fra 50% på blot 10 år. Teknologien forventes at forbedre sig yderligere til en hidtil uset niveau med moderne algoritmer og billedsegmenterings-teknikker. For nylig har Metas FAIR-laboratorium udgivet Segment Anything Model (SAM) – en game-changer i billedsegmentering. Denne avancerede model kan producere detaljerede objektmasker fra input-prompts, og tage computer vision til nye højder. Den kan potentielt revolutionere, hvordan vi interagerer med digital teknologi i denne æra.
Lad os udforske billedsegmentering og kort afsløre, hvordan SAM påvirker computer vision.
Hvad er Billedsegmentering & Hvad er dens Typer?
Billedsegmentering er en proces i computer vision, der opdeler et billede i multiple regioner eller segmenter, hver repræsenterende et forskelligt objekt eller område af billedet. Denne tilgang tillader eksperter at isolere bestemte dele af et billede for at opnå meningsfulde indsigt.
Billedsegmenteringsmodeller er trænet til at forbedre output ved at genkende vigtige billed detaljer og reducere kompleksitet. Disse algoritmer kan effektivt skelne mellem forskellige regioner af et billede baseret på funktioner som farve, tekstur, kontrast, skygger og kanter.
Ved at segmentere et billede kan vi fokusere vores analyse på de interessante regioner for indsigtsgivende detaljer. Herunder følger forskellige billedsegmenteringsteknikker.
- Semantisk segmentering indebærer at mærke pixels med semantiske klasser.
- Eksemplarsegmentering går videre ved at detektere og afgrænse hvert objekt i et billede.
- Panoptisk segmentering tildeler unikke eksemplar-ID’er til individuelle objektpixels, hvilket resulterer i en mere omfattende og kontekstuel mærkning af alle objekter i et billede.
Segmentering implementeres ved hjælp af billed-baserede dybe læringmodeller. Disse modeller henter alle værdifulde data punkter og funktioner fra træningssættet. Derefter omdanner de disse data til vektorer og matricer for at forstå komplekse funktioner. Nogle af de mest brugte dybe læringmodeller bag billedsegmentering er:
- Convolutional Neural Networks (CNNs)
- Fully Connected Networks (FCNs)
- Recurrent Neural Networks (RNNs)
Hvordan Fungerer Billedsegmentering?
I computer vision består de fleste billedsegmenteringsmodeller af en encoder-decoder-netværk. Encoderen encoderer en latent rum-repræsentation af inputdata, som decoderen decoderer for at danne segmentkort, eller med andre ord, kort som afgrænser hvert objekts placering i billedet.
Som regel består segmenteringsprocessen af 3 faser:
- En billedencoder, der transformerer inputbilledet til en matematisk model (vektorer og matricer) til behandling.
- Encoderen samler vektorerne på multiple niveauer.
- En hurtig maskedecoder tager billedindlejringerne som input og producerer en maske, der afgrænser forskellige objekter i billedet separat.
Tilstanden for Billedsegmentering
Fra 2014 så en bølge af dyb-læring-baserede segmenteringsalgoritmer op, såsom CNN+CRF og FCN, som gjorde betydelig fremskridt i feltet. 2015 så opkomsten af U-Net og Deconvolution Network, der forbedrede nøjagtigheden af segmenteringsresultaterne.
Derefter i 2016 forbedrede Instance Aware Segmentation, V-Net og RefineNet nøjagtigheden og hastigheden af segmentering. I 2017 introducerede Mark-RCNN og FC-DenseNet objektgenkendelse og tæt forudsigelse til segmenteringsopgaver.
I 2018 var Panoptisk Segmentering, Mask-Lab og Context Encoding Networks i centrum, da disse tilgange behandlede behovet for eksemplar-niveau segmentering. I 2019 introducerede Panoptic FPN, HRNet og Criss-Cross Attention nye tilgange til eksemplar-niveau segmentering.
I 2020 fortsatte trenden med introduktionen af Detecto RS, Panoptic DeepLab, PolarMask, CenterMask, DC-NAS og Efficient Net + NAS-FPN. Endelig i 2023 har vi SAM, som vi vil diskutere næste.
Segment Anything Model (SAM) – Generel Formål Billedsegmentering
Den Segment Anything Model (SAM) er en ny tilgang, der kan udføre interaktive og automatiske segmenteringsopgaver i en enkelt model. Tidligere tillod interaktiv segmentering segmentering af enhver objektklasse, men krævede, at en person guidede metoden ved at iterativt finjustere en maske.
Automatisk segmentering i SAM tillader segmentering af bestemte objekt-kategorier defineret på forhånd. Dens promotable interface gør den meget fleksibel. Derfor kan SAM håndtere en bred vifte af segmenteringsopgaver ved hjælp af en passende prompt, såsom klik, bokse, tekst og mere.
SAM er trænet på et divers og indsigtsgivende dataset på over 1 milliard masker, hvilket gør det muligt at genkende nye objekter og billeder, der ikke er tilgængelige i træningssættet. Denne moderne ramme vil revolutionere CV-modeller i anvendelser som selv kørende biler, sikkerhed og forstærket virkelighed.
SAM kan detektere og segmentere objekter omkring bilen i selv kørende biler, såsom andre køretøjer, fodgængere og trafikskilte. I forstærket virkelighed kan SAM segmentere den virkelige verden for at placere virtuelle objekter i passende placeringer, og skabe en mere realistisk og engagerende brugeroplevelse.
Billedsegmenterings Udfordringer i 2023
Den øgede forskning og udvikling i billedsegmentering medfører også betydelige udfordringer. Nogle af de fremmeste billedsegmenterings udfordringer i 2023 omfatter følgende:
- Den øgede kompleksitet af datasets, især for 3D-billedsegmentering
- Udviklingen af fortolkelige dybe modeller
- Brugen af uovervåede læringmodeller, der minimizerer menneskelig indgriben
- Behovet for realtids- og hukommelse-effektive modeller
- Elimineringen af flaskehalsene i 3D-punktskysegmentering
Fremtiden for Computer Vision
Den globale computer vision marked påvirker multiple industrier og forventes at nå over $41 milliarder i 2030. Moderne billedsegmenteringsteknikker som Segment Anything Model kombineret med andre dybe læringalgoritmer vil yderligere styrke computer visions fundament i det digitale landskab. Derfor vil vi se mere robuste computer vision-modeller og intelligente anvendelser i fremtiden.
Til at lære mere om AI og ML, udforsk Unite.ai – din eneste stoppested for alle spørgsmål om teknologi og dens moderne tilstand.













