AI-modeller og platforme

TinySAM : Effektiv Segment Anything Model

mm
Føj Unite.AI til dine foretrukne kilder på Google

Objektsegmentering er et grundlæggende og kritisk vigtigt område inden for moderne computer vision. Det spiller en vital rolle i applikationer, der kræver omfattende visuelle komponenter, såsom objektlokalisering og -identifikation, og kræver realtids-, hurtig og præcis segmentering. Denne vigtighed har gjort objektsegmentering til et konstant varmt forskningsemne, med betydelig arbejde udført i områder som instanssegmentering, semantisk segmentering og panoptisk segmentering.

Med udviklingen af objektsegmentering er Segment Anything Model (SAM) dukket op som et bemærkelsesværdigt værktøj, der viser fremragende segmenteringsfærdigheder og hurtigt er blevet adopteret i forskellige computer vision-applikationer. Rammer, der bruger en forudtrænet SAM-arkitektur, har opnået imponerende præstationer i downstream vision-opgaver. Men på trods af sine evner og høj nøjagtighed i segmenteringsopgaver, kræver SAM’s komplekse og tunge arkitektur betydelig beregningskraft, hvilket hindrer dens implementering på beregningsbegrænsede enheder.

For at løse SAM’s beregningsudfordringer har forskere udviklet den Tiny Segment Anything Model (TinySAM), der fastholder den zero-shot-præstation af den originale ramme, mens den er mere letvægts. TinySAM bruger en fuld-stadiums viden-destillationsmetode med online hard prompts til at skabe en mere effektiv elevmodel. Post-trænings-kvantificering tilpasset til promptable segmenteringsopgaver reducerer yderligere beregningsbehovene. Derudover sigter TinySAM’s design på hierarkisk segmentering, der næsten fordobler inferenshastigheden uden at påvirke præstationen.

Denne artikel dykker ned i TinySAM-rammen, hvor vi udforsker dens grundlæggende principper, arkitektur og præstation i forhold til andre state-of-the-art segmenteringsrammer. Lad os udforske disse aspekter i mere detalje.

TinySAM : Effektiv Segment Anything Model

Segment Anything Model har bidraget til den hurtige fremgang af flere computer vision-applikationer takket være dets prisværdige segmenteringsfærdigheder kombineret med en massiv segmenteringsdataset, der rummer over 11 millioner billeder og over en milliard billedmasker. Takket være dets exceptionelle præstation på opgaver, der segmenterer objekter med vilkårlige kategorier og former, fungerer det som grundlag for rammer, der udfører downstream-opgaver som billedindmalning, objektsporring, 3D-vision og mere. Derudover tilbyder Segment Anything Model også bemærkelsesværdig zero-shot-segmentering, der har nyttigt sensitive industrier, der arbejder med en begrænset mængde data, herunder medicinsk forskning og medicinsk billedbehandling.

Selv om man ikke kan bestride den bemærkelsesværdige segmenteringsfærdigheder, som Segment Anything Model tilbyder på en bred vifte af downstream vision-opgaver, har det sin downside i form af en kompleks arkitektonisk overbelastning, høje beregningskrav og betydelige driftsomkostninger. For et system, der kører på en moderne GPU, kan inferenstiden for en SAM-model være så høj som op til 2 sekunder for et 1024×1024-billede. Dette gør det meget svært at implementere SAM-applikationer på enheder med begrænsede beregningsressourcer. For at overvinde denne hindring har nyere arbejder som MobileSAM og FastSAM forsøgt at udvikle en SAM-model med mere beregnings-effektivitet. MobileSAM-rammen forsøger at erstatte den tunge komponent i billedkoderen med TinyViT-arkitekturen, mens FastSAM-modellen overfører segmentopgaven til en instanssegmenteringsopgave med kun én kategori med YoloV8-modellen. Selv om disse metoder opnåede en vis grad af succes i forhold til reduktion af beregningskravene, kunne de ikke fastholde præstationen, især på downstream zero-shot-opgaver.

TinySAM eller den Tiny Segment Anything Model er et forsøg på at reducere beregningskravene for den nuværende SAM-model uden at påvirke præstationen på zero-shot downstream-opgaver. Derudover foreslår TinySAM-rammen at implementere en fuld-stadiums viden-destillationsmetode i sin arkitektur med det formål at forbedre elevnetværkets evne. TinySAM-rammen destillerer elevnetværket på en slut til slut-måde under vejledning af lærer-netværket fra forskellige stadier. For at yderligere forbedre præstationen tillader rammen, at destillationsprocessen kan koncentrere sig mere om svære eksempler ved at implementere en ekstra online hard prompt-sampling-strategi. Derudover reducerer TinySAM-rammen yderligere beregningsomkostningerne ved at eksponere promptable segmenteringsopgaver for post-trænings-kvantificeringskomponenter.

Den største del af beregningskravene for en Segment Anything Model skyldes, at modellen genererer massive masker fra grid-punkter til at segmentere alt i billedet. For at overvinde beregningskravene for denne segmenteringsstrategi bruger TinySAM-rammen en hierarkisk segmenter-alt-strategi, der næsten fordobler inferenshastigheden uden at påvirke præstationen. Med disse metoder implementeret i sin arkitektur tilbyder TinySAM-rammen en betydelig reduktion i beregningskravene og sætter nye grænser for effektive segment-alt-opgaver.

TinySAM : Arkitektur og Metodologi

Før vi taler om TinySAM-rammens arkitektur og metodologi, er det vigtigt at først kaste et blik på dets forgænger, SAM-rammen. Siden dens introduktion har Segment Anything Model demonstreret bemærkelsesværdig præstation, fleksibilitet og generaliseringsfærdigheder på en bred vifte af downstream vision- og objektsegmenteringsopgaver.

I sin kerne består SAM-modellen af tre undernetværk: promptkoderen, billedkoderen og maskedekoderen. Promptkoderens primære formål er at kodificere vilkårligt formede masker, inputpunkter og -kasser samt fri tekst med positionsinformation. Billedkoderen er et tungt ViT- eller visionstransformatorbaseret netværk, der ekstraherer inputbilledet til indlejring. Modellen bruger forskellige netværk til at behandle geometriske og tekstprompter. Endelig indeholder maskedekoderen en to-vejs-transformator, der modtager outputtet fra prompt- og billedkoderen til at generere den endelige maskesprediction. Med datasset demonstrerer SAM-rammen bemærkelsesværdig højkvalitetssegmenteringsfærdigheder for objekter uanset deres form og kategori. Derudover demonstrerer Segment Anything Model bemærkelsesværdig præstation og effektivitet på zero-shot downstream vision-opgaver, herunder objektproposition, kantdetektion, tekst til maskesprediction og instanssegmentering. Takket være dets højkvalitetssegmenteringsfærdigheder og fleksible prompttilbud danner SAM-rammerne grundlaget for vision-applikationer. Med det sagt kan man ikke ignorere den høje beregningskrav for den traditionelle SAM-arkitektur med et stort antal parametre, der gør det næsten umuligt for udviklere at implementere SAM-baserede applikationer på enheder med begrænsede ressourcer.

Viden-Destillation

Viden-destillation er en vigtig tilgang til at forbedre præstationen af kompakte netværk under træningsfasen. Viden-destillationsmetoden, der bruger outputtet fra lærer-netværket til at vejlede træningen af det letvægts elevnetværk. Viden-destillationsmetoden kan deles i to underkategorier: destillation for mellemvariable funktioner og destillation for netværksoutput, med en majoritet af forskningsarbejde omkring viden-destillation fokuseret på billedklassificeringsopgaver.

Som nævnt tidligere demonstrerer følgende figur den generiske arkitektur af TinySAM-rammen sammen med præstationsoversigten på zero-shot instanssegmenteringsopgaver.

I første stadium implementerer TinySAM-rammen viden-destillation designet specifikt til SAM-rammen, og for at aktivere destillationsprocessen yderligere bruger modellen en online hard prompt-sampling til at udvinde hård viden til elevnetværket fra lærer-netværket. I andet stadium tilpasser TinySAM-rammen post-trænings-kvantificeringsmetoden til promptable segmenteringsopgaver og implementerer den på det letvægts elevnetværk. Endelig implementerer modellen en hierarkisk segmenter-alt-inferensmode designet til segmenteringsopgaver, der resulterer i en fordobling af inferenshastigheden med næsten ingen nøjagtigheds-tab.

Fuld-Stadiums Viden-Destillation

Som nævnt tidligere består Segment Anything Model af tre undernetværk i sin kerne: promptkoderen, billedkoderen og maskedekoderen, med billedkoderkomponenten bygget på en visionstransformator og havende høje beregningskrav. For at tackle dette problem implementerer TinySAM-rammen en fuld-stadiums viden-destillationsmetode, der vejleder det letvægts billedkoder fra læringsniveauet til det multiple viden-niveau. Ud over den konventionelle tab mellem ground-truth-mærker og de forudsagte resultater introducerer TinySAM-rammen flere destillations-tab under forskellige stadier, som vist i følgende figur.

Kvantificering

Model-kvantificering er en populær tilgang i computer vision-rammer og bruges til at komprimere modellen ved at kvantificere vægte eller aktiveringer fra højere til lavere båndbredde i et forsøg på at reducere beregningskompleksitet og lagringskrav uden at påvirke outputkvaliteten væsentligt.

Det primære formål med kvantificering i TinySAM er at projicere flydende punkt-tenoren til bit-integer-tenoren ved hjælp af en skalaerfaktor, hvor metoden for måling af afstanden mellem matrix-multiplication og den kvantificerede matrix spiller en vital rolle for optimering af skalaerfaktoren.

Hierarkisk Segment Alt

Segment Anything Model foreslår at bruge en automatisk maskgenerator, der sampler punkter som et grid til at segmentere alt i billedet. Det er dog blevet indikeret, at brugen af en tæt punktgrid resulterer i over-fine-grainede segmenteringsoutput og processen kræver massive beregningskrav og medfører høje driftsomkostninger. Derudover kan for mange sampelpunkter for et fuldt objekt resultere i, at forskellige sektioner af objektet bliver segmenteret forkert som separate masker, mens på den anden side er tidskostningen for alt-mode-inferens primært på grund af, at billedkoderen er blevet reduceret betydeligt. For at reducere driftsomkostningerne for alt-mode-inferens bruger TinySAM-rammen en hierarkisk maskgenereringsstrategi, hvor forskellen i strategien med den originale SAM-ramme demonstreres i følgende figur.

Forskelligt fra tilgangen implementeret i den originale SAM-ramme bruger TinySAM-modellen kun 25% punkter på hver side, og bruger dermed kun 1/16 af de tilgængelige punkter i den originale indstilling. Modellen inférerer derefter maskedekoderen og promptkoderen med disse prompts og får outputtet. Modellen filtrerer derefter nogle masker med en tillid, der overstiger en vis grænseværdi, og maskerer de korresponderende lokationer som områder for potentielle endelige forudsigelser. Da modellen behandler disse områder som segmenteringsresultatet af instanser med høj tillid, har den ingen behov for at generere punkt-prompts. Strategien hjælper ikke kun med at forhindre over-fine-grainede segmentering af objektet, men hjælper også med at reducere driftsomkostningerne og beregningskravene betydeligt. Rammen mergerer og efterbehandler derefter resultaterne fra disse to runder for at opnå de endelige masker.

TinySAM : Eksperimenter og Resultater

For at accelerere destillationsprocessen beregner og gemmer TinySAM-rammen billed-indlejring fra lærer-netværket på forhånd, hvilket gør det ikke nødvendigt for modellen at beregne den tunge billedkoder fra lærer-netværket gentagne gange under træningsfasen. For post-trænings-kvantificering kvantificerer TinySAM-rammen alle matrix-multiplicationslag, convolutionsslag, dekonvolutionslag og lineære lag, hvor modellen bruger kanal-vis skalaerfaktorer for både convolution og dekonvolutionslag. For matrix-multiplicationslag implementerer modellen hoved-vis skalaerfaktorer, mens for lineære lag implementerer modellen lineære skalaerfaktorer. Modellen udfører også evaluering på zero-shot downstream-opgaver.

For instanssegmenteringsopgaver i en zero-shot-indstilling følger TinySAM-rammen de eksperimentelle indstillinger for sin forgænger, Segment Anything Model, og bruger objekt-detektionsresultater fra Vision Transformer Det-H eller VitDet-H-rammen til instanssegmentering. Som demonstreret i følgende figur overgår TinySAM-rammen eksisterende metoder i forhold til instanssegmenteringsnøjagtighed og FLOPs-scoren.

Derudover demonstreres den kvalitative præstation af TinySAM-modellen i følgende figur for zero-shot instanssegmentering, hvor den grønne kasse repræsenterer box-prompts.

I forhold til zero-shot punkt-gyldig mask-evaluering overgår TinySAM-modellen MobileSAM-rammen betydeligt på forskellige datasæt og leverer væsentligt bedre resultater, når færre punkter bruges som prompts af rammen.

Derudover summerer følgende tabel resultaterne af accelerationen og reduktionen i beregningskrav, der opnås som følge af den hierarkiske alt-mode-strategi. Modellen anvender den samme stabilitets-score og grænseværdi med forskellige strategier for en fair sammenligning, og resultaterne summeres nedenfor.

Afsluttende Tanker

I denne artikel har vi talt om TinySAM, en foreslået ramme, der udvider grænserne for at segmentere enhver opgave, og opnår en effektiv modelarkitektur med færre beregningskrav og nøjagtighed på niveau med den originale SAM-ramme. TinySAM eller den Tiny Segment Anything Model, der fastholder og leverer zero-shot-præstationen af den originale ramme. TinySAM-rammen implementerer først en fuld-stadiums viden-destillationsmetode, der bruger online hard prompts til at destillere en letvægts elevmodel. TinySAM-rammen tilpasser derefter post-trænings-kvantificeringen til promptable segmenteringsopgaver, hvilket yderligere hjælper med at reducere beregningskravene. Derudover sigter rammen på at segmentere alt hierarkisk, hvilket næsten fordobler inferenshastigheden uden at påvirke præstationen.

En ingeniør af profession, en forfatter af hjerte. Kunal er en teknisk forfatter med en dyb kærlighed og forståelse af AI og ML, dedikeret til at forenkle komplekse koncepter inden for disse felter gennem sin engagerende og informative dokumentation.