AI-modeller och plattformar

DiffSeg : En fÃķrbÃĪttrad algoritm fÃķr ostrukturerad segmentering med hjÃĪlp av stabil diffusion

mm
LÃĪgg till Unite.AI bland dina fÃķredragna kÃĪllor pÃĨ Google

En av de stÃķrsta utmaningarna inom datormodeller baserade pÃĨ syn ÃĪr att generera hÃķgkvalitativa segmenteringsmasker. Nya framsteg inom storskalig Ãķvervakad utbildning har mÃķjliggjort ostrukturerad segmentering Ãķver olika bildstilar. Dessutom har ostrukturerad utbildning fÃķrenklat segmentering utan behov av omfattande annoteringar. Trots dessa framsteg kvarstÃĨr det som en komplex uppgift att konstruera en datormodell som kan segmentera allt i en ostrukturerad miljÃķ utan annoteringar. Semantisk segmentering, en grundlÃĪggande koncept inom datormodeller, innebÃĪr att dela upp en bild i mindre omrÃĨden med enhetliga semantik. Denna teknik ligger till grund fÃķr mÃĨnga nedstrÃķmsuppgifter, som medicinsk avbildning, bildredigering, autonom kÃķrning och mer.

FÃķr att frÃĪmja utvecklingen av datormodeller ÃĪr det viktigt att bildsegmentering inte begrÃĪnsas till en fast dataset med begrÃĪnsade kategorier. IstÃĪllet bÃķr den fungera som en flexibel grunduppgift fÃķr olika andra tillÃĪmpningar. Men den hÃķga kostnaden fÃķr att samla in etiketter pÃĨ en per-pixel-basis utgÃķr en betydande utmaning, vilket begrÃĪnsar framstegen inom ostrukturerad och Ãķvervakad segmentering som krÃĪver inga annoteringar och saknar tidigare tillgÃĨng till mÃĨlet. Den hÃĪr artikeln kommer att diskutera hur sjÃĪlvuppmÃĪrksamhetslager i stabil diffusionsmodell kan underlÃĪtta skapandet av en modell som kan segmentera alla indata i en ostrukturerad miljÃķ, ÃĪven utan korrekta annoteringar. Dessa sjÃĪlvuppmÃĪrksamhetslager fÃķrstÃĨr inneboende objektkoncept som lÃĪrs av en fÃķrutbildad stabil diffusionsmodell.

DiffSeg : En fÃķrbÃĪttrad algoritm fÃķr ostrukturerad segmentering

Semantisk segmentering ÃĪr en process som delar upp en bild i olika sektioner, dÃĪr varje sektion delar liknande semantik. Denna teknik utgÃķr grunden fÃķr mÃĨnga nedstrÃķmsuppgifter. Traditionellt har ostrukturerade datormodellsuppgifter varit beroende av Ãķvervakad semantisk segmentering, som anvÃĪnder stora dataset med annoterade och etiketterade kategorier. Men att implementera ostrukturerad semantisk segmentering i en ostrukturerad miljÃķ kvarstÃĨr som en utmaning. Medan traditionella Ãķvervakade metoder ÃĪr effektiva, ÃĪr deras per-pixel-etiketteringskostnad ofta fÃķrbjudande, vilket betonar behovet av att utveckla ostrukturerade segmenteringsmetoder i en mindre restriktiv ostrukturerad miljÃķ, dÃĪr modellen varken krÃĪver annoterade data eller tidigare kunskap om data.

FÃķr att ÃĨtgÃĪrda denna begrÃĪnsning introducerar DiffSeg en ny postprocesseringsstrategi, som utnyttjar stabil diffusionsramverkets fÃķrmÃĨga att bygga en generisk segmenteringsmodell som kan implementera ostrukturerad ÃķverfÃķring pÃĨ vilken bild som helst. Stabil diffusionsramverk har visat sig vara effektiva i att generera hÃķgupplÃķsta bilder baserat pÃĨ promptvillkor. FÃķr genererade bilder kan dessa ramverk producera segmenteringsmasker med hjÃĪlp av motsvarande textprompt, som vanligtvis endast innehÃĨller dominant fÃķremÃĨlsbakgrund.

I kontrast ÃĪr DiffSeg en innovativ postprocesseringsmetod som skapar segmenteringsmasker genom att anvÃĪnda uppmÃĪrksamhetstensorer frÃĨn sjÃĪlvuppmÃĪrksamhetslagren i en diffusionsmodell. DiffSeg-algoritmen bestÃĨr av tre huvudkomponenter: iterativ uppmÃĪrksamhetsfusion, uppmÃĪrksamhetsaggregering och icke-maximumundertryckning, som visas i fÃķljande bild.

DiffSeg-algoritmen bevarar visuell information Ãķver flera upplÃķsningar genom att aggregera 4D-uppmÃĪrksamhetstensorer med spatial konsistens och anvÃĪnda en iterativ fusionprocess genom att sampla ankarpunkter. Dessa ankarpunkter fungerar som startpunkten fÃķr att fusionera uppmÃĪrksamhetsmasker med samma objekthantering som absorberas slutligen. DiffSeg-ramverket kontrollerar fusionprocessen med hjÃĪlp av KL-avvikelsemetod fÃķr att mÃĪta likheten mellan tvÃĨ uppmÃĪrksamhetsmasker.

NÃĪr man jÃĪmfÃķr med klusterbaserade ostrukturerade segmenteringsmetoder behÃķver utvecklare inte ange antalet kluster i fÃķrvÃĪg i DiffSeg-algoritmen, och ÃĪven utan nÃĨgon tidigare kunskap kan DiffSeg-algoritmen producera segmentering utan att anvÃĪnda ytterligare resurser. Sammantaget ÃĪr DiffSeg-algoritmen “En ny ostrukturerad och ostrukturerad segmenteringsmetod som anvÃĪnder en fÃķrutbildad stabil diffusionsmodell och kan segmentera bilder utan nÃĨgra ytterligare resurser eller tidigare kunskap.

DiffSeg : GrundlÃĪggande koncept

DiffSeg ÃĪr en ny algoritm som bygger pÃĨ kunskaperna frÃĨn diffusionsmodeller, ostrukturerad segmentering och ostrukturerad segmentering.

Diffusionsmodeller

DiffSeg-algoritmen bygger pÃĨ kunskaperna frÃĨn fÃķrutbildade diffusionsmodeller. Diffusionsmodeller ÃĪr en av de mest populÃĪra generativa ramverken fÃķr datormodeller och lÃĪr sig den frÃĪmre och bakre diffusionsprocessen frÃĨn en sampad isotropisk gaussisk brusbild fÃķr att generera en bild. Stabil diffusionsmodell ÃĪr den mest populÃĪra varianten av diffusionsmodeller och anvÃĪnds fÃķr att utfÃķra en mÃĪngd olika uppgifter, inklusive Ãķvervakad segmentering, ostrukturerad klassificering, semantisk korrespondensmatchning, etikett-effektiv segmentering och ÃķppenvokabulÃĪr segmentering. Men det enda problemet med diffusionsmodeller ÃĪr att de fÃķrlitar sig pÃĨ hÃķgdimensionella visuella funktioner fÃķr att utfÃķra dessa uppgifter och ofta krÃĪver ytterligare utbildning fÃķr att fullt ut utnyttja dessa funktioner.

Ostrukturerad segmentering

DiffSeg-algoritmen ÃĪr nÃĪra relaterad till ostrukturerad segmentering, en modern AI-praxis som syftar till att generera tÃĪta segmenteringsmasker utan att anvÃĪnda nÃĨgra annoteringar. Men fÃķr att leverera goda prestationer behÃķver ostrukturerade segmenteringsmodeller nÃĨgon tidigare ostrukturerad utbildning pÃĨ mÃĨldatan. Ostrukturerad segmentering baserad pÃĨ AI-ramverk kan karakteriseras i tvÃĨ kategorier: kluster med fÃķrutbildade modeller och kluster baserat pÃĨ ofÃķrÃĪnderlighet. I den fÃķrsta kategorin anvÃĪnder ramverken de diskriminerande funktionerna som lÃĪrs av fÃķrutbildade modeller fÃķr att generera segmenteringsmasker, medan ramverk i den andra kategorin anvÃĪnder en generisk klusteralgoritm som optimerar den Ãķmsesidiga informationen mellan tvÃĨ bilder fÃķr att segmentera bilder i semantiska kluster och undvika degenererad segmentering.

Ostrukturerad segmentering

DiffSeg-algoritmen ÃĪr nÃĪra relaterad till ostrukturerade segmenteringsramverk, en metod som kan segmentera allt utan nÃĨgon tidigare utbildning eller kunskap om data. Ostrukturerade segmenteringsmodeller har visat sig ha exceptionella ostrukturerade ÃķverfÃķringsfÃķrmÃĨgor, men de krÃĪver nÃĨgon textinmatning och prompt. I kontrast anvÃĪnder DiffSeg-algoritmen en diffusionsmodell fÃķr att generera segmentering utan att frÃĨga och syntetisera flera bilder och utan att kÃĪnna till innehÃĨllet i objektet.

DiffSeg : Metod och arkitektur

DiffSeg-algoritmen anvÃĪnder sjÃĪlvuppmÃĪrksamhetslagren i en fÃķrutbildad stabil diffusionsmodell fÃķr att generera hÃķgkvalitativa segmenteringsuppgifter.

Stabil diffusionsmodell

Stabil diffusionsmodell ÃĪr en grundlÃĪggande koncept i DiffSeg-ramverket. Stabil diffusionsmodell ÃĪr ett generativt AI-ramverk och en av de mest populÃĪra diffusionsmodellerna. En av de viktigaste egenskaperna hos en diffusionsmodell ÃĪr en frÃĪmre och en bakre pass. I den frÃĪmre passen lÃĪggs en liten mÃĪngd gaussisk brus till en bild iterativt vid varje tidpunkt tills bilden blir en isotropisk gaussisk brusbild. I den bakre passen tar diffusionsmodellen iterativt bort bruset i den isotropiska gaussiska brusen fÃķr att ÃĨterstÃĪlla den ursprungliga bilden utan nÃĨgot gaussiskt brus.

Stabil diffusionsramverket anvÃĪnder en encoder-decoder och en U-Net-design med uppmÃĪrksamhetslager, dÃĪr den anvÃĪnder en encoder fÃķr att komprimera en bild till ett latentspace med mindre spatiala dimensioner och anvÃĪnder en decoder fÃķr att dekomprimera bilden. U-Net-arkitekturen bestÃĨr av en stapel modulÃĪra block, dÃĪr varje block bestÃĨr av antingen en Transformer-lager eller en ResNet-lager.

Komponenter och arkitektur

SjÃĪlvuppmÃĪrksamhetslager i diffusionsmodeller grupperar information om inneboende objekt i form av spatiala uppmÃĪrksamhetsmasker, och DiffSeg ÃĪr en ny postprocesseringsmetod fÃķr att fusionera uppmÃĪrksamhetstensorer till en giltig segmenteringsmask med pipelinen bestÃĨende av tre huvudkomponenter: uppmÃĪrksamhetsaggregering, icke-maximumundertryckning och iterativ uppmÃĪrksamhetsfusion.

UppmÃĪrksamhetsaggregering

FÃķr en inmatningsbild som passerar genom U-Net-lagren och encodern genererar den stabila diffusionsmodellen totalt 16 uppmÃĪrksamhetstensorer, med 5 tensorer fÃķr varje dimension. Det primÃĪra mÃĨlet med att generera 16 tensorer ÃĪr att aggregera dessa uppmÃĪrksamhetstensorer med olika upplÃķsningar till en tensor med den hÃķgsta mÃķjliga upplÃķsningen. FÃķr att uppnÃĨ detta behandlar DiffSeg-algoritmen de 4 dimensionerna olika frÃĨn varandra.

Av de fyra dimensionerna har de sista 2 dimensionerna i uppmÃĪrksamhetssensorerna olika upplÃķsningar men ÃĪr spatialt konsistenta, eftersom den 2D-spatiala kartan i DiffSeg-ramverket motsvarar korrelationen mellan platserna och de spatiala platserna. Resultatet ÃĪr att DiffSeg-ramverket sampar dessa tvÃĨ dimensioner av alla uppmÃĪrksamhetsmasker till den hÃķgsta upplÃķsningen av alla, 64 x 64. Å andra sidan anger de fÃķrsta 2 dimensionerna platsreferensen fÃķr uppmÃĪrksamhetsmaskerna, som visas i fÃķljande bild.

Eftersom dessa dimensioner refererar till platsen fÃķr uppmÃĪrksamhetsmaskerna mÃĨste uppmÃĪrksamhetsmaskerna aggregeras enligt detta. Dessutom, fÃķr att sÃĪkerstÃĪlla att den aggregerade uppmÃĪrksamhetsmasken har en giltig fÃķrdelning, normaliserar ramverket fÃķrdelningen efter aggregering, med varje uppmÃĪrksamhetsmask tilldelad en vikt proportionell till dess upplÃķsning.

Iterativ uppmÃĪrksamhetsfusion

Medan det primÃĪra mÃĨlet med uppmÃĪrksamhetsaggregering var att berÃĪkna en uppmÃĪrksamhetstensor, ÃĪr det primÃĪra mÃĨlet att fusionera uppmÃĪrksamhetsmaskerna i tensorn till en stapel objektfÃķrslag, dÃĪr varje enskilt fÃķrslag innehÃĨller antingen stuff-kategorin eller aktiveringen av ett enda objekt. Det fÃķreslagna lÃķsningen fÃķr att uppnÃĨ detta ÃĪr att implementera en K-Means-algoritm pÃĨ den giltiga fÃķrdelningen av tensorerna fÃķr att hitta klustren av objekten. Men att anvÃĪnda K-Means ÃĪr inte den optimala lÃķsningen, eftersom K-Means-klusterkrav anvÃĪndare att ange antalet kluster i fÃķrvÃĪg. Dessutom kan implementering av en K-Means-algoritm resultera i olika resultat fÃķr samma bild, eftersom den ÃĪr stokastiskt beroende av initialiseringen. FÃķr att Ãķvervinna hinder fÃķreslÃĨr DiffSeg-ramverket att generera en sampelgrid fÃķr att skapa fÃķrslagen genom att fusionera uppmÃĪrksamhetsmasker iterativt.

Icke-maximumundertryckning

Den tidigare steget av iterativ uppmÃĪrksamhetsfusion ger en lista med objektfÃķrslag i form av sannolikhets- eller uppmÃĪrksamhetsmasker, dÃĪr varje objektfÃķrslag innehÃĨller aktiveringen av objektet. Ramverket anvÃĪnder icke-maximumundertryckning fÃķr att konvertera listan med objektfÃķrslag till en giltig segmenteringsmask, och processen ÃĪr en effektiv approach, eftersom varje element i listan redan ÃĪr en karta av sannolikhetsfÃķrdelningen. FÃķr varje spatial plats Ãķver alla kartor tar algoritmen indexet av den stÃķrsta sannolikhetsvÃĪrdet och tilldelar en medlemskap baserat pÃĨ indexet av den motsvarande kartan.

DiffSeg : Experiment och resultat

Ramverk som arbetar med ostrukturerad segmentering anvÃĪnder tvÃĨ segmenteringsbenchmark, nÃĪmligen Cityscapes och COCO-stuff-27. Cityscapes-benchmarken ÃĪr en sjÃĪlvkÃķrande dataset med 27 medelnivÃĨkategorier, medan COCO-stuff-27-benchmarken ÃĪr en kuraterad version av den ursprungliga COCO-stuff-datan, som slÃĨr samman 80 ting och 91 kategorier i 27 kategorier. Dessutom, fÃķr att analysera segmenteringsprestationen, anvÃĪnder DiffSeg-ramverket medelintersection Ãķver union eller mIoU och pixelnoggrannhet eller ACC, och eftersom DiffSeg-algoritmen inte kan tillhandahÃĨlla en semantisk etikett, anvÃĪnder den Hungarian matching-algoritmen fÃķr att tilldela en grundtruth-mask till varje fÃķrutsagd mask. Om antalet fÃķrutsagda masker Ãķverstiger antalet grundtruth-masker, kommer ramverket att ta hÃĪnsyn till de omatchade fÃķrutsagda uppgifterna som falska negativ.

Dessutom betonar DiffSeg-ramverket ocksÃĨ fÃķljande tre arbeten fÃķr att kÃķra interferens: SprÃĨkberoende eller LD, ostrukturerad anpassning eller UA, och hjÃĪlpbild eller AX. SprÃĨkberoende innebÃĪr att metoden behÃķver beskrivande textinmatningar fÃķr att underlÃĪtta segmentering fÃķr bilden, ostrukturerad anpassning hÃĪnvisar till kravet fÃķr metoden att anvÃĪnda ostrukturerad utbildning pÃĨ mÃĨldatan, medan hjÃĪlpbild hÃĪnvisar till att metoden behÃķver ytterligare inmatning, antingen som syntetiska bilder eller som en pool av referensbilder.

Resultat

PÃĨ COCO-benchmarken innehÃĨller DiffSeg-ramverket tvÃĨ K-Means-baslinjer, K-Means-S och K-Means-C. K-Means-C-benchmarken innehÃĨller 6 kluster som berÃĪknas genom att genomsnitta antalet objekt i de bilder som utvÃĪrderas, medan K-Means-S-benchmarken anvÃĪnder ett specifikt antal kluster fÃķr varje bild baserat pÃĨ antalet objekt i grundtruthen av bilden, och resultaten pÃĨ bÃĨda dessa benchmark visas i fÃķljande bild.

Som det kan ses, ÃķvertrÃĪffar K-Means-baslinjen befintliga metoder, vilket visar fÃķrdelen med att anvÃĪnda sjÃĪlvuppmÃĪrksamhetstensorer. Vad som ÃĪr intressant ÃĪr att K-Means-S-benchmarken ÃķvertrÃĪffar K-Means-C-benchmarken, vilket indikerar att antalet kluster ÃĪr en grundlÃĪggande hyperparameter, och att justera den ÃĪr viktigt fÃķr varje bild. Dessutom, ÃĪven nÃĪr man fÃķrlitar sig pÃĨ samma uppmÃĪrksamhetstensorer, ÃķvertrÃĪffar DiffSeg-ramverket K-Means-baslinjerna, vilket visar DiffSeg-ramverkets fÃķrmÃĨga att inte bara tillhandahÃĨlla bÃĪttre segmentering, utan ocksÃĨ undvika de nackdelar som orsakas av att anvÃĪnda K-Means-baslinjer.

PÃĨ Cityscapes-datan levererar DiffSeg-ramverket resultat som liknar ramverken som anvÃĪnder inmatning med lÃĪgre 320-upplÃķsning, medan de ÃķvertrÃĪffar ramverken som tar hÃķgre 512-upplÃķsningsinmatningar Ãķver noggrannhet och mIoU.

Som nÃĪmnts tidigare, anvÃĪnder DiffSeg-ramverket flera hyperparametrar, som visas i fÃķljande bild.

UppmÃĪrksamhetsaggregering ÃĪr en av de grundlÃĪggande koncepten som anvÃĪnds i DiffSeg-ramverket, och effekterna av att anvÃĪnda olika aggregeringsvikt visas i fÃķljande bild, med bilden upplÃķsning konstant.

Som det kan observeras, ger hÃķgupplÃķsta kartor i Fig (b) med 64 x 64 kartor de mest detaljerade segmenteringarna, ÃĪven om segmenteringarna har nÃĨgra synliga sprickor, medan lÃĪgre upplÃķsningskartor tenderar att Ãķversegmentera detaljer, ÃĪven om de resulterar i fÃķrbÃĪttrade sammanhÃĪngande segmenteringar. I Fig (d) misslyckas lÃĨgupplÃķsningskartor med att generera nÃĨgon segmentering, eftersom hela bilden slÃĨs samman till ett enda objekt med befintliga hyperparametrar. Slutligen, Fig (a) som anvÃĪnder en proportionell aggregeringsstrategi resulterar i fÃķrbÃĪttrade detaljer och balanserad konsistens.

Slutliga tankar

Ostrukturerad ostrukturerad segmentering ÃĪr fortfarande en av de stÃķrsta utmaningarna fÃķr datormodeller, och befintliga modeller fÃķrlitar sig antingen pÃĨ icke-ostrukturerad ostrukturerad anpassning eller pÃĨ externa resurser. FÃķr att Ãķvervinna denna utmaning har vi diskuterat hur sjÃĪlvuppmÃĪrksamhetslager i stabil diffusionsmodell kan mÃķjliggÃķra konstruktionen av en modell som kan segmentera alla indata i en ostrukturerad miljÃķ utan korrekta annoteringar, eftersom dessa sjÃĪlvuppmÃĪrksamhetslager innehÃĨller de inneboende objektkoncepten som en fÃķrutbildad stabil diffusionsmodell lÃĪr sig. Vi har ocksÃĨ diskuterat DiffSeg, en ny postprocesseringsstrategi som syftar till att utnyttja potentialen i stabil diffusionsramverket fÃķr att konstruera en generisk segmenteringsmodell som kan implementera ostrukturerad ÃķverfÃķring pÃĨ vilken bild som helst. Algoritmen fÃķrlitar sig pÃĨ Inter-Attention Similarity och Intra-Attention Similarity fÃķr att fusionera uppmÃĪrksamhetsmasker iterativt till giltiga segmenteringsmasker fÃķr att uppnÃĨ toppprestationer pÃĨ populÃĪra benchmark.

En ingenjÃķr till yrket, en fÃķrfattare av hjÃĪrtat. Kunal ÃĪr en teknisk skribent med ett djupt kÃĪrlek och fÃķrstÃĨelse fÃķr AI och ML, dedikerad till att fÃķrenkla komplexa begrepp inom dessa omrÃĨden genom sin engagerande och informativa dokumentation.