AI-modeller och plattformar
DiffSeg : En förbättrad algoritm för ostrukturerad segmentering med hjälp av stabil diffusion
En av de största utmaningarna inom datormodeller baserade på syn är att generera högkvalitativa segmenteringsmasker. Nya framsteg inom storskalig övervakad utbildning har möjliggjort ostrukturerad segmentering över olika bildstilar. Dessutom har ostrukturerad utbildning förenklat segmentering utan behov av omfattande annoteringar. Trots dessa framsteg kvarstår det som en komplex uppgift att konstruera en datormodell som kan segmentera allt i en ostrukturerad miljö utan annoteringar. Semantisk segmentering, en grundläggande koncept inom datormodeller, innebär att dela upp en bild i mindre områden med enhetliga semantik. Denna teknik ligger till grund för många nedströmsuppgifter, som medicinsk avbildning, bildredigering, autonom körning och mer.
För att främja utvecklingen av datormodeller är det viktigt att bildsegmentering inte begränsas till en fast dataset med begränsade kategorier. Istället bör den fungera som en flexibel grunduppgift för olika andra tillämpningar. Men den höga kostnaden för att samla in etiketter på en per-pixel-basis utgör en betydande utmaning, vilket begränsar framstegen inom ostrukturerad och övervakad segmentering som kräver inga annoteringar och saknar tidigare tillgång till målet. Den här artikeln kommer att diskutera hur självuppmärksamhetslager i stabil diffusionsmodell kan underlätta skapandet av en modell som kan segmentera alla indata i en ostrukturerad miljö, även utan korrekta annoteringar. Dessa självuppmärksamhetslager förstår inneboende objektkoncept som lärs av en förutbildad stabil diffusionsmodell.
DiffSeg : En förbättrad algoritm för ostrukturerad segmentering
Semantisk segmentering är en process som delar upp en bild i olika sektioner, där varje sektion delar liknande semantik. Denna teknik utgör grunden för många nedströmsuppgifter. Traditionellt har ostrukturerade datormodellsuppgifter varit beroende av övervakad semantisk segmentering, som använder stora dataset med annoterade och etiketterade kategorier. Men att implementera ostrukturerad semantisk segmentering i en ostrukturerad miljö kvarstår som en utmaning. Medan traditionella övervakade metoder är effektiva, är deras per-pixel-etiketteringskostnad ofta förbjudande, vilket betonar behovet av att utveckla ostrukturerade segmenteringsmetoder i en mindre restriktiv ostrukturerad miljö, där modellen varken kräver annoterade data eller tidigare kunskap om data.
För att åtgärda denna begränsning introducerar DiffSeg en ny postprocesseringsstrategi, som utnyttjar stabil diffusionsramverkets förmåga att bygga en generisk segmenteringsmodell som kan implementera ostrukturerad överföring på vilken bild som helst. Stabil diffusionsramverk har visat sig vara effektiva i att generera högupplösta bilder baserat på promptvillkor. För genererade bilder kan dessa ramverk producera segmenteringsmasker med hjälp av motsvarande textprompt, som vanligtvis endast innehåller dominant föremålsbakgrund.
I kontrast är DiffSeg en innovativ postprocesseringsmetod som skapar segmenteringsmasker genom att använda uppmärksamhetstensorer från självuppmärksamhetslagren i en diffusionsmodell. DiffSeg-algoritmen består av tre huvudkomponenter: iterativ uppmärksamhetsfusion, uppmärksamhetsaggregering och icke-maximumundertryckning, som visas i följande bild.

DiffSeg-algoritmen bevarar visuell information över flera upplösningar genom att aggregera 4D-uppmärksamhetstensorer med spatial konsistens och använda en iterativ fusionprocess genom att sampla ankarpunkter. Dessa ankarpunkter fungerar som startpunkten för att fusionera uppmärksamhetsmasker med samma objekthantering som absorberas slutligen. DiffSeg-ramverket kontrollerar fusionprocessen med hjälp av KL-avvikelsemetod för att mäta likheten mellan två uppmärksamhetsmasker.
När man jämför med klusterbaserade ostrukturerade segmenteringsmetoder behöver utvecklare inte ange antalet kluster i förväg i DiffSeg-algoritmen, och även utan någon tidigare kunskap kan DiffSeg-algoritmen producera segmentering utan att använda ytterligare resurser. Sammantaget är DiffSeg-algoritmen “En ny ostrukturerad och ostrukturerad segmenteringsmetod som använder en förutbildad stabil diffusionsmodell och kan segmentera bilder utan några ytterligare resurser eller tidigare kunskap.
DiffSeg : Grundläggande koncept
DiffSeg är en ny algoritm som bygger på kunskaperna från diffusionsmodeller, ostrukturerad segmentering och ostrukturerad segmentering.
Diffusionsmodeller
DiffSeg-algoritmen bygger på kunskaperna från förutbildade diffusionsmodeller. Diffusionsmodeller är en av de mest populära generativa ramverken för datormodeller och lär sig den främre och bakre diffusionsprocessen från en sampad isotropisk gaussisk brusbild för att generera en bild. Stabil diffusionsmodell är den mest populära varianten av diffusionsmodeller och används för att utföra en mängd olika uppgifter, inklusive övervakad segmentering, ostrukturerad klassificering, semantisk korrespondensmatchning, etikett-effektiv segmentering och öppenvokabulär segmentering. Men det enda problemet med diffusionsmodeller är att de förlitar sig på högdimensionella visuella funktioner för att utföra dessa uppgifter och ofta kräver ytterligare utbildning för att fullt ut utnyttja dessa funktioner.
Ostrukturerad segmentering
DiffSeg-algoritmen är nära relaterad till ostrukturerad segmentering, en modern AI-praxis som syftar till att generera täta segmenteringsmasker utan att använda några annoteringar. Men för att leverera goda prestationer behöver ostrukturerade segmenteringsmodeller någon tidigare ostrukturerad utbildning på måldatan. Ostrukturerad segmentering baserad på AI-ramverk kan karakteriseras i två kategorier: kluster med förutbildade modeller och kluster baserat på oföränderlighet. I den första kategorin använder ramverken de diskriminerande funktionerna som lärs av förutbildade modeller för att generera segmenteringsmasker, medan ramverk i den andra kategorin använder en generisk klusteralgoritm som optimerar den ömsesidiga informationen mellan två bilder för att segmentera bilder i semantiska kluster och undvika degenererad segmentering.
Ostrukturerad segmentering
DiffSeg-algoritmen är nära relaterad till ostrukturerade segmenteringsramverk, en metod som kan segmentera allt utan någon tidigare utbildning eller kunskap om data. Ostrukturerade segmenteringsmodeller har visat sig ha exceptionella ostrukturerade överföringsförmågor, men de kräver någon textinmatning och prompt. I kontrast använder DiffSeg-algoritmen en diffusionsmodell för att generera segmentering utan att fråga och syntetisera flera bilder och utan att känna till innehållet i objektet.
DiffSeg : Metod och arkitektur
DiffSeg-algoritmen använder självuppmärksamhetslagren i en förutbildad stabil diffusionsmodell för att generera högkvalitativa segmenteringsuppgifter.
Stabil diffusionsmodell
Stabil diffusionsmodell är en grundläggande koncept i DiffSeg-ramverket. Stabil diffusionsmodell är ett generativt AI-ramverk och en av de mest populära diffusionsmodellerna. En av de viktigaste egenskaperna hos en diffusionsmodell är en främre och en bakre pass. I den främre passen läggs en liten mängd gaussisk brus till en bild iterativt vid varje tidpunkt tills bilden blir en isotropisk gaussisk brusbild. I den bakre passen tar diffusionsmodellen iterativt bort bruset i den isotropiska gaussiska brusen för att återställa den ursprungliga bilden utan något gaussiskt brus.
Stabil diffusionsramverket använder en encoder-decoder och en U-Net-design med uppmärksamhetslager, där den använder en encoder för att komprimera en bild till ett latentspace med mindre spatiala dimensioner och använder en decoder för att dekomprimera bilden. U-Net-arkitekturen består av en stapel modulära block, där varje block består av antingen en Transformer-lager eller en ResNet-lager.
Komponenter och arkitektur
Självuppmärksamhetslager i diffusionsmodeller grupperar information om inneboende objekt i form av spatiala uppmärksamhetsmasker, och DiffSeg är en ny postprocesseringsmetod för att fusionera uppmärksamhetstensorer till en giltig segmenteringsmask med pipelinen bestående av tre huvudkomponenter: uppmärksamhetsaggregering, icke-maximumundertryckning och iterativ uppmärksamhetsfusion.
Uppmärksamhetsaggregering
För en inmatningsbild som passerar genom U-Net-lagren och encodern genererar den stabila diffusionsmodellen totalt 16 uppmärksamhetstensorer, med 5 tensorer för varje dimension. Det primära målet med att generera 16 tensorer är att aggregera dessa uppmärksamhetstensorer med olika upplösningar till en tensor med den högsta möjliga upplösningen. För att uppnå detta behandlar DiffSeg-algoritmen de 4 dimensionerna olika från varandra.
Av de fyra dimensionerna har de sista 2 dimensionerna i uppmärksamhetssensorerna olika upplösningar men är spatialt konsistenta, eftersom den 2D-spatiala kartan i DiffSeg-ramverket motsvarar korrelationen mellan platserna och de spatiala platserna. Resultatet är att DiffSeg-ramverket sampar dessa två dimensioner av alla uppmärksamhetsmasker till den högsta upplösningen av alla, 64 x 64. Å andra sidan anger de första 2 dimensionerna platsreferensen för uppmärksamhetsmaskerna, som visas i följande bild.

Eftersom dessa dimensioner refererar till platsen för uppmärksamhetsmaskerna måste uppmärksamhetsmaskerna aggregeras enligt detta. Dessutom, för att säkerställa att den aggregerade uppmärksamhetsmasken har en giltig fördelning, normaliserar ramverket fördelningen efter aggregering, med varje uppmärksamhetsmask tilldelad en vikt proportionell till dess upplösning.
Iterativ uppmärksamhetsfusion
Medan det primära målet med uppmärksamhetsaggregering var att beräkna en uppmärksamhetstensor, är det primära målet att fusionera uppmärksamhetsmaskerna i tensorn till en stapel objektförslag, där varje enskilt förslag innehåller antingen stuff-kategorin eller aktiveringen av ett enda objekt. Det föreslagna lösningen för att uppnå detta är att implementera en K-Means-algoritm på den giltiga fördelningen av tensorerna för att hitta klustren av objekten. Men att använda K-Means är inte den optimala lösningen, eftersom K-Means-klusterkrav användare att ange antalet kluster i förväg. Dessutom kan implementering av en K-Means-algoritm resultera i olika resultat för samma bild, eftersom den är stokastiskt beroende av initialiseringen. För att övervinna hinder föreslår DiffSeg-ramverket att generera en sampelgrid för att skapa förslagen genom att fusionera uppmärksamhetsmasker iterativt.
Icke-maximumundertryckning
Den tidigare steget av iterativ uppmärksamhetsfusion ger en lista med objektförslag i form av sannolikhets- eller uppmärksamhetsmasker, där varje objektförslag innehåller aktiveringen av objektet. Ramverket använder icke-maximumundertryckning för att konvertera listan med objektförslag till en giltig segmenteringsmask, och processen är en effektiv approach, eftersom varje element i listan redan är en karta av sannolikhetsfördelningen. För varje spatial plats över alla kartor tar algoritmen indexet av den största sannolikhetsvärdet och tilldelar en medlemskap baserat på indexet av den motsvarande kartan.
DiffSeg : Experiment och resultat
Ramverk som arbetar med ostrukturerad segmentering använder två segmenteringsbenchmark, nämligen Cityscapes och COCO-stuff-27. Cityscapes-benchmarken är en självkörande dataset med 27 medelnivåkategorier, medan COCO-stuff-27-benchmarken är en kuraterad version av den ursprungliga COCO-stuff-datan, som slår samman 80 ting och 91 kategorier i 27 kategorier. Dessutom, för att analysera segmenteringsprestationen, använder DiffSeg-ramverket medelintersection över union eller mIoU och pixelnoggrannhet eller ACC, och eftersom DiffSeg-algoritmen inte kan tillhandahålla en semantisk etikett, använder den Hungarian matching-algoritmen för att tilldela en grundtruth-mask till varje förutsagd mask. Om antalet förutsagda masker överstiger antalet grundtruth-masker, kommer ramverket att ta hänsyn till de omatchade förutsagda uppgifterna som falska negativ.
Dessutom betonar DiffSeg-ramverket också följande tre arbeten för att köra interferens: Språkberoende eller LD, ostrukturerad anpassning eller UA, och hjälpbild eller AX. Språkberoende innebär att metoden behöver beskrivande textinmatningar för att underlätta segmentering för bilden, ostrukturerad anpassning hänvisar till kravet för metoden att använda ostrukturerad utbildning på måldatan, medan hjälpbild hänvisar till att metoden behöver ytterligare inmatning, antingen som syntetiska bilder eller som en pool av referensbilder.
Resultat
På COCO-benchmarken innehåller DiffSeg-ramverket två K-Means-baslinjer, K-Means-S och K-Means-C. K-Means-C-benchmarken innehåller 6 kluster som beräknas genom att genomsnitta antalet objekt i de bilder som utvärderas, medan K-Means-S-benchmarken använder ett specifikt antal kluster för varje bild baserat på antalet objekt i grundtruthen av bilden, och resultaten på båda dessa benchmark visas i följande bild.

Som det kan ses, överträffar K-Means-baslinjen befintliga metoder, vilket visar fördelen med att använda självuppmärksamhetstensorer. Vad som är intressant är att K-Means-S-benchmarken överträffar K-Means-C-benchmarken, vilket indikerar att antalet kluster är en grundläggande hyperparameter, och att justera den är viktigt för varje bild. Dessutom, även när man förlitar sig på samma uppmärksamhetstensorer, överträffar DiffSeg-ramverket K-Means-baslinjerna, vilket visar DiffSeg-ramverkets förmåga att inte bara tillhandahålla bättre segmentering, utan också undvika de nackdelar som orsakas av att använda K-Means-baslinjer.
På Cityscapes-datan levererar DiffSeg-ramverket resultat som liknar ramverken som använder inmatning med lägre 320-upplösning, medan de överträffar ramverken som tar högre 512-upplösningsinmatningar över noggrannhet och mIoU.

Som nämnts tidigare, använder DiffSeg-ramverket flera hyperparametrar, som visas i följande bild.

Uppmärksamhetsaggregering är en av de grundläggande koncepten som används i DiffSeg-ramverket, och effekterna av att använda olika aggregeringsvikt visas i följande bild, med bilden upplösning konstant.

Som det kan observeras, ger högupplösta kartor i Fig (b) med 64 x 64 kartor de mest detaljerade segmenteringarna, även om segmenteringarna har några synliga sprickor, medan lägre upplösningskartor tenderar att översegmentera detaljer, även om de resulterar i förbättrade sammanhängande segmenteringar. I Fig (d) misslyckas lågupplösningskartor med att generera någon segmentering, eftersom hela bilden slås samman till ett enda objekt med befintliga hyperparametrar. Slutligen, Fig (a) som använder en proportionell aggregeringsstrategi resulterar i förbättrade detaljer och balanserad konsistens.
Slutliga tankar
Ostrukturerad ostrukturerad segmentering är fortfarande en av de största utmaningarna för datormodeller, och befintliga modeller förlitar sig antingen på icke-ostrukturerad ostrukturerad anpassning eller på externa resurser. För att övervinna denna utmaning har vi diskuterat hur självuppmärksamhetslager i stabil diffusionsmodell kan möjliggöra konstruktionen av en modell som kan segmentera alla indata i en ostrukturerad miljö utan korrekta annoteringar, eftersom dessa självuppmärksamhetslager innehåller de inneboende objektkoncepten som en förutbildad stabil diffusionsmodell lär sig. Vi har också diskuterat DiffSeg, en ny postprocesseringsstrategi som syftar till att utnyttja potentialen i stabil diffusionsramverket för att konstruera en generisk segmenteringsmodell som kan implementera ostrukturerad överföring på vilken bild som helst. Algoritmen förlitar sig på Inter-Attention Similarity och Intra-Attention Similarity för att fusionera uppmärksamhetsmasker iterativt till giltiga segmenteringsmasker för att uppnå toppprestationer på populära benchmark.












