AI-modeller og plattformer

DiffSeg : Usikker Zero-Shot Segmentering ved hjelp av Stabil Diffusjon

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

En av de største utfordringene i datamaskinbaserte modeller er å generere høykvalitets segmenteringsmasker. Nylige fremgang i stor skala overvåket trening har gjort det mulig å oppnå zero-shot segmentering på tvers av ulike bildestiler. I tillegg har usikker trening forenklet segmentering uten behov for omfattende annoteringer. Til tross for disse utviklingene, å konstruere en datamaskinbasert ramme som kan segmentere noe i en zero-shot innstilling uten annoteringer, er en kompleks oppgave. Semantisk segmentering, en grunnleggende konsept i datamaskinmodeller, innebærer å dele en bilde inn i mindre regioner med enhetlig semantikk. Denne teknikken legger grunnlaget for en rekke nedstrømsoppgaver, som medisinske bilder, bildebearbeiding, autonom kjøring og mer.

For å fremme utviklingen av datamaskinmodeller, er det avgjørende at bildesegmentering ikke er begrenset til en fast datasett med begrensede kategorier. I stedet bør den fungere som en fleksibel grunnleggende oppgave for en rekke andre anvendelser. Imidlertid presenterer den høye kostnaden ved å samle inn etiketter på en per-pixel basis en betydelig utfordring, som begrenser fremgangen for zero-shot og overvåket segmentering som ikke krever annoteringer og mangler forhåndskunnskap om målet. Denne artikkelen vil diskutere hvordan selv-oppmerksomhetslag i stabil diffusjonsmodell kan muliggjøre opprettelsen av en modell som kan segmentere noe innputt i en zero-shot innstilling, selv uten korrekte annoteringer. Disse selv-oppmerksomhetslagene forstår innebygde objektkonsepter lært av en forhåndstreent stabil diffusjonsmodell.

DiffSeg : En Forbedret Zero-Shot Segmenteringsalgoritme

Semantisk segmentering er en prosess som deler en bilde inn i ulike seksjoner, hvor hver seksjon deler lik semantikk. Denne teknikken danner grunnlaget for en rekke nedstrømsoppgaver. Tradisjonelt har zero-shot datamaskinoppgaver avhengig av overvåket semantisk segmentering, som bruker store datasett med annoterte og merkte kategorier. Imidlertid er det en utfordring å implementere usikker semantisk segmentering i en zero-shot innstilling. Mens tradisjonelle overvåkede metoder er effektive, er deres per-pixel merking kostnad ofte forbudende, og det høylinger behovet for å utvikle usikre segmenteringsmetoder i en mindre begrenset zero-shot innstilling, hvor modellen hverken krever annotert data eller forhåndskunnskap om data.

For å løse denne begrensningen, innfører DiffSeg en ny post-prosesseringstrategi, som utnytter mulighetene i Stabil Diffusjonsrammen for å bygge en generisk segmenteringsmodell som kan utføre zero-shot overføring på noen bilde. Stabil Diffusjonsrammer har vist sin effektivitet i å generere høyoppløselige bilder basert på promptbetingelser. For genererte bilder kan disse rammene produsere segmenteringsmasker ved hjelp av tilhørende tekstprompt, som vanligvis bare inkluderer dominante forgrunnsobjekter.

I motsetning til dette er DiffSeg en innovativ post-prosesseringmetode som oppretter segmenteringsmasker ved å bruke oppmerksomhetstensorer fra selv-oppmerksomhetslagene i en diffusjonsmodell. DiffSeg-algoritmen består av tre nøkkelkomponenter: iterativ oppmerksomhetsfusjon, oppmerksomhetsaggregasjon og ikke-maksimum undertrykkelse, som vist i følgende bilde.

DiffSeg-algoritmen bevarer visuell informasjon på tvers av multiple oppløsninger ved å aggregere 4D oppmerksomhetstensorene med romlig konsistens, og ved å bruke en iterativ fusjonsprosess ved å prøve ankrepunkter. Disse ankrene tjener som utgangspunktet for å fusjonere oppmerksomhetsmasker med samme objektanker som til slutt absorberes. DiffSeg-rammen kontrollerer fusjonsprosessen med hjelp av KL-divergensmetoden for å måle likheten mellom to oppmerksomhetsmasker.

Når sammenlignet med klasterbaserte usikre segmenteringsmetoder, trenger utviklere ikke å spesifisere antallet klaster på forhånd i DiffSeg-algoritmen, og selv uten noen forhåndskunnskap kan DiffSeg-algoritmen produsere segmentering uten å bruke ekstra ressurser. Overordnet sett er DiffSeg-algoritmen en ny usikker og zero-shot segmenteringsmetode som utnytter en forhåndstreent Stabil Diffusjonsmodell, og kan segmentere bilder uten noen ekstra ressurser eller forhåndskunnskap.

DiffSeg : Grunnleggende Konsepter

DiffSeg er en ny algoritme som bygger på læringen fra Diffusjonsmodeller, Usikker Segmentering og Zero-Shot Segmentering.

Diffusjonsmodeller

DiffSeg-algoritmen bygger på læringen fra forhåndstrede diffusjonsmodeller. Diffusjonsmodeller er en av de mest populære generative rammene for datamaskinmodeller, og den lærer den fremover- og bakover-diffusjonsprosessen fra en sampet isotropisk Gaussisk støybilide til å generere en bilde. Stabil Diffusjon er den mest populære varianten av diffusjonsmodeller, og den brukes til å utføre en rekke oppgaver, inkludert overvåket segmentering, zero-shot klassifisering, semantisk-korrespondanse-matching, merkelapp-efektiv segmentering og åpen-vokabular-segmentering. Imidlertid er det eneste problemet med diffusjonsmodeller at de avhenger av høydimensjonale visuelle egenskaper for å utføre disse oppgavene, og de ofte krever ekstra trening for å dra full nytte av disse egenskapene.

Usikker Segmentering

DiffSeg-algoritmen er nært beslektet med usikker segmentering, en moderne AI-praksis som har som mål å generere tette segmenteringsmasker uten å bruke noen annoteringer. Imidlertid trenger usikre segmenteringsmodeller noen forhåndskunnskap om måldatasettet for å levere god ytelse. Usikre segmenteringsbaserte rammeverk kan karakteriseres i to kategorier: klastering ved hjelp av forhåndstrede modeller, og klastering basert på invarians. I den første kategorien bruker rammeverkene diskriminerende egenskaper lært av forhåndstrede modeller for å generere segmenteringsmasker, mens rammeverk i den andre kategorien bruker en generisk klasteralgoritme som optimaliserer den gjensidige informasjonen mellom to bilder for å segmentere bilder i semantiske klaster og unngå degenerert segmentering.

Zero-Shot Segmentering

DiffSeg-algoritmen er nært beslektet med zero-shot segmenteringsrammeverk, en metode som kan segmentere noe uten noen forhåndstrening eller kunnskap om data. Zero-shot segmenteringsmodeller har demonstrert eksepsjonell zero-shot overføringskapasitet i nyere tid, selv om de krever noen tekstinput og prompt. I motsetning til dette bruker DiffSeg-algoritmen en diffusjonsmodell for å generere segmentering uten å spørre og syntetisere flere bilder og uten å kjenne innholdet av objektet.

DiffSeg : Metode og Arkitektur

DiffSeg-algoritmen bruker selv-oppmerksomhetslagene i en forhåndstrede stabil diffusjonsmodell for å generere høykvalitets segmenteringsoppgaver.

Stabil Diffusjonsmodell

Stabil Diffusjon er en av de grunnleggende konseptene i DiffSeg-rammen. Stabil Diffusjon er en generativ AI-ramme, og en av de mest populære diffusjonsmodellene. En av de viktigste egenskapene ved en diffusjonsmodell er en fremover- og en bakover-pass. I den fremover-passen legges en liten mengde Gaussisk støy til en bilde iterativt ved hver tidspunkt til bilde blir en isotropisk Gaussisk støybilide. På den andre siden, i den bakover-passen, fjerner diffusjonsmodellen iterativt støyen i den isotropiske Gaussisk støybilden for å gjenopprette den opprinnelige bilde uten noen Gaussisk støy.

Stabil Diffusjonsrammen bruker en encoder-decoder, og en U-Net-design med oppmerksomhetslag hvor den bruker en encoder for å først komprimere en bilde inn i en latent rom med mindre romlige dimensjoner, og bruker dekoderen for å dekomprimere bilde. U-Net-arkitekturen består av en stabel med modulære blokker, hvor hver blokk består av enten av følgende to komponenter: en Transformer-lag, og en ResNet-lag.

Komponenter og Arkitektur

Selv-oppmerksomhetslag i diffusjonsmodeller grupperer informasjon om innebygde objekter i form av romlige oppmerksomhetsmasker, og DiffSeg er en ny post-prosesseringmetode for å fusjonere oppmerksomhetstensorer inn i en gyldig segmenteringsmaske med pipeline bestående av tre hovedkomponenter: oppmerksomhetsaggregasjon, ikke-maksimum undertrykkelse og iterativ oppmerksomhetsfusjon.

Oppmerksomhetsaggregasjon

For en innputt-bilde som passerer gjennom U-Net-lagene og Encoderen, genererer Stabil Diffusjonsmodellen en totalt 16 oppmerksomhetstensorer, med 5 tensorer for hver av dimensjonene. Det primære målet med å generere 16 tensorer er å aggregere disse oppmerksomhetstensorene med ulike oppløsninger inn i en tensor med den høyeste mulige oppløsningen. For å oppnå dette, behandler DiffSeg-algoritmen de fire dimensjonene forskjellig fra hverandre.

Av de fire dimensjonene har de siste to dimensjonene i oppmerksomhetstensorerne ulike oppløsninger, men de er romlig konsistente siden den 2D romlige kartet i DiffSeg-rammen korresponderer med korrelasjonen mellom lokalitetene og de romlige lokalitetene. Resultatet er at DiffSeg-rammen sampler disse to dimensjonene av alle oppmerksomhetsmasker til den høyeste oppløsningen av alle, 64 x 64. På den andre siden, indikerer de første to dimensjonene lokalitetsreferansen til oppmerksomhetsmaskene, som vist i følgende bilde.

Siden disse dimensjonene refererer til lokaliteten til oppmerksomhetsmaskene, må oppmerksomhetsmaskene aggregere etter lokalitet. I tillegg, for å sikre at den aggregerte oppmerksomhetsmasken har en gyldig distribusjon, normaliserer rammeverket distribusjonen etter aggregasjon med hver oppmerksomhetsmaske tildeles en vekt proporsjonal til dens oppløsning.

Iterativ Oppmerksomhetsfusjon

Mens det primære målet med oppmerksomhetsaggregasjon var å beregne en oppmerksomhetstensor, er det primære målet å fusjonere oppmerksomhetsmaskene i tensoren til en stabel med objektforslag hvor hver enkelt forslag inneholder enten kategorien “stoff” eller aktiveringen av et enkelt objekt. Den foreslåtte løsningen for å oppnå dette er å implementere en K-Means-algoritme på den gyldige distribusjonen av tensorer for å finne klusterne av objekter. Imidlertid er å bruke K-Means ikke den optimale løsningen, siden K-Means-klastering krever at brukerne spesifiserer antallet klaster på forhånd. Videre kan implementering av en K-Means-algoritme resultere i ulike resultater for samme bilde, siden det er stokastisk avhengig av initialiseringen. For å overvinne denne hindringen, foreslår DiffSeg-rammen å generere en sampling-grid for å opprette forslag ved å fusjonere oppmerksomhetsmasker iterativt.

Ikke-Maksimum Undertrykkelse

Den foregående prosessen med iterativ oppmerksomhetsfusjon resulterer i en liste med objektforslag i form av sannsynlighets- eller oppmerksomhetsmasker hvor hver objektforslag inneholder aktiveringen av objektet. Rammeverket bruker ikke-maksimum undertrykkelse for å konvertere listen med objektforslag til en gyldig segmenteringsmaske, og prosessen er en effektiv tilnærming siden hver element i listen allerede er en kart over sannsynlighetsfordelingen. For hver romlig lokalitet over alle kart, tar algoritmen indeksen til den største sannsynligheten og tildeles medlemskap basert på indeksen til den tilhørende masken.

DiffSeg : Eksperimenter og Resultater

Rammeverk som arbeider med usikker segmentering bruker to segmenteringsbenchmark, nemlig Cityscapes og COCO-stuff-27. Cityscapes-benchmark er en selv-kjørende datasett med 27 midtnivå-kategorier, mens COCO-stuff-27-benchmark er en kurert versjon av den opprinnelige COCO-stuff-datasettet som slår sammen 80 ting og 91 kategorier i 27 kategorier. Videre, for å analysere segmenteringsytelsen, bruker DiffSeg-rammen gjennomsnittlig intersection over union eller mIoU og pikselnøyaktighet eller ACC, og siden DiffSeg-algoritmen ikke kan tilby en semantisk etikett, bruker den den ungarske matchingsalgoritmen for å tildele en grunntruth-maske med hver forutsagt maske. Hvis antallet forutsagte masker overstiger antallet grunntruth-masker, vil rammeverket ta i betraktning de umatchede forutsagte oppgavene som falske negativ.

I tillegg legger DiffSeg-rammen vekt på følgende tre arbeider for å kjøre interferens: Språkavhengighet eller LD, Usikker Tilpasning eller UA, og Hjelpebildefunksjon eller AX. Språkavhengighet betyr at metoden trenger beskrivende tekstinput for å fasilitere segmentering for bildet, Usikker Tilpasning refererer til kravet for metoden til å bruke usikker trening på måldatasettet, mens Hjelpebildefunksjon betyr at metoden trenger ekstra input enten som syntetiske bilder eller som en samling referansebilder.

Resultater

På COCO-benchmark inkluderer DiffSeg-rammen to K-Means-basliner, K-Means-S og K-Means-C. K-Means-C-benchmark inkluderer 6 klaster som er beregnet ved å gjennomsnittle antallet objekter i bildene det vurderer, mens K-Means-S-benchmark bruker et bestemt antall klaster for hver bilde basert på antallet objekter i grunntruthen til bildet, og resultater på begge disse benchmarkene er vist i følgende bilde.

Som det kan sees, overstiger K-Means-baslinjen eksisterende metoder, og demonstrerer fordelen med å bruke selv-oppmerksomhetstensorer. Det som er interessant er at K-Means-S-benchmark overstiger K-Means-C-benchmark, og indikerer at antallet klaster er en grunnleggende hyperparameter, og finjustering av den er viktig for hver bilde. Videre, selv når man bruker samme oppmerksomhetstensorer, overstiger DiffSeg-rammen K-Means-baslinjene, og beviser evnen til DiffSeg-rammen til ikke bare å levere bedre segmentering, men også å unngå ulemper forbundet med å bruke K-Means-basliner.

På Cityscapes-datasettet levere DiffSeg-rammen resultater som er lignende med rammeverk som bruker innputt med lavere 320-oppløsning, mens den overstiger rammeverk som tar høyere 512-oppløsning innputt over nøyaktighet og mIoU.

Som nevnt tidligere, bruker DiffSeg-rammen flere hyperparametere, som vist i følgende bilde.

Oppmerksomhetsaggregasjon er en av de grunnleggende konseptene i DiffSeg-rammen, og effekten av å bruke ulike aggregasjonsvektorer er vist i følgende bilde med konstant oppløsning.

Som det kan observeres, resulterer høyoppløselige kart i Fig (b) med 64 x 64 kart i de mest detaljerte segmenteringer, selv om segmenteringene har noen synlige brudd. Lavere oppløsning 32 x 32 kart tenderer til å over-segmentere detaljer, selv om det resulterer i forbedret kohesjon. I Fig (d) mislykkes lavoppløselige kart i å generere noen segmentering, siden hele bildet slås sammen til et enkelt objekt med eksisterende hyperparameter-innstillinger. Til slutt resulterer Fig (a) som bruker en proporsjonal aggregasjonsstrategi i forbedret detaljer og balansert konsistens.

Slutt tanker

Zero-shot usikker segmentering er fortsatt en av de største hindringene for datamaskinbaserte modeller, og eksisterende modeller avhenger enten av ikke zero-shot usikker tilpasning eller eksterne ressurser. For å overvinne denne hindringen, har vi diskutert hvordan selv-oppmerksomhetslag i stabil diffusjonsmodeller kan muliggjøre opprettelsen av en modell som kan segmentere noen innputt i en zero-shot innstilling uten korrekte annoteringer, siden disse selv-oppmerksomhetslagene inneholder de innebygde konseptene til objektet som en forhåndstrede stabil diffusjonsmodell lærer. Vi har også diskutert DiffSeg, en ny post-prosesseringstrategi, som har som mål å utnytte mulighetene i Stabil Diffusjonsrammen for å bygge en generisk segmenteringsmodell som kan utføre zero-shot overføring på noen bilde. Algoritmen avhenger av Inter-Attention Likhet og Intra-Attention Likhet for å fusjonere oppmerksomhetsmasker iterativt inn i gyldige segmenteringsmasker for å oppnå statisk kunstnerisk ytelse på populære benchmark.

Kunal Kejriwal er en backend‑ingeniør som spesialiserer seg på Python, PostgreSQL, Redis og skyinfrastruktur på GCP og AWS. Med tre års erfaring med å bygge og skalere produksjonssystemer skriver han om AI‑infrastruktur, distribuerte systemer og arkitekturen bak utrulling av maskinlæringsarbeidsbelastninger.