Andersons vinkel
Opprettelse av et Tilpasset Generativt Adversarial Network med Skisser

Forskere fra Carnegie Mellon og MIT har utviklet en ny metode som gjør det mulig for en bruker å opprette et tilpasset Generative Adversarial Network (GAN) bilde-oppsettssystemer bare ved å tegne indikative skisser.
Et system av denne typen kunne tillate en sluttbruker å opprette bilde-genereringsystemer som kan generere svært spesifikke bilder, som for eksempel bestemte dyr, bygningstyper – og selv enkeltpersoner. For tiden produserer de fleste GAN-genereringssystemer brede og ganske tilfeldige utdata, med begrensede muligheter til å spesifisere bestemte egenskaper, som for eksempel dyrearter, hårtyper hos mennesker, arkitekturstiler eller faktiske ansiktsidentiteter.
Tilnærmingen, som er beskrevet i artikkelen Sketch Your Own GAN, bruker en ny skissegrensesnitt som en effektiv ‘søkefunksjon’ for å finne funksjoner og klasser i ellers overfylte bildebaser som kan inneholde tusenvis av objekter, inkludert mange underkategorier som ikke er relevante for brukerens intensjoner. GAN-en blir deretter trent på denne filterte undermengden av bilder.
Ved å tegne det spesifikke objekttypen som brukeren ønsker å kalibrere GAN-en med, blir rammeverkets generative evner spesialisert til denne klassen. For eksempel, hvis en bruker ønsker å opprette et rammeverk som genererer en bestemt type katt (i stedet for bare en hvilken som helst katt, som kan fås med This Cat Does Not Exist), tjener deres innskannede skisser som en filter for å utelukke ikke-relevante klasser av katter.

Kilde: https://peterwang512.github.io/GANSketching/
Forskningen ledes av Sheng Yu-Wang fra Carnegie Mellon University, sammen med kollega Jun-Yan Zhu, og David Bau fra MIT’s Computer Science & Artificial Intelligence Laboratory.
Metoden selv kalles ‘GAN-skiss’, og bruker innskannede skisser for å direkte endre vekter i en ‘mal’ GAN-modell for å spesifikt målrette den identifiserte domenet eller underdomenet gjennom cross-domain adversarial loss.
Forskjellige regulariseringsmetoder ble utforsket for å sikre at modellens utdata er variert, samtidig som den opprettholder en høy bildekvalitet. Forskerne opprettet eksempelapplikasjoner som kan interpolere latent rom og utføre bilde-redigeringsprosedyrer.
Dette [$class] Finnes Ikke
GAN-basert bilde-genereringssystemer har blitt en fad, hvis ikke en meme, de siste årene, med en proliferasjon av prosjekter som kan generere bilder av ikke-eksisterende ting, inkludert mennesker, leieboliger, snacks, føtter, hester, politikere og insekter, blant mange andre.
GAN-basert bilde-syntese-systemer opprettes ved å samle eller kuratere omfattende datasett som inneholder bilder fra måldomenet, som for eksempel ansikter eller hester; trene modeller som generaliserer en rekke funksjoner over bildene i databasen; og implementere generator-moduler som kan utgive tilfeldige eksempler basert på de lært funksjonene.

Utdata fra skisser i DeepFacePencil, som lar brukere opprette fotorealistiske ansikter fra skisser. Mange lignende skisse-til-bilde-prosjekter eksisterer. Kilde: https://arxiv.org/pdf/2008.13343.pdf
Høydimensjonale funksjoner er blant de første som blir konkretisert under treningprosessen, og er ekvivalent med en malers første brede penselstrøk på en canvas. Disse høydimensjonale egenskapene vil til slutt korrelere med mye mer detaljerte funksjoner (dvs. øyeglint og skarpe vibrer på en katt, i stedet for bare en generisk beige klump som representerer hodet).
Jeg Vet Hva Du Mener…
Ved å kartlegge forholdet mellom disse tidlige seminale formene og de endelige detaljerte tolkningene som oppnås mye senere i treningprosessen, er det mulig å slutte seg til forhold mellom ‘vage’ og ‘spesifikke’ bilder, og lar brukere opprette komplekse og fotorealistiske bilder fra grove skisser.
Nylig lanserte NVIDIA en skrivebordsversjon av sin langvarige GauGAN-forskning innen GAN-basert landskaps-generering, som lett demonstrerer dette prinsippet:

Omtrentlige skisser blir oversatt til rike sceniske bilder gjennom NVIDIA’s GauGAN, og nå NVIDIA Canvas-applikasjonen. Kilde: https://rossdawson.com/futurist/implications-of-ai/future-of-ai-image-synthesis/
Liksom, flere systemer som DeepFacePencil har brukt samme prinsipp til å opprette skisse-induserte fotorealistiske bilde-genererings-systemer for forskjellige domener.
Forenkling av Skisse-Til-Bilde
Den nye artikkelen sin GAN-skiss-tilnærming søker å fjerne den formidable byrden av data-innsamling og kurering som vanligvis er involvert i utviklingen av GAN-bilde-rammeverk, ved å bruke bruker-inndata til å definere hvilken undermengde av bilder som skal utgjøre treningdataene.
Systemet er designet for å kreve bare et lite antall innskannede skisser for å kalibrere rammeverket. Systemet reverserer effektivt funksjonaliteten til PhotoSketch, et felles forskningsinitiativ fra 2019 av forskere fra Carnegie Mellon, Adobe, Uber ATG og Argo AI, som er inkorporert i det nye arbeidet. PhotoSketch var designet for å opprette kunstneriske skisser fra bilder, og inneholder allerede den effektive kartleggingen av vage>spesifikke bilde-oppsett-relasjoner.
For genereringsdelen av prosessen, modifiserer den nye metoden bare vekter i StyleGAN2. Ettersom bildedataene som brukes bare er en undermengde av det totale tilgjengelige data, får man ønskede resultater ved å modifisere kartleggingsnettet.
Metoden ble evaluert på en rekke populære underdomener, inkludert hest, kirker og katter.
Princeton Universitys 2016 LSUN-datasett ble brukt som kjerne-materialet fra hvilket å kunne avlede mål-underdomener. For å etablere et skisse-kartleggingssystem som er robust mot eksentrisiteten til virkelige bruker-inndata-skisser, ble systemet trent på bilder fra QuickDraw-datasettet utviklet av Microsoft mellom 2021-2016.
Selv om skisse-kartleggingen mellom PhotoSketch og QuickDraw er ganske forskjellig, fant forskerne at deres rammeverk lykkes godt i å straddlere dem ganske enkelt på relativt enkle posisjoner, selv om mer kompliserte posisjoner (som for eksempel katter som ligger ned) viser seg å være en større utfordring, mens svært abstrakt bruker-inndata (dvs. overhodet grove tegninger) også hindrer kvaliteten på resultatene.

Latent Rom og Naturlig Bilde-Redigering
Forskerne utviklet to applikasjoner basert på det grunnleggende arbeidet: latent rom-redigering og bilde-redigering. Latent rom-redigering tilbyr tolkbare bruker-kontroller som er fasilitert på treningstid, og tillater en stor grad av variasjon samtidig som den forblir trofast mot måldomenet, og behagelig konsekvent over variasjoner.
Den latente rom-redigerings-komponenten ble drevet av 2020 GANSpace-prosjektet, et felles initiativ fra Aalto University, Adobe og NVIDIA.
En enkelt bilde kan også bli matet til den tilpassede modellen, og muliggjør naturlig bilde-redigering. I denne applikasjonen blir et enkelt bilde projisert til den tilpassede GAN-en, og ikke bare muliggjør direkte redigering, men også opprettholder høyere-nivå latent rom-redigering, hvis dette også har blitt brukt.

Her har et virkelig bilde blitt brukt som inndata til GAN-en (katt-modellen), som redigerer inndata til å matche innskannede skisser. Dette muliggjør bilde-redigering via skissing.
Selv om det er konfigurerbart, er systemet ikke designet for å fungere i sanntid, i alle fall når det gjelder trening og kalibrering. For tiden krever GAN-skiss 30 000 trening-iterasjoner. Systemet krever også tilgang til de originale trening-dataene for den originale modellen.
I tilfeller hvor datasettet er åpen kilde, og har en lisens som tillater lokal kopiering, kunne dette bli akseptert ved å inkludere kilde-dataene i en lokal installert pakke, selv om dette ville ta opp betydelig disk-plass; eller ved å få tilgang til eller prosessere data fjernhet, via en sky-basert tilnærming, som introduserer nettverks-overhead og (i tilfeller hvor prosessering faktisk skjer på skyen) muligens beregnings-kostnad-considerationer.

Transformasjoner fra tilpassede FFHQ-modeller trent på bare for menneske-genererte skisser.















