Andersons vinkel

Skapa en anpassad generativ adversarial nätverk med skisser

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Forskare från Carnegie Mellon och MIT har utvecklat en ny metodik som tillåter en användare att skapa anpassade generativa adversariala nätverk (GAN) för bildskapande system genom att skissa indicativa teckningar.

Ett system av detta slag skulle kunna tillåta en slutanvändare att skapa bildgenererande system som kan generera mycket specifika bilder, såsom särskilda djur, byggnadstyper och till och med enskilda personer. För närvarande producerar de flesta GAN-genereringssystem breda och ganska slumpmässiga utdata, med begränsad möjlighet att specificera särskilda egenskaper, såsom djurras, hårtyp hos människor, arkitekturstilar eller faktiska ansiktsidentiteter.

Tillvägagångssättet, som beskrivs i artikeln Skissa din egen GAN, använder en ny teckningsgränssnitt som en effektiv “sökfunktion” för att hitta funktioner och klasser i överbelastade bildatabaser som kan innehålla tusentals typer av objekt, inklusive många underkategorier som inte är relevanta för användarens avsikt. GAN utbildas sedan på denna filterade undermängd av bilder.

Genom att skissa det specifika objekttypen som användaren vill kalibrera GAN, blir ramverkets generativa förmågor specialiserade på den klassen. Till exempel, om en användare vill skapa ett ramverk som genererar en specifik typ av katt (i stället för bara någon gammal katt, som kan erhållas med This Cat Does Not Exist), fungerar deras indata som teckningar som ett filter för att utesluta icke-relevanta klasser av katter.

 

Källa: https://peterwang512.github.io/GANSketching/

Källa: https://peterwang512.github.io/GANSketching/

Forskningen leds av Sheng Yu-Wang från Carnegie Mellon University, tillsammans med kollegan Jun-Yan Zhu och David Bau från MIT:s datavetenskaps- och artificiella intelligenslaboratorium.

Metoden i sig kallas “GAN-teckning” och använder indata som teckningar för att direkt ändra vikterna i en “mall”-GAN-modell för att specifikt rikta sig mot den identifierade domänen eller underdomänen genom cross-domain adversarial förlust.

Olika regleringsmetoder undersöktes för att säkerställa att modellens utdata är diversifierad, samtidigt som den upprätthåller en hög bildkvalitet. Forskarna skapade exempelapplikationer som kan interpolera latenta utrymme och utföra bildredigeringsförfaranden.

Denna [$class] Existerar Inte

GAN-baserade bildgenereringssystem har blivit en trend, om inte en meme, under de senaste åren, med en utbredning av projekt som kan generera bilder av icke-existerande saker, inklusive människor, hyreslägenheter, snacks, fötter, hästar, politiker och insekter, bland många andra.

GAN-baserade bildsyntesystem skapas genom att sammanställa eller kurera omfattande datamängder som innehåller bilder från måldomänen, såsom ansikten eller hästar; utbilda modeller som generaliserar en mängd funktioner över bilderna i databasen; och implementera generatormoduler som kan producera slumpmässiga exempel baserat på de inlärda funktionerna.

Utdata från teckningar i DeepFacePencil, som tillåter användare att skapa fotorealistiska ansikten från teckningar. Många liknande sketch-to-image-projekt finns.

Utdata från teckningar i DeepFacePencil, som tillåter användare att skapa fotorealistiska ansikten från teckningar. Många liknande sketch-to-image-projekt finns.

Högdimensionella funktioner är bland de första som konkreteras under utbildningsprocessen och är ekvivalenta med en målares första breda penseldrag på en duk. Dessa högdimensionella egenskaper kommer så småningom att korrelera till mycket mer detaljerade funktioner (t.ex. ögonblink och skarpa mustascher på en katt, i stället för bara en generisk beige klump som representerar huvudet).

Jag Vet Vad Du Menar…

Genom att kartlägga relationen mellan dessa tidiga seminala former och de slutliga detaljerade tolkningarna som erhålls mycket senare i utbildningsprocessen, är det möjligt att härleda relationer mellan “suva” och “specifika” bilder, vilket tillåter användare att skapa komplexa och fotorealistiska bilder från grova penseldrag.

Nyligen släppte NVIDIA en skrivbordsversion av sin långsiktiga GauGAN-forskning om GAN-baserad landskapsgenerering, som lätt demonstrerar denna princip:

Approximativa penseldrag översätts till rika scenbilder genom NVIDIA's GauGAN och nu NVIDIA Canvas-applikationen. Källa: https://rossdawson.com/futurist/implications-of-ai/future-of-ai-image-synthesis/

Approximativa penseldrag översätts till rika scenbilder genom NVIDIA’s GauGAN och nu NVIDIA Canvas-applikationen. Källa: https://rossdawson.com/futurist/implications-of-ai/future-of-ai-image-synthesis/

Likaså har flera system, såsom DeepFacePencil, använt samma princip för att skapa sketch-inducerade fotorealistiska bildgenereringsmodeller för olika domäner.

Arkitekturen för DeepFacePencil.

Arkitekturen för DeepFacePencil.

Förenkla Sketch-To-Image

Den nya artikeln GAN Sketching-approach syftar till att ta bort den betydande bördan av datainsamling och kurering som vanligtvis är involverad i utvecklingen av GAN-bildramverk, genom att använda användarindata för att definiera vilken undermängd av bilder som ska utgöra utbildningsdata.

Systemet har utformats för att endast kräva ett litet antal indata som teckningar för att kalibrera ramverket. Systemet fungerar i princip som en omvänd funktion av PhotoSketch, ett gemensamt forskningsinitiativ från 2019 av forskare från Carnegie Mellon, Adobe, Uber ATG och Argo AI, som ingår i det nya arbetet. PhotoSketch var utformat för att skapa konstnärliga teckningar från bilder och innehåller redan den effektiva kartläggningen av suv > specifik bildskapande relationer.

För genereringsdelen av processen modifierar den nya metoden endast vikterna i StyleGAN2. Eftersom de använda bilderna endast är en undermängd av den totala tillgängliga datan, räcker det att modifiera mappningsnätverket för att uppnå önskade resultat.

Metoden utvärderades på ett antal populära underdomäner, inklusive hästar, kyrkor och katter.

Princeton Universitys 2016 LSUN-dataset användes som kärnmaterialet från vilket att härleda mål-underdomäner. För att etablera ett teckningsmappningssystem som är robust mot de egenskaper som finns i verkliga användarindata, utbildades systemet på bilder från QuickDraw-dataset som utvecklats av Microsoft mellan 2021-2016.

Även om teckningsmappningen mellan PhotoSketch och QuickDraw är ganska olika, fann forskarna att deras ramverk lyckas väl med att sträcka sig över dem ganska enkelt på relativt enkla poser, men mer komplicerade poser (såsom katter som ligger ner) visar sig vara en större utmaning, medan mycket abstrakt användarindata (t.ex. alltför grova teckningar) också hindrar kvaliteten på resultaten.

Latent Utrymme och Naturlig Bildredigering

Forskarna utvecklade två applikationer baserade på det grundläggande arbetet: latent utrymme redigering och bildredigering. Latent utrymme redigering erbjuder tolkningsbara användarkontroller som faciliteras vid utbildningstid och tillåter en stor grad av variation samtidigt som den förblir trogen mot måldomänen och behagligt konsekvent över variationer.

Smidig latent utrymme interpolation med de anpassade modellerna av GAN Sketching.

Smidig latent utrymme interpolation med de anpassade modellerna av GAN Sketching.

Den latenta utrymmesredigeringskomponenten drevs av 2020 GANSpace-projektet, ett gemensamt initiativ från Aalto University, Adobe och NVIDIA.

En enda bild kan också matas in i den anpassade modellen, vilket möjliggör naturlig bildredigering. I denna applikation projiceras en enda bild till den anpassade GAN, inte bara för att möjliggöra direkt redigering, utan också för att bevara högre latent utrymme redigering, om detta också har använts.

Här har en verklig bild använts som indata till GAN (kattmodell), som redigerar indata för att matcha inskickade teckningar. Detta möjliggör bildredigering via teckning.

Här har en verklig bild använts som indata till GAN (kattmodell), som redigerar indata för att matcha inskickade teckningar. Detta möjliggör bildredigering via teckning.

Även om systemet är konfigurerbart, är det inte utformat för att fungera i realtid, åtminstone inte när det gäller utbildning och kalibrering. För närvarande kräver GAN Sketching 30 000 utbildningsiterationer. Systemet kräver också tillgång till den ursprungliga utbildningsdatan för den ursprungliga modellen.

I fall där datamängden är öppen källkod och har en licens som tillåter lokal kopia, kunde detta åstadkommas genom att inkludera källdata i ett lokalt installerat paket, även om detta skulle ta upp betydande diskutrymme; eller genom att komma åt eller bearbeta data på distans via en molnbaserad approach, som introducerar nätverksöverbelastningar och (i de fall då bearbetning faktiskt sker på molnet) möjliga beräkningskostnadsöverväganden.

Transformationer från anpassade FFHQ-modeller utbildade på endast 4 mänskligt genererade teckningar.

Transformationer från anpassade FFHQ-modeller utbildade på endast mänskligt genererade teckningar.

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai