Unghiul lui Anderson
Crearea unui Rețea Adversarială Generativă Personalizată cu Schițe

Cercetători de la Carnegie Mellon și MIT au dezvoltat o nouă metodologie care permite utilizatorilor să creeze sisteme personalizate de generare de imagini bazate pe Rețele Adversariale Generative (GAN) prin simpla schițare a unor doodle indicative.
Un sistem de acest tip ar permite utilizatorilor finali să creeze sisteme de generare de imagini capabile să producă imagini foarte specifice, cum ar fi animale, tipuri de clădiri sau chiar persoane individuale. În prezent, majoritatea sistemelor de generare GAN produc ieșiri largi și destul de aleatorii, cu posibilități limitate de a specifica caracteristici particulare, cum ar fi rasa animalului, tipul de păr la oameni, stilul de arhitectură sau identități faciale reale.
Aproachul, prezentat în lucrarea Schițează-ți propriul GAN, utilizează o interfață de schițare inovatoare ca o funcție de “căutare” eficientă pentru a găsi caracteristici și clase în baze de date de imagini supraîncărcate, care pot conține mii de tipuri de obiecte, inclusiv multe subtipuri care nu sunt relevante pentru intenția utilizatorului. GAN-ul este apoi antrenat pe acest subset filtrat de imagini.
Prin schițarea obiectului specific cu care utilizatorul dorește să calibreze GAN-ul, capacitățile generative ale framework-ului devin specializate pentru acea clasă. De exemplu, dacă un utilizator dorește să creeze un framework care generează un anumit tip de pisică (și nu doar orice pisică, așa cum se poate obține cu This Cat Does Not Exist), schițele sale de intrare servesc ca filtru pentru a exclude clasele nerelevante de pisici.

Sursă: https://peterwang512.github.io/GANSketching/
Cercetarea este condusă de Sheng Yu-Wang de la Universitatea Carnegie Mellon, împreună cu colegul său Jun-Yan Zhu și David Bau de la Laboratorul de Știință a Calculatoarelor și Inteligență Artificială al MIT.
Metoda însăși este denumită “schițare GAN” și utilizează schițele de intrare pentru a modifica direct greutățile unui model GAN “șablon” pentru a ținti domeniul sau sub-domeniul identificat prin pierdere adversă între domenii.
Au fost explorate diferite metode de regularizare pentru a se asigura că ieșirea modelului este diversă, menținând în același timp o calitate ridicată a imaginii. Cercetătorii au creat aplicații de exemplu care pot interpolarea spațiului latent și efectua proceduri de editare a imaginilor.
Această [$class] Nu Existe
Sistemele de generare de imagini bazate pe GAN au devenit o modă, dacă nu o glumă, în ultimii ani, cu o proliferare de proiecte capabile să genereze imagini cu lucruri care nu există, inclusiv oameni, apartamente de închiriat, gustări, picioare, cai, politicieni și insecte, printre altele.
Sistemele de sinteză de imagini bazate pe GAN sunt create prin compilarea sau curățarea unor seturi extinse de date care conțin imagini din domeniul țintă, cum ar fi fețe sau cai; antrenarea modelului care generalizează o gamă de caracteristici de-a lungul imaginilor din baza de date; și implementarea modulelor generatoare care pot produce exemple aleatorii pe baza caracteristicilor învățate.

Ieșire din schițe în DeepFacePencil, care permite utilizatorilor să creeze fețe fotorealiste din schițe. Multe proiecte similare de schiță-la-imagină există.
Caracteristicile de înaltă dimensiune sunt printre primele care sunt concretizate în timpul procesului de antrenare și sunt echivalente cu primele pensule late de culoare pe o pânză. Aceste caracteristici de înaltă dimensiune vor corela în cele din urmă cu caracteristici mult mai detaliate (de exemplu, strălucirea ochilor și mustățile ascuțite ale unei pisici, și nu doar o pată generică de culoare bej care reprezintă capul).
Știu Ce Vrei să Spui…
Prin cartografierea relației dintre aceste forme seminale inițiale și interpretările detaliate care sunt obținute mult mai târziu în procesul de antrenare, este posibil să se inferă relații între imagini “vage” și “specifice”, permițând utilizatorilor să creeze imagini complexe și fotorealiste din schițe crude.
Recent, NVIDIA a lansat o versiune de desktop a cercetării sale pe termen lung GauGAN în generarea de peisaje bazate pe GAN, care demonstrează ușor acest principiu:

Approximări de schițe sunt traduse în imagini scenice bogate prin NVIDIA GauGAN și acum aplicația NVIDIA Canvas. Sursă: https://rossdawson.com/futurist/implications-of-ai/future-of-ai-image-synthesis/
La fel, sisteme multiple, cum ar fi DeepFacePencil, au folosit același principiu pentru a crea generatoare de imagini fotorealiste induse de schițe pentru diverse domenii.
Simplificarea Schiță-la-Imagine
Abordarea din noua lucrare, denumită “Schițare GAN”, își propune să elimine povara formidabilă a colectării și curățării datelor, care este de obicei implicată în dezvoltarea cadrului de imagini GAN, prin utilizarea intrărilor utilizatorului pentru a defini care subset de imagini ar trebui să constituie datele de antrenare.
Sistemul a fost proiectat pentru a necesita doar un număr mic de schițe de intrare pentru a calibra cadrul. Sistemul inversează în esență funcționalitatea PhotoSketch, o inițiativă de cercetare comună din 2019 de la cercetători de la Carnegie Mellon, Adobe, Uber ATG și Argo AI, care este încorporată în noua lucrare. PhotoSketch a fost proiectat pentru a crea schițe artistice din imagini și conține deja cartografierea eficientă a relațiilor de creare a imaginilor “vage” și “specifice”.
Pentru partea de generare a procesului, noua metodă modifică doar greutățile StyleGAN2. Deoarece datele de imagine utilizate sunt doar un subset din datele totale disponibile, modificarea doar a rețelei de mapare obține rezultate dorite.
Metoda a fost evaluată pe mai multe sub-domenii populare, inclusiv ecvestru, biserici și pisici.
Setul de date LSUN din 2016 de la Universitatea Princeton a fost utilizat ca material de bază din care să se deriveze sub-domenii țintă. Pentru a stabili un sistem de mapare a schițelor robust la excentricitățile intrărilor de schițe ale utilizatorilor din lumea reală, sistemul este antrenat pe imagini din setul de date QuickDraw dezvoltat de Microsoft între 2021-2016.
Deși maparea schițelor între PhotoSketch și QuickDraw este destul de diferită, cercetătorii au constatat că cadrul lor reușește bine în a traversa cu ușurință pe poziții relativ simple, deși poziții mai complicate (cum ar fi pisici culcate) se dovedesc a fi mai dificile, în timp ce intrările de schițe abstracte ale utilizatorilor (de exemplu, desene prea crude) împiedică, de asemenea, calitatea rezultatelor.

Spațiu Latent și Editare de Imagini Naturale
Cercetătorii au dezvoltat două aplicații bazate pe lucrarea de bază: editarea spațiului latent și editarea imaginilor. Editarea spațiului latent oferă controale utilizator interpretabile care sunt facilitate la timpul antrenării și permit o variație largă, rămânând fidelă domeniului țintă și plăcut de consistentă pe parcursul variațiilor.
Componenta de editare a spațiului latent a fost alimentată de proiectul GANSpace din 2020, o inițiativă comună de la Universitatea Aalto, Adobe și NVIDIA.
O singură imagine poate fi, de asemenea, introdusă în modelul personalizat, facilitând editarea naturală a imaginilor. În această aplicație, o imagine singulară este proiectată pe GAN-ul personalizat, permițând nu numai editarea directă, ci și păstrarea editării spațiului latent de nivel superior, dacă acesta a fost utilizat și el.

Aici, o imagine reală a fost utilizată ca intrare pentru GAN (model de pisică), care editează intrarea pentru a se potrivi cu schițele trimise. Acest lucru permite editarea imaginilor prin schițare.
Deși poate fi configurat, sistemul nu este proiectat pentru a funcționa în timp real, cel puțin în ceea ce privește antrenarea și calibrarea. În prezent, Schițarea GAN necesită 30.000 de iterații de antrenare. Sistemul necesită, de asemenea, acces la datele de antrenare originale pentru modelul original.
În cazurile în care setul de date este open source și are o licență care permite copierea locală, acest lucru ar putea fi realizat prin includerea datelor sursă într-un pachet instalat local, deși acest lucru ar ocupa o cantitate considerabilă de spațiu pe disc; sau prin accesarea sau procesarea datelor la distanță, prin abordarea bazată pe cloud, care introduce suprasarcini de rețea și (în cazul în care procesarea are loc efectiv în cloud) posibile considerații de cost de calcul.

Transformări din modelele FFHQ personalizate antrenate pe doar schițe generate de oameni.















