Modele și platforme AI

InstantStyle: Păstrarea stilului în generarea de imagini pe baza textului

mm
Adaugă Unite.AI la sursele tale preferate pe Google

În ultimii ani, modelele de difuzie bazate pe reglare au demonstrat progrese remarcabile într-o varietate de sarcini de personalizare și customizare a imaginilor. Cu toate acestea, în ciuda potențialului lor, modelele actuale de difuzie bazate pe reglare continuă să întâmpine o serie de provocări complexe în producerea și generarea de imagini cu stil consistent, și pot exista trei motive pentru acest lucru. În primul rând, conceptul de stil rămâne în mare măsură nedeterminat și neclar, și cuprinde o combinație de elemente, incluzând atmosferă, structură, design, material, culoare și multe altele. În al doilea rând, metodele bazate pe inversare sunt predispuse la degradarea stilului, ceea ce duce la pierderea frecventă a detaliilor fine. În final, abordările bazate pe adaptori necesită reglarea frecventă a greutăților pentru fiecare imagine de referință, pentru a menține un echilibru între controlul textului și intensitatea stilului.

Mai mult, obiectivul principal al majorității abordărilor de transfer de stil sau generare de imagini stilizate este de a utiliza imaginea de referință și de a aplica stilul specific dintr-un subset dat sau imagine de referință la o imagine de conținut țintă. Cu toate acestea, este numărul mare de atribute ale stilului care face dificilă sarcina cercetătorilor de a colecta seturi de date stilizate, de a reprezenta corect stilul și de a evalua succesul transferului. Anterior, modelele și cadrele care se ocupă de procesul de difuzie bazat pe reglare, au reglat setul de date de imagini care au un stil comun, un proces care este atât timp-consuming, cât și cu o generalizare limitată în sarcinile din lumea reală, deoarece este dificil să se adune un subset de imagini care au același sau aproape identic stil.

În acest articol, vom discuta despre InstantStyle, un cadru proiectat cu scopul de a aborda problemele cu care se confruntă modelele actuale de difuzie bazate pe reglare pentru generarea și personalizarea de imagini. Vom discuta despre cele două strategii cheie implementate de cadrul InstantStyle:

  1. O abordare simplă, dar eficientă, de a decupa stilul și conținutul din imagini de referință în spațiul de caracteristici, prezis pe baza ipotezei că caracteristicile din același spațiu de caracteristici pot fi adăugate sau scăzute una de la alta.
  2. Prevenirea scurgerilor de stil prin injectarea caracteristicilor imaginii de referință exclusiv în blocurile specifice de stil, și evitarea deliberată a necesității de a utiliza greutăți incomode pentru reglare, care sunt adesea caracteristice pentru proiecte mai grele de parametri.

Acest articol are scopul de a acoperi cadrul InstantStyle în profunzime, și vom explora mecanismul, metodologia, arhitectura cadrului, împreună cu comparația cu cadrele de ultimă generație. Vom discuta, de asemenea, despre modul în care cadrul InstantStyle demonstrează rezultate remarcabile de stilizare vizuală, și găsește un echilibru optim între controlul elementelor textuale și intensitatea stilului. Așadar, să începem.

InstantStyle: Păstrarea stilului în generarea de imagini pe baza textului

Cadrele de generare de imagini pe baza textului, bazate pe difuzie, au obținut succese remarcabile într-o varietate de sarcini de personalizare și customizare, în special în sarcinile de generare de imagini consistente, incluzând personalizarea obiectelor, păstrarea imaginilor și transferul de stil. Cu toate acestea, în ciuda succesului recent și a creșterii performanței, transferul de stil rămâne o sarcină dificilă pentru cercetători, datorită naturii nedeterminate și neclarificate a stilului, care include adesea o varietate de elemente, incluzând atmosferă, structură, design, material, culoare și multe altele. Cu toate acestea, obiectivul principal al generării de imagini stilizate sau al transferului de stil este de a aplica stilul specific dintr-o imagine de referință dată sau dintr-un subset de imagini de referință la o imagine de conținut țintă. Cu toate acestea, numărul mare de atribute ale stilului face dificilă sarcina cercetătorilor de a colecta seturi de date stilizate, de a reprezenta corect stilul și de a evalua succesul transferului. Anterior, modelele și cadrele care se ocupă de procesul de difuzie bazat pe reglare, au reglat setul de date de imagini care au un stil comun, un proces care este atât timp-consuming, cât și cu o generalizare limitată în sarcinile din lumea reală, deoarece este dificil să se adune un subset de imagini care au același sau aproape identic stil.

Cu provocările întâmpinate de abordarea actuală, cercetătorii au luat în considerare dezvoltarea de abordări de reglare pentru transferul de stil sau generarea de imagini stilizate, și aceste cadre pot fi împărțite în două grupuri diferite:

  • Abordări fără adaptori: Abordările fără adaptori și cadrele utilizează puterea atenției în procesul de difuzie, și prin implementarea unei operații de atenție partajată, aceste modele sunt capabile să extragă caracteristici esențiale, incluzând chei și valori, din imagini de stil de referință direct.
  • Abordări bazate pe adaptori: Abordările bazate pe adaptori și cadrele incorporează un model ușor proiectat pentru a extrage reprezentări detaliate de imagini din imagini de stil de referință. Cadrul integrează apoi aceste reprezentări în procesul de difuzie, utilizând mecanisme de atenție încrucișată. Obiectivul principal al procesului de integrare este de a ghida procesul de generare, și de a asigura că imaginea rezultată este aliniată cu nuanțele stilistice dorite ale imaginii de referință.

Cu toate acestea, în ciuda promisiunilor, metodele fără reglare întâlnesc adesea câteva provocări. În primul rând, abordarea fără adaptori necesită un schimb de chei și valori în straturile de atenție, și pre-ia matricele de chei și valori derivate din imagini de stil de referință. Când se implementează pe imagini naturale, abordarea fără adaptori necesită inversarea imaginii înapoi la zgomotul latent, utilizând tehnici precum DDIM sau inversarea modelului de difuzie implicită. Cu toate acestea, utilizarea DDIM sau a altor abordări de inversare poate duce la pierderea detaliilor fine, precum culoarea și textura, diminuând astfel informația de stil în imaginile generate. Mai mult, pașii suplimentari introduși de aceste abordări sunt un proces consumator de timp, și pot prezenta dezavantaje semnificative în aplicații practice. Pe de altă parte, provocarea principală pentru metodele bazate pe adaptori constă în găsirea echilibrului corect între scurgerea de conținut și intensitatea stilului. Scurgerea de conținut apare atunci când o creștere a intensității condiției de imagine duce la apariția unor elemente non-stil din imaginea de referință în ieșirea generată, cu punctul principal de dificultate constând în separarea stilului de conținut în imaginea de referință în mod eficient. Pentru a aborda această problemă, unele cadre construiesc seturi de date pereche care reprezintă același obiect în diferite stiluri, facilitând extragerea reprezentării conținutului și a stilurilor separate. Cu toate acestea, datorită reprezentării în mod inerent nedeterminate a stilului, sarcina de a crea seturi de date pereche la scară largă este limitată în ceea ce privește diversitatea stilurilor pe care le poate capta, și este un proces consumator de resurse.

Pentru a aborda aceste limitări, cadrul InstantStyle este introdus, care este un mecanism nou fără reglare, bazat pe metodele existente bazate pe adaptori, cu capacitatea de a se integra perfect cu alte metode de injecție bazate pe atenție, și de a realiza decuparea conținutului și a stilului în mod eficient. Mai mult, cadrul InstantStyle introduce nu una, ci două modalități eficiente de a realiza decuparea stilului și a conținutului, obținând o migrare mai bună a stilului, fără a necesita introducerea unor metode suplimentare pentru decupare sau construirea unor seturi de date pereche.

Mai mult, cadrele anterioare bazate pe adaptori au fost utilizate pe scară largă în metodele bazate pe CLIP, ca extractor de caracteristici de imagine, și unele cadre au explorat posibilitatea implementării decupării caracteristicilor în spațiul de caracteristici, și, în comparație cu nedeterminarea atributelor de stil, este mai ușor să se descrie conținutul cu text. Deoarece imaginile și textele împărtășesc un spațiu de caracteristici în metodele bazate pe CLIP, o operație simplă de scădere a caracteristicilor textului de conținut și a caracteristicilor de imagine poate reduce scurgerea de conținut în mod semnificativ. Mai mult, în majoritatea modelelor de difuzie, există un anumit strat în arhitectura sa care injectează informația de stil, și realizează decuparea conținutului și a stilului prin injecția caracteristicilor de imagine numai în blocurile specifice de stil. Prin implementarea acestor două strategii simple, cadrul InstantStyle este capabil să rezolve problemele de scurgere de conținut întâmpinate de majoritatea cadrelor existente, menținând în același timp puterea stilului.

Pentru a rezuma, cadrul InstantStyle utilizează două mecanisme simple, dar eficiente, pentru a realiza o decupare eficientă a conținutului și a stilului din imagini de referință. Cadrul InstantStyle este o abordare independentă de model și fără reglare, care demonstrează o performanță remarcabilă în sarcinile de transfer de stil, cu un potențial enorm pentru sarcinile ulterioare.

InstantStyle: Metodologie și Arhitectură

Așa cum au demonstrat abordările anterioare, există un echilibru în injecția condițiilor de stil în modelele de difuzie fără reglare. Dacă intensitatea condiției de imagine este prea mare, poate duce la scurgerea de conținut, în timp ce dacă intensitatea condiției de imagine scade prea mult, stilul poate să nu fie suficient de evident. Un motiv principal pentru această observație este că, într-o imagine, stilul și conținutul sunt interconectați, și datorită atributelor de stil în mod inerent nedeterminate, este dificil să se decupeze stilul și intenția. Ca urmare, greutăți minuțioase sunt adesea reglate pentru fiecare imagine de referință, în încercarea de a echilibra controlul textului și puterea stilului. Mai mult, pentru o imagine de referință dată și descrierea sa textuală corespunzătoare, în metodele bazate pe inversare, se adoptă abordări de inversare precum DDIM, peste imagine, pentru a obține traseul de difuzie inversat, un proces care aproximează ecuația de inversare pentru a transforma o imagine într-o reprezentare de zgomot latent. Construind pe aceasta, și începând de la traseul de difuzie inversat, împreună cu o nouă serie de prompturi, aceste metode generează conținut nou, cu stilul său aliniat cu intrarea.

Venind la metodologie, în loc de a utiliza strategii complexe pentru a decupa conținutul și stilul din imagini, cadrul InstantStyle adoptă abordarea cea mai simplă pentru a obține o performanță similară. În comparație cu atributelor de stil nedeterminate, conținutul poate fi reprezentat prin text natural, permițând cadrului InstantStyle să utilizeze encoderul de text din CLIP pentru a extrage caracteristicile textului de conținut ca reprezentări de context. În același timp, cadrul InstantStyle implementează encoderul de imagine CLIP pentru a extrage caracteristicile imaginii de referință. Utilizând caracterizarea caracteristicilor globale CLIP, și scăzând caracteristicile textului de conținut din caracteristicile de imagine, cadrul InstantStyle este capabil să decupeze stilul și conținutul în mod explicit. Deși este o strategie simplă, ajută cadrul InstantStyle să fie eficient în minimizarea scurgerii de conținut.

Mai mult, fiecare strat într-o rețea profundă este responsabil pentru capturarea diferitelor informații semantice, și observația cheie din modelele anterioare este că există două straturi de atenție care sunt responsabile pentru manipularea stilului. În mod specific, este vorba de straturile blocks.0.attentions.1 și down blocks.2.attentions.1, care sunt responsabile pentru capturarea stilului, precum culoarea, materialul, atmosfera, și stratul de layout spațial, care capturează structura și compoziția, respectiv. Cadrul InstantStyle utilizează aceste straturi în mod implicit pentru a extrage informația de stil, și prevenirea scurgerii de conținut fără a pierde puterea stilului. Strategia este simplă, dar eficientă, deoarece modelul a identificat blocurile de stil care pot injecta caracteristicile de imagine în aceste blocuri pentru a obține un transfer de stil fără cusur. Mai mult, deoarece modelul reduce semnificativ numărul de parametri ai adaptorului, capacitatea de control a textului a cadrului este îmbunătățită, și mecanismul este, de asemenea, aplicabil altor modele de injecție de caracteristici bazate pe atenție, pentru editare și alte sarcini.

InstantStyle: Experimente și Rezultate

Cadrul InstantStyle este implementat pe cadrul Stable Diffusion XL, și utilizează IR-adapterul pre-antrenat ca exemplar pentru a-și valida metodologia, și mută toate straturile, cu excepția straturilor de stil, pentru caracteristicile de imagine. Modelul InstantStyle antrenează, de asemenea, IR-adapterul pe 4 milioane de seturi de date de imagini pereche la scară largă, de la zero, și, în loc de a antrena toate straturile, actualizează numai straturile de stil.

Pentru a-și testa capacitățile de generalizare și robustețe, cadrul InstantStyle efectuează numeroase experimente de transfer de stil cu diverse stiluri, pe diferite conținuturi, și rezultatele pot fi observate în imaginile următoare. Dată o singură imagine de referință de stil, împreună cu prompturi variate, cadrul InstantStyle oferă imagini de calitate superioară, cu stil consistent.

Mai mult, deoarece modelul injectează informații de imagine numai în straturile de stil, este capabil să atenueze semnificativ problema scurgerii de conținut, și, prin urmare, nu are nevoie de reglarea greutăților.

În continuare, cadrul InstantStyle adoptă, de asemenea, arhitectura ControlNet pentru a obține stilizarea imaginilor cu control spațial, și rezultatele sunt demonstrate în imaginea următoare.

În comparație cu metodele actuale de ultimă generație, incluzând StyleAlign, B-LoRA, Swapping Self Attention, și IP-Adapter, cadrul InstantStyle demonstrează cele mai bune efecte vizuale.

Gânduri Finale

În acest articol, am discutat despre InstantStyle, un cadru general care utilizează două strategii simple, dar eficiente, pentru a realiza o decupare eficientă a conținutului și a stilului din imagini de referință. Cadrul InstantStyle este proiectat cu scopul de a aborda problemele cu care se confruntă modelele actuale de difuzie bazate pe reglare pentru generarea și personalizarea de imagini. Cadrul InstantStyle implementează două strategii vitale: O abordare simplă, dar eficientă, de a decupa stilul și conținutul din imagini de referință în spațiul de caracteristici, prezis pe baza ipotezei că caracteristicile din același spațiu de caracteristici pot fi adăugate sau scăzute una de la alta. În al doilea rând, prevenirea scurgerilor de stil prin injectarea caracteristicilor imaginii de referință exclusiv în blocurile specifice de stil, și evitarea deliberată a necesității de a utiliza greutăți incomode pentru reglare, care sunt adesea caracteristice pentru proiecte mai grele de parametri.

"Un inginer de profesie, un scriitor din inimă". Kunal este un scriitor tehnic cu o dragoste și o înțelegere profundă a inteligenței artificiale și a învățării automate, dedicat simplificării conceptelor complexe din aceste domenii prin documentația sa captivantă și informativă.