Unghiul lui Anderson

Editare asistată de obiecte cu Google’s Imagic și Runway’s ‘Erase and Replace’

mm
Adaugă Unite.AI la sursele tale preferate pe Google

În această săptămână, două noi algoritmi grafici impulsionați de IA oferă modalități noi pentru utilizatorii finali de a face schimbări foarte granulare și eficiente la obiecte din fotografii.

Primul este Imagic, de la Google Research, în asociere cu Institutul de Tehnologie din Israel și Institutul de Știință Weizmann. Imagic oferă editare fină a obiectelor prin reglarea modelului de difuzie.

Schimbați ceea ce doriți, și lăsați restul - Imagic promite editare granulară a doar a părților pe care doriți să le schimbați. Sursă: https://arxiv.org/pdf/2210.09276.pdf

Schimbați ceea ce doriți, și lăsați restul – Imagic promite editare granulară a doar a părților pe care doriți să le schimbați. Sursă: https://arxiv.org/pdf/2210.09276.pdf

Oricine care a încercat vreodată să schimbe doar un element într-o re-renderizare a difuziei stabile va ști prea bine că, pentru fiecare editare reușită, sistemul va schimba cinci lucruri pe care le-ați plăcut exact așa cum erau. Este o lipsă care, în prezent, face ca mulți dintre cei mai talentați entuziaști ai difuziei stabile să sară constant între difuzia stabilă și Photoshop, pentru a remedia acest tip de “daune colaterale”. Din acest punct de vedere, realizările Imagic par notabile.

La momentul scrierii, Imagic lipsește încă chiar și un videoclip promoțional, și, având în vedere atitudinea rezervată a Google față de lansarea de instrumente de sinteză de imagini neîngrădite, este incert în ce măsură, dacă va fi cazul, vom avea ocazia să testăm sistemul.

Al doilea ofertant este facilitățile Erase and Replace de la Runway ML, o funcție nouă în secțiunea “AI Magic Tools” a suitei sale exclusive online de utilități vizuale bazate pe învățare automată.

Funcția Erase and Replace de la Runway ML, deja văzută într-o previzualizare pentru un sistem de editare text-la-videoclip. Sursă: https://www.youtube.com/watch?v=41Qb58ZPO60

Funcția Erase and Replace de la Runway ML, deja văzută într-o previzualizare pentru un sistem de editare text-la-videoclip. Sursă: https://www.youtube.com/watch?v=41Qb58ZPO60

Să aruncăm o privire mai atentă la ieșirea lui Runway.

Erase and Replace

La fel ca Imagic, Erase and Replace se ocupă exclusiv de imagini statice, deși Runway a previzualizat aceeași funcționalitate într-un sistem de editare text-la-videoclip care nu a fost încă lansat:

Deși oricine poate testa noua funcție Erase and Replace pe imagini, versiunea video nu este încă disponibilă public.

Deși oricine poate testa noua funcție Erase and Replace pe imagini, versiunea video nu este încă disponibilă public. Sursă: https://twitter.com/runwayml/status/1568220303808991232

Deși Runway ML nu a lansat detalii despre tehnologiile din spatele lui Erase and Replace, viteza cu care puteți înlocui o plantă de casă cu o bust de Ronald Reagan destul de convingător sugerează că un model de difuzie, cum ar fi difuzia stabilă (sau, mult mai puțin probabil, un DALL-E 2 licențiat) este motorul care reinventează obiectul alegerii dvs. în Erase and Replace.

Înlocuirea unei plante de casă cu un bust al lui Ronald Reagan nu este chiar atât de rapidă, dar este destul de rapidă. Sursă: https://app.runwayml.com/

Înlocuirea unei plante de casă cu un bust al lui Ronald Reagan nu este chiar atât de rapidă, dar este destul de rapidă. Sursă: https://app.runwayml.com/

Sistemul are unele restricții de tip DALL-E 2 – imagini sau texte care declanșează filtrele Erase and Replace vor declanșa un avertisment despre posibila suspendare a contului în caz de încălcări ulterioare – practic o copie a politicii OpenAI pentru DALL-E 2.

Înlocuirea unei mese de casă cu o 'masă de gheață' în Erase and Replace de la Runway ML.

Înlocuirea unei mese de casă cu o ‘masă de gheață’ în Erase and Replace de la Runway ML.

Ca și în cazul lui Imagic (a se vedea mai jos), Erase and Replace este “orientat către obiecte” – nu puteți șterge doar o “parte goală” a imaginii și o puteți repicta cu rezultatul promptului dvs. text; în acest scenariu, sistemul va urma pur și simplu obiectul aparent de-a lungul liniei de vedere a mascăi (cum ar fi un perete sau un televizor) și va aplica transformarea acolo.

Așa cum indică numele, nu puteți injecta obiecte în spațiu gol în Erase and Replace. Aici, o încercare de a chema cel mai faimos dintre lordurile Sith se soldează cu o ciudată pictură Vader pe televizor, aproximativ acolo unde a fost desenată zona de 'înlocuire'.

Așa cum indică numele, nu puteți injecta obiecte în spațiu gol în Erase and Replace. Aici, o încercare de a chema cel mai faimos dintre lordurile Sith se soldează cu o ciudată pictură Vader pe televizor, aproximativ acolo unde a fost desenată zona de ‘înlocuire’.

Este dificil de spus dacă Erase and Replace evită utilizarea de imagini cu copyright (care sunt încă în mare parte obstructate, deși cu succes variabil, în DALL-E 2) sau dacă modelul utilizat în motorul de render din spate nu este optimizat pentru acest tip de lucru.

Muralul ușor NSFW 'al lui Nicole Kidman' indică faptul că modelul (presupus) bazat pe difuzie de la dispoziție nu are sistemul de respingere a rendering-ului de fețe realiste sau conținut explicit, în timp ce rezultatele pentru încercările de a evoca lucrări cu copyright variază de la ambiguitate ('xenomorph') la absurd ('tronus de fier'). Înset, în partea de jos, dreapta, imaginea sursă.

Muralul ușor NSFW ‘al lui Nicole Kidman’ indică faptul că modelul (presupus) bazat pe difuzie de la dispoziție nu are sistemul de respingere a rendering-ului de fețe realiste sau conținut explicit, în timp ce rezultatele pentru încercările de a evoca lucrări cu copyright variază de la ambiguitate (‘xenomorph’) la absurd (‘tronus de fier’). Înset, în partea de jos, dreapta, imaginea sursă.

Ar fi interesant de știut care sunt metodele pe care le utilizează Erase and Replace pentru a izola obiectele pe care le poate înlocui. Presupunând că imaginea este rulată printr-o versiune a CLIP, cu articolele discrete individuate prin recunoaștere de obiecte și segmentare semantică ulterioară. Niciuna dintre aceste operațiuni nu funcționează aproape la fel de bine într-o instalație obișnuită de difuzie stabilă.

Dar nimic nu este perfect – uneori sistemul pare să șteargă și să nu înlocuiască, chiar și atunci când (așa cum am văzut în imaginea de mai sus), mecanismul de rendering subiacent știe cu siguranță ce înseamnă un prompt text. În acest caz, se dovedește imposibil să transformi o masă de cafea într-un xenomorf – mai degrabă, masa pur și simplu dispare.

O iterație mai înfricoșătoare a 'Unde este Waldo', deoarece Erase and Replace nu reușește să producă un extraterestru.

O iterație mai înfricoșătoare a ‘Unde este Waldo’, deoarece Erase and Replace nu reușește să producă un extraterestru.

Erase and Replace pare a fi un sistem eficient de substituție a obiectelor, cu o pictură excelentă. Cu toate acestea, nu poate edita obiecte existente percepute, ci doar le poate înlocui. Pentru a modifica într-adevăr conținutul imaginii existente fără a compromite materialul ambiental este, în mod evident, o sarcină mult mai dificilă, legată de lupta lungă a sectorului de cercetare a viziunii calculatorului pentru dezlegare în diversele spații latente ale cadrului popular.

Imagic

Este o sarcină pe care Imagic o abordează. Noul articol oferă numeroase exemple de editări care modifică cu succes aspecte individuale ale unei fotografii, lăsând restul imaginii neatins.

În Imagic, imaginile modificate nu suferă de întinderea, deformarea și 'ghicirea ocluziunii' caracteristice păpușării deepfake, care utilizează priori limitate derivate dintr-o singură imagine.

În Imagic, imaginile modificate nu suferă de întinderea, deformarea și ‘ghicirea ocluziunii’ caracteristice păpușării deepfake, care utilizează priori limitate derivate dintr-o singură imagine.

Sistemul utilizează un proces în trei etape – optimizarea încorporării textului; reglarea modelului; și, în final, generarea imaginii modificate.

Imagic codifică promptul text țintă pentru a obține încorporarea textului inițial, și apoi optimizează rezultatul pentru a obține imaginea de intrare. După aceea, modelul generativ este reglat pentru imaginea sursă, adăugând o serie de parametri, înainte de a fi supus interpolării solicitate.

Imagic codifică promptul text țintă pentru a obține încorporarea textului inițial, și apoi optimizează rezultatul pentru a obține imaginea de intrare. După aceea, modelul generativ este reglat pentru imaginea sursă, adăugând o serie de parametri, înainte de a fi supus interpolării solicitate.

Nu este de mirare că cadrul este bazat pe arhitectura text-la-videoclip Imagen de la Google, deși cercetătorii afirmă că principiile sistemului sunt aplicabile în general modelelor de difuzie latente.

Imagen utilizează o arhitectură cu trei niveluri, și nu o matrice cu șapte niveluri utilizată pentru iterația recentă a companiei de text-la-videoclip a software-ului. Cele trei module distincte cuprind un model de difuzie generativ care funcționează la o rezoluție de 64x64px; un model de superraționare care mărește această ieșire la 256x256px; și un model suplimentar de superraționare pentru a duce ieșirea până la o rezoluție de 1024×1024.

Imagic intervine în cea mai timpurie etapă a acestui proces, optimizând încorporarea textului solicitat la etapa de 64px, pe un optimizer Adam cu o rată de învățare statică de 0,0001.

Un master-class în dezlegare: cei care au încercat să schimbe ceva atât de simplu ca culoarea unui obiect renderizat într-un model de difuzie, GAN sau NeRF vor ști cât de semnificativ este faptul că Imagic poate efectua astfel de transformări fără a 'dezmembra' consistența restului imaginii.

Un master-class în dezlegare: cei care au încercat să schimbe ceva atât de simplu ca culoarea unui obiect renderizat într-un model de difuzie, GAN sau NeRF vor ști cât de semnificativ este faptul că Imagic poate efectua astfel de transformări fără a ‘dezmembra’ consistența restului imaginii.

Reglarea se efectuează apoi pe modelul de bază Imagen, pentru 1500 de pași pe imagine de intrare, condiționat de încorporarea revizuită. În același timp, stratul secundar 64px>256px este optimizat în paralel pe imaginea condiționată. Cercetătorii notează că o optimizare similară pentru stratul final 256px>1024px are “puțin sau deloc” efect asupra rezultatelor finale și, prin urmare, nu au implementat acest lucru.

Articolul afirmă că procesul de optimizare durează aproximativ opt minute pentru fiecare imagine pe cipuri TPUV4 gemene. Renderul final are loc în Imagen de bază sub schema de eșantionare DDIM.

La fel ca și în cazul proceselor de reglare similare pentru DreamBooth de la Google, încorporările rezultate pot fi utilizate suplimentar pentru a alimenta stilizarea, precum și editările fotorealiste care conțin informații extrase din baza de date mai largă care alimentează Imagen (deoarece, așa cum arată prima coloană de mai jos, imaginile sursă nu au conținutul necesar pentru a efectua aceste transformări).

Mișcări fotorealiste flexibile și editări pot fi obținute prin Imagic, în timp ce codurile derivate și dezlegate obținute în acest proces pot fi utilizate la fel de ușor pentru ieșiri stilizate.

Mișcări fotorealiste flexibile și editări pot fi obținute prin Imagic, în timp ce codurile derivate și dezlegate obținute în acest proces pot fi utilizate la fel de ușor pentru ieșiri stilizate.

Cercetătorii au comparat Imagic cu lucrări anterioare SDEdit, o abordare bazată pe GAN din 2021, o colaborare între Universitatea Stanford și Universitatea Carnegie Mellon; și Text2Live, o colaborare, din aprilie 2022, între Institutul de Știință Weizmann și NVIDIA.

O comparație vizuală între Imagic, SDEdit și Text2Live.

O comparație vizuală între Imagic, SDEdit și Text2Live.

Este clar că abordările anterioare se luptă, dar în rândul de jos, care implică introducerea unei schimbări masive de poziție, concurenții eșuează complet în a refigura materialul sursă, în comparație cu un succes notabil de la Imagic.

Cerințele de resurse și timpul de antrenament per imagine al lui Imagic, deși scurt prin standardele acestor urmări, îl fac o includere puțin probabilă într-o aplicație de editare a imaginilor locale pe computere personale – și nu este clar în ce măsură procesul de reglare poate fi redus la nivelul consumatorilor.

Așa cum stă, Imagic este o ofertă impresionantă, mai potrivită pentru API-uri – un mediu în care cercetarea Google, precaută în ceea ce privește facilitarea deepfaking-ului, se poate simți în orice caz cel mai confortabil.

 

Publicat pentru prima dată pe 18 octombrie 2022.

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai