Unghiul lui Anderson

Îmbunătățirea acurateței editării de imagini cu ajutorul inteligenței artificiale

mm
Adaugă Unite.AI la sursele tale preferate pe Google
Images from the paper ' Tight Inversion: Image-Conditioned Inversion for Real Image Editing'

Deși modelul de difuzie latentă (LDM) Firefly de la Adobe este, probabil, unul dintre cele mai bune disponibile în prezent, utilizatorii de Photoshop care au încercat funcțiile sale generative vor fi observat că nu este capabil să editeze cu ușurință imagini existente – în schimb, înlocuiește complet zona selectată de utilizator cu imagini bazate pe promptul de text furnizat de utilizator (deși Firefly este priceput în integrarea secțiunii generate rezultate în contextul imaginii).

În versiunea beta actuală, Photoshop poate cel puțin să incorporeze o imagine de referință ca prompt parțial de imagine, ceea ce aduce produsul emblematic al Adobe la nivelul de funcționalitate pe care utilizatorii de Stable Diffusion l-au avut timp de peste doi ani, mulțumită unor cadre terțe precum Controlnet:

Versiunea beta actuală a Adobe Photoshop permite utilizarea de imagini de referință la generarea de conținut nou într-o selecție - deși este o chestiune de noroc în acest moment.

Versiunea beta actuală a Adobe Photoshop permite utilizarea de imagini de referință la generarea de conținut nou într-o selecție – deși este o chestiune de noroc în acest moment.

Acest lucru ilustrează o problemă deschisă în cercetarea sintezei de imagini – dificultatea pe care o au modelele de difuzie în editarea imaginilor existente fără a implementa o “reimaginare” completă a selecției indicate de utilizator.

Deși această pictură bazată pe difuzie respectă promptul utilizatorului, reinventează complet subiectul materiei sursă fără a lua în considerare imaginea originală (cu excepția amestecării noii generații cu mediul). Sursă: https://arxiv.org/pdf/2502.20376

Deși această pictură bazată pe difuzie respectă promptul utilizatorului, reinventează complet subiectul materiei sursă fără a lua în considerare imaginea originală (cu excepția amestecării noii generații cu mediul). Sursă: https://arxiv.org/pdf/2502.20376

Această problemă apare deoarece LDM-urile generează imagini prin denoising iterativ, unde fiecare etapă a procesului este condiționată de promptul de text furnizat de utilizator. Cu conținutul promptului de text transformat în tokeni de încorporare și cu un model hiperscalabil precum Stable Diffusion sau Flux care conține sute de mii (sau milioane) de încorporări apropiate de prompt, procesul are o distribuție condiționată calculată pe care să o urmărească; și fiecare pas făcut este un pas către acest “țintă de distribuție condiționată”.

Deci, aceasta este imaginea de la text – un scenariu în care utilizatorul “speră la cel mai bun”, deoarece nu există niciun mod de a ști exact ce va fi generat.

În schimb, mulți au încercat să utilizeze capacitatea generativă puternică a unui LDM pentru a edita imagini existente – dar acest lucru implică un act de echilibru între fidelitate și flexibilitate.

Când o imagine este proiectată în spațiul latent al modelului prin metode precum inversarea DDIM, scopul este de a recupera originalul cât mai exact posibil, permițând totuși editări semnificative. Problema este că, cu cât o imagine este reconstruită mai precis, cu atât modelul se conformează mai mult structurii sale originale, făcând modificările majore dificile.

La fel ca multe alte cadre de editare de imagini bazate pe difuzie propuse în ultimii ani, arhitectura Renoise are dificultăți în a face orice schimbare reală a aspectului imaginii, cu doar o indicație perfunctorie a unei cravate care apare la baza gâtului pisicii.

La fel ca multe alte cadre de editare de imagini bazate pe difuzie propuse în ultimii ani, arhitectura Renoise are dificultăți în a face orice schimbare reală a aspectului imaginii, cu doar o indicație perfunctorie a unei cravate care apare la baza gâtului pisicii.

Pe de altă parte, dacă procesul prioritizează editabilitatea, modelul slăbește strânsoarea asupra originalului, făcând mai ușor introducerea de modificări – dar la costul consistenței generale cu imaginea sursă:

Misiune îndeplinită - dar este o transformare și nu o ajustare, pentru majoritatea cadrelor de editare de imagini bazate pe inteligență artificială.

Misiune îndeplinită – dar este o transformare și nu o ajustare, pentru majoritatea cadrelor de editare de imagini bazate pe inteligență artificială.

Deoarece este o problemă cu care resursele considerabile ale Adobe se luptă să o abordeze, putem considera în mod rezonabil că provocarea este notabilă și nu poate permite soluții ușoare, dacă există.

Inversarea strânsă

Prin urmare, exemplele dintr-un nou articol publicat în această săptămână mi-au atras atenția, deoarece lucrarea oferă o îmbunătățire valoroasă și notabilă a stadiului actual al artei în acest domeniu, prin faptul că poate aplica editări subtile și rafinate asupra imaginilor proiectate în spațiul latent al unui model – fără ca editările să fie nesemnificative sau să înăbușe conținutul original din imaginea sursă:

Cu Inversarea strânsă aplicată metodelor de inversare existente, selecția sursă este considerată într-un mod mult mai granular, iar transformările se conformează materialului original în loc de a-l suprascrie.

Cu Inversarea strânsă aplicată metodelor de inversare existente, selecția sursă este considerată într-un mod mult mai granular, iar transformările se conformează materialului original în loc de a-l suprascrie.

Amatorii și practicienii de LDM pot recunoaște acest tip de rezultat, deoarece o mare parte din acesta poate fi creată într-un flux de lucru complex utilizând sisteme externe precum Controlnet și IP-Adapter:

De fapt, noua metodă – denumită Inversarea strânsă – utilizează într-adevăr IP-Adapter, împreună cu un model dedicat bazat pe față, pentru reprezentări umane.

Din articolul original IP-Adapter din 2023, exemple de editări adecvate ale materialului sursă. Sursă: https://arxiv.org/pdf/2308.06721

Din articolul original IP-Adapter din 2023, exemple de editări adecvate ale materialului sursă. Sursă: https://arxiv.org/pdf/2308.06721

Realizarea semnificativă a Inversării strânse, atunci, este de a fi proceduralizat tehnici complexe într-un modul de plug-in care poate fi aplicat sistemelor existente, inclusiv multe dintre cele mai populare distribuții LDM.

Natural, acest lucru înseamnă că Inversarea strânsă (TI), la fel ca sistemele auxiliare pe care le utilizează, folosește imaginea sursă ca factor de condiționare pentru versiunea editată, în loc de a se baza doar pe prompturi de text precise:

Mai multe exemple ale capacității Inversării strânse de a aplica editări cu adevărat amestecate materialului sursă.

Mai multe exemple ale capacității Inversării strânse de a aplica editări cu adevărat amestecate materialului sursă.

Deși autorii admit că abordarea lor nu este lipsită de tensiunea tradițională și continuă între fidelitate și editabilitate în tehnici de editare de imagini bazate pe difuzie, ei raportează rezultate de ultimă oră atunci când injectează TI în sisteme existente, comparativ cu performanța de bază.

Noua lucrare se intitulează Inversarea strânsă: inversarea condiționată de imagine pentru editarea reală de imagini și provine de la cinci cercetători de la Universitatea Tel Aviv și Snap Research.

Metodă

Inițial, un model de limbaj mare (LLM) este utilizat pentru a genera un set de prompturi de text variate din care o imagine este generată. Apoi, inversarea DDIM menționată anterior este aplicată fiecărei imagini cu trei condiții de text: promptul de text utilizat pentru a genera imaginea; o versiune scurtată a acestuia; și un prompt gol (vid).

Cu zgomotul inversat returnat de aceste procese, imaginile sunt regenerate cu aceeași condiție și fără îndrumarea clasificatorului gratuit (CFG).

Rezultatele inversării DDIM pe diverse metrice cu setări de prompt variate.

Rezultatele inversării DDIM pe diverse metrice cu setări de prompt variate.

Pe măsură ce putem vedea din graficul de mai sus, scorurile pe diverse metrice sunt îmbunătățite cu lungimea textului crescută. Metricile utilizate au fost raportul de semnal la zgomot de vârf (PSNR); distanța L2; indicele de similaritate structurală (SSIM); și similaritatea percepției învățate a patch-ului de imagine (LPIPS).

Conștient de imagine

Inversarea strânsă schimbă, în esență, modul în care un model de difuzie edită imagini reale, condiționând procesul de inversare de imaginea însăși, în loc de a se baza doar pe prompturi de text.

Normal, inversarea unei imagini în spațiul de zgomot al unui model de difuzie necesită estimarea zgomotului de start care, atunci când este denzumat, reconstruiește intrarea. Metodele standard utilizează un prompt de text pentru a ghida acest proces; dar un prompt imperfect poate duce la erori, pierderea de detalii sau modificarea structurilor.

Inversarea strânsă utilizează, în schimb, IP-Adapter pentru a introduce informații vizuale în model, astfel încât acesta să reconstruiască imaginea cu o acuratețe mai mare, convertind imaginile sursă în tokeni de condiționare și proiectându-i în conducta de inversare.

Acești parametri sunt editabili: creșterea influenței imaginii sursă face reconstrucția aproape perfectă, în timp ce reducerea acesteia permite modificări mai creative. Acest lucru face Inversarea strânsă utilă atât pentru modificări subtile, precum schimbarea culorii unei cămăși, cât și pentru editări mai semnificative, precum înlocuirea obiectelor – fără efectele secundare comune ale altor metode de inversare, cum ar fi pierderea detaliilor fine sau apariția de aberrări neașteptate în conținutul de fundal.

Autorii afirmă:

‘Remarcăm că Inversarea strânsă poate fi integrată ușor cu metodele de inversare anterioare (de exemplu, Edit Friendly DDPM, ReNoise) prin [înlocuirea nucleului de difuzie nativ cu modelul modificat de IP-Adapter], [și] Inversarea strânsă îmbunătățește în mod constant aceste metode în ceea ce privește atât reconstrucția, cât și editabilitatea.’

Date și teste

Cercetătorii au evaluat TI în ceea ce privește capacitatea sa de a reconstrui și edita imagini sursă din lumea reală. Toate experimentele au utilizat Stable Diffusion XL cu un programator DDIM, așa cum este descris în articolul original Stable Diffusion; și toate testele au utilizat 50 de pași de denoising la o scară de îndrumare implicită de 7,5.

Pentru condiționarea imaginii, a fost utilizat IP-Adapter-plus sdxl vit-h. Pentru teste cu câteva pași, cercetătorii au utilizat SDXL-Turbo cu un programator Euler și au efectuat, de asemenea, experimente cu FLUX.1-dev, condiționând modelul în acest ultim caz pe PuLID-Flux, utilizând RF-Inversarea la 28 de pași.

PuLID a fost utilizat doar în cazurile care implicau fețe umane, deoarece acesta este domeniul pentru care PuLID a fost antrenat – și, deși este remarcabil faptul că un subsistem specializat este utilizat pentru acest tip de prompt, interesul nostru excesiv pentru generarea de fețe umane sugerează că a ne bază doar pe greutățile unui model de bază, cum ar fi Stable Diffusion, nu poate fi suficient pentru standardele pe care le cerem pentru această sarcină particulară.

Testele de reconstrucție au fost efectuate pentru evaluarea calitativă și cantitativă. În imaginea de mai jos, putem vedea exemple calitative pentru inversarea DDIM:

Rezultate calitative pentru inversarea DDIM. Fiecare rând arată o imagine foarte detaliată lângă versiunile sale reconstruite, cu fiecare pas utilizând condiții din ce în ce mai precise în timpul inversării și denoisingului. Pe măsură ce condiționarea devine mai precisă, calitatea reconstrucției se îmbunătățește. Coloana din dreapta arată cele mai bune rezultate, unde imaginea originală însăși este utilizată ca condiție, atingând fidelitatea cea mai înaltă. CFG nu a fost utilizat în niciun stadiu. Vă rugăm să consultați documentul sursă pentru o rezoluție și detalii mai bune.

Rezultate calitative pentru inversarea DDIM. Fiecare rând arată o imagine foarte detaliată lângă versiunile sale reconstruite, cu fiecare pas utilizând condiții din ce în ce mai precise în timpul inversării și denoisingului.

Autorii afirmă:

‘Aceste exemple subliniază că condiționarea procesului de inversare de o imagine îmbunătățește semnificativ reconstrucția în regiunile foarte detaliate.

‘În mod remarcabil, în al treilea exemplu din [imaginea de mai jos], metoda noastră reconstruiește cu succes tatuajul de pe spatele boxerului din dreapta. Mai mult, poza piciorului boxerului este păstrată mai precis, iar tatuajul de pe picior devine vizibil.’

Mai multe rezultate calitative pentru inversarea DDIM. Condițiile descriptive îmbunătățesc inversarea DDIM, cu condiționarea imaginii care depășește textul, în special pe imagini complexe.

Mai multe rezultate calitative pentru inversarea DDIM. Condițiile descriptive îmbunătățesc inversarea DDIM, cu condiționarea imaginii care depășește textul, în special pe imagini complexe.

Autorii au testat, de asemenea, Inversarea strânsă ca modul de plug-in pentru sisteme existente, comparând versiunile modificate cu performanța lor de bază.

Cele trei sisteme testate au fost inversarea DDIM menționată anterior și RF-Inversarea; și, de asemenea, ReNoise, care împărtășește o parte din autorii articolului discutat aici. Deoarece rezultatele DDIM nu au dificultăți în a obține o reconstrucție de 100%, cercetătorii s-au concentrat doar pe editabilitate.

(Imaginile cu rezultate calitative sunt formate într-un mod care este dificil de reprodus aici, așa că ne referim cititorul la PDF-ul sursă pentru o acoperire mai bună și o rezoluție mai mare, în ciuda faptului că unele selecții sunt prezentate mai jos)

Stânga, rezultate calitative pentru reconstrucția Inversării strânse cu SDXL. Dreapta, reconstrucția cu Flux. Aspectul acestor rezultate în lucrarea publicată face dificilă reproducerea aici, așa că vă rugăm să consultați PDF-ul sursă pentru o impresie adevărată a diferențelor obținute.

Stânga, rezultate calitative pentru reconstrucția Inversării strânse cu SDXL. Dreapta, reconstrucția cu Flux.

Aici autorii comentează:

‘Așa cum se ilustrează, integrarea Inversării strânse cu metodele existente îmbunătățește în mod constant reconstrucția. De exemplu, metoda noastră reconstruiește cu acuratețe balustrada din exemplul din stânga și bărbatul cu cămașa albastră din exemplul din dreapta [din figura 5 a articolului].’

Autorii au testat, de asemenea, sistemul în mod cantitativ. În conformitate cu lucrările anterioare, ei au utilizat setul de validare al MS-COCO și notează că rezultatele (ilustrate mai jos) au îmbunătățit reconstrucția pe toate metricile pentru toate metodele.

Comparația metricilor pentru performanța sistemelor cu și fără Inversarea strânsă.

Comparația metricilor pentru performanța sistemelor cu și fără Inversarea strânsă.

Următorul pas a fost testarea capacității sistemului de a edita fotografii, comparându-l cu versiunile de bază ale abordărilor anterioare prompt2prompt; Edit Friendly DDPM; LED-ITS++; și RF-Inversarea.

Prezentate mai jos sunt o selecție din rezultatele calitative ale articolului pentru SDXL și Flux (și ne referim cititorul la layoutul destul de comprimat al articolului original pentru mai multe exemple).

Selecții din rezultatele calitative extinse (prezentate într-un mod puțin confuz) din întreaga lucrare. Vă rugăm să consultați PDF-ul sursă pentru o rezoluție îmbunătățită și o claritate semnificativă.

Selecții din rezultatele calitative extinse din întreaga lucrare.

Autorii susțin că Inversarea strânsă depășește în mod constant tehniciile de inversare existente, găsind un echilibru mai bun între reconstrucție și editabilitate. Metodele standard, cum ar fi inversarea DDIM și ReNoise, pot recupera o imagine bine, dar adesea au dificultăți în a păstra detalii fine atunci când se aplică editări.

În schimb, Inversarea strânsă utilizează condiționarea imaginii pentru a ancora ieșirea modelului mai strâns de original, prevenind distorsiunile nedorite. Autorii susțin că, chiar și atunci când abordările concurente produc reconstrucții care par precise, introducerea de editări adesea duce la artefacte sau incoerențe structurale, și că Inversarea strânsă atenuează aceste probleme.

În final, rezultate cantitative au fost obținute prin evaluarea Inversării strânse împotriva benchmark-ului MagicBrush, utilizând inversarea DDIM și LEDITS++, măsurate cu CLIP Sim.

Comparații cantitative ale Inversării strânse împotriva benchmark-ului MagicBrush.

Comparații cantitative ale Inversării strânse împotriva benchmark-ului MagicBrush.

Autorii conchid:

‘În ambele grafice, compromisul dintre păstrarea imaginii și conformarea cu editarea țintă este clar observat. Inversarea strânsă oferă un control mai bun asupra acestui compromis și păstrează mai bine imaginea de intrare, aliniindu-se în același timp cu editarea [prompt]. ‘

‘Remarcăm, de asemenea, că o similaritate CLIP de peste 0,3 între o imagine și un prompt de text indică o aliniere plauzibilă între imagine și prompt.’

Concluzie

Deși nu reprezintă o “descoperire” în una dintre cele mai spinătoase provocări ale sintezei de imagini bazate pe LDM, Inversarea strânsă consolidează o serie de abordări auxiliare într-o metodă unificată de editare de imagini cu ajutorul inteligenței artificiale.

Deși tensiunea dintre editabilitate și fidelitate nu a dispărut sub această metodă, ea este în mod semnificativ redusă, conform rezultatelor prezentate. Având în vedere că provocarea centrală pe care o abordează această lucrare poate dovedi a fi în cele din urmă intractabilă dacă este abordată pe propriile sale termene (mai degrabă decât a căuta dincolo de arhitecturile bazate pe LDM în sistemele viitoare), Inversarea strânsă reprezintă o îmbunătățire binevenită și incrementală a stadiului actual al artei.

 

Publicat pentru prima dată vineri, 28 februarie 2025

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai