Andersons vinkel

Forbedring af nøjagtigheden af AI-billedredigering

mm
Føj Unite.AI til dine foretrukne kilder på Google
Images from the paper ' Tight Inversion: Image-Conditioned Inversion for Real Image Editing'

Selv om Adobes Firefly latent diffusion model (LDM) kan siges at være en af de bedste, der i øjeblikket er tilgængelige, vil Photoshop-brugere, der har prøvet dens generative funktioner, have lagt mærke til, at den ikke let kan redigere eksisterende billeder – i stedet erstatter den helt brugerens valgte område med billeder baseret på brugerens tekstprompt (selv om Firefly er dygtig til at integrere den resulterende genererede sektion i billedets kontekst).

I den nuværende beta-version kan Photoshop i hvert fald inkorporere et referencebillede som en delvis billedprompt, hvilket bringer Adobes flagskib til niveau med den type funktionalitet, som Stable Diffusion-brugere har nydt af i over to år, takket være tredjepartsframeworks som Controlnet:

Den nuværende beta af Adobe Photoshop tillader brug af referencebilleder, når der genereres ny indhold inden for en markering - selv om det er en hit-and-miss-sag i øjeblikket.

Den nuværende beta af Adobe Photoshop tillader brug af referencebilleder, når der genereres ny indhold inden for en markering – selv om det er en hit-and-miss-sag i øjeblikket.

Dette illustrerer et åbent problem i billedsyntheseforskning – vanskeligheden ved, at diffusionsmodeller har med at redigere eksisterende billeder uden at implementere en fuldstændig ‘genopfindelse’ af den markering, som brugeren har angivet.

Selv om denne diffusionsbaserede inpaint adlyder brugerens prompt, genopfinder den helt billedets oprindelige emne uden at tage det oprindelige billede i betragtning (bortset fra ved at blande den nye generation med omgivelserne). Kilde: https://arxiv.org/pdf/2502.20376

Selv om denne diffusionsbaserede inpaint adlyder brugerens prompt, genopfinder den helt billedets oprindelige emne uden at tage det oprindelige billede i betragtning (bortset fra ved at blande den nye generation med omgivelserne). Kilde: https://arxiv.org/pdf/2502.20376

Dette problem opstår, fordi LDM’er genererer billeder gennem iterativ støjreducering, hvor hvert trin i processen er betinget af den tekstprompt, som brugeren har angivet. Med tekstpromptindholdet konverteret til embedding-tokens og med en hyperskala-model som Stable Diffusion eller Flux, der indeholder hundredtusinder (eller millioner) af næsten-matching-embeddings i forhold til prompten, har processen en beregnet betinget distribution at sigte mod; og hvert trin, der tages, er et skridt mod denne ‘betingede distributionsmål’.

Så det er tekst til billede – en situation, hvor brugeren ‘håber på det bedste’, da der ikke er noget, der kan sige præcis, hvordan generationen vil være.

I stedet har mange forsøgt at bruge en LDM’s kraftige generative kapacitet til at redigere eksisterende billeder – men det indebærer en balancering mellem trofasthed og fleksibilitet.

Når et billede projiceres ind i modellens latente rum ved metoder som DDIM-inversion, er målet at genskabe det oprindelige så nøjagtigt som muligt, samtidig med at det tillader meningsfulde redigeringer. Problemet er, at jo mere præcist et billede genskabes, jo mere holder modellen fast i sin oprindelige struktur, hvilket gør store ændringer vanskelige.

I fællesskab med mange andre diffusionsbaserede billedredigeringsframeworks, der er foreslået i de seneste år, har Renoise-arkitekturen vanskeligheder med at foretage nogen reel ændring i billedets udseende, med kun en perfunctorisk indication af en slips ved katteens hals.

I fællesskab med mange andre diffusionsbaserede billedredigeringsframeworks, der er foreslået i de seneste år, har Renoise-arkitekturen vanskeligheder med at foretage nogen reel ændring i billedets udseende, med kun en perfunctorisk indication af en slips ved katteens hals.

På den anden side, hvis processen prioriterer redigering, løsner modellen sit greb om det oprindelige, hvilket gør det lettere at introducere ændringer – men til en pris for den overordnede konsistens med kildebilledet:

Mission accomplished - men det er en transformation snarere end en justering for de fleste AI-baserede billedredigeringsframeworks.

Mission accomplished – men det er en transformation snarere end en justering for de fleste AI-baserede billedredigeringsframeworks.

Da det er et problem, som selv Adobes betydelige ressourcer kæmper med at løse, kan vi rimeligt overveje, at udfordringen er betydelig og måske ikke tillader lette løsninger, hvis de overhovedet findes.

Tight Inversion

Derfor fik eksemplerne i en ny artikel, der udkom i denne uge, min opmærksomhed, da arbejdet tilbyder en værdig og væsentlig forbedring af den nuværende tilstand i dette område, ved at kunne anvende subtile og raffinerede redigeringer til billeder projiceret ind i modellens latente rum – uden at redigeringerne enten er ubetydelige eller overvælder det oprindelige indhold i kildebilledet:

Med Tight Inversion anvendt på eksisterende inversionsmetoder, betragtes kildevalget på en langt mere detaljeret måde, og transformationerne overensstemmer med det oprindelige materiale i stedet for at overskrive det.

Med Tight Inversion anvendt på eksisterende inversionsmetoder, betragtes kildevalget på en langt mere detaljeret måde, og transformationerne overensstemmer med det oprindelige materiale i stedet for at overskrive det.

LDM-hobbyister og -praktikere kan genkende denne type resultat, da meget af det kan opnås i en kompleks arbejdsgang ved hjælp af eksterne systemer som Controlnet og IP-Adapter.

Faktisk anvender den nye metode – kaldet Tight Inversion – IP-Adapter samt en dedikeret face-baseret model til menneskeafbildninger.

Fra den oprindelige IP-Adapter-artikel fra 2023, eksempler på at lave passende redigeringer af kildematerialet. Kilde: https://arxiv.org/pdf/2308.06721

Fra den oprindelige IP-Adapter-artikel fra 2023, eksempler på at lave passende redigeringer af kildematerialet. Kilde: https://arxiv.org/pdf/2308.06721

Tight Inversions betydeligste præstation er således at have proceduraliseret komplekse teknikker til en enkelt drop-in-plugin-metode, der kan anvendes på eksisterende systemer, herunder mange af de mest populære LDM-distributioner.

Naturligvis betyder dette, at Tight Inversion (TI), ligesom de bifaldende systemer, den anvender, bruger kildebilledet som en betingelsesfaktor for sin egen redigerede version, i stedet for kun at afhænge af præcise tekstprompts:

Yderligere eksempler på Tight Inversions evne til at anvende sandt blandede redigeringer til kildematerialet.

Yderligere eksempler på Tight Inversions evne til at anvende sandt blandede redigeringer til kildematerialet.

Selv om forfatterne indrømmer, at deres tilgang ikke er fri for den traditionelle og vedvarende spænding mellem trofasthed og redigering i diffusionsbaseret billedredigering, rapporterer de om state-of-the-art-resultater, når de injicerer TI i eksisterende systemer, i forhold til baseline-præstationen.

Det nye arbejde har titlen Tight Inversion: Image-Conditioned Inversion for Real Image Editing og kommer fra fem forskere på Tel Aviv Universitet og Snap Research.

Metode

Initialt anvendes en Large Language Model (LLM) til at generere en række varierede tekstprompts, hvorfra et billede genereres. Derefter anvendes den ovennævnte DDIM-inversion på hvert billede med tre tekstbetingelser: den tekstprompt, der anvendes til at generere billedet; en forkortet version af samme; og en null (tom) prompt.

Med den inverse støj, der returneres fra disse processer, genereres billederne igen med samme betingelse og uden klassifikator-fri vejledning (CFG).

DDIM-inversionskorer over forskellige metrikker med varierende prompt-indstillinger.

DDIM-inversionskorer over forskellige metrikker med varierende prompt-indstillinger.

Som vi kan se fra grafen ovenfor, er skorerne over forskellige metrikker forbedret med øget tekstlængde. De metrikker, der anvendes, var Peak Signal-to-Noise Ratio (PSNR); L2-afstand; Structural Similarity Index (SSIM); og Learned Perceptual Image Patch Similarity (LPIPS).

Billedebevidst

Effektivt ændrer Tight Inversion, hvordan en vært-diffusionsmodel redigerer virkelige billeder ved at betinge inversionsprocessen på billedet selv i stedet for kun at afhænge af tekst.

Normalt kræver inversering af et billede ind i en diffusionsmodels støjrum estimering af den startstøj, der, når den afstøjes, genskaber input. Standardmetoder anvender en tekstprompt til at guide denne proces; men en uperfekt prompt kan føre til fejl, tab af detaljer eller ændring af strukturer.

Tight Inversion anvender i stedet IP-Adapter til at føre visuel information ind i modellen, så den genskaber billedet med større nøjagtighed, konverterer kildebillederne til betingelses-tokens og projicerer dem ind i inversionsrøret.

Disse parametre er redigerbare: øgning af kildebilledets indflydelse gør genskabelsen næsten perfekt, mens reduktion tillader mere kreative ændringer. Dette gør Tight Inversion nyttig både til subtile ændringer, såsom ændring af skjortefarve, eller mere betydelige redigeringer, såsom udskiftning af objekter – uden de almindelige bivirkninger af andre inversionsmetoder, såsom tab af fine detaljer eller uventede afvigelser i baggrundens indhold.

Forfatterne skriver:

‘Vi bemærker, at Tight Inversion kan integreres let med tidligere inversionsmetoder (f.eks. Edit Friendly DDPM, ReNoise) ved at [erstatte den native diffusionskerne med IP-Adapter-ændret model], [og] Tight Inversion forbedrer konsekvent disse metoder i forhold til både genskabelse og redigering.’

Data og tests

Forskerne evaluerede TI’s evne til at genskabe og redigere virkelige kildebilleder. Alle eksperimenter anvendte Stable Diffusion XL med en DDIM-scheduler, som beskrevet i den oprindelige Stable Diffusion-artikel; og alle tests anvendte 50 afstøjningstrin med en standard-vejledningsskala på 7,5.

Til billedbetingelse anvendtes IP-Adapter-plus sdxl vit-h. Til få-trins-tests anvendtes SDXL-Turbo med en Euler-scheduler, og der blev også gennemført eksperimenter med FLUX.1-dev, hvor modellen blev betinget på PuLID-Flux, ved hjælp af RF-Inversion på 28 trin.

PulID blev kun anvendt i tilfælde med menneskeansigter, da dette er det domæne, som PulID er trænet til at håndtere – og selv om det er værd at bemærke, at et specialiseret undersystem anvendes til denne ene mulige prompt-type, tyder vores ekstraordinære interesse for at generere menneskeansigter på, at afhængighed af kun de bredere vægte i en grundmodel som Stable Diffusion måske ikke er tilstrækkeligt til de standarder, vi kræver for denne specifikke opgave.

Genskabningstests blev udført til kvalitativ og kvantitativ evaluering. I billedet nedenfor ses kvalitative eksempler for DDIM-inversion:

Kvalitative resultater for DDIM-inversion. Hver række viser et meget detaljeret billede sammen med dets genskabte versioner, hvor hvert trin anvender progressivt mere præcise betingelser under inversion og afstøjning. Da betingelsen bliver mere præcis, forbedres genskabelseskvaliteten. Den højre kolonne viser de bedste resultater, hvor det oprindelige billede selv anvendes som betingelse, og opnår den højeste trofasthed. CFG blev ikke anvendt på noget tidspunkt. Se venligst kilde-dokumentet for bedre opløsning og detaljer.

Kvalitative resultater for DDIM-inversion. Hver række viser et meget detaljeret billede sammen med dets genskabte versioner, hvor hvert trin anvender progressivt mere præcise betingelser under inversion og afstøjning.

Artiklen skriver:

‘Disse eksempler fremhæver, at betingelse af inversionsprocessen på et billede betydeligt forbedrer genskabelse i højt detaljerede områder.

‘Bemærkelsesværdigt er, at i det tredje eksempel [i billedet nedenfor], genskaber vores metode succesfuldt tatoveringen på ryggen af den højre bokser. Desuden er boksens benstilling mere præcis bevaret, og tatoveringen på benet bliver synlig.’

Yderligere kvalitative resultater for DDIM-inversion. Beskrivende betingelser forbedrer DDIM-inversion, og billedbetingelse overgår tekst, især på komplekse billeder.

Yderligere kvalitative resultater for DDIM-inversion. Beskrivende betingelser forbedrer DDIM-inversion, og billedbetingelse overgår tekst, især på komplekse billeder.

Forfatterne testede også Tight Inversion som en drop-in-modul for eksisterende systemer, hvor de satte de modificerede versioner op imod deres baseline-præstation.

De tre systemer, der blev testet, var den ovennævnte DDIM-inversion og RF-inversion; samt ReNoise, som deler nogen af forfatterne med artiklen, der her diskuteres. Da DDIM-resultaterne ikke har svært ved at opnå 100% genskabelse, fokuserede forskerne kun på redigering.

(De kvalitative resultatbilleder er formateret på en måde, der er svær at reproducere her, så vi henviser læseren til kilde-PDF’en for fuld dækning og bedre opløsning, selv om nogen udvalg er vist nedenfor)

Venstre, kvalitative genskabningsresultater for Tight Inversion med SDXL. Højre, genskabning med Flux. Layoutet af disse resultater i den publicerede artikel gør det svært at reproducere her, så se venligst kilde-PDF'en for et sandt indtryk af forskellene, der opnås.

Venstre, kvalitative genskabningsresultater for Tight Inversion med SDXL. Højre, genskabning med Flux.

Her kommenterer forfatterne:

‘Som vist, integrerer Tight Inversion konsekvent med eksisterende metoder og forbedrer genskabelse. For [eksempel] genskaber vores metode nøjagtigt gelænderet i det venstre eksempel og manden med den blå skjorte i det højre eksempel [i figur 5 i artiklen].’

Forfatterne testede også systemet kvantitativt. I overensstemmelse med tidligere arbejder anvendte de valideringssættet af MS-COCO, og bemærker, at resultaterne (vist nedenfor) forbedrede genskabelse over alle metrikker for alle metoder.

Sammenligning af metrikker for systemets præstation med og uden Tight Inversion.

Sammenligning af metrikker for systemets præstation med og uden Tight Inversion.

Derefter testede forfatterne systemets evne til at redigere billeder, hvor de satte det op imod baseline-versioner af tidligere tilgange prompt2prompt; Edit Friendly DDPM; LED-ITS++; og RF-Inversion.

Vist nedenfor er en udvalg af artiklens kvalitative resultater for SDXL og Flux (og vi henviser læseren til den ret komprimerede layout i den originale artikel for yderligere eksempler).

Udvalg af de spredte kvalitative resultater (ret forvirrende) i artiklen. Vi henviser læseren til kilde-PDF'en for bedre opløsning og meningsfuld klarhed.

Udvalg af de spredte kvalitative resultater (ret forvirrende) i artiklen.

Forfatterne hævder, at Tight Inversion konsekvent overgår eksisterende inversionsmetoder ved at finde en bedre balance mellem genskabelse og redigering. Standardmetoder som DDIM-inversion og ReNoise kan genskabe et billede godt, men artiklen fastslår, at de ofte kæmper med at bevare fine detaljer, når redigeringer anvendes.

I modsætning hertil anvender Tight Inversion billedbetingelse til at fæstne modellens output tættere til det oprindelige, og forhindrer uønskede forvrængninger. Forfatterne hævder, at selv når konkurrerende tilgange producerer genskabelser, der ser nøjagtige ud, fører indførelsen af redigeringer ofte til artefakter eller strukturelle inkonsistenser, og at Tight Inversion mildner disse problemer.

Til sidst blev kvantitative resultater opnået ved at evaluere Tight Inversion mod MagicBrush-benchmarket, ved hjælp af DDIM-inversion og LEDITS++, målt med CLIP Sim.

Kvantitative sammenligninger af Tight Inversion mod MagicBrush-benchmarket.

Kvantitative sammenligninger af Tight Inversion mod MagicBrush-benchmarket.

Forfatterne konkluderer:

‘I begge grafer er kompromisset mellem billedbevarelse og overensstemmelse med mål-redigeringen tydeligt [observerbart]. Tight Inversion giver bedre kontrol over dette kompromis og bevarelsen af det oprindelige billede, samtidig med at det stadig er i overensstemmelse med redigeringen [prompt]. ‘

‘Bemærk, at en CLIP-lighed på over 0,3 mellem et billede og en tekstprompt indikerer en plausibel overensstemmelse mellem billedet og prompten.’

Konklusion

Selv om det ikke repræsenterer en ‘gennembrud’ i en af de torneste udfordringer i LDM-baseret billedsynthese, konsoliderer Tight Inversion en række besværlige bifaldende tilgange til en samlet metode til AI-baseret billedredigering.

Selv om spændingen mellem redigering og trofasthed ikke er væk under denne metode, er den dog betydeligt reduceret, ifølge resultaterne, der præsenteres. Da den centrale udfordring, som dette arbejde beskæftiger sig med, kan vise sig at være ultimativt uovervindelig, hvis den håndteres på egne præmisser (i stedet for at se beyond LDM-baserede arkitekturer i fremtidige systemer), repræsenterer Tight Inversion en velkommen inkrementel forbedring af state-of-the-art.

 

Offentliggjort første gang fredag, 28. februar 2025

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai