Andersons vinkel
Förbättring av noggrannheten i AI-bildredigering

Även om Adobes Firefly latent diffusion model (LDM) är en av de bästa som för närvarande finns tillgänglig, har Photoshop-användare som har testat dess generativa funktioner märkt att den inte kan redigera befintliga bilder lätt – istället ersätter den den valda området med bilder baserat på användarens textprompt (även om Firefly är skicklig på att integrera den resulterande genererade delen i bildens sammanhang).
I den nuvarande betaversionen kan Photoshop åtminstone använda en referensbild som en delvis bildprompt, vilket gör Adobes flaggskeppprodukt jämförbar med den funktion som Stable Diffusion-användare har haft i över två år, tack vare tredjepartsramverk som Controlnet:

Den nuvarande betaversionen av Adobe Photoshop tillåter användning av referensbilder när generering av nytt innehåll i ett urval – även om det för närvarande är en hit-or-miss-angelägenhet.
Detta illustrerar ett öppet problem inom bildsyntesforskning – svårigheten som diffusionsmodeller har att redigera befintliga bilder utan att implementera en fullständig “omfattande” av det urval som användaren anger.

Även om denna diffusionsbaserade inpainting följer användarens prompt, återskapar den helt källämnet utan att ta hänsyn till den ursprungliga bilden (utom genom att blanda den nya generationen med miljön). Källa: https://arxiv.org/pdf/2502.20376
Detta problem uppstår eftersom LDM genererar bilder genom iterativt brusreducering, där varje steg i processen är villkorat av den textprompt som tillhandahålls av användaren. När promptinnehållet konverteras till inbäddningstoken och en hyperskalemodell som Stable Diffusion eller Flux innehåller hundratusentals (eller miljoner) nästan matchande inbäddningar relaterade till prompten, har processen en beräknad villkorad fördelning att sträva efter; och varje steg som tas är ett steg mot denna “villkorade fördelningsmål”.
Så det är text till bild – ett scenario där användaren “hoppas på det bästa”, eftersom det inte finns något sätt att veta exakt vad generationen kommer att vara som.
Istället har många försökt att använda en LDM:s kraftfulla generativa kapacitet för att redigera befintliga bilder – men detta innebär en balansgång mellan trohet och flexibilitet.
När en bild projiceras in i modellens latenta utrymme med metoder som DDIM-inversion, är målet att återställa originalet så nära som möjligt samtidigt som det tillåter meningsfulla redigeringar. Problemet är att ju mer exakt en bild återges, desto mer följer modellen sitt ursprungliga struktur, vilket gör stora ändringar svåra.

I likhet med många andra diffusionsbaserade bildredigeringsramverk som föreslagits under de senaste åren har Renoise-arkitekturen svårt att göra någon verklig förändring av bildens utseende, med endast en perfunctorisk indikation av en fluga som syns vid kattens hals.
Å andra sidan, om processen prioriterar redigerbarhet, släpper modellen sitt grepp om originalet, vilket gör det lättare att införa ändringar – men till priset av övergripande konsekvens med källbilden:

Uppdraget är slutfört – men det är en transformation snarare än en justering, för de flesta AI-baserade bildredigeringsramverk.
Eftersom det är ett problem som till och med Adobes betydande resurser kämpar för att hantera, kan vi rimligen betrakta utmaningen som betydande och kanske inte tillåter enkla lösningar, om några alls.
Tight Inversion
Därför fick exemplen i en ny artikel som släpptes den här veckan min uppmärksamhet, eftersom arbetet erbjuder en värdig och värt att notera förbättring av den nuvarande state-of-the-art inom detta område, genom att visa sig kunna applicera subtila och raffinerade redigeringar på bilder som projiceras in i en modells latenta utrymme – utan att redigeringarna antingen är obetydliga eller överväldigar det ursprungliga innehållet i källbilden:

Med Tight Inversion tillämpat på befintliga inverteringsmetoder, betraktas källurvalet på ett långt mer granulärt sätt, och transformationerna följer det ursprungliga materialet istället för att skriva över det.
LDM-hobbyister och praktiker kan känna igen detta resultat, eftersom mycket av det kan skapas i en komplex arbetsflöde med hjälp av externa system som Controlnet och IP-Adapter.
I själva verket använder den nya metoden – som kallas Tight Inversion – faktiskt IP-Adapter, tillsammans med en dedikerad modell för ansikten, för människoavbildningar.

Från den ursprungliga 2023 IP-Adapter-artikeln, exempel på att skapa lämpliga redigeringar av källmaterialet. Källa: https://arxiv.org/pdf/2308.06721
Den signifikanta prestationen av Tight Inversion är att den har proceduraliserat komplexa tekniker till en enda drop-in-plugin-modul som kan appliceras på befintliga system, inklusive många av de mest populära LDM-distributionerna.
Naturligtvis innebär detta att Tight Inversion (TI), liksom de tillhörande system som den använder, använder källbilden som en villkorsfaktor för sin egen redigerade version, istället för att enbart förlita sig på precisa textprompt:

Ytterligare exempel på Tight Inversions förmåga att applicera riktigt blandade redigeringar på källmaterial.
Även om författarna medger att deras tillvägagångssätt inte är fritt från den traditionella och pågående spänningen mellan trohet och redigerbarhet i diffusionsbaserad bildredigering, rapporterar de state-of-the-art-resultat när de injicerar TI i befintliga system, jämfört med baseline-prestanda.
Det nya arbetet heter Tight Inversion: Image-Conditioned Inversion for Real Image Editing och kommer från fem forskare på Tel Aviv University och Snap Research.
Metod
Initialt används en stor språkmodell (LLM) för att generera en uppsättning varierade textprompt från vilka en bild genereras. Sedan appliceras den ovannämnda DDIM-inversionen på varje bild med tre textvillkor: textprompten som användes för att generera bilden; en förkortad version av samma; och en null (tom) prompt.
Med det inverterade bruset som returneras från dessa processer, genereras bilderna igen med samma villkor, och utan klassificeringsfri vägledning (CFG).

DDIM-inversionspoäng över olika mått med varierande promptinställningar.
Som vi kan se från grafen ovan, förbättras poängen över olika mått med ökad textlängd. Måtten som användes var Peak Signal-to-Noise Ratio (PSNR); L2-avstånd; Strukturell likhetsindex (SSIM); och Lärd perceptuell bildpatchlikhet (LPIPS).
Bildmedveten
Effektivt ändrar Tight Inversion hur en värdiffusionsmodell redigerar riktiga bilder genom att villkora inverteringsprocessen på bilden själv, snarare än att enbart förlita sig på text.
Vanligtvis kräver invertering av en bild in i en diffusionsmodells brusutrymme en uppskattning av det startbrus som, när det avbrusas, återställer indata. Standardmetoder använder en textprompt för att vägleda denna process; men en ofullständig prompt kan leda till fel, förlorade detaljer eller ändrade strukturer.
Tight Inversion använder istället IP-Adapter för att mata in visuell information i modellen, så att den återställer bilden med större noggrannhet, omvandlar källbilderna till villkorstoken och projicerar dem in i inverteringspipelinen.
De här parametrarna är redigerbara: ökning av källbildens inflytande gör rekonstruktionen nästan perfekt, medan minskning tillåter för mer kreativa förändringar. Detta gör Tight Inversion användbart för både subtila ändringar, som att ändra en skjortas färg, eller mer betydande redigeringar, som att byta ut föremål – utan de vanliga bieffekterna av andra inverteringsmetoder, som förlust av fina detaljer eller oväntade avvikelser i bakgrunds-innehållet.
Författarna påstår:
‘Vi noterar att Tight Inversion kan enkelt integreras med tidigare inverteringsmetoder (t.ex. Edit Friendly DDPM, ReNoise) genom att [byta ut den nativa diffusionskärnan för IP-Adapter-ändrad modell], [och] Tight Inversion förbättrar konsekvent sådana metoder i termer av både rekonstruktion och redigerbarhet.’
Data och tester
Forskarna utvärderade TI på dess förmåga att återställa och redigera riktiga källbilder. Alla experiment använde Stable Diffusion XL med en DDIM-schemaläggare som beskrivs i den ursprungliga Stable Diffusion-artikeln; och alla tester använde 50 avbrusningssteg vid en standardvägledningsskala på 7,5.
För bildvillkor användes IP-Adapter-plus sdxl vit-h. För fåstegstester användes SDXL-Turbo med en Euler-schemaläggare, och forskarna genomförde också experiment med FLUX.1-dev, villkorande modellen i det senare fallet på PuLID-Flux, med användning av RF-Inversion vid 28 steg.
PulID användes enbart i fall som innehöll mänskliga ansikten, eftersom detta är det område som PulID tränades för att hantera – och medan det är värt att notera att ett specialiserat undersystem används för denna ena möjliga prompttyp, tyder vår ovanliga intresse för att generera mänskliga ansikten på att vi kanske inte kan förlita oss enbart på de breda viktorna i en grundmodell som Stable Diffusion för denna specifika uppgift.
Rekonstruktions tester utfördes för kvalitativ och kvantitativ utvärdering. I bilden nedan ser vi kvalitativa exempel för DDIM-inversion:

Ytterligare kvalitativa resultat för DDIM-inversion. Beskrivande villkor förbättrar DDIM-inversion, med bildvillkor som överträffar text, särskilt på komplexa bilder.
Författarna testade också Tight Inversion som en drop-in-modul för befintliga system, och jämförde de modifierade versionerna med deras baseline-prestanda.
De tre system som testades var den ovannämnda DDIM-inversionen och RF-inversion; och även ReNoise, som delar några författare med den artikel som diskuteras här. Eftersom DDIM-resultat inte har några svårigheter att uppnå 100% rekonstruktion, fokuserade forskarna enbart på redigerbarhet.
(De kvalitativa resultaten är formaterade på ett sätt som är svårt att reproducera här, så vi hänvisar läsaren till käll-PDF för fullständigare täckning och bättre upplösning, trots att vissa urval presenteras nedan)

Vänster, kvalitativa rekonstruktionsresultat för Tight Inversion med SDXL. Höger, rekonstruktion med Flux. Layouten av dessa resultat i den publicerade artikeln gör det svårt att reproducera här, så vänligen se käll-PDF för en sanningsenlig bild av skillnaderna som uppnåddes.
Här kommenterar författarna:
‘Som visas, integrerar Tight Inversion konsekvent med befintliga metoder och förbättrar rekonstruktion. För [exempel], vår metod återställer handräcket i det vänstra exemplet och mannen med den blå skjortan i det högra exemplet [i figur 5 i artikeln].’
Författarna testade också systemet kvantitativt. I linje med tidigare arbeten, använde de valideringsuppsättningen av MS-COCO, och noterar att resultaten (illustrerade nedan) förbättrade rekonstruktionen över alla mått för alla metoder.

Jämförelse av mått för systemens prestanda med och utan Tight Inversion.
Sedan testade författarna systemets förmåga att redigera foton, och jämförde det med baseline-versioner av tidigare tillvägagångssätt prompt2prompt; Edit Friendly DDPM; LED-ITS++; och RF-inversion.
Visas nedan är ett urval av artikeln kvalitativa resultat för SDXL och Flux (och vi hänvisar läsaren till den ganska komprimerade layouten i den ursprungliga artikeln för ytterligare exempel).

Urval från de spridda kvalitativa resultaten (ganska förvirrande) i artikeln. Vänligen se käll-PDF för förbättrad upplösning och meningsfull tydlighet.
Författarna hävdar att Tight Inversion konsekvent överträffar befintliga inverteringstekniker genom att uppnå en bättre balans mellan rekonstruktion och redigerbarhet. Standardmetoder som DDIM-inversion och ReNoise kan återställa en bild väl, men artikeln påstår att de ofta kämpar för att bevara fina detaljer när redigeringar appliceras.
I kontrast använder Tight Inversion bildvillkor för att fästa modellens utdata närmare originalet, och förhindrar oönskade förvrängningar. Författarna hävdar att även när konkurrerande tillvägagångssätt producerar rekonstruktioner som verkar precisa, leder införandet av redigeringar ofta till artefakter eller strukturella oförenligheter, och att Tight Inversion mildrar dessa problem.
Slutligen erhölls kvantitativa resultat genom att utvärdera Tight Inversion mot MagicBrush-benchmark, med användning av DDIM-inversion och LEDITS++, mätt med CLIP Sim.

Kvantitativa jämförelser av Tight Inversion mot MagicBrush-benchmark.
Författarna avslutar:
‘I båda graferna observeras avvägningen mellan bildbevarande och anpassning till målredigering tydligt. Tight Inversion erbjuder bättre kontroll över denna avvägning och bevarar bättre ingångsbilden samtidigt som den anpassar sig till redigeringsprompten.’
‘Notera att en CLIP-likhet på över 0,3 mellan en bild och en textprompt indikerar en trovärdig anpassning mellan bilden och prompten.’
Slutsats
Även om det inte representerar ett “genombrott” i en av de törnigaste utmaningarna i LDM-baserad bildsyntes, konsoliderar Tight Inversion ett antal besvärliga tillhörande tillvägagångssätt till en enhetlig metod för AI-baserad bildredigering.
Även om spänningen mellan redigerbarhet och trohet inte är borta under denna metod, är den betydligt minskad, enligt de presenterade resultaten. Med tanke på att den centrala utmaning som detta arbete hanterar kan visa sig vara slutgiltigt olöslig om den hanteras på sina egna villkor (snarare än att titta bortom LDM-baserade arkitekturer i framtida system), representerar Tight Inversion en välkommen inkrementell förbättring av state-of-the-art.
Publicerad första gången fredag, den 28 februari 2025












