Andersonův úhel

Obnovení a úprava lidských obrazů pomocí umělé inteligence

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
Montage of examples from supplementary material for the paper 'CompleteMe: Reference-based Human Image Completion' (https://liagm.github.io/CompleteMe/pdf/supp.pdf)

Nová spolupráce mezi University of California Merced a Adobe přináší pokrok v oblasti dokončování lidských obrazů – úkolu, který spočívá v „odhalení“ zakrytých nebo skrytých částí obrazů lidí, a to za účelem využití ve virtuálních zkouškách, animaci a úpravě fotografií.

Kromě opravování poškozených obrazů nebo jejich úpravy podle uživatele, systémy dokončování lidských obrazů, jako je CompleteMe, mohou vkládat nové oděvy (pomocí vedlejší referenční obrazu, jako je tomu v prostředním sloupci těchto dvou příkladů) do existujících obrazů. Tyto příklady pocházejí z rozsáhlého doplňkového PDF pro novou práci. Source: https://liagm.github.io/CompleteMe/pdf/supp.pdf

Kromě opravování poškozených obrazů nebo jejich úpravy podle uživatele, systémy dokončování lidských obrazů, jako je CompleteMe, mohou vkládat nové oděvy (pomocí vedlejší referenční obrazu, jako je tomu v prostředním sloupci těchto dvou příkladů) do existujících obrazů. Tyto příklady pocházejí z rozsáhlého doplňkového PDF pro novou práci. Source: https://liagm.github.io/CompleteMe/pdf/supp.pdf

Nový přístup, nazvaný CompleteMe: Reference-based Human Image Completion, používá vedlejší vstupní obrazy k „navrhnutí“ systému, co by mělo nahradit skrytou nebo chybějící část lidského zobrazení (a tím i aplikovatelnost na rámce založené na módní zkoušce):

Systém CompleteMe může přizpůsobit referenční obsah zakryté nebo zakryté části lidského obrazu.

Systém CompleteMe může přizpůsobit referenční obsah zakryté nebo zakryté části lidského obrazu.

Nový systém používá dvojitou architekturu U-Net a blok Region-Focused Attention (RFA), který soustřeďuje zdroje do příslušné oblasti instance obnovy obrazu.

Výzkumníci také nabízejí nový a náročný benchmarkový systém navržený pro hodnocení úkolu dokončování založeného na referenci (protože CompleteMe je součástí stávající a probíhající výzkumné linie v počítačovém vidění, i když dosud neměl žádný benchmarkový schema).

V testech a ve dobře navržené uživatelské studii nová metoda vyšla nejlépe ve většině metrik a celkově. V určitých případech byly soupeřící metody zcela zmateny referenčním přístupem:

Z doplňkového materiálu: metoda AnyDoor má značné potíže s interpretací referenčního obrazu.

Z doplňkového materiálu: metoda AnyDoor má značné potíže s interpretací referenčního obrazu.

Práce uvádí:

‘Rozsáhlé experimenty na našem benchmarku prokázaly, že CompleteMe překonává stávající metody, a to jak reference-based, tak non-reference-based, z hlediska kvantitativních metrik, kvalitativních výsledků a uživatelských studií.

‘Zejména v náročných scénářích zahrnujících složité pozice, složité vzory oděvů a charakteristické doplňky naše model konzistentně dosahuje vyšší vizuální věrnosti a sémantické koherence.’

Bohužel, přítomnost projektu na GitHubu neobsahuje žádný kód, ani slibuje žádný, a iniciativa, která má také skromnou stránku projektu, se zdá být rámována jako proprietární architektura.

Další příklad subjektivního výkonu nového systému ve srovnání s předchozími metodami. Více detailů později v článku.

Další příklad subjektivního výkonu nového systému ve srovnání s předchozími metodami. Více detailů později v článku.

Metoda

Rámec CompleteMe je založen na Reference U-Net, který zpracovává integraci pomocných materiálů do procesu, a na koherentním U-Net, který akomoduje širší řadu procesů pro získání konečného výsledku, jak je znázorněno v konceptuálním schématu níže:

Konceptuální schéma pro CompleteMe. Source: https://arxiv.org/pdf/2504.20042

Konceptuální schéma pro CompleteMe. Source: https://arxiv.org/pdf/2504.20042

Systém nejprve kóduje zakrytý vstupní obraz do latentního zobrazení. Současně Reference U-Net zpracovává několik referenčních obrazů – každý zobrazující různé části těla – pro extrakci detailních prostorových funkcí.

Tyto funkce procházejí blokem Region-focused Attention, který je vložen do „dokončeného“ U-Net, kde jsou selektivně maskovány pomocí odpovídajících regionálních masek, což zajišťuje, že model se soustředí pouze na relevantní oblasti referenčních obrazů.

Maskované funkce jsou poté integrovány s globálními CLIP-odvozenými sémantickými funkcemi pomocí dekomponovaného cross-attention, což umožňuje modelu rekonstruovat chybějící obsah s jemnými detaily a sémantickou koherencí.

Pro zlepšení realismu a robustnosti se proces maskování vstupu kombinuje se náhodnými gridovými zakrytími a maskami lidské tělesné formy, každá aplikovaná s rovnoměrnou pravděpodobností, což zvyšuje složitost chybějících oblastí, které model musí dokončit.

Pouze pro referenci

Předchozí metody pro reference-based image inpainting obvykle spoléhaly na sémantické úrovně kódéry. Projekty tohoto druhu zahrnují CLIP samotný a DINOv2, které extrahují globální funkce z referenčních obrazů, ale často ztrácejí jemné prostorové detaily potřebné pro přesnou identitu.

Z vydání papíru pro starší přístup DINOv2, který je zahrnut v porovnávacích testech nové studie: barevné překryvy ukazují první tři hlavní komponenty z analýzy hlavních komponent (PCA), aplikované na obrazové fragmenty uvnitř každé sloupce, zdůrazňující, jak DINOv2 seskupuje podobné části objektů napříč různými obrazy. Navzdory rozdílům v póze, stylu nebo vykreslení jsou odpovídající oblasti (jako křídla, končetiny nebo kola) konzistentně sladěny, ilustrujíce schopnost modelu učit se strukturu založenou na částech bez dohledu. Source: https://arxiv.org/pdf/2304.07193

Z vydání papíru pro starší přístup DINOv2, který je zahrnut v porovnávacích testech nové studie: barevné překryvy ukazují první tři hlavní komponenty z analýzy hlavních komponent (PCA), aplikované na obrazové fragmenty uvnitř každé sloupce, zdůrazňující, jak DINOv2 seskupuje podobné části objektů napříč různými obrazy. Source: https://arxiv.org/pdf/2304.07193

CompleteMe řeší tento aspekt prostřednictvím specializovaného Reference U-Net inicializovaného z Stable Diffusion 1.5, ale fungujícího bez difúzního šumu*.

Každý referenční obraz, pokrývající různé části těla, je kódován do detailních latentních funkcí prostřednictvím tohoto U-Net. Globální sémantické funkce jsou také extrahovány samostatně pomocí CLIP, a obě sady funkcí jsou uloženy pro efektivní použití během integrace založené na pozornosti. Díky tomu může systém akomodovat několik referenčních vstupů flexibilně, zatímco zachovává jemné vzhledové informace.

Orchestrace

Koherentní U-Net řídí konečné fáze procesu dokončování. Adaptovaný z inpainting varianty Stable Diffusion 1.5, bere jako vstup maskovaný zdrojový obraz v latentní formě, spolu s detailními prostorovými funkcemi vytaženými z referenčních obrazů a globálními sémantickými funkcemi extrahovanými pomocí kódéru CLIP.

Tyto různé vstupy jsou spojeny prostřednictvím bloku RFA, který hraje kritickou roli při směrování pozornosti modelu k nejrelevantnějším oblastem referenčního materiálu.

Před vstupem do mechanismu pozornosti jsou referenční funkce explicitně maskovány, aby se odstranily nepříbuzné oblasti, a poté sloučeny s latentním zobrazením zdrojového obrazu, zajišťující, že pozornost je směrována co nejpřesněji.

Pro zlepšení této integrace CompleteMe zahrnuje dekomponovaný mechanismus cross-attention adaptovaný z IP-Adapter frameworku:

IP-Adapter, jehož část je začleněna do CompleteMe, je jedním z nejúspěšnějších a nejčastěji využívaných projektů z posledních tří bouřlivých let vývoje architektur latentních difúzních modelů. Source: https://ip-adapter.github.io/

IP-Adapter, jehož část je začleněna do CompleteMe, je jedním z nejúspěšnějších a nejčastěji využívaných projektů z posledních tří bouřlivých let vývoje architektur latentních difúzních modelů. Source: https://ip-adapter.github.io/

To umožňuje modelu zpracovávat prostorově detailní vizuální funkce a širší sémantický kontext prostřednictvím samostatných proudů pozornosti, které jsou později kombinovány, vedoucí k koherentní rekonstrukci, která, podle autorů, zachovává jak identitu, tak jemné detaily.

Benchmarking

Vzhledem k absenci vhodného datasetu pro reference-based human completion, výzkumníci navrhli svůj vlastní. Benchmark (bez názvu) byl vytvořen kurátorstvím vybraných obrazových párů z datasetu WPose, vytvořeného pro projekt Adobe Research 2023 UniHuman.

Příklady póz z projektu Adobe Research 2023 UniHuman. Source: https://github.com/adobe-research/UniHuman?tab=readme-ov-file#data-prep

Příklady póz z projektu Adobe Research 2023 UniHuman. Source: https://github.com/adobe-research/UniHuman?tab=readme-ov-file#data-prep

Výzkumníci ručně nakreslili zdrojové masky pro označení oblastí inpainting, nakonec získali 417 tripartitních obrazových skupin tvořících zdrojový obraz, masku a referenční obraz.

Dva příklady skupin odvozených z referenčního datasetu WPose a kurátorstvím výzkumníky nové práce.

Dva příklady skupin odvozených z referenčního datasetu WPose a kurátorstvím výzkumníky nové práce.

Autorů použili velký jazykový model LLaVA k generování textových promptů popisujících zdrojové obrazy.

Metriky používané byly rozsáhlejší než obvykle; kromě obvyklého Peak Signal-to-Noise Ratio (PSNR), Structural Similarity Index (SSIM) a Learned Perceptual Image Patch Similarity (LPIPS, v tomto případě pro hodnocení maskovaných oblastí), výzkumníci použili DINO pro skóre podobnosti; DreamSim pro hodnocení výsledků generace; a CLIP.

Data a testy

Pro testování práce autoři využili jak výchozí model Stable Diffusion V1.5, tak model inpainting 1.5. Obrázky encoder systému používaly model CLIP Vision, spolu s projekčními vrstvami – skromnými neuronovými sítěmi, které přepojují nebo zarovnávají výstupy CLIP, aby odpovídaly vnitřním rozměrům funkcí používaných modelem.

Školení probíhalo po 30 000 iterací na osmi GPU NVIDIA A100, dohlížených Mean Squared Error (MSE) ztrátou, při velikosti batch 64 a learning rate 2×10-5. Různé prvky byly náhodně vyřazeny během školení, aby se zabránilo systému přeučení na datech.

Dataset byl modifikován z Parts to Whole datasetu, který je sám založen na DeepFashion-MultiModal datasetu.

Příklady z datasetu Parts to Whole, použitých při vývoji kurátorovaných dat pro CompleteMe. Source: https://huanngzh.github.io/Parts2Whole/

Příklady z datasetu Parts to Whole, použitých při vývoji kurátorovaných dat pro CompleteMe. Source: https://huanngzh.github.io/Parts2Whole/

Autoři uvádějí:

‘Abychom splnili naše požadavky, [přebudujeme] trénovací páry pomocí zakrytých obrazů s několika referenčními obrazy, které zachycují různé aspekty lidského vzhledu, spolu s jejich krátkými textovými popisy.

‘Každý vzorek v našem trénovacím datovém souboru zahrnuje šest typů vzhledu: horní části oděvu, spodní části oděvu, celého těla, vlasů nebo pokrývek hlavy, obličeje a bot. Pro strategii maskování aplikujeme 50% náhodného gridového maskování mezi 1 a 30 krát, zatímco pro zbývajících 50% používáme masku lidské tělesné formy, aby se zvýšila složitost maskování.

‘Po konstrukční pipeline jsme získali 40 000 obrazových párů pro trénink.’

Srovnávací předchozí non-reference metody testované byly Large occluded human image completion (LOHC) a plug-and-play image inpainting model BrushNet; reference-based modely testované byly Paint-by-Example; AnyDoor; LeftRefill; a MimicBrush.

Autoři začali kvantitativním srovnáním na dříve uvedených metrikách:

Výsledky počátečního kvantitativního srovnání.

Výsledky počátečního kvantitativního srovnání.

Co se týče kvantitativního hodnocení, autoři poznamenávají, že CompleteMe dosahuje nejvyšších skóre v většině percepčních metrik, včetně CLIP-I, DINO, DreamSim a LPIPS, které jsou určeny k zachycení sémantické shody a vzhledové věrnosti mezi výstupem a referenčním obrazem.

Jedná se však o to, že model nevyhrává ve všech případech. Zvláště BrushNet dosahuje nejvyššího skóre v CLIP-T, LeftRefill vede v SSIM a PSNR, a MimicBrush mírně překonává v CLIP-I.

CompleteMe vykazuje celkově silné výsledky, ale rozdíly ve výkonu jsou v některých případech skromné, a určitá metrika zůstává vedená srovnávacími metodami. Autoři rámcují tyto výsledky jako důkaz vyvážené síly CompleteMe napříč strukturálními i percepčními rozměry.

Ilustrace pro kvalitativní testy provedené v rámci studie jsou příliš četné, než aby je bylo možné zde reprodukovat, a odkazujeme čtenáře nejen na původní papír, ale i na rozsáhlý doplňkový PDF, který obsahuje mnoho dalších kvalitativních příkladů.

Podtrháváme primární kvalitativní příklady prezentované v hlavním papíru, spolu s výběrem dalších případů vybraných z doplňkového obrazového fondu, který byl uveden dříve v tomto článku:

Počáteční kvalitativní výsledky prezentované v hlavním papíru. Prosím, odkážete se na původní papír pro lepší rozlišení.

Počáteční kvalitativní výsledky prezentované v hlavním papíru. Prosím, odkážete se na původní papír pro lepší rozlišení.

K kvalitativním výsledkům zobrazeným výše autoři komentují:

‘Dané maskované vstupy, tyto non-reference metody generují věrohodný obsah pro maskované oblasti pomocí obrazových předloh nebo textových promptů.

‘Nicméně, jak je naznačeno v červené rámečku, nemohou reprodukovat specifické detaily, jako jsou tetování nebo jedinečné vzory oděvů, protože jim chybí referenční obrazy, které by řídily rekonstrukci identické informace.’

Druhé srovnání, jehož část je zobrazena níže, se zaměřuje na čtyři reference-based metody Paint-by-Example, AnyDoor, LeftRefill a MimicBrush. Zde byl poskytnut pouze jeden referenční obraz a textový prompt.

Kvalitativní srovnání s reference-based metodami. CompleteMe produkuje realističtější dokončování a lépe zachovává specifické detaily z referenčního obrazu. Červené rámečky zvýrazňují oblasti zvláštního zájmu.

Kvalitativní srovnání s reference-based metodami. CompleteMe produkuje realističtější dokončování a lépe zachovává specifické detaily z referenčního obrazu. Červené rámečky zvýrazňují oblasti zvláštního zájmu.

Autoři uvádějí:

‘Daný maskovaný lidský obraz a referenční obraz, jiné metody mohou generovat věrohodný obsah, ale často selhávají v zachování kontextové informace z referenčního obrazu přesně.

‘V některých případech generují irelevantní obsah nebo nesprávně mapují odpovídající části z referenčního obrazu. Naopak CompleteMe efektivně dokončuje maskovanou oblast zachováváním identické informace a správným mapováním odpovídajících částí lidského těla z referenčního obrazu.’

Pro posouzení, jak dobře modely odpovídají lidskému vnímání, autoři provedli uživatelskou studii zahrnující 15 anotátorů a 2 895 vzorkových párů. Každý pár srovnával výstup CompleteMe s jedním ze čtyř reference-based bazeline metod: Paint-by-Example, AnyDoor, LeftRefill nebo MimicBrush.

Anotátoři hodnotili každý výsledek na základě vizuální kvality dokončené oblasti a rozsahu, v jakém zachovává identifikační rysy z referenčního obrazu – a zde, při hodnocení celkové kvality a identity, CompleteMe získal více definitivní výsledek:

Výsledky uživatelské studie.

Výsledky uživatelské studie.

Závěr

Pokud něco, kvalitativní výsledky v této studii jsou podkopány svou vlastní rozsáhlostí, protože detailní prohlížení ukazuje, že nový systém je vysoce efektivní v této relativně úzké, ale intenzivně sledované oblasti neuronového editování obrazů.

Jedná se však o to, že vyžaduje trochu více péče a přiblížení se k původnímu PDF, aby se docenilo, jak dobře systém přizpůsobuje referenční materiál zakryté oblasti ve srovnání (v téměř všech případech) s předchozími metodami.

Doporučujeme čtenáři pečlivě prozkoumat počátečně matoucí, ne-li přehlcující lavinu výsledků prezentovaných v doplňkovém materiálu.

Doporučujeme čtenáři pečlivě prozkoumat počátečně matoucí, ne-li přehlcující lavinu výsledků prezentovaných v doplňkovém materiálu.

 

* Je zajímavé poznamenat, jak nyní již značně zastaralá verze V1.5 zůstává favoritem výzkumníků – částečně kvůli legacy like-on-like testování, ale také proto, že je nejméně cenzurovaná a možná nejsnáze trénovatelná ze všech iterací Stable Diffusion, a nezdědí cenzurní omezení FOSS Flux verzí.

Specifikace VRAM není uvedena – mohlo by se jednat buď o 40GB nebo 80GB na kartu.

První zveřejnění úterý 29. dubna 2025

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai