Andersonův úhel
Asistované editování objektů pomocí Google Imagic a Runway ‘Erase and Replace’

Tento týden byly představeny dvě nové, ale kontrastní AI poháněné grafické algoritmy, které nabízejí novým způsobem umožňují koncovým uživatelům provádět velmi detailní a efektivní změny objektů ve fotografiích.
První z nich je Imagic, od Google Research, ve spolupráci s Izraelským technologickým institutem a Weizmannovým vědeckým institutem. Imagic nabízí textově podmíněné, jemné úpravy objektů prostřednictvím jemného ladění difuzních modelů.

Změňte, co chcete, a nechte zbytek – Imagic slibuje jemné úpravy pouze těch částí, které chcete změnit. Zdroj: https://arxiv.org/pdf/2210.09276.pdf
Kdokoli, kdo se již pokusil změnit pouze jeden prvek ve Stable Diffusion re-render, ví velmi dobře, že pro každou úspěšnou editaci systém změní pět věcí, které jste měli rádi právě tak, jak byly. Je to nedostatek, který目前 má mnoho z nejtalentovanějších SD nadšenců neustále mění mezi Stable Diffusion a Photoshop, aby opravili tento typ “kolaterálního poškození”. Z tohoto úhlu pohledu se zdá, že úspěchy Imagic jsou pozoruhodné.
V době psaní tohoto článku Imagic dosud postrádá i propagační video, a vzhledem k opatrnému postoji Google k vydávání neomezených nástrojů pro syntézu obrazů, je nejasné, do jaké míry, pokud vůbec, budeme mít možnost otestovat systém.
Druhá nabídka je Runway ML’s spíše přístupnější Erase and Replace funkce, nová funkce v sekci “AI Magic Tools” jeho výhradně online sady nástrojů pro vizuální efekty založené na strojovém učení.

Runway ML’s Erase and Replace funkce, již viděná v náhledu pro text-to-video editační systém. Zdroj: https://www.youtube.com/watch?v=41Qb58ZPO60
Pojedneme nyní o Runway’s nabídce.
Vymazat a nahradit
Stejně jako Imagic, Erase and Replace se zabývá výhradně statickými obrázky, i když Runway předvedl stejnou funkčnost v text-to-video editačním systému, který dosud nebyl vydán:

Ačkoli kdokoli může otestovat novou Erase and Replace na obrázcích, video verze dosud není veřejně dostupná. Zdroj: https://twitter.com/runwayml/status/1568220303808991232
Ačkoli Runway ML dosud nezveřejnil detaily technologií za Erase and Replace, rychlost, s jakou můžete nahradit pokojovou rostlinu poměrně přesvědčivou bustou Ronalda Reagana, naznačuje, že difuzní model, jako je Stable Diffusion (nebo, daleko méně pravděpodobně, licencovaný DALL-E 2), je motorem, který znovu vynalézá objekt vaší volby v Erase and Replace.

Nahrazení pokojové rostliny bustou The Gippera není tak rychlé, ale je poměrně rychlé. Zdroj: https://app.runwayml.com/
Systém má některé omezení typu DALL-E 2 – obrázky nebo text, které spustí filtry Erase and Replace, spustí varování o možném pozastavení účtu v případě dalších porušení – prakticky klon OpenAI zásad pro DALL-E 2.
Mnohé výsledky postrádají typické hrubé hrany Stable Diffusion. Runway ML jsou investoři a výzkumní partneři v SD, a je možné, že vyškolili proprietární model, který je lepší než otevřený zdroj 1.4 checkpoint váhy, se kterou se目前 ostatní uživatelé potýkají (jako mnoho jiných vývojových skupin, hobbyist a profesionálů, kteří目前 školí nebo jemně ladí Stable Diffusion modely).

Nahrazení domácího stolu ‘stolem z ledu’ v Runway ML’s Erase and Replace.
Stejně jako Imagic (viz níže), Erase and Replace je ‘objektově orientovaný’ – nemůžete jednoduše vymazat ‘prázdnou’ část obrázku a inpaintovat ji výsledkem vašeho textového podnětu; v tomto scénáři systém prostě stopuje nejbližší zjevný objekt podél linie masky a aplikuje transformaci tam.

Jak název naznačuje, nemůžete injektovat objekty do prázdného prostoru v Erase and Replace. Zde, snaha o vyvolání nejznámějšího ze Sithů lordů vede k podivnému Vaderově murálu na TV, přibližně tam, kde byla ‘nahradit’ oblast nakreslena.
Je obtížné určit, zda Erase and Replace je evazivní ve vztahu k používání autorských obrázků (které jsou dosud značně omezeny, i když s různým úspěchem, v DALL-E 2), nebo zda model používaný v backend renderovacím motoru není prostě optimalizován pro tento typ věcí.

Mírně NSFW ‘Mural of Nicole Kidman’ naznačuje, že (pravděpodobně) difuzní model, který je k dispozici, postrádá DALL-E 2 bývalé systematické odmítnutí renderování realistických tváří nebo rizikového obsahu, zatímco výsledky pro pokusy vyvolat autorská díla se pohybují od ambivalentních (‘xenomorph’) po absurdní (‘the iron throne’). Vložený spodní pravý roh, zdroj obrázku.
Bývalo by zajímavé vědět, jaké metody Erase and Replace používá k izolaci objektů, které je schopná nahradit. Přesně je obrázek procházen prostřednictvím některé derivace CLIP, s diskrétními položkami individuovanými pomocí objektového rozpoznání a následné semantické segmentace. Žádná z těchto operací nefunguje téměř tak dobře v běžné instalaci Stable Diffusion.
Ale nic není dokonalé – někdy systém zdá se, že vymaže a nenahradí, i když (jako jsme viděli na obrázku výše), základní renderovací mechanismus určitě ví, co znamená textový podnět. V tomto případě se ukáže, že je nemožné změnit kavárnu na xenomorfa – spíše stůl jednoduše zmizí.

Strašidelnější iterace ‘Where’s Waldo’, jako Erase and Replace selže při produkci mimozemšťana.
Erase and Replace se zdá být účinným systémem pro nahrazování objektů, s vynikajícím inpaintingem. Nicméně, nemůže editovat stávající vnímané objekty, ale pouze je nahradit. Skutečně změnit stávající obsah obrázku bez ohrožení okolního materiálu je zřejmě mnohem těžší úkol, spojený s dlouhodobým úsilím výzkumu počítačového vidění směrem k disentanglementu v různých latentních prostorech populárních rámců.
Imagic
Je to úkol, který Imagic řeší. Nový článek nabízí mnoho příkladů úprav, které úspěšně mění jednotlivé aspekty fotografie, zatímco zbytek obrázku zůstává nedotčen.

V Imagic, upravené obrázky netrpí charakteristickým táhnutím, zkreslením a ‘occlusion guessing’ charakteristickým pro deepfake loutkářství, které využívá omezené apriory odvozené z jediného obrázku.
Systém používá třístupňový proces – optimalizace textového vloženia; jemné ladění modelu; a konečně, generování upraveného obrázku.

Imagic kóduje cílový textový podnět pro získání počátečního textového vloženia, a poté optimalizuje výsledek pro získání vstupního obrázku. Poté je generativní model jemně laděn pro zdroj obrázku, přidává řadu parametrů, předtím, než je podroben požadované interpolaci.
Nečekaně, rámec je založen na Google’s Imagen text-to-video architektuře, i když výzkumníci uvádějí, že principy systému jsou obecně aplikovatelné na latentní difuzní modely.
Imagen používá třívrstvou architekturu, spíše než sedmivrstvý array používaný pro společnost’s nedávnou text-to-video iteraci softwaru. Tři samostatné moduly se skládají z generativního difuzního modelu, který funguje na 64x64px rozlišení; super-rozlišení modelu, který zvyšuje toto výstup na 256x256px; a další super-rozlišení modelu, který zvyšuje výstup až na 1024×1024 rozlišení.
Imagic zasahuje do nejranější fáze tohoto procesu, optimalizuje požadované textové vloženie na 64px fázi na Adam optimalizátoru na statické učení rychlosti 0,0001.

Mistrovská třída v disentanglementu: ti uživatelé, kteří se pokusili změnit něco tak jednoduchého, jako je barva renderovaného objektu v difuzi, GAN nebo NeRF modelu, ví, jak významné je, že Imagic může provádět takové transformace bez ‘roztahování’ konzistence zbytku obrázku.
Jemné ladění poté probíhá na Imagen’s základním modelu, pro 1500 kroků na vstupní obrázek, podmíněné na revidovaném vložením. Současně je sekundární 64px>256px vrstva optimalizována paralelně na podmíněném obrázku. Výzkumníci uvádějí, že podobná optimalizace pro konečnou 256px>1024px vrstvu má ‘malý nebo žádný’ účinek na konečné výsledky, a proto ji neimplementovali.
Článek uvádí, že proces optimalizace trvá přibližně osm minut pro každý obrázek na dvojici TPUV4 čipů. Konečné vykreslení probíhá v jádru Imagen pod DDIM sampling schématem.
Stejně jako u podobných procesů jemného ladění pro Google’s DreamBooth, výsledné vloženia lze navíc použít k ovlivnění stylizace, stejně jako fotorealistických úprav, které obsahují informace získané z širšího podkladového databáze, která pohání Imagen (protože, jak první sloupec níže ukazuje, zdroj obrázky nemají žádný z nezbytných obsahů pro provedení těchto transformací).

Pružné fotorealistické pohyby a úpravy lze vyvolat pomocí Imagic, zatímco odvozené a disentangled kódy získané v procesu lze stejně snadno použít pro stylizovaný výstup.
Výzkumníci porovnali Imagic s předchozími pracemi SDEdit, GAN-based přístup z roku 2021, spolupráci mezi Stanford University a Carnegie Mellon University; a Text2Live, spolupráci z dubna 2022, mezi Weizmannovým vědeckým institutem a NVIDIA.

Porovnání mezi Imagic, SDEdit a Text2Live.
Je zřejmé, že předchozí přístupy se potýkají, ale v dolní řadě, která zahrnuje velkou změnu postoje, incumbenty zcela selhávají při refiguraci zdrojového materiálu, ve srovnání s pozoruhodným úspěchem Imagic.
Požadavky na zdroje a dobu školení Imagic na úrovni obrázku, zatímco krátké ve srovnání s podobnými aktivitami, činí jej nepravděpodobným zařazením do lokální image editační aplikace na osobních počítačích – a není jasné, do jaké míry by proces jemného ladění mohl být snížen na spotřebitelské úrovně.
Jak stojí, Imagic je působivou nabídkou, která je vhodnější pro API – prostředí, ve kterém Google Research, chary kritiky ve vztahu k usnadňování deepfaking, může být v každém případě nejvíce komfortní.
Poprvé publikováno 18. října 2022.












