Andersonův úhel

Rozdělování “sloučených” lidí v počítačovém vidění

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Nová studie z Hyundai Motor Group Innovation Center v Singapuru nabízí metodu pro rozdělování “sloučených” lidí v počítačovém vidění – těch případů, kdy rámec rozpoznávání objektů nalezl člověka, který je nějakým způsobem “příliš blízko” k jinému člověku (jako je “objímání” nebo “stání za” pózy) a není schopen rozlišit mezi dvěma lidmi, čímž je matou jako jednu osobu nebo entitu.

Dva se stanou jedním, ale to není dobrá věc v semantickém rozdělování. Zde vidíme, že nová soustava dosahuje špičkových výsledků v individuaci propletených lidí v komplexních a náročných obrazech. Zdroj: https://arxiv.org/pdf/2210.03686.pdf

Dva se stanou jedním, ale to není dobrá věc v semantickém rozdělování. Zde vidíme, že nová soustava dosahuje špičkových výsledků v individuaci propletených lidí v komplexních a náročných obrazech. Zdroj: https://arxiv.org/pdf/2210.03686.pdf

Toto je pozoruhodný problém, který získal velkou pozornost ve výzkumné komunitě v posledních letech. Řešení tohoto problému bez zřejmé, ale obvykle nedobytné ceny hyperscale, lidsky vedeného přizpůsobení, by mohlo umožnit zlepšení individuace lidí v text-to-image systémech, jako je Stable Diffusion, které často “roztírají” lidi, kde je požadovaná póza vyžaduje blízkost více osob.

Objalte hrůzu – text-to-image modely, jako je DALL-E 2 a Stable Diffusion (obě jsou uvedeny výše), mají problémy s reprezentací lidí v blízkosti nhau.

Objalte hrůzu – text-to-image modely, jako je DALL-E 2 a Stable Diffusion (obě jsou uvedeny výše), mají problémy s reprezentací lidí v blízkosti nhau.

Generativní modely, jako je DALL-E 2 a Stable Diffusion,目前 neobsahují (alespoň podle našeho vědomí, v případě uzavřeného zdroje DALL-E 2) semantické rozdělování nebo rozpoznávání objektů, tyto hrůzné lidské portmanteau nemohou být vyléčeny aplikací těchto metod – protože stav objektového rozpoznávání a zdrojů není mnohem lepší než CLIP-založené pracovní postupy latentních difúzních modelů.

Nová studie – nazvaná Lidé nemusí označovat více lidí: Occlusion Copy & Paste pro Occluded Human Instance Segmentation– přizpůsobuje a vylepšuje nedávný “řez a vlož” přístup k semi-syntetickým datům, aby dosáhla nové špičkové pozice v úkolu, i proti nejvíce náročným zdrojovým materiálům:

Nová metoda Occlusion Copy & Paste目前 vede v oblasti, i proti předchozím rámcům a přístupům, které řeší výzvu v komplexních a více věnovaných způsobech, jako je například modelování pro zakrytí.

Nová metoda Occlusion Copy & Paste目前 vede v oblasti, i proti předchozím rámcům a přístupům, které řeší výzvu v komplexních a více věnovaných způsobech, jako je například modelování pro zakrytí.

Vyřízněte to!

Upravená metoda – nazvaná Occlusion Copy & Paste – je odvozena z práce z roku 2021 Simple Copy-Paste, vedené Google Research, která navrhla, že superponování extrahovaných objektů a lidí mezi různými zdrojovými trénovacími obrázky by mohlo zlepšit schopnost systému rozpoznat každý instanci nalezenou v obraze:

Z práce z roku 2021 Google Research-led 'Simple Copy-Paste is a Strong Data Augmentation Method for Instance Segmentation', vidíme prvky z jedné fotografie 'migrující' do jiných fotografií, s cílem trénovat lepší a více akční model rozpoznávání obrazu. Zdroj: https://arxiv.org/pdf/2012.07177.pdf

Z práce z roku 2021 Google Research-led ‘Simple Copy-Paste is a Strong Data Augmentation Method for Instance Segmentation’, vidíme prvky z jedné fotografie ‘migrující’ do jiných fotografií, s cílem trénovat lepší model rozpoznávání obrazu. Zdroj: https://arxiv.org/pdf/2012.07177.pdf

Nová verze přidává omezení a parametry do tohoto automatizovaného a algoritmického “přepisování”, analogizující proces do “koše” obrazů plných potenciálních kandidátů pro “přenos” do jiných obrazů, na základě několika klíčových faktorů.

Konceptuální workflow pro OC&P.

Konceptuální workflow pro OC&P.

Rižení prvků

Tyto omezující faktory zahrnují pravděpodobnost řezu a vložení, která zajišťuje, že proces se neodehraje neustále, což by vedlo k “nasycujícímu” efektu, který by podkopával augmentaci dat; počet obrazů, které bude “koš” mít v jednom okamžiku, kde větší počet “segmentů” může zlepšit variabilitu instancí, ale zvýšit čas předzpracování; a rozsah, který určuje počet obrazů, které budou vloženy do “hostitelského” obrazu.

Co se týče posledně jmenovaného, studie poznamenala ‘Potřebujeme dostatečnou zakrytí, aby se udál, ale ne příliš mnoho, protože by mohly obraz překrývat, což by mohlo být škodlivé pro učení.’

Další dvě inovace pro OC&P jsou cílené vkládání a augmentované vkládání instancí.

Cílené vkládání zajišťuje, že vhodný obraz přistane poblíž existující instance v cílovém obraze. V předchozím přístupu, z předchozí práce, byl nový prvek omezen pouze na hranice obrazu, bez ohledu na kontext.

Ačkoli je toto 'vložení', s cíleným vkládáním, zřejmé pro lidské oko, obě OC&P a její předchůdce zjistily, že zvýšená vizuální autenticita není nutně důležitá a mohla by být dokonce škodlivá (viz 'Reality Bites' níže).

Ačkoli je toto ‘vložení’, s cíleným vkládáním, zřejmé pro lidské oko, obě OC&P a její předchůdce zjistily, že zvýšená vizuální autenticita není nutně důležitá a mohla by být dokonce škodlivá (viz ‘Reality Bites’ níže).

Augmentované vkládání instancí zajišťuje, že vložené instance nevykazují “specifický vzhled”, který by mohl být klasifikován systémem nějakým způsobem, což by mohlo vést k vyloučení nebo “zvláštnímu zacházení”, které by mohlo bránit generalizaci a aplikovatelnosti. Augmentované vkládání moduluje vizuální faktory, jako je jasnота a ostrost, škálování a rotace, a sytost – mezi jinými faktory.

Z doplňkových materiálů nové studie: přidání OC&P do existujících rozpoznávacích rámců je poměrně triviální a vede k lepší individuaci lidí v blízkosti nhau. Zdroj: https://arxiv.org/src/2210.03686v1/anc/OcclusionCopyPaste_Supplementary.pdf

Z doplňkových materiálů nové studie: přidání OC&P do existujících rozpoznávacích rámců je poměrně triviální a vede k lepší individuaci lidí v blízkosti nhau. Zdroj: https://arxiv.org/src/2210.03686v1/anc/OcclusionCopyPaste_Supplementary.pdf

Dále OC&P reguluje minimální velikost pro každou vloženou instanci. Například je možné extrahovat obraz jednoho člověka z obrovského davu, který by mohl být vložen do jiného obrazu – ale v takovém případě by malé množství pixelů nebylo pravděpodobně nápomocné pro rozpoznání. Proto systém aplikuje minimální škálu na základě poměru stejné délky strany pro cílový obraz.

Další, OC&P zavedla škálovací vkládání, kde, kromě hledání podobných subjektů jako vloženého subjektu, bere v úvahu velikost ohraničujících boxů v cílovém obraze. Nicméně, toto nevede k kompozitním obrazům, které by lidé považovali za uvěřitelné nebo realistické (viz níže), ale spíše sestavuje semanticky vhodné prvky poblíž sebe způsobem, který je nápomocný během trénování.

Reality Bites

Obě předchozí práce, na kterých je OC&P založena, a současná implementace, přikládají nízkou prioritu autenticitě, nebo “fotorealistické” kvalitě konečného “montážního” obrazu. Ačkoli je důležité, aby konečná sestava nespadla úplně do Dadaismu (jinak by reálné nasazení trénovaných systémů nemohlo doufat, že se setká s prvky v takových scénách, na kterých byly trénovány), obě iniciativy zjistily, že významné zvýšení “vizuální kredibility” nejen přidává k času předzpracování, ale že takové “realistické vylepšení” by mohlo být dokonce kontraproduktivní.

Z doplňkových materiálů nové studie: příklady augmentovaných obrazů s 'náhodným mícháním'. Ačkoli tyto scény mohou vypadat halucinogenně pro člověka, mají stejně tak subjekty vržené dohromady; ačkoli zakrytí jsou fantastická pro lidské oko, povaha potenciálního zakrytí nemůže být známa předem a je nemožné trénovat – proto jsou takové bizarní 'odříznutí' forem dostatečné k donucení trénovaného systému, aby vyhledal a rozpoznal částečné cílové subjekty, bez potřeby vyvinout složité Photoshopové metody, aby scény vypadaly uvěřitelněji.

Z doplňkových materiálů nové studie: příklady augmentovaných obrazů s ‘náhodným mícháním’. Ačkoli tyto scény mohou vypadat halucinogenně pro člověka, mají stejně tak subjekty vržené dohromady; ačkoli zakrytí jsou fantastická pro lidské oko, povaha potenciálního zakrytí nemůže být známa předem a je nemožné trénovat – proto jsou takové bizarní ‘odříznutí’ forem dostatečné k donucení trénovaného systému, aby vyhledal a rozpoznal částečné cílové subjekty, bez potřeby vyvinout složité Photoshopové metody, aby scény vypadaly uvěřitelněji.

Data a testy

Pro fázi testování byl systém trénován na osobě třídě MS COCO datasetu, který obsahuje 262 465 příkladů lidí napříč 64 115 obrázky. Nicméně, aby se získaly lepší masky než MS COCO, obdržely obrázky také LVIS masky anotace.

Vydaný v roce 2019, LVIS, z Facebook Research, je rozsáhlý dataset pro Large Vocabulary Instance Segmentation. Zdroj: https://arxiv.org/pdf/1908.03195.pdf

Vydaný v roce 2019, LVIS, z Facebook Research, je rozsáhlý dataset pro Large Vocabulary Instance Segmentation. Zdroj: https://arxiv.org/pdf/1908.03195.pdf

Abyste mohli vyhodnotit, jak dobře augmentovaný systém může soutěžit s velkým množstvím zakrytých lidských obrazů, výzkumníci postavili OC&P proti OCHuman (Occluded Human) benchmarku.

Příklady z OCHuman datasetu, který byl uveden na podporu Pose2Seg detekčního projektu v roce 2018. Tato iniciativa se snažila získat lepší semantické rozdělování lidí pomocí jejich postoje a pózy jako semantické delimiteru pro pixely, které představují jejich těla. Zdroj: https://github.com/liruilong940607/OCHumanApi

Příklady z OCHuman datasetu, který byl uveden na podporu Pose2Seg detekčního projektu v roce 2018. Tato iniciativa se snažila získat lepší semantické rozdělování lidí pomocí jejich postoje a pózy jako semantické delimiteru pro pixely, které představují jejich těla. Zdroj: https://github.com/liruilong940607/OCHumanApi

Pokud OCHuman benchmark není vyčerpávající anotován, autoři nové studie vytvořili podmnožinu pouze těch příkladů, které byly plně anotovány, nazvanou OCHumanFL. To snížilo počet osob instancí na 2 240 napříč 1 113 obrázky pro validaci a 1 923 instancí napříč 951 obrázky, které byly skutečně použity pro testování. Oba originální a nově vytvořené sady byly testovány, s použitím Mean Average Precision (mAP) jako hlavní metriky.

Pro konzistenci byla architektura vytvořena z Mask R-CNN s ResNet-50 základem a feature pyramid sítí, která poskytuje přijatelný kompromis mezi přesností a rychlostí trénování.

S tím, že výzkumníci poznamenali škodlivý efekt upstream ImageNet vlivu v podobných situacích, celý systém byl trénován od začátku na 4 NVIDIA V100 GPU, po dobu 75 epoch, následujících inicializačních parametrů Facebookova vydání z roku 2021 Detectron 2.

Výsledky

Kromě výše uvedených výsledků, baseline výsledky proti MMDetection (a jeho třem souvisejícím modelům) pro testy ukazovaly jasnou převahu OC&P v jeho schopnosti vybrat lidi z složitých póz.

Kromě překonání PoSeg a Pose2Seg, možná jeden z nejvýznamnějších úspěchů této studie je, že systém může být poměrně obecně aplikován na existující rámce, včetně těch, které byly srovnány v testech (viz srovnávací boxy výše).

Studie uzavírá:

‘Hlavní výhodou našeho přístupu je, že je snadno aplikovatelný s jakýmkoli modelem nebo jinými modelovými vylepšeními. Vzhledem k rychlosti, s níž se hluboké učení pohybuje, je pro každého výhodou mít přístupy, které jsou vysoce interoperabilní se všemi ostatními aspekty trénování. Zanecháváme jako budoucí práci integraci tohoto s modelovými vylepšeními, aby účinně řešila segmentaci instancí zakrytých lidí.’

Potenciál pro zlepšení text-to-obraz syntézy

Vedoucí autor Evan Ling poznamenal, v e-mailu pro nás*, že hlavním přínosem OC&P je, že může zachovat původní masky a získat novou hodnotu z nich “zdarma” v novém kontextu – tj. v obrazech, do kterých byly vloženy.

Ačkoli semantické rozdělování lidí zdá se být úzce spojené s obtížemi, které modely, jako je Stable Diffusion, mají s individuací lidí (místo “sloučení” jich), jakýkoli vliv, který semantické označení může mít na noční můru lidských renderů, které SD a DALL-E 2 často produkují, je velmi, velmi vzdálen.

Miliardy LAION 5B subset obrazů, které osvětlují generativní sílu Stable Diffusion, neobsahují objektové úrovně označení, jako jsou ohraničující boxy a instance masky, i když CLIP architektura, která komponuje renderings z obrazů a databázového obsahu, mohla mít prospěch z takové instance; spíše, LAION obrazy jsou označeny “zdarma”, protože jejich označení byly odvozeny z metadat a environmentálních popisků, atd., které byly spojeny s obrázky, když byly scrapovány z webu do datasetu.

‘Ale to stranou,’ řekl Ling. ‘nějaká forma augmentace podobná naší OC&P může být využita během trénování text-to-obraz generativních modelů. Ale myslím, že realističnost augmentovaného tréninkového obrazu by mohla být problémem.

‘V naší práci ukazujeme, že “dokonalá” realističnost není obecně vyžadována pro supervidované segmentaci instancí, ale nejsem si jist, zda lze stejný závěr vyvodit pro trénování text-to-obraz generativních modelů (zejména když jejich výstupy jsou očekávány jako vysoce realistické). V tomto případě by mohlo být zapotřebí více práce na “dokonalení” realističnosti augmentovaných obrazů.’

CLIP je již používán jako možná multimodální nástroj pro semantické rozdělování, naznačující, že vylepšené systémy rozpoznávání a individuace lidí, jako je OC&P, by mohly být nakonec vyvinuty do systémových filtrů nebo klasifikátorů, které by libovolně odmítaly “sloučené” a deformované lidské reprezentace – úkol, který je obtížné dosáhnout目前 s Stable Diffusion, protože má omezenou schopnost pochopit, kde selhal (kdyby měl takovou schopnost, pravděpodobně by chybu neudělal).

Jen jeden z mnoha projektů, které目前 využívají OpenAI CLIP framework – srdce DALL-E 2 a Stable Diffusion – pro semantické rozdělování. Zdroj: https://openaccess.thecvf.com/content/CVPR2022/papers/Wang_CRIS_CLIP-Driven_Referring_Image_Segmentation_CVPR_2022_paper.pdf

Jen jeden z mnoha projektů, které目前 využívají OpenAI CLIP framework – srdce DALL-E 2 a Stable Diffusion – pro semantické rozdělování. Zdroj: https://openaccess.thecvf.com/content/CVPR2022/papers/Wang_CRIS_CLIP-Driven_Referring_Image_Segmentation_CVPR_2022_paper.pdf

‘Jiným otázkou by bylo,’ navrhuje Ling, ‘zda by jednoduché krmení těchto generativních modelů obrázky zakrytých lidí během trénování fungovalo, bez komplementárního modelového designu, aby se vyřešil problém “sloučení lidí”? To je pravděpodobně otázka, která je obtížná odpovědět okamžitě. Bude určitě zajímavé vidět, jak můžeme vložit nějakou formu instance-úrovně vedení (prostřednictvím instance-úrovně označení, jako je instance maska) během trénování text-to-obraz generativních modelů.’

 

* 10. října 2022

První zveřejnění 10. října 2022.

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai