Andersonův úhel

Lepší výkony strojového učení díky technice CNN založené na změně velikosti obrázků

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Výzkumníci z Google navrhli novou metodu, která zlepšuje efektivitu a přesnost školení počítačového vidění založeného na obrazech tím, že vylepšuje způsob, jakým jsou obrázky ve datové sadě zmenšovány ve fázi předzpracování.

V článku Learning to Resize Images for Computer Vision Tasks výzkumníci Hossein Talebi a Peyman Milanfar využívají CNN k vytvoření nové hybridní architektury pro změnu velikosti obrázků, která přináší významné zlepšení výsledků rozpoznávání získaných z čtyř populárních datových sad počítačového vidění.

Navrhované společné rámce pro rozpoznávání a změnu velikosti. Zdroj: https://arxiv.org/pdf/2103.09950.pdf

Navrhované společné rámce pro rozpoznávání a změnu velikosti. Zdroj: https://arxiv.org/pdf/2103.09950.pdf

Článek uvádí, že metody změny velikosti obrázků, které se目前 používají v automatizovaných školicích procesech strojového učení, jsou již desetiletí zastaralé a často využívají pouze základní bilineární, bikubické a nejbližšího souseda změnu velikosti – metody, které zacházejí se všemi pixely bez rozdílu.

Naopak, navrhovaná metoda rozšiřuje obrazová data prostřednictvím CNN a zahrnuje tento vstup do změněných obrázků, které nakonec projdou architekturou modelu.

Omezení obrázků ve školení AI

Pro školení modelu, který pracuje s obrázky, je součástí rámce strojového učení fáze předzpracování, ve které je systematicky ořezávána a měněna velikost různorodé skupiny obrázků různých velikostí, barevných prostorů a rozlišení (které budou přispívat do školicí datové sady) do konzistentních rozměrů a stabilního, jednotného formátu.

Obecně to bude zahrnovat nějaký kompromis kolem formátu PNG, kde bude stanoven kompromis mezi časem zpracování, velikostí souboru a kvalitou obrázku.

Většinou jsou konečné rozměry zpracovaného obrázku velmi malé. Níže vidíme příklad rozlišení 80×80, ve kterém byly vygenerovány některé z prvních datových sad deepfake:

Toto je rozlišení 80x80, ve kterém byly vygenerovány některé z prvních datových sad deepfake:

Pokud tváře (a další možné předměty) zřídka zapadají do požadovaného čtvercového poměru, mohou být nutné přidat černé pruhy (nebo povolit nevyužitý prostor) za účelem homogenizace obrázků, což dále snižuje skutečný využitelný obrazový data:

Zde byla tvář vyňata z větší obrazové oblasti, dokud nebyla ořezána co nejekonomičtěji, aby zahrnovala celou oblast tváře. Avšak, jak je vidět na pravé straně, velká část zbývající oblasti nebude během školení využita, což přidává větší váhu důležitosti kvality změněných dat.

Zde byla tvář vyňata z větší obrazové oblasti, dokud nebyla ořezána co nejekonomičtěji, aby zahrnovala celou oblast tváře. Avšak, jak je vidět na pravé straně, velká část zbývající oblasti nebude během školení využita, což přidává větší váhu důležitosti kvality změněných dat.

Jak se v posledních letech zlepšily schopnosti GPU, s novou generací karet NVIDIA vybavených zvětšenou kapacitou video-RAM (VRAM), průměrné velikosti přispívajících obrázků začínají růst, ačkoli 224×224 pixelů je stále bastante standardní (například je to velikost ResNet-50 datové sady).

Nezměněný obrázek o velikosti 224x244 pixelů.

Nezměněný obrázek o velikosti 224×244 pixelů.

Umístění dávek do VRAM

Důvod, proč musí všechny obrázky mít stejnou velikost, je ten, že gradientní sestup, metoda, kterou se model zlepšuje s časem, vyžaduje uniformní školicí data.

Důvod, proč musí být obrázky tak malé, je ten, že musí být načteny (plně dekomprimovány) do VRAM během školení v malých dávkách, obvykle mezi 6-24 obrázky na dávku. Příliš málo obrázků na dávku a není dostatek materiálu pro dobré zobecnění, kromě prodloužení školicího času; příliš mnoho a model může selhat při získávání nezbytných charakteristik a detailů (viz níže).

Tato ‘živá načítání’ sekce školicí architektury se nazývá latentní prostor. To je místo, kde jsou rysy opakovaně extrahovány ze stejné datové sady (tj. ze stejné skupiny obrázků), dokud model nedosáhne stavu, ve kterém má všechny potřebné znalosti pro provedení transformací na pozdější, neviditelná data podobného typu.

Tento proces obecně trvá dny, ale může trvat i měsíc nebo více nepřetržitého, vysoce objemového, 24/7 zpracování, aby se dosáhlo užitečného zobecnění. Zvýšení velikosti VRAM je pouze částečně užitečné, protože i malé zvýšení rozlišení obrázku může mít řádově větší efekt na zpracování kapacitu a související účinky na přesnost, které nemusí být vždy výhodné.

Využití větší kapacity VRAM pro ubytování větších dávek je také smíšené požehnání, protože vyšší školicí rychlosti získané touto cestou jsou pravděpodobně kompenzovány méně přesnými výsledky.

Proto, protože školicí architektura je tak omezená, vše, co může mít vliv na zlepšení uvnitř stávajících omezení potrubí, je pozoruhodným úspěchem.

Jak lepší zmenšování pomáhá

Konečná kvalita obrázku, který bude zahrnut do školicí datové sady, byla prokázána jako zlepšení výsledku školení, zejména v úkolech rozpoznávání objektů. V roce 2018 výzkumníci z Max Planck Institute for Intelligent Systems tvrdili, že volba metody opětovného vzorkování významně ovlivňuje výkon školení a výsledky.

Dále, předchozí práce od Google (spoluautorem jsou autoři nového článku) zjistila, že klasifikační přesnost může být zlepšena udržením kontroly nad kompresními artefakty v obrazech datové sady.

Architektura CNN pro navrhovanou algoritmus zmenšování od Google Research.

Architektura CNN pro navrhovanou algoritmus zmenšování od Google Research.

Model CNN integrovaný do nového zmenšovače kombinuje bilineární zmenšování se “skip connection” funkcí, která může zahrnout výstup ze školené sítě do změněného obrázku.

Na rozdíl od typické architektury encoder/decoder, nový návrh může fungovat nejen jako feed-forward úzké místo, ale také jako inverzní úzké místo pro zvětšování na libovolnou cílovou velikost a/nebo poměr stran. Kromě toho lze standardní metodu opětovného vzorkování vyměnit za jakoukoli jinou vhodnou tradiční metodu, jako je Lanczos.

Vysokofrekvenční detaily

Nová metoda produkuje obrázky, které v podstatě “pečou” klíčové rysy (které budou nakonec rozpoznány během školení) přímo do zdrojového obrázku. Z estetického hlediska jsou výsledky netradiční:

Nová metoda aplikovaná na čtyři sítě – Inception V2; DenseNet-121; ResNet-50; a MobileNet-V2. Výsledky metody zmenšování obrázků od Google Research produkují obrázky s očividnou agregací pixelů, předpovídající klíčové rysy, které budou rozpoznány během školení.

Nová metoda aplikovaná na čtyři sítě – Inception V2; DenseNet-121; ResNet-50; a MobileNet-V2. Výsledky metody zmenšování obrázků od Google Research produkují obrázky s očividnou agregací pixelů, předpovídající klíčové rysy, které budou rozpoznány během školení.

Výzkumníci uvádějí, že tyto počáteční experimenty jsou výhradně optimalizovány pro úkoly rozpoznávání obrázků, a že v testech jejich CNN-poháněný “naučený zmenšovač” byl schopen dosáhnout zlepšených chybových rychlostí v těchto úkolech. Výzkumníci mají v úmyslu v budoucnu aplikovat metodu na další typy aplikací počítačového vidění založených na obrazech.

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai