Andersonův úhel

Školení modelů počítačového vidění pomocí náhodného šumu místo skutečných obrazů

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Výzkumníci z MIT Computer Science & Artificial Intelligence Laboratory (CSAIL) experimentovali s použitím náhodných šumových obrazů v datech počítačového vidění pro školení modelů počítačového vidění a zjistili, že místo produkce nesmyslů je tato metoda překvapivě efektivní:

Generativní modely z experimentu, seřazeny podle výkonu. Zdroj: https://openreview.net/pdf?id=RQUl8gZnN7O

Generativní modely z experimentu, seřazeny podle výkonu. Zdroj: https://openreview.net/pdf?id=RQUl8gZnN7O

Krmení zjevného “vizuálního odpadu” do populárních architektur počítačového vidění by nemělo vést k tomuto typu výkonu. Na pravé straně obrázku výše představují černé sloupce hodnoty přesnosti (v Imagenet-100) pro čtyři “skutečné” datové sady. Zatímco “náhodné šumové” datové sady, které jim předcházejí (zobrazeny v různých barvách, viz index vlevo nahoře), nemohou dosáhnout stejné úrovně, jsou téměř všechny v rámci úctyhodných horních a dolních mezí (červené čárkované linie) pro přesnost.

V tomto smyslu “přesnost” neznamená, že výsledek nutně vypadá jako tvář, kostel, pizza nebo jakékoli jiné konkrétní domény, pro kterou byste mohli být intéressováni o vytvoření obrazové syntézy systému, jako je Generativní adversní síť nebo encoder/decoder framework.

Spíše to znamená, že modely CSAIL odvodily široce použitelné centrální “pravdy” z obrazových dat, která jsou tak zjevně neuspořádaná, že by neměla být schopna poskytnout je.

Různorodost vs. Naturalismus

Ani tyto výsledky nelze připsat přeučení: živá diskuze mezi autory a recenzenty na Open Review ukazuje, že míchání různých obsahů z vizuálně rozmanitých datových sad (jako “mrtvé listy”, “fraktály” a “procedurální šum” – viz obrázek níže) do trénovací datové sady skutečně zlepšuje přesnost v těchto experimentech.

To naznačuje (a je to trochu revoluční myšlenka) nový typ “podhodnocení”, kde “různorodost” převyšuje “naturalismus”.

Projektová stránka pro iniciativu umožňuje interaktivně prohlížet různé typy náhodných obrazových datových sad použitých v experimentu. Zdroj: https://mbaradad.github.io/learning_with_noise/

Projektová stránka pro iniciativu umožňuje interaktivně prohlížet různé typy náhodných obrazových datových sad použitých v experimentu. Zdroj: https://mbaradad.github.io/learning_with_noise/

Výsledky získané výzkumníky zpochybňují základní vztah mezi obrazovými neuronovými sítěmi a “skutečnými” obrazovými daty, která jsou na ně vržena v alarmujících větším objemech každý rok, a naznačují, že potřeba získat, kurátorsky zpracovat a jinak zpracovat hyperscale obrazová data se může nakonec stát zbytečnou. Autoři uvádějí:

“Současné vizuální systémy jsou trénovány na obrovských datech, a tato data přinášejí náklady: kurátorské zpracování je drahé, dědí se lidské předpojatosti a existují obavy ohledně soukromí a práv použití. Abychom tyto náklady snížili, vzrostl zájem o učení z levnějších zdrojů dat, jako jsou neoznačená obrazová data.”

“V tomto článku jdeme o krok dále a ptáme se, zda můžeme zcela odstranit skutečná obrazová data a učit se z procedurálních šumových procesů.”

Výzkumníci naznačují, že současná generace architektur strojového učení může odvozovat něco mnohem fundamentálnějšího (nebo alespoň neočekávaného) z obrazových dat, než se dříve myslelo, a že “nesmyslné” obrazy mohou potenciálně poskytnout velkou část této znalosti mnohem levněji, i s možným použitím ad hoc syntetických dat, prostřednictvím architektur generování dat, které generují náhodné obrazy během trénování:

“Identifikujeme dvě klíčové vlastnosti, které dělají dobré syntetické data pro trénování vizuálních systémů: 1) naturalismus, 2) různorodost. Zajímavé je, že nejnaturalističtější data nejsou vždy nejlepší, protože naturalismus může přijít na úkor různorodosti. “

“Skutečnost, že naturalistické data pomáhají, není překvapivá, a naznačuje, že skutečně velké reálné data mají hodnotu. Nicméně, zjistili jsme, že to, co je důležité, není to, zda data jsou skutečná, ale zda jsou naturalističtější, tj. musí zachytit určité strukturální vlastnosti skutečných dat. “

“Mnoho z těchto vlastností lze zachytit v jednoduchých šumových modelech.”

<img class="size-full wp-image-179245" src="https://www.unite.ai/wp-content/uploads/2021/12/experiments-random-noise.jpg" alt="Vizualizace funkcí výsledkem z AlexNet-derived encoderu na některých z různých 'náhodných obrazových' datových sadách použitých autory, pokrývajících 3. a 5. (finální) konvoluční vrstvu. Metodika použitá zde následuje tu, která je popsána v Google AI research z roku 2017

.” width=”1200″ height=”462″ /> Vizualizace funkcí výsledkem z AlexNet-derived encoderu na některých z různých ‘náhodných obrazových’ datových sadách použitých autory, pokrývajících 3. a 5. (finální) konvoluční vrstvu. Metodika použitá zde následuje tu, která je popsána v Google AI research z roku 2017.

Článek, prezentovaný na 35. konferenci o zpracování neuronových informací (NeurIPS 2021) v Sydney, se jmenuje Učení vidět tím, že se díváme na šum a pochází od šesti výzkumníků z CSAIL, s rovnocenným příspěvkem.

Práce byla doporučena konsenzem pro výběr na NeurIPS 2021, s peer komentáři charakterizující článek jako “vědecký průlom”, který otevírá “velkou oblast studia”, i když vyvolává tolik otázek, kolik odpovědí.

“Ukázali jsme, že, když jsou navrženy pomocí výsledků z předchozích výzkumů o přírodních obrazových statistikách, tyto datové sady mohou úspěšně trénovat vizuální reprezentace. Doufáme, že tento článek bude motivovat studium nových generativních modelů, které jsou schopny produkovat strukturovaný šum a dosahovat ještě lepšího výkonu při použití v různých vizuálních úkolech.

‘Bylo by možné dosáhnout stejné úrovně výkonu, jako je získání s předtrénováním ImageNet? Možná, v nepřítomnosti velkého trénovacího souboru specifického pro konkrétní úkol, nejlepší předtrénování nemusí být použití standardní reálné datové sady, jako je ImageNet.’

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai