Modely a platformy AI
Nový nástroj může ukázat výzkumníkům, co GANs vynechávají z obrazu
Nedávno tým výzkumníků z MIT-IBM Watson AI Lab vytvořil metodu pro zobrazení toho, co Generative Adversarial Network vynechává z obrazu, když je požádán o generování obrazů. Studie byla nazvána Seeing What a GAN Cannot Generate a byla nedávno představena na Mezinárodní konferenci o počítačovém vidění.
Generative Adversarial Networks se staly v posledních letech robustnějšími, sofistikovanějšími a více používanými. Staly se khá dobrými v renderování obrazů plných detailů, pokud je obraz omezen na relativně malou oblast. Nicméně, když jsou GANs použity pro generování obrazů větších scén a prostředí, často nevykonávají tak dobře. V scénářích, kde jsou GANs požádány o renderování scén plných mnoha objektů a položek, jako je rušná ulice, GANs často vynechávají mnoho důležitých aspektů obrazu.
Podle MIT News byla výzkumu vyvinuta částečně Davidem Bauem, studentem na oddělení elektrotechniky a počítačových věd na MIT. Bau vysvětlil, že výzkumníci se obvykle soustředí na zlepšování toho, na co se systémy strojového učení zaměřují, a na určování, jak určitý vstup může být mapován na určitý výstup. Nicméně, Bau také vysvětlil, že porozumění tomu, co data jsou ignorována strojovými učícími modely, je často stejně důležité a že výzkumný tým doufá, že jejich nástroje inspirují výzkumníky, aby se zaměřili na ignorovaná data.
Bauův zájem o GANs byl vyvolán tím, že je možné použít je k prozkoumání černé skříňky neuronových sítí a k získání intuice o tom, jak sítě mohou.reasonovat. Bau dříve pracoval na nástroji, který mohl identifikovat specifické klastry umělých neuronů, označující je jako zodpovědné za reprezentaci reálných objektů, jako jsou knihy, mraky a stromy. Bau také měl zkušenosti s nástrojem nazvaným GANPaint, který umožňuje umělcům odstraňovat a přidávat specifické funkce z fotografií pomocí GANs. Podle Baua aplikace GANPaint odhalila potenciální problém s GANs, problém, který se stal zjevným, když Bau analyzoval obrazy. Jak Bau řekl MIT News:
„Můj poradce mě vždy povzbuzoval, abych se podíval za čísla a prozkoumal skutečné obrazy. Když jsme se podívali, fenomén vyskočil přímo ven: Lidé byli vynecháni selektivně.”
Zatímco systémy strojového učení jsou navrženy tak, aby extrahovaly vzory z obrazů, mohou také skončit ignorováním relevantních vzorů. Bau a další výzkumníci experimentovali s trénováním GANs na různých vnitřních a vnějších scénách, ale ve všech typech scén GANs vynechaly důležité detaily v scénách, jako jsou auta, dopravní značky, lidé, kola atd. To bylo pravdivé i v případech, kdy objekty vynechány byly důležité pro scénář.
Výzkumný tým hypotézoval, že když je GAN trénován na obrazech, GAN může najít jednodušší vzory obrazu, které jsou snazší reprezentovat, jako jsou velké stacionární objekty, jako jsou krajiny a budovy. Učí se těmto vzorům nad jinými, složitějšími vzory, jako jsou auta a lidé. Je obecně známo, že GANs často vynechávají důležité, smysluplné detaily při generování obrazů, ale studie z MIT týmu může být prvním případem, kdy GANs vynechávají celé třídy objektů v obraze.
Výzkumný tým poznamenává, že je možné, aby GANs dosáhly svých numerických cílů, i když vynechávají objekty, které lidé pečují o, když se dívají na obrazy. Pokud jsou obrazy generované GANs použity pro trénování komplexních systémů, jako jsou autonomní vozidla, obrazová data by měla být pečlivě prozkoumána, protože existuje skutečná obava, že kritické objekty, jako jsou značky, lidé a další auta, mohou být vynechány z obrazů. Bau vysvětlil, že jejich výzkum ukazuje, proč by výkon modelu neměl být založen pouze na přesnosti:
„Musíme pochopit, co sítě dělají a nedělají, abychom se ujistili, že dělají volby, které chceme, aby dělaly.”












