AI-mallit ja alustat

Uusi Työkalu Voisi Näyttää Tutkijoille, Mitä GAN:jä Jättävät Pois Kuvasta

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Hiljattain MIT-IBM Watson AI Lab:n tutkijaryhmä loi menetelmän, jolla voidaan näyttää, mitä Generative Adversarial Network (GAN) jättää pois kuvasta, kun se pyydetään generoimaan kuvia. Tutkimus nimettiin Näkeminen, mitä GAN ei voi generoida, ja se esiteltiin äskettäin International Conference on Computer Vision -konferenssissa.

Generative Adversarial Networks ovat kehittyneet entisestään viime vuosina ja ovat tulleet yhä monipuolisemmiksi ja laajemmin käytetyiksi. Ne ovat oppineet tuottamaan yksityiskohtaisia kuvia, kunhan kuva on rajattu suhteellisen pienelle alueelle. Kuitenkin, kun GAN:eja käytetään kuvien generoimiseen laajemmista kohteista ja ympäristöistä, ne eivät suoriudu yhtä hyvin. Tilanteissa, joissa GAN:eja käytetään kuvien generoimiseen, jotka sisältävät monia objekteja ja kohteita, kuten kiireinen katu, GAN:t usein jättävät monia tärkeitä yksityiskohtia pois.

MIT Newsin mukaan tutkimus kehitettiin osittain David Bau:n toimesta, joka on jatko-opiskelija sähkötekniikan ja tietotieteiden laitoksella MIT:ssä. Bau selitti, että tutkijat keskittyvät yleensä parantamaan sitä, mihin koneoppimisjärjestelmät kiinnittävät huomiota ja mihin tiettyjä syötearvoja voidaan kytkeä tiettyihin tuloksiin. Bau selitti myös, että ymmärtäminen siitä, mitä dataa koneoppimismallit jättävät huomiotta, on usein yhtä tärkeää, ja tutkimusryhmä toivoo, että heidän työkalunsa inspiroivat tutkijoita kiinnittämään huomiota jääneisiin tietoihin.

Bau:n kiinnostus GAN:eja heräsi siitä, että ne voivat olla hyödyllisiä tutkimuksessa mustan laatikon luonteesta ja antavat intuition siitä, miten verkostot voivat toimia. Bau työskenteli aiemmin työkalun parissa, joka pystyy tunnistamaan tiettyjä ryhmiä tekoälyneuronien kanssa, joita voidaan merkitä vastaaviksi todellisten esineiden, kuten kirjojen, pilvien ja puiden, edustajiksi. Bau työskenteli myös GANPaint-työkalun parissa, joka mahdollistaa taiteilijoille poistaa ja lisätä tiettyjä piirteitä valokuvista GAN:eja käyttäen. Bau:n mukaan GANPaint-sovellus paljasti mahdollisen ongelman GAN:eissa, josta tuli ilmi, kun Bau analysoi kuvia. Kuten Bau kertoi MIT Newsille:

“Minun ohjaajani on aina rohkaissut meitä katselemaan lukujen ulkopuolelle ja tarkastelemaan itse kuvia. Kun katsoimme, ilmiö hyppäsi ulos: Ihmiset jätettiin pois valikoivasti.”

Koneoppimisjärjestelmät on suunniteltu havaitsemaan kuvista mallit, mutta ne voivat myös jättää huomiotta merkityksellisiä malleja. Bau ja muut tutkijat kouluttivat GAN:eja erilaisilla sisä- ja ulkotilakohtauksilla, mutta kaikissa eri tyypeissä GAN:t jättivät pois tärkeitä yksityiskohtia, kuten autoja, tienviittoja, ihmisiä, polkupyöriä jne. Tämä oli totta, vaikka jätetyn kohteen olisi ollut tärkeä kohtaus kuvaamisessa.

Tutkimusryhmä oletti, että kun GAN on koulutettu kuvilla, GAN voi löytää helpommin kuvan helppoja malleja, kuten suuria staattisia objekteja, kuten maisemia ja rakennuksia. Se oppii nämä mallit helpommin kuin vaikeammin tulkittavat mallit, kuten autot ja ihmiset. On ollut yleisesti tiedossa, että GAN:t usein jättävät pois tärkeitä, merkityksellisiä yksityiskohtia kuvissa, mutta MIT-tiimin tutkimus saattaa olla ensimmäinen kerta, kun GAN:eja on todettu jättävän pois koko objektien luokat kuvista.

Tutkimusryhmä toteaa, että GAN:eilla on mahdollista saavuttaa numeeriset tavoitteensa, vaikka ne jättäisivät pois objekteja, jotka ihmiset pitävät tärkeinä kuvissa. Jos GAN:eilla generoituja kuvia käytetään kompleksisten järjestelmien, kuten itseohjautuvien ajoneuvojen, kouluttamiseen, kuvadataa on tarkasteltava tarkkaan, koska on olemassa todellinen huolenaihe, että kriittiset objektit, kuten merkit, ihmiset ja muut autot, voivat jäädä pois kuvista. Bau selitti, että heidän tutkimuksensa osoittaa, miksi mallin suorituskykyä ei pidä perustaa ainoastaan tarkkuuteen:

“Meidän on ymmärrettävä, mitä verkostot tekevät ja mitä eivät tee, jotta varmistetaan, että ne tekevät valinnat, jotka haluamme, että ne tekevät.”

Blogger ja ohjelmoija, jolla on erityisalat Machine Learning ja Deep Learning -aiheissa. Daniel toivoo pystyvänsä auttamaan muita käyttämään tekoälyn voimaa sosiaaliseen hyvään.