AI-mallit ja alustat

Uusi tekniikka auttaa tekoälyä tunnistamaan 3D-objekteja

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Pohjois-Carolinan osavaltion yliopistossa tutkijat ovat kehittäneet uuden tekniikan, joka parantaa tekoälyohjelmien kykyä tunnistaa 3D-objekteja. Tekniikka, jota kutsutaan MonoConiksi, auttaa myös tekoälyä oppimaan, miten 3D-objektit liittyvät toisiinsa tilassa käyttämällä 2D-kuvia.

MonoConilla on mahdollisesti laaja soveltamisala, kuten esimerkiksi autonominen ajoneuvoliikenne, jossa 2D-kuvia käytetään navigoimiseen. Se voi myös olla hyödyllinen valmistuksessa ja robottiikassa.

Tianfu Wu on tutkimusartikkelin vastaava tekijä ja sähkö- ja tietotekniikan apulaisprofessori Pohjois-Carolinan osavaltion yliopistossa.

“Elämme 3D-maailmassa, mutta kun otat valokuvan, se tallentaa maailman 2D-kuvaan”, Wu sanoo.

“Tekoälyohjelmat saavat visuaalisen syötteen kameroista. Jos haluamme, että tekoäly vuorovaikuttaa maailman kanssa, meidän on varmistettava, että se pystyy tulkimaan, mitä 2D-kuvat voivat kertoa 3D-tilasta. Tässä tutkimuksessa keskitymme yhteen haasteen osaan: miten saada tekoäly tunnistamaan 3D-objekteja, kuten ihmisiä tai autoja, 2D-kuvissa ja sijoittamaan ne tilaan”, Wu jatkaa.

Autonominen liikenne

Autonominen liikenne usein riippuu lidarista navigoidakseen 3D-tilassa. Lidar, joka käyttää lasersäteilyä etäisyyden mittaamiseen, on kallista, mikä tarkoittaa, että autonomiset järjestelmät eivät sisällä paljon redundanssia. Useiden lidar-anturien asentaminen massatuotantoon valmistettavaan ajoneuvoon olisi erittäin kallista.

“Mutta jos autonominen ajoneuvo voisi käyttää visuaalista syötettä navigoidakseen tilassa, voitaisiin rakentaa redundanssi”, Wu sanoo. “Kameroita on huomattavasti halvempaa kuin lidaria, joten olisi taloudellisesti kannattavaa sisällyttää lisää kamera-antureita ja rakentaa redundanssi järjestelmään, mikä tekisi siitä turvallisemman ja luotettavamman.

“Tämä on yksi käytännön sovellus. Olemme kuitenkin myös innoissamme tämän työn perustavanlaatuisesta edistymisestä: se on mahdollista saada 3D-tiedot 2D-objekteista.”

Tekoälyn koulutus

MonoCon voi tunnistaa 3D-objekteja 2D-kuvissa ennen kuin sijoittaa ne “rajatun laatikkoon”, joka kertoo tekoälylle objektin reunat.

“Se, mikä erottaa työmme muista, on se, miten koulutamme tekoälyä, joka perustuu aiempiin koulutustekniikoihin”, Wu sanoo. “Kuten aiemmissa pyrkimyksissä, asetamme objektit 3D-rajatuissa laatikoissa kouluttaessamme tekoälyä. Lisäksi pyydämme tekoälyä ennustamaan kameran ja objektin etäisyyden sekä rajatun laatikon mitat. Pyydämme myös tekoälyä ennustamaan kunkin laatikon kahdeksan kohdan sijaintia ja etäisyyden laatikon keskipisteestä kahdessa ulottuvuudessa. Tätä kutsutaan “apuliittymäksi”, ja olemme havainneet, että se auttaa tekoälyä tunnistamaan ja ennustamaan 3D-objekteja 2D-kuvien perusteella tarkemmin.

“Ehdotettu menetelmä perustuu tunnettuun teoreemaan mittateoriassa, Cramér-Woldin teoreemaan. Se on myös mahdollisesti sovellettavissa muihin strukturoitujen tulosten ennustamistehtäviin tietokoneen näön alalla.”

MonoConia testattiin laajasti käytetyllä KITTI-benchmark-aineistolla.

“Silloin, kun jätimme tämän artikkelin, MonoCon suoritti paremmin kuin kymmenet muut tekoälyohjelmat, jotka pyrkivät hakemaan 3D-tietoja autoista 2D-kuvista”, Wu sanoo.

Tutkijaryhmä aikoo nyt laajentaa prosessia suuremmilla aineistoilla.

“Jatkamme tätä prosessia ja työskentelemme suurempien aineistojen kanssa arvioidaksemme ja hienosäätääksemme MonoConia autonomisen ajon käyttöön”, Wu sanoo. “Halumme myös tutkia sovelluksia valmistuksessa, jotta voimme parantaa tehtävien, kuten robottikäsien, suorituskykyä.”

Alex McFarland on AI-toimittaja ja kirjailija, joka tutkii viimeisimpiä kehityksiä tekoälyssä. Hän on tehnyt yhteistyötä useiden AI-startup-yritysten ja julkaisujen kanssa maailmanlaajuisesti.