Robotiikka ja fyysinen AI

Konenäön malli ymmärtää objektien väliset suhteet

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Massachusettsin teknillisen korkeakoulun (MIT) tutkijat ovat kehittäneet uuden konenäön mallin, joka ymmärtää objektien väliset suhteet kohtauksessa. Malli edustaa yksittäisiä suhteita yksi kerrallaan ja yhdistää edustukset kuvaamaan koko kohtausta.

Tämän uuden lähestymistavan avulla konenäön malli voi generoida tarkemmin kuvia tekstin kuvausten perusteella, ja se voi tehdä tämän jopa silloin, kun kohtauksessa on useita projekteja, jotka on järjestetty eri suhteissa toisiinsa.

Tämä uusi kehitys on tärkeä, koska monet syvän oppimisen mallit eivät pysty ymmärtämään yksittäisten objektien välisiä suhteita.

Tutkijaryhmän mallia voidaan käyttää tapauksissa, joissa teollisuusroboteilla on suoritettava monivaiheisia manipulaatiotehtäviä, kuten esineiden pinottamista tai laitteiden kokoamista. Se myös auttaa koneiden oppimisessa ja vuorovaikutuksessa ympäristönsä kanssa, aivan ihmisten tapaan.

Yilun Du on tietojenkäsittelytieteen ja tekoälylaboratorion (CSAIL) tohtorikoulutettava ja tutkimuksen yhteisjohtaja. Du johti tutkimusta Shuang Lin kanssa, joka on myös CSAILin tohtorikoulutettava, ja Nan Liu, joka on Illinoisin yliopiston Urbana-Champaignin graduate student. Tutkimukseen osallistuivat myös Joshua B. Tenenbaum, Paul E. Newtonin kehitysprofessori kognitiivisessa tieteen ja laskennan laitoksessa, ja vanhempi tekijä Antonio Torralba, Delta Electronicsin professori sähkötekniikassa ja tietojenkäsittelytieteessä. Molemmat Tenenbaum ja Torralba ovat CSAILin jäseniä.

Uusi kehys

“Kun katson pöytää, en voi sanoa, että siinä on objekti XYZ-koordinaateissa. Meidän mielimme eivät toimi sillä tavalla. Meidän mielimme ymmärtävät kohtauksen objektiensa välisen suhteen perusteella. Uskomme, että rakentamalla järjestelmän, joka voi ymmärtää objektiensa välisiä suhteita, voimme käyttää sitä muokkaamaan ja muuttaa ympäristöämme tehokkaammin”, Du sanoo.

Uusi kehys voi generoida kuvan kohtauksesta tekstin kuvausten perusteella objektiensa ja suhteidensa osalta.

Järjestelmä voi sitten jakaa nämä lauseet pienempiin osiin, jotka kuvaavat kunkin yksittäisen suhteen. Kunkin osan jälkeen malli yhdistää ne optimointiprosessin kautta, joka generoi kuvan kohtauksesta.

Kun lauseet on jaettu lyhyempiin osiin, järjestelmä voi sitten yhdistää ne eri tavoilla, mikä mahdollistaa sopeutumisen kohtauksien kuvausten mukaisiin, joita se ei ole aiemmin kohdannut.

“Muiden järjestelmien tapaan otetaan kaikki suhteet kokonaisuutena ja generoidaan kuva yhden kerran kuvausten perusteella. Mutta tällaiset lähestymistavat epäonnistuvat, kun meillä on kuvausten ulkopuolisia suhteita, kuten kuvausten, joissa on enemmän suhteita, koska nämä mallit eivät pysty sopeutumaan yhden kerran generoimaan kuvia, jotka sisältävät enemmän suhteita. Mutta koska me koostamme nämä erilliset, pienemmät mallit yhteen, voimme mallintaa suuremman määrän suhteita ja sopeutua uusiin yhdistelmiin”, Du sanoo.

Järjestelmä voi myös suorittaa tämän prosessin vastakkaisesti. Jos sille syötetään kuva, se voi löytää tekstin kuvausten, jotka vastaavat objektiensa välisiä suhteita kohtauksessa.

Mallin arviointi

Tutkijat pyysivät ihmisiä arvioimaan, vastaavatko generoidut kuvat alkuperäistä kohtauksen kuvausta. Kun kuvausten sisällön oli kolme suhdetta, mikä oli monimutkaisin tyyppi, 91 prosenttia osallistujista sanoi, että uusi malli suoritti paremmin kuin muut syvän oppimisen menetelmät.

“Yksi mielenkiintoinen asia, jonka löysimme, on, että mallimme voi lisätä lauseensa yhdestä suhteen kuvauksesta kahteen, kolmeen tai jopa neljään kuvaukseen, ja lähestymistapaamme voidaan jatkaa generoimalla kuvia, jotka ovat oikein kuvattuina kuvausten mukaan, kun taas muut menetelmät epäonnistuvat”, Du sanoo.

Malli osoitti myös vaikuttavan kyvyn toimia kuvausten kanssa, joita se ei ollut aiemmin kohdannut.

“Tämä on erittäin lupaavaa, koska se on lähempänä sitä, miten ihmiset toimivat. Ihmiset voivat nähdä vain muutamia esimerkkejä, mutta voimme poimia hyödyllistä tietoa vain näistä muutamista esimerkeistä ja yhdistää ne yhteen luodaksemme äärettömän määrän yhdistelmiä. Ja mallimme on sellainen ominaisuus, joka sallii sen oppia vähemmästä datasta, mutta yleistää monimutkaisempiin kohtauksiin tai kuvien generointiin”, Li sanoo.

Tutkijaryhmä aikoo nyt testata mallia monimutkaisemmissa, todellisissa kuvissa ja tutkia, miten mallia voidaan lopulta sisällyttää robottiin.

Alex johtaa Unite.AI:n tekoälypohjaista uutistoimintaa, yhdistäen journalismia, tutkimusta ja automaatiota tukeakseen ajantasaista ja skaalautuvaa tekoälyn kattavuutta. Hänen työnsä auttaa varmistamaan, että nousevat tekoälykehitykset saadaan esiin tehokkaasti samalla kun julkaisun toimitukselliset standardit säilyvät.