Andersonin kulma

Silmien kosketuksen havaitseminen kehon asennosta koneoppimisen avulla

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Ranskalaiset ja sveitsiläiset tutkijat ovat kehittäneet tietokoneen näköjärjestelmän, joka voi arvioida, katsooko henkilö suoraan “ego”-kameraan AI-järjestelmässä pelkästään sen perusteella, miten henkilö seisoo tai liikkuu.

Uusi kehyskäyttö hyödyntää hyvin vähäistä tietoa tämän arvioinnin tekemiseksi, muodossa, jossa on semanttisia avainkohtia (ks. kuva alla), eikä yritä pääasiassa analyysoida silmien sijaintia kasvojen kuvissa. Tämä tekee johtuvan havaintomenetelmästä erittäin kevyen ja ketterän verrattuna tietosisällön analyysiin perustuviin objectin havaintoarkkitehtuureihin, kuten YOLO.

Uusi kehys arvioi, katsooko kadulla oleva henkilö AI-järjestelmän tallennusanturia, pelkästään kehon asennon perusteella. Kuvissa vihreällä korostetut henkilöt ovat todennäköisesti katsomassa kameraa, kun taas punaisella korostetut henkilöt ovat todennäköisemmin katsomassa pois.

Uusi kehys arvioi, katsooko kadulla oleva henkilö AI-järjestelmän tallennusanturia, pelkästään kehon asennon perusteella. Kuvissa vihreällä korostetut henkilöt ovat todennäköisesti katsomassa kameraa, kun taas punaisella korostetut henkilöt ovat todennäköisemmin katsomassa pois. Lähde: https://arxiv.org/pdf/2112.04212.pdf

Vaikka työ on motivoidtu parempien turvajärjestelmien kehittämisestä itsenäisille ajoneuvoille, tutkimuksen tekijät myöntävät, että se voi olla sovellettavissa myös muihin aloihin, ja huomauttavat, että ‘jopa älykkäissä kaupungeissa silmien kosketuksen havaitseminen voi olla hyödyllistä ymmärtääkseen jalankulkijoiden käyttäytymistä, esim. tunnistaa, mihin he kiinnittävät huomiota tai mitä julkisia merkintöjä he katsovat’.

Tukeakseen tämän ja myöhempien järjestelmien kehittämistä, tutkijat ovat koonneet uuden ja kattavan tietojoukon nimeltä LOOK, joka käsittelee suoraan silmien kosketuksen havaitsemisen haasteita satunnaisissa tilanteissa, kuten katunäkymissä, joita havaitaan itsenäisen ajoneuvon kamerasta, tai väkijoukon keskellä, jossa robotti voi tarvita navigoida ja antaa jalankulkijoiden väistää.

Kehyksen tulokset, joissa 'katsojat' on korostettu vihreällä.

Kehyksen tulokset, joissa ‘katsojat’ on korostettu vihreällä.

Tutkimus on nimeltään Do Pedestrians Pay Attention? Eye Contact Detection in the Wild, ja se on neljän tutkijan työ Visual Intelligence for Transportation (VITA) -tutkimushankkeesta Sveitsissä ja yhden tutkijan työ Sorbonne Universitésta.

Arkkitehtuuri

Useimmat aiemmat työt tässä alassa ovat keskittyneet kuljettajien huomioon, käyttäen koneoppimista analysoimaan kuljettajakohtaisia kameroiden tuloksia ja luottaen jatkuvasti kiinteään ja lähietäisyyteen kuljettajasta – ylellisyyttä, jota ei välttämättä ole saatavilla julkisten TV-kameroiden usein matalaresoluutioisissa syötteissä, joissa ihmiset voivat olla liian kaukana kasvojen analyysijärjestelmän silmien asennon ratkaisemiseksi, ja joissa muut esteet (kuten aurinkolasit) myös estävät näkemisen.

Enemmän keskeistä projektin ilmoitetulle tavoitteelle, itsenäisten ajoneuvojen ulospäin suunnatut kamerat eivät välttämättä ole ihanteellisessa tilanteessa, mikä tekee ‘alatasoisen’ avainkohtitiedon ihanteelliseksi perustaksi katseanalyysikehykselle. Itsenäisten ajoneuvojen järjestelmien tarvitsee erittäin vastaanotettava ja nopea tapa ymmärtää, onko jalankulkija – joka voi astua jalankulkijan polulle auton eteen – nähnyt itsenäisen ajoneuvon. Tällaisessa tilanteessa viive voi merkitä eroa elämän ja kuoleman välillä.

Tutkijoiden kehittämä modulaarinen arkkitehtuuri ottaa sisään (yleensä) täysikokoisen kuvan henkilöstä, josta 2D-nivelet poistetaan perusmuotoon.

Uuden ranskalais-sveitsiläisen silmien kosketuksen havaitsemisjärjestelmän arkkitehtuuri.

Uuden ranskalais-sveitsiläisen silmien kosketuksen havaitsemisjärjestelmän arkkitehtuuri.

Asento normalisoidaan poistamaan tieto Y-akselista, luodakseen “tasaisen” asennon edustajan, joka asettaa sen tasolle tuhansien tunnettujen asentojen kanssa, joita algoritmi on oppinut (joilla on myös “tasattu”), ja niiden liittyvien binäärimerkintöjen/merkkien (ts. 0: Ei katsomassa tai 1: Katsomassa).

Asento verrataan algoritmin sisäiseen tietoon siitä, miten hyvin tuo asento vastaa muiden jalankulkijoiden kuvia, joita on tunnistettu “katsomassa kameraa” – merkinnät tehtiin käyttäen mukautettuja selainvälineitä, joita tutkijat kehittivät Amazon Mechanical Turk -työntekijöille, jotka osallistuivat LOOK-tietojoukon kehittämiseen.

Jokainen kuva LOOKissa oli altis neljän AMT-työntekijän tarkastelulle, ja vain kuvat, joissa kolme neljästä työntekijästä olivat samaa mieltä lopputuloksesta, otettiin lopulliseen kokoelmaan.

Pään leikkaustieto, joka on ollut suurimman osan aiemmasta työstä, on yksi epäluotettavimmista silmien kosketuksen merkkinä satunnaisissa kaupunkitilanteissa, ja se on otettu arkkitehtuuriin valinnaisena tietovirtana, missä tallennuslaatu ja kattavuus ovat riittäviä tukeakseen päätöstä siitä, katsooko henkilö kameraa vai ei. Kaukana olevien henkilöiden kohdalla tämä ei ole välttämättä hyödyllistä tietoa.

Data

Tutkijat johdattivat LOOKin useista aiemmista tietojoukoista, jotka eivät ole oletusarvoisesti sovellettavissa tähän tehtävään. Ainoat kaksi tietojoukkoa, jotka jakavat tämän projektin tavoitteen, ovat JAAD ja PIE, ja niissä on molemmissa rajoituksia.

JAAD on vuoden 2017 tarjonta Yorkin yliopistosta Torontosta, joka sisältää 390 000 merkittyä esimerkkiä jalankulkijoista, mukaan lukien reunakkeet ja käyttäytymisen merkintä. Niistä vain 17 000 on merkitty “Katsomassa kuljettajaa” (ts. ego-kamera). Tietojoukko sisältää 346 30fps-klippiä, jotka pyörivät 5-10 sekunnin mittaisia kameran tallennuksia Pohjois-Amerikassa ja Euroopassa. JAADissa on korkea toistuvuus, ja yksilöiden määrä on vain 686.

Uudempi (2019) PIE, Yorkin yliopistosta Torontosta, on samanlainen kuin JAAD, sillä se sisältää kameran 30fps-tallenteita, tällä kertaa peräisin kuudesta tunnista ajoa Toronton keskustassa, mikä tuottaa 700 000 merkittyä jalankulkijaa ja 1 842 yksilöä, joista vain 180 katsoo kameraa.

Sen sijaan tutkijat kokoivat uusimman tutkimuksen sovellettavimman datan kolmesta aiemmasta itsenäisestä ajo-tietojoukosta: KITTI, JRDB ja NuScenes, jotka ovat peräisin Karlsruhen teknillisestä korkeakoulusta Saksassa, Stanfordin ja Monashin yliopistosta Australiassa ja MIT:n spin-offista Nutonomy.

Tämä kokoaminen johti laajasti monipuoliseen joukkoon kaappauksia neljästä kaupungista – Bostonista, Singaporesta, Tübingenistä ja Palo Altosta. Noin 8000 merkityllä jalankulkijan näkökulmalla tutkijat väittävät, että LOOK on monipuolisin tietojoukko “villissä” silmien kosketuksen havaitsemiselle.

Koulutus ja tulokset

Poiminta, koulutus ja arviointi suoritettiin yhdellä NVIDIA GeForce GTX 1080ti:llä, jossa on 11 Gt:n VRAM, toimien Intel Core i7-8700-suorittimella, joka pyörii 3,20 GHz:n nopeudella.

Tutkijat totesivat, että heidän menetelmänsä parantaa SOTA-perusviivoja vähintään 5 prosentilla, ja että tulokset mallista, joka on koulutettu JAAD:lla, yleistyvät erittäin hyvin näkymättömiin tietoihin, tilanteessa, jossa testattiin useiden tietojoukkojen sekoittamista.

Koska suoritettu testaus oli monimutkainen ja piti ottaa huomioon crop-pohjaiset mallit (kasvojen eristäminen ja leikkaaminen eivät ole keskeisiä uuden aloitteen arkkitehtuuriin), katso tutkimus yksityiskohtaisista tuloksista.

Tulokset keskimääräisestä tarkkuudesta (AP) prosentteina ja reunaisten kehysten korkeuden funktiona pikseleissä JAAD-tietojoukon ylitestauksessa, tutkijoiden tulokset lihavoitu.

Tulokset keskimääräisestä tarkkuudesta (AP) prosentteina ja reunaisten kehysten korkeuden funktiona pikseleissä JAAD-tietojoukon ylitestauksessa, tutkijoiden tulokset lihavoitu.

Tutkijat ovat julkaisseet koodinsa julkisesti, ja tietojoukko on saatavilla täältä, ja lähdekoodi on GitHubissa.

Tutkijat päättävät toiveilla, että heidän työnsä inspiroi lisää tutkimushankkeita, joita he kuvaavat “tärkeäksi mutta laiminlyödyksi aiheeksi”.

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai