Andersons vinkel
Deteksjon av Ãļyekontakt fra kroppsholdning med maskinlÃĶring

Forskere fra Frankrike og Sveits har utviklet et datavisjonssystem som kan anslÃĨ om en person ser direkte pÃĨ âegoâ-kameraet i et AI-system basert bare pÃĨ mÃĨten personen stÃĨr eller beveger seg pÃĨ.
Det nye rammeverket bruker svÃĶrt redusert informasjon for ÃĨ gjÃļre denne vurderingen, i form av semantiske nÃļkkelord (se bildet under), snarere enn ÃĨ forsÃļke ÃĨ analysere Ãļyeposisjon i bilder av ansikter. Dette gjÃļr den resulterende deteksjonsmetoden svÃĶrt lett og smidig, i sammenligning med mer dataintensive objektdetekteringsarkitekturer, som YOLO.
<img class="wp-image-179268 size-full" src="https://www.unite.ai/wp-content/uploads/2021/12/semantic-keypoints.jpg" alt="Det nye rammeverket vurderer om en person pÃĨ gaten ser pÃĨ AI-sensoren, basert bare pÃĨ kroppsholdningen. Her er personer som er merket med grÃļnt sannsynligvis ÃĨ se pÃĨ kameraet, mens de som er merket med rÃļdt er mer sannsynlig ÃĨ se bort. Kilde: https://arxiv.org/pdf/2112.04212.pdf
Selv om arbeidet er motivert av utviklingen av bedre sikkerhetssystemer for autonome kjÃļretÃļy, innrÃļmmer forfatterne av den nye artikkelen at det kan ha mer generelle anvendelser i andre industrier, og observerer âselv i smarte byer kan Ãļyekontaktdeteksjon vÃĶre nyttig for ÃĨ bedre forstÃĨ fotgjengeres atferd, f.eks. ÃĨ identifisere hvor deres oppmerksomhet gÃĨr eller hva offentlige skilt de ser pÃĨâ.
For ÃĨ hjelpe med videre utvikling av dette og senere systemer, har forskerne samlet en ny og omfattende datasett kalt LOOK, som direkte adresserer de spesifikke utfordringene med Ãļyekontaktdeteksjon i vilkÃĨrlige scenarioer som gatebilder sett fra et selvkjÃļrende kjÃļretÃļys kamera, eller uformelle folkemengder som en robot mÃĨ navigere gjennom og vike for fotgjengeres vei.

Resultater fra rammeverket, med âseereâ identifisert med grÃļnt.
Forskningen hele artikkelen heter Do Pedestrians Pay Attention? Eye Contact Detection in the Wild, og kommer fra fire forskere ved Visual Intelligence for Transportation (VITA) forskningsinitiativet i Sveits, og en ved Sorbonne UniversitÃĐ.
Arkitektur
De fleste tidligere arbeider i dette feltet har vÃĶrt sentrert pÃĨ sjÃĨfÃļr oppmerksomhet, ved ÃĨ bruke maskinlÃĶring til ÃĨ analysere utgangen av sjÃĨfÃļr-rettede kamere, og avhengig av en konstant, fast og nÃĶrvÃĶr av sjÃĨfÃļren â en luksus som ikke er sannsynlig ÃĨ vÃĶre tilgjengelig i de ofte lav-opplÃļste strÃļmmene av offentlige TV-kameraer, hvor personer kan vÃĶre for langt borte for et ansiktsanalyse-system ÃĨ lÃļse deres Ãļyedisposisjon, og hvor andre forstyrrelser (som solbriller) ogsÃĨ kommer i veien.
Mer sentral til prosjektets uttalt mÃĨl, vil de utvendige kameraene i autonome kjÃļretÃļy ikke nÃļdvendigvis vÃĶre i en optimal scenario heller, gjÃļr âlav-nivÃĨâ nÃļkkelinformasjon ideell som grunnlag for en blikkanalyse-rammeverk. Autonome kjÃļretÃļysystemer trenger en svÃĶrt responsiv og lyn-rask mÃĨte ÃĨ forstÃĨ om en fotgjenger â som kan gÃĨ av fortauet inn i kjÃļretÃļyets vei â har sett AV. I en slik situasjon kan forsinkelse bety forskjellen mellom liv og dÃļd.
Den modulÃĶre arkitekturen utviklet av forskerne tar inn et (vanligvis) fullkroppsbilde av en person fra hvilken 2D-ledd er trukket ut i en base, skjelettform.

Arkitekturen til det nye fransk-sveitsiske Ãļyekontaktdetekteringssystemet.
Holdningen er normalisert for ÃĨ fjerne informasjon pÃĨ Y-aksen, for ÃĨ skape en âflatâ representasjon av holdningen som setter den i likhet med de tusenvis av kjente holdninger som er lÃĶrt av algoritmen (som ogsÃĨ har blitt âflattetâ), og deres assosierte binÃĶre flagg/merker (dvs. 0: Ikke ser eller 1: Ser).
Holdningen sammenlignes mot algoritmens interne kunnskap om hvordan godt denne posturen korresponderer med bilder av andre fotgjengere som har blitt identifisert som âser pÃĨ kameraâ â annotasjoner gjort ved hjelp av egendefinerte nettleser-verktÃļy utviklet av forfatterne for Amazon Mechanical Turk-arbeiderne som deltok i utviklingen av LOOK-datasettet.
Hver bilde i LOOK var underlagt skrÃĨning av fire AMT-arbeidere, og bare bilder hvor tre av fire var enige om utfallet ble inkludert i den endelige samlingen.
Hodekropps-informasjon, kjernen i mye tidligere arbeid, er blant de minst pÃĨlitelige indikatorene for blikk i vilkÃĨrlige by-scenarioer, og er inkludert som en valgfri datastrÃļm i arkitekturen hvor opptakskvaliteten og dekningen er tilstrekkelig til ÃĨ stÃļtte en beslutning om hvorvidt personen ser pÃĨ kameraet eller ikke. I tilfelle av svÃĶrt fjerntliggende personer, vil dette ikke vÃĶre nyttig informasjon.
Data
Forskere har avledet LOOK fra flere tidligere datasett som ikke er tilgjengelige for denne oppgaven. De to datasettene som direkte deler prosjektets ambisjon er JAAD og PIE, og hver har begrensninger.
JAAD er et tilbud fra 2017 fra York University i Toronto, som inneholder 390 000 merkte eksempler pÃĨ fotgjengere, inkludert bounding-bokser og atferdsannotering. Av disse er bare 17 000 merket som ser pÃĨ sjÃĨfÃļren (dvs. ego-kameraet). Datasettet har 346 30fps-klipp som kjÃļrer i 5-10 sekunder av on-board kameraopptak registrert i Nord-Amerika og Europa. JAAD har en hÃļy forekomst av gjentakelser, og det totale antallet unike fotgjengere er bare 686.
Den mer nylige (2019) PIE, fra York University i Toronto, er lignende JAAD, i det at det inneholder on-board 30fps-opptak, denne gangen avledet fra seks timers kjÃļring gjennom downtown Toronto, som gir 700 000 annoterte fotgjengere og 1 842 unike fotgjengere, hvor bare 180 ser pÃĨ kameraet.
I stedet har forskerne for den nye artikkelen samlet den mest egnede data fra tre tidligere autonome kjÃļretÃļydatasett: KITTI, JRDB og NuScenes, henholdsvis fra Karlsruhe Institute of Technology i Tyskland, Stanford og Monash University i Australia, og en tidligere MIT-spin-off Nutonomy.
Denne kurasjonen resulterte i en svÃĶrt diversifisert samling av opptak fra fire byer â Boston, Singapore, TÞbingen og Palo Alto. Med rundt 8000 merkte fotgjengerperspektiver, hevder forfatterne at LOOK er det mest diverse datasettet for âi villmarkâ Ãļyekontaktdeteksjon.
Trening og resultater
Ekstraksjon, trening og evaluering ble alle utfÃļrt pÃĨ en enkelt NVIDIA GeForce GTX 1080ti med 11gb VRAM, som opererte pÃĨ en Intel Core i7-8700 CPU som kjÃļrte pÃĨ 3,20GHz.
Forfatterne fant at ikke bare deres metode forbedrer SOTA-baselinjer med minst 5%, men ogsÃĨ at de resulterende modellene som er trent pÃĨ JAAD generaliserer svÃĶrt godt til usette data, en scenario testet ved ÃĨ blande en rekke datasett.
Ettersom testingen som ble utfÃļrt var kompleks, og mÃĨtte gjÃļre provisjon for crop-baserte modeller (mens ansiktsisolering og cropping ikke er sentrale i det nye initiativets arkitektur), se artikkelen for detaljerte resultater.

Resultater for gjennomsnittlig nÃļyaktighet (AP) som prosent og funksjon av bounding-boks hÃļyde i piksler for testing over JAAD-datasettet, med forfatterens resultater i fet skrift.
Forskere har gjort koden offentlig tilgjengelig, med datasettet tilgjengelig her, og kildekoden pÃĨ GitHub.
Forfatterne konkluderer med hÃĨp om at deres arbeid vil inspirere videre forskningsinnsats i hva de beskriver som en âviktig men oversett temaâ.












