Andersons vinkel
AI avdekker hemmelig aktivitet avslørt av blanke vegger

Et forskningssamarbeid, inkludert bidragsytere fra NVIDIA og MIT, har utviklet en maskinlæringsmetode som kan identifisere skjulte personer bare ved å observere indirekte belysning på en nærliggende vegg, selv når personene ikke er i nærheten av lyskildene. Metoden har en nøyaktighet på nærmere 94% når det gjelder å identifisere antallet skjulte personer, og kan også identifisere den spesifikke aktiviteten til en skjult person ved å forstørre lysrefleksjoner som er usynlige for det menneskelige øye og for standardmetoder for bildeforstørring.

Umerkelige forstyrrelser av lys, forstørret av den nye metoden, som bruker konvolusjonsneurale nettverk for å identifisere områder med endring. Kilde: https://www.youtube.com/watch?v=K4PapXyX-bI
Den nye artikkelen har tittelen Hva du kan lære ved å stirre på en blank vegg, med bidragsytere fra NVIDIA og MIT, samt Israel Institute of Technology.
Tidligere metoder for å “se rundt hjørner” har avhengig av kontrollerbare lyskilder eller forhåndskunnskap om kjente kilder for skjuling, mens den nye teknikken kan generaliseres til enhver ny rom, uten krav om omkalibrering. De to konvolusjonsneurale nettverkene som identifiserer skjulte personer brukte data fra bare 20 scener.
Prosjektet er rettet mot høyrisikosituasjoner, sikkerhetskritiske situasjoner, for søk- og redningsoperasjoner, generell overvåking, nødsituasjoner, for å detektere fall blant eldre mennesker, og som et middel for å detektere skjulte fotgjengere for autonome kjøretøy.
Passiv evaluering
Som ofte er tilfelle med datavisjonsprosjekter, var den sentrale oppgaven å identifisere, klassifisere og operasjonalisere observerte tilstandsendringer i en bildestrøm. Å kombinere endringene leder til signaturmønster som kan brukes enten til å identifisere antallet personer eller til å detektere aktiviteten til en eller flere personer.
Arbeidet åpner opp muligheten for fullstendig passiv scenarievaluering, uten å måtte bruke reflekterende overflater, Wi-Fi-signaler, radar, lyd eller andre “spesielle omstendigheter” som er nødvendige i andre forskningsinnsats de siste årene som har søkt å etablere skjult menneskelig tilstedeværelse i en farlig eller kritisk miljø.

En eksempel på en datainnsamlingssituasjon av typen som er brukt i den nye forskningen. Kilde: https://arxiv.org/pdf/2108.13027.pdf
Effektivt, ville den omgivende lyset i den typiske scenariet som er tenkt for anvendelsen, overveldige enhver liten forstyrrelse forårsaket av reflektert lys fra personer som er skjult andre steder i scenariet. Forskerne beregner at lysforstyrrelsesbidraget fra personene ville vanligvis være mindre enn 1% av det totale synlige lyset.
Fjerning av statisk belysning
For å trekke ut bevegelse fra den tilsynelatende statiske veggbildet, er det nødvendig å beregne den tidsmessige gjennomsnittet av videoen og fjerne det fra hver ramme. De resulterende bevegelsesmønstrene er vanligvis under støyterskelen for selv godkvalitets videoutstyr, og i virkeligheten skjer mye av bevegelsen innenfor et negativt pikselrom.
For å rette opp dette, nedprøver forskerne videoen med en faktor på 16 og oppskalerer deretter den resulterende filmen med en faktor på 50, samtidig som de legger til en midtgrå basisnivå for å påvise tilstedeværelsen av negative piksler (som ikke kan forklares av baseline video sensor støy).

Forskjellen mellom det menneskelige opplevde veggen og den uttrukne forstyrrelsen av skjulte personer.
Vinduet for å oppfatte bevegelse er svært skjørt, og kan påvirkes selv av blinkingen av lys i en 60 Hz AC-frekvens. Derfor må også denne naturlige forstyrrelsen vurderes og fjernes fra filmen før personforårsaket bevegelse vil oppstå.
Til slutt produserer systemet rom-tid-plott som signaliserer et bestemt antall skjulte rombeboere – diskrete visuelle signaturer:

Signatur rom-tid-plott som representerer forskjellige antall skjulte personer i et rom.
Forskjellige menneskelige aktiviteter vil også resultere i signaturforstyrrelser som kan klassifiseres og senere gjenkjennes:

Rom-tid-plott-signaturer for inaktivitet, gange, knele, vifte med hendene og hoppe.
For å produsere en automatisert maskinlæringsbasert arbeidsflyt for skjult persongjenkjenning, ble variert film fra 20 passende scener brukt til å trene to neurale nettverk som opererte på bredt liknende konfigurasjoner – ett for å telle antallet personer i en scene, og ett for å identifisere enhver bevegelse som skjer.
Testing
Forskerne testet det trente systemet i ti usette virkelige miljøer som var designet for å rekonstruere begrensningene som var forventet for den endelige utrullingen. Systemet kunne oppnå opptil 94,4% nøyaktighet (over 256 rammeverk – vanligvis bare over 8 sekunder av video) i klassifisering av antallet skjulte personer, og opptil 93,7% nøyaktighet (under de samme betingelsene) i klassifisering av aktiviteter. Selv om nøyaktigheten synker med færre kilde-rammeverk, er det ikke en lineær synk, og selv 64 rammeverk vil oppnå en 79,4% nøyaktighetsrate for “antall-personer”-evaluering (mot nesten 95% for fire ganger så mange rammeverk).
Selv om metoden er robust mot værbaserte endringer i belysning, sliter den i en scene belyst av en TV, eller under omstendigheter hvor personene bærer ensfargede klær som er likt fargen på den reflekterende veggen.
Flere detaljer om forskningen, inkludert høykvalitetsfilm av uttrekk, kan ses i den offisielle videoen nedenfor.













