Andersons vinkel

AI avslöjar den hemliga aktivitet som avslöjas av blanka väggar

mm
Lägg till Unite.AI bland dina föredragna källor på Google

En forskningssamarbete, inklusive bidrag från NVIDIA och MIT, har utvecklat en maskinlärningsmetod som kan identifiera dolda personer genom att observera indirekt belysning på en närliggande vägg, även när personerna inte är i närheten av ljuskällorna. Metoden har en noggrannhet på nästan 94% när det gäller att identifiera antalet dolda personer, och kan också identifiera den specifika aktiviteten hos en dold person genom att kraftigt förstärka ljusblixtar som är osynliga för mänskliga ögon och för standardmetoder för bildförstärkning.

Oupptäckliga perturbationer av ljus, förstärkt av den nya metoden, som använder konvolutionsneuronnät för att identifiera områden av förändring. Källa: https://www.youtube.com/watch?v=K4PapXyX-bI

Oupptäckliga perturbationer av ljus, förstärkt av den nya metoden, som använder konvolutionsneuronnät för att identifiera områden av förändring. Källa: https://www.youtube.com/watch?v=K4PapXyX-bI

Den nya artikeln har titeln Vad du kan lära dig genom att stirra på en blank vägg, med bidrag från NVIDIA och MIT, samt Israel Institute of Technology.

Tidigare metoder för att “se runt hörn” har förlitat sig på kontrollerbara ljuskällor eller tidigare kunskap om kända källor till skymning, medan den nya tekniken kan generaliseras till vilket rum som helst, utan krav på omkalibrering. De två konvolutionsneuronnät som identifierar dolda personer använde data från endast 20 scener.

Projektet är inriktat på högrisk-, säkerhetskritiska situationer, för sök- och räddningsinsatser, allmänna polisövervakningsuppgifter, nödsituationer, för fallupptäckt bland äldre människor och som ett sätt att upptäcka dolda fotgängare för autonoma fordon.

Passiv utvärdering

Som ofta är fallet med datorseende-projekt var den centrala uppgiften att identifiera, klassificera och operationalisera uppfattade tillståndsändringar i en bildström. Att kombinera ändringarna leder till signaturmönster som kan användas antingen för att identifiera antalet individer eller för att upptäcka aktiviteten hos en eller flera individer.

Arbetet öppnar upp möjligheten för helt passiv scenunderökning, utan behov av att använda reflekterande ytor, Wi-Fi-signal, radar, ljud eller några andra “särskilda omständigheter” som krävs i andra forskningsinsatser under de senaste åren som har försökt att fastställa dold mänsklig närvaro i en farlig eller kritisk miljö.

En exempeldatainsamlingscenariotyp som används för den nya forskningen. Försökspersonerna är noggrant positionerade så att de inte kastar skuggor eller direkt blockerar några ljus, och inga reflekterande ytor eller andra

En exempeldatainsamlingscenariotyp som används för den nya forskningen. Försökspersonerna är noggrant positionerade så att de inte kastar skuggor eller direkt blockerar några ljus, och inga reflekterande ytor eller andra “fusk”-vektorer är tillåtna. Källa: https://arxiv.org/pdf/2108.13027.pdf

I själva verket skulle den omgivande belysningen i det typiska scenariot som förutses för tillämpningen överväldiga alla små perturbationer orsakade av reflekterat ljus från personer som är dolda någon annanstans i scenen. Forskarna beräknar att ljusstörningsbidraget från individerna vanligtvis skulle vara mindre än 1% av det totala synliga ljuset.

Borttagning av statisk belysning

För att extrahera rörelse från den till synes statiska väggens bild är det nödvändigt att beräkna den temporala genomsnittet av videon och ta bort det från varje bildruta. De resulterande rörelsemönstren ligger vanligtvis under brusgränsen för till och med högkvalitativ videoutrustning, och i själva verket sker mycket av rörelsen inom ett negativt pixellutrymme.

För att åtgärda detta nedsamplear forskarna videon med en faktor på 16 och upscale den resulterande filmen med en faktor på 50, samtidigt som de lägger till en mittgrå basnivå för att upptäcka närvaron av negativa pixlar (som inte kunde förklaras av baslinsensensorbrus).

Skillnaden mellan den mänskligt uppfattade väggen och den extraherade perturbationen av dolda individer. Eftersom bildkvalitet är en central fråga i denna forskning, se den officiella videon i slutet av artikeln för en högkvalitativ bild.

Skillnaden mellan den mänskligt uppfattade väggen och den extraherade perturbationen av dolda individer. Eftersom bildkvalitet är en central fråga i denna forskning, se den officiella videon i slutet av artikeln för en högkvalitativ bild.

Fönstret för möjlighet att uppfatta rörelse är mycket ömtåligt och kan påverkas även av blinkande ljus i en frekvens av 60 Hz AC. Därför måste också denna naturliga perturbation utvärderas och tas bort från filmen innan personinducerad rörelse kommer att framträda.

Till slut producerar systemet rum-tid-diagram som signalerar ett specifikt antal dolda ruminvånare – diskreta visuella signaturer:

Signatur-rum-tid-diagram som representerar olika antal dolda personer i ett rum.

Signatur-rum-tid-diagram som representerar olika antal dolda personer i ett rum.

Olika mänskliga aktiviteter kommer också att resultera i signaturperturbationer som kan klassificeras och senare erkännas:

Rum-tid-diagram-signaturer för inaktivitet, gång, knäböj, vinkande händer och hopp.

Rum-tid-diagram-signaturer för inaktivitet, gång, knäböj, vinkande händer och hopp.

För att producera en automatiserad maskinlärningsbaserad arbetsflöde för dold personigenkänning användes varierad film från 20 lämpliga scenarier för att träna två neuronnät som fungerar på bredvid liknande konfigurationer – en för att räkna antalet personer i en scen, och den andra för att identifiera eventuell rörelse som sker.

Testning

Forskarna testade det tränade systemet i tio osynliga verkliga miljöer som utformats för att återskapa de begränsningar som förväntas för den slutliga distributionen. Systemet kunde uppnå upp till 94,4% noggrannhet (över 256 bildrutor – vanligtvis strax över 8 sekunder av video) i klassificeringen av antalet dolda personer, och upp till 93,7% noggrannhet (under samma förhållanden) i klassificeringen av aktiviteter. Även om noggrannheten minskar med färre källramar, är det inte en linjär minskning, och även 64 ramar kommer att uppnå en noggrannhetsgrad på 79,4% för “antal-personer”-utvärdering (mot nästan 95% för fyra gånger så många ramar).

Även om metoden är robust mot väderbaserade förändringar i belysning, har den svårt i en scen upplyst av en TV, eller i omständigheter där personerna bär enhetliga kläder i samma färg som den reflekterande väggen.

Mer information om forskningen, inklusive högkvalitativ film av extraktionerna, kan ses i den officiella videon nedan.

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai