Andersons vinkel

Syntese av menneskebilder fra reflekterte radiobølger

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Forskere fra Kina har utviklet en metode for å syntetisere nære fotorealistiske bilder av mennesker uten kameraer, ved å bruke radiobølger og Generative Adversarial Networks (GANs). Systemet de har utviklet er trent på virkelige bilder tatt i god lys, men er i stand til å fange relativt autentiske ‘øyeblikksbilder’ av mennesker selv når forholdene er mørke – og selv gjennom store hindringer som ville skjule menneskene for konvensjonelle kameraer.

Bildene avhenger av ‘varme-kart’ fra to radiantenner, en som fanger data fra taket ned, og en annen som registrerer radiobølge-forstyrrelser fra en ‘stående’ posisjon.

De resulterende bildene fra forskernes proof-of-concept-eksperimenter har et ansiktsløst, ‘J-Horror’-aspekt:

Basert på trening av virkelige bilder av mennesker i samme miljø, bruker RFGAN radiobølge-varme-kart til å registrere menneskelig aktivitet og generere bilder som approksimerer hva den begrensede oppløsningen av de lave frekvensene RF-signaler oppfatter. Lys er ikke nødvendig, siden farger (apparat) oppfattes av måten radiobølger forstyrres av menneskenes tilstedeværelse, og variasjoner i frekvens når radiobølgene returnerer tilbake med ulike signalstyrker og egenskaper. Kilde: https://arxiv.org/pdf/2112.03727.pdf

RFGAN er trent på bilder av virkelige mennesker i kontrollerte miljøer og på radiobølge-varme-kart som registrerer menneskelig aktivitet. Etter å ha lært funksjoner fra dataene, kan RFGAN så generere bilder basert på nye RF-data. Det resulterende bildet er en approksimering, basert på den begrensede oppløsningen av de lave frekvensene RF-signaler som er tilgjengelige. Denne prosessen fungerer selv i mørke miljøer og gjennom en rekke potensielle hindringer. Kilde: https://arxiv.org/pdf/2112.03727.pdf

For å trene GAN, kalt RFGAN, brukte forskerne sammenfallende data fra et standard RGB-kamera og fra de sammenføyde tilhørende radiobølge-varme-kartene som ble produsert på det eksakte øyeblikket for opptak. Bilder av syntetiske mennesker i det nye prosjektet tenderer å være uskarpe på en måte som ligner tidlige Daguerreotype-fotografier, fordi oppløsningen av radiobølgene som brukes er svært lav, med en dybde-oppløsning på 7,5 cm og en vinkel-oppløsning på omtrent 1,3 grader.

Ovenfor, bildet som mates til GAN-nettverket – nedenfor, de to varme-kartene, horisontal og vertikal, som karakteriserer personen i rommet, og som syntetiseres selv innenfor arkitekturen til en 3D-representasjon av forstyrrede data.

Ovenfor, bildet som mates til GAN-nettverket – nedenfor, de to varme-kartene, horisontal og vertikal, som karakteriserer personen i rommet, og som syntetiseres selv innenfor arkitekturen til en 3D-representasjon av forstyrrede data.

Den nye artikkelen, tittelen RFGAN: RF-basert menneskesyntese, kommer fra seks forskere fra University of Electronic Science and Technology of China.

Data og arkitektur

På grunn av mangelen på noen tidligere datasett eller prosjekter som delte dette omfanget, og det faktum at RF-signaler ikke har blitt brukt tidligere i en GAN-bilde-syntese-ramme, måtte forskerne utvikle nye metoder.

Kjerne-arkitekturen til RFGAN.

Kjerne-arkitekturen til RFGAN.

Adaptiv normalisering ble brukt til å tolke de doble varme-kart-bildene under trening, slik at de korresponderer romlig med de fangete bilde-dataene.

RF-fangst-enhetene var millimeter-bølge (mmWave)-radarer konfigurert som to antenne-arrays, horisontal og vertikal. Frekvens-modulert kontinuerlig bølge (FMCW) og lineære antenner ble brukt for sending og mottak.

Generatoren mottar en kilde-ramme som en inndata-lag, med den RF-fusjonerte (varme-kart)-representasjonen som orkestrerer nettverket gjennom normalisering på nivået av konvolusjons-lagene.

Data

Dataene ble samlet inn fra RF-signal-refleksjoner fra mmWave-antennen på en ren 20 Hz, med samtidig menneske-video fanget på en svært lav 10 fps. Ni innendørs-scener ble fanget, med seks frivillige, hver av dem iført forskjellige klær for forskjellige sesjoner av data-innsamlingen.

Resultatet var to distinkte datasett, RF-Aktivitet og RF-Gå, den første inneholdt 68 860 bilder av mennesker i varierende posisjoner (slik som knele og ), sammen med 137 760 tilhørende varme-kart-rammer; og den andre inneholdt 67 860 menneske-tilfeldige gå-rammer, sammen med 135 720 par av tilhørende varme-kart.

Dataene, ifølge konvensjon, ble delt ujevnt mellom trening og testing, med 55 225 bilde-rammer og 110 450 varme-kart-par brukt for trening, og resten holdt tilbake for testing. RGB-fangst-rammer ble større enn 320×180, og varme-kart større enn 201×160.

Modellen ble deretter trent med Adam på en konstant læringsrate på 0,0002 for både generatoren og diskriminatoren, på en epoch på 80 og en (svært sparsom) batch-størrelse på 2. Trening fant sted via PyTorch på en forbruker-nivå-enkelt GTX-1080-GPU, hvis 8 GB VRAM ville generelt bli betraktet som ganske beskjedent for en slik oppgave (forklaringen for den lave batch-størrelsen).

Selv om forskerne tilpasset noen konvensjonelle målinger for å teste realisme av utgangen (detaljert i artikkelen), og utførte de vanlige ablasjonstestene, var det ingen tilsvarende tidligere arbeid mot å måle ytelsen til RFGAN.

Åpen interesse for hemmelige signaler

RFGAN er ikke det første prosjektet som forsøker å bruke radiofrekvenser til å bygge en volumetrisk bilde av hva som skjer i et rom. I 2019 utviklet forskere fra MIT CSAIL en arkitektur kalt RF-Avatar, i stand til å rekonstruere 3D-mennesker basert på radiofrekvens-signaler i Wi-Fi-området, under alvorlige forhold av okklusjon.

I MIT CSAIL-prosjektet fra 2019 ble radiobølger brukt til å fjerne okklusjoner, selv inkludert vegger og klær, for å gjenskape fangete subjekter i en mer tradisjonell CGI-basert arbeidsflyt. Kilde: https://people.csail.mit.edu/mingmin/papers/rf-avatar.pdf

I MIT CSAIL-prosjektet fra 2019 ble radiobølger brukt til å fjerne okklusjoner, selv inkludert vegger og klær, for å gjenskape fangete subjekter i en mer tradisjonell CGI-basert arbeidsflyt. Kilde: https://people.csail.mit.edu/mingmin/papers/rf-avatar.pdf

Forskerne i den nye artikkelen anerkjenner også løst-relatert tidligere arbeid rundt miljø-kartlegging med radiobølger (ingen av dem forsøkte å gjenskape fotorealistiske mennesker), som forsøkte å estimere menneskelig hastighet; se gjennom vegger med Wi-Fi; evaluere menneskelige posisjoner; og sogar gjenkjenne menneskelige gesturer, blant andre mål.

Overførbarhet og videre anvendelighet

Forskerne gikk deretter ut for å se om deres oppdagelse var over-tilpasset den opprinnelige fangst-miljøet og trening-omstendighetene, selv om artikkelen tilbyr få detaljer om denne fasen av eksperimentet. De hevder:

‘For å distribuere vår modell i en ny scene, trenger vi ikke å trene hele modellen fra starten. Vi kan fin-justere den forhånds-trente RFGAN ved å bruke svært lite data (omtrent 40 sekunders data) for å få lignende resultater.’

Og fortsetter:

‘Tap-funksjonene og hyperparameterne er de samme som i trening-stadiet. Fra de kvantitative resultater, finner vi at den forhånds-trente RFGAN-modellen kan generere ønskede menneskelig aktivitet-rammer i den nye scenen etter fin-justering med bare litt data, hvilket betyr at vår foreslåtte modell har potensialet for å bli bredt brukt.’

Basert på artikkelen detaljer om denne seminale anvendelsen av en ny teknikk, er det ikke klart om nettverket som forskerne har skapt er ‘fit-trent’ eksklusivt til de opprinnelige subjektene, eller om RF-varme-kart kan slutte detaljer som farge på klær, da dette synes å gå over de to forskjellige typene frekvenser involvert i optiske og radiokapte-metoder.

Uansett, RFGAN er en ny måte å bruke de imiterende og representative kreftene til Generative Adversarial Networks til å skape en ny og intrigerende form for overvåking – en som potensielt kan operere i mørket og gjennom vegger, på en måte som er enda mer imponerende enn nylige forsøk på å se rundt hjørner med reflektert lys.

 

 

8. desember 2021 (dag for første publisering), 20:04 GMT+2 – fjernet gjentatt ord. – MA

Forfatter innen maskinlæring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: martin@martinanderson.ai