Andersons vinkel

Mänsklig bildsyntes från reflekterade radiovågor

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Forskare från Kina har utvecklat en metod för att syntetisera nästan fotorealistiska bilder av människor utan kameror, med hjälp av radiovågor och Generativa Adversarial Networks (GANs). Systemet de har utvecklat är tränat på riktiga bilder tagna i gott ljus, men kan ändå fånga relativt autentiska “ögonblicksbilder” av människor även i mörka förhållanden – och till och med genom stora hinder som skulle dölja människor för konventionella kameror.

Bilderna bygger på “värmekartor” från två radioantenner, en som fångar data från taket nedåt, och en annan som registrerar radiovågsstörningar från en “stående” position.

De resulterande bilderna från forskarnas proof-of-concept-experiment har ett ansiktslöst, “J-Horror”-liknande utseende:

Baserat på träningsbilder av människor i samma miljö, använder RFGAN radiovågs-värmekartor för att registrera mänsklig aktivitet och generera ögonblicksbilder som approximerar den begränsade upplösningen av de lågfrekventa RF-signalerna. Lampor är inte nödvändiga, eftersom färger (tydligen) uppfattas av hur radiovågor störs av människors närvaro, och av variationer i frekvens när radiovågorna återvänder med varierande signalstyrka och egenskaper. Källa: https://arxiv.org/pdf/2112.03727.pdf

RFGAN är tränat på bilder av riktiga människor i kontrollerade miljöer och på radiovågs-värmekartor som registrerar mänsklig aktivitet. Efter att ha lärt sig funktioner från data kan RFGAN sedan generera ögonblicksbilder baserat på nya RF-data. Den resulterande bilden är en approximation, baserat på den begränsade upplösningen av de lågfrekventa RF-signalerna som finns tillgängliga. Denna process fungerar även i mörka miljöer och genom en mängd olika hinder. Källa: https://arxiv.org/pdf/2112.03727.pdf

För att träna GAN, som kallas RFGAN, använde forskarna matchade data från en standard RGB-kamera och från de sammanfogade motsvarande radiovågs-värmekartor som producerades exakt vid tidpunkten för inspelning. Bilder av syntetiserade människor i det nya projektet tenderar att vara suddiga på ett sätt som liknar tidig Daguerreotype-fotografi, eftersom upplösningen av radiovågorna som används är mycket låg, med en djupupplösning på 7,5 cm och en vinkelupplösning på cirka 1,3 grader.

Överst, bilden som matas in i GAN-nätverket - underst, de två värmekartor, horisontella och vertikala, som karakteriserar personen i rummet och som syntetiseras själva inom arkitekturen till en tredimensionell representation av de störda data.

Överst, bilden som matas in i GAN-nätverket – underst, de två värmekartor, horisontella och vertikala, som karakteriserar personen i rummet och som syntetiseras själva inom arkitekturen till en tredimensionell representation av de störda data.

Den nya artikeln, med titeln RFGAN: RF-baserad mänsklig syntes, kommer från sex forskare från University of Electronic Science and Technology of China.

Data och Arkitektur

På grund av bristen på tidigare dataset eller projekt som delade detta syfte, och det faktum att RF-signalerna inte hade använts tidigare i en GAN-bildsyntesram, var forskarna tvungna att utveckla nya metoder.

Kärnarkitekturen i RFGAN.

Kärnarkitekturen i RFGAN.

Adaptiv normalisering användes för att tolka de dubbla värmekartorna under träningsprocessen, så att de korresponderar rumsligt med de inspelade bilderna.

RF-inspelningsenheterna var millimeter-vågsradar (mmWave) konfigurerade som två antennmatriser, horisontella och vertikala. Frekvensmodulerad kontinuerlig våg (FMCW) och linjära antenn användes för sändning och mottagning.

Generatoren tar emot en källram som inmatningslager, med den RF-sammanslagna (värmekart-) representationen som orkestrerar nätverket genom normalisering på konvolutionslagernas nivå.

Data

Data samlades in från RF-signalreflektioner från mmWave-antennen vid en frekvens på endast 20 Hz, med samtidig mänsklig videainspelning vid en mycket låg hastighet av 10 fps. Nio inomhusscener spelades in, med sex frivilliga, var och en som bar olika kläder under olika sessioner av datainsamlingen.

Resultatet var två distinkta dataset, RF-Aktivitet och RF-Gång, den första innehållande 68 860 bilder av människor i varierande positioner (såsom knäböj och gång), tillsammans med 137 760 motsvarande värmekartor; och den senare innehållande 67 860 mänskliga slumpmässiga gångsekvenser, tillsammans med 135 720 par av associerade värmekartor.

Data delades, enligt konvention, ojämnt mellan tränings- och testdata, med 55 225 bildsekvenser och 110 450 värmekartpar som användes för träningsändamål, och resten hölls tillbaka för testning. RGB-inspelningssekvenser storleksändrades till 320×180, och värmekartor storleksändrades till 201×160.

Modellen tränades sedan med Adam vid en konstant inlärningshastighet på 0,0002 för både generatoren och diskriminatoren, vid en epoch på 80 och en (mycket gles) batchstorlek på 2. Träningen ägde rum via PyTorch på en konsumentnivå, ensam GTX-1080-GPU, vars 8 GB VRAM generellt anses vara ganska blygsamt för en sådan uppgift (vilket förklarar den låga batchstorleken).

Även om forskarna anpassade några konventionella mått för att testa realismen i utdata (detaljerat i artikeln), och genomförde de sedvanliga ablations-testerna, fanns det inget tidigare arbete att mäta prestandan för RFGAN mot.

Öppen Intresse för Hemliga Signaleringar

RFGAN är inte det första projektet som försöker använda radiofrekvenser för att bygga en volymetrisk bild av vad som händer i ett rum. 2019 utvecklade forskare från MIT CSAIL en arkitektur som kallades RF-Avatar, som kunde rekonstruera 3D-människor baserat på radiofrekvenssignalering i Wi-Fi-området, under svåra förhållanden av döljande.

I MIT CSAIL-projektet från 2019 användes radiovågor för att ta bort döljande, även inklusive väggar och kläder, för att återskapa inspelade föremål i en mer traditionell CGI-baserad arbetsflöde. Källa: https://people.csail.mit.edu/mingmin/papers/rf-avatar.pdf

I MIT CSAIL-projektet från 2019 användes radiovågor för att ta bort döljande, även inklusive väggar och kläder, för att återskapa inspelade föremål i en mer traditionell CGI-baserad arbetsflöde. Källa: https://people.csail.mit.edu/mingmin/papers/rf-avatar.pdf

Forskarna bakom den nya artikeln erkänner också löst relaterat tidigare arbete kring miljökartläggning med radiovågor (inget av dem försökte återskapa fotorealistiska människor), som försökte uppskatta mänsklig hastighet; se genom väggar med Wi-Fi; utvärdera mänskliga poser; och till och med känna igen mänskliga gester, bland många andra mål.

Överförbarhet och Vidare Tillämpbarhet

Forskarna gick sedan vidare för att se om deras upptäckt var överanpassad till den initiala insamlingsmiljön och träningsomständigheterna, även om artikeln erbjuder få detaljer om denna fas av experimentet. De hävdar:

‘För att distribuera vår modell i en ny scen, behöver vi inte träna hela modellen från början. Vi kan finjustera den förtränade RFGAN med mycket lite data (cirka 40 sekunders data) för att få liknande resultat.’

Och fortsätter:

‘Förlustfunktionerna och hyperparametrarna är desamma som under träningssteget. Från de kvantitativa resultaten finner vi att den förtränade RFGAN-modellen kan generera önskvärda mänskliga aktivitetssidor i den nya scenen efter finjustering med bara lite data, vilket betyder att vår föreslagna modell har potentialen att användas brett.’

Baserat på artikeln detaljer om denna banbrytande tillämpning av en ny teknik, är det inte tydligt om nätverket som forskarna har skapat är “fit-tränat” uteslutande till de ursprungliga föremålen, eller om RF-värmekartor kan utläsa detaljer som färgen på kläder, eftersom detta verkar ligga mellan de två olika typerna av frekvenser som är inblandade i optisk och radioinspelning.

Ändå är RFGAN ett nytt sätt att använda de imiterande och representativa krafterna i Generativa Adversarial Networks för att skapa en ny och intressant form av övervakning – en som potentiellt kan fungera i mörker och genom väggar, på ett sätt som är ännu mer imponerande än nyliga försök att se runt hörn med reflekterat ljus.

 

 

8:e december 2021 (dag för första publicering), 20:04 GMT+2 – borttagen upprepad ord. – MA

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai