Andersons hoek
Synthese van menselijke beelden uit gereflecteerde radiogolven

Onderzoekers uit China hebben een methode ontwikkeld om near-fotorealistische beelden van mensen te synthetiseren zonder camera’s, door radiogolven en Generative Adversarial Networks (GAN’s) te gebruiken. Het systeem dat ze hebben ontwikkeld, is getraind op echte beelden genomen in goed licht, maar is in staat om relatief authentieke ‘snapshots’ van mensen te maken, zelfs wanneer de omstandigheden donker zijn – en zelfs door grote obstakels heen die mensen voor conventionele camera’s zouden verbergen.
De beelden zijn afhankelijk van ‘heat maps’ van twee radiogolven, waarvan er een gegevens verzamelt vanaf het plafond en de andere radiogolven perturbaties opneemt vanuit een ‘staande’ positie.
De resulterende foto’s van de proof-of-concept-experimenten van de onderzoekers hebben een gezichtsloos, ‘J-Horror’-aspect:

RFGAN is getraind op beelden van echte mensen in gecontroleerde omgevingen en op radiogolven-heatmaps die menselijke activiteit opnemen. Nadat het netwerk kenmerken heeft geleerd van de gegevens, kan RFGAN vervolgens snapshots genereren op basis van nieuwe RF-gegevens. Het resulterende beeld is een benadering, gebaseerd op de beperkte resolutie van de lage frequentie RF-signalen die beschikbaar zijn. Dit proces werkt zelfs in verduisterde omgevingen en door een verscheidenheid aan potentiële obstakels. Bron: https://arxiv.org/pdf/2112.03727.pdf
Om de GAN te trainen, die RFGAN is genoemd, gebruikten de onderzoekers overeenkomstige gegevens van een standaard RGB-camera en van de geconcateneerde overeenkomstige radiogolven-heatmaps die op het exacte moment van opname werden geproduceerd. Beelden van gesynthetiseerde mensen in het nieuwe project zijn vaak wazig op een manier die lijkt op vroege Daguerreotype-fotografie, omdat de resolutie van de gebruikte radiogolven zeer laag is, met een diepte-resolutie van 7,5 cm en een hoekresolutie van ongeveer 1,3 graden.

Boven, het beeld dat aan het GAN-netwerk wordt gevoerd – onder, de twee heatmaps, horizontaal en verticaal, die de persoon in de kamer karakteriseren en die zelf worden gesynthetiseerd in de architectuur tot een 3D-weergave van de verstoord gegevens.
Het nieuwe artikel, getiteld RFGAN: RF-gebaseerde mensensynthese, komt van zes onderzoekers van de Universiteit van Elektronica en Technologie van China.
Gegevens en architectuur
Vanwege het ontbreken van enige eerdere datasets of projecten die deze reikwijdte deelden, en het feit dat RF-signalen niet eerder zijn gebruikt in een GAN-afbeeldingssyntheseframework, moesten de onderzoekers nieuwe methodologieën ontwikkelen.

De kernarchitectuur van RFGAN.
Adaptieve normalisatie werd gebruikt om de tweeling heatmap-afbeeldingen te interpreteren tijdens het trainen, zodat ze ruimtelijk overeenkomen met de opgenomen beeldgegevens.
De RF-opname-apparaten waren millimetergolfradars die waren geconfigureerd als twee antenne-arrays, horizontaal en verticaal. Frequentiegemoduleerde continue golf (FMCW) en lineaire antennes werden gebruikt voor transmissie.
De Generator ontvangt een bronframe als invoerlaag, met de RF-gefuseerde (heatmap-)weergave die het netwerk orkestreert via normalisatie op het niveau van de convolutionele lagen.
Gegevens
De gegevens werden verzameld van RF-signaalreflecties van de mmWave-antenne bij een frequentie van slechts 20 Hz, met gelijktijdige menselijke videocapture bij een zeer lage 10 fps. Negen binnen-scènes werden opgenomen, met zes vrijwilligers, die elk verschillende kleding droegen voor verschillende sessies van de gegevensverzameling.
Het resultaat was twee afzonderlijke datasets, RF-Activiteit en RF-Wandelen, waarvan de eerste 68.860 beelden van mensen in verschillende posities bevatte (zoals hurken en wandelen), samen met 137.760 overeenkomstige heatmap-frames; en de laatste bevatte 67.860 menselijke willekeurige wandel-frames, samen met 135.720 paren van geassocieerde heatmaps.
De gegevens werden, volgens conventie, onevenredig verdeeld tussen trainen en testen, met 55.225 beeldframes en 110.450 heatmap-paren die werden gebruikt voor trainen, en de rest werd achtergehouden voor testen. RGB-capture-frames werden herschaald naar 320×180, en heatmaps werden herschaald naar 201×160.
Het model werd vervolgens getraind met Adam bij een consistent leer tempo van 0,0002 voor zowel de generator als de discriminator, bij een epoch van 80 en een (zeer schaarse) batchgrootte van 2. Het trainen vond plaats via PyTorch op een consumentenniveau sole GTX-1080 GPU, waarvan de 8 GB VRAM over het algemeen als bescheiden zou worden beschouwd voor een dergelijke taak (wat de lage batchgrootte verklaart).
Hoewel de onderzoekers enkele conventionele metrics aanpasten voor het testen van de realiteit van de uitvoer (gedetailleerd in het artikel), en de gebruikelijke ablatietests uitvoerden, was er geen equivalent voorgaand werk waarop de prestaties van RFGAN konden worden gemeten.
Openbaar belang in geheime signalen
RFGAN is niet het eerste project dat heeft geprobeerd om radiogolven te gebruiken om een volumetrisch beeld te maken van wat er in een kamer gebeurt. In 2019 ontwikkelden onderzoekers van MIT CSAIL een architectuur genaamd RF-Avatar, die in staat was om 3D-mensen te reconstrueren op basis van radiogolven in het Wi-Fi-bereik, onder zware omstandigheden van occlusie.

In het MIT CSAIL-project van 2019 werden radiogolven gebruikt om occlusies te verwijderen, zelfs inclusief muren en kleding, om onderwerpen te reconstrueren in een meer traditionele CGI-gebaseerde workflow. Bron: https://people.csail.mit.edu/mingmin/papers/rf-avatar.pdf
De onderzoekers van het nieuwe artikel erkennen ook losjes verwant voorgaand werk rondom omgevingskaarten met radiogolven (geen van hen probeerde om fotorealistische mensen te reconstrueren), dat probeerde om menselijke snelheid te schatten; zie door muren met Wi-Fi; menselijke poses evalueren; en zelfs menselijke gebaren herkennen, onder andere doelen.
Overdraagbaarheid en bredere toepasbaarheid
De onderzoekers stelden vervolgens vast of hun ontdekking overgedragen was naar de initiële opname-omgeving en trainingsomstandigheden, hoewel het artikel weinig details biedt over deze fase van het experiment. Zij beweren:
‘Om ons model in een nieuwe scène te implementeren, hoeven we het hele model niet opnieuw te trainen. We kunnen het voorgetrainde RFGAN fijn afstemmen met heel weinig gegevens (ongeveer 40 seconden gegevens) om soortgelijke resultaten te krijgen.’
En vervolgen:
‘De verliesfuncties en hyperparameters zijn hetzelfde als de trainingsfase. Uit de kwantitatieve resultaten blijkt dat het voorgetrainde RFGAN-model in staat is om gewenste menselijke activiteitsframes te genereren in de nieuwe scène na fijn afstemmen met slechts een beetje gegevens, wat betekent dat ons voorgestelde model het potentieel heeft om breed te worden gebruikt.’
Op basis van de details in het artikel over deze seminale toepassing van een nieuwe techniek, is het niet duidelijk of het netwerk dat de onderzoekers hebben gemaakt ‘fit-getraind’ is op de oorspronkelijke onderwerpen, of dat RF-heatmaps details kunnen afleiden zoals de kleur van kleding, aangezien dit lijkt te grenzen aan de twee verschillende soorten frequenties die betrokken zijn bij optische en radiocapture-methoden.
Either way, RFGAN is een noviteit in het gebruik van de imitatie- en representatieve krachten van Generative Adversarial Networks om een nieuwe en intrigerende vorm van surveillance te creëren – een die potentieel kan opereren in het donker en door muren, op een manier die nog indrukwekkender is dan recente inspanningen om om hoeken te kijken met gereflecteerd licht.
8 december 2021 (dag van eerste publicatie), 20:04 GMT+2 – herhaald woord verwijderd. – MA












