Andersonin kulma

Ihmiskuvan synteesi heijastetuista radiotaajuuksista

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Kiinalaisten tutkijoiden kehittämä menetelmä mahdollistaa lähes valokuvamaisen ihmiskuvan synteesin ilman kameroiden käyttöä, hyödyntäen radiotaajuuksia ja Generative Adversarial Networks (GAN) -tekniikkaa. Tutkijoiden kehittämä järjestelmä on koulutettu todellisilla kuvilla, jotka on otettu hyvissä valaistusolosuhteissa, mutta se pystyy kuvaamaan ihmisiä aidosti myös pimeissä olosuhteissa ja esteiden läpi, joita perinteiset kamerat eivät pysty kuvaamaan.

Kuvat perustuvat “lämpökarttoihin”, jotka kaksi radiotaajuusantennia on kerännyt, yksi kattoa kohti ja toinen “seisomaan” asennossa.

Tutkijoiden kokeellisista kokeista saadut kuvat ovat kasvottomia ja muistuttavat japanilaista kauhuelokuvaa:

Perustuen todellisiin ihmiskuvissa samassa ympäristössä, RFGAN käyttää radiotaajuuslämpökarttoja ihmistoiminnan tallentamiseen ja syntetisoi kuvia, jotka vastaavat matalataajuisen RF-signaalin rajallista resoluutiota. Valot eivät ole välttämättömiä, koska värit havaitaan radiotaajuuslämpökarttojen muutoksina ja signaaleiden paluutaajuuksien vaihteluna. Lähde: https://arxiv.org/pdf/2112.03727.pdf

RFGAN on koulutettu todellisilla kuvilla ja radiotaajuuslämpökarttoilla. Sen jälkeen se pystyy generoimaan kuvia uusista RF-tiedoista. Tuloksena oleva kuva on approksimaatio, joka perustuu matalataajuisen RF-signaalin rajalliseen resoluutioon. Tämä prosessi toimii myös pimeissä olosuhteissa ja esteiden läpi. Lähde: https://arxiv.org/pdf/2112.03727.pdf

RFGAN:n kouluttamiseen käytettiin yhdistettyjä tietoja RGB-kamerasta ja radiotaajuuslämpökartasta, jotka otettiin samanaikaisesti. Syntetisoiduissa kuvissa ihmiset ovat usein sumearsia, samalla tavalla kuin varhaisissa daguerreotyypeissä, koska käytetyn radiotaajuuden resoluutio on hyvin alhainen, syvyyden resoluutio on 7,5 cm ja kulman resoluutio on noin 1,3 astetta.

Ylhäällä, kuva GAN-verkkoon - alhaalla, kaksi lämpökarttaa, vaaka- ja pystysuora, jotka kuvaavat henkilöä huoneessa ja jotka syntetisoidaan itse arkkitehtuuriin 3D-muodossa.

Ylhäällä, kuva GAN-verkkoon – alhaalla, kaksi lämpökarttaa, vaaka- ja pystysuora, jotka kuvaavat henkilöä huoneessa ja jotka syntetisoidaan itse arkkitehtuuriin 3D-muodossa.

Uusi artikkeli, jonka otsikko on RFGAN: RF-pohjainen ihmisen synteesi, on tehty kuuden Kiinan Elektroniikan ja Tietotekniikan Yliopiston tutkijan toimesta.

Tiedot ja Arkkitehtuuri

Tutkijoiden oli kehitettävä uusia menetelmiä, koska aiemmin ei ollut olemassa vastaavaa tietokantaa tai projekti, joka olisi käyttänyt RF-signaaleja GAN-kuvansynteesiin.

RFGAN:n ydinarkkitehtuuri.

RFGAN:n ydinarkkitehtuuri.

Adaptiivinen normalisointi käytettiin lämpökarttojen tulkintaan koulutuksen aikana, jotta ne vastaisivat tilallisesti kerättyjä kuvatietoja.

RF-kaappauslaitteet olivat millimetri-aaltoalueen (mmWave) tutkat, jotka oli määritelty kaksi antenniryhmäksi, vaaka- ja pystysuoraan. Taajuusmuuttuva jatkuva aalto (FMCW) ja lineaariset antennit käytettiin lähettämiseen ja vastaanottamiseen.

Generaattori vastaanottaa lähdekehyksen syötteenä, ja RF-yhdistetty (lämpökartta) edustaa verkkoa normalisoinnin kautta konvoluutiokerrosten tasolla.

Tiedot

Tiedot kerättiin RF-signaalin heijastuksista mmWave-antennista 20 Hz:n taajuudella, ja samanaikaisesti kuvaaminen tehtiin 10 fps:n nopeudella. Yhdeksän sisätilakohtauksia kerättiin, ja kuusi vapaaehtoista osallistui, ja heillä oli eri vaatteita eri istuntojen aikana.

Tuloksena oli kaksi erillistä tietokantaa, RF-Activity ja RF-Walk, joista ensimmäinen sisälsi 68 860 kuvaa ihmisistä eri asennoissa (kuten polvistu ja kävely), ja 137 760 vastaavaa lämpökarttaa; ja jälkimmäinen sisälsi 67 860 ihmisen satunnaisen kävelyn kehyksiä, ja 135 720 paria vastaavia lämpökarttoja.

Tiedot jaettiin epätasaisesti koulutus- ja testausosuuksiin, ja 55 225 kuvakehyksiä ja 110 450 lämpökarttaparia käytettiin koulutukseen, ja loput pidettiin testaamiseen. RGB-kuvakehykset muunnettiin 320×180-kokoisiksi, ja lämpökartat 201×160-kokoisiksi.

Malli koulutettiin Adamilla tasaisella oppimisnopeudella 0,0002 sekä generaattorille että diskriminaattorille, 80 epochin ja (hyvin harvan) 2:n batch-koon kanssa. Koulutus tehtiin PyTorchilla kuluttajaluokan GTX-1080-grafiikkakortilla, jonka 8 Gt:n VRAM olisi yleensä katsottu melko vaatimattomaksi tämänkaltaiseen tehtävään (selittäen matalan batch-koon).

Vaikka tutkijat sovelsivat joitakin perinteisiä mittareita tulosten realismin testaamiseen (yksityiskohtaisesti artikkelissa), ja suorittivat tavanomaiset ablaatiokokeet, ei ollut vertailukelpoista aiempaa työtä, johon RFGAN:n suorituskykyä voitiin verrata.

Avoin mielenkiinto salattuihin signaaleihin

RFGAN ei ole ensimmäinen hanke, joka on yrittänyt käyttää radiotaajuuksia tilan kolmiulotteisen kuvan luomiseen. Vuonna 2019 MIT CSAIL:n tutkijat kehittivät arkkitehtuurin nimeltä RF-Avatar, joka pystyi rekonstruoimaan 3D-ihmisiä radiotaajuuksien avulla Wi-Fi-taajuusalueella, jopa esteiden takana.

MIT CSAIL:n hankkeessa vuonna 2019 radiotaajuuksia käytettiin esteiden poistamiseen, mukaan lukien seinät ja vaatteet, jotta voitiin rekonstruoida kohteet perinteisemmässä CGI-pohjaisessa työvirrassa. Lähde: https://people.csail.mit.edu/mingmin/papers/rf-avatar.pdf

MIT CSAIL:n hankkeessa vuonna 2019 radiotaajuuksia käytettiin esteiden poistamiseen, mukaan lukien seinät ja vaatteet, jotta voitiin rekonstruoida kohteet perinteisemmässä CGI-pohjaisessa työvirrassa. Lähde: https://people.csail.mit.edu/mingmin/papers/rf-avatar.pdf

Tutkijat myös tunnustavat löyhästi liittyvän aiemman työn ympäristön karttaamisesta radiotaajuuksien avulla (joka ei yrittänyt rekonstruoida valokuvamaisia ihmisiä), joka pyrki arvioimaan ihmisen nopeutta; ks. seinien läpi Wi-Fi:n avulla; arvioimaan ihmisen asentoja; ja jopa tunnistamaan ihmisen eleitä, muun muassa.

Siirtäminen ja laajempi soveltuvuus

Tutkijat pyrkivät selvittämään, oliko heidän löytönsä ylikoulutettu alkuperäiseen havaintoympäristöön ja koulutusolosuhteisiin, vaikka artikkeli tarjoaa vain vähän yksityiskohtia tästä kokeen vaiheesta. He väittävät:

‘Jotta voisimme käyttää malliamme uudessa kohtauksessa, emme tarvitse kouluttaa koko mallia alusta. Voimme hienosäätää esikoulutettua RFGAN:ia käyttäen vain vähän dataa (noin 40 sekunnin dataa) saadaksemme samanlaisia tuloksia.’

Ja jatkavat:

‘Häviöfunktiot ja hyperparametrit ovat samat kuin koulutusvaiheessa. Määrällisten tulosten perusteella havaitsemme, että esikoulutettu RFGAN-malli pystyy generoimaan toivottavia ihmistoimintakehyksiä uudessa kohtauksessa vain vähän datan avulla, mikä tarkoittaa, että mallimme on mahdollisesti laajasti käytettävissä.’

Artikkelin yksityiskohtien perusteella ei ole selvää, onko tutkijoiden luoma verkko “koulutettu” yksinomaan alkuperäisiin kohteisiin vai voivatko RF-lämpökartat päätellä yksityiskohtia, kuten vaatteiden väriä, koska tämä vaatii eri taajuusalueita optisen ja radiotaajuuden tallennusmenetelmien välillä.

Joka tapauksessa, RFGAN on uusi tapa hyödyntää Generative Adversarial Networks -tekniikan jäljittely- ja edustusominaisuuksia luomaan uusi ja mielenkiintoinen valvontamuoto – yksi, joka voisi toimia pimeässä ja esteiden läpi, jopa vaikuttavammin kuin viimeaikaiset pyrkimykset nähdä kulmiin heijastetun valon avulla.

 

 

8. joulukuuta 2021 (julkaisupäivä), 20:04 GMT+2 – poistettu toistuva sana. – MA

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai