Andersonův úhel

Syntéza lidského obrazu z odražených radiových vln

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Vědci z Číny vyvinuli metodu pro syntézu téměř fotorealistických obrazů lidí bez použití kamer, pomocí radiových vln a Generativních adversativních sítí (GAN). Systém, který vytvořili, je trénován na skutečných obrazech pořízených v dobrém světle, ale je schopen zachytit relativně autentické “snímky” lidí i v tmavých podmínkách – a dokonce i skrze významné překážky, které by skryly lidi před konvenčními kamerami.

Obrazy se spoléhají na “teplotní mapy” ze dvou radiových antén, jedné, která zachycuje data ze stropu dolů, a druhé, která zaznamenává perturbace radiových vln z “stojící” pozice.

Výsledné fotografie z experimentů vědců mají beztvarý, “J-Horror” aspekt:

Na základě trénování skutečných obrazů lidí ve stejné prostředí, RFGAN používá radiové vlny k zaznamenání lidské činnosti a generování snímků, které aproximují, co omezené rozlišení nízkofrekvenčních RF signálů vnímá. Světla nejsou nutná, protože barvy jsou (zdá se) vnímány způsobem, jakým jsou radiové vlny perturbovány přítomností lidí, a variacemi frekvence, jak radiové vlny vracejí zpět v různých signálních silách a s rozdílnými charakteristikami. Zdroj: https://arxiv.org/pdf/2112.03727.pdf

RFGAN je trénován na obrazech skutečných lidí v kontrolovaném prostředí a na radiových vlnových mapách, které zaznamenávají lidskou činnost. Po naučení funkcí z dat, RFGAN může poté generovat snímky na základě nových RF dat. Výsledný obraz je aproximace, založená na omezeném rozlišení nízkofrekvenčních RF signálů. Tento proces funguje i v tmavých prostředích a skrze různé potenciální překážky. Zdroj: https://arxiv.org/pdf/2112.03727.pdf

Pro trénování GAN, nazvaného RFGAN, vědci použili shodná data z běžné RGB kamery a ze spojených odpovídajících radiových vlnových map, které byly vyprodukovány přesně v okamžiku zachycení. Obrazy syntetizovaných lidí v novém projektu tendují být rozmazané způsobem podobným rané daguerrotypické fotografii, protože rozlišení radiových vln použitých je velmi nízké, s hloubkovým rozlišením 7,5 cm a úhlovým rozlišením asi 1,3 stupně.

Nahoře, obraz, který je krmen do GAN sítě - dole, dvě teplotní mapy, horizontální a vertikální, které charakterizují osobu v místnosti, a které jsou syntetizovány samy o sobě uvnitř architektury do 3D reprezentace perturbovaných dat.

Nahoře, obraz, který je krmen do GAN sítě – dole, dvě teplotní mapy, horizontální a vertikální, které charakterizují osobu v místnosti, a které jsou syntetizovány samy o sobě uvnitř architektury do 3D reprezentace perturbovaných dat.

Nová práce, nazvaná RFGAN: RF-Based Human Synthesis, pochází od šesti vědců z University of Electronic Science and Technology of China.

Data a architektura

Vzhledem k tomu, že neexistovaly žádné předchozí datové sady nebo projekty, které by sdílely tento rozsah, a skutečnost, že RF signály nebyly dříve použity v rámci GAN obrazové syntézy, vědci museli vyvinout nové metodologie.

Jádro architektury RFGAN.

Jádro architektury RFGAN.

Adaptivní normalizace byla použita k interpretaci dvojice teplotních map během trénování, aby odpovídaly prostorově se zachycenými daty.

RF zachycovací zařízení byla konfigurována jako dva anténní pole, horizontální a vertikální. Použity byly frekvenčně modulované nepřetržité vlny (FMCW) a lineární antény pro transceiving.

Generátor dostává zdroj rámce jako vstupní vrstvu, s RF spojenou (teplotní mapou) reprezentací, která orchestruje síť normalizací na úrovni konvolučních vrstev.

Data

Data byla shromážděna z RF signálových odrazů z mmWave antény na pouhých 20 Hz, s simultánním lidským videem zachyceným na velmi nízkém 10 fps. Bylo zachyceno devět vnitřních scén, pomocí šesti dobrovolníků, z nichž každý nosil různé oblečení pro různé relace sběru dat.

Výsledkem byly dvě odlišné datové sady, RF-Activity a RF-Walk, první obsahující 68 860 obrazů lidí v různých pozicích (jako squat a walk), spolu s 137 760 odpovídajícími teplotními mapami; a druhá obsahující 67 860 lidských náhodných chodeb, spolu s 135 720 páry spojených teplotních map.

Data, podle konvence, byla rozdělena nerovnoměrně mezi trénování a testování, s 55 225 obrazovými rámci a 110 450 páry teplotních map použitými pro trénování, a zbytek byl držen zpět pro testování. RGB zachycené rámce byly přepočteny na 320×180, a teplotní mapy přepočteny na 201×160.

Model byl poté trénován s Adamem na konzistentní učící rychlosti 0,0002 pro generátor i diskriminátor, na epochě 80 a (velmi řídké) velikosti batche 2. Trénování probíhalo prostřednictvím PyTorch na spotřebitelské úrovni sole GTX-1080 GPU, jehož 8 GB VRAM by obecně bylo považováno za bastante skromné pro takovou úlohu (což vysvětluje nízkou velikost batche).

Ačkoli vědci adaptovali některé konvenční metriky pro testování realismu výstupu (podrobně popsáno v práci), a provedli obvyklé ablační testy, neexistovala žádná předchozí práce, proti které by se mohla měřit výkonnost RFGAN.

Otevřený zájem o tajné signály

RFGAN není prvním projektem, který se pokusil použít radiové frekvence k vytvoření objemového obrazu toho, co se děje v místnosti. V roce 2019 vědci z MIT CSAIL vyvinuli architekturu nazvanou RF-Avatar, schopnou rekonstruovat 3D lidi na základě radiových frekvencí v rozsahu Wi-Fi, za podmínek závažného zakrytí.

V projektu MIT CSAIL z roku 2019 byly radiové vlny použity k odstranění zakrytí, včetně stěn a oděvů, za účelem rekonstrukce zachycených subjektů v tradičním CGI-založeném pracovním postupu. Zdroj: https://people.csail.mit.edu/mingmin/papers/rf-avatar.pdf

V projektu MIT CSAIL z roku 2019 byly radiové vlny použity k odstranění zakrytí, včetně stěn a oděvů, za účelem rekonstrukce zachycených subjektů v tradičním CGI-založeném pracovním postupu. Zdroj: https://people.csail.mit.edu/mingmin/papers/rf-avatar.pdf

Vědci nové práce také uznávají volně související předchozí práci kolem mapování prostředí s radiovými vlnami (žádná z nich se nepokoušela rekonstruovat fotorealistické lidi), která se snažila odhadnout lidskou rychlost; vidět skrze stěny s Wi-Fi; hodnotit lidské postoje; a dokonce rozpoznat lidské gesta, mezi mnoha dalšími cíli.

Přenosnost a širší použitelnost

Vědci se poté pokusili zjistit, zda jejich objev byl nadměrně přizpůsoben počátečnímu zachycovacímu prostředí a trénovacím okolnostem, ačkoli práce nabízí málo detailů o této fázi experimentu. Tvrdí:

‘Chceme-li nasadit náš model do nové scény, nemusíme znovu trénovat celý model od začátku. Můžeme jemně upravit předtrénovaný RFGAN pomocí velmi málo dat (asi 40 sekund dat) a získat podobné výsledky.’

A pokračují:

‘Funkce ztrát a hyperparametry jsou stejné jako ve fázi trénování. Z kvantitativních výsledků jsme zjistili, že předtrénovaný RFGAN model může generovat žádoucí lidské aktivity ve nové scéně po jemné úpravě s velmi málo daty, což znamená, že náš navrhovaný model má potenciál pro široké použití.’

Na základě detailů v práci o tomto seminárním použití nové techniky není jasné, zda síť, kterou vědci vytvořili, je “fit-trénována” výhradně pro původní subjekty, nebo zda RF-teplotní mapy mohou odvodit detaily, jako je barva oděvu, protože to zdá se, že spojuje dva různé typy frekvencí zapojených do optického a radiového zachycení.

Either way, RFGAN je novým způsobem použití imitačních a reprezentačních sil Generativních adversativních sítí k vytvoření nové a zajímavé formy dohledu – jedné, která by mohla potenciálně fungovat v tmě a skrze stěny, způsobem ještě působivějším než nedávné úsilí vidět za rohy s odraženým světlem.

 

 

8. prosince 2021 (den první publikace), 20:04 GMT+2 – odstraněno opakované slovo. – MA

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai