Kąt Andersona
Synteza obrazu ludzkiego z fal radiowych

Naukowcy z Chin opracowali metodę syntezy niemal fotorealistycznych obrazów ludzi bez użycia kamer, wykorzystując fale radiowe i Sieci Przeciwstawnych Generatywnych (GAN). System, który opracowali, jest szkolony na rzeczywistych obrazach zrobionych w dobrych warunkach oświetleniowych, ale potrafi uchwycić dość autentyczne “zrzuty” ludzi nawet w ciemnych warunkach – i nawet przez duże przeszkody, które ukryłyby ludzi przed konwencjonalnymi kamerami.
Obrazy opierają się na “mapach cieplnych” z dwóch anten radiowych, jednej rejestrującej dane z sufitu w dół, a drugiej rejestrującej perturbacje fal radiowych z “stojącej” pozycji.
Wynikające z tego obrazy z eksperymentów dowodowych naukowców mają bez twarzy, “J-Horror” aspekt:

RFGAN jest szkolony na obrazach rzeczywistych ludzi w kontrolowanych środowiskach i na mapach cieplnych fal radiowych, które rejestrują aktywność ludzką. Po nauczeniu się cech z danych, RFGAN może następnie generować migawki na podstawie nowych danych RF. Wynikowy obraz jest przybliżeniem, opartym na ograniczonej rozdzielczości niskoczęstotliwościowych sygnałów RF. Ten proces działa nawet w ciemnych środowiskach i przez różne przeszkody. Źródło: https://arxiv.org/pdf/2112.03727.pdf
Aby przeszkolić GAN, nazwany RFGAN, naukowcy wykorzystali dopasowane dane z standardowej kamery RGB i z połączonych odpowiednich map cieplnych fal radiowych, które zostały wyprodukowane w dokładnym momencie uchwycenia. Obrazy syntetyzowanych ludzi w nowym projekcie mają tendencję do być rozmyte w sposób podobny do wczesnej fotografii daguerrotypowej, ponieważ rozdzielczość fal radiowych użytych jest bardzo niska, z rozdzielczością głębi 7,5 cm i rozdzielczością kątową około 1,3 stopnia.

Powyżej, obraz podawany do sieci GAN – poniżej, dwie mapy cieplne, poziome i pionowe, które charakteryzują osobę w pokoju i które są syntetyzowane same w sobie w architekturze w trójwymiarową reprezentację perturbowanych danych.
Nowy artykuł, zatytułowany RFGAN: Synteza ludzi oparta na falach radiowych, pochodzi od sześciu naukowców z Uniwersytetu Nauk Elektronicznych i Technologii Chin.
Dane i Architektura
Ze względu na brak wcześniejszych zbiorów danych lub projektów o tym samym zakresie i faktu, że sygnały RF nie były wcześniej używane w ramach sieci GAN do syntezy obrazu, naukowcy musieli opracować nowe metody.

Rdzeń architektury RFGAN.
Normalizacja adaptacyjna została użyta do interpretacji bliźniaczych obrazów map cieplnych podczas szkolenia, tak aby odpowiadały one przestrzennie z uchwycionymi danymi obrazu.
Urządzenia do uchwycenia fal radiowych były radarami fal milimetrowych (mmWave) skonfigurowanymi jako dwie tablice anten, poziome i pionowe. Wykorzystano również falę modulowaną ciągłą (FMCW) i anteny liniowe do transmisji.
Generator otrzymuje ramkę źródłową jako warstwę wejściową, z reprezentacją fal radiowych (mapą cieplną) sterującą siecią poprzez normalizację na poziomie warstw konwolucyjnych.
Dane
Dane zostały zebrane z odbicia sygnałów radiowych z anteny mmWave o częstotliwości 20 Hz, z jednoczesnym nagrywaniem wideo ludzi w bardzo niskiej rozdzielczości 10 klatek na sekundę. Zarejestrowano dziewięć scen wewnętrznych, wykorzystując sześciu wolontariuszy, każdy z nich nosił różne ubrania w różnych sesjach zbierania danych.
Wynikiem były dwa odrębne zbiory danych, RF-Aktywność i RF-Chód, pierwszy zawierający 68 860 obrazów ludzi w różnych pozycjach (takich jak przysiad i chód), wraz z 137 760 odpowiednimi ramkami map cieplnych; a drugi zawierający 67 860 ramkami ludzi chodzących losowo, wraz z 135 720 parami powiązanych map cieplnych.
Dane, zgodnie z konwencją, zostały podzielone nierównomiernie między szkolenie a testowanie, z 55 225 ramkami obrazu i 110 450 parami map cieplnych wykorzystanymi do szkolenia, a resztą zatrzymaną do testowania. Ramki obrazu RGB zostały przeskalowane do 320×180, a mapy cieplne przeskalowane do 201×160.
Model został następnie przeszkolony z Adamem przy stałej szybkości uczenia się 0,0002 dla generatora i dyskryminatora, w epoce 80 i (bardzo rzadkim) rozmiarze partii 2. Szkolenie odbywało się za pomocą PyTorch na konsumentach poziomu GPU GTX-1080, którego 8 GB pamięci VRAM byłoby ogólnie uważane za skromne do tego zadania (co tłumaczy niski rozmiar partii).
Chociaż naukowcy dostosowali niektóre konwencjonalne metryki do testowania realizmu danych wyjściowych (szczegółowo opisanych w artykule), i przeprowadzili standardowe testy ablacjacji, nie było równoważnej wcześniejszej pracy, z którą można by było porównać wyniki RFGAN.
Otwarta zainteresowanie tajnymi sygnałami
RFGAN nie jest pierwszym projektem, który próbował wykorzystać częstotliwości radiowe do zbudowania objętościowego obrazu tego, co dzieje się w pokoju. W 2019 roku naukowcy z MIT CSAIL opracowali architekturę o nazwie RF-Avatar, zdolną do rekonstrukcji 3D ludzi na podstawie sygnałów radiowych w zakresie Wi-Fi, w warunkach ciężkich zakłóceń.

W projekcie MIT CSAIL z 2019 roku fale radiowe zostały wykorzystane do usunięcia zakłóceń, w tym nawet ścian i ubrania, w celu odtworzenia uchwycenia osób w bardziej tradycyjnym przepływie pracy CGI. Źródło: https://people.csail.mit.edu/mingmin/papers/rf-avatar.pdf
Naukowcy nowego artykułu również potwierdzają luźno związaną wcześniejszą pracę wokół mapowania środowiska z falami radiowymi (żadna z nich nie próbowała odtworzyć fotorealistycznych ludzi), która miała na celu oszacowanie prędkości ludzi; zobacz przez ściany z Wi-Fi; ocenić pozycje ludzi; i nawet rozpoznać gesty ludzi, wśród innych celów.
Przenoszalność i szersza stosowalność
Naukowcy następnie postanowili sprawdzić, czy ich odkrycie było przystosowane do początkowego środowiska uchwycenia i okoliczności szkolenia, chociaż artykuł oferuje niewiele szczegółów na temat tej fazy eksperymentu. Twierdzą:
‘Aby wdrożyć nasz model w nowej scenie, nie musimy ponownie szkolić całego modelu od początku. Możemy dostrajać wstępnie przeszkolony RFGAN, używając bardzo niewielkich danych (około 40 sekund danych), aby uzyskać podobne wyniki.’
I kontynuują:
‘Funkcje strat i hiperparametry są takie same jak w fazie szkolenia. Z wyników ilościowych stwierdzamy, że wstępnie przeszkolony model RFGAN może generować pożądane ramki aktywności ludzkiej w nowej scenie po dostrajaniu z tylko niewielkimi danymi, co oznacza, że nasz proponowany model ma potencjał do szerokiego zastosowania.’
Na podstawie szczegółów artykułu dotyczących tego przełomowego zastosowania nowej techniki, nie jest jasne, czy sieć, którą stworzyli naukowcy, jest “przeszkolona” wyłącznie do oryginalnych osób, czy też mapy cieplne fal radiowych mogą wywnioskować szczegóły, takie jak kolor ubrania, ponieważ to wydaje się przechodzić przez dwa różne rodzaje częstotliwości zaangażowanych w metody uchwycenia optycznego i radiowego.
W każdym razie RFGAN jest nowym sposobem wykorzystania naśladujących i reprezentatywnych możliwości Sieci Przeciwstawnych Generatywnych do stworzenia nowej i interesującej formy nadzoru – jednej, która mogłaby potencjalnie działać w ciemności i przez ściany, w sposób jeszcze bardziej imponujący niż niedawne próby zobaczenia za rogi z odbitym światłem.
8 grudnia 2021 (dzień pierwszej publikacji), 20:04 GMT+2 – usunięto powtórzone słowo. – MA












