Unghiul lui Anderson

Sinteză de imagini umane din unde radio reflectate

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Cercetători din China au dezvoltat o metodă pentru a sintetiza imagini aproape fotoreale ale oamenilor fără camere, utilizând unde radio și Rețele Adversative Generative (GAN). Sistemul pe care l-au conceput este antrenat pe imagini reale luate în lumină bună, dar este capabil să capteze “instantanee” relativ autentice ale oamenilor, chiar și în condiții de întuneric – și chiar prin obstrucții majore care ar ascunde oamenii de camerele convenționale.

Imaginile se bazează pe “hărți de căldură” de la două antene radio, una care captează date de la tavan în jos, și alta care înregistrează perturbări ale undelor radio dintr-o poziție “în picioare”.

Imaginile rezultate din experimentele de concept ale cercetătorilor au un aspect fără față, “J-Horror”:

Pe baza imaginilor reale ale oamenilor din același mediu, RFGAN utilizează hărți de căldură ale undelor radio pentru a înregistra activitatea umană și a genera instantanee care aproximează ceea ce percep semnalele RF de rezoluție joasă. Lumina nu este necesară, deoarece culorile sunt (aparent) percepute prin modul în care unde radio sunt perturbate de prezența oamenilor și prin variații de frecvență pe măsură ce undele radio se întorc cu o varietate de intensități de semnal și cu caracteristici diferite. Sursă: https://arxiv.org/pdf/2112.03727.pdf

RFGAN este antrenat pe imagini de oameni reali în medii controlate și pe hărți de căldură ale undelor radio care înregistrează activitatea umană. După ce a învățat caracteristici din date, RFGAN poate genera instantanee pe baza noilor date RF. Imaginea rezultată este o aproximație, pe baza rezoluției limitate a semnalelor RF de frecvență joasă disponibile. Acest proces funcționează chiar și în medii întunecate și prin diverse obstacole. Sursă: https://arxiv.org/pdf/2112.03727.pdf

Pentru a antrena GAN, numit RFGAN, cercetătorii au utilizat date împerecheate de la o cameră RGB standard și de la hărțile de căldură ale undelor radio concatenate, care au fost produse în momentul exact al capturii. Imaginile de oameni sintetizați în noul proiect tind să fie estompate într-un mod similar cu fotografia Daguerreotype timpurie, deoarece rezoluția undelor radio utilizate este foarte scăzută, cu o rezoluție de adâncime de 7,5 cm și o rezoluție unghiulară de aproximativ 1,3 grade.

Mai sus, imaginea alimentată rețelei GAN - mai jos, cele două hărți de căldură, orizontală și verticală, care caracterizează persoana din cameră și care sunt sintetizate ele însele în interiorul arhitecturii într-o reprezentare 3D a datelor perturbate.

Mai sus, imaginea alimentată rețelei GAN – mai jos, cele două hărți de căldură, orizontală și verticală, care caracterizează persoana din cameră și care sunt sintetizate ele însele în interiorul arhitecturii într-o reprezentare 3D a datelor perturbate.

Noul articol, intitulat RFGAN: Sinteză Umană pe Baza Undelor Radio, provine de la șase cercetători de la Universitatea de Știință și Tehnologie Electronică din China.

Date și Arhitectură

Din cauza lipsei oricăror seturi de date sau proiecte anterioare care au împărtășit acest scop și a faptului că semnalele RF nu au fost utilizate anterior într-un cadru de sinteză de imagini GAN, cercetătorii au trebuit să dezvolte metodologii noi.

Arhitectura de bază a RFGAN.

Arhitectura de bază a RFGAN.

Normalizarea adaptivă a fost utilizată pentru a interpreta imaginile cu hărți de căldură gemene în timpul antrenamentului, astfel încât acestea să corespundă spațial cu datele de imagine capturate.

Dispozitivele de captură RF au fost radare cu undă milimetrică (mmWave) configurate ca două matrice de antene, orizontală și verticală. S-au utilizat unde cu modulație de frecvență continuă (FMCW) și antene liniare pentru transmisie și recepție.

Generatorul primește un cadru sursă ca intrare, cu reprezentarea (harta de căldură) a undelor radio orchestrând rețeaua prin normalizare la nivelul straturilor convoluționale.

Date

Datele au fost colectate de la reflexiile semnalelor RF de la antena mmWave la o frecvență de numai 20 Hz, cu captură video umană simultană la o rată foarte scăzută de 10 fps. S-au capturat nouă scene interioare, utilizând șase voluntari, fiecare purtând haine diferite pentru diverse sesiuni de colectare a datelor.

Rezultatul a fost două seturi de date distincte, RF-Activity și RF-Walk, primul conținând 68.860 de imagini cu oameni în diverse poziții (cum ar fi îngenunchiat și mers), împreună cu 137.760 de cadre de hărți de căldură corespunzătoare; și al doilea conținând 67.860 de cadre de mers ale oamenilor, împreună cu 135.720 de perechi de hărți de căldură asociate.

Datele, conform convenției, au fost împărțite inegal între antrenament și testare, cu 55.225 de cadre de imagine și 110.450 de perechi de hărți de căldură utilizate pentru antrenament, și restul rezervate pentru testare. Cadrele de captură RGB au fost redimensionate la 320×180, iar hărțile de căldură au fost redimensionate la 201×160.

Modelul a fost apoi antrenat cu Adam la o rată de învățare constantă de 0,0002 pentru atât generator, cât și discriminator, la o epocă de 80 și o dimensiune de lot (foarte rară) de 2. Antrenamentul a avut loc prin PyTorch pe un GPU GTX-1080 de nivel consumator, a cărui VRAM de 8 GB ar fi considerată în general modestă pentru o astfel de sarcină (explicând dimensiunea mică a lotului).

Deși cercetătorii au adaptat unele metrice convenționale pentru testarea realismului ieșirii (detaliate în articol), și au efectuat testele de ablație obișnuite, nu a existat niciun precedent de lucru împotriva căruia să se poată măsura performanța RFGAN.

Interes Deschis pentru Semnale Secrete

RFGAN nu este primul proiect care încearcă să utilizeze frecvențe radio pentru a construi o imagine volumetrică a ceea ce se întâmplă într-o cameră. În 2019, cercetători de la MIT CSAIL au dezvoltat o arhitectură numită RF-Avatar, capabilă de a reconstrui oameni 3D pe baza semnalelor de frecvență radio din gama Wi-Fi, în condiții severe de ocluziune.

În proiectul MIT CSAIL din 2019, unde radio au fost utilizate pentru a elimina ocluziunile, inclusiv pereți și haine, pentru a recrea subiecții capturați într-un flux de lucru CGI mai tradițional. Sursă: https://people.csail.mit.edu/mingmin/papers/rf-avatar.pdf

În proiectul MIT CSAIL din 2019, unde radio au fost utilizate pentru a elimina ocluziunile, inclusiv pereți și haine, pentru a recrea subiecții capturați într-un flux de lucru CGI mai tradițional. Sursă: https://people.csail.mit.edu/mingmin/papers/rf-avatar.pdf

Cercetătorii noului articol recunosc, de asemenea, lucrări anterioare legate de cartografierea mediului cu unde radio (niciuna dintre ele încercând să recrieze oameni fotoreali), care au încercat să estimeze viteza umană; a vedea prin pereți cu Wi-Fi; evalua pozițiile umane; și chiar recunoaște gesturile umane, printre alte obiective.

Transferabilitate și Aplicabilitate Mai Lară

Cercetătorii au încercat apoi să vadă dacă descoperirea lor a fost suprapusă pe mediul inițial de captură și circumstanțele de antrenament, deși articolul oferă puține detalii despre această fază a experimentului. Ei afirmă:

‘Pentru a implementa modelul nostru într-o nouă scenă, nu avem nevoie să reantrenăm întregul model de la început. Putem ajusta RFGAN preantrenat utilizând foarte puține date (aproximativ 40 de secunde de date) pentru a obține rezultate similare.’

Și continuă:

‘Funcțiile de pierdere și hiperparametrii sunt aceiași cu cei din etapa de antrenament. Din rezultatele cantitative, constatăm că modelul RFGAN preantrenat poate genera cadre de activitate umană de dorit în noua scenă după ajustare cu doar puține date, ceea ce înseamnă că modelul nostru propus are potențialul de a fi utilizat pe scară largă.’

Pe baza detaliilor din articol despre această aplicație seminală a unei tehnici noi, nu este clar dacă rețeaua pe care au creat-o cercetătorii este “antrenată pentru a se potrivi” exclusiv cu subiecții originali sau dacă hărțile de căldură RF pot deduce detalii precum culoarea îmbrăcămintei, deoarece acest lucru pare să se situeze între cele două tipuri de frecvențe implicate în metodele de captură optică și radio.

În orice caz, RFGAN este o modalitate nouă și interesantă de utilizare a puterilor imitative și reprezentative ale Rețelelor Adversative Generative pentru a crea o nouă și intrigantă formă de supraveghere – una care ar putea funcționa în întuneric și prin pereți, într-un mod și mai impresionant decât eforturile recente de a vedea în jurul colțurilor cu lumină reflectată.

 

 

8 decembrie 2021 (ziua primei publicări), 20:04 GMT+2 – s-a eliminat cuvântul repetat. – MA

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai