Погляд Anderson

Синтез зображень людини з відбитих радіохвиль

mm
Додайте Unite.AI до бажаних джерел у Google

Дослідники з Китаю розробили метод синтезу майже фотореалістичних зображень людей без камер, використовуючи радіохвилі та Генеративні суперницькі мережі (GAN). Система, яку вони створили, навчена на реальних зображеннях, зроблених у добрій освітленості, але здатна захоплювати відносно автентичні “фотографії” людей навіть у темних умовах – і навіть через великі перешкоди, які б приховали людей від звичайних камер.

Зображення залежать від “теплових карт” двох радіоантен, одна з яких захоплює дані з потолка вниз, а інша реєструє радіочастотні порушення з “стоячої” позиції.

Результатні фотографії з експериментів дослідників мають безлике, “жахаюче” вигляду:

На основі навчання реальних зображень людей у тому ж середовищі, RFGAN використовує радіочастотні теплові карти для реєстрації діяльності людини та генерації знімків, які наближаються до того, що обмежена роздільна здатність низькочастотних радіосигналів сприймає. Світло не потрібно, оскільки кольори (очевидно) сприймаються шляхом порушення радіохвиль присутністю людей та змінами частоти, коли радіохвилі повертаються з різними характеристиками. Джерело: https://arxiv.org/pdf/2112.03727.pdf

RFGAN навчається на зображеннях реальних людей у контрольованих середовищах та на радіочастотних теплових картах, які реєструють діяльність людини. Навчившись особливостей з даних, RFGAN може потім генерувати знімки на основі нових радіоданих. Результатом є наближення, засноване на обмеженій роздільній здатності низькочастотних радіосигналів. Цей процес працює навіть у затемнених середовищах та через різні потенційні перешкоди. Джерело: https://arxiv.org/pdf/2112.03727.pdf

Для навчання GAN, названого RFGAN, дослідники використовували зіставлені дані зі стандартної RGB-камери та з конкатенованих відповідних радіотеплових карт, які були створені в момент захоплення. Зображення синтезованих людей у новому проекті мають розмитий вигляд, подібний до ранньої дагерротипної фотографії, оскільки роздільна здатність використовуваних радіохвиль дуже низька, з роздільною здатністю глибини 7,5 см та кутовою роздільною здатністю близько 1,3 градусів.

Вгорі, зображення, яке подається до мережі GAN - внизу, дві теплові карти, горизонтальна та вертикальна, які характеризують людину в кімнаті та які синтезуються самі собою всередині архітектури у тривимірному представлені порушених даних.

Вгорі, зображення, яке подається до мережі GAN – внизу, дві теплові карти, горизонтальна та вертикальна, які характеризують людину в кімнаті та які синтезуються самі собою всередині архітектури у тривимірному представлені порушених даних.

Нова стаття, названа RFGAN: RF-основана синтез людини, походить від шести дослідників з Університету електронної науки та технологій Китаю.

Дані та архітектура

Через відсутність будь-яких попередніх наборів даних або проектів, які б мали такий же масштаб, та через те, що радіосигнали не були використані раніше у рамках синтезу зображень GAN, дослідники мали розробити нові методи.

Ядро архітектури RFGAN.

Ядро архітектури RFGAN.

Адаптивна нормалізація була використана для інтерпретації подвійних теплових карт під час навчання, так що вони відповідають просторово захопленим даним.

Пристрої радіозахоплення були радіолокаційними станціями міліметрового діапазону (mmWave), сконфігуровані як дві антенних масиви, горизонтальні та вертикальні. Використовувалися частотно-модульовані неперервні хвилі (FMCW) та лінійні антени для передачі та прийому.

Генератор отримує вхідний кадр як вхідний шар, з радіочастотним (тепловим) представленням, яке керує мережею через нормалізацію на рівні卷очних шарів.

Дані

Дані були зібрані з радіосигналів, відбитих від міліметрової антени на частоті 20 Гц, з одночасним відеозаписом людини на дуже низькій частоті 10 кадрів в секунду. Було захоплено дев’ять внутрішніх сцен, використовуючи шість добровольців, кожний з яких носив різні одяги під час різних сесій збору даних.

Результатом стали два окремих набори даних, RF-Activity та RF-Walk, перший з яких містить 68 860 зображень людей у різних позиціях (таких як сquat та walk), разом з 137 760 відповідними тепловими кадрами; а другий містить 67 860 кадрів випадкової ходьби людини, разом з 135 720 парами асоційованих теплових карт.

Дані, згідно з конвенцією, були розділені нерівномірно між навчанням та тестуванням, з 55 225 кадрами зображень та 110 450 парами теплових карт, використаних для навчання, та рештою, що залишилася для тестування. Кадри RGB-захоплення були змінені в розмірі до 320×180, а теплові карти – до 201×160.

Модель була навчена з використанням Adam при постійній швидкості навчання 0,0002 для генератора та дискримінатора, на епоху 80 та (дуже розрідженому) розмірі партії 2. Навчання відбувалося за допомогою PyTorch на споживчому рівні одній GTX-1080 GPU, чия 8 ГБ відеопам’яті загалом вважається досить скромною для такого завдання (що пояснює низький розмір партії).

Хоча дослідники адаптували деякі традиційні метрики для тестування реалізму виходу (подробиці описані в статті), та провели звичайні тести абляції, не було жодної попередньої роботи, проти якої можна було б виміряти продуктивність RFGAN.

Відкритий інтерес до секретних сигналів

RFGAN не є першим проектом, який намагається використовувати радіочастоти для побудови об’ємного зображення того, що відбувається в кімнаті. У 2019 році дослідники з MIT CSAIL розробили архітектуру під назвою RF-Avatar, здатну відновлювати тривимірних людей на основі радіочастотних сигналів у діапазоні Wi-Fi, під суворими умовами окулювання.

У проекті MIT CSAIL 2019 року радіохвилі були використані для видалення окулювання, навіть включаючи стіни та одяг, для відновлення захоплених об'єктів у більш традиційному CGI-орієнтованому робочому процесі. Джерело: https://people.csail.mit.edu/mingmin/papers/rf-avatar.pdf

У проекті MIT CSAIL 2019 року радіохвилі були використані для видалення окулювання, навіть включаючи стіни та одяг, для відновлення захоплених об’єктів у більш традиційному CGI-орієнтованому робочому процесі. Джерело: https://people.csail.mit.edu/mingmin/papers/rf-avatar.pdf

Дослідники нової статті також визнають пов’язану попередню роботу щодо середовищної карти з радіохвилями (ніяка з них не намагалася відновити фотореалістичних людей), яка мала на меті оцінити людську швидкість; дивіться крізь стіни з Wi-Fi; оцінити людські пози; та навіть визнати людські жести, серед інших цілей.

Переносимість та ширша застосовність

Дослідники потім спробували побачити, чи їхнє відкриття було надмірно підігнане до початкового середовища захоплення та умов навчання, хоча стаття пропонує небагато деталей щодо цієї фази експерименту. Вони стверджують:

‘Для розгортання нашої моделі в новій сцені нам не потрібно перезнавчати всю модель з початку. Ми можемо донастроювати попередньо навчену RFGAN, використовуючи дуже мало даних (близько 40 секунд даних), щоб отримати подібні результати.’

І продовжують:

‘Функції втрат та гіперпараметри такі ж, як і на етапі навчання. З кількісних результатів ми бачимо, що попередньо навчена модель RFGAN може генерувати бажані кадри людської діяльності в новій сцені після донастроювання з дуже мало даних, що означає, що наш запропонований модель має потенціал для широкого застосування.’

На основі деталей статті про це семінальне застосування нової техніки, не зовсім зрозуміло, чи мережа, створена дослідниками, “фіто-навчена” виключно до оригінальних об’єктів, чи радіо-теплові карти можуть вивести деталі, такі як колір одягу, оскільки це здається межею між двома різними типами частот, залучених до оптичних та радіозахоплення.

Так чи інакше, RFGAN – це новий спосіб використання імітативних та представницьких можливостей Генеративних суперницьких мереж для створення нового та інтригуючого виду спостереження – такого, який потенційно міг би працювати у темряві та через стіни,方式 ще більш вражаючий, ніж недавні зусилля подивитися за кути з відбитим світлом.

 

 

8 грудня 2021 року (день першої публікації), 20:04 за Грінвічем+2 – видалено повторене слово. – MA

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai