Взгляд Anderson
Синтез изображений человека из отраженных радиоволн

Исследователи из Китая разработали метод синтеза gần фотореалистичных изображений людей без камер, используя радиоволны и Генеративные противостоящие сети (GAN). Система, которую они разработали, обучена на реальных изображениях, снятых в хорошем свете, но способна захватывать относительно аутентичные “снимки” людей даже в темных условиях – и даже через значительные препятствия, которые бы скрыли людей от обычных камер.
Изображения полагаются на “тепловые карты” от двух радиоантенн, одна из которых захватывает данные с потолка вниз, а другая записывает радиоволновые возмущения с “стоящего” положения.
Результирующие фотографии из экспериментов исследователей имеют безликий, “J-Horror” аспект:

RFGAN обучен на изображениях реальных людей в контролируемых средах и на радиоволновых тепловых картах, которые записывают человеческую активность. Получив характеристики из данных, RFGAN может затем генерировать снимки на основе новых радиоданных. Результирующее изображение является приближением, основанным на ограниченном разрешении низкочастотных радиосигналов. Источник: https://arxiv.org/pdf/2112.03727.pdf
Для обучения GAN, названного RFGAN, исследователи использовали сопоставленные данные из стандартной RGB-камеры и из сконкатенированных соответствующих радиотепловых карт, которые были произведены в момент захвата. Изображения синтезированных людей в новом проекте имеют размытый характер, подобный ранней дагерротипной фотографии, поскольку разрешение радиоволн, используемых очень низкое, с глубинным разрешением 7,5 см и угловым разрешением около 1,3 градусов.

Вверху, изображение, поданное в сеть GAN – внизу, две тепловые карты, горизонтальная и вертикальная, которые характеризуют человека в комнате и которые синтезируются сами по себе внутри архитектуры в 3D-представление возмущенных данных.
Новая статья, озаглавленная RFGAN: RF-основанная синтез человека, исходит от шести исследователей из Университета электронной науки и технологии Китая.
Данные и Архитектура
Из-за отсутствия каких-либо предыдущих наборов данных или проектов, которые разделяли этот объем, и того факта, что радиочастотные сигналы не использовались ранее в рамках синтеза изображений GAN, исследователи должны были разработать новые методологии.

Основная архитектура RFGAN.
Адаптивная нормализация использовалась для интерпретации двойных тепловых карт во время обучения, чтобы они соответствовали пространственно захваченным данным изображений.
Устройства захвата радиочастот были миллиметровыми волновыми (mmWave) радарами, сконфигурированными как две антенные массивы, горизонтальные и вертикальные. Частотно-модулированные непрерывные волны (FMCW) и линейные антенны использовались для передачи и приема.
Генератор получает исходный кадр в качестве входного слоя, с радиочастотным (тепловым) представлением, оркестрирующим сеть через нормализацию на уровне сверточных слоев.
Данные
Данные были собраны из радиосигналов, отраженных от миллиметровой антенны на частоте 20 Гц, с одновременным захватом видео человека на очень низкой частоте 10 кадров в секунду. Девять внутренних сцен были захвачены, используя шесть волонтеров, каждый из которых носил разную одежду для различных сессий сбора данных.
Результатом стали два различных набора данных, RF-Activity и RF-Walk, первый из которых содержал 68 860 изображений людей в различных положениях (таких как сquat и walk), вместе с 137 760 соответствующими тепловыми картами; и второй содержал 67 860 кадров случайной ходьбы человека, вместе с 135 720 парами ассоциированных тепловых карт.
Данные, согласно конвенции, были разделены неравномерно между обучением и тестированием, с 55 225 кадрами изображений и 110 450 парами тепловых карт, использованных для обучения, и остальным, отложенным для тестирования. Кадры RGB-изображений были изменены в размере до 320×180, а тепловые карты – до 201×160.
Модель была затем обучена с помощью Adam с постоянной скоростью обучения 0,0002 для обоих генератора и дискриминатора, на эпохе 80 и очень малом размере пакета 2. Обучение проходило через PyTorch на потребительском уровне одиночной GTX-1080 GPU, чья 8 ГБ видеопамяти обычно считались бы довольно скромными для такой задачи (объясняя низкий размер пакета).
Хотя исследователи адаптировали некоторые обычные метрики для тестирования реализма выходных данных (подробно описанных в статье), и провели обычные тесты на удаление, не было эквивалентной предыдущей работы, с которой можно было бы сравнить производительность RFGAN.
Открытый интерес к секретным сигналам
RFGAN не является первым проектом, который попытался использовать радиочастоты для построения объемного изображения того, что происходит в комнате. В 2019 году исследователи из MIT CSAIL разработали архитектуру под названием RF-Avatar, способную реконструировать 3D-людей на основе радиочастотных сигналов в диапазоне Wi-Fi, в условиях сильного заслонения.

В проекте MIT CSAIL 2019 года радиоволны использовались для удаления заслонений, включая стены и одежду, для реконструкции захваченных объектов в более традиционном потоке CGI. Источник: https://people.csail.mit.edu/mingmin/papers/rf-avatar.pdf
Исследователи новой статьи также признают свободно связанную предыдущую работу вокруг картографирования среды с помощью радиоволн (ни одна из них не пыталась воссоздать фотореалистичных людей), которая стремилась оценить скорость человека; см. через стены с помощью Wi-Fi; оценить позы человека; и даже распознать жесты человека, среди различных других целей.
Переносимость и более широкое применение
Исследователи затем попытались выяснить, является ли их открытие переобученным для начальной среды захвата и условий обучения, хотя статья предлагает мало подробностей об этой фазе эксперимента. Они утверждают:
‘Чтобы развернуть нашу модель в новой сцене, нам не нужно переобучать всю модель с начала. Мы можем дообучить предварительно обученную RFGAN, используя очень немного данных (около 40 секунд данных), чтобы получить подобные результаты.’
И продолжают:
‘Функции потерь и гиперпараметры одинаковы с этапом обучения. Из количественных результатов мы обнаруживаем, что предварительно обученная модель RFGAN может генерировать желаемые кадры человеческой активности в новой сцене после дообучения с очень немного данными, что означает, что наша предложенная модель имеет потенциал для широкого использования.’
На основе деталей статьи об этом семинальном применении новой техники неясно, является ли сеть, созданная исследователями, “обученной” исключительно для исходных объектов или могут ли RF-тепловые карты вывести детали, такие как цвет одежды, поскольку это, кажется, занимает промежуточное положение между двумя различными типами частот, участвующих в оптическом и радиозахвате.
В любом случае, RFGAN является новым способом использования имитационных и представительных сил Генеративных противостоящих сетей для создания новой и интригующей формы слежения – одной, которая потенциально может работать в темноте и через стены, таким образом, который даже более впечатляющий, чем недавние усилия по видению за углами с помощью отраженного света.
8 декабря 2021 года (день первой публикации), 20:04 по Гринвичу +2 – удалено повторяющееся слово. – MA












