Взгляд Anderson

Преобразование LiDAR в фотографически реалистичные изображения с помощью генеративной сети противников

mm
Добавьте Unite.AI в избранные источники в Google

Ранее на этой неделе было опубликовано видео, на котором система автопилота Tesla врезалась в остановившуюся машину на трассе в июне 2021 года. Тот факт, что машина была темной и трудно различимой, вызвал обсуждение ограничений использования компьютерного зрения в автономных транспортных средствах.

Видео, опубликованное в декабре 2021 года, показывает момент столкновения. Источник: https://twitter.com/greentheonly/status/1473307236952940548

Видео, опубликованное в декабре 2021 года, показывает момент столкновения. Источник: https://twitter.com/greentheonly/status/1473307236952940548

Хотя сжатие видео в широко распространенном видео дает несколько преувеличенное впечатление о том, как быстро остановившаяся машина «подошла» к водителю в этом случае, видео более высокого качества того же события показывает, что даже полностью бдительный водитель бы испытал трудности с реакцией, кроме как с запоздалым поворотом или полуэффективным торможением.

Видео добавляет скандал вокруг решения Tesla удалить радарные датчики для Autopilot, объявленного в мае 2021 года, и его позиции по преимуществу систем, основанных на компьютерном зрении, над другими технологиями эхолокации, такими как LiDAR.

Совпадением, новая исследовательская работа из Израиля предлагает подход, чтобы объединить области LiDAR и компьютерного зрения, преобразуя облака точек LiDAR в фотографически реалистичные изображения с помощью генеративной сети противников (GAN).

В новом проекте из Израиля черные машины, выявленные в данных LiDAR, преобразуются в «дневную» сцену для анализов, основанных на компьютерном зрении, подобно подходу, который Tesla преследует для разработки своей системы Autopilot. Источник: https://arxiv.org/pdf/2112.11245.pdf

В новом проекте из Израиля черные машины, выявленные в данных LiDAR, преобразуются в «дневную» сцену для анализов, основанных на компьютерном зрении, подобно подходу, который Tesla преследует для разработки своей системы Autopilot. Источник: https://arxiv.org/pdf/2112.11245.pdf

Авторы заявляют:

‘Наши модели научились предсказывать реалистичные изображения из данных облаков точек, даже изображения с черными машинами.

‘Черные машины трудно обнаружить напрямую из облаков точек из-за их низкого уровня отражения. Этот подход может быть использован в будущем для выполнения визуального распознавания объектов на фотографически реалистичных изображениях, сгенерированных из облаков точек LiDAR.’

Фотографически реалистичные, LiDAR-основанные потоки изображений

Новая работа названа Генерация фотографически реалистичных изображений из облаков точек LiDAR с помощью генеративных сетей противников, и исходит от семи исследователей из трех израильских академических факультетов, вместе с шестью исследователями из израильской компании Innoviz Technologies.

Исследователи поставили цель выяснить, может ли синтетическая изображение, основанное на GAN, быть произведено с подходящей скоростью из облаков точек, сгенерированных системами LiDAR, так что последующий поток изображений может быть использован в рабочих процессах распознавания объектов и семантической сегментации.

Данные

Центральная идея, как и во многих новых проектах по транслитерации изображений, заключается в том, чтобы обучить алгоритм на парных данных, где изображения облаков точек LiDAR (которые полагаются на свет, испускаемый устройством) обучаются против соответствующего кадра из передней камеры.

Поскольку видео было снято днем, когда система компьютерного зрения может более легко индивидуализировать обычно-elusive черную машину (такую как та, в которую врезалась Tesla в июне), это обучение должно обеспечить центральную истину, которая более устойчива к темным условиям.

Данные были собраны с помощью датчика LiDAR InnovizOne, который предлагает скорость захвата 10fps или 15fps, в зависимости от модели.

Данные LiDAR, захваченные устройством Innoviz. Источник: https://www.youtube.com/watch?v=wmcaf_VpsQI

Данные LiDAR, захваченные устройством Innoviz. Источник: https://www.youtube.com/watch?v=wmcaf_VpsQI

Результирующий набор данных содержал около 30 000 изображений и 200 000 собранных 3D-точек. Исследователи провели два теста: один, в котором данные облака точек содержали только информацию о отражении; и второй, в котором данные облака точек имели два канала, по одному для отражения и расстояния.

Для первого эксперимента GAN была обучена на 50 эпох, после чего была обнаружена проблема переобучения.

Изображения, созданные GAN, из первого эксперимента. Слева, данные облака точек; в середине, фактические кадры из захваченного видео, использованные в качестве эталона; справа, синтетические представления, созданные генеративной сетью противников.

Изображения, созданные GAN, из первого эксперимента. Слева, данные облака точек; в середине, фактические кадры из захваченного видео, использованные в качестве эталона; справа, синтетические представления, созданные генеративной сетью противников.

Авторы комментируют:

‘Тестовый набор является совершенно новой записью, которую GAN никогда не видел раньше теста. Это было предсказано только на основе информации об отражении из облака точек.

‘Мы выбрали показать кадры с черными машинами, потому что черные машины обычно трудно обнаружить из LiDAR. Мы можем видеть, что генератор научился генерировать черные машины, вероятно, из контекстной информации, из-за того, что цвета и точные формы объектов в предсказанных изображениях не идентичны реальным изображениям.’

Для второго эксперимента авторы обучили GAN на 40 эпох с размером пакета 1, в результате чего получили аналогичное представление «представительных» черных машин, полученных в основном из контекста. Эта конфигурация также была использована для генерации видео, которое показывает сгенерированные GAN кадры (на верхнем изображении, в образце ниже) вместе с эталонным видео.

Оценка

Обычный процесс оценки и сравнения с существующим состоянием дел не был возможен с этим проектом, из-за его уникальной природы. Вместо этого исследователи разработали индивидуальный метрический показатель, касающийся степени, в которой машины (незначительные и мимолетные части исходного видео) представлены в выходном видео.

Они выбрали 100 пар LiDAR/сгенерированных изображений из каждого набора и эффективно разделили количество изображений машин, присутствующих в исходном видео, на количество, присутствующее в синтетических данных, произведенных, в результате чего получили метрический показатель от 0 до 1.

Авторы заявляют:

‘Оценка в обоих экспериментах была между 0,7 и 0,8. Учитывая тот факт, что общее качество предсказанных изображений ниже, чем у реальных изображений (это более трудно в целом обнаружить объекты в изображениях более низкого качества), этот показатель указывает на то, что подавляющее большинство машин, присутствующих в эталонном видео, присутствуют в предсказанных изображениях.’

Исследователи заключили, что обнаружение черных транспортных средств, которое является проблемой как для систем, основанных на компьютерном зрении, так и для LiDAR, может быть выполнено путем выявления отсутствия данных для секций изображения:

‘Тот факт, что в предсказанных изображениях информация о цвете и точные формы не идентичны эталонным, предполагает, что предсказание черных машин в основном получено из контекстной информации, а не из отражения LiDAR.

‘Мы предлагаем, что, в дополнение к традиционной системе LiDAR, вторая система, которая генерирует фотографически реалистичные изображения из облаков точек LiDAR, будет работать одновременно для визуального распознавания объектов в реальном времени.’

Исследователи намерены развивать эту работу в будущем, с более крупными наборами данных.

Задержка и переполненный стек обработки SDV

Один комментатор в широко распространенном посте Twitter о крушении Autopilot оценил, что, движущийся со скоростью около 75 миль в час (110 футов в секунду), видеопоток, работающий с частотой 20 кадров в секунду, покроет только 5,5 футов на кадр. Однако, если транспортное средство было оснащено последним оборудованием и программным обеспечением Tesla, частота кадров была бы 36 кадров в секунду (для основной камеры), что устанавливает оценку скорости на 110 футов в секунду (три фута на кадр).

Помимо стоимости и эргономики, проблема использования LiDAR в качестве дополнительного потока данных заключается в огромном масштабе информационной «пробки» входных данных в стек обработки SDV. В сочетании с критической природой задачи, это, кажется, заставило радар и LiDAR выйти из стека Autopilot в пользу методов оценки, основанных на изображениях.

Следовательно, кажется маловероятным, что система, использующая LiDAR, которая сама добавит к обработочной пробке на Autopilot, чтобы сделать вывод о фотографически реалистичных изображениях, является осуществимой с точки зрения Tesla.

Основатель Tesla Илон Маск не является безоговорочным критиком LiDAR, который, как он указывает, используется компанией SpaceX для процедур стыковки, но считает, что эта технология «бесполезна» для самоходных транспортных средств. Маск предлагает, что проникающая в окклюзии длина волны, такая как ~4 мм точной радар, будет более полезной.

Однако, по состоянию на июнь 2021 года, транспортные средства Tesla не оснащены радаром. В настоящее время не кажется, что есть много проектов, предназначенных для генерации потоков изображений из радара таким же образом, как текущий израильский проект (хотя Министерство энергетики США спонсировало одну попытку радар-источника GAN-изображений в 2018 году).

 

Опубликовано впервые 23 декабря 2021 года.

 

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai