Взгляд Anderson

Улучшение фотореализма симуляций вождения с помощью генеративных состязательных сетей

mm
Добавьте Unite.AI в избранные источники в Google

Новая исследовательская инициатива между США и Китаем предложила использовать генеративные состязательные сети (GAN) для увеличения реализма симуляторов вождения.

В новом подходе к задаче создания фотореалистичных сцен вождения, исследователи разработали гибридный метод, который сочетает более фотореалистичный вывод систем на основе CycleGAN с более традиционно сгенерированными элементами, которые требуют более высокого уровня детализации и согласованности, таких как дорожные знаки и транспортные средства, видимые с точки зрения водителя.

Гибридная генеративная нейронная графика (HGNG) предлагает новый подход к симуляциям вождения, который сохраняет точность 3D-моделей для важных элементов (таких как дорожные знаки и транспортные средства), одновременно используя сильные стороны GAN в генерации интересных и неповторяющихся фонов и окружающих деталей. Source

Гибридная генеративная нейронная графика (HGNG) предлагает новый подход к симуляциям вождения, который сохраняет точность 3D-моделей для важных элементов (таких как дорожные знаки и транспортные средства), одновременно используя сильные стороны GAN в генерации интересных и неповторяющихся фонов и окружающих деталей. Source

Система, называемая гибридной генеративной нейронной графикой (HGNG), вводит ограниченный вывод из традиционного, основанного на CGI симулятора вождения в pipeline GAN, где фреймворк NVIDIA SPADE берет на себя работу генерации окружения.

Преимущество, согласно авторам, заключается в том, что среды вождения станут потенциально более разнообразными, создавая более погружающий опыт. Как это стоит сейчас, даже преобразование вывода CGI в фотореалистичный нейронный рендеринг не может решить проблему повторения, поскольку исходные кадры, входящие в нейронную трубу, ограничены ограничениями моделей окружения и их тенденцией повторять текстуры и сетки.

Source: https://www.youtube.com/watch?v=0fhUJT21-bs

Преобразованные кадры из статьи 2021 года ‘Улучшение фотореализма’, которые все еще зависят от CGI-рендеринга, включая фон и общую окружающую деталь, ограничивающую разнообразие окружения в симулированном опыте. Source: https://www.youtube.com/watch?v=P1IcaBn3ej0

The paper states*:

‘Вероятность традиционного симулятора вождения зависит от качества его графического конвейера, который состоит из 3D-моделей, текстур и рендерингового движка. Высококачественные 3D-модели и текстуры требуют художественного мастерства, тогда как рендеринговый движок должен выполнять сложные физические расчеты для реалистичного представления освещения и затенения.’

The new paper is titled Фотореализм в симуляциях вождения: сочетание генеративной состязательной синтеза изображений с рендерингом, и исходит от исследователей из департамента электротехники и компьютерных наук в Университете штата Огайо и Chongqing Changan Automobile Co Ltd в Чунцине, Китай.

Фоновий материал

HGNG преобразует семантическую структуру входной сцены CGI, смешивая частично отрендеренные передние планы с генерированными GAN окружением. Хотя исследователи экспериментировали с различными наборами данных для обучения моделей, наиболее эффективным оказался KITTI Vision Benchmark Suite, который в основном включает кадры, снятые с точки зрения водителя, из немецкого города Карлсруэ.

HGNG генерирует семантическую структуру из вывода CGI, а затем вводит SPADE с различными стилями кодирования, чтобы создать случайные и разнообразные фотореалистичные фоновые изображения, включая ближайшие объекты в городских сценах. Новая статья гласит, что повторяющиеся узоры, которые являются общими для ограниченных CGI-конвейеров, 'нарушают погружение' для человеческих водителей, использующих симулятор, и что более разнообразные фоны, которые может предоставить GAN, могут решить эту проблему.

HGNG генерирует семантическую структуру из вывода CGI, а затем вводит SPADE с различными стилями кодирования, чтобы создать случайные и разнообразные фотореалистичные фоновые изображения, включая ближайшие объекты в городских сценах. Новая статья гласит, что повторяющиеся узоры, которые являются общими для ограниченных CGI-конвейеров, ‘нарушают погружение’ для человеческих водителей, использующих симулятор, и что более разнообразные фоны, которые может предоставить GAN, могут решить эту проблему.

Исследователи экспериментировали с обоими условными GAN (cGAN) и CYcleGAN (CyGAN) в качестве генеративных сетей, обнаружив в конечном итоге, что каждая имеет сильные и слабые стороны: cGAN требует парных наборов данных, а CyGAN не требует. Однако CyGAN в настоящее время не может превзойти состояние искусства в традиционных симуляторах, ожидая дальнейших улучшений в адаптации домена и циклической согласованности. Поэтому cGAN, с его дополнительными требованиями к парным данным, получает лучшие результаты на данный момент.

Концептуальная архитектура HGNG.

Концептуальная архитектура HGNG.

В нейронной графической трубе HGNG формируются 2D-представления из сцен CGI. Объекты, которые передаются в GAN-поток из CGI-рендеринга, ограничены ‘необходимыми’ элементами, включая дорожные знаки и транспортные средства, которые GAN сам по себе в настоящее время не может отрендерить с достаточной временной согласованностью и целостностью для симулятора вождения. cGAN-синтезированное изображение затем смешивается с частично физически основанным рендером.

Тесты

Для тестирования системы исследователи использовали SPADE, обученную на Cityscapes, чтобы преобразовать семантическую структуру сцены в фотореалистичный вывод. Исходный CGI-материал поступал из открытого симулятора вождения CARLA, который использует Unreal Engine 4 (UE4).

Вывод из открытого симулятора вождения CARLA. Source: https://arxiv.org/pdf/1711.03938.pdf

Вывод из открытого симулятора вождения CARLA. Source: https://arxiv.org/pdf/1711.03938.pdf

Система затенения и освещения UE4 обеспечила семантическую структуру и частично отрендеренные изображения, с только транспортными средствами и дорожными знаками на выходе. Смешивание было достигнуто с помощью GP-GAN экземпляра, обученного на Transient Attributes Database, и все эксперименты проводились на NVIDIA RTX 2080 с 8 ГБ GDDR6 VRAM.

Исследователи тестируют на семантическую сохранность – способность вывода соответствовать исходной семантической маске, предназначенной в качестве шаблона для сцены.

В тестовых изображениях выше мы видим, что в ‘только рендере’ (внизу слева) полный рендер не получает правдоподобных теней. Исследователи отмечают, что здесь (желтый круг) тени деревьев, падающие на тротуар, были ошибочно классифицированы DeepLabV3 (семантической сегментацией, использованной для этих экспериментов) как ‘дорожное’ содержимое.

В среднем столбце мы видим, что cGAN-созданные транспортные средства не имеют достаточной согласованной определенности, чтобы быть пригодными для симулятора вождения (красный круг). В правом столбце смешанное изображение соответствует исходной семантической определению, сохраняя при этом важные CGI-элементы.

Для оценки реализма исследователи использовали Frechet Inception Distance (FID) в качестве метрики производительности, поскольку он может работать с парными данными или непарными данными.

Три набора данных были использованы в качестве эталона: Cityscapes, KITTI и ADE20K.

Выводные изображения были сравнены друг с другом с помощью оценок FID, и с физически основанным (т.е. CGI) конвейером, а также оценивалась семантическая сохранность.

В результатах выше, которые относятся к семантической сохранности, более высокие оценки лучше, с подходом на основе пирамиды CGAN (одним из нескольких конвейеров, протестированных исследователями) получившим наивысший балл.

Результаты, изображенные выше, относятся к оценкам FID, с HGNG, набравшим наивысший балл с помощью набора данных KITTI.

‘Только рендер’ метод (обозначенный как [23]) относится к выводу из CARLA, CGI-потоку, который не ожидается быть фотореалистичным.

Качественные результаты на традиционном рендеринговом движке (‘c’ в изображении выше) демонстрируют нереалистичную дальнюю фоническую информацию, такую как деревья и растительность, требуя при этом подробных моделей и загрузки сеток, а также других процессорно-интенсивных процедур. В среднем (b) мы видим, что cGAN не может получить достаточную определенность для важных элементов, таких как транспортные средства и дорожные знаки. В предложенном смешанном выводе (a) определение транспортных средств и дорог хорошее, а окружающая среда разнообразна и фотореалистична.

Статья заключает, что временная согласованность GAN-генерируемой части рендерингового конвейера может быть увеличена с помощью более крупных городских наборов данных, и что будущая работа в этом направлении может предложить реальную альтернативу дорогостоящим нейронным преобразованиям CGI-основанных потоков, обеспечивая при этом большую реализм и разнообразие.

 

* Мое преобразование внутренних цитат авторов в гиперссылки.

Опубликовано впервые 23 июля 2022 года.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai