Погляд Anderson
Покращення фотореалізму симуляцій водіння за допомогою генеративних суперницьких мереж

Нова дослідницька ініціатива між США та Китаєм пропонує використання генеративних суперницьких мереж (GAN) для підвищення реалізму симуляторів водіння.
У новому підході до завдання створення фотореалістичних сцен водіння з точки зору водія, дослідники розробили гібридний метод, який поєднує переваги різних підходів, змішуючи більш фотореалістичний вивід системи CycleGAN з більш традиційно згенерованими елементами, які вимагають вищого рівня деталізації та узгодженості, таких як дорожні розмітки та автомобілі, спостережувані з точки зору водія.

Гібридна генеративна нейронна графіка (HGNG) пропонує новий напрямок для симуляцій водіння, який зберігає точність 3D-моделей для основних елементів (таких як дорожні розмітки та автомобілі), одночасно використовуючи переваги GAN у генерації цікавих та не повторюваних фонових та навколишніх деталей. Джерело
Система, яку називають Гібридною генеративною нейронною графікою (HGNG), впроваджує обмежений вивід з традиційного, CGI-орієнтованого симулятора водіння у трубопровід GAN, де фреймворк NVIDIA SPADE бере на себе роботу генерації середовища.
Перевага, згідно з авторами, полягає в тому, що середовища водіння можуть стати потенційно більш різноманітними, створюючи більш іммерсивний досвід. На даний час навіть перетворення виводу CGI у фотореалістичний нейронний рендеринг не може вирішити проблему повторення, оскільки оригінальне відео, яке надходить у нейронний трубопровід, обмежене обмеженнями моделей середовищ, і їх схильністю повторювати текстури та сітки.

Перетворене відео з роботи 2021 року ‘Покращення фотореалізму’, яке залишається залежним від CGI-рендерингу, включаючи фонові та навколишні деталі, обмежуючи різноманітність середовища у симульованому досвіді. Джерело: https://www.youtube.com/watch?v=P1IcaBn3ej0
У роботі зазначається*:
‘Відтворення традиційного симулятора водіння залежить від якості його графічного трубопроводу, який складається з 3D-моделей, текстур та рендерингового двигуна. Високоякісні 3D-моделі та текстури вимагають художності, тоді як рендеринговий двигун повинен виконувати складні фізичні розрахунки для реалістичного представлення світла та тіні.’
Нова робота має назву Фотореалізм у симуляціях водіння: Змішування генеративної суперницької синтезу зображень з рендерингом, і була виконана дослідниками відділу електротехніки та комп’ютерних наук університету штату Огайо, та компанії Chongqing Changan Automobile Co Ltd у місті Чунцин, Китай.
Фонові матеріали
HGNG перетворює семантичну структуру вхідної сцени CGI шляхом змішування частково відтворених передніх матеріалів з генерацією середовища GAN. Хоча дослідники експериментували з різними наборами даних для навчання моделей, найбільш ефективним виявився набір даних KITTI Vision Benchmark Suite, який в основному складається з знімків з точки зору водія з німецького міста Карлсруе.

HGNG генерує семантичну структуру з виводу CGI, а потім впроваджує SPADE з різними стильовими кодуваннями, щоб створити випадкові та різноманітні фотореалістичні фонові зображення, включаючи навколишні об’єкти в міських сценах. Нова робота зазначає, що повторювані узори, які є загальними для обмежених CGI-трубопроводів, ‘перебивають іммерсію’ для людських водіїв, які використовують симулятор, і що більш різноманітні фонові, які може забезпечити GAN, можуть вирішити цю проблему.
Дослідники експериментували з умовною GAN (cGAN) та CycleGAN (CyGAN) як генеративними мережами, виявивши, що кожна має свої сильні та слабкі сторони: cGAN вимагає спарених наборів даних, а CyGAN – ні. Однак CyGAN поки не може перевершити сучасний рівень у традиційних симуляторах, поки не будуть зроблені подальші вдосконалення у адаптації домену та циклічній узгодженості. Тому cGAN, з його додатковими вимогами до спарених даних, на даний час дає найкращі результати.

Концептуальна архітектура HGNG.
У нейронному графічному трубопроводі HGNG утворюються 2D-представлення з сцен CGI. Об’єкти, які передаються до потоку GAN з CGI-рендерингу, обмежені ‘основними’ елементами, включаючи дорожні розмітки та автомобілі, які GAN сам по собі поки не може відтворити з достатньою тимчасовою узгодженістю та цілісністю для симулятора водіння. Зображення, згенероване cGAN, потім змішується з частково фізично-орієнтованим рендерингом.
Тести
Для тестування системи дослідники використали SPADE, навчений на Cityscapes, для перетворення семантичної структури сцени у фотореалістичний вивід. Вихід CGI походив з відкритого симулятора водіння CARLA, який використовує Unreal Engine 4 (UE4).

Вивід з відкритого симулятора водіння CARLA. Джерело: https://arxiv.org/pdf/1711.03938.pdf
Дослідники тестували на семантичне збереження – здатність вивідного зображення відповідати початковій семантичній масці, призначеній як шаблон для сцени.
У тестових зображеннях вище, ми бачимо, що у зображенні ‘тільки рендер’ (ліворуч внизу) повний рендеринг не дає правдоподібних тіней. Дослідники зазначають, що тут (жовтий круг) тіні дерев, які падають на тротуар, були помилково класифіковані DeepLabV3 (фреймворком семантичної сегментації, використаним для цих експериментів) як ‘дорожній’ вміст.
У середньому стовпчику ми бачимо, що зображення, згенероване cGAN, не має достатньої чіткості для використання у симуляторі водіння (червоний круг). У правому стовпчику пропоноване змішане зображення відповідає оригінальній семантичній ознаці, зберігаючи основні CGI-орієнтовані елементи.
Для оцінки реалізму дослідники використали відстань Фрідберга-Інсепшена (FID) як метрику продуктивності, оскільки вона може працювати з парними або непарними даними.
Було використано три набори даних як істину: Cityscapes, KITTI та ADE20K.
Вивідні зображення порівнювалися один з одним за допомогою оцінок FID, а також з фізично-орієнтованим трубопроводом, тоді як семантичне збереження також оцінювалося.

У результатах вище, які стосуються семантичного збереження, вищі оцінки кращі, з підходом пірамідальної cGAN (одним з кількох трубопроводів, протестованих дослідниками) з найвищим балом.

Результати, зображені вище, стосуються оцінок FID, з HGNG, який має найвищий бал за допомогою набору даних KITTI.
Метод ‘Тільки рендер’ (позначений як [23]) стосується виводу з CARLA, трубопроводу CGI, який не очікується бути фотореалістичним.
Якість результатів на традиційному рендеринговому двигуні (‘c’ у зображенні вище) демонструє нереалістичну віддалену фонові інформацію, таку як дерева та рослинність, тоді як вимагає детальних моделей та завантаження сіток just-in-time, а також інших процесорно-інтенсивних процедур. У середньому (b), ми бачимо, що cGAN не може забезпечити достатню чіткість для основних елементів, автомобілів та дорожніх розміток. У пропонованому змішаному виводі (a), визначення автомобілів та дорожніх розміток хороші, тоді як навколишнє середовище різноманітне та фотореалістичне.
Робота закінчується висновком, що тимчасова узгодженість генеративної частини трубопроводу рендерингу могла бути підвищена за допомогою використання більших міських наборів даних, і що майбутня робота в цьому напрямку могла б забезпечити реальну альтернативу коштовним нейронним перетворенням CGI-орієнтованих потоків, забезпечуючи більший реалізм та різноманітність.
* Моє перетворення внутрішніх посилань авторів на гіперпосилання.
Перша публікація 23 липня 2022 року.














