Погляд Anderson
Нейронне Рендеринг: Як Низько Ви Можете Іти За Рахунок Входних Даних?

Вчора деяка надзвичайна нова робота в нейронній синтезі зображень привернула увагу і уяву інтернету, оскільки дослідники Intel (INTC ) викрили новий метод для підвищення реалізму синтетичних зображень.
Система, як демонструється у відео від Intel, втручається безпосередньо в потік зображень для відеогри Grand Theft Auto V, і автоматично підвищує якість зображень через алгоритм синтезу зображень, навчений на卷невій нейронній мережі (CNN), використовуючи реальні зображення з набору даних Mapillary, і заміняючи менш реалістичне освітлення та текстурурування двигуна гри GTA.

Коментатори, у широкому діапазоні реакцій у спільнотах, таких як Reddit і Hacker News, висловлюють думку, що не тільки нейронне рендеринг цього типу може ефективно замінити менш фотореалістичний вивід традиційних ігрових двигунів і VFX-рівневого CGI, але і що цей процес може бути здійснений з набагато більш базовими вхідними даними, ніж було продемонстровано у демонстрації Intel GTA5 – фактично створюючи “лялькові” проксі-входи з надзвичайно реалістичними виводами.
Парні Набори Даних
Принцип був продемонстрований новим поколінням систем GAN і енкодер/декодер за останні три роки, таких як GauGAN від NVIDIA, який генерує фотореалістичні пейзажні зображення з грубих мазків.
Ефективно цей принцип перевертає традиційне використання семантичної сегментації у комп’ютерному зорі з пасивного методу, який дозволяє машинним системам ідентифікувати та ізолювати спостережувані об’єкти, у творчий вхід, де користувач “малює” фальшиву семантичну карту сегментації, і система генерує зображення, які узгоджуються з відносинами, які вона розуміє з попередньої класифікації та сегментації певної області, chẳng hạn як пейзаж.

Фреймворк машинного навчання застосовує семантичну сегментацію до різних зовнішніх сцен, забезпечуючи архітектурну парадигму, яка дозволяє розробляти інтерактивні системи, де користувач малює блок сегментації, а система заповнює блок відповідними зображеннями з набору даних, специфічного для області, chẳng hạn як набір даних Mapillary Німеччини, використаний у демонстрації Intel GTA5 нейронного рендерингу. Джерело: http://ais.informatik.uni-freiburg.de/publications/papers/valada17icra.pdf
Системи синтезу зображень з парними наборами даних працюють шляхом кореляції семантичних міток на двох наборах даних: багатому та повному наборі зображень, або згенерованим з реальних зображень (як набір Mapillary, використаний для підвищення якості зображень у демонстрації Intel GTA5), або з синтетичних зображень, chẳng hạn як CGI-зображень.

Приклади парних наборів даних для системи синтезу зображень, призначеної для створення нейронно-рендерених персонажів з грубих ескізів. Зліва, зразки з набору даних CGI. Посередині, відповідні зразки з набору даних «ескіз». Праворуч, нейронні рендеринги, які перетворили ескізи назад у високоякісні зображення. Джерело: https://www.youtube.com/watch?v=miLIwQ7yPkA
Зовнішні середовища відносно нескладні при створенні парних наборів даних такого типу, оскільки виступи зазвичай досить обмежені, топографія має обмежений діапазон варіантів, який можна повністю захопити у наборі даних, і нам не потрібно створювати штучних людей чи переміщуватися через Долину Несвіту (ще).
Інвертування Карти Сегментації
Google розробила анімовану версію схеми GauGAN, називається Infinite Nature, здатну навмисно “галюцинувати” безперервні та нескінченні фіктивні пейзажі, перекладаючи фальшиві семантичні карти у фотореалістичні зображення через систему заповнення SPADE від NVIDIA:

Джерело: https://www.youtube.com/watch?v=oXUf6anNAtc
Однак, Infinite Nature використовує одне зображення як початкову точку та використовує SPADE лише для малювання відсутніх секцій у послідовних кадрах, тоді як сама SPADE створює перетворення зображень безпосередньо з карт сегментації.
Це здатність, здається, викликала захоплення у шанувальників системи Intel Image Enhancement – можливість отримання дуже високоякісних фотореалістичних зображень, навіть у реальному часі (зрештою), з надзвичайно грубих вхідних даних.
Заміна Текстур І Освітлення Нейронним Рендерингом
У випадку з вхідними даними GTA5 деякі люди запитували, чи дійсно будь-які з обчислювально дорогих процедурних та бітмап-текстурних та освітлення з виводу двигуна гри дійсно будуть необхідні у майбутніх системах нейронного рендерингу, чи чи можна перетворити низькорозрізневі, дротові вхідні дані у фотореалістичне відео, яке перевершує можливості затінення, текстурування та освітлення ігрових двигунів, створюючи гіперреалістичні сцени з “проксі”-вхідних даних.
Можна подумати, що ігрові аспекти, такі як відблиски, текстури та інші типи деталей середовища, є необхідними джерелами інформації для системи нейронного рендерингу типу, продемонстрованого Intel. Однак минуло кілька років з тих пір, як система UNIT (UNsupervised Image-to-image Translation Networks) від NVIDIA продемонструвала, що тільки область важлива, а питання, такі як “ніч чи день”, є питаннями, які повинні бути оброблені шляхом переносу стилю:
У термінах необхідних вхідних даних це потенційно залишає ігровий двигун лише для генерації базової геометрії та фізичних симуляцій, оскільки система нейронного рендерингу може перфарбовувати всі інші аспекти, синтезуючи бажане зображення з захопленого набору даних, використовуючи семантичні карти як інтерпретаційний шар.

Система Intel підвищує якість повністю відтвореного та відтвореного кадру з GTA5, додаючи сегментацію та оцінені глибинні карти – два аспекти, які потенційно можуть бути надані безпосередньо стрімованою ігровою системою. Джерело: https://www.youtube.com/watch?v=P1IcaBn3ej0
Підхід Intel до нейронного рендерингу включає аналіз повністю відтворених кадрів з буфера GTA5, і нейронна система має додаткове навантаження з створення глибинних карт та карт сегментації. Оскільки глибинні карти явно доступні у традиційних 3D-пайплайнах (і менш вимогливі до генерації, ніж текстурування, трасування променів або глобальне освітлення), можливо, буде краще використовувати ігровий двигун для обробки їх.
Скорочені Вхідні Дані Для Системи Нейронного Рендерингу
Поточна реалізація мережі підвищення зображення Intel, отже, може включати багато зайвих обчислювальних циклів, оскільки ігровий двигун генерує обчислювально дорогі текстурування та освітлення, які система нейронного рендерингу дійсно не потребує. Система, здається, була розроблена таким чином не тому, що це обов’язково оптимальний підхід, а тому, що легше адаптувати систему нейронного рендерингу до існуючого пайплайну, ніж створити новий ігровий двигун, оптимізований для підходу нейронного рендерингу.
Найекономічніший спосіб використання ресурсів у системі гри цього типу міг би бути повним захопленням GPU системою нейронного рендерингу, з обробкою скорочених проксі-вхідних даних на CPU.
Крім того, ігровий двигун міг би легко виробляти представницькі карти сегментації самостійно, вимикаючи всі затінення та освітлення у своєму виводі. Крім того, він міг би постачати відео у значно нижчій роздільній здатності, ніж зазвичай потрібно від нього, оскільки відео лише потрібно було б бути загально представницьким для вмісту, з високою роздільною здатністю деталей, обробленої системою нейронного рендерингу, далі звільняючи локальні обчислювальні ресурси.
Попередня Робота Intel ISL З Сегментацією > Зображенням
Прямий переклад сегментації у фотореалістичне відео далеко не гіпотетичний. У 2017 році Intel ISL, творці вчорашнього фурору, випустили початкове дослідження, здатне виконувати урбаністичну відеосинтезу безпосередньо з семантичної сегментації.

Intel ISL – сегментація до зображення з 2017 року. Джерело: https://awesomeopensource.com/project/CQFIO/PhotographicImageSynthesis
По суті, той оригінальний пайплайн 2017 року був просто розширений, щоб підходити до повністю відтвореного виводу GTA5.
Нейронний Рендеринг У VFX
Нейронний рендеринг з штучними картами сегментації також здається перспективною технологією для VFX, з можливістю прямого перекладу дуже базових відеограм безпосередньо у закінчене відео візуальних ефектів, генеруючи набори даних, специфічні для області, взяті з моделей або синтетичних (CGI) зображень.


Гіпотетична система нейронного рендерингу, де розширена покриття кожного цільового об’єкта абстрагується у вкладовий набір даних, і де штучно створені карти сегментації використовуються як основа для повної роздільної здатності фотореалістичного виводу. Джерело: https://rossdawson.com/futurist/implications-of-ai/comprehensive-guide-ai-artificial-intelligence-visual-effects-vfx/
Розробка та впровадження таких систем змінять центр зусиль художників з інтерпретативного на представницький робочий процес, і підвищать роль області-орієнтованого збору даних з підтримуючої до центральної ролі у візуальному мистецтві.
Стаття оновлена о 16:55, щоб додати матеріал про дослідження Intel ISL 2017 року.














