Взгляд Anderson

Нейронная отрисовка: как низко можно опуститься в плане входных данных?

mm
Добавьте Unite.AI в избранные источники в Google

Вчера некоторые необыкновенные новые работы в области нейронной синтеза изображений привлекли внимание и воображение интернета, когда исследователи Intel (INTC ) раскрыли новый метод для повышения реализма синтетических изображений.

Система, как продемонстрировано в видео от Intel, вмешивается直接 в конвейер изображений для видеоигры Grand Theft Auto V и автоматически улучшает изображения через алгоритм синтеза изображений, обученный на свёрточной нейронной сети (CNN), используя реальные изображения из Mapillary и заменяя менее реалистичное освещение и текстурирование игрового движка.

Комментаторы, в широком диапазоне реакций в сообществах, таких как Reddit и Hacker News, предполагают, что не только нейронная отрисовка такого типа может эффективно заменить менее фотореалистичный вывод традиционных игровых движков и VFX-уровня CGI, но и что этот процесс может быть достигнут с гораздо более базовым входным данным, чем было продемонстрировано в демонстрации Intel GTA5 — эффективно создавая ‘кукольные’ прокси-входные данные с чрезвычайно реалистичными выходами.

Сопряжённые наборы данных

Принцип был продемонстрирован новым поколением систем GAN и энкодер/декодер за последние три года, таких как GauGAN от NVIDIA, который генерирует фотореалистичные пейзажные изображения из грубых набросков.

По сути, этот принцип переворачивает традиционное использование семантической сегментации в компьютерном зрении из пассивного метода, который позволяет машинным системам идентифицировать и изолировать наблюдаемые объекты, в творческий вход, где пользователь ‘рисует’ фальшивую семантическую сегментацию и система генерирует изображения, которые согласуются с отношениями, которые она понимает из предварительно классифицированных и сегментированных доменов, таких как пейзажи.

Фреймворк машинного обучения применяет семантическую сегментацию к различным внешним сценам, предоставляя архитектурную парадигму, которая позволяет разработать интерактивные системы, где пользователь рисует семантическую сегментацию и система заполняет блок соответствующими изображениями из домен-специфического набора данных, такого как набор уличных видов Mapillary, использованный в демонстрации Intel GTA5. Источник: http://ais.informatik.uni-freiburg.de/publications/papers/valada17icra.pdf

Фреймворк машинного обучения применяет семантическую сегментацию к различным внешним сценам, предоставляя архитектурную парадигму, которая позволяет разработать интерактивные системы, где пользователь рисует семантическую сегментацию и система заполняет блок соответствующими изображениями из домен-специфического набора данных, такого как набор уличных видов Mapillary, использованный в демонстрации Intel GTA5. Источник: http://ais.informatik.uni-freiburg.de/publications/papers/valada17icra.pdf

Сопряжённые наборы данных системы синтеза изображений работают, коррелируя семантические метки на двух наборах данных: богатом и полноценном наборе изображений, либо сгенерированном из реальных изображений (как набор Mapillary, использованный для улучшения GTA5 в демонстрации Intel), либо из синтетических изображений, таких как CGI-изображения.

Примеры сопряжённых наборов данных для системы синтеза изображений, предназначенной для создания нейронно-отрисованных персонажей из неуклюжих эскизов. Слева, образцы из набора CGI. В центре, соответствующие образцы из набора 'эскизов'. Справа, нейронные отрисовки, которые перевели эскизы обратно в высококачественные изображения. Источник: https://www.youtube.com/watch?v=miLIwQ7yPkA

Примеры сопряжённых наборов данных для системы синтеза изображений, предназначенной для создания нейронно-отрисованных персонажей из неуклюжих эскизов. Источник: https://www.youtube.com/watch?v=miLIwQ7yPkA

Внешние среды относительно несложны при создании сопряжённых наборов данных такого типа, поскольку выступы обычно довольно ограничены, топография имеет ограниченный диапазон вариаций, который можно полностью захватить в наборе данных, и нам не приходится создавать искусственных людей или ориентироваться в области неопределённости (пока).

Инвертирование карт сегментации

Google разработал анимированную версию схемы GauGAN, называемую Infinite Nature, способную намеренно ‘галлюцинировать’ непрерывные и бесконечные фантастические пейзажи, переводя фальшивые семантические карты в фотореалистичные изображения через систему заполнения SPADE от NVIDIA:

Источник: https://www.youtube.com/watch?v=oXUf6anNAtc

Источник: https://www.youtube.com/watch?v=oXUf6anNAtc

Однако Infinite Nature использует одно изображение в качестве отправной точки и использует SPADE только для заполнения пропущенных секций в последовательных кадрах, тогда как сама SPADE создаёт преобразования изображений直接 из карт сегментации.

Источник: https://nvlabs.github.io/SPADE/

Источник: https://nvlabs.github.io/SPADE/

Эта способность, кажется, вдохновила поклонников системы Intel Image Enhancement — возможность получения очень высококачественных фотореалистичных изображений, даже в реальном времени (в конечном итоге), из чрезвычайно грубого входного данных.

Упрощённый вход для нейронной отрисовки

Текущая реализация сети улучшения изображений Intel, поэтому, может включать много избыточных вычислительных циклов, поскольку игровой движок генерирует вычислительно дорогую текстурировку и освещение, которое нейронная отрисовка не нуждается. Система, кажется, была разработана таким образом не потому, что это обязательно оптимальный подход, а потому, что проще адаптировать нейронную отрисовку к существующему конвейеру, чем создать новый игровой движок, оптимизированный для нейронной отрисовки.

Самый экономичный способ использования ресурсов в системе такого типа может быть полным захватом GPU нейронной отрисовкой, с упрощённым прокси-входным данным, обрабатываемым CPU.

Кроме того, игровой движок может легко производить представительные карты сегментации, выключая все затенение и освещение в своём выходе. Кроме того, он может поставлять видео с гораздо более низким разрешением, чем обычно требуется от него, поскольку видео нужно только примерно представлять содержание, с высоким разрешением деталей, обрабатываемым нейронной системой, что ещё больше освобождает локальные вычислительные ресурсы.

Предыдущая работа Intel ISL с сегментацией>изображением

Прямой перевод сегментации в фотореалистичное видео далеко не гипотетичен. В 2017 году Intel ISL, создатели вчерашнего фурора, выпустили первоначальные исследования, способные выполнять городскую видеосинтез直接 из семантической сегментации.

Intel ISL - сегментация в изображение

Работа Intel ISL по сегментации в изображение 2017 года. Источник: https://awesomeopensource.com/project/CQFIO/PhotographicImageSynthesis

По сути, та оригинальная pipeline 2017 года была просто расширена, чтобы соответствовать полностью отрендеренному выходу GTA5.

Нейронная отрисовка в VFX

Нейронная отрисовка из искусственных карт сегментации также кажется перспективной технологией для VFX, с возможностью прямого перевода очень базовых видеограмм直接 в готовые кадры визуальных эффектов, генерируя домен-специфические наборы данных, взятые либо из моделей, либо из синтетических (CGI) изображений.

Гипотетическая система нейронной отрисовки, где обширное покрытие каждого целевого объекта абстрагируется в.contributing набор данных, и где искусственно сгенерированные карты сегментации используются в качестве основы для полноэкранного фотореалистичного выхода. Источник: https://rossdawson.com/futurist/implications-of-ai/comprehensive-guide-ai-artificial-intelligence-visual-effects-vfx/

Гипотетическая система нейронной отрисовки, где обширное покрытие каждого целевого объекта абстрагируется в.contributing набор данных, и где искусственно сгенерированные карты сегментации используются в качестве основы для полноэкранного фотореалистичного выхода. Источник: https://rossdawson.com/futurist/implications-of-ai/comprehensive-guide-ai-artificial-intelligence-visual-effects-vfx/

Разработка и внедрение таких систем сместит центр художественных усилий от интерпретативного к представительному рабочему процессу и повысит домен-ориентированное сбор данных из поддерживающей в центральную роль в визуальном искусстве.

Статья обновлена в 16:55, чтобы добавить информацию о исследованиях Intel ISL 2017 года.

Автор в области машинного обучения, специалист по синтезу человеческих изображений. Бывший руководитель отдела исследовательского контента в Metaphysic.ai, до его объединения с Brahma.ai от DNEG.
Веб‑сайт: martinanderson.ai
Контакт: martin@martinanderson.ai