Модели и платформы ИИ
Исследователи используют глубокое обучение для преобразования фотографий достопримечательностей в 4D

Исследователи из Корнелльского университета разработали новый метод, который использует глубокое обучение для преобразования фотографий достопримечательностей в 4D. Команда опиралась на публично доступные фотографии туристов крупных достопримечательностей, таких как фонтан Треви в Риме, и в результате получились 3D-изображения, которые можно манипулировать и которые показывают изменения внешнего вида во времени.
Новый метод обрабатывает и синтезирует десятки тысяч не размеченных и не датированных фотографий, и это большой шаг вперед в области компьютерного зрения.
Работа озаглавлена «Crowdsampling the Plenoptic Function», и она была представлена на виртуальной Европейской конференции по компьютерному зрению, которая прошла с 23 по 28 августа.
Ноа Снавели является ассоциированным профессором компьютерных наук в Корнелльском технологическом институте и старшим автором статьи. Другими участниками являются докторант Корнелльского университета Чжэнци Ли, первый автор статьи, а также Эйб Дэвис, ассистент профессора компьютерных наук в факультете информатики, и докторант Корнелльского технологического института Вэнци Сянь.
«Это новый способ моделирования сцены, который не только позволяет вам двигать головой и видеть, скажем, фонтан с разных точек зрения, но также дает вам контроль за изменением времени», – сказал Снавели.
«Если вы действительно посетили фонтан Треви на отдыхе, то его внешний вид зависел бы от того, когда вы туда пришли – ночью он был бы освещен прожекторами снизу. Днем он был бы освещен солнцем, если только вы не пришли в пасмурный день», – продолжил он. «Мы узнали весь диапазон внешних видов, основанный на времени суток и погоде, из этих неорганизованных коллекций фотографий, так что вы можете исследовать весь диапазон и одновременно двигаться по сцене».
Традиционные ограничения компьютерного зрения
Поскольку существует так много разных текстур, которые необходимо воспроизвести, традиционному компьютерному зрению трудно точно представлять места на фотографиях.
«Настоящий мир так разнообразен в своем виде и имеет разные виды материалов – блестящие вещи, вода, тонкие структуры», – сказал Снавели.
Помимо этих барьеров, традиционное компьютерное зрение также борется с несоответствующими данными. Пленоптическая функция – это то, как что-то выглядит с любой возможной точки зрения в пространстве и времени, но для воспроизведения этого требуется сотни веб-камер на месте. Не только это, но они должны записывать все время суток и ночи. Это можно сделать, но это очень ресурсоемкая задача, когда речь идет о количестве сцен, где этот метод необходим.
Обучение на других фотографиях
Чтобы обойти это, команда исследователей разработала новый метод.
«Возможно, нет фотографии, сделанной в 16:00 с этой точной точки зрения в наборе данных. Итак, нам приходится учиться на фотографии, сделанной в 21:00 в одном месте, и фотографии, сделанной в 16:03 в другом месте», – сказал Снавели. «И мы не знаем, с какой точностью эти фотографии были сделаны. Но использование глубокого обучения позволяет нам сделать вывод о том, как сцена выглядела бы в любой данной точке и времени».
Исследователи ввели новое представление сцены под названием Глубокие многослойные изображения, чтобы интерполировать внешний вид в четырех измерениях, которые являются 3D и изменения во времени.
По словам Снавели, «Мы используем ту же идею, которая была изобретена для создания 3D-эффектов в 2D-анимации, чтобы создать 3D-эффекты в реальных сценах, чтобы создать это глубокое многослойное изображение, подогнав его ко всем этим разрозненным измерениям из фотографий туристов. Интересно, что это как-то происходит из очень старой, классической техники, используемой в анимации».
Исследование показало, что обученная модель может создать сцену с 50 000 публично доступных изображений с различных сайтов. Команда считает, что это может иметь последствия в многих областях, включая исследования компьютерного зрения и виртуального туризма.
«Вы можете почувствовать, что действительно находитесь там», – сказал Снавели. «Это работает удивительно хорошо для разнообразных сцен».
Проект получил поддержку от бывшего генерального директора Google (GOOGL ) и филантропа Эрика Шмидта, а также Вендта Шмидта.
https://www.youtube.com/watch?v=MAVFKWX8LYo&feature=emb_title












