Моделі та платформи ШІ
Дослідники використовують глибоке навчання для перетворення фотографій пам’яток у 4D

Дослідники з Корнелльського університету розробили новий метод, який використовує глибоке навчання для перетворення фотографій світових пам’яток у 4D. Команда використала публічно доступні фотографії туристів великих пам’яток, таких як фонтан Треві в Римі, і отримала 3D-образи, які можна обертати і які показують зміни зовнішнього вигляду з часом.
Новий метод обробляє і синтезує десятки тисяч неозначених і недатованих фотографій, і це великий крок вперед у галузі комп’ютерного бачення.
Робота називається «Crowdsampling the Plenoptic Function», і була представлена на віртуальній Європейській конференції з комп’ютерного бачення, яка відбулася між 23-28 серпня.
Ной Снавелі є асоційованим професором комп’ютерних наук у Корнелльському університеті і старшим автором статті. Інші учасники включають докторанта Корнелльського університету Чженці Лі, першого автора статті, а також Абрахама Девіса, асистента професора комп’ютерних наук у факультеті обчислювальної техніки та інформації, і докторанта Корнелльського університету Веньці Сяна.
«Це новий спосіб моделювання сцени, який дозволяє не тільки рухати головою і бачити, наприклад, фонтан з різних точок зору, але також надає контроль за зміною часу», – сказав Снавелі.
«Якщо ви дійсно були у фонтані Треві на своїй відпустці, то його вигляд залежав би від того, коли ви туди прийшли – вночі він був би освітлений прожекторами знизу. У післяполудень він був би освітлений сонцем, якщо ви не прийшли у хмарний день», – продовжував він. «Ми вивчили весь діапазон зовнішніх виглядів, заснованих на часі доби і погоді, з цих неорганізованих фотографій, так що ви можете досліджувати весь діапазон і одночасно рухатися по сцені».
Традиційні обмеження комп’ютерного бачення
Оскільки існує так багато різних текстур, які потрібно відтворити, традиційне комп’ютерне бачення має труднощі з точним представленням місць через фотографії.
«Реальний світ дуже різноманітний у своєму зовнішньому вигляді і має різні види матеріалів – блискучі речі, вода, тонкі конструкції», – сказав Снавелі.
Крім цих бар’єрів, традиційне комп’ютерне бачення також бореться з несумісними даними. Пленоптична функція – це те, яким чином щось виглядає з будь-якої можливої точки зору в просторі і часі, але для відтворення цього потрібні сотні веб-камер на місці. Не тільки це, але вони повинні записувати все протягом дня і ночі. Це можна зробити, але це дуже ресурсоємка задача, якщо дивитися на кількість сцен, де цей метод буде потрібен.
Навчання з інших фотографій
Щоб обійти це, команда дослідників розробила новий метод.
«Можливо, немає фотографії, зробленої о 16:00 з цієї точної точки зору в наборі даних. Тому нам потрібно вивчати з фотографії, зробленої о 21:00 в одному місці, і фотографії, зробленої о 16:03 в іншому місці», – сказав Снавелі. «І ми не знаємо рівня деталізації, коли ці фотографії були зроблені. Але використання глибокого навчання дозволяє нам вивести, яким би виглядав сценарій в будь-який момент часу і місця».
Дослідники ввели нове представлення сцени під назвою Глибокі мультипланарні зображення, щоб інтерполювати зовнішній вигляд у чотирьох вимірах, тобто 3D і зміни з часом.
За словами Снавелі, «Ми використовуємо ту ж ідею, винайдену для створення 3D-ефекти в 2D-анімації, для створення 3D-ефекти в реальних сценах, для створення цього глибокого мультишарового зображення, підганяючи його під всі ці несумісні вимірювання з фотографій туристів. Цікаво, що це ніби походить з дуже старої, класичної техніки, використовуваної в анімації».
Дослідження показало, що навчена модель може створити сцену з 50 000 публічно доступних зображень з різних сайтів. Команда вважає, що це може мати наслідки у багатьох областях, включаючи дослідження комп’ютерного бачення і віртуальної туристичної індустрії.
«Ви можете відчувати себе там», – сказав Снавелі. «Це працює досить добре для ряду сцен».
Проект отримав підтримку від колишнього генерального директора Google (GOOGL ) і філантропа Еріка Шмідта, а також Венді Шмідт.
https://www.youtube.com/watch?v=MAVFKWX8LYo&feature=emb_title












