Моделі та платформи ШІ

Дослідники використовують глибоке навчання для перетворення фотографій пам’яток у 4D

mm
Додайте Unite.AI до бажаних джерел у Google

Дослідники з Корнелльського університету розробили новий метод, який використовує глибоке навчання для перетворення фотографій світових пам’яток у 4D. Команда використала публічно доступні фотографії туристів великих пам’яток, таких як фонтан Треві в Римі, і отримала 3D-образи, які можна обертати і які показують зміни зовнішнього вигляду з часом.

Новий метод обробляє і синтезує десятки тисяч неозначених і недатованих фотографій, і це великий крок вперед у галузі комп’ютерного бачення.

Робота називається «Crowdsampling the Plenoptic Function», і була представлена на віртуальній Європейській конференції з комп’ютерного бачення, яка відбулася між 23-28 серпня.

Ной Снавелі є асоційованим професором комп’ютерних наук у Корнелльському університеті і старшим автором статті. Інші учасники включають докторанта Корнелльського університету Чженці Лі, першого автора статті, а також Абрахама Девіса, асистента професора комп’ютерних наук у факультеті обчислювальної техніки та інформації, і докторанта Корнелльського університету Веньці Сяна.

«Це новий спосіб моделювання сцени, який дозволяє не тільки рухати головою і бачити, наприклад, фонтан з різних точок зору, але також надає контроль за зміною часу», – сказав Снавелі.

«Якщо ви дійсно були у фонтані Треві на своїй відпустці, то його вигляд залежав би від того, коли ви туди прийшли – вночі він був би освітлений прожекторами знизу. У післяполудень він був би освітлений сонцем, якщо ви не прийшли у хмарний день», – продовжував він. «Ми вивчили весь діапазон зовнішніх виглядів, заснованих на часі доби і погоді, з цих неорганізованих фотографій, так що ви можете досліджувати весь діапазон і одночасно рухатися по сцені».

Традиційні обмеження комп’ютерного бачення

Оскільки існує так багато різних текстур, які потрібно відтворити, традиційне комп’ютерне бачення має труднощі з точним представленням місць через фотографії.

«Реальний світ дуже різноманітний у своєму зовнішньому вигляді і має різні види матеріалів – блискучі речі, вода, тонкі конструкції», – сказав Снавелі.

Крім цих бар’єрів, традиційне комп’ютерне бачення також бореться з несумісними даними. Пленоптична функція – це те, яким чином щось виглядає з будь-якої можливої точки зору в просторі і часі, але для відтворення цього потрібні сотні веб-камер на місці. Не тільки це, але вони повинні записувати все протягом дня і ночі. Це можна зробити, але це дуже ресурсоємка задача, якщо дивитися на кількість сцен, де цей метод буде потрібен.

Навчання з інших фотографій

Щоб обійти це, команда дослідників розробила новий метод.

«Можливо, немає фотографії, зробленої о 16:00 з цієї точної точки зору в наборі даних. Тому нам потрібно вивчати з фотографії, зробленої о 21:00 в одному місці, і фотографії, зробленої о 16:03 в іншому місці», – сказав Снавелі. «І ми не знаємо рівня деталізації, коли ці фотографії були зроблені. Але використання глибокого навчання дозволяє нам вивести, яким би виглядав сценарій в будь-який момент часу і місця».

Дослідники ввели нове представлення сцени під назвою Глибокі мультипланарні зображення, щоб інтерполювати зовнішній вигляд у чотирьох вимірах, тобто 3D і зміни з часом.

За словами Снавелі, «Ми використовуємо ту ж ідею, винайдену для створення 3D-ефекти в 2D-анімації, для створення 3D-ефекти в реальних сценах, для створення цього глибокого мультишарового зображення, підганяючи його під всі ці несумісні вимірювання з фотографій туристів. Цікаво, що це ніби походить з дуже старої, класичної техніки, використовуваної в анімації».

Дослідження показало, що навчена модель може створити сцену з 50 000 публічно доступних зображень з різних сайтів. Команда вважає, що це може мати наслідки у багатьох областях, включаючи дослідження комп’ютерного бачення і віртуальної туристичної індустрії.

«Ви можете відчувати себе там», – сказав Снавелі. «Це працює досить добре для ряду сцен».

Проект отримав підтримку від колишнього генерального директора Google (GOOGL ) і філантропа Еріка Шмідта, а також Венді Шмідт.

https://www.youtube.com/watch?v=MAVFKWX8LYo&feature=emb_title

Alex очолює новинні операції Unite.AI, що працюють на базі ШІ, поєднуючи журналістику, дослідження та автоматизацію, щоб підтримувати своєчасне та масштабоване висвітлення штучного інтелекту. Його робота допомагає забезпечити ефективне виявлення нових розробок у сфері ШІ, зберігаючи редакційні стандарти видання.