Modele i platformy AI

Badacze wykorzystują głębokie uczenie, aby przekształcić zdjęcia zabytków w 4D

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Badacze z Cornell University opracowali nową metodę, która wykorzystuje głębokie uczenie, aby przekształcić zdjęcia zabytków świata w 4D. Zespół oparł się na publicznie dostępnych zdjęciach turystycznych znanych miejsc, takich jak Fontanna di Trevi w Rzymie, a efektem końcowym są obrazy 3D, które można obracać i które pokazują zmiany wyglądu w czasie.

Nowo opracowana metoda łączy i syntetyzuje dziesiątki tysięcy nieopatrzonych i nieodznaczonych zdjęć, co stanowi duży krok naprzód w dziedzinie widzenia komputerowego.

Praca nosi tytuł „Crowdsampling the Plenoptic Function” i została przedstawiona na wirtualnej Europejskiej Konferencji Widzenia Komputerowego, która odbyła się w dniach 23-28 sierpnia.

Noah Snavely jest associate profesorem informatyki na Cornell Tech i seniorem autorem artykułu. Inni współautorzy to doktorant Cornell Zhengqi Li, pierwszy autor artykułu, a także Abe Davis, asystent profesora informatyki w Wydziale Informatyki i Nauk o Informacji, oraz doktorant Cornell Tech Wenqi Xian.

„To nowy sposób modelowania sceny, który pozwala nie tylko poruszać głową i widzieć, na przykład, fontannę z różnych punktów widzenia, ale także daje kontrolę nad zmianą czasu”, powiedział Snavely.

„Jeśli naprawdę byliście przy Fontannie di Trevi podczas wakacji, to wygląd byłby zależny od tego, o której godzinie tam byliście – w nocy byłaby oświetlona reflektorami od dołu. W południe byłaby nasłoneczniona, chyba że przyszlibyście w pochmurny dzień”, kontynuował. „Nauczyliśmy się całego zakresu wyglądów, w oparciu o czas dnia i pogodę, z tych nieuporządkowanych kolekcji zdjęć, tak aby można było zbadać cały zakres i jednocześnie poruszać się po scenie.”

Tradycyjne ograniczenia widzenia komputerowego

Ponieważ istnieje wiele różnych tekstur, które muszą być odtworzone, tradycyjne widzenie komputerowe ma trudności z dokładnym przedstawieniem miejsc za pomocą zdjęć.

„Rzeczywisty świat jest tak różnorodny w swoim wyglądzie i ma różne rodzaje materiałów – błyszczące rzeczy, woda, cienkie struktury”, powiedział Snavely.

Ponadto tradycyjne widzenie komputerowe ma trudności z niekonsekwentnymi danymi. Funkcja plenotyczna to sposób, w jaki coś wygląda z każdego możliwego punktu widzenia w przestrzeni i czasie, ale aby ją odtworzyć, potrzeba setek kamer internetowych na miejscu. Nie tylko to, ale również musiałyby one nagrywać cały dzień i noc. To mogłoby być zrobione, ale jest to niezwykle wymagające zadanie, biorąc pod uwagę liczbę scen, w których ta metoda byłaby wymagana.

Uczenie się z innych zdjęć

Aby obejść ten problem, zespół badaczy opracował nową metodę.

„Może nie ma zdjęcia zrobionego o 16:00 z tego samego punktu widzenia w zestawie danych. Więc musimy się uczyć z zdjęcia zrobionego o 21:00 w jednym miejscu i zdjęcia zrobionego o 16:03 w innym miejscu”, powiedział Snavely. „I nie wiemy, jaka jest dokładność, kiedy te zdjęcia zostały zrobione. Ale dzięki głębokiemu uczeniu możemy wnioskować, jaki byłby wygląd sceny w danym momencie i miejscu.”

Badacze wprowadzili nowe przedstawienie sceny zwane Deep Multiplane Images, aby interpolować wygląd w czterech wymiarach, czyli 3D i zmiany w czasie.

Według Snavely’ego, „Używamy tego samego pomysłu, który został wynaleziony do tworzenia efektów 3D w animacji 2D, aby stworzyć efekty 3D w rzeczywistych scenach, aby stworzyć ten głęboki wielowarstwowy obraz, dopasowując go do wszystkich tych rozproszonych pomiarów z zdjęć turystów. Jest to interesujące, że pochodzi to z bardzo starej, klasycznej techniki używanej w animacji.”

Badanie wykazało, że wytrenowany model mógł stworzyć scenę z 50 000 publicznie dostępnych zdjęć z różnych stron. Zespół uważa, że może to mieć wpływ na wiele dziedzin, w tym badania widzenia komputerowego i wirtualny turystykę.

„Można poczuć, że jesteśmy tam naprawdę”, powiedział Snavely. „Działa to zaskakująco dobrze dla szerokiego zakresu scen.”

Projekt otrzymał wsparcie od byłego dyrektora generalnego Google (GOOGL ) i filantropa Erica Schmidta, a także Wendt Schmidta.

https://www.youtube.com/watch?v=MAVFKWX8LYo&feature=emb_title

Alex kieruje operacjami informacyjnymi Unite.AI opartymi na sztucznej inteligencji, łącząc dziennikarstwo, badania i automatyzację, aby wspierać terminowe i skalowalne relacjonowanie sztucznej inteligencji. Jego praca pomaga zapewnić, że nowe osiągnięcia w dziedzinie AI są prezentowane efektywnie, przy jednoczesnym zachowaniu standardów redakcyjnych publikacji.