Modele și platforme AI

Cercetătorii utilizează învățarea profundă pentru a transforma fotografii de monumente în 4D

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Cercetătorii de la Universitatea Cornell au dezvoltat o nouă metodă care utilizează învățarea profundă pentru a transforma fotografii de monumente în 4D. Echipa s-a bazat pe fotografii publice disponibile ale turiștilor cu puncte de reper importante, cum ar fi Fântâna Trevi din Roma, și rezultatele finale sunt imagini 3D care pot fi manevrate și pot arăta schimbări în aparență în timp.

Noua metodă dezvoltată preia și sintetizează zeci de mii de fotografii neetichetate și nedatate, și reprezintă un pas important înainte pentru viziunea computerizată.

Lucrarea se intitulează „Crowdsampling the Plenoptic Function”, și a fost prezentată la Conferința virtuală europeană de viziune computerizată, care a avut loc între 23-28 august.

Noah Snavely este profesor asociat de știință computerizată la Cornell Tech și autorul principal al lucrării. Alți contribuitori includ studentul doctoral de la Cornell, Zhengqi Li, autorul principal al lucrării, precum și Abe Davis, asistent profesor de știință computerizată în Facultatea de Calcul și Știință a Informației, și studentul doctoral de la Cornell Tech, Wenqi Xian.

„Este o nouă modalitate de modelare a scenei care nu numai că vă permite să vă mișcați capul și să vedeți, să zicem, fântâna din perspective diferite, dar vă oferă și controale pentru schimbarea timpului”, a spus Snavely.

„Dacă ați fost cu adevărat la Fântâna Trevi în vacanță, aspectul său ar depinde de ora la care ați fost – noaptea, ar fi iluminat de reflectoare de la bază. În după-amiaza, ar fi luminat de soare, cu excepția cazului în care ați fost într-o zi înnorată”, a continuat el. „Am învățat întreaga gamă de aparențe, pe baza orei și vremii, din aceste colecții de fotografii neorganizate, astfel încât puteți explora întreaga gamă și, în același timp, vă puteți mișca prin scenă.”

Limitările tradiționale ale viziunii computerizate

Deoarece pot exista atâtea texturi diferite care trebuie reproduse, este dificil pentru viziunea computerizată tradițională să reprezinte locuri cu acuratețe prin fotografii.

„Lumea reală este atât de diversă în aparență și are diferite tipuri de materiale – lucruri strălucitoare, apă, structuri subțiri”, a spus Snavely.

Pe lângă aceste bariere, viziunea computerizată tradițională se confruntă și cu date inconsistente. Funcția plenoptică reprezintă modul în care ceva apare din orice punct de vedere în spațiu și timp, dar pentru a reproduce acest lucru, sunt necesare sute de webcam-uri la fața locului. Nu numai că, dar acestea ar trebui să înregistreze tot timpul zilei și nopții. Acest lucru poate fi realizat, dar este o sarcină extrem de grea atunci când se ia în considerare numărul de scene în care această metodă ar fi necesară.

Învățarea din alte fotografii

Pentru a ocoli acest lucru, echipa de cercetători a dezvoltat o nouă metodă.

„Poate nu există o fotografie făcută la ora 16:00 din acest punct de vedere exact în setul de date. Așadar, trebuie să învățăm dintr-o fotografie făcută la ora 21:00 într-un loc și o fotografie făcută la ora 16:03 în alt loc”, a spus Snavely. „Și nu știm granulația când au fost făcute aceste fotografii. Dar utilizarea învățării profunde ne permite să inferăm cum ar fi arătat scena la orice moment și loc dat.”

Cercetătorii au introdus o nouă reprezentare a scenei numită Deep Multiplane Images, pentru a interpolarea aparenței în patru dimensiuni, care sunt 3D și schimbări în timp.

Conform lui Snavely, „Utilizăm aceeași idee inventată pentru crearea de efecte 3D în animație 2D pentru a crea efecte 3D în scene reale, pentru a crea această imagine multilayer profundă prin ajustarea la toate aceste măsurători disparate din fotografiile turiștilor. Este interesant că acest lucru provine dintr-o tehnică veche, clasică, utilizată în animație.”

Studiul a demonstrat că modelul antrenat poate crea o scenă cu 50.000 de fotografii publice disponibile de pe diverse site-uri. Echipa consideră că acest lucru ar putea avea implicații în multe domenii, inclusiv cercetarea viziunii computerizate și turismul virtual.

„Puteți simți cu adevărat că sunteți acolo”, a spus Snavely. „Funcționează surprinzător de bine pentru o gamă largă de scene.”

Proiectul a primit sprijin din partea fostului director general al Google (GOOGL ) și filantropului Eric Schmidt, precum și din partea lui Wendt Schmidt.

https://www.youtube.com/watch?v=MAVFKWX8LYo&feature=emb_title

Alex conduce operațiunile de știri alimentate de AI ale Unite.AI, combinând jurnalismul, cercetarea și automatizarea pentru a susține o acoperire rapidă și scalabilă a inteligenței artificiale. Munca sa contribuie la asigurarea că evoluțiile emergente în domeniul AI sunt evidențiate eficient, menținând în același timp standardele editoriale ale publicației.