Modely a platformy AI

Výzkumníci používají hluboké učení k převodu fotografií památek do 4D

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Výzkumníci z Cornellovy univerzity vyvinuli novou metodu, která využívá hluboké učení k převodu fotografií světových památek do 4D. Tým se spoléhal na veřejně dostupné fotografie turistů z významných míst, jako je Treviho fontána v Římě, a výsledkem jsou 3D obrázky, které lze ovládat a které ukazují změny vzhledu v čase.

Nová metoda zpracovává a syntetizuje desetitisíce nepopsaných a nedatovaných fotografií, a je to velký krok vpřed pro počítačové vidění.

Práce je nazvána „Crowdsampling the Plenoptic Function“ a byla prezentována na virtuální Evropské konferenci o počítačovém vidění, která se konala mezi 23. a 28. srpnem.

Noah Snavely je asociativní profesor počítačových věd na Cornell Tech a hlavní autor článku. Dalšími přispěvateli jsou Cornellův doktorand Zhengqi Li, první autor článku, Abe Davis, asistent profesora počítačových věd na Fakultě informatiky a informačních věd, a Cornellův doktorand Wenqi Xian.

„Je to nový způsob modelování scény, který nejen umožňuje pohybovat hlavou a vidět, řekněme, fontánu z různých úhlů, ale také poskytuje ovládání pro změnu času,“ řekl Snavely.

„Pokud jste opravdu navštívili Treviho fontánu na dovolené, její vzhled by závisel na tom, kdy jste šli – v noci by byla osvětlena reflektory zespoda. Odpoledne by byla osvětlena sluncem, pokud jste nešli v zamračený den,“ pokračoval. „Naučili jsme se celý rozsah vzhledů na základě času dne a počasí z těchto neuspořádaných sbírek fotografií, takže můžete prozkoumat celý rozsah a zároveň se pohybovat kolem scény.“

Tradiční omezení počítačového vidění

Protože existuje tolik různých textur, které je třeba reprodukovat, je pro tradiční počítačové vidění obtížné přesně reprezentovat místa pomocí fotografií.

„Skutečný svět je tak rozmanitý ve svém vzhledu a má různé druhy materiálů – lesklé věci, vodu, tenké struktury,“ řekl Snavely.

Kromě těchto bariér se tradiční počítačové vidění také potýká s nekonzistentními daty. Plenoptická funkce je způsob, jakým něco vypadá z každého možného úhlu v prostoru a čase, ale k reprodukci toho je třeba stovek webových kamer na scéně. Nejen to, ale musí také natáčet po celý den a noc. To by bylo možné, ale je to extrémně náročná úloha, pokud se podíváme na počet scén, kde by tato metoda byla vyžadována.

Učení z jiných fotografií

Aby se tomu vyhnuli, tým výzkumníků vyvinul novou metodu.

„Může se stát, že nebyla pořízena fotografie ve 4 hodiny od tohoto exactního úhlu v datové sadě. Takže se musíme učit z fotografie pořízené v 9 hodin od jednoho místa a fotografie pořízené ve 4:03 od jiného místa,“ řekl Snavely. „A nevíme, jak přesně byly tyto fotografie pořízeny. Ale pomocí hlubokého učení můžeme odvodit, jak by scénář vypadal v každém daném čase a místě.“

Výzkumníci představili novou reprezentaci scény nazvanou Deep Multiplane Images, která umožňuje interpolovat vzhled ve čtyřech dimenzích, tj. 3D a změny v čase.

Podle Snavelyho „používáme stejnou myšlenku, která byla vynalezena pro vytváření 3D efektů v 2D animaci, k vytváření 3D efektů ve skutečných scénách, k vytvoření tohoto hlubokého multivrstevnatého obrazu přizpůsobením ho všem těmto různojmenným měřením z turistických fotografií. Je zajímavé, že to trochu vychází z této velmi staré, klasické techniky používané v animaci.“

Studie prokázala, že trénovaný model může vytvořit scénář s 50 000 veřejně dostupnými obrázky z různých míst. Tým věří, že to může mít důsledky v mnoha oblastech, včetně výzkumu počítačového vidění a virtuální turistiky.

„Můžete získat pocit, že jste opravdu tam,“ řekl Snavely. „Funguje překvapivě dobře pro řadu scén.“

Projekt získal podporu od bývalého generálního ředitele Googlu a filantropa Erica Schmidta, stejně jako od Wendt Schmidta.

(GOOGL )

https://www.youtube.com/watch?v=MAVFKWX8LYo&feature=emb_title

Alex vede AI‑poháněné zpravodajské operace společnosti Unite.AI, spojující žurnalistiku, výzkum a automatizaci, aby podpořil včasné a škálovatelné pokrytí umělé inteligence. Jeho práce pomáhá zajistit, aby se nové vývoje umělé inteligence rychle objevovaly, a to při zachování redakčních standardů publikace.