AI-modeller og platforme

Forskere bruger dyb læring til at omdanne landemærkefotos til 4D

mm
Føj Unite.AI til dine foretrukne kilder på Google

Forskere ved Cornell University har udviklet en ny metode, der udnytter dyb læring til at omdanne verdens landemærkefotos til 4D. Holdet har baseret sig på offentligt tilgængelige turistfotos af større punkter som Trevi-fontænen i Rom, og resultaterne er 3D-billeder, der kan manipuleres og vise ændringer i udseende over tid.

Den nyligt udviklede metode indtager og syntetiserer titusinder af uplagte og udaterede fotos, og det er et stort skridt fremad for computer vision.

Arbejdet har titlen “Crowdsampling the Plenoptic Function” og blev præsenteret på den virtuelle europæiske konference om computer vision, der fandt sted mellem 23. og 28. august.

Noah Snavely er en associeret professor i datalogi ved Cornell Tech og seniorforfatter på artiklen. Andre bidragsydere inkluderer Cornell-doktoranden Zhengqi Li, der er første forfatter på artiklen, samt Abe Davis, assistentprofessor i datalogi på Faculty of Computing and Information Science, og Cornell Tech-doktoranden Wenqi Xian.

”Det er en ny måde at modelere scener, der ikke kun giver dig mulighed for at flytte hovedet og se, sagen, fontænen fra forskellige vinkler, men også giver dig kontroller for at ændre tiden,” sagde Snavely.

”Hvis du virkelig var ved Trevi-fontænen på din ferie, ville udseendet afhænge af, hvornår du gik derhen – om natten ville det være belyst af projektører fra bunden. Om eftermiddagen ville det være solbelyst, medmindre du gik der på en skyggedag,” fortsatte han. ”Vi lærte hele udseendets variation, baseret på tid på dagen og vejr, fra disse uorganiserede fotosamlinger, så du kan udforske hele variationen og samtidig flytte dig rundt i scenen.”

Traditionel computer vision begrænsninger

Da der kan være så mange forskellige teksturer, der skal reproduceres, er det svært for traditionel computer vision at repræsentere steder nøjagtigt gennem fotos.

”Den virkelige verden er så divers i sit udseende og har forskellige typer af materialer – blanke ting, vand, tynde strukturer,” sagde Snavely.

Foruden disse barrierer kæmper traditionel computer vision også med inkonsistent data. Plenoptic funktion er, hvordan noget ser ud fra hver enkelt mulig vinkel i rum og tid, men for at reproducere dette kræves hundredvis af webkameraer på stedet. Ikke kun det, men de skulle også optage hele dagen og natten. Dette kunne gøres, men det er en ekstremt ressourcekrævende opgave, når man ser på antallet af scener, hvor denne metode ville være nødvendig.

At lære af andre fotos

For at komme rundt om dette udviklede forskerholdet den nye metode.

”Der kan ikke være et foto taget klokken 16 fra denne præcise vinkel i datasættet. Så vi må lære af et foto taget klokken 21 på et sted, og et foto taget klokken 16:03 på et andet sted,” sagde Snavely. ”Og vi ved ikke, hvornår disse fotos blev taget. Men ved at bruge dyb læring kan vi slutte, hvordan scenen ville have set ud på et given tidspunkt og sted.”

En ny scene-repræsentation kaldet Deep Multiplane Images blev introduceret af forskerne for at interpolere udseende i fire dimensioner, som er 3D og ændringer over tid.

Ifølge Snavely ”Bruger vi samme idé, der blev opfundet til at skabe 3D-effekter i 2D-animation, til at skabe 3D-effekter i virkelige scener, til at skabe denne dybe multilag-billede ved at tilpasse det til alle disse forskellige målinger fra turisternes fotos. Det er interessant, at det nærmest stammer fra denne meget gamle, klassiske teknik, der blev brugt i animation.”

Studiet demonstrerede, at den trænede model kunne skabe en scene med 50.000 offentligt tilgængelige billeder fra forskellige steder. Holdet mener, at det kunne have implikationer i mange områder, herunder computer vision-forskning og virtuel turisme.

”Du kan få fornemmelsen af virkelig at være der,” sagde Snavely. ”Det virker overraskende godt for en række scener.”

Projektet modtog støtte fra tidligere Google-direktør og filantrop Eric Schmidt samt Wendt Schmidt.

(GOOGL )

https://www.youtube.com/watch?v=MAVFKWX8LYo&feature=emb_title

Alex leder Unite.AI’s AI‑drevne nyhedsoperationer, der kombinerer journalistik, forskning og automatisering for at understøtte rettidig og skalerbar dækning af kunstig intelligens. Hans arbejde sikrer, at nye AI‑udviklinger fremhæves effektivt, samtidig med at publikationsredaktionens standarder opretholdes.