AI-mallit ja alustat

Tutkijat käyttävät syvää oppimista maamerkkikuvien 4D-muuttamiseen

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Cornellin yliopiston tutkijat ovat kehittäneet uuden menetelmän, joka hyödyntää syvää oppimista maailman maamerkkikuvien 4D-muuttamiseen. Tutkijaryhmä käytti julkisesti saatavilla olevia matkailijoiden valokuvia suurista kohteista, kuten Rooman Trevi-lähteestä, ja lopputuloksena ovat 3D-kuvat, jotka voidaan manööverata ja jotka voivat näyttää ulkonäön muutoksia ajassa.

Uusi menetelmä ottaa vastaan ja syntetisoi kymmeniä tuhansia merkintä- ja päivämäätöntä valokuvaa, ja se on suuri askel eteenpäin tietokoneen näön kehityksessä.

Työ on nimeltään ”Crowdsampling the Plenoptic Function”, ja se esiteltiin virtuaalisessa Euroopan tietokoneen näön konferenssissa, joka järjestettiin 23.-28. elokuuta.

Noah Snavely on Cornell Techin tietokoneen tieteen apulaisprofessori ja tutkimuksen seniorkirjoittaja. Muita avustajia ovat Cornellin tohtorikoulutettava Zhengqi Li, tutkimuksen ensimmäinen kirjoittaja, sekä Abe Davis, tietokoneen tieteen apulaisprofessori Faculty of Computing and Information Sciencessä, ja Cornell Techin tohtorikoulutettava Wenqi Xian.

”Se on uusi tapa mallintaa kohtauksia, joka sallii liikuttaa päätäsi ja nähdä, esimerkiksi, lähde eri näkökulmista, ja antaa myös ohjaimet ajan muuttamiseen”, Snavely sanoi.

”Jos olet todella käynyt Trevi-lähteellä lomallasi, sen ulkonäkö riippuisi siitä, mihin aikaan menit – yöllä se olisi valaistu pohjasta alkaen. Iltapäivällä se olisi auringonvalossa, ellei sinä menisi pilvisenä päivänä”, hän jatkoi. ”Olemme oppineet koko ulkonäön sävyt, perustuen aikaan ja sääoloihin, näistä järjestämättömistä valokuvakokoelmista, jotta voit tutkia koko sävyt ja liikuttaa samanaikaisesti kohtauksen ympärillä”.

Perinteisen tietokoneen näön rajoitukset

Koska on olemassa niin monta erilaista tekstuuria, jotka on reproduktiivista, on vaikea perinteiselle tietokoneen näölle edustaa paikkoja tarkasti valokuvien kautta.

”Todellinen maailma on niin monimuotoinen ulkonäöltään ja sisältää erilaisia materiaaleja – kiiltäviä asioita, vettä, ohuita rakenteita”, Snavely sanoi.

Lisäksi perinteinen tietokoneen näkö kamppailee epäjohdonmukaisen datan kanssa. Plenoptinen funktio on, miten jokin näyttää jokaisesta mahdollisesta näkökulmasta avaruudessa ja ajassa, mutta jotta voidaan reproduktiivista tämä, tarvitaan satoja web-kameroita kohtauksessa. Ei ainoastaan se, vaan ne pitäisi tallentaa kaiken päivän ja yön ajan. Tämä voidaan tehdä, mutta se on erittäin resursseja vaativa tehtävä, kun tarkastellaan määrää kohtauksia, joissa tämä menetelmä vaaditaan.

Oppiminen muiden valokuvien avulla

Jotta voidaan kiertää tämä, tutkijaryhmä kehitti uuden menetelmän.

”Ei välttämättä ole valokuvaa, joka on otettu kello 16:00 tästä näkökulmasta tietokannassa. Joten meidän on opittava valokuvasta, joka on otettu kello 21:00 toisesta paikasta, ja valokuvasta, joka on otettu kello 16:03 toisesta paikasta”, Snavely sanoi. ”Emme tiedä, mihin aikaan nämä valokuvat on otettu. Mutta syvän oppimisen avulla voimme päätellä, miltä kohtaus olisi näyttänyt tietyssä ajassa ja paikassa”.

Tutkijat esittivät uuden kohtauksen esitystavan, jota kutsutaan Deep Multiplane Imagesiksi, jotta voidaan interpoloida ulkonäkö neljässä ulottuvuudessa, jotka ovat 3D ja muutokset ajassa.

Snavelyn mukaan, ”Käytämme samaa ideaa, joka on keksitty luomaan 3D-vaikutuksia 2D-animaatiossa, luomaan 3D-vaikutuksia todellisissa kohtauksissa, luomaan tämän syvän monikerroksisen kuvan sovittamalla se kaikkiin näihin erilaisiin mittauksiin matkailijoiden valokuvista. On mielenkiintoista, että se johtuu tästä vanhasta, klassisesta tekniikasta, jota käytetään animaatiossa”.

Tutkimus osoitti, että koulutettu malli voisi luoda kohtauksen 50 000 julkisesti saatavilla olevasta kuvasta eri sivustoilta. Tutkijaryhmä uskoo, että se voisi olla vaikutuksia monilla aloilla, mukaan lukien tietokoneen näön tutkimus ja virtuaaliturismi.

”Voit saada todellisen olon olemisesta siellä”, Snavely sanoi. ”Se toimii yllättävän hyvin monissa kohtauksissa”.

Hankkeen tuki tuli entiseltä Google-johtajalta ja hyväntekijältä Eric Schmidtiltä sekä Wendt Schmidtiltä.

(GOOGL )

https://www.youtube.com/watch?v=MAVFKWX8LYo&feature=emb_title

Alex johtaa Unite.AI:n tekoälypohjaista uutistoimintaa, yhdistäen journalismia, tutkimusta ja automaatiota tukeakseen ajantasaista ja skaalautuvaa tekoälyn kattavuutta. Hänen työnsä auttaa varmistamaan, että nousevat tekoälykehitykset saadaan esiin tehokkaasti samalla kun julkaisun toimitukselliset standardit säilyvät.