AI-mallit ja alustat

Intel Labs Edistää Tietokoneen Näkökyvyn Kehitystä Kahdella Uudella Tekoälymallilla

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

VI-Depth 1.0 ja MiDaS 3.1 avoimen lähdekoodin tekoälymallit parantavat syvyyden arviointia tietokoneen näkökyvyssä.

Syvyyden arviointi on haastava tehtävä tietokoneen näkökyvyn sovelluksissa, kuten robotiikassa, lisätyn todellisuuden (AR) ja virtuaalitodellisuuden (VR) sovelluksissa. Olemassa olevat ratkaisut usein kamppailevat etäisyyksien oikean arvioinnin kanssa, mikä on tärkeä asia visuaalisen navigoinnin suunnittelussa ja esteiden välttämisessä. Intel (INTC ) Labsin tutkijat ovat ratkaisseet tämän ongelman julkaisemalla kaksi tekoälymallia yksittäisen kuvan syvyyden arvioimiseksi: yhden visuaalisen-inertiaalisen syvyyden arvioimiseksi ja toisen vakaan suhteellisen syvyyden arvioimiseksi (RDE).

Uusin RDE-malli, MiDaS versio 3.1, ennustaa vakaan suhteellisen syvyyden käyttämällä vain yhtä kuvaa syötteenä. Sen koulutus laajalla ja monipuolisella aineistolla mahdollistaa tehokkaan suorittamisen laajalla valikoimalla tehtävissä ja ympäristöissä. MiDaS:n uusin versio parantaa mallin tarkkuutta RDE:ssä noin 30 %:lla suuremman koulutusaineiston ja päivitetympien koodausyksiköiden ansiosta.

MiDaS on otettu käyttöön useissa projekteissa, joista merkittävin on Stable Diffusion 2.0, jossa se mahdollistaa syvyydestä kuvaan -ominaisuuden, joka arvioi syötteen kuvan syvyyden ja sitten generoi uusia kuvia sekä tekstin että syvyyden tiedon perusteella. Esimerkiksi digitaalinen luojaa Scottie Fox käytti yhdistelmää Stable Diffusionista ja MiDaS:sta luodakseen 360-astetta VR-ympäristön. Tämä teknologia voi johtaa uusiin virtuaalisovelluksiin, kuten rikospaikan rekonstruktioon oikeustapauksissa, terveydenhuollon parantamiseen ja upottavaan pelikokemukseen.

Vaikka RDE:llä on hyvä yleistettävyys ja se on hyödyllinen, mittakaavan puute vähentää sen hyödyllisyyttä alihankkeissa, jotka vaativat mittakaavan mukaista syvyyttä, kuten kartoittamista, suunnittelua, navigointia, objektien tunnistamista, 3D-rekonstruktioita ja kuvan muokkausta. Intel Labsin tutkijat ovat ratkaisseet tämän ongelman julkaisemalla VI-Depthin, toisen tekoälymallin, joka tarjoaa tarkan syvyyden arvioinnin.

VI-Depth on visuaalinen-inertiaalinen syvyyden arviointiputki, joka yhdistää yksittäisen kuvan syvyyden arvioinnin ja visuaalisen-inertiaalisen odometrian (VIO) tuottaakseen tiheän syvyyden arvioinnin mittakaavassa. Tämä lähestymistapa tarjoaa tarkan syvyyden arvioinnin, joka voi auttaa kohtauksen rekonstruktiossa, kartoittamisessa ja objektien manipuloinnissa.

Inertiaalisten tietojen sisällyttäminen voi auttaa ratkaisemaan mittakaavan epävarmuuden. Useimmat mobiililaitteet sisältävät jo inertiaalisen mittausyksikön (IMU). Globaali kohdistus määrittää sopivan globaalin mittakaavan, kun taas tiheän mittakaavan kohdistus (SML) toimii paikallisesti ja työntää tai vetää alueita oikeaan mittakaavaan. SML-verkko hyödyntää MiDaS:ia koodausyksikkönä. Modulaarisessa putkessa VI-Depth yhdistää dataohjatun syvyyden arvioinnin MiDaS:n suhteellisen syvyyden ennustemallin sekä IMU-sensorin mittausyksikön. Tietolähteiden yhdistäminen mahdollistaa VI-Depthille luotettavan tiheän mittakaavan syvyyden arvioinnin jokaiselle kuvapikselille.

MiDaS 3.1 ja VI-Depth 1.0 ovat saatavilla avoimen lähdekoodin MIT-lisenssillä GitHubissa.

Lisätietoja löytyy osoitteista “Vision Transformers for Dense Prediction” ja “Towards Robust Monocular Depth Estimation: Mixing Datasets for Zero-shot Cross-dataset Transfer.”

Daniel on suuri kannattaja siitä, miten tekoäly lopulta muuttaa kaiken. Hän hengittää teknologiaa ja elää kokeillakseen uusia laitteita.