Andersonin kulma

Tekoäly kamppailee maamerkkien koostumuksen tunnistamisessa

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa
AI-generated image (GPT-2 + Photoshop): High-angle view of a man holding a scale model of the Leaning Tower of Pisa on a grassy field, with an inset photograph showing the same model aligned from ground level to resemble the full-sized tower in the background.

Näkemiskielimallit ymmärtävät monumentteja, mutta ne eivät voi nähdä koko kuvaa…

 

Yksi varhaisimmista selviytymistaidoista, jonka kehitymme, on kyky erottaa asioita, jotka ovat pieniä tai kaukana. Voimme peittää kuun peukalolla, ilman että luulisi sen olevan yhden sentin kokoinen, koska olemme sisäistäneet suhteellisen mittakaavan ymmärryksen.

Tämä on epätavallisen vaikea tehtävä tietokoneen näköjärjestelmille, koska useimmat niistä riippuvat aiemmasta annotaatiosta, joka ei auta niitä “ymmärtämään” mittakaavaa samalla tavalla kuin ihmiset. Lisäksi, tietyn ja melko lähellä olevan rajan jälkeen, kaikki kaukaisuudessa ovat ulottumattomissa stereonäön ratkaisukyvyltä – auto kaukaisessa päässä; pilvenpiirtäjä kaukaisuudessa sen jälkeen; ja sirppimäinen kuu nousee ylös… kaikki ovat “2D”-entiteettejä, useimpien näköperusteisten koneoppimismenetelmien kannalta.

Tietysti, kun tietty esimerkki “kaukaisesta” mutta väärin tulkitusta kohteesta päätyy hyvin edustettuna koulutusdataan, järjestelmät, jotka ovat nähneet tämän datan, voivat olla vaikeita huijaamaan:

ChatGPT-5.5 ei ole lainkaan vaikuttunut tästä klassisesta matkailutroopista.

ChatGPT-5.5 ei ole lainkaan vaikuttunut tästä klassisesta matkailutroopista.

Sen mukaan, miten vähän mallin koulutettu latenttiavaruus sisältää tällaista tiettyä ja usein toistuvaa tietoa, sitä enemmän se tarvitsee pystyä yleistämään ja sisäistämään mittakaavan käsitteitä, joita me ymmärrämme nuorella iällä. Ilman tätä, jopa kuuluisat esimerkit voivat edelleen aiheuttaa mittakaavan väärin arvioimista:

Tässä spekulatiivisessa esimerkissä, joka on otettu tänään tarkasteltavasta uudesta tutkimuksesta, kameran näkökulma sisältää Arc De Triomphe -taustalla – mutta järjestelmä ei tiedä, miten suuri se on, ja tekee virheellisen arvion. Lähde - https://arxiv.org/pdf/2606.02379

Tässä spekulatiivisessa esimerkissä, joka on sovellettu tänään tarkasteltavasta uudesta tutkimuksesta, kameran näkökulma sisältää Arc De Triomphe -taustalla – mutta järjestelmä ei tiedä, miten suuri se on, ja tekee virheellisen arvion. Lähde

Vaara, joka liittyy tiettyihin ja erittäin ominaispiirteisiin objekteihin, kuten Eiffel-torniin, on, että järjestelmä turvautuu pikanäppäintä koon arvioimiseen, joka on oikein alkuperäiselle mallille, mutta ei ole oikein monille Pariisin maamerkin jäljennöksille, jotka ovat yhtä kaukana stereoresoluution etäisyydellä, mutta eivät ole läheskään yhtä suuria.

Siksi on tärkeää, että näköjärjestelmät lähestyvät uusia (näkemättömiä) näkymiä valmiilla taitopohjalla, eikä vain joukolla “salaisia koodauksia”.

Skalointi

Tähän tarkoitukseen Yhdysvaltain ja Kiinan välinen uusi yhteistyö tarjoaa korjaavaa tietojoukkoa ja arviointimenetelmää, joka osoittaa ongelman:

Uusi lähestymistapa muuttaa aiempaa järjestelmää parannetun koulutusmateriaalin kautta – dataa, joka on tarpeeksi monipuolista, jotta voidaan saavuttaa syvempi ymmärrys syvyyden ongelmista.

Uusi lähestymistapa muuttaa aiempaa järjestelmää parannetun koulutusmateriaalin kautta – dataa, joka on tarpeeksi monipuolista, jotta voidaan saavuttaa syvempi ymmärrys syvyyden ongelmista.

Yhdessä sivuston kanssa, MetricScenes -aloite sisältää dataa ja koodia julkaisuja.

Tutkimus sanoo*:

‘[Me] löysimme, että nykyiset huipputason menetelmät usein epäonnistuvat arvioimaan oikean kohtauksen mittakaavaa, johtaen jatkuvaan mittakaavan romahdukseen “luonnonoloissa”.’

‘[Yllä oleva kuva] näyttää esimerkin, jossa selkeät semanttiset viittaukset (ihmiset) ovat läsnä, mutta jossa mallit kuten MoGe-2 osoittavat merkittävää mittakaavan epäjohdonmukaisuutta etäisyyden vaihtelussa: arvioitu metrinen mittakaava lähialueen objekteille on uskottava – tässä tapauksessa, turistit ovat uskottavan korkeuden – mutta kaukaisen rakennelman mittakaava on dramaattisesti aliarvioitu – tässä tapauksessa, Arc de Triomphe -taustalla on metrisesti arvioitu vain 18,8 m leveä, mikä on yli 2-kertaa pienempi kuin todellinen leveys (44,8 m).

‘MoGe-2 on asettanut miniaturisoidun maamerkin, vaikka viittaukset ovat vastakkaisia.’

Kolmen voima

Kirjoittajien uusi kokoelma koostuu kolmesta olemassa olevasta tietojoukosta: MegaScenes, AerialMegaDepth ja Stereo4D:

Esimerkki kuvaa MegaScenesista, joka muodostaa osan uudesta kokoelmasta. Lähde - https://megascenes.github.io/

Esimerkki kuvaa MegaScenesista, joka muodostaa osan uudesta kokoelmasta. Lähde

Ongelma, joka liittyy tietojoukkoihin, jotka muodostavat MetricScenesin, kun ne otetaan yksin, on, että ne soveltuvat rajoitettuihin alueisiin, kuten autopilottikuvaa tai sisätiloja, kun taas yhdistetty alue on tarpeen ongelman ratkaisemiseksi ja näköjärjestelmien lähentämiseksi ihmisenkaltaiseen mittakaavan ymmärrykseen.

Jokainen kuva on saatettu RGB-kuvauksella, osittain havaittu syvyys, joka on johdettu Rakenteen liikkeestä (SfM), Moninäkökulmaisesta stereosta (MVS) tai muista geometrisista etuoletuksista, yhdessä valmiin syvyyden kartan kanssa, joka on generoitu kahden vaiheen Poisson-täydennysprosessin kautta, ja liittyvien kameratietojen kanssa.

Hienosäätö MoGe-2-kehyksessä uudella tietojoukolla ‘merkittävästi lievittää‘ mittakaavan romahdusta, jota kirjoittajat mainitsevat, ja saavuttaa paremmat tulokset avoimissa kohtauksissa ja huipputason suorituskyvyn liittyvissä mittauksissa.

Uusi tutkimus on nimeltään Honey, I Shrunk the Arc de Triomphe!, ja se tulee neljältä tutkijalta Cornellin yliopistosta ja Shanghain Jiao Tong -yliopistosta.

Menetelmä

MetricScenes perustuu osittain mainittuihin AerialMegaDepth ja MegaScenes -tietojoukkoihin – kaksi Internet-valokuvakokoelmaa, jotka kattavat historialliset arkistot, matkailukuvat ja ammattivalokuvauksen. Vaikka MegaScenes tarjoaa laajamittaisia SfM-rekonstruktioita, nämä kohtaukset puuttuvat todellisesta mittakaavasta. Tätä varten geotagitut kuvat online-karttapalveluista käytettiin rekonstruktioita vastaamaan tunnettuja fyysisiä sijainteja ja mittoja.

Toisaalta AerialMegaDepth sisältää jo geotagitut Google Earth -näkymät, jotka tarjoavat metrisen mittakaavan maamerkkirekonstruktioita.

Mahdolliset rekonstruktiovirheet, joita aiheuttivat visuaalisesti samankaltaiset mutta maantieteellisesti etäiset rakenteet, käsiteltiin MASt3R-SfM:n ja Doppelgangers++ -luokittelijan avulla. Moninäkökulmaisen stereorekonstruktio jälkeen, epävakaiden syvyyden arvioiden ja syvyyden vuotamisen poistettiin yhdistelmällä vakaus­tarkastuksia ja MoGe-2:n ennusteita:

AerialMegaDepth johdattaa todellisen mittakaavan yhdistämällä Internet-kuvia geotagituihin Google Earth -näkymiin, kun taas MegaScenesin kohtaukset on suunnattu vastaamaan fyysisiä mittoja käyttämällä georeferoidun kadunnäkymän kuvaa. Moninäkökulmaisen stereorekonstruktio jälkeen, epävakaiden syvyyden arvioiden ja syvyyden vuotamisen poistettiin, tuottaen puhdasemmat metrinen syvyyden kartat, jotka soveltuvat koulutukseen. Keltaiset ruudut korostavat väliaikaisia objekteja, jotka poistettiin prosessin aikana, kun taas punaiset ruudut osoittavat korjattuja syvyyden vuotamisalueita.

AerialMegaDepth johdattaa todellisen mittakaavan yhdistämällä Internet-kuvia geotagituihin Google Earth -näkymiin, kun taas MegaScenesin kohtaukset on suunnattu vastaamaan fyysisiä mittoja käyttämällä georeferoidun kadunnäkymän kuvaa. Moninäkökulmaisen stereorekonstruktio jälkeen, epävakaiden syvyyden arvioiden ja syvyyden vuotamisen poistettiin, tuottaen puhdasemmat metrinen syvyyden kartat, jotka soveltuvat koulutukseen. Keltaiset ruudut korostavat väliaikaisia objekteja, jotka poistettiin prosessin aikana, kun taas punaiset ruudut osoittavat korjattuja syvyyden vuotamisalueita.

Metrinen mittakaava palautettiin georeferoidun kuvan avulla. AerialMegaDepth sisältää jo mittakaavan, joka perustuu Google Earth -renderöintiin, jotka on otettu tunnetuista sijainneista, kun taas MegaScenes on suunnattu vastaamaan todellisiin mittoihin käyttämällä geotagitut kadunnäkymän kuvaa, jotka on saatu karttapalveluista.

Nämä kuvat on yhdistetty olemassa oleviin rekonstruktioihin MASt3R:llä, hienosäädetty Doppelganger-luokittelijalla, suunnattu COLMAP:lla ja mitattu RANSAC-pohjaisella arviointimenetelmällä, joka perustuu Maakeskeiseen, maakiinteään (ECEF) -koordinaatteihin. Kohtaukset, joissa mittakaava-arviot olivat epäluotettavia tai joilla oli huono rekisteröintilaatu, hylättiin.

Näkeminen stereona

MetricScenes-kokoelma perustuu myös edellä mainittuun Stereo4D-tietojoukkoon, joka sisältää tuhansia todellisen maailman stereoskooppisia videosekvenssejä, jotka on otettu VR180-kameroilla, tarjoten ajallisen ulottuvuuden näille:

Stereo4D-tietojoukko on rakennettu stereoskooppisista Internet-videoista, yhdistämällä kameran asennot, syvyyden arviot ja liiketrajektoria, jotta voidaan palauttaa dynaamisia 3D-kohtauksia mittakaavassa. Tuloksena oleva tietojoukko sisältää satoja tuhansia videosekvenssejä, jotka on esitetty piste-pilvina pitkän matkan liiketrajektoreilla, tarjoten suuren määrän todellisen maailman 3D-geometriaa ja liikettä näkömallien koulutukseen. Lähde - https://arxiv.org/pdf/2412.09621

Stereo4D-tietojoukko on rakennettu stereoskooppisista Internet-videoista, yhdistämällä kameran asennot, syvyyden arviot ja liiketrajektoria, jotta voidaan palauttaa dynaamisia 3D-kohtauksia mittakaavassa. Tuloksena oleva tietojoukko sisältää satoja tuhansia videosekvenssejä, jotka on esitetty piste-pilvina pitkän matkan liiketrajektoreilla, tarjoten suuren määrän todellisen maailman 3D-geometriaa ja liikettä näkömallien koulutukseen. Lähde

Koska fyysinen etäisyys kahden kameran linssien välillä vaihtelee eri laitteissa, vain videot, joissa on dokumentoitu kamerakonfiguraatio, otettiin käyttöön, jotta kohtauksen syvyys voitiin palauttaa oikeaan mittakaavaan.

Stereo4D perustui alun perin SEA-RAFT -optisen virtauksen järjestelmään syvyyden arvioimiseksi, mutta kirjoittajat totesivat, että epätäydellinen kamerakalibrointi voi vääristää rekonstruoituja kohtauksia, aiheuttaen rakenteiden, jotka pitäisi olla rinnakkaisia, konvergoimaan epäluonnollisesti. Siksi parantamaan tarkkuutta, he korvasivat tämän lähestymistavan moninäkökulmaisella rekonstruktio-pipelineilla, joka arvioi yhdessä kameran asennot ja syvyyden useista kehyksistä.

π³, DepthAnything V3 ja MapAnything vertailtu, ja π³ valittiin sen geometrisen luotettavuuden ja kyvyn säilyttää hienot yksityiskohdat:

Metrinen syvyyden palautus Stereo4D:stä. Standardi-stereosopimismenetelmät voivat tuottaa vääristyneen geometrian, kun kamerakalibrointi on epätäydellinen, kun taas π³ generoi johdonmukaisemman kohtauksen rekonstruktioita ja säilyttää hienot yksityiskohdat. Palautettu geometria on sitten suunnattu tunnetun fyysisen peruslinjan mukaan stereokamerasta, johtaen tarkasti mitattuihin metrisiin syvyyden kartoissa.

Metrinen syvyyden palautus Stereo4D:stä. Standardi-stereosopimismenetelmät voivat tuottaa vääristyneen geometrian, kun kamerakalibrointi on epätäydellinen, kun taas π³ generoi johdonmukaisemman kohtauksen rekonstruktioita ja säilyttää hienot yksityiskohdat. Palautettu geometria on sitten suunnattu tunnetun fyysisen peruslinjan mukaan stereokamerasta, johtaen tarkasti mitattuihin metrisiin syvyyden kartoissa.

Koska π³ rekonstruoii kohtaukset mielivaltaisessa mittakaavassa, tuloksena olevat syvyyden kartat on suunnattu vastaamaan todellisiin mittoihin käyttämällä tunnetun fyysistä peruslinjaa kustakin stereokamerasta. Lisäksi poistettiin alhaisen laadun kehykset, syvyyden epäjohdonmukaisuudet, kalibrointivirheet ja epäluotettavat mittakaava-arviot.

Lisäksi käytettiin kahden vaiheen syvyyden täydennysprosessia, joka yhdisti etualan ennusteet MoGe-2:sta taustan geometriasta Multi-View Stereosta (MVS), tuottaen puhdasemman metrinen syvyyden koulutusdatan, jossa on johdonmukkaisempi mittakaava ja terävemmät objektirajat:

Kahden vaiheen syvyyden täydennys. Käyttämällä vain taustan ankkureita voidaan säilyttää kohtauksen rakenne, mutta vääristää kokonaisen mittakaavan, kun taas yhdistämällä etu- ja taustarajoitteita yhdessä vaiheessa, aiheutuu mittakaavan liukuminen ja reuna-artefakteja. Kahden vaiheen lähestymistapa säilyttää johdonmukkaisen metrinen mittakaavan sekä lähellä oleville että kaukaisille objekteille, säilyttäen samalla puhdas objektirajat.

Kahden vaiheen syvyyden täydennys. Käyttämällä vain taustan ankkureita voidaan säilyttää kohtauksen rakenne, mutta vääristää kokonaisen mittakaavan, kun taas yhdistämällä etu- ja taustarajoitteita yhdessä vaiheessa, aiheutuu mittakaavan liukuminen ja reuna-artefakteja. Kahden vaiheen lähestymistapa säilyttää johdonmukkaisen metrinen mittakaavan sekä lähellä oleville että kaukaisille objekteille, säilyttäen samalla puhdas objektirajat.

Kirjoittajat totesivat, että Internet-kuvakokoelmat usein puuttuvat luotettavasta etualan syvyydestä, kun taas stereokuvat usein puuttuvat kaukaisista taustasta. Vaikka MoGe-2 voi johtaa tiheää geometriaa koko kohtauksessa, sen arviot taipuvat samaan mittakaavan romahdus -ongelmaan, jonka projekti pyrkii ratkaisemaan. Siksi kahden vaiheen syvyyden täydennysputki suunniteltiin yhdistämään MoGe-2:n ja Multi-View Stereon (MVS) vahvuudet.

Taustan geometria palautettiin MVS-johdannaisista ankkureista, luomalla perussyvyyden kartan, jossa on luotettava suurmittakaavan rakenne. Toisessa vaiheessa etualan arviot MoGe-2:sta otettiin uudelleen käyttöön reunatietoisen täydennysprosessin kautta, joka on suunniteltu säilyttämään objektirajat estäen mittakaavan liukuminen ja syvyyden vuotamisen artefakteja.

Syvyyden kartat, jotka tämä lähestymistapa tuottaa, tutkimus väittää, ovat sekä visuaalisesti täydellisiä että johdonmukkaisempia todellisessa mittakaavassa:

Kahden vaiheen syvyyden täydennysputki. Ensimmäisessä vaiheessa Multi-View Stereon (MVS) ankkureita käytetään taustan geometrian palauttamiseen luotettavassa metrisessä mittakaavassa. Toisessa vaiheessa etualan arviot MoGe-2:sta otetaan uudelleen käyttöön reunatietoisen kompositioprosessin kautta, tuottaen lopullisen syvyyden kartan, joka on suunniteltu säilyttämään sekä suuren mittakaavan tarkkuuden että terävät paikalliset yksityiskohdat.

Kahden vaiheen syvyyden täydennysputki. Ensimmäisessä vaiheessa Multi-View Stereon (MVS) ankkureita käytetään taustan geometrian palauttamiseen luotettavassa metrisessä mittakaavassa. Toisessa vaiheessa etualan arviot MoGe-2:sta otetaan uudelleen käyttöön reunatietoisen kompositioprosessin kautta, tuottaen lopullisen syvyyden kartan, joka on suunniteltu säilyttämään sekä suuren mittakaavan tarkkuuden että terävät paikalliset yksityiskohdat.

Data ja testit

Lopullinen MetricScenes-kokoelma koostuu 47 579:stä ainoastaan todellisen maailman kuvasta, jotka kattavat 134 kohtausta AerialMegaDepthistä; 29 583 kuvaa 356 kohtauksesta MegaScenesistä; ja 22 549 kehyksestä 1 725 videosta Stereo4D:stä.

Kokoelma, josta 10 kohtausta kunkin lähteen mukaan pidettiin takaisin validointina, kattaa sekä ulko- että sisätiloja, sekä maanpinnan- että ilmakuvia, sekä urbaaneja- että luonnonmaisemia – yhdistetty ja yhtenäinen konteksti, jota ei ole saatavilla yksittäisissä osallistuvissa kokoelmissa.

Alkuvaiheen laadullisessa testissä kirjoittajat hienosäätöivät MoGe-2:n ViT-Large-Normal -mallin uudella MetricScenes-tietojoukolla 10 000 iteroinnilla eräkoon 32 – tehokkaasti noin kolme epochia. Leikkaus ja yleinen datan muokkaus -lähestymistapa otettiin alkuperäisistä MoGe-2-testeistä, ja koulutus tapahtui oppien nopeudella 1×10-6 (rungo) ja 1×10-5 (kaikki muut parametrit). Laadullisessa testissä syvyyden rekonstruktio tehtiin hienosäätöityllä WildMoGe -mallilla, jota verrattiin alkuperäiseen MoGe-2:een; DepthAnything V3:een; Metric3Dv2:een; UniDepth v2:een; ja DepthPro:een:

Metrinen mittakaavan maamerkin rekonstruktio. Todelliset mittaukset Google Mapsista näkyvät vasemmalla sarakkeessa. Tuntemattomien maailmanlaajuisten maamerkkien yli WildMoGe tuottaa mittakaava-arvioita, jotka ovat lähempänä tunnettuja mittoja, kun taas MoGe-2, DepthAnything V3 ja Metric3D V2 usein aliarvioivat kaukaisen rakennelman koon – UniDepth V2 usein tuottaa uskottavampia mittakaavoja, mutta on epäjohdonmukainen, kun taas DepthPro toisinaan tuottaa vakavia mittakaavan virheitä.

Metrinen mittakaavan maamerkin rekonstruktio. Todelliset mittaukset Google Mapsista näkyvät vasemmalla sarakkeessa. Tuntemattomien maailmanlaajuisten maamerkkien yli WildMoGe tuottaa mittakaava-arvioita, jotka ovat lähempänä tunnettuja mittoja, kun taas MoGe-2, DepthAnything V3 ja Metric3D V2 usein aliarvioivat kaukaisen rakennelman koon – UniDepth V2 usein tuottaa uskottavampia mittakaavoja, mutta on epäjohdonmukainen, kun taas DepthPro toisinaan tuottaa vakavia mittakaavan virheitä.

Tästä tuloksesta tutkimus sanoo:

‘[WildMoGe] palauttaa johdonmukkaisesti tarkempia absoluuttisia mittakaavoja moninaisten maamerkkien yli, lähes vastaavat todelliset mittaukset (esim. 31,4 m vs. 32,4 m Philadelphian taidemuseolle, 46,7 m vs 46,5 m Piazza della Signorinalle). MoGe-2, DepthAnything v3 ja Metric3D v25 osoittavat mittakaavan romahdus-käyttäytymistä, joka aliarvioi jatkuvasti kaukaisen rakennelman koon.

‘UniDepth v2 tuottaa enemmän realistisia mittakaavoja, mutta poikkeaa edelleen todellisista mittauksista, ja DepthPro usein epäonnistuu palauttamaan absoluuttisen mittakaavan, tuottaen tuloksia, jotka ovat useita kertoja pienempiä kuin todellisuus. Huomaa, että nämä kohtaukset puuttuvat koulutusjoukosta.

‘Tämä suorituskyky osoittaa, että WildMoGe voi yleistyä näkemättömiin sisältöihin, eikä vain muista koulutuskohtauksia.’

Jotta varmistettaisiin, että parannukset eivät rajoittuisi pelkästään maamerkkeihin ja suuriin ulkoilmakohtauksiin, kirjoittajat arvioivat myös WildMoGe:ä tavallisilla sisä- ja kadun tasolla olevilla kuvilla, joissa se tuotti mittakaava-arvioita, jotka olivat laajalti yhdenmukaisia MoGe-2:n kanssa, saavuttaen suuremman tarkkuuden ETH3D -pihan kohtauksella:

Vertailu standardikohtauksilla. Tavallisilla sisä- ja kadun tasolla olevilla ympäristöillä WildMoGe tuottaa mittakaava-arvioita, jotka ovat laajalti yhdenmukaisia MoGe-2:n kanssa, saavuttaen suuremman tarkkuuden ETH3D-piha-benchmarkilla, palauttaen objektien mitat, jotka ovat lähempänä todellisia mittauksia.

Vertailu standardikohtauksilla. Tavallisilla sisä- ja kadun tasolla olevilla ympäristöillä WildMoGe tuottaa mittakaava-arvioita, jotka ovat laajalti yhdenmukaisia MoGe-2:n kanssa, saavuttaen suuremman tarkkuuden ETH3D-piha-benchmarkilla, palauttaen objektien mitat, jotka ovat lähempänä todellisia mittauksia.

Arvioinnissa WildMoGe paransi merkittävästi metrinen mittakaavan ennustetta MetricScenes-testijoukossa, ylittäen MoGe-2:n kaikissa ilmoitetuissa mittareissa ja saavuttaen vahvemman metrinen geometrian ja metrinen syvyyden pisteet kuin MoGe-2, DepthAnything V3, Metric3D V2, UniDepth V2 ja DepthPro.

Suorituskyky NYUv2:ssä, KITTI:ssä, ETH3D:ssä, iBims-1:ssä, GSO:ssa, Sintel:ssä, DDAD:ssa, DIODE:ssa, Spring:ssä ja HAMMER:ssa pysyi laajalti verrattavissa MoGe-2:een. Kirjoittajat attribuoivat nämä parannukset MetricScenesin metrinen valvontaan, joka näyttää vähentävän mittakaavan romahdusta säilyttäen yleisen kohtauksen rekonstruktio-suorituskyvyn.

Vertailut tehtiin MoGe-2:een, UniDepth V2:een, DepthPro:hin, MASt3R:ään, Depth Anything V2:een, Depth Anything V3:een, ZoeDepth:iin ja Metric3D V2:een:

Määrällinen arviointi suhteellista ja metriä geometriaa. MetricScenes-testijoukossa WildMoGe ylitti MoGe-2:n kaikissa ilmoitetuissa mittareissa ja pysyi laajalti kilpailukykyisenä ZoeDepthin, Metric3D V2:n, Depth Anything V2:n, Depth Anything V3:n, MASt3R:n, UniDepth V2:n ja DepthPro:n kanssa vakiintuneilla mittareilla, osoittaen, että parannettu metrinen mittakaavan arviointi saavutettiin ilman yleisen geometrian rekonstruktio-laadun uhraamista.

Määrällinen arviointi suhteellista ja metriä geometriaa. MetricScenes-testijoukossa WildMoGe ylitti MoGe-2:n kaikissa ilmoitetuissa mittareissa ja pysyi laajalti kilpailukykyisenä ZoeDepthin, Metric3D V2:n, Depth Anything V2:n, Depth Anything V3:n, MASt3R:n, UniDepth V2:n ja DepthPro:n kanssa vakiintuneilla mittareilla, osoittaen, että parannettu metrinen mittakaavan arviointi saavutettiin ilman yleisen geometrian rekonstruktio-laadun uhraamista.

WildMoGe paransi merkittävästi metrinen mittakaavan ennustetta MetricScenes-testijoukossa, ylittäen MoGe-2:n kaikissa ilmoitetuissa mittareissa ja saavuttaen vahvemman metrinen geometrian ja metrinen syvyyden pisteet kuin MoGe-2, DepthAnything V3, Metric3D V2, UniDepth V2 ja DepthPro.

Suorituskyky NYUv2:ssa, KITTI:ssä, ETH3D:ssä, iBims-1:ssä, GSO:ssa, Sintel:ssä, DDAD:ssa, DIODE:ssa, Spring:ssä ja HAMMER:ssa pysyi laajalti verrattavissa MoGe-2:een. Kirjoittajat attribuoivat nämä parannukset MetricScenesin metrinen valvontaan, joka näyttää vähentävän mittakaavan romahdusta säilyttäen yleisen kohtauksen rekonstruktio-suorituskyvyn.

Johtopäätös

MetricScenes-ratkaisu “mittakaavan romahdukseen” näyttää melko Heath-Robinsonin kaltaiselta, tutkimuksessa – yhdistelmä useista tietojoukoista, joista kullakin on arvokas näkökulma. Se näyttää hieman yrittävän määrittää elefantin muodon koskettelemalla.

Luultavasti tärkein palvelu, jonka tutkimus tarjoaa, on se, että se herättää enemmän huomiota tähän ongelmaan, joka näyttää vaativan jonkinlaista uutta tai sovitettua yleistä standardia. Kuitenkin, sellaisen innovaation, joka keskeyttäisi nykyisten menetelmien toistettavuuden ja johdonmukaisuuden, pitäisi olla erittäin vakuuttava.

 

* Minun muunnos kirjoittajien sisäisistä viittauksista hyperlinkkeihin.

Julkaistu ensimmäisen kerran torstaina 11. kesäkuuta 2026

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai