AI-mallit ja alustat
Sapiens: Läpimurto ihmisen näkömallien kehittämisessä
Suuren mittakaavan esikoulutuksen ja tehtävikohtaisen hienosäätelyn menetelmä on vakiintunut kielen mallinnuksessa. Samoin tietokoneen näkömenetelmät omaksuvat vähitellen laajat aineistot esikoulutukseen. Suurten aineistojen, kuten LAION5B, Instagram-3.5B, JFT-300M, LVD142M, Visual Genome ja YFCC100M, ilmestyminen on mahdollistanut aineiston tutkimisen perinteisten vertailujen ulottuvilla. Merkittäviä töitä tässä alassa ovat DINOv2, MAWS ja AIM. DINOv2 saavuttaa huipputason suorituskyvyn itsesäätelevien ominaisuuksien luomisessa skaalaamalla kontrastiivisen iBot-menetelmän LDV-142M-aineistolla. MAWS tutkii mask-automaattisen koodarin (MAE) skaalaamista miljardien kuvien kanssa. AIM tutkii visuaalisen esikoulutuksen skaalautuvuutta BERT:n kaltaisten visiotransformatorien kanssa. Toisin kuin nämä menetelmät, jotka keskittyvät pääasiassa yleiseen kuvien esikoulutukseen tai nollasuorituksisen kuvien luokitteluun, Sapiens noudattaa erityisesti ihmiskeskeistä lähestymistapaa: Sapiens-mallit hyödyntävät laajan ihmiskuvien kokoelmaa esikoulutukseen ja lopulliseen säätöön useilla ihmiseen liittyvillä tehtävillä.
Merkittäviä edistysaskelia on tehty hallituissa tai studioympäristöissä, mutta haasteita on edelleen laajentaa näitä menetelmiä rajoittamattomiin ympäristöihin. Näiden haasteiden ratkaisemiseksi on tärkeää kehittää monipuolisia malleja, jotka pystyvät useisiin perustaviin tehtäviin, kuten avainpistekohtien arvioimiseen, ruumiinosien segmentointiin, syvyyden arvioimiseen ja pinnanormaalin ennustamiseen kuvista luonnollisissa olosuhteissa. Tässä työssä Sapiens pyrkii kehittämään malleja näille olennaisille ihmisen näkötehtäville, jotka yleistyvät villiin. Tällä hetkellä suurimmat julkisesti saatavilla olevat kielen mallit sisältävät yli 100 miljardia parametriä, kun taas yleisimmin käytetyt kielen mallit sisältävät noin 7 miljardia parametriä. Sen sijaan visiotransformatorit (ViT), jotka jakavat saman arkkitehtuurin, eivät ole onnistuneet skaalautumaan tämän verran. Vaikka on olemassa mainittavia pyrkimyksiä tässä suunnassa, mukaan lukien tiheän ViT-4B:n kehittäminen, joka on koulutettu sekä tekstille että kuville, ja menetelmien kehittäminen vakaan koulutukseen ViT-22B:lle, yleisimmin käytetyt visiotransformatorit ovat edelleen 300-600 miljoonan parametrin välillä ja ne on pääasiassa esikoulutettu noin 224 pikselin kuvaresoluutiolla. Samoin olemassa olevat transformer-pohjaiset kuvien luomismallit, kuten DiT, käyttävät alle 700 miljoonaa parametriä ja toimivat erittäin tiiviissä latenttiavaruudessa. Tässä kuussa Sapiens esittelee kokoelman suuria, korkearesoluutioisia ViT-malleja, jotka on esikoulutettu alkuperäisesti 1024 pikselin kuvaresoluutiolla miljoonilla ihmiskuvilla.
Sapiens esittää malliperheen neljälle perustavalle ihmiskeskeiselle näkötehtäville: 2D-asennusarvio, ruumiinosien segmentointi, syvyyden arvio ja pinnanormaalin ennustaminen. Sapiens-mallit tukevat luonnostaan 1K:n korkearesoluutioista suoritusta ja ovat erittäin helppoja sovittaa yksittäisiin tehtäviin vain hienosäätämällä malleja, jotka on esikoulutettu yli 300 miljoonalla villissä ihmiskuvalla. Sapiens huomauttaa, että samalla laskentaresurssilla itseohjautuva esikoulutus valikoituneella ihmiskuvien aineistolla parantaa merkittävästi suorituskykyä monissa ihmiskeskeisissä tehtävissä. Tuloksena olevat mallit osoittavat huomattavaa yleistymistä villiin aineistoihin, jopa silloin, kun merkitty aineisto on niukkaa tai täysin syntetistä. Yksinkertainen mallin suunnittelu tuo myös skaalautuvuuden – mallin suorituskyky tehtävien yli paranee, kun parametriiden määrä skaalautuu 0,3 miljardista 2 miljardiin. Sapiens ylittää jatkuvasti olemassa olevat vertailuarvot useilla ihmiskeskeisillä vertailuaineistoilla, saavuttaen merkittäviä parannuksia aiempiin huipputuloksiin: 7,6 mAP Humans-5K:lla (asento), 17,1 mIoU Humans-2K:lla (ruumiinosat), 22,4 prosentin suhteellinen RMSE Hi4D:llä (syvyys) ja 53,5 prosentin suhteellinen kulmaVirhe THuman2:lla (normaali).
Sapiens: Läpimurto ihmisen näkömallien kehittämisessä
Viime vuosina on tehty merkittäviä edistysaskelia fotorealististen ihmisten luomisessa 2D- ja 3D-muodossa. Näiden menetelmien menestys voidaan palauttaa vahvaan arviointiin erilaisia varusteita, kuten 2D-avainpisteitä, hienojakoista ruumiinosien segmentointia, syvyyttä ja pinnanormaaleja. Kuitenkin vahvan ja tarkan arvioinnin näistä varusteista on edelleen aktiivinen tutkimusalue, ja monimutkaiset järjestelmät parantamaan suorituskykyä yksittäisissä tehtävissä usein estävät laajempaa soveltamista. Lisäksi saada tarkkaa ground truth -merkintää villissä on erittäin vaikeaa skaalata. Sapiensin tavoitteena on tarjota yhtenäinen kehys ja mallit näiden varusteiden arvioimiseksi villissä, avaamalla laajan valikoiman ihmiskeskeisiä sovelluksia kaikille.
Sapiens väittää, että tällaiset ihmiskeskeiset mallit tulisi täyttää kolme kriteeriä: yleistyminen, laaja soveltuvuus ja korkea uskottavuus. Yleistyminen takaa mallin luotettavuuden näkymättömiin olosuhteisiin, mahdollistaen mallin toimimisen johdonmukaisesti erilaisissa ympäristöissä. Laaja soveltuvuus osoittaa mallin monipuolisuutta, tehden siitä soveltuvan laajaan valikoimaan tehtäviin vähäisin muutoksin. Korkea uskottavuus tarkoittaa mallin kykyä tuottaa tarkkaa, korkearesoluutioista tulostetta, joka on välttämätöntä uskollisen ihmisen luomistehtäville. Tämä artikkeli kertoo mallien kehittämisestä, jotka henkilöivät nämä ominaisuudet, yhteisesti kutsutaan Sapiensiksi.
Seurauksena Sapiens hyödyntää suuria aineistoja ja skaalautuvia mallirakenteita, jotka ovat avainasemassa yleistymisessä. Laajemman soveltuvuuden vuoksi Sapiens omaksuu esikoulutus-jälkikoulutus-lähestymistavan, mahdollistaen jälkikoulutuksen sopeuttamisen tiettyihin tehtäviin vähäisin muutoksin. Tämä lähestymistapa herättää kriittisen kysymyksen: Mikä tyyppi aineistoa on tehokkain esikoulutukseen? Laskentaresurssien rajoitusten vuoksi tulisi painottaa joko mahdollisimman suuren ihmiskuvien keräämistä vai esikoulutusta vähemmän valikoituneella aineistolla paremman maailman vaihtelun heijastamiseksi. Olemassa olevat menetelmät usein ohittavat esikoulutusaineiston jakautumisen tehtävien kontekstissa. Tutkiakseen esikoulutusaineiston jakautumisen vaikutusta ihmiskohtaisiin tehtäviin, Sapiens kerää Humans-300M-aineiston, joka sisältää 300 miljoonaa monipuolista ihmiskuvaa. Nämä merkinnättömät kuvat käytetään perustamaan visiotransformatoriperhe alkusta alkaen, parametriiden määrä vaihtelee 300 miljoonasta 2 miljardiin.
Eri itseohjautuvien menetelmien joukosta yleisten visuaalisten ominaisuuksien oppimiseksi suurista aineistoista Sapiens valitsee mask-automaattisen koodarin (MAE) lähestymistavan sen yksinkertaisuuden ja tehokkuuden vuoksi esikoulutuksessa. MAE, jolla on yksisuuntainen inference-malli verrattuna kontrastiseen tai monisuuntaiseen strategiaan, sallii suuremman kuvamäärän prosessoinnin samojen laskentaresurssien kanssa. Korkeamman uskottavuuden vuoksi, toisin kuin aiemmat menetelmät, Sapiens lisää esikoulutuksen alkuperäisen kuvaresoluution 1024 pikseliin, mikä johtaa noin 4-kertaiseen FLOPs-kasvuun verrattuna suurimpaan olemassa olevaan visiotransformatorirunkoon. Jokainen malli on esikoulutettu 1,2 biljoonalla tokenilla. Ihmiskeskeisten tehtävien jälkikoulutukseen Sapiens käyttää yhdenmukaisen koodarin-dekoodarin arkkitehtuuria. Koodari on alustettu esikoulutuksen painoilla, kun taas dekoodari, kevyt ja tehtäväkohtainen pää, on alustettu satunnaisesti. Molemmat komponentit ovat sitten jälkikoulutettu loppuun asti. Sapiens keskittyy neljään keskeiseen tehtävään: 2D-asennusarvio, ruumiinosien segmentointi, syvyys ja normaalin ennustaminen, kuten seuraavassa kuvassa näkyy.

Yhdenmukaisesti aiempien tutkimusten kanssa Sapiens vahvistaa merkittävän vaikutuksen merkintöjen laadussa mallin suorituskykyyn villissä. Julkiset vertailuaineistot sisältävät usein melkoista meteliä, tarjoten epäjohdonmukaisia ohjaussignaaleja mallin jälkikoulutuksen aikana. Samalla on tärkeää hyödyntää hienojakoisia ja tarkkoja merkintöjä, jotka ovat lähellä Sapiensin päämäärää 3D-ihmisen digitalisoinnissa. Tähän tarkoitukseen Sapiens ehdottaa olennaisesti tiheämpää joukkoa 2D-kehon avainpisteitä asennusarviointiin ja yksityiskohtaista luokka-sanastoa ruumiinosien segmentointiin, joka ylittää aiempien aineistojen laajuuden. Nimenomaan Sapiens esittelee kattavan kokoelman 308 avainpistettä, jotka kattavat kehon, kädet, jalat, pinnan ja kasvon. Lisäksi Sapiens laajentaa segmentoinnin luokka-sanastoa 28 luokkaan, kattaen ruumiinosia kuten hiukset, kieli, hampaat, ylempi/alaleuka ja vartalo. Taataksesi merkintöjen laadun ja johdonmukaisuuden sekä korkean asteisen automaation, Sapiens käyttää moninäkökulmaista kaappausta asennus- ja segmentointimerkintöjen keräämiseen. Sapiens käyttää myös ihmiskeskeistä syntetistä aineistoa syvyyden ja normaalin arvioimiseen, hyödyntäen 600 yksityiskohtaista skannausta RenderPeopleltä korkearesoluutioisien syvyyden karttojen ja pinnanormaalien luomiseen. Sapiens osoittaa, että alaan erikoistuneen suuren mittakaavan esikoulutuksen ja rajoitetusti korkealaatuisen merkintöjen yhdistelmä johtaa vahvaan villiin yleistymiseen.

Sapiens: Menetelmä ja Arkkitehtuuri
Sapiens noudattaa mask-automaattisen koodarin (MAE) lähestymistapaa esikoulutuksessa. Malli on koulutettu rekonstruoimaan alkuperäinen ihmiskuva sen osittaisen havainnon perusteella. Kaikkien autoencoderien tapaan Sapiensin malli koostuu koodarista, joka kartuttaa näkyvän kuvan latenttirepresentaatioon, ja dekoodarista, joka rekonstruoii alkuperäisen kuvan tästä latenttirepresentaatiosta. Esikoulutusaineisto koostuu sekä yksittäisistä että monista ihmiskuvista, joista jokainen on muunnettu kiinteään kokoon neliön muodossa. Samoin kuin ViT, kuva on jaettu säännöllisiin, päällekkäisyyttä sisältämättömiin palasiin kiinteällä palasikoolla. Osa näistä paloista on valittu satunnaisesti ja maskattu, jättäen loput näkyviksi. Maskattujen palasten ja näkyvien palasten suhde, tunnettu maskausuhauksena, säilyy kiinteänä koulutuksen aikana.
Sapiensin mallit osoittavat yleistymistä monien kuvien ominaisuuksien yli, mukaan lukien skaalat, leikkaukset, ikä ja etnisyys kohteita ja kohteiden määrä. Jokainen palastoken mallissa vastaa 0,02 % kuvan pinta-alasta verrattuna 0,4 %:iin standardi-ViTeissä, mikä on 16-kertainen vähennys – tarjoamalla hienojakoinen inter-token päättely mallille. Jopa 95 %:n maskausuhauksella Sapiensin malli saavuttaa uskottavan rekonstruktio ihmisen anatomiaa pidätetyillä näytteillä. Sapiensin esikoulutetun mallin rekonstruktio näkymättömillä ihmiskuvilla on esitetty seuraavassa kuvassa.

Lisäksi Sapiens käyttää suurta omistuksessa olevaa aineistoa esikoulutukseen, joka koostuu noin miljardista villissä kuvasta, keskittyen yksinomaan ihmiskuvien. Esikäsittely sisältää kuvien poistamisen, joissa on vesileimat, teksti, taiteelliset esitykset tai epäluonnolliset elementit. Sapiens käyttää sitten valmiina olevaa henkilön rajauskenttäilmaisinta suodattamaan kuvat, säilyttäen ne, joilla on havaintoarvo yli 0,9 ja rajauskenttäulottuvuudet ylittävät 300 pikseliä. Yli 248 miljoonaa kuvaa aineistossa sisältää useita kohteita.
2D-asennusarvio
Sapiensin kehys hienosäätää koodarin ja dekoodarin useilla luurangoilla, mukaan lukien K = 17 [67], K = 133 [55] ja uusi yksityiskohtainen luuranko, K = 308, kuten seuraavassa kuvassa näkyy.

Vertailuun aiempiin formaatteihin, joissa on enintään 68 kasvojen avainpistettä, Sapiensin merkinnät koostuvat 243 kasvojen avainpisteistä, mukaan lukien edustavat pisteet silmien, huulten, nenän ja korvien ympärillä. Tämä suunnittelu on suunniteltu pyrkimään tarkasti kaappaamaan kasvoilmeiden hienot yksityiskohdat todellisessa maailmassa. Nämä avainpisteiden avulla Sapiensin kehys on manuaalisesti merkitty 1 miljoonalle kuvalle 4K-resoluutiolla sisäisestä kaappausympäristöstä. Samoin kuin aiemmissa tehtävissä, asetamme dekoodarin ulostulukanavat normaaliarvioijalle N olevan 3, vastaavan xyz-komponenttien normivektoria jokaisessa pikselissä. Syntetisoidut tiedot käytetään myös ohjaamiseen pinnanormaalin arvioinnissa.

Sapiens: Koe ja Tulokset
Sapiens-2B on esikoulutettu 1024 A100 GPU:lla 18 päivää PyTorchilla. Sapiens käyttää AdamW-optimointia kaikissa kokeissa. Oppimisjärjestelmä sisältää lyhyen lineaarisen lämmittelyn, seurattuna kosininennustuksella esikoulutuksessa ja lineaarisella vaimennuksella hienosäätössä. Kaikki mallit on esikoulutettu alusta alkaen 1024 x 1024 resoluutiolla ja 16 pikselin palasikoko. Hienosäätössä syötekuva on muunnettu 4:3-suhteeseen, eli 1024 x 768. Sapiens soveltaa standardiaugmentaatioita, kuten leikkausta, skaalausta, kääntämistä ja valokuvallista vääristymää. Satunnainen tausta ei-ihmiskuvista COCO:sta lisätään segmentointi-, syvyyden ja normaalinennustustehtäviin. Olennaisesti Sapiens käyttää eri oppimisnopeuksia yleistymisen säilyttämiseksi, alemmilla kerroksilla alempia oppimisnopeuksia ja seuraavilla kerroksilla suurempia nopeuksia. Kerroksikohtainen oppimisnopeuden pieneneminen on asetettu 0,85:een ja painojen pieneneminen 0,1:een koodarille.
Sapiensin suunnitteluparametrit on yksityiskohtaisesti lueteltu seuraavassa taulukossa. Noudattaen tiettyä lähestymistapaa Sapiens priorisoi mallien skaalautumista leveyden suhteen syvyyden sijaan. Huomionarvoista on, että Sapiens-0,3B-malli, joka on arkkitehtuuriltaan samanlainen kuin perinteinen ViT-Large, sisältää kaksikymmenkertaista enemmän FLOPsia korkeamman resoluutionsa ansiosta.

Sapiens on hienosäätelty kasvojen, kehon, jalkojen ja käden (K = 308) asennusarviointiin korkealaatuisilla merkinnöillä. Koulutuksessa Sapiens käyttää koulutusjoukkoa, joka sisältää 1 miljoonaa kuvaa, ja arviointiin se käyttää testijoukkoa, joka on nimeltään Humans5K, ja siinä on 5 000 kuvaa. Arviointi noudattaa top-down-lähestymistapaa, jossa Sapiens käyttää valmiina olevaa havaintodetektoria rajauskenttien havaitsemiseen ja suorittaa yhden ihmisen asennusarvion. Taulukko 3 esittää vertailun Sapiens-malleja olemassa olevien menetelmien kanssa kehon asennusarvioinnissa. Kaikki menetelmät on arvioitu 114 yhteisellä avainpisteellä Sapiensin 308 avainpisteen sanastossa ja COCO-WholeBodyn 133 avainpisteen sanastossa. Sapiens-0,6B ylittää nykyisen huipputason, DWPose-L:n, +2,8 AP:lla. Toisin kuin DWPose, joka käyttää monimutkaisen opettaja-opetusmenetelmää, jossa on ominaisuus tiivistys tehtävään, Sapiens noudattaa yleistä koodari-dekoodari-arkkitehtuuria suurella ihmiskeskeisellä esikoulutuksella.
Mielenkiintoisesti, jopa samalla parametrin määrällä Sapiens-mallit osoittavat parempaa suorituskykyä verrattuna vastaaviin. Esimerkiksi Sapiens-0,3B ylittää VitPose+-L:n +5,6 AP:lla, ja Sapiens-0,6B ylittää VitPose+-H:n +7,9 AP:lla. Sapiensin perheen sisällä tulokset osoittavat suoran korrelaation mallin koosta ja suorituskyvystä. Sapiens-2B asettaa uuden huipputason 61,1 AP:lla, mikä on merkittävä parannus +7,6 AP edelliseen huipputulokseen. Vaikka se on hienosäätelty merkinnöillä sisäisestä kaappausstudion, Sapiens osoittaa vahvan yleistymisen todellisiin maailman tilanteisiin, kuten seuraavassa kuvassa näkyy.

Sapiens on hienosäätelty ja arvioitu 28 luokan segmentointisanastolla. Koulutusjoukko koostuu 100 000 kuvasta, kun taas testijoukko, Humans-2K, koostuu 2 000 kuvasta. Sapiens on vertailtu olemassa oleviin ruumiinosien segmentointimenetelmiin, jotka on hienosäätelty samalla koulutusjoukolla ja käyttäen ehdotettuja esikoulutettuja tarkistuspisteitä kunkin menetelmän aloittamiseen. Samoin kuin asennusarvioinnissa, Sapiens osoittaa yleistymistä segmentoinnissa, kuten seuraavassa taulukossa näkyy.

Mielenkiintoisesti, pienin malli, Sapiens-0,3B, ylittää nykyisen huipputason segmentointimenetelmät, kuten Mask2Former ja DeepLabV3+, 12,6 mIoU:lla korkeamman resoluutionsa ja suuren ihmiskeskeisen esikoulutuksensa ansiosta. Lisäksi mallin kokoonpanon kasvattaminen parantaa edelleen segmentointisuorituskykyä. Sapiens-2B saavuttaa parhaimman suorituskyvyn 81,2 mIoU:lla ja 89,4 mAcc:lla testijoukossa, ja seuraavassa kuvassa näkyy laadukkaat tulokset Sapiens-malleista.

Johtopäätös
Sapiens edustaa merkittävää askelta ihmiskeskeisten näkömallien kehittämisessä perusmallien alueelle. Sapiens-mallit osoittavat vahvaa yleistymiskykyä monissa ihmiskeskeisissä tehtävissä. Huipputason suorituskyky voidaan attribuoida seuraaviin tekijöihin: (i) suuren mittakaavan esikoulutus kuratoiduilla aineistoilla, jotka on suunniteltu ymmärtämään ihmisiä, (ii) skaalattujen korkearesoluutioisten ja suurikapasiteettisten visiotransformatorirunkojen, ja (iii) korkealaatuiset merkinnät studio- ja syntetisoiduilla aineistoilla. Sapiens-mallit voivat muodostua tärkeäksi rakennuspalikaksi monille alimmaisille tehtäville ja tarjota pääsyn korkealaatuisiin visiorunkoihin merkittävästi laajemmalle yhteisölle.












