AI-modeller och plattformar
Sapiens: Genombrott inom MÃĪnskliga Visionmodeller
Den anmÃĪrkningsvÃĪrda framgÃĨngen med storskalig fÃķrtrÃĪning fÃķljt av uppgiftsspecifik finjustering fÃķr sprÃĨkmodellering har etablerat denna metod som en standardpraxis. PÃĨ liknande sÃĪtt har datorseende metoder successivt bÃķrjat omfamna omfattande datasÃĪtt fÃķr fÃķrtrÃĪning. Uppkomsten av stora datasamlingar, sÃĨsom LAION5B, Instagram-3,5B, JFT-300M, LVD142M, Visual Genome och YFCC100M, har mÃķjliggjort utforskning av en datakorpus lÃĨngt bortom omfattningen av traditionella benchmarkningar. FramtrÃĪdande arbete inom detta omrÃĨde inkluderar DINOv2, MAWS och AIM. DINOv2 uppnÃĨr toppprestation i generering av sjÃĪlvstÃĪndiga funktioner genom att skala upp kontrastiv iBot-metod pÃĨ LDV-142M-datasamlingen. MAWS studerar skalningen av maskerade autoencoders (MAE) pÃĨ miljarder bilder. AIM utforskar skalbarheten av autoregressiv visuell fÃķrtrÃĪning liknande BERT fÃķr visionstransformatorer. I kontrast till dessa metoder, som frÃĪmst fokuserar pÃĨ allmÃĪn bildfÃķrtrÃĪning eller nollskottsbildklassificering, tar Sapiens en tydligt mÃĪnniskocentrerad ansats: Sapiens modeller utnyttjar en omfattande samling av mÃĪnskliga bilder fÃķr fÃķrtrÃĪning, och finjusterar sedan fÃķr en rad mÃĪnskliga uppgifter. Jakten pÃĨ storskalig 3D-mÃĪnsklig digitalisering fÃķrblir ett avgÃķrande mÃĨl inom datorseende.
Betydande framsteg har gjorts inom kontrollerade eller studio-miljÃķer, men utmaningar kvarstÃĨr i att utÃķka dessa metoder till oberoende miljÃķer. FÃķr att tackla dessa utmaningar ÃĪr det avgÃķrande att utveckla flexibla modeller som kan hantera flera grundlÃĪggande uppgifter, sÃĨsom nyckelpunktsestimering, kroppsdelssgmentering, djupestimering och ytnormalprediktion frÃĨn bilder i naturliga miljÃķer. I detta arbete syftar Sapiens till att utveckla modeller fÃķr dessa essentiella mÃĪnskliga visionuppgifter som generaliserar till vilda miljÃķer. FÃķr nÃĪrvarande innehÃĨller de stÃķrsta offentligt tillgÃĪngliga sprÃĨkmodellerna Ãķver 100 miljarder parametrar, medan de mer vanligt anvÃĪnda sprÃĨkmodellerna innehÃĨller runt 7 miljarder parametrar. I kontrast har Visionstransformatorer (ViT), trots att de delar en liknande arkitektur, inte skalats upp till denna omfattning pÃĨ ett lyckat sÃĪtt. Medan det finns anmÃĪrkningsvÃĪrda fÃķretag i denna riktning, inklusive utvecklingen av en tÃĪt ViT-4B som trÃĪnats pÃĨ bÃĨde text och bilder, och formuleringen av tekniker fÃķr stabil trÃĪnings av en ViT-22B, anvÃĪnds vanligtvis visionsskelett mellan 300M till 600M parametrar och ÃĪr frÃĪmst fÃķrtrÃĪnade vid en bildupplÃķsning pÃĨ cirka 224 pixlar. PÃĨ liknande sÃĪtt anvÃĪnder befintliga transformerbaserade bildgenereringsmodeller, sÃĨsom DiT, mindre ÃĪn 700M parametrar och opererar pÃĨ ett hÃķgt komprimerat latentspace. FÃķr att tackla detta gap introducerar Sapiens en samling av stora, hÃķgupplÃķsta ViT-modeller som fÃķrtrÃĪnas ursprungligen vid en 1024-pixel bildupplÃķsning pÃĨ miljontals mÃĪnskliga bilder.
Sapiens presenterar en familj av modeller fÃķr fyra grundlÃĪggande mÃĪnskliga visionuppgifter: 2D-posestimering, kroppsdelssgmentering, djupestimering och ytnormalprediktion. Sapiens-modeller stÃķder nativt 1K hÃķgupplÃķst inferens och ÃĪr extremt lÃĪtta att anpassa fÃķr enskilda uppgifter genom att enkelt finjustera modeller som fÃķrtrÃĪnats pÃĨ Ãķver 300 miljoner vilda mÃĪnskliga bilder. Sapiens observerar att, givet samma berÃĪkningsbudget, sjÃĪlvstÃĪndig fÃķrtrÃĪning pÃĨ en kuraterad datasamling av mÃĪnskliga bilder signifikant fÃķrbÃĪttrar prestanda fÃķr en diversifierad uppsÃĪttning mÃĪnskliga uppgifter. De resulterande modellerna visar anmÃĪrkningsvÃĪrd generalisering till vilda data, ÃĪven nÃĪr mÃĪrkt data ÃĪr knapp eller helt syntetisk. Den enkla modellkonstruktionen medfÃķr ocksÃĨ skalbarhet â modellprestanda Ãķver uppgifter fÃķrbÃĪttras nÃĪr antalet parametrar skalas frÃĨn 0,3 till 2 miljarder. Sapiens ÃķvertrÃĪffar konsekvent befintliga baslinjer Ãķver olika mÃĪnskliga benchmarkningar, och uppnÃĨr signifikanta fÃķrbÃĪttringar jÃĪmfÃķrt med tidigare toppprestationsresultat: 7,6 mAP pÃĨ Humans-5K (pose), 17,1 mIoU pÃĨ Humans-2K (part-seg), 22,4% relativ RMSE pÃĨ Hi4D (djup), och 53,5% relativ vinkelavvikelse pÃĨ THuman2 (normal).
Sapiens: Genombrott inom MÃĪnskliga Visionmodeller
De senaste ÃĨren har sett anmÃĪrkningsvÃĪrda steg mot att generera fotorealistiska mÃĪnniskor i 2D och 3D. FramgÃĨngen fÃķr dessa metoder tillskrivs i stor utstrÃĪckning den robusta estimeringen av olika tillgÃĨngar som 2D-nyckelpunkter, finmaskig kroppsdelssgmentering, djup och ytnormaler. Men robust och exakt estimering av dessa tillgÃĨngar fÃķrblir ett aktivt forskningsomrÃĨde, och komplicerade system fÃķr att fÃķrbÃĪttra prestanda fÃķr enskilda uppgifter hindrar ofta en bredare tillÃĪmpning. Dessutom ÃĪr det svÃĨrt att erhÃĨlla exakt grundtruth-annotation i vilda miljÃķer. Sapiens mÃĨl ÃĪr att tillhandahÃĨlla en enhetlig ram och modeller fÃķr att hÃĪrleda dessa tillgÃĨngar i vilda miljÃķer, och dÃĪrmed lÃĨsa upp en rad mÃĪnskliga tillÃĪmpningar fÃķr alla.
Sapiens hÃĪvdar att sÃĨdana mÃĪnskliga modeller bÃķr uppfylla tre kriterier: generalisering, bred tillÃĪmpbarhet och hÃķg trohet. Generalisering sÃĪkerstÃĪller robusthet mot osedda fÃķrhÃĨllanden, vilket mÃķjliggÃķr fÃķr modellen att prestera konsekvent Ãķver varierande miljÃķer. Bred tillÃĪmpbarhet indikerar modellens flexibilitet, vilket gÃķr den lÃĪmplig fÃķr en rad uppgifter med minimala justeringar. HÃķg trohet betecknar modellens fÃķrmÃĨga att producera precisa, hÃķgupplÃķsta utdata, vilket ÃĪr avgÃķrande fÃķr trogna mÃĪnskliga generationuppgifter. Denna artikel detaljerar utvecklingen av modeller som kÃĪnnetecknas av dessa attribut, som kollektivt benÃĪmns Sapiens.
FÃķljande insikter, Sapiens utnyttjar stora datasamlingar och skalbara modellarkitekturer, som ÃĪr nyckeln till generalisering. FÃķr bredare tillÃĪmpbarhet antar Sapiens fÃķrtrÃĪning-och-finjusteringsansatsen, vilket mÃķjliggÃķr post-fÃķrtrÃĪningsanpassning till specifika uppgifter med minimala justeringar. Denna ansats vÃĪcker en kritisk frÃĨga: Vilken typ av data ÃĪr mest effektiv fÃķr fÃķrtrÃĪning? Givet berÃĪkningsbegrÃĪnsningar, bÃķr fokus ligga pÃĨ att samla in sÃĨ mÃĨnga mÃĪnskliga bilder som mÃķjligt, eller ÃĪr det fÃķredraget att fÃķrtrÃĪna pÃĨ en mindre kuraterad uppsÃĪttning fÃķr att bÃĪttre ÃĨterspegla verkliga variationsmÃķnster? Befintliga metoder fÃķrsummar ofta fÃķrtrÃĪningsdatafÃķrdelningen i sammanhanget med nedstrÃķmsuppgifter. FÃķr att studera inflytandet av fÃķrtrÃĪningsdatafÃķrdelning pÃĨ mÃĪnskliga specifika uppgifter, samlar Sapiens in Humans-300M-datasamlingen, som bestÃĨr av 300 miljoner varierande mÃĪnskliga bilder. Dessa oetiketterade bilder anvÃĪnds fÃķr att fÃķrtrÃĪna en familj av visionstransformatorer frÃĨn scratch, med parameterantal som strÃĪcker sig frÃĨn 300M till 2 miljarder.
Bland olika sjÃĪlvstÃĪndiga metoder fÃķr att lÃĪra allmÃĪnna visuella funktioner frÃĨn stora datasamlingar, vÃĪljer Sapiens den maskerade autoencoders (MAE) ansatsen fÃķr dess enkelhet och effektivitet vid fÃķrtrÃĪning. MAE, som har en enkel-pass-inferensmodell jÃĪmfÃķrt med kontrastiva eller multi-inferensstrategier, tillÃĨter bearbetning av en stÃķrre volym av bilder med samma berÃĪkningsresurser. FÃķr hÃķgre trohet, till skillnad frÃĨn tidigare metoder, Ãķkar Sapiens den ursprungliga inmatningsupplÃķsningen fÃķr fÃķrtrÃĪning till 1024 pixlar, vilket resulterar i en ca 4-gÃĨnger Ãķkning av FLOPs jÃĪmfÃķrt med den stÃķrsta befintliga visionsskelettet. Varje modell fÃķrtrÃĪnas pÃĨ 1,2 biljoner token. FÃķr finjustering pÃĨ mÃĪnskliga uppgifter, anvÃĪnder Sapiens en konsekvent encoder-decoder-arkitektur. Encodern initieras med vikter frÃĨn fÃķrtrÃĪning, medan decodern, en lÃĪtt och uppgiftsspecifik huvud, initieras slumpmÃĪssigt. BÃĨda komponenterna finjusteras sedan slutligen. Sapiens fokuserar pÃĨ fyra nyckeluppgifter: 2D-posestimering, kroppsdelssgmentering, djup och normalstimering, som visas i fÃķljande figur.

I linje med tidigare studier, bekrÃĪftar Sapiens den kritiska pÃĨverkan av etikettkvalitet pÃĨ modellens prestanda i vilda miljÃķer. Offentliga benchmarkningar innehÃĨller ofta brusiga etiketter, vilket ger inkonsekventa Ãķvervakningssignaler under modellfinjustering. Samtidigt ÃĪr det viktigt att anvÃĪnda finmaskiga och precisa etiketter fÃķr att nÃĪra ansluta till Sapiens primÃĪra mÃĨl om 3D-mÃĪnsklig digitalisering. FÃķr detta ÃĪndamÃĨl, fÃķreslÃĨr Sapiens en betydligt tÃĪtare uppsÃĪttning av 2D-helkroppsnyckelpunkter fÃķr posestimering och en detaljerad klassvokabulÃĪr fÃķr kroppsdelssgmentering, som ÃķvertrÃĪffar omfattningen av tidigare datasamlingar. Specifikt introducerar Sapiens en omfattande samling av 308 nyckelpunkter som omfattar kroppen, hÃĪnderna, fÃķtterna, ytan och ansiktet. Dessutom expanderar Sapiens klassvokabulÃĪren fÃķr kroppsdelssgmentering till 28 klasser, som tÃĪcker kroppsdelar som hÃĨr, tunga, tÃĪnder, Ãķvre/lÃĪgre lÃĪpp och torso. FÃķr att garantera kvaliteten och konsekvensen av etiketter och en hÃķg grad av automatisering, anvÃĪnder Sapiens en multi-vy-capturesetup fÃķr att samla in pose- och segmenteringsetiketter. Sapiens anvÃĪnder ocksÃĨ mÃĪnskliga syntetiska data fÃķr djup- och normalstimering, som utnyttjar 600 detaljerade skanningar frÃĨn RenderPeople fÃķr att generera hÃķgupplÃķsta djupkartor och ytnormaler. Sapiens visar att kombinationen av domÃĪnspecifik stor skalig fÃķrtrÃĪning med begrÃĪnsad, men hÃķgkvalitativ etikettering, leder till robust generalisering i vilda miljÃķer.

Sapiens: Metod och Arkitektur
Sapiens fÃķljer den maskerade autoencoders (MAE) ansatsen fÃķr fÃķrtrÃĪning. Modellen trÃĪnas fÃķr att rekonstruera den ursprungliga mÃĪnskliga bilden givet dess partiella observation. Liksom alla autoencoders, har Sapiens modell en encoder som kartar den synliga bilden till en latent representation och en decoder som rekonstruerar den ursprungliga bilden frÃĨn denna latent representation. FÃķrtrÃĪningsdatasamlingen bestÃĨr av bÃĨde enstaka och multi-mÃĪnskliga bilder, med varje bild ÃĨterstorad till en fast storlek med en kvadratisk bildfÃķrhÃĨllande. Liksom ViT, delas bilden in i regelbundna, icke-overlappande patchar med en fast patch-storlek. En undermÃĪngd av dessa patchar vÃĪljs slumpmÃĪssigt och maskeras, medan resten fÃķrblir synliga. FÃķrhÃĨllandet mellan maskerade patchar och synliga patchar, kallat maskeringsfÃķrhÃĨllandet, fÃķrblir konstant under hela trÃĪningsprocessen.
Sapiens modeller visar generalisering Ãķver en rad bildkaraktÃĪristika, inklusive skalor, beskÃĪrningar, ÃĨlder och etnicitet hos ÃĪmnen, samt antalet ÃĪmnen. Varje patch-token i modellen stÃĨr fÃķr 0,02% av bildomrÃĨdet jÃĪmfÃķrt med 0,4% i standard-ViTs, en 16-gÃĨnger minskning â vilket ger finmaskig inter-token resonemang fÃķr modellerna. Ãven med en Ãķkad maskeringsfÃķrhÃĨllande pÃĨ 95%, uppnÃĨr Sapiens modell en trovÃĪrdig rekonstruktion av mÃĪnsklig anatomi pÃĨ utvalda prover. Rekonstruktionen av Sapiens fÃķrtrÃĪnade modell pÃĨ osedda mÃĪnskliga bilder visas i fÃķljande bild.

Dessutom anvÃĪnder Sapiens en stor proprietÃĪr datasamling fÃķr fÃķrtrÃĪning, som bestÃĨr av cirka 1 miljard vilda bilder, med fokus enbart pÃĨ mÃĪnskliga bilder. FÃķrbearbetningen inkluderar att kasta bilder med vattenstÃĪmplar, text, konstnÃĪrliga representationer eller onaturliga element. Sapiens anvÃĪnder sedan en fÃĪrdig person-begrÃĪnsningsdetektor fÃķr att filtrera bilder, och behÃĨller de som har en detekteringsscore Ãķver 0,9 och begrÃĪnsningsbox-dimensioner som Ãķverstiger 300 pixlar. Ãver 248 miljoner bilder i datasamlingen innehÃĨller flera ÃĪmnen.
2D Posestimering
Sapien-ramverket finjusterar encodern och decodern i P Ãķver flera skelett, inklusive K = 17, K = 133 och en ny, hÃķgt detaljerad skelett, med K = 308, som visas i fÃķljande figur.

JÃĪmfÃķrt med befintliga format som har som mest 68 ansiktsnyckelpunkter, bestÃĨr Sapiens etiketter av 243 ansiktsnyckelpunkter, inklusive representativa punkter runt Ãķgonen, lÃĪpparna, nÃĪsan och Ãķronen. Denna design ÃĪr anpassad fÃķr att noggrant fÃĨnga de nyanserade detaljerna i ansiktsuttryck i den verkliga vÃĪrlden. Med dessa nyckelpunkter, annoterade Sapien-ramverket manuellt 1 miljon bilder i 4K-upplÃķsning frÃĨn en inomhus-capturesetup. PÃĨ liknande sÃĪtt som tidigare uppgifter, stÃĪlls decoderns utgÃĨngskanaler fÃķr normal-estimatoren N till 3, motsvarande xyz-komponenterna av normalvektorn vid varje pixel. De genererade syntetiska data anvÃĪnds ocksÃĨ som Ãķvervakning fÃķr ytnormalstimering.

Sapien: Experiment och Resultat
Sapiens-2B fÃķrtrÃĪnas med 1024 A100 GPU:er under 18 dagar med PyTorch. Sapiens anvÃĪnder AdamW-optimisatorn fÃķr alla experiment. LÃĪrandeschemat inkluderar en kort linjÃĪr uppvÃĪrmning, fÃķljt av cosinus-avklingning fÃķr fÃķrtrÃĪning och linjÃĪr avklingning fÃķr finjustering. Alla modeller fÃķrtrÃĪnas frÃĨn scratch vid en upplÃķsning pÃĨ 1024 Ã 1024 med en patch-storlek pÃĨ 16. FÃķr finjustering, ÃĨterstoras inmatningsbilden till en 4:3-fÃķrhÃĨllande, d.v.s. 1024 Ã 768. Sapiens tillÃĪmpar standard-augmenteringar som beskÃĪrning, skalning, vÃĪndning och fotometriska distorsioner. En slumpmÃĪssig bakgrund frÃĨn icke-mÃĪnskliga COCO-bilder lÃĪggs till fÃķr segmenterings-, djup- och normalprediktionsuppgifter. Viktigt ÃĪr att Sapiens anvÃĪnder differentiala lÃĪrhastigheter fÃķr att bevara generalisering, med lÃĪgre lÃĪrhastigheter fÃķr initiala lager och progressivt hÃķgre hastigheter fÃķr efterfÃķljande lager. Lag-vise lÃĪrhastighetsavklingning ÃĪr instÃĪlld pÃĨ 0,85 med en viktavklingning pÃĨ 0,1 fÃķr encodern.
Designspecifikationerna fÃķr Sapiens detaljereras i fÃķljande tabell. FÃķljande en specifik ansats, prioriterar Sapiens skalning av modeller genom bredd snarare ÃĪn djup. AnmÃĪrkningsvÃĪrt ÃĪr att Sapiens-0,3B-modellen, trots att den ÃĪr arkitektoniskt lik den traditionella ViT-Large, bestÃĨr av tjugo gÃĨnger fler FLOPs pÃĨ grund av sin hÃķgre upplÃķsning.

Sapiens finjusteras fÃķr ansikte, kropp, fÃķtter och hand (K = 308) posestimering med hÃķgkvalitativa etiketter. FÃķr trÃĪningsÃĪndamÃĨl, anvÃĪnder Sapiens trÃĪningsuppsÃĪttningen med 1M bilder, och fÃķr utvÃĪrdering, anvÃĪnder den testuppsÃĪttningen, som kallas Humans5K, med 5K bilder. UtvÃĪrderingen fÃķljer en topp-ned-ansats, dÃĪr Sapiens anvÃĪnder en fÃĪrdig detektor fÃķr begrÃĪnsningsboxar och utfÃķr enkel-mÃĪnsklig pose-inferens. Tabell 3 visar en jÃĪmfÃķrelse mellan Sapiens-modeller och befintliga metoder fÃķr helkropps-posestimering. Alla metoder utvÃĪrderas pÃĨ 114 gemensamma nyckelpunkter mellan Sapiens 308-nyckelpunktsvokabulÃĪr och COCO-WholeBody 133-nyckelpunktsvokabulÃĪr. Sapiens-0,6B ÃķvertrÃĪffar den nuvarande toppprestationsmodellen, DWPose-l, med +2,8 AP. Till skillnad frÃĨn DWPose, som anvÃĪnder en komplex elev-lÃĪrar-ram med funktionell destillering anpassad fÃķr uppgiften, antar Sapiens en allmÃĪn encoder-decoder-arkitektur med stor mÃĪnsklig fÃķrtrÃĪning.
Intressant nog, ÃĪven med samma parameterantal, visar Sapiens-modeller ÃķverlÃĪgsen prestanda jÃĪmfÃķrt med deras motsvarigheter. Till exempel, ÃķvertrÃĪffar Sapiens-0,3B VitPose+-L med +5,6 AP, och Sapiens-0,6B ÃķvertrÃĪffar VitPose+-H med +7,9 AP. Inom Sapiens-familjen, indikerar resultaten en direkt korrelation mellan modellstorlek och prestanda. Sapiens-2B sÃĪtter en ny toppprestationsrekord med 61,1 AP, en signifikant fÃķrbÃĪttring pÃĨ +7,6 AP jÃĪmfÃķrt med tidigare toppprestationsresultat. Trots att de finjusteras med etiketter frÃĨn en inomhus-capturesetup, visar Sapiens robust generalisering till verkliga vÃĪrldsscenario, som visas i fÃķljande figur.

Sapiens finjusteras och utvÃĪrderas med en segmenteringsvokabulÃĪr pÃĨ 28 klasser. TrÃĪningsuppsÃĪttningen bestÃĨr av 100K bilder, medan testuppsÃĪttningen, Humans-2K, bestÃĨr av 2K bilder. Sapiens jÃĪmfÃķrs med befintliga kroppsdelssgmenteringsmetoder som finjusteras pÃĨ samma trÃĪningsuppsÃĪttning, med de fÃķreslagna fÃķrtrÃĪnade kontrollpunkterna som initiering. PÃĨ liknande sÃĪtt som posestimering, visar Sapiens generalisering i segmentering, som visas i fÃķljande tabell.

Intressant nog, ÃĪr den minsta modellen, Sapiens-0,3B, ÃķverlÃĪgsen befintliga toppprestationssegmenteringsmetoder som Mask2Former och DeepLabV3+ med 12,6 mIoU, tack vare sin hÃķgre upplÃķsning och stor mÃĪnsklig fÃķrtrÃĪning. Dessutom fÃķrbÃĪttrar en Ãķkning av modellstorleken segmenteringsprestandan. Sapiens-2B uppnÃĨr den bÃĪsta prestandan, med 81,2 mIoU och 89,4 mAcc pÃĨ testuppsÃĪttningen, som visas i fÃķljande figur.

Slutsats
Sapiens representerar ett betydande steg mot att frÃĪmja mÃĪnskliga visionmodeller till omrÃĨdet fÃķr grundmodeller. Sapiens-modeller visar starka generaliseringsfÃķrmÃĨgor Ãķver en rad mÃĪnskliga uppgifter. Toppprestationsresultaten tillskrivs: (i) stor skalig fÃķrtrÃĪning pÃĨ en kuraterad datasamling specifikt anpassad fÃķr att fÃķrstÃĨ mÃĪnniskor, (ii) skalade hÃķgupplÃķsta och hÃķgkapacitetsvisionstransformator-skelett, och (iii) hÃķgkvalitativa etiketter pÃĨ fÃķrstÃĪrkta studio- och syntetiska data. Sapiens-modeller har potentialen att bli en viktig byggsten fÃķr en mÃĪngd nedstrÃķmsuppgifter och ge tillgÃĨng till hÃķgkvalitativa visionsskelett till en betydligt bredare del av samhÃĪllet.












