AI-modeller og plattformer

Sapiens: Gjennombrudd i menneskelige visningsmodeller

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Den bemerkelsesverdige suksessen med stor skala pre-trening fulgt av oppgave-spesifikk finjustering for språkmodellering har etablert denne tilnærmingen som en standard praksis. Liksom datamaskin-syn metoder er progressivt omfavner omfattende data skalaer for pre-trening. Oppblomstringen av store datasett, som LAION5B, Instagram-3.5B, JFT-300M, LVD142M, Visual Genome og YFCC100M, har muliggjort utforskning av en data korpus langt utenfor rekkevidden av tradisjonelle benchmark. Fremtredende arbeid i dette domenet inkluderer DINOv2, MAWS og AIM. DINOv2 oppnår state-of-the-art ytelse i å generere selv-overnede funksjoner ved å skalerer kontrastive iBot metoden på LDV-142M datasettet. MAWS studerer skaleren av maskert-autoencodere (MAE) på billion bilder. AIM utforsker skalerbarheten av autoregressiv visuell pre-trening lignende BERT for visjonstransformatorer. I motsetning til disse metodene, som hovedsakelig fokuserer på generell bilde pre-trening eller null-skudd bilde klassifisering, Sapiens tar en distinkt menneske-sentrert tilnærming: Sapiens modeller utnytter en enorm samling av menneskebilder for pre-trening, og deretter finjusterer for en rekke menneske-relaterte oppgaver. Forfølgelsen av stor skala 3D menneske digitalisering forblir et avgjørende mål i datamaskin-syn.

Betydelige fremsteg har blitt gjort innen kontrollerte eller studio miljøer, men utfordringer består i å utvide disse metodene til uavhengige miljøer. For å møte disse utfordringene, er det avgjørende å utvikle fleksible modeller som kan håndtere flere grunnleggende oppgaver, som nøkkel punkt estimat, kroppsdels segmentering, dybde estimat og overflate normalt forutsigelse fra bilder i naturlige innstillinger, er avgjørende. I dette arbeidet, Sapiens har som mål å utvikle modeller for disse essensielle menneske-syn oppgavene som generaliserer til i-ville-miljøer. For tiden, inneholder de største offentlig tilgjengelige språkmodellene over 100 milliarder parametre, mens de mer vanlige språkmodellene inneholder rundt 7 milliarder parametre. I motsetning, Visjonstransformatorer (ViT), til tross for å dele en lignende arkitektur, har ikke blitt skalert til denne utstrekningen med suksess. Mens det finnes bemerkelsesverdige forsøk i denne retningen, inkludert utviklingen av en tett ViT-4B trent på både tekst og bilder, og formuleringen av teknikker for stabil trening av en ViT-22B, vanligvis brukte visjon bakgrunner varierer mellom 300M til 600M parametre og er hovedsakelig pre-trent på en bilde oppløsning på rundt 224 piksler. Liksom eksisterende transformer-basert bilde genereringsmodeller, som DiT, bruker mindre enn 700M parametre og opererer på en høyt komprimert latent rom. For å møte dette gapet, Sapiens introduserer en samling av store, høyoppløste ViT modeller som er pre-trent nativt på en 1024-piksel bilde oppløsning på millioner av menneskebilder.

Sapiens presenterer en familie av modeller for fire grunnleggende menneske-sentrerte visjon oppgaver: 2D posisjon estimat, kroppsdels segmentering, dybde estimat og overflate normalt forutsigelse. Sapiens modeller støtter nativt 1K høyoppløst inferens og er ekstremt enkelt å tilpasse for individuelle oppgaver ved å finjustere modeller pre-trent på over 300 millioner i-ville-menneskebilder. Sapiens observerer at, gitt samme beregnings budsjett, selv-overnede pre-trening på en kurert datasett av menneskebilder signifikant booster ytelse for en divers samling av menneske-sentrerte oppgaver. De resulterende modellene utviser bemerkelsesverdig generalisering til i-ville-data, selv når merket data er sjeldent eller helt syntetisk. Den enkle modell designet bringer også skalerbarhet – modell ytelse over oppgaver forbedrer seg når antall parametre skalerer fra 0,3 til 2 milliarder. Sapiens konsekvent overgår eksisterende baseline over flere menneske-sentrerte benchmark, oppnår betydelige forbedringer over tidligere state-of-the-art resultater: 7,6 mAP på Humans-5K (posisjon), 17,1 mIoU på Humans-2K (dels-segmentering), 22,4% relativ RMSE på Hi4D (dybde), og 53,5% relativ vinkel feil på THuman2 (normalt).

Sapiens : Gjennombrudd i menneskelige visningsmodeller

De siste årene har sett bemerkelsesverdige skritt mot å generere fotorealistiske mennesker i 2D og 3D. Suksessen til disse metodene er i stor grad tilskrevet den robuste estimatet av ulike aktiva som 2D nøkkel punkt, fin-granet kroppsdels segmentering, dybde og overflate normalt. Likevel, robust og nøyaktig estimat av disse aktiva forblir et aktivt forskningsområde, og kompliserte systemer for å forbedre ytelse for individuelle oppgaver ofte hindrer videre utbredelse. Dessuten, å oppnå nøyaktig bakgrunns annotasjon i-ville er notorisk vanskelig å skalerer. Sapiens’ mål er å tilby en forent ramme og modeller for å inferere disse aktiva i-ville, åpner opp en rekke menneske-sentrerte applikasjoner for alle.

Sapiens argumenterer for at slike menneske-sentrerte modeller bør tilfredsstille tre kriterier: generalisering, bred anvendelighet og høy trofasthet. Generalisering sikrer robusthet til usette betingelser, muliggjør modellen å fungere konsekvent over varierte miljøer. Bred anvendelighet indikerer modellens fleksibilitet, gjør den egnet for en rekke oppgaver med minimalt justering. Høy trofasthet betegner modellens evne til å produsere nøyaktige, høyoppløste utdata, essensielle for trofast menneske generering oppgaver. Denne artikkelen detaljer utviklingen av modeller som inkorporerer disse attributtene, kollektivt referert til som Sapiens.

Følgende innsikt, Sapiens utnytter store datasett og skalerbare modell arkitekturer, nøkkel for generalisering. For bredere anvendelighet, Sapiens adopterer pre-trening-deretter-finjustering tilnærmingen, muliggjør post-pre-trening tilpasning til spesifikke oppgaver med minimalt justering. Denne tilnærmingen reiser en kritisk spørsmål: Hva type data er mest effektivt for pre-trening? Gitt beregnings grenser, bør fokuset være på å samle så mange menneskebilder som mulig, eller er det foretrukket å pre-treine på en mindre kurert sett for å bedre reflektere virkelige variasjoner? Eksisterende metoder ofte overseer pre-trening data distribusjon i sammenheng med nedstrøms oppgaver. For å studere påvirkningen av pre-trening data distribusjon på menneske-spesifikke oppgaver, Sapiens samler Humans-300M datasettet, featuring 300 millioner diverse menneskebilder. Disse u-merkede bildene brukes til å pre-treine en familie av visjonstransformatorer fra scratch, med parameter teller som varierer fra 300M til 2B.

Blant ulike selv-overnede metoder for å lære generelle visuelle funksjoner fra store datasett, Sapiens velger maskert-autoencoder (MAE) tilnærmingen for dens enkelhet og effisiens i pre-trening. MAE, med en enkelt-pass inferens modell sammenlignet med kontrastive eller multi-inferens strategier, tillater prosessering av en større volum av bilder med samme beregnings ressurser. For høyere trofasthet, i motsetning til tidligere metoder, Sapiens øker den native inndata oppløsningen av sin pre-trening til 1024 piksler, resulterer i en ca. 4× økning i FLOPs sammenlignet med den største eksisterende visjon bakgrunn. Hver modell er pre-trent på 1,2 billioner token. For finjustering på menneske-sentrerte oppgaver, Sapiens bruker en konsekvent encoder-decoder arkitektur. Encoderen initialiseres med vekter fra pre-trening, mens decoderen, en lett og oppgave-spesifikk hode, initialiseres tilfeldig. Begge komponenter finjusteres deretter end-to-end. Sapiens fokuserer på fire nøkkel oppgaver: 2D posisjon estimat, kroppsdels segmentering, dybde og normalt forutsigelse, som demonstrert i følgende figur.

I overensstemmelse med tidligere studier, Sapiens bekrefter den kritiske påvirkningen av merke kvalitet på modellens i-ville ytelse. Offentlige benchmark inneholder ofte støyende merker, gir inkonsistente overordnede signaler under modell finjustering. Samtidig er det viktig å utnytte fin-granet og presise annotasjoner for å alignere nært med Sapiens’ primære mål om 3D menneske digitalisering. For å nå dette, Sapiens foreslår en vesentlig tettere sett av 2D hele-kropp nøkkel punkt for posisjon estimat og en detaljert klasse vokabular for kroppsdels segmentering, overgår omfanget av tidligere datasett. Spesifikt, Sapiens introduserer en omfattende samling av 308 nøkkel punkt som omfatter kroppen, hendene, føttene, overflaten og ansiktet. Dessuten, Sapiens utvider segmenterings klassen vokabular til 28 klasser, dekker kroppsdeler som håret, tunga, tennene, øvre/lavere leppe og torso. For å garantere kvaliteten og konsistensen av annotasjoner og en høy grad av automatisering, Sapiens utnytter en multi-views oppsett for å samle posisjon og segmenterings annotasjoner. Sapiens utnytter også menneske-sentrerte syntetiske data for dybde og normalt estimat, utnytter 600 detaljerte skanninger fra RenderPeople for å generere høyoppløste dybde kart og overflate normaler. Sapiens demonstrerer at kombinasjonen av domene-spesifikke stor skala pre-trening med begrensede, men høykvalitets annotasjoner, leder til robust i-ville generalisering. Overordnet, Sapiens’ metode viser en effektiv strategi for å utvikle høyt presise diskriminative modeller som kan fungere i virkelige verdens scenarioer uten behov for å samle en kostbar og divers sett av annotasjoner.

Sapiens : Metode og Arkitektur

Sapiens følger maskert-autoencoder (MAE) tilnærmingen for pre-trening. Modellen er trent for å rekonstruere det opprinnelige menneskebildet gitt dets delvis observasjon. Liksom alle autoencodere, Sapiens’ modell har en encoder som kartlegger det synlige bildet til en latent representasjon og en decoder som rekonstruerer det opprinnelige bildet fra denne latente representasjonen. Pre-trening datasettet består av både enkelt og multi-menneske bilder, med hver bilde resizet til en fast størrelse med en kvadratisk aspektforhold. Liksom ViT, bildet deles inn i regulære ikke-overlappende patches med en fast patch størrelse. En undergruppe av disse patches er tilfeldig valgt og maskert, etterlater resten synlig. Forholdet mellom maskerte og synlige patches, kjent som maskeringsforholdet, forblir konstant gjennom trening.

Sapiens’ modeller utviser generalisering over en rekke av bilde egenskaper, inkludert skalaer, crops, alder og etnisitet av subjekter, og antall subjekter. Hver patch token i modellen står for 0,02% av bildet area sammenlignet med 0,4% i standard ViTs, en 16× reduksjon—gir fin-granet inter-token resonnering for modellene. Selv med en økt maskeringsforhold på 95%, Sapiens’ modell oppnår en plausibel rekonstruksjon av menneske anatomien på holdt-ut prøver. Rekonstruksjonen av Sapien’s pre-trent modell på usette menneskebilder demonstreres i følgende bilde.

Dessuten, Sapiens utnytter en stor proprietær datasett for pre-trening, bestående av omtrent 1 milliard i-ville bilder, fokusert eksklusivt på menneskebilder. Forbearbeidingen inkluderer å forkaste bilder med vannmerker, tekst, kunstneriske fremstillinger eller unaturlige elementer. Sapiens deretter bruker en off-the-shelf person bounding-box detector for å filtere bilder, beholdende de med en detekterings score over 0,9 og bounding box dimensjoner over 300 piksler. Over 248 millioner bilder i datasettet inneholder multiple subjekter.

2D Posisjon Estimat

Sapien rammen finjusterer encoderen og decoderen i P over multiple skjelett, inkludert K = 17 [67], K = 133 [55] og en ny høyt detaljert skjelett, med K = 308, som vist i følgende figur.

Sammenlignet med eksisterende formater med maks 68 ansikts nøkkel punkt, Sapien’s annotasjoner består av 243 ansikts nøkkel punkt, inkludert representative punkt rundt øynene, leppene, nesen og ørene. Denne designen er tilpasset for å fange de nøyaktige detaljene av ansikts uttrykk i den virkelige verden. Med disse nøkkel punktene, Sapien rammen manuelt annoterte 1 million bilder på 4K oppløsning fra en innendørs oppsett. Liksom tidligere oppgaver, setter vi decoder utgangskanaler for normal estimator N til å være 3, korresponderende til xyz komponentene av normalvektoren på hver piksel. De genererte syntetiske dataene brukes også som overordning for overflate normalt estimat.

Sapien : Eksperiment og Resultater

Sapiens-2B er pre-trent ved å bruke 1024 A100 GPUs i 18 dager med PyTorch. Sapiens bruker AdamW optimizer for alle eksperimenter. Lærings skedulen inkluderer en kort linær oppvarming, etterfulgt av cosine annealing for pre-trening og lineær avkorting for finjustering. Alle modeller er pre-trent fra scratch på en oppløsning av 1024 × 1024 med en patch størrelse på 16. For finjustering, er inndata bildet resizet til en 4:3 forhold, dvs. 1024 × 768. Sapiens anvender standard augmentasjoner som beskjæring, skaleringsforandring, flipping og fotometriske forvrengninger. En tilfeldig bakgrunn fra ikke-menneske COCO bilder legges til for segmenterings-, dybde- og normalt forutsigelse oppgaver. Viktigst, Sapiens bruker differensielle læringsrater for å bevare generalisering, med lavere læringsrater for initielle lag og progressivt høyere rater for påfølgende lag. Lag-vis læringsrate avkorting er satt til 0,85 med en vekt avkorting på 0,1 for encoderen.

Design spesifikasjonene for Sapiens er detaljert i følgende tabell. Følgende en bestemt tilnærming, Sapiens prioriterer skalerings modeller ved bredde snarere enn dybde. Merkverdig, Sapiens-0,3B modellen, selv om den er arkitektonisk lik den tradisjonelle ViT-Large, består av tyvefold mer FLOPs på grunn av sin høyere oppløsning.

Sapiens er finjustert for ansikt, kropp, føtter og hånd (K = 308) posisjon estimat ved å bruke høykvalitets annotasjoner. For trening, Sapiens bruker treningssettet med 1M bilder, og for evaluering, det bruker testsettet, navngitt Humans5K, med 5K bilder. Evalueringen følger en topp-ned tilnærming, hvor Sapiens bruker en off-the-shelf detector for bounding-bokser og utfører enkelt menneske posisjon inferens. Tabell 3 viser en sammenligning av Sapiens modeller med eksisterende metoder for hele-kropp posisjon estimat. Alle metoder er evaluert på 114 felles nøkkel punkt mellom Sapiens’ 308 nøkkel punkt vokabular og 133 nøkkel punkt vokabular fra COCO-WholeBody. Sapiens-0,6B overgår den nåværende state-of-the-art, DWPose-l, med +2,8 AP. I motsetning til DWPose, som bruker en kompleks student-lærer ramme med funksjons destillasjon tilpasset for oppgaven, Sapiens adopterer en generell encoder-decoder arkitektur med stor menneske-sentrert pre-trening.

Interessant, selv med samme parameter teller, Sapiens modeller demonstrerer overlegen ytelse sammenlignet med deres motparter. For eksempel, Sapiens-0,3B overgår VitPose+-L med +5,6 AP, og Sapiens-0,6B overgår VitPose+-H med +7,9 AP. Innenfor Sapiens familien, resultater indikerer en direkte korrelasjon mellom modell størrelse og ytelse. Sapiens-2B setter en ny state-of-the-art med 61,1 AP, en betydelig forbedring på +7,6 AP over tidligere state-of-the-art resultater. Til tross for finjustering med annotasjoner fra en innendørs studio, Sapiens demonstrerer robust generalisering til virkelige verdens scenarioer, som vist i følgende figur.

Sapiens er finjustert og evaluert ved å bruke en segmenterings vokabular på 28 klasser. Treningssettet består av 100K bilder, mens testsettet, Humans-2K, består av 2K bilder. Sapiens sammenlignes med eksisterende kroppsdels segmenterings metoder finjustert på samme treningssett, ved å bruke foreslåtte pre-trent checkpoints fra hver metode som initialisering. Liksom posisjon estimat, Sapiens viser generalisering i segmentering, som demonstrert i følgende tabell.

Interessant, den minste modellen, Sapiens-0,3B, overgår eksisterende state-of-the-art segmenterings metoder som Mask2Former og DeepLabV3+ med 12,6 mIoU på grunn av sin høyere oppløsning og stor menneske-sentrert pre-trening. Dessuten, økning av modell størrelse forbedrer seg ytterligere segmenterings ytelse. Sapiens-2B oppnår den beste ytelsen, med 81,2 mIoU og 89,4 mAcc på testsettet, som vist i følgende figur.

Konklusjon

Sapiens representerer et betydelig skritt mot å fremme menneske-sentrerte visjon modeller inn i området av foundation modeller. Sapiens modeller demonstrerer sterke generaliserings evner over en rekke menneske-sentrerte oppgaver. State-of-the-art ytelsen tilskrives: (i) stor skala pre-trening på en kurert datasett spesifikt tilpasset for å forstå mennesker, (ii) skalert høyoppløst og høykapasitets visjonstransformator bakgrunner, og (iii) høykvalitets annotasjoner på augmentert studio og syntetiske data. Sapiens modeller har potensialet til å bli en nøkkel byggestein for en rekke nedstrøms oppgaver og gi tilgang til høykvalitets visjon bakgrunner til en betydelig bredere del av samfunnet.

En ingeniør av yrke, en forfatter av hjerte. Kunal er en teknisk forfatter med en dyp kjærlighet og forståelse av AI og ML, dedikert til å forenkle komplekse konsepter i disse feltene gjennom sin engasjerende og informerende dokumentasjon.