AI-modeller og platforme

Sapiens: Gennembrud i Menneskelige Visionmodeller

mm
FÃļj Unite.AI til dine foretrukne kilder pÃĨ Google

Den bemÃĶrkelsesvÃĶrdige succes med storstile pretraining fulgt af opgave-specifik finjustering for sprogmodellering har etableret denne tilgang som en standardpraksis. Lignende computer vision metoder er progressivt ved at omfavne omfattende datasÃĶt for pretraining. Opkomsten af store datasÃĶt, sÃĨsom LAION5B, Instagram-3.5B, JFT-300M, LVD142M, Visual Genome og YFCC100M, har muliggjort udforskningen af et datakorpus langt ud over omfanget af traditionelle benchmarks. FremtrÃĶdende arbejde i dette domÃĶne inkluderer DINOv2, MAWS og AIM. DINOv2 opnÃĨr state-of-the-art-prÃĶstation i generering af selv-supervised funktioner ved at skala kontrastive iBot-metoden pÃĨ LDV-142M-datasÃĶttet. MAWS studerer skaleringen af masked-autoencoders (MAE) pÃĨ billion billeder. AIM udforsker skalerbarheden af autoregressiv visuel pretraining lignende BERT for vision transformers. I modsÃĶtning til disse metoder, som primÃĶrt fokuserer pÃĨ generel billedpretraining eller zero-shot billedklassificering, tager Sapiens en tydeligt menneskecentreret tilgang: Sapiens’ modeller udnytter en enorm samling af menneskebilleder til pretraining og finjusterer derefter for en rÃĶkke menneskerelaterede opgaver. ForfÃļlgelsen af storstile 3D-menneskedigitalisering forbliver et afgÃļrende mÃĨl i computer vision.

Betydelig fremgang er opnÃĨet inden for kontrollerede eller studiemiljÃļer, men udfordringer bestÃĨr i at udvide disse metoder til ukontrollerede miljÃļer. For at imÃļdegÃĨ disse udfordringer er det afgÃļrende at udvikle fleksible modeller, der kan udfÃļre multiple grundlÃĶggende opgaver, sÃĨsom nÃļglepunkt-estimation, kropsdel-segmentering, dybde-estimation og overfladenormal-prÃĶdiction fra billeder i naturlige indstillinger. I dette arbejde sigter Sapiens mod at udvikle modeller for disse essentielle menneskevision-opgaver, der generaliserer til in-the-wild-indstillinger. For tiden indeholder de stÃļrste offentligt tilgÃĶngelige sprogmodeller over 100 milliarder parametre, mens de mere almindeligt brugte sprogmodeller indeholder omkring 7 milliarder parametre. I modsÃĶtning hertil har Vision Transformers (ViT), pÃĨ trods af at de deler en lignende arkitektur, ikke vÃĶret skaleret til dette omfang succesfuldt. Selv om der er bemÃĶrkelsesvÃĶrdige bestrÃĶbelser i denne retning, herunder udviklingen af en tÃĶt ViT-4B trÃĶnet pÃĨ bÃĨde tekst og billeder, og formuleringen af teknikker til stabil trÃĶning af en ViT-22B, bruges almindelige vision-baggrunde stadig mellem 300M til 600M parametre og er primÃĶrt fortrÃĶnet pÃĨ en billedoplÃļsning pÃĨ omkring 224 pixel. Lignende eksisterende transformer-baserede billedgenereringsmodeller, sÃĨsom DiT, bruger mindre end 700M parametre og opererer pÃĨ et hÃļjt komprimeret latent rum. For at imÃļdegÃĨ dette gap introducerer Sapiens en samling af store, hÃļjoplÃļsnings-ViT-modeller, der er fortrÃĶnet naturligt pÃĨ en 1024-pixel billedoplÃļsning pÃĨ millioner af menneskebilleder.

Sapiens prÃĶsenterer en familie af modeller for fire grundlÃĶggende menneskecentrerede vision-opgaver: 2D-pose-estimation, kropsdel-segmentering, dybde-estimation og overfladenormal-prÃĶdiction. Sapiens-modellerne understÃļtter naturligt 1K-hÃļjoplÃļsnings-inferens og er ekstremt lette at tilpasse til individuelle opgaver ved blot at finjustere modeller, der er fortrÃĶnet pÃĨ over 300 millioner in-the-wild-menneskebilleder. Sapiens observerer, at givet det samme beregningsbudget, selv-supervised pre-training pÃĨ et kurateret datasÃĶt af menneskebilleder betydeligt forbedrer prÃĶstationen for en divers samling af menneskecentrerede opgaver. De resulterende modeller viser bemÃĶrkelsesvÃĶrdig generalisering til in-the-wild-data, selv nÃĨr labeled data er sjÃĶldent eller helt syntetisk. Den simple model-design bringer ogsÃĨ skalerbarhed – modelprÃĶstationen over opgaver forbedres, nÃĨr antallet af parametre skalerer fra 0,3 til 2 milliarder. Sapiens overgÃĨr konsekvent eksisterende baseline over forskellige menneskecentrerede benchmarks, opnÃĨende betydelige forbedringer over tidligere state-of-the-art-resultater: 7,6 mAP pÃĨ Humans-5K (pose), 17,1 mIoU pÃĨ Humans-2K (part-seg), 22,4% relativ RMSE pÃĨ Hi4D (dybde) og 53,5% relativ vinkel-fejl pÃĨ THuman2 (normal).

Sapiens: Gennembrud i Menneskelige Visionmodeller

De seneste ÃĨr har set bemÃĶrkelsesvÃĶrdige skridt mod generering af fotorealistiske mennesker i 2D og 3D. Succesen med disse metoder kan tilskrives den robuste estimation af forskellige aktiver, sÃĨsom 2D-nÃļglepunkter, fin-granuleret kropsdel-segmentering, dybde og overfladenormale. Men robust og prÃĶcis estimation af disse aktiver forbliver et aktivt forskningsomrÃĨde, og komplicerede systemer til at forbedre prÃĶstationen for individuelle opgaver kan forhindre videre udbredelse. Desuden er det vanskeligt at opnÃĨ prÃĶcise grund-sandhed-annotationer in-the-wild. Sapiens’ mÃĨl er at give en samlet ramme og modeller til at slutte disse aktiver in-the-wild, lÃĨse op for en bred vifte af menneskecentrerede anvendelser for alle.

Sapiens argumenterer for, at sÃĨdanne menneskecentrerede modeller skal opfylde tre kriterier: generalisering, bred anvendelighed og hÃļj trofasthed. Generalisering sikrer robusthed overfor usete betingelser, hvilket giver mulighed for, at modellen kan udfÃļre konsekvent over forskellige miljÃļer. Bred anvendelighed indikerer modellens fleksibilitet, hvilket gÃļr den egnet til en bred vifte af opgaver med minimale ÃĶndringer. HÃļj trofasthed angiver modellens evne til at producere prÃĶcise, hÃļjoplÃļsnings-outputs, hvilket er afgÃļrende for trofaste menneskegenereringsopgaver. Denne artikel detaljer udviklingen af modeller, der inkorporerer disse attributter, kollektivt kendt som Sapiens.

FÃļlgende indsigt, Sapiens udnytter store datasÃĶt og skalerbare modelarkitekturer, nÃļgle for generalisering. For bredere anvendelighed adopterer Sapiens pretrain-then-finetune-tilgangen, hvilket giver mulighed for post-pretraining-tilpasning til specifikke opgaver med minimale ÃĶndringer. Dette approach rejser en kritisk spÃļrgsmÃĨl: Hvad type data er mest effektivt for pretraining? Givet beregningsbegrÃĶnsninger, skal fokus vÃĶre pÃĨ at samle sÃĨ mange menneskebilleder som muligt, eller er det bedre at fortrÃĶne pÃĨ et mindre kurateret datasÃĶt for at bedre reflektere realverdenens variation? Eksisterende metoder overser ofte pretraining-datafordelingen i sammenhÃĶng med downstream-opgaver. For at studere indflydelsen af pretraining-datafordeling pÃĨ menneske-specifikke opgaver, samler Sapiens Humans-300M-datasÃĶttet, der indeholder 300 millioner diverse menneskebilleder. Disse ulabelde billeder bruges til at fortrÃĶne en familie af vision transformers fra scratch, med parameterantal fra 300M til 2 milliarder.

Blandt forskellige selv-supervision-metoder til at lÃĶre generelle visuelle funktioner fra store datasÃĶt, vÃĶlger Sapiens masked-autoencoder (MAE)-tilgangen for dets enkelthed og effektivitet i pretraining. MAE, der har en enkelt-pass-inferensmodel i forhold til kontrastive eller multi-inferens-strategier, giver mulighed for at behandle en stÃļrre mÃĶngde billeder med de samme beregningsressourcer. For hÃļjere trofasthed, i modsÃĶtning til tidligere metoder, Ãļger Sapiens den native input-oplÃļsning af sin pretraining til 1024 pixel, hvilket resulterer i en ca. 4× forÃļgelse af FLOPs i forhold til den stÃļrste eksisterende vision-baggrund. Hver model er fortrÃĶnet pÃĨ 1,2 billion token. For finjustering pÃĨ menneskecentrerede opgaver, bruger Sapiens en konsekvent encoder-decoder-arkitektur. Encoderen initialiseres med vÃĶgte fra pretraining, mens decoderen, en letvÃĶgts- og opgave-specifik hoved, initialiseres tilfÃĶldigt. Begge komponenter finjusteres herefter end-to-end. Sapiens fokuserer pÃĨ fire nÃļgle-opgaver: 2D-pose-estimation, kropsdel-segmentering, dybde- og normal-estimation, som demonstreres i fÃļlgende figur.

I overensstemmelse med tidligere studier, bekrÃĶfter Sapiens den kritiske indvirkning af labelkvalitet pÃĨ modellens in-the-wild-prÃĶstation. Offentlige benchmarks indeholder ofte stÃļjende labels, der giver inkonsistente supervisory-signaler under model-finjustering. Samtidig er det vigtigt at bruge fin-granulerede og prÃĶcise annotationer for at vÃĶre i overensstemmelse med Sapiens’ primÃĶre mÃĨl om 3D-menneskedigitalisering. Til dette formÃĨl foreslÃĨr Sapiens en betydeligt tÃĶttere samling af 2D hele-krops-nÃļglepunkter til pose-estimation og en detaljeret klasse-vokabular for kropsdel-segmentering, der overgÃĨr omfanget af tidligere datasÃĶt. Specifikt introducerer Sapiens en omfattende samling af 308 nÃļglepunkter, der omfatter kroppen, hÃĶnder, fÃļdder, overflade og ansigt. Desuden udvider Sapiens segmenterings-klasse-vokabularet til 28 klasser, der dÃĶkker kropsdele sÃĨsom hÃĨr, tunge, tÃĶnder, Ãļvre/lÃĶgre lÃĶbe og torso. For at garantere kvaliteten og konsistensen af annotationer og en hÃļj grad af automation, bruger Sapiens en multi-view-capture-opstilling til at samle pose- og segmenterings-annotationer. Sapiens bruger ogsÃĨ menneskecentreret syntetisk data til dybde- og normal-estimation, udnyttende 600 detaljerede scans fra RenderPeople til at generere hÃļjoplÃļsnings-dybde-kort og overfladenormale. Sapiens demonstrerer, at kombinationen af domÃĶne-specifik storstile pretraining med begrÃĶnsede, men hÃļj-kvalitets-annotationer, fÃļrer til robust in-the-wild-generalisering. Overordnet set viser Sapiens’ metode en effektiv strategi for udvikling af hÃļjprÃĶcise diskriminative modeller, der kan udfÃļre i realverden-scenarier uden behov for at samle en kostbar og divers samling af annotationer.

Sapiens: Metode og Arkitektur

Sapiens fÃļlger masked-autoencoder (MAE)-tilgangen for pretraining. Modellen trÃĶnes til at genskabe det originale menneskebillede givet dets partielle observation. Ligesom alle autoencodere, har Sapiens’ model en encoder, der kortlÃĶgger det synlige billede til en latent reprÃĶsentation, og en decoder, der genskaber det originale billede fra denne latente reprÃĶsentation. Pretraining-datasÃĶttet bestÃĨr af bÃĨde enkelt- og multi-menneskebilleder, hvor hvert billede er resizeret til en fast stÃļrrelse med en kvadratisk aspektforhold. Ligesom ViT, deles billedet op i regelmÃĶssige, ikke-overlappende patches med en fast patch-stÃļrrelse. En undermÃĶngde af disse patches er tilfÃĶldigt valgt og maskeret, efterladende resten synlige. Forholdet mellem maskerede patches til synlige, kendt som maskeringsforholdet, forbliver fast under trÃĶning.

Sapiens’ modeller viser generalisering over en rÃĶkke billedkarakteristika, herunder skalaer, afkortninger, alder og etnicitet af subjekter og antallet af subjekter. Hver patch-token i modellen stÃĨr for 0,02% af billedarealet i forhold til 0,4% i standard ViTs, en 16× reduktion – giver fin-granuleret inter-token-reasoning for modellerne. Selv med en Ãļget maskeringsforhold pÃĨ 95%, opnÃĨr Sapiens’ model en plausibel rekonstruktion af menneskeanatomi pÃĨ holdt-ud-prÃļver. Rekonstruktionen af Sapien’s fortrÃĶnet model pÃĨ usete menneskebilleder demonstreres i fÃļlgende billede.

Desuden udnytter Sapiens et stort proprietÃĶrt datasÃĶt for pretraining, der bestÃĨr af omkring 1 milliard in-the-wild-billeder, der fokuserer eksklusivt pÃĨ menneskebilleder. Forarbejdningen indebÃĶrer at afvise billeder med vandmÃĶrker, tekst, kunstneriske fremstillinger eller unaturlige elementer. Sapiens bruger herefter en off-the-shelf person-bounding-box-detector til at filtrere billeder, der beholder billeder med en detections-score over 0,9 og en bounding-box-stÃļrrelse pÃĨ over 300 pixel. Over 248 millioner billeder i datasÃĶttet indeholder multiple subjekter.

2D-Pose-Estimation

Sapien-rammen finjusterer encoderen og decoderen i P over multiple skeletter, herunder K = 17 [67], K = 133 [55] og en ny, hÃļjdetaljeret skelet, med K = 308, som vist i fÃļlgende figur.

I forhold til eksisterende formater med op til 68 ansigt-nÃļglepunkter, bestÃĨr Sapien’s annotationer af 243 ansigt-nÃļglepunkter, herunder reprÃĶsentative punkter omkring Ãļjne, lÃĶber, nÃĶse og Ãļrer. Denne design er tilpasset til at fange de nuancerede detaljer af ansigtsudtryk i den virkelige verden. Med disse nÃļglepunkter har Sapien-rammen manuelt annoteret 1 million billeder i 4K-oplÃļsning fra en indendÃļrs capture-opstilling. Ligesom tidligere opgaver, sÃĶttes decoder-outputs-kanalerne for normal-estimatoren N til at vÃĶre 3, svarende til xyz-komponenterne af normal-vektoren pÃĨ hvert pixel. Den genererede syntetiske data bruges ogsÃĨ som supervision til overfladenormal-estimation.

Sapien: Eksperiment og Resultater

Sapiens-2B er fortrÃĶnet ved hjÃĶlp af 1024 A100-GPU’er i 18 dage med PyTorch. Sapiens bruger AdamW-optimizeren til alle eksperimenter. LÃĶringsplanen inkluderer en kortvarig lineÃĶr varme-op, efterfulgt af cosine-annealing til pretraining og lineÃĶr decay til finjustering. Alle modeller er fortrÃĶnet fra scratch i en oplÃļsning pÃĨ 1024 × 1024 med en patch-stÃļrrelse pÃĨ 16. Til finjustering er input-billedet resizeret til en 4:3-forhold, dvs. 1024 × 768. Sapiens anvender standard-augmenteringer som afkortning, skaleringsforhold, flipping og fotometriske forvridninger. Et tilfÃĶldigt baggrundsbillede fra ikke-menneske-COCO-billeder tilfÃļjes til segmenterings-, dybde- og normal-prÃĶdiction-opgaver. Vigtigt er, at Sapiens bruger differential-lÃĶringsrater til at bevare generalisering, med lavere lÃĶringsrater for de fÃļrste lag og progressivt hÃļjere rater for efterfÃļlgende lag. Lag-vis lÃĶringsrate-decay er sat til 0,85 med en vÃĶgt-decay pÃĨ 0,1 for encoderen.

Designspecifikationerne for Sapiens er detaljeret i fÃļlgende tabel. FÃļlgende en bestemt tilgang, prioriterer Sapiens skaleringsmodeller ved bredde snarere end dybde. BemÃĶrkelsesvÃĶrdigt er, at Sapiens-0,3B-modellen, selv om den er arkitektonisk lignende den traditionelle ViT-Large, bestÃĨr af tyve gange flere FLOPs pÃĨ grund af dens hÃļjere oplÃļsning.

Sapiens er finjusteret til ansigt-, krops-, fÃļdder- og hÃĨnd- (K = 308) pose-estimation ved hjÃĶlp af hÃļj-kvalitets-annotationer. Til trÃĶning bruges trÃĶningssÃĶttet med 1 million billeder, og til evaluering bruges test-sÃĶttet, der kaldes Humans5K, med 5.000 billeder. Evalueringen fÃļlger en top-down-tilgang, hvor Sapiens bruger en off-the-shelf-detector til bounding-box og udfÃļrer enkelt-menneske-pose-inferens. Tabel 3 viser en sammenligning af Sapiens-modeller med eksisterende metoder til hele-krops-pose-estimation. Alle metoder evalueres pÃĨ 114 fÃĶlles nÃļglepunkter mellem Sapiens’ 308-nÃļglepunkts-vokabular og COCO-WholeBody’s 133-nÃļglepunkts-vokabular. Sapiens-0,6B overgÃĨr den nuvÃĶrende state-of-the-art, DWPose-l, med +2,8 AP. I modsÃĶtning til DWPose, der bruger en kompleks elev-lÃĶrer-ramme med funktion-distillation tilpasset til opgaven, adopterer Sapiens en generel encoder-decoder-arkitektur med stor menneskecentreret pretraining.

Interessant er, at selv med det samme parameterantal, viser Sapiens-modellerne overlegen prÃĶstation i forhold til deres modstykke. For eksempel overgÃĨr Sapiens-0,3B VitPose+-L med +5,6 AP, og Sapiens-0,6B overgÃĨr VitPose+-H med +7,9 AP. Inden for Sapiens-familien viser resultaterne en direkte korrelation mellem modelstÃļrrelse og prÃĶstation. Sapiens-2B sÃĶtter en ny state-of-the-art med 61,1 AP, en betydelig forbedring pÃĨ +7,6 AP i forhold til tidligere state-of-the-art. Selv om finjusteret med annotationer fra en indendÃļrs capture-studio, viser Sapiens robust generalisering til realverden-scenarier, som vist i fÃļlgende figur.

Sapiens er finjusteret og evalueret med et segmenterings-vokabular pÃĨ 28 klasser. TrÃĶningssÃĶttet bestÃĨr af 100.000 billeder, mens test-sÃĶttet, Humans-2K, bestÃĨr af 2.000 billeder. Sapiens sammenlignes med eksisterende kropsdel-segmenteringsmetoder, der er finjusteret pÃĨ det samme trÃĶningssÃĶt, ved hjÃĶlp af de foreslÃĨede fortrÃĶnede checkpoints fra hver metode som initialisering. Ligesom pose-estimation viser Sapiens generalisering i segmentering, som demonstreres i fÃļlgende tabel.

Interessant er, at den mindste model, Sapiens-0,3B, overgÃĨr eksisterende state-of-the-art-segmenteringsmetoder som Mask2Former og DeepLabV3+ med 12,6 mIoU pÃĨ grund af dens hÃļjere oplÃļsning og stor menneskecentreret pretraining. Desuden forbedrer Ãļgning af modelstÃļrrelsen yderligere segmenteringsprÃĶstationen. Sapiens-2B opnÃĨr den bedste prÃĶstation med 81,2 mIoU og 89,4 mAcc pÃĨ test-sÃĶttet, som vist i fÃļlgende figur.

Konklusion

Sapiens reprÃĶsenterer et betydeligt skridt mod at fremme menneskecentrerede vision-modeller til at blive grundlÃĶggende modeller. Sapiens-modellerne viser stÃĶrke generaliserings-evner over en rÃĶkke menneskecentrerede opgaver. State-of-the-art-prÃĶstationen tilskrives: (i) storstile pretraining pÃĨ et kurateret datasÃĶt specifikt tilpasset til at forstÃĨ mennesker, (ii) skaleret hÃļjoplÃļsning og hÃļjkapacitets vision-transformer-baggrunde og (iii) hÃļj-kvalitets-annotationer pÃĨ forstÃĶrket studio- og syntetisk data. Sapiens-modellerne har potentialet til at blive en nÃļgle-byggesten for en bred vifte af downstream-opgaver og giver adgang til hÃļj-kvalitets vision-baggrunde til en betydeligt stÃļrre del af fÃĶllesskabet.

En ingeniÃļr af profession, en forfatter af hjerte. Kunal er en teknisk forfatter med en dyb kÃĶrlighed og forstÃĨelse af AI og ML, dedikeret til at forenkle komplekse koncepter inden for disse felter gennem sin engagerende og informative dokumentation.