Modely a platformy AI

Sapiens: Přlom v modelech lidského vidění

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Úspěch velkých škál předtrénování následovaný specifickým jemným laděním pro modelování jazyka ustanovil tento přístup jako standardní praxi. Podobně, metody počítačového vidění jsou postupně přijímající rozsáhlá data pro předtrénování. Vznik velkých datových sad, jako je LAION5B, Instagram-3.5B, JFT-300M, LVD142M, Visual Genome a YFCC100M, umožnil prozkoumání datového korpusu daleko za rámec tradičních benchmarků. Významné práce v této oblasti zahrnují DINOv2, MAWS a AIM. DINOv2 dosahuje špičkového výkonu při generování samo-supervizních funkcí škálováním kontrastivní iBot metody na datové sadě LDV-142M. MAWS studuje škálování maskovaných autoencoderů (MAE) na miliardách obrázků. AIM prozkoumává škálovatelnost autoregresivního vizuálního předtrénování podobného BERT pro vizuální transformátory. Na rozdíl od těchto metod, které se zaměřují hlavně na obecné předtrénování obrázků nebo nulové snímání obrazů, Sapiens využívá lidsky orientovaný přístup: modely Sapiens využívají rozsáhlou sbírku lidských obrázků pro předtrénování, následované jemným laděním pro řadu lidských úkolů. Snaha o velkou 3D digitalizaci lidských těl zůstává zásadním cílem v počítačovém vidění.

Byla učiněna významná pokroku v kontrolovaných nebo studiových prostředích, nicméně výzvy přetrvávají při rozšiřování těchto metod do neomezených prostředí. Pro řešení těchto výzev je důležité vyvinout všestranné modely schopné více základních úkolů, jako je odhad klíčových bodů, segmentace částí těla, odhad hloubky a predikce povrchové normály z obrázků v přirozených podmínkách. V této práci Sapiens cílem je vyvinout modely pro tyto základní lidské vidění úkoly, které se generalizují na divoké podmínky. V současné době největší veřejně dostupné jazykové modely obsahují více než 100 miliard parametrů, zatímco více běžně používané jazykové modely obsahují kolem 7 miliard parametrů. Na rozdíl od toho, Vision Transformery (ViT), navzdory podobné architektuře, nebyly dosud škálovány na tuto úroveň. Zatímco existují pozoruhodné úsilí v tomto směru, včetně vývoje hustého ViT-4B trénovaného na textu a obrazech, a formulace technik pro stabilní trénování ViT-22B, běžně využívané vizuální základy se pohybují mezi 300M a 600M parametry a jsou primárně předtrénovány na rozlišení obrázku kolem 224 pixelů. Podobně, existující transformátorové modely obrazové generace, jako je DiT, využívají méně než 700M parametrů a operují na vysoce komprimovaném latentním prostoru. Pro řešení této mezery Sapiens představuje kolekci velkých, high-resolution ViT modelů, které jsou předtrénovány nativně na 1024-pixelovém rozlišení obrázku na milionech lidských obrázků.

Sapiens představuje rodinu modelů pro čtyři základní lidsky orientované vidění úkoly: 2D odhad postoje, segmentace částí těla, odhad hloubky a predikce povrchové normály. Modely Sapiens nativně podporují 1K high-resolution inference a jsou extrémně snadno přizpůsobitelné pro individuální úkoly jednoduchým jemným laděním modelů předtrénovaných na více než 300 milionech divokých lidských obrázků. Sapiens pozoruje, že, daný stejný výpočetní rozpočet, samo-supervizní předtrénování na kurátorované datové sadě lidských obrázků významně zvyšuje výkon pro různorodou sadu lidských úkolů. Výsledné modely vykazují pozoruhodnou generalizaci na divoká data, i když jsou štítky vzácné nebo zcela syntetické. Jednoduchý design modelu také přináší škálovatelnost – výkon modelu přes úkoly se zlepšuje, jak se počet parametrů škáluje z 0,3 na 2 miliardy. Sapiens konzistentně překonává stávající benchmarky napříč různými lidskými úkoly, dosahující významných zlepšení oproti předchozím špičkovým výsledkům: 7,6 mAP na Humans-5K (postoj), 17,1 mIoU na Humans-2K (segmentace), 22,4% relativní RMSE na Hi4D (hloubka) a 53,5% relativní úhlová chyba na THuman2 (normála).

Sapiens : Přlom v lidských modelech vidění

Poslední roky svědky pozoruhodného pokroku ve generování fotorealistických lidských obrázků ve 2D a 3D. Úspěch těchto metod je značně přisuzován robustnímu odhadu různých aktiv, jako jsou 2D klíčové body, jemná segmentace částí těla, hloubka a povrchová normála. Nicméně, robustní a přesný odhad těchto aktiv zůstává aktivní výzkumnou oblastí a komplikované systémy pro zlepšení výkonu pro jednotlivé úkoly často brání širšímu přijetí. Kromě toho, získání přesných ground-truth anotací v divočině je notoricky obtížné škálovat. Cílem Sapiens je poskytnout sjednocený rámec a modely pro inference těchto aktiv v divočině, odemykající širokou škálu lidských aplikací pro každého.

Sapiens tvrdí, že takové lidsky orientované modely by měly splňovat tři kritéria: generalizaci, širokou aplikovatelnost a vysokou fidelitu. Generalizace zajišťuje odolnost vůči neviditelným podmínkám, umožňující modelu konzistentně fungovat napříč různými prostředími. Široká aplikovatelnost naznačuje všestrannost modelu, činí jej vhodným pro širokou škálu úkolů s minimálními úpravami. Vysoká fidelita označuje schopnost modelu produkovat přesné, high-resolution výstupy, které jsou nezbytné pro věrné lidské generace úkoly. Tato práce podrobně popisuje vývoj modelů, které ztělesňují tyto atributy, kolektivně označované jako Sapiens.

Po těchto poznatcích Sapiens využívá velké datové sady a škálovatelné modelové architektury, klíčové pro generalizaci. Pro širší aplikovatelnost Sapiens přijímá předtrénovací a jemné ladění přístup, umožňující post-předtrénovací adaptaci na specifické úkoly s minimálními úpravami. Tento přístup vyvolává kritickou otázku: Jaký typ dat je nejúčinnější pro předtrénování? Daný výpočetní limit, měl by být důraz kladen na shromažďování co nejvíce lidských obrázků, nebo je lepší předtrénovat na méně kurátorované datové sadě, aby lépe odrážela reálnou světovou variabilitu? Stávající metody často přehlížejí distribuci předtrénovacích dat v kontextu downstream úkolů. Pro studium vlivu distribuce předtrénovacích dat na lidské specifické úkoly Sapiens shromažďuje datovou sadu Humans-300M, obsahující 300 milionů rozmanitých lidských obrázků. Tyto neoznačené obrázky se používají k předtrénování rodiny vizuálních transformátorů od začátku, s počtem parametrů sahajícím od 300M do 2B.

Mezi různými samo-supervizními metodami pro učení obecných vizuálních funkcí z velkých datových sad Sapiens zvolí maskovaný autoencoder (MAE) přístup pro jeho jednoduchost a efektivitu v předtrénování. MAE, mající jednopasový inferenční model ve srovnání s kontrastními nebo multi-inferenčními strategiemi, umožňuje zpracování většího objemu obrázků se stejnými výpočetními zdroji. Pro vyšší fidelitu, na rozdíl od předchozích metod, Sapiens zvyšuje nativní vstupní rozlišení předtrénování na 1024 pixelů, což vede k přibližnému 4násobnému zvýšení FLOPs ve srovnání s největší stávající vizuální základy. Každý model je předtrénován na 1,2 bilionu tokenů. Pro jemné ladění na lidských úkolech Sapiens používá konzistentní encoder-decoder architekturu. Encoder je inicializován s váhami z předtrénování, zatímco decoder, lehká a úkol-specifická hlava, je inicializován náhodně. Oba komponenty jsou poté jemně laděny koncovými body. Sapiens se zaměřuje na čtyři klíčové úkoly: 2D odhad postoje, segmentace částí těla, hloubka a normální odhad, jak je demonstrováno na následujícím obrázku.

Konzistentně s předchozími studiemi, Sapiens potvrzuje kritický dopad kvality štítků na výkon modelu v divočině. Veřejné benchmarky často obsahují šumové štítky, poskytující nekonzistentní supervizní signály během jemného ladění modelu. Současně je důležité využít jemné a přesné anotace, aby se blízko shodovaly se základním cílem Sapiens 3D lidské digitalizace. K tomuto účelu Sapiens navrhuje podstatně hustější sadu 2D celkových klíčových bodů pro odhad postoje a podrobnou třídní slovník pro segmentaci částí těla, překračující rozsah předchozích datových sad. Konkrétně, Sapiens představuje komplexní kolekci 308 klíčových bodů zahrnujících tělo, ruce, nohy, povrch a obličej. Kromě toho, Sapiens rozšiřuje slovník segmentace tříd na 28 tříd, pokrývajících části těla, jako je vlasy, jazyk, zuby, horní a dolní ret a trup. Pro zajištění kvality a konzistence anotací a vysoké úrovně automatizace, Sapiens využívá multi-view capture nastavení pro shromažďování anotací postoje a segmentace. Sapiens také využívá lidsky orientované syntetické údaje pro hloubkovou a normální odhad, využívající 600 podrobných skenů z RenderPeople pro generování high-resolution hloubkových map a povrchových normál. Sapiens demonstruje, že kombinace doménově specifického velkého měřítka předtrénování s omezenými, ale vysoce kvalitními anotacemi, vede k robustní generalizaci v divočině.

Sapiens : Metoda a architektura

Sapiens následuje maskovaný autoencoder (MAE) přístup pro předtrénování. Model je trénován k rekonstrukci původního lidského obrázku daného jeho částečným pozorováním. Jako všechny autoencodery, model Sapiens má encoder, který mapuje viditelný obrázek na latentní reprezentaci, a decoder, který rekonstruuje původní obrázek z této latentní reprezentace. Předtrénovací datová sada se skládá z obou single a multi-lidských obrázků, s každým obrázkem přepočteným na pevnou velikost se čtvercovým poměrem. Podobně jako ViT, obrázek je rozdělen na pravidelné neoverlappingové patche s pevnou velikostí patche. Podmnožina těchto patchů je náhodně vybrána a maskována, zanechávající zbytek viditelným. Poměr maskovaných patchů k viditelným, známý jako maskovací poměr, zůstává konstantní po celou dobu trénování.

Modely Sapiens vykazují generalizaci napříč různými obrazovými charakteristikami, včetně měřítek, ořezů, věku a etnické příslušnosti subjektů a počtu subjektů. Každý patch token v modelu odpovídá 0,02% obrazové plochy ve srovnání s 0,4% ve standardních ViTs, což je 16násobné snížení – poskytující jemné inter-tokenové uvažování pro modely. I s zvýšeným maskovacím poměrem 95% model Sapiens dosahuje přijatelné rekonstrukce lidské anatomie na držených vzorcích. Rekonstrukce předtrénovaného modelu Sapiens na nevídaných lidských obrázků je demonstrována na následujícím obrázku.

Navíc, Sapiens využívá velkou soukromou datovou sadu pro předtrénování, skládající se z přibližně 1 miliardy divokých obrázků, zaměřujících se výhradně na lidské obrázky. Předzpracování zahrnuje odstranění obrázků s vodotisky, textem, uměleckými zobrazeními nebo nepřirozenými prvky. Sapiens poté využívá off-the-shelf person bounding-box detektor pro filtrování obrázků, uchovávající ty s detekční hodnotou nad 0,9 a rozměry bounding-boxu nad 300 pixelů. Více než 248 milionů obrázků v datové sadě obsahuje více subjektů.

2D odhad postoje

Rámec Sapien jemně ladí encoder a decoder v P napříč několika skelety, včetně K = 17, K = 133 a nového vysoce detailního skeletu, s K = 308, jak je ukázáno na následujícím obrázku.

Ve srovnání s existujícími formáty s maximálně 68 klíčovými body obličeje, anotace Sapien se skládají z 243 klíčových bodů obličeje, včetně reprezentativních bodů kolem očí, rtů, nosu a uší. Tento design je navržen tak, aby pečlivě zachytil jemné detaily obličejových výrazů v reálném světě. S těmito klíčovými body, rámec Sapien ručně anotoval 1 milion obrázků v rozlišení 4K z vnitřního capture nastavení. Podobně jako předchozí úkoly, nastavujeme výstupní kanály decoderu normalizátoru N na 3, odpovídající xyz komponentám normálového vektoru na každém pixelu. Generované syntetické údaje se také používají jako supervize pro normální odhad.

Sapien : Experiment a výsledky

Sapiens-2B je předtrénován pomocí 1024 A100 GPU za 18 dní s PyTorch. Sapiens využívá AdamW optimalizátor pro všechny experimenty. Učební plán zahrnuje krátké lineární zahřátí, následované kosinovým annealingem pro předtrénování a lineárním poklesem pro jemné ladění. Všechny modely jsou předtrénovány od začátku v rozlišení 1024 × 1024 s velikostí patche 16. Pro jemné ladění, vstupní obrázek je přepočten na 4:3 poměr, tj. 1024 × 768. Sapiens aplikuje standardní augmentace, jako je ořez, měřítko, flipping a fotometrické zkreslení. Náhodný pozadí z ne-lidských COCO obrázků je přidán pro segmentační, hloubkové a normální predikční úkoly. Důležité je, že Sapiens využívá diferenciální učební sazby pro zachování generalizace, s nižšími učebními sazbami pro počáteční vrstvy a postupně vyššími sazbami pro následující vrstvy. Vrstevní učební sazba poklesu je nastavena na 0,85 s váhovým poklesem 0,1 pro encoder.

Specifikace Sapiens jsou podrobně popsány v následující tabulce. Následující specifický přístup, Sapiens priorizuje škálování modelů šířkou spíše než hloubkou. Pozoruhodně, model Sapiens-0,3B, navzdory architektonické podobnosti s tradičním ViT-Large, se skládá z dvacetinásobně více FLOPs díky vyššímu rozlišení.

Sapiens je jemně laděn pro obličej, tělo, nohy a ruce (K = 308) odhad postoje pomocí vysoce kvalitních anotací. Pro trénování, Sapiens využívá trénovací sadu s 1M obrázků a pro hodnocení, využívá testovací sadu, nazvanou Humans5K, s 5K obrázků. Hodnocení následuje top-down přístup, kde Sapiens využívá off-the-shelf detektor pro bounding-boxy a provádí single lidský pose inference. Tabulka 3 ukazuje srovnání modelů Sapiens s existujícími metodami pro celkovou odhad postoje. Všechny metody jsou hodnoceny na 114 společných klíčových bodech mezi 308 klíčovými body Sapiens a 133 klíčovými body z COCO-WholeBody. Sapiens-0,6B překonává současný špičkový výkon, DWPose-l, o +2,8 AP. Na rozdíl od DWPose, který využívá komplexní student-teacher rámec s funkcí distilací pro úkol, Sapiens přijímá obecnou encoder-decoder architekturu s velkým lidským předtrénováním.

Zajímavě, i se stejným počtem parametrů, modely Sapiens vykazují lepší výkon ve srovnání se svými protějšky. Například, Sapiens-0,3B překonává VitPose+-L o +5,6 AP a Sapiens-0,6B překonává VitPose+-H o +7,9 AP. V rámci rodiny Sapiens, výsledky ukazují přímou korelaci mezi velikostí modelu a výkonem. Sapiens-2B nastavuje nový špičkový výkon s 61,1 AP, což je významné zlepšení o +7,6 AP oproti předchozím špičkovým výsledkům. Navzdory jemnému ladění s anotacemi z vnitřního capture studia, Sapiens vykazuje robustní generalizaci na reálné scénáře, jak je ukázáno na následujícím obrázku.

Sapiens je jemně laděn a hodnocen pomocí segmentační slovníku 28 tříd. Trénovací sada se skládá z 100K obrázků, zatímco testovací sada, Humans-2K, se skládá z 2K obrázků. Sapiens je srovnán s existujícími metodami segmentace částí těla, jemně laděnými na stejné trénovací sadě, využívajícími navrhované předtrénované checkpoints pro inicializaci. Podobně jako u odhadu postoje, Sapiens vykazuje generalizaci v segmentaci, jak je demonstrováno v následující tabulce.

Zajímavě, nejmenší model, Sapiens-0,3B, překonává existující špičkové metody segmentace, jako je Mask2Former a DeepLabV3+, o 12,6 mIoU díky vyššímu rozlišení a velkému lidskému předtrénování. Kromě toho, zvyšování velikosti modelu dále zlepšuje výkon segmentace. Sapiens-2B dosahuje nejlepšího výkonu, s 81,2 mIoU a 89,4 mAcc na testovací sadě, jak je ukázáno na následujícím obrázku.

Závěr

Sapiens představuje významný krok vpřed ve vývoji lidsky orientovaných modelů vidění do oblasti základních modelů. Modely Sapiens vykazují silné generalizační schopnosti napříč různými lidskými úkoly. Špičkový výkon je přisuzován: (i) velkému měřítku předtrénování na kurátorované datové sadě specificky navrženém pro pochopení lidských těl, (ii) škálovatelným, high-resolution a high-kapacitním vizuálním transformátorům a (iii) vysoce kvalitním anotacím na augmentovaném studiovém a syntetickém datu. Modely Sapiens mají potenciál stát se klíčovým stavebním kamenem pro řadu downstream úkolů a poskytnout přístup k vysoce kvalitním vizuálním základům širší komunitě.

Inženýr z povolání, spisovatel ze srdce. Kunal je technický spisovatel s hlubokou láskou a porozuměním pro AI a ML, který se věnuje zjednodušování složitých konceptů v těchto oblastech prostřednictvím svých přitažlivých a informačních dokumentací.