Modele i platformy AI
Sapiens: Przełom w modelach widzenia ludzkiego
Niezwykły sukces dużych, z پیشtreningowanych modeli językowych, a następnie dostosowanych do konkretnych zadań, ustanowił ten podejście jako standardową praktykę. Podobnie, metody komputerowego widzenia stopniowo przyjmują obszerne skale danych do przedtreningu. Pojawienie się dużych zbiorów danych, takich jak LAION5B, Instagram-3.5B, JFT-300M, LVD142M, Visual Genome i YFCC100M, umożliwiło eksplorację korpusu danych poza zakresem tradycyjnych benchmarków. Wyróżniająca się praca w tym obszarze obejmuje DINOv2, MAWS i AIM. DINOv2 osiąga najlepsze wyniki w generowaniu samodzielnych funkcji poprzez skalowanie metody kontrastowej iBot na zbiorze danych LDV-142M. MAWS badają skalowanie maskowanych-autoencoderów (MAE) na miliardzie obrazów. AIM eksploruje skalowalność autoregresyjnego wstępnego treningu wizualnego, podobnego do BERT dla transformatorów wizualnych. W przeciwieństwie do tych metod, które koncentrują się głównie na ogólnym przedtreningu obrazów lub klasyfikacji obrazów zero-shot, Sapiens przyjmuje wyraźnie ludzko-orientowane podejście: modele Sapiens wykorzystują ogromną kolekcję obrazów ludzkich do przedtreningu, a następnie dostosowują się do szeregu zadań związanych z ludźmi.
Znaczny postęp został dokonany w kontrolowanych lub studiu środowiskach, jednak nadal istnieją wyzwania w rozszerzaniu tych metod na środowiska nieograniczone. Aby rozwiązać te wyzwania, rozwijanie modeli wielofunkcyjnych, zdolnych do wykonywania wielu podstawowych zadań, takich jak estymacja punktów kluczowych, segmentacja części ciała, estymacja głębokości i predykcja normalnej powierzchni z obrazów w naturalnych ustawieniach, jest kluczowe. W tym pracy Sapiens ma na celu rozwinięcie modeli dla tych podstawowych zadań widzenia ludzkiego, które uogólniają się do ustawień w środowisku.
Sapiens prezentuje rodzinę modeli dla czterech podstawowych zadań widzenia ludzkiego: estymacji pozy 2D, segmentacji części ciała, estymacji głębokości i predykcji normalnej powierzchni. Modele Sapiens natywnie obsługują inferencję o wysokiej rozdzielczości 1K i są niezwykle łatwe do adaptacji do poszczególnych zadań poprzez proste dostosowanie modeli wstępnie trenowanych na ponad 300 milionach obrazów ludzkich w środowisku. Sapiens obserwuje, że przy tym samym budżecie obliczeniowym, samodzielny przedtrening na starannie wybranym zbiorze danych obrazów ludzkich znacznie zwiększa wydajność dla różnorodnego zestawu zadań związanych z ludźmi. Wynikowe modele wykazują zdumiewającą ogólną zdolność do generalizacji do danych w środowisku, nawet gdy dane etykietowane są rzadkie lub całkowicie syntetyczne.
Sapiens: Przełom w modelach widzenia ludzkiego
Ostatnie lata zaowocowały znacznym postępem w generowaniu fotorealistycznych ludzi w 2D i 3D. Sukces tych metod jest w dużej mierze przypisywany solidnej estymacji różnych aktywów, takich jak punkty kluczowe 2D, drobna segmentacja części ciała, głębokość i normalna powierzchni. Jednakże, solidna i dokładna estymacja tych aktywów pozostaje aktywnym obszarem badań, a skomplikowane systemy do zwiększania wydajności dla poszczególnych zadań często utrudniają szersze przyjęcie. Ponadto, uzyskanie dokładnych adnotacji w środowisku jest notorycznie trudne do skalowania. Celem Sapiens jest dostarczenie zjednoczonego frameworku i modeli do inferencji tych aktywów w środowisku, odblokowując szeroki zakres aplikacji związanych z ludźmi dla wszystkich.
Sapiens twierdzi, że takie modele ludzko-orientowane powinny spełniać trzy kryteria: uogólnienie, szeroką stosowalność i wysoką wierność. Uogólnienie zapewnia wytrzymałość na niewidziane warunki, umożliwiając modelowi wykonywanie się w sposób ciągły w różnych środowiskach. Szeroka stosowalność wskazuje na wszechstronność modelu, czyniąc go odpowiednim do szerokiego zakresu zadań z minimalnymi modyfikacjami. Wysoka wierność oznacza zdolność modelu do generowania precyzyjnych, wysokich rozdzielczości danych wyjściowych, niezbędnych do zadań generowania ludzi.
Po uzyskaniu tych spostrzeżeń, Sapiens wykorzystuje duże zbiory danych i skalowalne architektury modeli, kluczowe dla uogólnienia. Dla szerszej stosowalności, Sapiens przyjmuje podejście przedtreningu, a następnie dostosowania do konkretnych zadań z minimalnymi modyfikacjami. To podejście podnosi kluczowe pytanie: jaki rodzaj danych jest najbardziej skuteczny do przedtreningu? Biorąc pod uwagę ograniczenia obliczeniowe, czy należy skupić się na zbieraniu jak największej liczby obrazów ludzkich, czy jest lepiej przedtreningować na mniej starannie wybranym zbiorze, aby lepiej odzwierciedlić rzeczywistą zmienność? Istniejące metody często pomijają dystrybucję danych przedtreningowych w kontekście zadań dolnych. Aby zbadać wpływ dystrybucji danych przedtreningowych na zadania związane z ludźmi, Sapiens zbiera zbiór danych Humans-300M, zawierający 300 milionów różnorodnych obrazów ludzkich.
Wśród różnych metod samodzielnych do nauki ogólnych funkcji wizualnych z dużych zbiorów danych, Sapiens wybiera podejście maskowanego-autoencodera (MAE) ze względu na jego prostotę i wydajność w przedtreningu. MAE, mający model inferencyjny jednopasmowy w porównaniu z kontrastowymi lub wieloinferencyjnymi strategiami, pozwala na przetwarzanie większej ilości obrazów przy tych samych zasobach obliczeniowych. Dla wyższej wierności, w przeciwieństwie do poprzednich metod, Sapiens zwiększa rodzimą rozdzielczość przedtreningu do 1024 pikseli, co skutkuje wzrostem o około 4-krotny wzrostem FLOPs w porównaniu z największym istniejącym modelem wizualnym.

Zgodnie z poprzednimi badaniami, Sapiens potwierdza kluczowy wpływ jakości etykiet na wyniki modelu w środowisku. Publiczne benchmarki często zawierają szumy etykiet, zapewniając niespójne sygnały nadzorcze podczas dostosowania modelu. Jednocześnie ważne jest wykorzystanie drobnych i precyzyjnych adnotacji, aby ściśle dopasować się do głównego celu Sapiens, którym jest cyfryzacja ludzi 3D. W tym celu Sapiens proponuje znacznie gęstszy zbiór punktów kluczowych 2D dla estymacji pozy i szczegółowy słownik klas dla segmentacji części ciała, przewyższający zakres poprzednich zbiorów danych.

Sapiens: Metoda i Architektura
Sapiens stosuje podejście maskowanego-autoencodera (MAE) do przedtreningu. Model jest trenowany do odtworzenia oryginalnego obrazu ludzkiego na podstawie jego częściowego obserwowania. Podobnie jak wszystkie autoencodery, model Sapiens ma encoder, który mapuje widoczny obraz na reprezentację latentną, i decoder, który odtwarza oryginalny obraz z tej reprezentacji latentnej.
Modele Sapiens wykazują uogólnienie na różnorodne cechy obrazów, w tym skalę, cięcia, wiek i etniczność osób, a także liczbę osób. Każdy token patch w modelu odpowiada za 0,02% powierzchni obrazu w porównaniu z 0,4% w standardowych ViT, co stanowi 16-krotny spadek – zapewniając drobne wnioskowanie między-tokenowe dla modeli.

Estymacja Pozy 2D
Ramka Sapien dostosowuje encoder i decoder w P przez wiele szkieletów, w tym K = 17, K = 133 i nowy, bardzo szczegółowy szkielet, z K = 308, jak pokazano na poniższym rysunku.

W porównaniu z istniejącymi formatami, które mają co najwyżej 68 punktów kluczowych twarzy, adnotacje Sapien składają się z 243 punktów kluczowych twarzy, w tym reprezentatywnych punktów wokół oczu, ust, nosa i uszu. Ten projekt jest dostosowany do starannego uchwycenia nuansów wyrażeń twarzy w świecie rzeczywistym.

Sapien: Eksperyment i Wyniki
Sapiens-2B jest wstępnie trenowany przy użyciu 1024 procesorów A100 przez 18 dni z PyTorch. Sapiens wykorzystuje optymalizator AdamW dla wszystkich eksperymentów. Harmonogram uczenia obejmuje krótkie rozgrzewanie liniowe, po którym następuje anulowanie kosinowe dla przedtreningu i liniowy spadek dla dostosowania.
Specyfikacje Sapiens są szczegółowo opisane w poniższej tabeli. Po przeanalizowaniu podejścia, Sapiens priorytetem jest skalowanie modeli szerokością, a nie głębokością. Godne uwagi jest to, że model Sapiens-0,3B, chociaż architekturalnie podobny do tradycyjnego ViT-Large, składa się z dwudziestokrotnie więcej FLOPs ze względu na wyższą rozdzielczość.

Sapiens jest dostosowywany do twarzy, ciała, stóp i rąk (K = 308) estymacji pozy przy użyciu adnotacji o wysokiej wierności. Do treningu Sapiens wykorzystuje zbiór treningowy z 1M obrazami, a do oceny – zbiór testowy, nazwany Humans5K, z 5K obrazami.
Wyniki wskazują, że Sapiens-0,6B przewyższa obecny stan sztuki, DWPose-l, o +2,8 AP. W przeciwieństwie do DWPose, który wykorzystuje złożoną ramę ucznia-nauczyciela z dystrybucją funkcji dostosowaną do zadania, Sapiens przyjmuje ogólną architekturę encoder-decoder z dużym, ludzko-orientowanym przedtreningiem.

Sapiens jest dostosowywany i oceniany przy użyciu słownika segmentacji 28 klas. Zbiór treningowy składa się z 100K obrazów, a zbiór testowy, Humans-2K, składa się z 2K obrazów.

Podsumowanie
Sapiens reprezentuje znaczący krok w kierunku rozwoju modeli widzenia ludzkiego w dziedzinie modeli podstawowych. Modele Sapiens wykazują silne zdolności uogólniania na różnorodne zadania związane z ludźmi. Wyniki te są przypisywane: (i) dużemu, z przedtreningiem na starannie wybranym zbiorze danych, specjalnie dostosowanym do zrozumienia ludzi, (ii) skalowanym, wysokorozdzielczym i wysokowydajnym transformatorom wizualnym, oraz (iii) wysokiej jakości adnotacjom na danych studiu i syntetycznych. Modele Sapiens mają potencjał, aby stać się kluczowym elementem budulcowym dla wielu zadań dolnych i zapewnić dostęp do wysokiej jakości wizualnych backbone’ów znacznie szerszemu gronu społeczności.












