Kąt Andersona

Przerabianie ludzkich typÃģw ciała za pomocą sztucznej inteligencji

mm
Dodaj Unite.AI do preferowanych ÅšrÃģdeł w Google

Nowe badanie przeprowadzone przez chińskich naukowcÃģw oferuje nową metodę przerabiania ludzkiego ciała na zdjęciach, wykorzystując wspÃģłrzędnie dwie sieci neuronowe, sterowane modelem parametrycznym, ktÃģry pozwala uÅžytkownikowi modyfikować wagę, wysokość i proporcje ciała w interaktywnym interfejsie graficznym.

Parametryzowana modyfikacja kształtu ciała, z suwakami modyfikującymi trzy dostępne funkcje. ÅđrÃģdło: https://arxiv.org/pdf/2203.10496.pdf

Parametryzowana modyfikacja kształtu ciała, z suwakami modyfikującymi trze dostępne funkcje. ÅđrÃģdło: https://arxiv.org/pdf/2203.10496.pdf

Praca ta oferuje kilka ulepszeń w porÃģwnaniu z poprzednim projektem z Alibaba, poniewaÅž moÅže przekonywająco modyfikować wysokość i proporcje ciała, a takÅže posiada dedykowaną sieć neuronową do “wypełniania” tła (w przypadku np. zeszklonego ciała – patrz poniÅžej).

Nazwany NeuralReshaper, nowy system dopasowuje parametryczny szablon 3D do obrazu ÅšrÃģdłowego, a następnie wykorzystuje odkształcenia w szablonie, aby dostosować oryginalny obraz do nowych parametrÃģw.

System moÅže obsługiwać transformacje ciała na zdjęciach osÃģb ubranych, a takÅže pÃģłubranych (tj. w stroju kąpielowym).

Transformacje tego typu są obecnie przedmiotem intensywnego zainteresowania sektora sztucznej inteligencji w modzie, ktÃģry wyprodukował wiele platform opartych na StyleGAN/CycleGAN i ogÃģlnych sieciach neuronowych do wirtualnych przymiarek, ktÃģre mogą dostosować dostępne ubrania do kształtu i typu ciała uÅžytkownika, lub w inny sposÃģb pomÃģc w zgodności wizualnej.

Artykuł pt. Single-image Human-body Reshaping with Deep Neural Networks, pochodzi od badaczy z Uniwersytetu Zhejiang w Hangzhou i Szkoły MediÃģw Kreatywnych na Uniwersytecie Miasta Hongkong.

Dopasowanie SMPL

NeuralReshaper wykorzystuje model Skinned Multi-Person Linear (SMPL) opracowany przez Instytut Maxa Plancka dla SystemÃģw Inteligentnych i renomowaną firmę VFX Industrial Light and Magic w 2015 roku.

Parametryczne ludzkie kształty z kolaboracji Planck/ILM z 2015 roku. ÅđrÃģdło: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf

Parametryczne ludzkie kształty z kolaboracji Planck/ILM z 2015 roku. ÅđrÃģdło: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf

W pierwszym etapie procesu generowany jest model SMPL z obrazu ÅšrÃģdłowego, do ktÃģrego mają być wprowadzane transformacje ciała. Dostosowanie modelu SMPL do obrazu odbywa się zgodnie z metodologią metody Human Mesh Recovery (HMR) zaproponowanej przez uniwersytety w Niemczech i USA w 2018 roku.

Trzy parametry odkształcenia (waga, wysokość, proporcje ciała) są obliczane na tym etapie, wraz z uwzględnieniem parametrÃģw kamery, takich jak ogniskowa. 2D punkty kluczowe i wygenerowana wyrÃģwnanie konturu zapewniają ograniczenie odkształcenia w postaci 2D konturu, dodatkowy środek optymalizacji, ktÃģry zwiększa dokładność granic i pozwala na autentyczne wypełnienie tła w dalszej części procesu.

Etap dopasowania SMPL: po lewej, obraz ÅšrÃģdłowy; drugi od lewej, wynik optymalizacji uzyskany z metody opisanej w badaniach z 2016 roku pod przewodnictwem Instytutu Maxa Plancka dla SystemÃģw Inteligentnych; trzeci od lewej, wynik inferencji bezpośredniej z pre-trenowanego modelu do odzyskiwania kształtu i pozy ludzkiej; czwarty od lewej, wyniki uzyskane po optymalizacji 2D punktÃģw kluczowych; i na koniec, po prawej, ukończone dopasowanie po optymalizacji konturu (patrz powyÅžej).

Etap dopasowania SMPL: po lewej, obraz ÅšrÃģdłowy; drugi, wynik optymalizacji uzyskany z metody opisanej w badaniach z 2016 roku pod przewodnictwem Instytutu Maxa Plancka dla SystemÃģw Inteligentnych; trzeci, wynik inferencji bezpośredniej z pre-trenowanego modelu do odzyskiwania kształtu i pozy ludzkiej; czwarty, wyniki uzyskane po optymalizacji 2D punktÃģw kluczowych; i na koniec, piąty, ukończone dopasowanie po optymalizacji konturu (patrz powyÅžej).

Odkształcenie 3D jest następnie projekowane do przestrzeni obrazu, aby umoÅžliwić gęste odkształcenie, ktÃģre zdefiniuje odkształcenie. Proces ten trwa około 30 sekund na obraz.

Architektura NeuralReshaper

NeuralReshaper uruchamia dwie sieci neuronowe jednocześnie: kodującą przednią część ciała, ktÃģra generuje przekształcony kształt ciała, oraz kodującą tło, ktÃģra koncentruje się na wypełnianiu “odkrytego” tła (w przypadku np. zeszklonego ciała – patrz poniÅžej).

Ramka w stylu U-net integruje dane wyjściowe z cech obu kodujących przed przekazaniem wyniku do zjednoczonego kodującego, ktÃģry ostatecznie produkuje nowy obraz z dwÃģch wejść. Architektura posiada nowy mechanizm przewodzenia odkształcenia, aby umoÅžliwić integrację.

Szkolenie i eksperymenty

NeuralReshaper jest wdroÅžony w PyTorch na jednej karcie graficznej NVIDIA 1080ti z 11 GB pamięci VRAM. Sieć była trenowana przez 100 epok pod kontrolą optymalizatora Adam, z generatorem ustawionym na docelowa stratę 0,0001 i dyskryminatorem na docelowa stratę 0,0004. Trenowanie odbywało się na partii o rozmiarze 8 dla własnego zestawu danych zewnętrznych (pochodzącego z COCO, MPII i LSP), oraz 2 podczas trenowania na DeepFashion.

Po lewej, oryginalne obrazy, po prawej, wynik przekształcenia NeuralReshaper.

Po lewej, oryginalne obrazy, po prawej, wynik przekształcenia NeuralReshaper.

PoniÅžej znajdują się przykłady wyłącznie z zestawu DeepFashion, przeszkolonego dla NeuralReshaper, z oryginalnymi obrazami zawsze po lewej.

Trzy kontrolowane atrybuty są rozdzielone i mogą być stosowane oddzielnie.

Transformacje na pochodzącym zestawie danych zewnętrznych są bardziej wymagające, poniewaÅž często wymagają wypełniania skomplikowanych tłÃģw i klarownego i przekonywującego wyznaczenia przekształconych typÃģw ciała:

Parametryczna konieczność

Jak zauwaÅža artykuł, takie same transformacje obrazu reprezentują niewłaściwie postawiony problem w syntezie obrazu. Wiele transformacyjnych sieci GAN i ram framework moÅže wykorzystywać sparowane obrazy (takie jak rÃģÅžne projekty zaprojektowane do wykonania transformacji szkic>foto i transformacji foto>szkic).

Jednak w tym przypadku wymagałoby to par obrazÃģw przedstawiających tych samych ludzi w rÃģÅžnych konfiguracjach fizycznych, takich jak “przed i po” obrazy w reklamach dietetycznych lub chirurgii plastycznej – dane, ktÃģre są trudne do uzyskania lub wygenerowania.

Alternatywnie, transformacyjne sieci GAN mogą być trenowane na znacznie bardziej zrÃģÅžnicowanych danych i mogą wykonywać transformacje, szukając kierunku latentnego między obrazem ÅšrÃģdłowym (oryginalnym kodem latentnym) a poŞądaną klasą (w tym przypadku “gruby”, “chudy”, “wysoki” itp.). JednakÅže, ten podejście jest obecnie zbyt ograniczone do celÃģw precyzyjnego kształtowania ciała.

Podejścia Neural Radiance Fields (NeRF) są znacznie bardziej zaawansowane w symulacji pełnego ciała niÅž większość systemÃģw opartych na GAN, ale pozostają specyficzne dla sceny i wymagające zasobÃģw, z obecnie bardzo ograniczoną moÅžliwością edycji typÃģw ciała w sposÃģb, w jaki NeuralReshaper i poprzednie projekty prÃģbują rozwiązać (poza skalowaniem całego ciała w stosunku do jego otoczenia).

Przestrzeń latentna GAN jest trudna do zarządzania; VAE same nie rozwiązują jeszcze złoÅžoności pełnej reprodukcji ciała; i moÅžliwość NeRF do ciągłej i realistycznej przebudowy ludzkich ciał jest nadal w powijakach. Dlatego teÅž włączanie “tradycyjnych” metod CGI, takich jak SMPL, wydaje się kontynuowane w sektorze syntezowania obrazu ludzkiego, jako sposÃģb na kontrolowanie, konsolidację i ujednolicenie cech, klas i kodÃģw latentnych, ktÃģrych parametry i wykorzystywanie nie są jeszcze w pełni zrozumiane w tych nowych technologiach.

 

Pierwotnie opublikowano 31 marca 2022 r.

Pisarz na temat uczenia maszynowego, specjalista w dziedzinie syntezy obrazu ludzkiego. Były kierownik treści badawczych w Metaphysic.ai, do czasu jego rozwiązania w DNEG's Brahma.ai.
Strona portfelowo: martinanderson.ai
Kontakt: [email protected]