Kąt Andersona

Zalety uzyskania tłuszczu za pomocą sztucznej inteligencji

mm
Dodaj Unite.AI do preferowanych ÅšrÃģdeł w Google
Images of synthetically altered data, from the paper 'Odo: Depth-Guided Diffusion for Identity-Preserving Body Reshaping at https://arxiv.org/abs/2508.13065

Nowy system sztucznej inteligencji moÅže realistycznie zmieniać kształt ciała ludzi na zdjęciach, robiąc ich grubszymi, chudszymi lub bardziej umięśnionymi, bez zmiany twarzy, ubrania lub tła. System jest szkolony na w pełni syntetycznym zbiorze danych, ktÃģry pokazuje kaÅždą toÅžsamość w wielu typach ciała.

 

Podczas gdy coraz częstsze stosowanie sztucznej inteligencji jako metody dokonywania drobnych korekt kształtu ciała w sieciach społecznościowych lub (potencjalnie) do modyfikacji typÃģw ciała do celÃģw efektÃģw wizualnych, stosowanie uczenia maszynowego do zmiany wyglądu osÃģb moÅže spełniać waÅžniejszą funkcję: pomagać osobom z zaburzeniami odÅžywiania zrozumieć ich własną dysmorficzną interpretację wyglądu, a takÅže oferować potencjalne motywacyjne narzędzie do ogÃģlnych celÃģw sportowych i fitness:

Z artykułu 'Body size estimation in women with anorexia nervosa and healthy controls using 3D avatars', GUI do wizualizacji zmian kształtu ciała. Osoby z dysmorficznym wyglądem ciała mogą mieć trudności z powiązaniem realistycznej interpretacji ich ciała z podobnym obrazem, dając klinicystom miarę dysmorficznych odpowiedzi, między innymi.

Z artykułu ‘Body size estimation in women with anorexia nervosa and healthy controls using 3D avatars’, GUI do wizualizacji zmian kształtu ciała. Osoby z dysmorficznym wyglądem ciała mogą mieć trudności z powiązaniem realistycznej interpretacji ich ciała z podobnym obrazem, dając klinicystom miarę dysmorficznych odpowiedzi, między innymi. ÅđrÃģdło: https://www.nature.com/articles/s41598-017-15339-z.pdf

Ponadto, powszechnie poszukiwany podzbiÃģr badań nad wizją komputerową, fashion try-on, rÃģwnieÅž ma interes w zapewnieniu dokładnych wizualizacji w rÃģÅžnych kształtach ciała. Tymczasem ramy pracy, takie jak oferta DiffBody z 2024 roku z Uniwersytetu Tsukuba w Japonii, stworzyły pewne imponujące funkcjonalności w tej dziedzinie:

NiektÃģre z transformacji moÅžliwych za pomocą wcześniejszej techniki DiffBody. ÅđrÃģdło: https://arxiv.org/pdf/2401.02804

NiektÃģre z transformacji moÅžliwych za pomocą wcześniejszej techniki DiffBody. ÅđrÃģdło: https://arxiv.org/pdf/2401.02804

PoniewaÅž podstawowe modele sztucznej inteligencji są zoptymalizowane w kierunku konwencjonalnie atrakcyjnych lub innych powszechnych kształtÃģw ciała, nietypowe rozmiary, takie jak “otyły”, są albo minimalnie dostępne w standardowych modelach, albo mają pewne karzące uprzedzenia.

Para konieczności

Jednym z największych wyzwań w tworzeniu systemÃģw sztucznej inteligencji, ktÃģre mogą realistycznie dodawać lub usuwać tłuszcz i mięśnie z obrazÃģw osÃģb, bez zmiany ich toÅžsamości, środowiska lub ubrania, jest to, Åže wymaga to parowego szkolenia, gdzie system sztucznej inteligencji skutecznie uczy się “przed” i “po” obrazÃģw, ktÃģre definiują kaÅždą transformację, jaką model ma wykonać.

Ten rodzaj szkolenia wrÃģcił do łask w ciągu lata dzięki sukcesowi serii modeli Kontext firmy Black Forest Labs, gdzie tego rodzaju sparowane dane były uÅžywane do nauczenia modeli szeregu transformacji:

Z witryny Flux Kontext, przykład transformacji, ktÃģra odzwierciedla rodzaj danych ÅšrÃģdłowych potrzebnych do szkolenia modelu zdolnego do zachowania integralności obrazu przy wprowadzaniu duÅžych zmian. ÅđrÃģdło: https://bfl.ai/models/flux-kontext

Z witryny Flux Kontext, przykład transformacji, ktÃģra odzwierciedla rodzaj danych ÅšrÃģdłowych potrzebnych do szkolenia modelu zdolnego do zachowania integralności obrazu przy wprowadzaniu duÅžych zmian. ÅđrÃģdło: https://bfl.ai/models/flux-kontext

Oczywiście, w przypadku opracowania modelu, ktÃģry moÅže znacznie zmienić wygląd osoby (bez ponownego wyobraÅženia całego obrazu), potrzebne jest coś, co jest całkowicie niemoÅžliwe w świecie rzeczywistym: radykalne “przed” i “po” obrazy zrobione tylko sekundy od siebie.

Jedyną moÅžliwością jest dane syntetyczne. NiektÃģre projekty tego rodzaju wykorzystywały indywidualne, wysiłkowe kontrastowe pary utworzone ręcznie w programie Photoshop; jednak jest to nierzeczywiste w skali, a automatyczny lub pÃģłautomatyczny, napędzany sztuczną inteligencją proces generowania par jest teraz coraz częściej uwaÅžany za preferowany.

Problem z opartymi na GAN i większości opartych na SMPL/X podejściach (gdzie wirtualna postać CGI słuÅžy jako rodzaj mechanizmu wymiany między rzeczywistymi obrazami a poŞądanymi transformacjami), a takÅže podejściami, ktÃģre wykorzystują wyginanie obrazu, polega na tym, Åže tło i toÅžsamość cierpią w tym procesie.

Parametryczne, wektorowe modele CGI, takie jak SMPL i SMPL-X (między innymi), zapewniają określone konwencjonalne wspÃģłrzędne fizyczne 3D, ktÃģre mogą być interpretowane i włączone do ram wizji komputerowej. ÅđrÃģdło: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf

Parametryczne, wektorowe modele CGI, takie jak SMPL i SMPL-X (między innymi), zapewniają określone konwencjonalne wspÃģłrzędne fizyczne 3D, ktÃģre mogą być interpretowane i włączone do ram wizji komputerowej. ÅđrÃģdło: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf

PoniewaÅž waÅžne jest, aby sztuczna inteligencja nauczyła się zmieniać tylko poŞądane aspekty, zamiast uczyć się wyginania tła i powielania innych niepoŞądanych błędÃģw, Åžaden system zmiany ciała nie osiągnął jeszcze idealnego rozwiązania.

Jeden z niedawnych artykułÃģw z Indii proponuje jednak znaczący postęp w stanie sztuki za pomocą starszego modelu dyfuzji Flux, uzupełnionego o szereg dodatkowych podejść, ktÃģre umoÅžliwiają lepszy i bardziej spÃģjny zestaw sparowanych danych:

Przykłady zestawu danych z nowego projektu. ÅđrÃģdło: https://arxiv.org/pdf/2508.13065

Przykłady zestawu danych z nowego projektu. ÅđrÃģdło: https://arxiv.org/pdf/2508.13065

Projekt składa się z nowego i obszernego zestawu sparowanych danych; Odo, modelu dyfuzji generatywnej szkolonego na tych danych; oraz specjalnie opracowanego nowego benchmarku zaprojektowanego do ilościowej oceny wydajności edycji kształtu ciała. W testach autorzy twierdzą, Åže osiągnęli znaczący postęp w porÃģwnaniu z podobnymi modelami.

Nowy artykuł nosi tytuł Odo: Depth-Guided Diffusion for Identity-Preserving Body Reshaping i pochodzi od trzech badaczy z Fast Code AI Pvt. Ltd w Bangalore.

Dane i metoda

Zestaw danych stworzony przez badaczy zawiera 7 615 wysokich rozdzielczości (960×1280 px) obrazÃģw dla kaÅždego docelowego typu ciała (tłusty, chudy i umięśniony).

Początkowo wygenerowano 1 523 twarze ludzkie za pomocą 12-miliardowego modelu dyfuzji FLUX.1-dev, wykorzystując pewną nieokreśloną liczbę bezpłatnych twarzy referencyjnych z Pexels i Unsplash, aby zwiększyć rÃģÅžnorodność.

Aby wygenerować pełne obrazy ciała, ktÃģre zawierają te twarze, badacze wykorzystali ofertę PuLID firmy ByteDance z 2024 roku, punkt kontrolny dostrajany na podstawie podstawowego modelu Flux, zawierający kontrastową stratę toÅžsamości zaprojektowaną w celu zachowania toÅžsamości twarzy podczas procesÃģw transformacyjnych:

Przykłady z projektu PuLID. ÅđrÃģdło: https://arxiv.org/pdf/2404.16022

Przykłady z projektu PuLID. ÅđrÃģdło: https://arxiv.org/pdf/2404.16022

Model otrzymywał obraz twarzy i standaryzowany komunikat z prośbą o płeć, ubranie, pozycję, scenę, a takÅže typ ciała chudy, tłusty lub umięśniony.

Trzy obrazy typÃģw ciała dla kaÅždej toÅžsamości czasami wykazywały niewielkie przesunięcia w wyrÃģwnaniu tła i postrzeganym rozmiarze obiektu, wynikające z stochastycznego zachowania modeli dyfuzji, gdzie kaÅžda generacja zaczyna się od nowego szumu nasienia. Nawet niewielkie zmiany w komunikacie, takie jak modyfikacja opisu typu ciała, mogą wpłynąć na trajektorię modelu w przestrzeni latentnej i spowodować wizualne dryfowanie.

Aby skorygować tę zmienność, zastosowano czterostopniowy automatyczny potok przetwarzania, z chudy obrazem w kaÅždym triplikacie wybranym jako odniesienie, poniewaÅž jego mniejszy sylwet wyeksponował więcej tła.

Wykrywanie osÃģb wykonano przy uÅžyciu RT-DETRv2, a następnie segmentację przy uÅžyciu SAM 2.1 w celu wyodrębnienia masek obiektÃģw dla wszystkich trzech typÃģw ciała. Obraz chudy referencyjny został następnie przekazany do FLUX.1 Kontext Pro (nowszego systemu edycji obrazu) do wypełnienia tła, wytwarzając czystą wersję sceny z usuniętym obiektem.

Warianty tłusty i umięśniony zostały przeskalowane przy uÅžyciu jednolitej skali, aby dopasować wysokość do cienkiego odniesienia maski, i złoÅžone na czyste tło w tym samym dolnym wyrÃģwnaniu, zapewniając spÃģjne ramy we wszystkich obrazach.

Autorzy stwierdzają:

‘Wynikające z tego triplety transformacji (chudy, tłusty i mięśniowy) mają identyczne tło i jednorodną skalę obiektu. To usuwa nieistotne zmienności, ktÃģre mogłyby negatywnie wpłynąć na pÃģÅšniejsze szkolenie lub ocenę.’

KaÅždy triplik obrazÃģw chudych, tłustych i umięśnionych pozwalał na sześć moÅžliwych par transformacji, w wyniku czego powstało 45 690 teoretycznych kombinacji w 7 615 toÅžsamościach.

Po odfiltrowaniu przykładÃģw z niezgodnymi ubraniami, nienaturalnymi pozycjami, zniekształconymi kończynami, dryfowaniem toÅžsamości lub minimalnymi zmianami kształtu, pozostawiono 18 573 wysokiej jakości pary. ChociaÅž pewne niewielkie rÃģÅžnice w pozycji pozostały, model okazał się odporny na te zmienności.

Szkolenie i testy

Wynikające z tego obrazy zostały wykorzystane do szkolenia modelu Odo – podejścia opartego na dyfuzji do zmiany kształtu ciała ludzi, z uÅžyciem map Skinned Multi-Person Linear Model (SMPL, czyli pośredni CGI).

Na podstawie metod Neural Localizer’s z 2024 roku, dane zostały dostosowane do postaci SMPL dla kaÅždej osoby, a wynikające parametry optymalizacji były w stanie wytworzyć mapy głębi z ktÃģrych pochodzą zmienione obrazy:

Schemat potoku szkoleniowego. Lewa strona pokazuje ustawienie szkolenia, gdzie mapy głębi SMPL z obrazu docelowego prowadzą ReshapeNet za pomocą ControlNet do wykonania transformacji ciała. Cechy z obrazu ÅšrÃģdłowego są wyodrębnione przez ReferenceNet i scalone z ReshapeNet za pomocą przestrzennego uwagi selbst. Prawa strona pokazuje inferencję, gdzie parametry SMPL są szacowane z obrazu wejściowego, modyfikowane przez atrybuty semantyczne i renderowane w mapę głębi docelową, ktÃģra warunkuje ReshapeNet podczas odwracania szumu w celu wytworzenia ostatecznego przekształconego obrazu.

Schemat potoku szkoleniowego. Lewa strona pokazuje ustawienie szkolenia, gdzie mapy głębi SMPL z obrazu docelowego prowadzą ReshapeNet za pomocą ControlNet do wykonania transformacji ciała. Cechy z obrazu ÅšrÃģdłowego są wyodrębnione przez ReferenceNet i scalone z ReshapeNet za pomocą przestrzennego uwagi selbst. Prawa strona pokazuje inferencję, gdzie parametry SMPL są szacowane z obrazu wejściowego, modyfikowane przez atrybuty semantyczne i renderowane w mapę głębi docelową, ktÃģra warunkuje ReshapeNet podczas odwracania szumu w celu wytworzenia ostatecznego przekształconego obrazu.

Model (patrz schemat powyÅžej) składa się z modułu ReshapeNet, wspieranego przez trzy pomocnicze moduły: ReferenceNet; moduł IP-Adapter; oraz moduł ControlNet oparty na głębi.

ReferenceNet wyodrębnia szczegÃģłowe cechy, takie jak tło, ubranie i toÅžsamość z obrazu wejściowego, i przekazuje je do ReshapeNet. IP-Adapter przyczynia się do wysokiego poziomu kierowania cechami, podczas gdy ControlNet oparty na głębi stosuje warunkowanie SMPL, aby skierować transformację ciała. Zgodnie z poprzednimi pracami, wykorzystano SDXL-oparty zamroÅžony UNet do wyodrębnienia pośrednich cech.

Jeśli chodzi o moduł IP-Adapter, ten koduje obraz wejściowy za pomocą CLIP, a wynikające wektory są scalone z powrotem do ReshapeNet za pomocą uwagi krzyÅžowej.

Jeśli chodzi o moduł ControlNet oparty na głębi, ten kieruje warstwami środkowymi i dekodującymi ReshapeNet za pomocą połączeń resztowych. Następnie bierze mapę głębi wyrenderowaną z parametrÃģw SMPL docelowych i wyrÃģwnuje ją z obrazem docelowym.

ReshapeNet, oparty na SDXL UNet, jest siecią centralną Odo. Podczas szkolenia obrazy docelowe są kodowane w przestrzeni latentnej za pomocą autoencoderu wariancji, zaszumione w czasie i następnie odszumione przez ReshapeNet za pomocą cech z ControlNet i ReferenceNet.

Kategoryzowane tekstowe komunikaty, takie jak “ZrÃģb osobę tłustszą”, “ZrÃģb osobę chudszą” lub “ZrÃģb osobę umięśnioną”, zostały dodane, aby skierować transformacje. Podczas gdy mapy głębi przechwytywały ogÃģlne kształty ciała, komunikaty dostarczyły semantyczne szczegÃģły potrzebne do zmian, takich jak definicja mięśni, pozwalając modelowi wytworzyć bardziej dokładne i realistyczne modyfikacje.

WdroÅženie szkolenia

Odo został wyszkolony na syntetycznym zbiorze danych projektu, połączonym z podzbiorem DeepFashion-MultiModal, co dało w sumie 20 000 par obrazÃģw.

Dane DeepFashion-MultiModal dostarczyły rÃģÅžnorodność w odzieÅžy i cechach twarzy, z obrazami sparowanymi przeciwko sobie podczas szkolenia. Ze wszystkimi mapami głębi SMPL wcześniej obliczonymi dla wydajności, szkolenie trwało 60 epok na jednej karcie graficznej NVIDIA A100 z 80 GB pamięci VRAM.

Przy rozmiarze obrazÃģw wejściowych 768×1024, wykorzystano optymalizator Adam przy wspÃģłczynniku uczenia 1×10âŧâĩ. ReshapeNet został zainicjowany z wagami SDXL UNet i dostrojony wspÃģlnie z IP-Adapter z jego punktu kontrolnego.

ReferenceNet został zainicjowany z wagami SDXL i pozostawał zamroÅžony, podczas gdy ControlNet oparty na głębi wykorzystywał wstępnie wyszkolone wagi i rÃģwnieÅž pozostawał zamroÅžony.

Ostateczny model wymagał około 23 GB pamięci GPU, wymagając 18 sekund na inferencję jednego obrazu.

Nowy wskaÅšnik

Brak zestawÃģw danych tego rodzaju wymaganych do tego rodzaju projektu oznaczał, Åže nie istniały Åžadne istniejące wskaÅšniki, ktÃģre naprawdę rozwiązywałyby wyzwanie. Dlatego autorzy opracowali nowy benchmark, składający się z 3 600 par obrazÃģw, zawierających rzeczywiste obrazy twarzy i opisy tła, a takÅže rÃģÅžnorodne zmiany kształtu ciała.

Inne wykorzystane wskaÅšniki to WskaÅšnik Podobieństwa Strukturalnego (SSIM); WspÃģłczynnik Sygnału do Szumu (PSNR); Nauczona Perceptualna Podobieństwo Patches Obrazu (LPIPS); oraz Skalowany Błąd Euclidesowy na Wierzchołku w neutralnej (T-)pozycji (PVE-T-SC).

Najpierw autorzy przetestowali swoją metodę jakościowo na obrazach z dzikiej przyrody (obrazach, ktÃģrych model nie widział podczas szkolenia):

Testy jakościowe. Przykłady konwersji z oryginalnego obrazu do cienkiego, tłustego i umięśnionego typu ciała w rÃģÅžnych pozycjach, w tym siedzących i stojących.

Testy jakościowe. Przykłady konwersji z oryginalnego obrazu do cienkiego, tłustego i umięśnionego typu ciała w rÃģÅžnych pozycjach, w tym siedzących i stojących. Proszę odnieść się do oryginalnego artykułu w celu uzyskania lepszej definicji i szczegÃģłÃģw.

Z tych wynikÃģw artykuł stwierdza:

‘[Nasza] metoda skutecznie radzi sobie z rÃģÅžnymi pozycjami, tłami i ubraniem, zachowując toÅžsamość osoby.

‘OprÃģcz kształtÃģw docelowych SMPL, dostarczamy tekstowe komunikaty – “ZrÃģb osobę tłustszą”, “ZrÃģb osobę chudszą” lub “ZrÃģb osobę umięśnioną” – aby wyraÅšnie skierować poŞądane transformacjeâ€Ķ

â€Ķ'[PoniÅžszy obraz] dodatkowo demonstruje moÅžliwość naszego modelu do wykonywania rÃģÅžnorodnych transformacji kształtu. Model dokładnie podÄ…Åža za mapami głębi SMPL, aby wygenerować wiele wariantÃģw wersji chudszych i tłustszych od obrazu referencyjnego.’

<img class=" wp-image-222141" src="https://www.unite.ai/wp-content/uploads/2025/08/figure-1-3.jpg" alt="Dalsze testy jakościowe obejmujące zakres typÃģw ciała docelowych. Proszę odnieść się do oryginalnego artykułu w celu uzyskania lepszej definicji i szczegÃģłÃģw.

Autorzy komentują dalej:

‘Nasze wyniki demonstrują bardziej realistyczne transformacje zgodnie z docelową wagą, poniewaÅž nasz model jednocześnie dostosowuje ogÃģlny kształt ciała, proporcje kończyn i ubranie, w wyniku czym powstają anatomicznie spÃģjne i wizualnie przekonywające modyfikacje.’

Dla testÃģw ilościowych autorzy zestawili swÃģj system z modelem otwartoÅšrÃģdłowym FLUX.1 Kontext [dev] i ofertą Structure-Aware Flow Generation for Human Body Reshaping z 2022 roku.

Dla FLUX.1 Kontext [dev] komunikaty zostały opracowane w celu poinstruowania “ZrÃģb osobę tłustszą”, “ZrÃģb osobę chudszą” lub “ZrÃģj osobę umięśnioną”, z określoną wagą docelową – chociaÅž brak drobnych kontroli ograniczał wydajność:

PorÃģwnanie Odo z Structure-Aware Flow Generation for Human Body Reshaping i FLUX.1 Kontext [dev] na zestawie testowym, wraz z wynikami ablacjacji dla modeli szkolonych bez warunkowania komunikatÃģw w ReshapeNet, bez ReferenceNet (wykorzystując tylko IP-Adapter) i z szkoleniem ograniczonym do zestawu BR-5K. Tabela zawiera rÃģwnieÅž materiały związane z badaniami ablacjacji (BR-5K), ktÃģrych tutaj nie omawiamy.

PorÃģwnanie Odo z Structure-Aware Flow Generation for Human Body Reshaping i FLUX.1 Kontext [dev] na zestawie testowym, wraz z wynikami ablacjacji (nie omawianymi w tym artykule) dla modeli szkolonych bez warunkowania komunikatÃģw w ReshapeNet, bez ReferenceNet (wykorzystując tylko IP-Adapter) i z szkoleniem ograniczonym do zestawu BR-5K.

Wnioski

Pojawienie się Flux Kontext w tym roku, a nawet niedawne wydanie niewaÅžonych wag dla Qwen Image Edit, przywrÃģciły sparowane dane obrazÃģw do centrum uwagi społeczności hobbystÃģw i profesjonalistÃģw. W klimacie rosnącej krytyki i niecierpliwości dotyczącej niedokładności generatywnej sztucznej inteligencji, modele tego rodzaju są zaprojektowane do znacznie większej wierności obrazom ÅšrÃģdłowym (chociaÅž mniejsze modele są czasem ograniczone przez swoje bardzo szczegÃģłowe cele szkoleniowe).

W tym przypadku uÅžyteczność systemu zmiany ciała wydaje się leÅžeć w dziedzinach psychologicznych, medycznych i modowych. Niemniej jednak pozostaje moÅžliwe, Åže systemy tego rodzaju osiągną wyÅžszy poziom popularności i, być moÅže, bardziej swobodny i potencjalnie niepokojący zestaw zastosowań.

 

Pierwotnie opublikowane w poniedziałek, 25 sierpnia 2025

Pisarz na temat uczenia maszynowego, specjalista w dziedzinie syntezy obrazu ludzkiego. Były kierownik treści badawczych w Metaphysic.ai, do czasu jego rozwiązania w DNEG's Brahma.ai.
Strona portfelowo: martinanderson.ai
Kontakt: [email protected]