KÄ t Andersona
Zalety uzyskania tÅuszczu za pomocÄ sztucznej inteligencji

Nowy system sztucznej inteligencji moÅže realistycznie zmieniaÄ ksztaÅt ciaÅa ludzi na zdjÄciach, robiÄ c ich grubszymi, chudszymi lub bardziej umiÄÅnionymi, bez zmiany twarzy, ubrania lub tÅa. System jest szkolony na w peÅni syntetycznym zbiorze danych, ktÃģry pokazuje kaÅždÄ toÅžsamoÅÄ w wielu typach ciaÅa.
Â
Podczas gdy coraz czÄstsze stosowanie sztucznej inteligencji jako metody dokonywania drobnych korekt ksztaÅtu ciaÅa w sieciach spoÅecznoÅciowych lub (potencjalnie) do modyfikacji typÃģw ciaÅa do celÃģw efektÃģw wizualnych, stosowanie uczenia maszynowego do zmiany wyglÄ du osÃģb moÅže speÅniaÄ waÅžniejszÄ funkcjÄ: pomagaÄ osobom z zaburzeniami odÅžywiania zrozumieÄ ich wÅasnÄ dysmorficznÄ interpretacjÄ wyglÄ du, a takÅže oferowaÄ potencjalne motywacyjne narzÄdzie do ogÃģlnych celÃģw sportowych i fitness:

Z artykuÅu âBody size estimation in women with anorexia nervosa and healthy controls using 3D avatarsâ, GUI do wizualizacji zmian ksztaÅtu ciaÅa. Osoby z dysmorficznym wyglÄ dem ciaÅa mogÄ mieÄ trudnoÅci z powiÄ zaniem realistycznej interpretacji ich ciaÅa z podobnym obrazem, dajÄ c klinicystom miarÄ dysmorficznych odpowiedzi, miÄdzy innymi. ÅđrÃģdÅo: https://www.nature.com/articles/s41598-017-15339-z.pdf
Ponadto, powszechnie poszukiwany podzbiÃģr badaÅ nad wizjÄ komputerowÄ , fashion try-on, rÃģwnieÅž ma interes w zapewnieniu dokÅadnych wizualizacji w rÃģÅžnych ksztaÅtach ciaÅa. Tymczasem ramy pracy, takie jak oferta DiffBody z 2024 roku z Uniwersytetu Tsukuba w Japonii, stworzyÅy pewne imponujÄ ce funkcjonalnoÅci w tej dziedzinie:

NiektÃģre z transformacji moÅžliwych za pomocÄ wczeÅniejszej techniki DiffBody. ÅđrÃģdÅo: https://arxiv.org/pdf/2401.02804
PoniewaÅž podstawowe modele sztucznej inteligencji sÄ zoptymalizowane w kierunku konwencjonalnie atrakcyjnych lub innych powszechnych ksztaÅtÃģw ciaÅa, nietypowe rozmiary, takie jak âotyÅyâ, sÄ albo minimalnie dostÄpne w standardowych modelach, albo majÄ pewne karzÄ ce uprzedzenia.
Para koniecznoÅci
Jednym z najwiÄkszych wyzwaÅ w tworzeniu systemÃģw sztucznej inteligencji, ktÃģre mogÄ realistycznie dodawaÄ lub usuwaÄ tÅuszcz i miÄÅnie z obrazÃģw osÃģb, bez zmiany ich toÅžsamoÅci, Årodowiska lub ubrania, jest to, Åže wymaga to parowego szkolenia, gdzie system sztucznej inteligencji skutecznie uczy siÄ âprzedâ i âpoâ obrazÃģw, ktÃģre definiujÄ kaÅždÄ transformacjÄ, jakÄ model ma wykonaÄ.
Ten rodzaj szkolenia wrÃģciÅ do Åask w ciÄ gu lata dziÄki sukcesowi serii modeli Kontext firmy Black Forest Labs, gdzie tego rodzaju sparowane dane byÅy uÅžywane do nauczenia modeli szeregu transformacji:

Z witryny Flux Kontext, przykÅad transformacji, ktÃģra odzwierciedla rodzaj danych ÅšrÃģdÅowych potrzebnych do szkolenia modelu zdolnego do zachowania integralnoÅci obrazu przy wprowadzaniu duÅžych zmian. ÅđrÃģdÅo: https://bfl.ai/models/flux-kontext
OczywiÅcie, w przypadku opracowania modelu, ktÃģry moÅže znacznie zmieniÄ wyglÄ d osoby (bez ponownego wyobraÅženia caÅego obrazu), potrzebne jest coÅ, co jest caÅkowicie niemoÅžliwe w Åwiecie rzeczywistym: radykalne âprzedâ i âpoâ obrazy zrobione tylko sekundy od siebie.
JedynÄ moÅžliwoÅciÄ jest dane syntetyczne. NiektÃģre projekty tego rodzaju wykorzystywaÅy indywidualne, wysiÅkowe kontrastowe pary utworzone rÄcznie w programie Photoshop; jednak jest to nierzeczywiste w skali, a automatyczny lub pÃģÅautomatyczny, napÄdzany sztucznÄ inteligencjÄ proces generowania par jest teraz coraz czÄÅciej uwaÅžany za preferowany.
Problem z opartymi na GAN i wiÄkszoÅci opartych na SMPL/X podejÅciach (gdzie wirtualna postaÄ CGI sÅuÅžy jako rodzaj mechanizmu wymiany miÄdzy rzeczywistymi obrazami a poÅžÄ danymi transformacjami), a takÅže podejÅciami, ktÃģre wykorzystujÄ wyginanie obrazu, polega na tym, Åže tÅo i toÅžsamoÅÄ cierpiÄ w tym procesie.

Parametryczne, wektorowe modele CGI, takie jak SMPL i SMPL-X (miÄdzy innymi), zapewniajÄ okreÅlone konwencjonalne wspÃģÅrzÄdne fizyczne 3D, ktÃģre mogÄ byÄ interpretowane i wÅÄ czone do ram wizji komputerowej. ÅđrÃģdÅo: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf
PoniewaÅž waÅžne jest, aby sztuczna inteligencja nauczyÅa siÄ zmieniaÄ tylko poÅžÄ dane aspekty, zamiast uczyÄ siÄ wyginania tÅa i powielania innych niepoÅžÄ danych bÅÄdÃģw, Åžaden system zmiany ciaÅa nie osiÄ gnÄ Å jeszcze idealnego rozwiÄ zania.
Jeden z niedawnych artykuÅÃģw z Indii proponuje jednak znaczÄ cy postÄp w stanie sztuki za pomocÄ starszego modelu dyfuzji Flux, uzupeÅnionego o szereg dodatkowych podejÅÄ, ktÃģre umoÅžliwiajÄ lepszy i bardziej spÃģjny zestaw sparowanych danych:

PrzykÅady zestawu danych z nowego projektu. ÅđrÃģdÅo: https://arxiv.org/pdf/2508.13065
Projekt skÅada siÄ z nowego i obszernego zestawu sparowanych danych; Odo, modelu dyfuzji generatywnej szkolonego na tych danych; oraz specjalnie opracowanego nowego benchmarku zaprojektowanego do iloÅciowej oceny wydajnoÅci edycji ksztaÅtu ciaÅa. W testach autorzy twierdzÄ , Åže osiÄ gnÄli znaczÄ cy postÄp w porÃģwnaniu z podobnymi modelami.
Nowy artykuÅ nosi tytuÅ Odo: Depth-Guided Diffusion for Identity-Preserving Body Reshaping i pochodzi od trzech badaczy z Fast Code AI Pvt. Ltd w Bangalore.
Dane i metoda
Zestaw danych stworzony przez badaczy zawiera 7 615 wysokich rozdzielczoÅci (960Ã1280 px) obrazÃģw dla kaÅždego docelowego typu ciaÅa (tÅusty, chudy i umiÄÅniony).
PoczÄ tkowo wygenerowano 1 523 twarze ludzkie za pomocÄ 12-miliardowego modelu dyfuzji FLUX.1-dev, wykorzystujÄ c pewnÄ nieokreÅlonÄ liczbÄ bezpÅatnych twarzy referencyjnych z Pexels i Unsplash, aby zwiÄkszyÄ rÃģÅžnorodnoÅÄ.
Aby wygenerowaÄ peÅne obrazy ciaÅa, ktÃģre zawierajÄ te twarze, badacze wykorzystali ofertÄ PuLID firmy ByteDance z 2024 roku, punkt kontrolny dostrajany na podstawie podstawowego modelu Flux, zawierajÄ cy kontrastowÄ stratÄ toÅžsamoÅci zaprojektowanÄ w celu zachowania toÅžsamoÅci twarzy podczas procesÃģw transformacyjnych:

PrzykÅady z projektu PuLID. ÅđrÃģdÅo: https://arxiv.org/pdf/2404.16022
Model otrzymywaÅ obraz twarzy i standaryzowany komunikat z proÅbÄ o pÅeÄ, ubranie, pozycjÄ, scenÄ, a takÅže typ ciaÅa chudy, tÅusty lub umiÄÅniony.
Trzy obrazy typÃģw ciaÅa dla kaÅždej toÅžsamoÅci czasami wykazywaÅy niewielkie przesuniÄcia w wyrÃģwnaniu tÅa i postrzeganym rozmiarze obiektu, wynikajÄ ce z stochastycznego zachowania modeli dyfuzji, gdzie kaÅžda generacja zaczyna siÄ od nowego szumu nasienia. Nawet niewielkie zmiany w komunikacie, takie jak modyfikacja opisu typu ciaÅa, mogÄ wpÅynÄ Ä na trajektoriÄ modelu w przestrzeni latentnej i spowodowaÄ wizualne dryfowanie.
Aby skorygowaÄ tÄ zmiennoÅÄ, zastosowano czterostopniowy automatyczny potok przetwarzania, z chudy obrazem w kaÅždym triplikacie wybranym jako odniesienie, poniewaÅž jego mniejszy sylwet wyeksponowaÅ wiÄcej tÅa.
Wykrywanie osÃģb wykonano przy uÅžyciu RT-DETRv2, a nastÄpnie segmentacjÄ przy uÅžyciu SAM 2.1 w celu wyodrÄbnienia masek obiektÃģw dla wszystkich trzech typÃģw ciaÅa. Obraz chudy referencyjny zostaÅ nastÄpnie przekazany do FLUX.1 Kontext Pro (nowszego systemu edycji obrazu) do wypeÅnienia tÅa, wytwarzajÄ c czystÄ wersjÄ sceny z usuniÄtym obiektem.
Warianty tÅusty i umiÄÅniony zostaÅy przeskalowane przy uÅžyciu jednolitej skali, aby dopasowaÄ wysokoÅÄ do cienkiego odniesienia maski, i zÅoÅžone na czyste tÅo w tym samym dolnym wyrÃģwnaniu, zapewniajÄ c spÃģjne ramy we wszystkich obrazach.
Autorzy stwierdzajÄ :
âWynikajÄ ce z tego triplety transformacji (chudy, tÅusty i miÄÅniowy) majÄ identyczne tÅo i jednorodnÄ skalÄ obiektu. To usuwa nieistotne zmiennoÅci, ktÃģre mogÅyby negatywnie wpÅynÄ Ä na pÃģÅšniejsze szkolenie lub ocenÄ.â
KaÅždy triplik obrazÃģw chudych, tÅustych i umiÄÅnionych pozwalaÅ na szeÅÄ moÅžliwych par transformacji, w wyniku czego powstaÅo 45 690 teoretycznych kombinacji w 7 615 toÅžsamoÅciach.
Po odfiltrowaniu przykÅadÃģw z niezgodnymi ubraniami, nienaturalnymi pozycjami, znieksztaÅconymi koÅczynami, dryfowaniem toÅžsamoÅci lub minimalnymi zmianami ksztaÅtu, pozostawiono 18 573 wysokiej jakoÅci pary. ChociaÅž pewne niewielkie rÃģÅžnice w pozycji pozostaÅy, model okazaÅ siÄ odporny na te zmiennoÅci.
Szkolenie i testy
WynikajÄ ce z tego obrazy zostaÅy wykorzystane do szkolenia modelu Odo â podejÅcia opartego na dyfuzji do zmiany ksztaÅtu ciaÅa ludzi, z uÅžyciem map Skinned Multi-Person Linear Model (SMPL, czyli poÅredni CGI).
Na podstawie metod Neural Localizerâs z 2024 roku, dane zostaÅy dostosowane do postaci SMPL dla kaÅždej osoby, a wynikajÄ ce parametry optymalizacji byÅy w stanie wytworzyÄ mapy gÅÄbi z ktÃģrych pochodzÄ zmienione obrazy:

Schemat potoku szkoleniowego. Lewa strona pokazuje ustawienie szkolenia, gdzie mapy gÅÄbi SMPL z obrazu docelowego prowadzÄ ReshapeNet za pomocÄ ControlNet do wykonania transformacji ciaÅa. Cechy z obrazu ÅšrÃģdÅowego sÄ wyodrÄbnione przez ReferenceNet i scalone z ReshapeNet za pomocÄ przestrzennego uwagi selbst. Prawa strona pokazuje inferencjÄ, gdzie parametry SMPL sÄ szacowane z obrazu wejÅciowego, modyfikowane przez atrybuty semantyczne i renderowane w mapÄ gÅÄbi docelowÄ , ktÃģra warunkuje ReshapeNet podczas odwracania szumu w celu wytworzenia ostatecznego przeksztaÅconego obrazu.
Model (patrz schemat powyÅžej) skÅada siÄ z moduÅu ReshapeNet, wspieranego przez trzy pomocnicze moduÅy: ReferenceNet; moduÅ IP-Adapter; oraz moduÅ ControlNet oparty na gÅÄbi.
ReferenceNet wyodrÄbnia szczegÃģÅowe cechy, takie jak tÅo, ubranie i toÅžsamoÅÄ z obrazu wejÅciowego, i przekazuje je do ReshapeNet. IP-Adapter przyczynia siÄ do wysokiego poziomu kierowania cechami, podczas gdy ControlNet oparty na gÅÄbi stosuje warunkowanie SMPL, aby skierowaÄ transformacjÄ ciaÅa. Zgodnie z poprzednimi pracami, wykorzystano SDXL-oparty zamroÅžony UNet do wyodrÄbnienia poÅrednich cech.
JeÅli chodzi o moduÅ IP-Adapter, ten koduje obraz wejÅciowy za pomocÄ CLIP, a wynikajÄ ce wektory sÄ scalone z powrotem do ReshapeNet za pomocÄ uwagi krzyÅžowej.
JeÅli chodzi o moduÅ ControlNet oparty na gÅÄbi, ten kieruje warstwami Årodkowymi i dekodujÄ cymi ReshapeNet za pomocÄ poÅÄ czeÅ resztowych. NastÄpnie bierze mapÄ gÅÄbi wyrenderowanÄ z parametrÃģw SMPL docelowych i wyrÃģwnuje jÄ z obrazem docelowym.
ReshapeNet, oparty na SDXL UNet, jest sieciÄ centralnÄ Odo. Podczas szkolenia obrazy docelowe sÄ kodowane w przestrzeni latentnej za pomocÄ autoencoderu wariancji, zaszumione w czasie i nastÄpnie odszumione przez ReshapeNet za pomocÄ cech z ControlNet i ReferenceNet.
Kategoryzowane tekstowe komunikaty, takie jak âZrÃģb osobÄ tÅustszÄ â, âZrÃģb osobÄ chudszÄ â lub âZrÃģb osobÄ umiÄÅnionÄ â, zostaÅy dodane, aby skierowaÄ transformacje. Podczas gdy mapy gÅÄbi przechwytywaÅy ogÃģlne ksztaÅty ciaÅa, komunikaty dostarczyÅy semantyczne szczegÃģÅy potrzebne do zmian, takich jak definicja miÄÅni, pozwalajÄ c modelowi wytworzyÄ bardziej dokÅadne i realistyczne modyfikacje.
WdroÅženie szkolenia
Odo zostaÅ wyszkolony na syntetycznym zbiorze danych projektu, poÅÄ czonym z podzbiorem DeepFashion-MultiModal, co daÅo w sumie 20 000 par obrazÃģw.
Dane DeepFashion-MultiModal dostarczyÅy rÃģÅžnorodnoÅÄ w odzieÅžy i cechach twarzy, z obrazami sparowanymi przeciwko sobie podczas szkolenia. Ze wszystkimi mapami gÅÄbi SMPL wczeÅniej obliczonymi dla wydajnoÅci, szkolenie trwaÅo 60 epok na jednej karcie graficznej NVIDIA A100 z 80 GB pamiÄci VRAM.
Przy rozmiarze obrazÃģw wejÅciowych 768Ã1024, wykorzystano optymalizator Adam przy wspÃģÅczynniku uczenia 1Ã10âŧâĩ. ReshapeNet zostaÅ zainicjowany z wagami SDXL UNet i dostrojony wspÃģlnie z IP-Adapter z jego punktu kontrolnego.
ReferenceNet zostaÅ zainicjowany z wagami SDXL i pozostawaÅ zamroÅžony, podczas gdy ControlNet oparty na gÅÄbi wykorzystywaÅ wstÄpnie wyszkolone wagi i rÃģwnieÅž pozostawaÅ zamroÅžony.
Ostateczny model wymagaÅ okoÅo 23 GB pamiÄci GPU, wymagajÄ c 18 sekund na inferencjÄ jednego obrazu.
Nowy wskaÅšnik
Brak zestawÃģw danych tego rodzaju wymaganych do tego rodzaju projektu oznaczaÅ, Åže nie istniaÅy Åžadne istniejÄ ce wskaÅšniki, ktÃģre naprawdÄ rozwiÄ zywaÅyby wyzwanie. Dlatego autorzy opracowali nowy benchmark, skÅadajÄ cy siÄ z 3 600 par obrazÃģw, zawierajÄ cych rzeczywiste obrazy twarzy i opisy tÅa, a takÅže rÃģÅžnorodne zmiany ksztaÅtu ciaÅa.
Inne wykorzystane wskaÅšniki to WskaÅšnik PodobieÅstwa Strukturalnego (SSIM); WspÃģÅczynnik SygnaÅu do Szumu (PSNR); Nauczona Perceptualna PodobieÅstwo Patches Obrazu (LPIPS); oraz Skalowany BÅÄ d Euclidesowy na WierzchoÅku w neutralnej (T-)pozycji (PVE-T-SC).
Najpierw autorzy przetestowali swojÄ metodÄ jakoÅciowo na obrazach z dzikiej przyrody (obrazach, ktÃģrych model nie widziaÅ podczas szkolenia):

Testy jakoÅciowe. PrzykÅady konwersji z oryginalnego obrazu do cienkiego, tÅustego i umiÄÅnionego typu ciaÅa w rÃģÅžnych pozycjach, w tym siedzÄ cych i stojÄ cych. ProszÄ odnieÅÄ siÄ do oryginalnego artykuÅu w celu uzyskania lepszej definicji i szczegÃģÅÃģw.
Z tych wynikÃģw artykuÅ stwierdza:
â[Nasza] metoda skutecznie radzi sobie z rÃģÅžnymi pozycjami, tÅami i ubraniem, zachowujÄ c toÅžsamoÅÄ osoby.
âOprÃģcz ksztaÅtÃģw docelowych SMPL, dostarczamy tekstowe komunikaty â âZrÃģb osobÄ tÅustszÄ â, âZrÃģb osobÄ chudszÄ â lub âZrÃģb osobÄ umiÄÅnionÄ â â aby wyraÅšnie skierowaÄ poÅžÄ dane transformacjeâĶ
âĶ'[PoniÅžszy obraz] dodatkowo demonstruje moÅžliwoÅÄ naszego modelu do wykonywania rÃģÅžnorodnych transformacji ksztaÅtu. Model dokÅadnie podÄ Åža za mapami gÅÄbi SMPL, aby wygenerowaÄ wiele wariantÃģw wersji chudszych i tÅustszych od obrazu referencyjnego.â
<img class=" wp-image-222141" src="https://www.unite.ai/wp-content/uploads/2025/08/figure-1-3.jpg" alt="Dalsze testy jakoÅciowe obejmujÄ
ce zakres typÃģw ciaÅa docelowych. ProszÄ odnieÅÄ siÄ do oryginalnego artykuÅu w celu uzyskania lepszej definicji i szczegÃģÅÃģw.
Autorzy komentujÄ dalej:
âNasze wyniki demonstrujÄ bardziej realistyczne transformacje zgodnie z docelowÄ wagÄ , poniewaÅž nasz model jednoczeÅnie dostosowuje ogÃģlny ksztaÅt ciaÅa, proporcje koÅczyn i ubranie, w wyniku czym powstajÄ anatomicznie spÃģjne i wizualnie przekonywajÄ ce modyfikacje.â
Dla testÃģw iloÅciowych autorzy zestawili swÃģj system z modelem otwartoÅšrÃģdÅowym FLUX.1 Kontext [dev] i ofertÄ Structure-Aware Flow Generation for Human Body Reshaping z 2022 roku.
Dla FLUX.1 Kontext [dev] komunikaty zostaÅy opracowane w celu poinstruowania âZrÃģb osobÄ tÅustszÄ â, âZrÃģb osobÄ chudszÄ â lub âZrÃģj osobÄ umiÄÅnionÄ â, z okreÅlonÄ wagÄ docelowÄ â chociaÅž brak drobnych kontroli ograniczaÅ wydajnoÅÄ:
![PorÃģwnanie Odo z Structure-Aware Flow Generation for Human Body Reshaping i FLUX.1 Kontext [dev] na zestawie testowym, wraz z wynikami ablacjacji dla modeli szkolonych bez warunkowania komunikatÃģw w ReshapeNet, bez ReferenceNet (wykorzystujÄ
c tylko IP-Adapter) i z szkoleniem ograniczonym do zestawu BR-5K. Tabela zawiera rÃģwnieÅž materiaÅy zwiÄ
zane z badaniami ablacjacji (BR-5K), ktÃģrych tutaj nie omawiamy.](https://www.unite.ai/wp-content/uploads/2025/08/table-2-1.jpg)
PorÃģwnanie Odo z Structure-Aware Flow Generation for Human Body Reshaping i FLUX.1 Kontext [dev] na zestawie testowym, wraz z wynikami ablacjacji (nie omawianymi w tym artykule) dla modeli szkolonych bez warunkowania komunikatÃģw w ReshapeNet, bez ReferenceNet (wykorzystujÄ
c tylko IP-Adapter) i z szkoleniem ograniczonym do zestawu BR-5K.
Wnioski
Pojawienie siÄ Flux Kontext w tym roku, a nawet niedawne wydanie niewaÅžonych wag dla Qwen Image Edit, przywrÃģciÅy sparowane dane obrazÃģw do centrum uwagi spoÅecznoÅci hobbystÃģw i profesjonalistÃģw. W klimacie rosnÄ cej krytyki i niecierpliwoÅci dotyczÄ cej niedokÅadnoÅci generatywnej sztucznej inteligencji, modele tego rodzaju sÄ zaprojektowane do znacznie wiÄkszej wiernoÅci obrazom ÅšrÃģdÅowym (chociaÅž mniejsze modele sÄ czasem ograniczone przez swoje bardzo szczegÃģÅowe cele szkoleniowe).
W tym przypadku uÅžytecznoÅÄ systemu zmiany ciaÅa wydaje siÄ leÅžeÄ w dziedzinach psychologicznych, medycznych i modowych. Niemniej jednak pozostaje moÅžliwe, Åže systemy tego rodzaju osiÄ gnÄ wyÅžszy poziom popularnoÅci i, byÄ moÅže, bardziej swobodny i potencjalnie niepokojÄ cy zestaw zastosowaÅ.
Â
Pierwotnie opublikowane w poniedziaÅek, 25 sierpnia 2025












