Unghiul lui Anderson
Avantajele obținerii grăsimii prin intermediul inteligenței artificiale

Noua sistemă de inteligență artificială poate modifica realist corpul oamenilor în fotografii, făcându-i mai grași, mai slabi sau mai musculoși, fără a schimba fața, hainele sau fundalul. Sistemul este antrenat pe un set de date complet sintetic care prezintă fiecare identitate în multiple tipuri de corp.
Pe lângă utilizarea din ce în ce mai frecventă a inteligenței artificiale ca metodă de refinare a formei corpului pe rețelele sociale, sau (posibil) pentru modificarea tipului de corp pentru scopuri VFX, utilizarea învățării automate pentru a modifica aspectul indivizilor poate avea o funcție și mai importantă: ajutând indivizii cu tulburări de alimentație să înțeleagă propria interpretare distorsionată a aspectului lor, precum și oferind un posibil instrument motivațional pentru scopuri sportive și de fitness mai generale:

Din lucrarea ‘Estimarea dimensiunii corpului la femeile cu anorexie nervoasă și controlul sănătos utilizând avatare 3D’, o interfață pentru a vizualiza modificările formei corpului. Indivizii cu dismorfie corporală pot avea dificultăți în a asocia o interpretare realistă a corpului lor cu o imagine similară, oferind astfel clinicienilor un metric pentru răspunsurile dismorfe, printre alte scopuri. Sursa: https://www.nature.com/articles/s41598-017-15339-z.pdf
În plus, sub-domeniul încercat de încercări de îmbrăcăminte în cercetarea viziunii computerizate are, de asemenea, interesul de a oferi visualizări precise pe o gamă de tipuri de corp. Între timp, cadre precum DiffBody din 2024, oferit de Universitatea Tsukuba din Japonia, au creat o funcționalitate impresionantă în acest domeniu:

Unele dintre transformările posibile utilizând tehnica DiffBody anterioară. Sursa: https://arxiv.org/pdf/2401.02804
Deoarece modelele de bază ale inteligenței artificiale sunt optimizate pentru forme de corp convențional atractive sau altfel comune, dimensiuni neobișnuite, cum ar fi “obezitatea”, sunt fie minim disponibile în modelele standard, fie vin cu anumite prejudecăți.
Necesități pereche
Una dintre cele mai mari provocări în crearea sistemelor de inteligență artificială care pot modifica realist grăsimea sau mușchii în fotografii, fără a schimba identitatea, mediul sau hainele, este că acest lucru implică antrenament pereche, unde sistemul de inteligență artificială învață efectiv imagini “înainte” și “după” care definesc orice transformare pe care modelul este destinat să o execute.
Acest tip de antrenament a revenit în prim-plan pe parcursul verii datorită succesului seriei de modele de editare a imaginilor Kontext de la Black Forest Labs, unde acest tip de date pereche a fost utilizat pentru a preda o gamă de transformări modelului:

De pe site-ul Flux Kontext, un exemplu de transformare care reflectă tipul de date sursă necesare pentru a antrena un model capabil să păstreze integritatea imaginii atunci când se efectuează modificări majore. Sursa: https://bfl.ai/models/flux-kontext
În mod evident, în cazul dezvoltării unui model care poate modifica semnificativ aspectul unei persoane (fără a reimagina întreaga imagine), este nevoie de ceva care este total imposibil în lumea reală: imagini radicale “înainte” și “după” luate la doar câteva secunde distanță.
Singura soluție este datele sintetice. Unele proiecte de acest tip au utilizat perechi contrastive individuale create manual în Photoshop; cu toate acestea, acest lucru este nerealist la scară, iar un proces automat sau semi-automat, condus de inteligență artificială, pentru generarea perechilor este acum considerat din ce în ce mai mult ca fiind preferabil.
Problema cu abordările bazate pe GAN și cu majoritatea abordărilor bazate pe SMPL/X (unde o figură virtuală CGI este utilizată ca un fel de mecanism de schimb între imagini reale și transformările dorite), și cu abordările care utilizează răsucirea imaginii, este că fundalul și identitatea tind să sufere în proces.

Modele CGI parametrice și vectoriale, cum ar fi SMPL și SMPL-X (printre altele), oferă coordonate fizice 3D convenționale definite care pot fi interpretate și integrate în cadre de viziune computerizată. Sursa: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf
Deoarece este important ca inteligența artificială să învețe să modifice doar aspectele dorite, în loc de a învăța să deformeze fundaluri și să reproducă alte erori nedorite, niciun sistem de modificare a corpului nu a ajuns încă la o soluție perfectă.
Un articol recent din India propune, totuși, o avansare notabilă a stadiului actual al tehnologiei prin utilizarea cadrului mai vechi de model de difuzie Flux, îmbunătățit cu o serie de abordări secundare care permit un set de date pereche superior și mai consistent:

Exemple de set de date din noul proiect. Sursa: https://arxiv.org/pdf/2508.13065
Proiectul cuprinde un nou și extins set de date pereche; Odo, un model de difuzie generativ antrenat pe aceste date; și un benchmark nou, special conceput pentru a evalua cantitativ performanța de editare a formei umane. În testele efectuate, autorii susțin o avansare notabilă față de standardele realizate de modele comparabile.
Noul articol se intitulează Odo: Difuzie ghidată de adâncime pentru remodelarea corpului care păstrează identitatea și provine de la trei cercetători de la Fast Code AI Pvt. Ltd din Bangalore.
Date și Metodă
Setul de date creat de cercetători conține 7.615 imagini de înaltă rezoluție (960x1280px) pentru fiecare tip de corp țintă (gras, slab și musculos).
Inițial, 1.523 de fețe umane au fost generate prin modelul de difuzie FLUX.1-dev cu 12 miliarde de parametri, utilizând un număr nedefinit de fețe de referință fără drepturi de autor de la Pexels și Unsplash, pentru a crește diversitatea.
Pentru a genera imagini cu corpul întreg care includ aceste fețe, cercetătorii au utilizat oferirea ByteDance din 2024 PuLID, un punct de control reglat pe baza Flux, și care prezintă o pierdere de identitate contrastivă concepută pentru a ajuta la conservarea identității faciale în timpul proceselor de transformare:

Exemple din proiectul PuLID. Sursa: https://arxiv.org/pdf/2404.16022
Modelul a primit o imagine a feței și un prompt standardizat care solicita sex, îmbrăcăminte, poziție, scenă, precum și tipul de corp slab, gras sau musculos.
Imaginile cu trei tipuri de corp pentru fiecare identitate au prezentat uneori deplasări minore în alinierea fundalului și dimensiunea percepută a subiectului, care au apărut din comportamentul stohastic al modelelor de difuzie, unde fiecare generare pornește de la o nouă zgomot sămânță. Chiar și schimbări minore ale promptului, cum ar fi modificarea descrierii tipului de corp, pot influența traiectoria modelului în spațiul latent și pot cauza derivație vizuală.
Pentru a corecta această variație, a fost aplicată o conductă de post-procesare automată în patru etape, cu imaginea slabă din fiecare triplet selectată ca referință, deoarece silueta sa mai mică expunea mai mult fundalul.
Detectarea persoanei a fost efectuată utilizând RT-DETRv2, urmată de segmentare cu SAM 2.1 pentru a extrage măști de subiect pentru toate cele trei tipuri de corp. Imaginea slabă de referință a fost apoi trimisă la FLUX.1 Kontext Pro (noul sistem de editare a imaginilor) pentru a picta fundalul, producând o versiune curată a scenei, cu subiectul eliminat.
Variantele gras și musculos au fost redimensionate utilizând scalare uniformă pentru a se potrivi cu înălțimea măștii de referință subțire, și compuse pe fundalul curat la aceeași aliniere inferioară, asigurând cadrare consistentă pe toate imaginile.
Autorii afirmă:
‘Tripleții de transformare rezultate (slab, gras și mușchi) au un fundal identic și o scară a subiectului uniformă. Acest lucru elimină variațiile irelevante care ar putea afecta negativ antrenamentul sau evaluarea ulterioară.’
Fiecare triplet de imagini subțire, gras și muscular a permis șase perechi de transformare posibile, rezultând 45.690 de combinații teoretice pe 7.615 de identități.
După filtrarea exemplelor cu îmbrăcăminte necorespunzătoare, poziții neobișnuite, membre distorsionate, deplasare a identității sau schimbări minore ale formei, au fost păstrate 18.573 de perechi de înaltă calitate. Deși au rămas unele diferențe minore de poziție, modelul s-a dovedit a fi robust față de aceste variații.
Antrenament și Teste
Imaginile rezultate au fost utilizate pentru a antrena modelul Odo – o abordare bazată pe difuzie pentru remodelarea oamenilor, cu utilizarea hărților Skinned Multi-Person Linear Model (SMPL, adică CGI intermediar).
Inspirat de metodele Localizatorului Neural din 2024, datele au fost conforme cu figura SMPL pentru fiecare individ, parametrii optimizați rezultând capabili să producă hărți de adâncime din care imaginile modificate ar fi derivate:

Schema pentru conducta de antrenament. Partea stângă arată configurația de antrenament, unde hărțile de adâncime SMPL de la imaginea țintă ghidă ReshapeNet prin ControlNet pentru a efectua transformarea corpului. Caracteristicile de la imaginea sursă sunt extrase de ReferenceNet și integrate în ReshapeNet utilizând atenție spațială. Partea dreaptă arată inferența, unde parametrii SMPL sunt estimați din imaginea de intrare, modificați de atribute semantice și redați într-o hartă de adâncime țintă care condiționează ReshapeNet în timpul denoisingului, pentru a produce imaginea finală transformată.
Modelul (a se vedea schema de mai sus) cuprinde modulul ReshapeNet, sprijinit de trei module auxiliare: ReferenceNet; un modul IP-Adapter; și un modul ControlNet bazat pe adâncime.
ReferenceNet extrage caracteristici detaliate, cum ar fi fundal, îmbrăcăminte și identitate, din imaginea de intrare și le transmite lui ReshapeNet. IP-Adapter contribuie cu îndrumarea caracteristicilor de nivel înalt, în timp ce Depth ControlNet aplică condiționarea bazată pe SMPL pentru a ghida transformarea corpului. În conformitate cu lucrări anterioare, a fost utilizat un SDXL-bazat înghețat UNet pentru a extrage caracteristici intermediare.
În ceea ce privește modulul IP-Adapter, acesta codifică imaginea de intrare prin CLIP, iar încorporările rezultate sunt integrate înapoi în ReshapeNet prin atenție încrucișată.
În ceea ce privește modulul Depth ControlNet, acesta ghidă straturile medii și decodificatorul lui ReshapeNet utilizând conexiuni reziduale. Ulterior, acesta ia o hartă de adâncime redată din parametrii SMPL țintă și o aliniază cu imaginea țintă.
ReshapeNet, bazat pe UNet SDXL, este rețeaua centrală a lui Odo. În timpul antrenamentului, imaginile țintă sunt codificate în spațiu latent cu un autoencoder variabil, zgomotite în timp și apoi denoizate de ReshapeNet utilizând caracteristici de la ControlNet și ReferenceNet.
Prompturi de text specifice, cum ar fi “Fă persoana mai grasă”, “Fă persoana mai slabă” sau “Fă persoana mai musculară”, au fost adăugate pentru a ghida transformările. În timp ce hărțile de adâncime au capturat forme corporale grosiere, prompturile au furnizat detaliile semantice necesare pentru schimbări, cum ar fi definirea mușchilor, permițând modelului să producă modificări mai precise și realiste.
Implementarea Antrenamentului
Odo a fost antrenat pe setul de date sintetic al proiectului, combinat cu un subset al setului de date DeepFashion-MultiModal, rezultând un total de 20.000 de perechi de imagini.
Datele DeepFashion-MultiModal au oferit varietate în îmbrăcăminte și caracteristici faciale, cu imagini pereche împotriva lor însele în timpul antrenamentului. Cu toate hărțile de adâncime SMPL precalculate pentru eficiență, antrenamentul a durat 60 de epoci pe un singur GPU NVIDIA A100 cu 80GB de VRAM.
Imaginile de intrare au fost redimensionate la 768×1024, iar optimizerul Adam a fost utilizat la o rată de învățare de 1×10⁻⁵. ReshapeNet a fost inițializat cu greutăți UNet SDXL și reglat împreună cu IP-Adapter de la punctul său de control.
ReferenceNet a fost inițializat cu greutăți SDXL și a rămas înghețat, în timp ce Depth ControlNet a utilizat greutăți preantrenate și a rămas, de asemenea, înghețat.
Modelul final a necesitat aproximativ 23GB de memorie GPU, necesitând 18 secunde pentru inferența unei singure imagini.
O Metrică Nouă
Lipsa seturilor de date de acest tip necesare pentru acest tip de proiect a însemnat că niciuna dintre metricele existente nu aborda cu adevărat provocarea. Prin urmare, autorii au conceput o nouă benchmark, alcătuită din 3.600 de perechi de imagini, care prezintă imagini reale ale feței și descrieri ale fundalului, împreună cu diverse variații ale formei corpului.
Alte metrice utilizate au fost Indicele de Similaritate Structurală (SSIM); Raportul de Semnal la Zgomot de Vârf (PSNR); Similaritatea Perceptuală a Patches de Imagine Învățate (LPIPS); și Eroarea Euclidiană Corectată la Scară pe Vârf în Poziție Neutră (PVE-T-SC).
Mai întâi, autorii au testat metoda lor calitativ împotriva imaginilor din sălbăticie (imagini care nu au fost văzute de model în timpul antrenamentului):

Teste calitative. Exemplele arată conversii de la imaginea originală la tipuri de corp subțire, supraponderal și muscular în diferite poziții, inclusiv șezând și stând. Vă rugăm să consultați articolul sursă pentru o definiție și detalii mai bune.
Din aceste rezultate, articolul afirmă:
‘[Metoda noastră] gestionează eficient diverse poziții, fundaluri și îmbrăcăminte, păstrând identitatea persoanei.
‘În plus față de forme țintă SMPL, oferim prompturi textuale – “Fă persoana mai grasă”, “Fă persoana mai slabă” sau “Fă persoana mai musculară” – pentru a ghida în mod explicit transformările dorite…
…'[Imaginea de mai jos] demonstrează în continuare capacitatea modelului nostru de a efectua diverse transformări ale formei. Modelul urmează cu acuratețe hărțile de adâncime SMPL pentru a genera multiple variații ale versiunilor subțire și supraponderale de la imaginea de referință.’

Teste calitative suplimentare care acoperă gama de tipuri de corp țintă. Vă rugăm să consultați articolul sursă pentru o definiție și detalii mai bune.
Autorii mai spun:
‘Rezultatele noastre demonstrează transformări mai realiste conform greutății țintă, deoarece modelul nostru ajustează în același timp forma generală a corpului, proporțiile membrelor și îmbrăcămintea, rezultând modificări anatomice consistente și convincente din punct de vedere vizual.’
Pentru testele cantitative, autorii și-au comparat sistemul cu modelul de editare a imaginilor Flux Kontext [dev] și cu oferta din 2022 Generarea de fluxuri structurale conștiente pentru remodelarea corpului uman.
Pentru FLUX.1 Kontext [dev], prompturile au fost concepute pentru a instrui “Fă persoana mai grasă”, “Fă persoana mai slabă” sau “Fă persoana mai musculară”, cu greutăți țintă specificate – deși lipsa controalelor fine a limitat performanța:
![Comparație între Odo și Generarea de fluxuri structurale conștiente pentru remodelarea corpului uman și FLUX.1 Kontext [dev] pe setul de test, împreună cu rezultatele ablației pentru modele antrenate fără condiționarea promptului în ReshapeNet, fără ReferenceNet (utilizând doar IP-Adapter) și cu antrenamentul limitat la setul de date BR-5K. Tabela include, de asemenea, materiale legate de studii de ablație (BR-5K), pe care nu le vom acoperi aici.](https://www.unite.ai/wp-content/uploads/2025/08/table-2-1.jpg)
Comparație între Odo și Generarea de fluxuri structurale conștiente pentru remodelarea corpului uman și FLUX.1 Kontext [dev] pe setul de test, împreună cu rezultatele ablației (nu sunt acoperite în acest articol) pentru modele antrenate fără condiționarea promptului în ReshapeNet, fără ReferenceNet (utilizând doar IP-Adapter) și cu antrenamentul limitat la setul de date BR-5K.
Concluzie
Apariția Flux Kontext în acest an și, mai recent, lansarea greutăților nequantificate pentru Qwen Image Edit au readus datele pereche în prim-planul comunităților de hobby și profesionale. În climatul de critică și nerăbdare crescândă cu privire la imprecizia inteligenței artificiale generative, modele de acest tip sunt concepute pentru o fidelitate mult mai mare față de imaginile sursă (deși modelele la scară mai mică sunt uneori limitate de obiectivele lor de antrenament foarte specifice).
În acest caz, utilitatea unui sistem de remodelare a corpului pare să se afle în domeniile psihologic, medical și bazat pe modă. Cu toate acestea, rămâne posibil ca sisteme de acest tip să atingă un nivel mai ridicat de prominență și, poate, un set mai casual și chiar mai îngrijorător de utilizări.
Publicat pentru prima dată luni, 25 august 2025












