Andersonin kulma
Rasvan saaminen AI:n avulla: Edut

Uusi AI-järjestelmä voi realistisesti muuttaa ihmisten vartaloita valokuvissa, tehden heistä lihavampia, hoikempia tai lihaslisäksi, ilman että se muuttaa heidän kasvojaan, vaatteitaan tai taustaa. Järjestelmä on koulutettu täysin syntetisellä aineistolla, joka näyttää jokaisen identiteetin useiden eri vartalotyypien kautta.
AI:n käytön lisääntyessä keinona vartalon muokkaamiseen sosiaalisessa mediassa tai (mahdollisesti) VFX-tarkoituksiin, koneoppimisen käyttäminen yksilöiden ulkonäön muuttamiseen voi palvella tärkeämpää tarkoitusta: auttamaan yksilöitä, joilla on syöväongelmia ymmärtämään oman vääristyneen tulkintansa omasta ulkonäöstään, sekä tarjoamaan potentiaalisen motivaatiotyökalun yleisemmille urheilu- ja kuntoilutarkoituksiin:

Artikkelista ‘Body size estimation in women with anorexia nervosa and healthy controls using 3D avatars’, GUI visualisoida vartalonmuodon muutoksia. Yksilöt, joilla on vartalonmuodon häiriö, voivat käydä vaikeuksien kautta yhdistämään realistisen tulkinnan omasta vartalostaan samankaltaiseen kuvaan, antaen klinikoille mittarin dysmorfinen reaktioita varten, muun muassa. Source: https://www.nature.com/articles/s41598-017-15339-z.pdf
Lisäksi tietokonegrafiikkaan liittyvä muotiyritys-ala, joka pyrkii tarjoamaan tarkkoja visualisointeja eri vartalotyypeille, on kiinnostunut tästä aiheesta. Esimerkiksi Japanin Tsukuban yliopiston vuoden 2024 DiffBody-tarjonta on luonut joitakin silmiä hiveleviä toiminnallisuuksia tässä alalla:

Joitakin muodonmuutoksia, jotka ovat mahdollisia DiffBody-tekniikalla. Source: https://arxiv.org/pdf/2401.02804
Koska AI-perusmallit on optimoitu yleensä esteettisesti miellyttävien tai yleisten vartalotyypien mukaan, epätavalliset koot, kuten “ylipainoinen”, ovat joko vähäisiä tai tulevat joillakin rajoituksilla.
Parin tarpeet
Yksi suurimmista haasteista luoda AI-järjestelmiä, jotka voivat realistisesti lisätä tai vähentää rasvaa ja lihasta valokuvista ilman, että se muuttaa henkilön identiteettiä, ympäristöä tai vaatteita, on se, että se vaatii parin koulutusta, jossa AI-järjestelmä oppii “ennen” ja “jälkeen” -kuvat, jotka määrittelevät halutun muodonmuutoksen.
Tämänkaltaista koulutusta on tullut jälleen esiin kesän aikana Black Forest Labsin Kontext-sarjan kuvankäsittelymallien menestyksen myötä, joissa tällaista paria käytettiin opettamaan monia muodonmuutoksia malleille:

Esimerkki muodonmuutoksesta Flux Kontext -sivustolta, joka edustaa kaltaista lähdeaineistoa, jota tarvitaan kouluttamaan malli, joka voi säilyttää kuvan eheys, kun tehdään suuria muutoksia. Source: https://bfl.ai/models/flux-kontext
Ilmeisesti, kehittäessä mallia, joka voi merkittävästi muuttaa henkilön ulkonäköä (ilman koko kuvan uudelleenluomista), tarvitaan jotain, mikä on täysin mahdotonta todellisessa maailmassa: radikaalit “ennen” ja “jälkeen” -kuvat, jotka on otettu vain sekunteja erilleen.
Ainoa keino on synteettinen data. Joitakin tällaisia projekteja on tehty manuaalisesti luoduilla kontrastipareilla Photoshopissa; kuitenkin tämä on epärealistista suuressa mittakaavassa, ja automaattinen tai puoli-automatisoitu, AI-ohjattu prosessi parien luomiseen on nyt yhä useammin katsottu mieluummaksi.
Ongelma GAN-pohjaisilla ja useimmat SMPL/X-pohjaisilla lähestymistavoilla (jossa virtuaalinen CGI-hahmo toimii välikappaleena todellisten kuvien ja halutun muodonmuutoksen välillä), sekä lähestymistavoilla, jotka käyttävät kuvan venyttämistä, on, että tausta ja identiteetti usein kärsivät prosessissa.

Parametrinen, vektoripohjainen CGI-malli, kuten SMPL ja SMPL-X, tarjoaa määritellyt konventionaalisen fyysisen 3D-koordinaatit, jotka voidaan tulkitsemaan ja sisällyttää tietokonegrafiikkaan. Source: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf
Koska on tärkeää, että AI opi muuttamaan vain halutut osat, sen sijaan, että se opisi muuttamaan taustoja ja toistamaan muita ei-toivottuja virheitä, mikään vartalonmuokkausjärjestelmä ei ole vielä saavuttanut täydellistä ratkaisua.
Yksi viimeaikainen artikkeli Intiasta ehdottaa kuitenkin merkittävää edistystä vanhan Flux-dif fuusiomallirakenteen avulla, johon on lisätty useita toissijaisia lähestymistapoja, jotka mahdollistavat paremman ja johdonmukaisemman parin aineiston.

Aineistoesimerkit uudesta projektista. Source: https://arxiv.org/pdf/2508.13065
Projekti koostuu uudesta ja laajasta parin aineistosta; Odo, generatiivisesta dif fuusiomallista, joka on koulutettu tällä aineistolla; ja erityisesti suunnitellusta uudesta mittarista, joka arvioi ihmisen muodonmuutoksen suorituskykyä.
Uusi artikkeli on nimeltään Odo: Depth-Guided Diffusion for Identity-Preserving Body Reshaping, ja se on peräisin kolmelta tutkijalta Fast Code AI Pvt. Ltd:stä Bangalorestä.
Data ja menetelmä
Tutkijoiden luoma aineisto sisältää 7 615 korkean resoluution (960x1280px) kuvaa kullekin kohdevartalotyypille (lihava, hoikka ja lihaslisäksi).
Aluksi 1 523 ihmisen kasvoja generoitiin FLUX.1-dev-dif fuusiomallilla, joka käytti määrittelemätöntä määrää lisenssimahdollisia viitekasvoja Pexelsistä ja Unsplashista, lisätäkseen monimuotoisuutta.
Jotta voidaan luoda täysikokoisia kuvia, jotka sisältävät nämä kasvot, tutkijat käyttivät ByteDancen vuoden 2024 PuLID-mallia, joka on tarkennettu Flux-pohjaisella kontrasti-identiteettikadolla, joka on suunniteltu säilyttämään kasvon identiteetti muodonmuutoksessa:

PuLID-projektin esimerkkejä. Source: https://arxiv.org/pdf/2404.16022
Malli sai kasvokuva- ja standardoidun pyynnön, joka pyysi sukupuolta, vaatteita, asentoa, kohtausta sekä vartalotyyppiä hoikka, lihava tai lihaslisäksi.
Kolme vartalotyyppikuvaa kullekin identiteetille näyttivät joskus vähäisiä siirtymiä taustan suhteen ja kohteen koon suhteen, jotka johtuivat dif fuusiomallien stokastisesta käyttäytymisestä, jossa jokainen generointi aloitetaan uudesta äänen siemenestä. Vähäiset muutokset pyynnössä, kuten vartalotyyppikuvaus, voivat vaikuttaa mallin reittiin latenttiavaruudessa ja aiheuttaa visuaalista siirtymää.
Johtuen tästä vaihtelusta, neliportainen automaattinen jälkikäsittelyputki sovellettiin, jossa hoikka kuva kullekin triadille valittiin viiteeksi, koska sen pienempi siluetti paljasti enemmän taustaa.
Henkilön havaitseminen tehtiin RT-DETRv2:n avulla, ja segmentointi tehtiin SAM 2.1:n avulla, jotta voitiin poistaa kohteen maskit kaikille kolmelle vartalotyypille. Hoikka viitekuva lähetettiin FLUX.1 Kontext Pro:lle (uudelle kuvankäsittelyjärjestelmälle) taustan täyttämiseksi, jotta saatiin puhdas versio kohtauksesta ilman kohteen.
Lihava ja lihaslisäksi variantit mitattiin yhdenmukaisella skaalauksella hoikan viiteen korkeuden kanssa, ja ne koostettiin puhdas tausta samassa alhaalla olevassa tasossa, varmistaen yhdenmukaisen kehyskaavan kaikille kuville.
Tekijät toteavat:
‘Tuloksena olevat muodonmuutoskolmiot (hoikka, lihava ja lihaslisäksi) ovat identtisiä taustoja ja yhdenmukaisia kohteen mittauksia. Tämä poistaa merkityksettömät vaihtelut, jotka voivat haitata myöhempää koulutusta tai arviointia.’
Kullekin kolmiolle (hoikka, lihava ja lihaslisäksi) saatiin kuusi mahdollista muodonmuutosparia, mikä johti 45 690 teoreettiseen yhdistelmään 7 615 identiteetin kautta.
Jälkeenpoistojen jälkeen, joissa oli vaatteiden, asentojen, jäykän jäsenten, identiteetin siirtymän tai vähäisen muodonmuutoksen kanssa, 18 573 laadukasta paria säilytettiin. Vaikka jotkut vähäiset asentoeronnuksia säilyivät, malli osoittautui kestäväksi näille vaihtelulle.
Koulutus ja testit
Näitä kuvia käytettiin kouluttamaan Odo-mallia – dif fuusiopohjaista lähestymistapaa vartalonmuokkaukseen, jossa käytettiin Skinned Multi-Person Linear Model (SMPL, eli väliaikainen CGI) -kartoja.
Tiedostojen muokkausta ohjattiin 2024 Neural Localizerin menetelmien mukaan, ja aineisto sovitettiin SMPL-hahmoon yksilökohtaisesti, jolloin saatiin optimoituja parametreja, jotka pystyivät tuottamaan syvyyden karttoja, joista muokatut kuvat saatiin:

Laadulliset testit. Esimerkit muodonmuutoksista alkuperäisestä kuvasi thinner, ylipainoiseen ja lihaslisäksiin eri asennoissa, mukaan lukien istuminen ja seisonnin. Viittaa alkuperäiseen artikkeliin paremman määrityksen ja yksityiskohtaisuuden vuoksi.
Näistä tuloksista artikkeli toteaa:
‘[Meidän] menetelmä käsittelee tehokkaasti monimuotoisia asentoja, taustoja ja vaatteita, säilyttäen henkilön identiteetin.
‘Lisäksi SMPL-kohdemuotoja, tarjoamme tekstipyyntöjä – ‘Tee henkilöstä lihavampi,’ ‘Tee henkilöstä hoikka’ tai ‘Tee henkilöstä lihaslisäksi’ – ohjataksesi toivottuja muodonmuutoksia…’
…'[Seuraava kuva] osoittaa myös mallin kyvyn tehdä monimuotoisia muodonmuutoksia. Malli seuraa SMPL-syvyyden karttoja, jotta voidaan luoda useita versioita hoikemmasta ja lihavammasta alkuperäisestä kuvasta.’

Lisälaadulliset testit, jotka kattavat kohdevartalotyypin valikoiman. Viittaa alkuperäiseen artikkeliin paremman määrityksen ja yksityiskohtaisuuden vuoksi.
Tekijät toteavat myös:
‘Tuloksemme osoittavat realistisempia muodonmuutoksia kohdepainoon, koska mallimme sovittaa yleisen vartalonmuodon, jäsenten suhteita ja vaatteiden yhdenmukaisuutta, johtaen anatomiassa yhdenmukaisiin ja visuaalisesti vakuuttaviin muutoksiin.’
Määrällisissä testeissä tekijät asettivat järjestelmänsä avoimeen lähde- Flux Kontext [dev] -malliin, FLUX.1:een, ja vuoden 2022 tarjontaan Rakenteen tunnistava virtausgeneraattori ihmisen vartalonmuokkaukseen.
FLUX.1 Kontext [dev] -mallille suunniteltiin pyynnöt, jotka pyysivät ‘Tee henkilöstä lihavampi,’ ‘Tee henkilöstä hoikka’ tai ‘Tee henkilöstä lihaslisäksi’, kohdepainot määriteltynä – vaikka puuttuvat hienosäätöohjaimet rajoittivat suorituskykyä:
![Odon vertailu Structure-Aware Flow Generation for Human Body Reshaping ja FLUX.1 Kontext [dev] -testijoukossa, sekä ablaatiotutkimusten tulokset (ei käsitelty tässä artikkelissa) malleille, jotka on koulutettu ilman pyynnön ehdollistamista ReshapeNetissä, ilman ReferenceNetiä (käyttäen vain IP-Adapteria) ja koulutusta rajoitettuna BR-5K -aineistoon.](https://www.unite.ai/wp-content/uploads/2025/08/table-2-1.jpg)
Odon vertailu Structure-Aware Flow Generation for Human Body Reshaping ja FLUX.1 Kontext [dev] -testijoukossa, sekä ablaatiotutkimusten tulokset (ei käsitelty tässä artikkelissa) malleille, jotka on koulutettu ilman pyynnön ehdollistamista ReshapeNetissä, ilman ReferenceNetiä (käyttäen vain IP-Adapteria) ja koulutusta rajoitettuna BR-5K -aineistoon.
Johtopäätös
Flux Kontextin saapuminen tänä vuonna ja viimeaikainen Qwen Image Edit:n epäkvantitoiden painojen julkaisu ovat tuoneet parillisen aineiston jälleen eturintamaan sekä harrastelija- että ammattilaisten keskuudessa. Kasvavan kritiikin ja kärsivällisyyden ilmapiirissä generatiivista AI:ta kohtaan, tällaiset mallit on suunniteltu paljon tarkemmin alkuperäisille syötekuville (vaikka pienemmät mallit voivat joskus olla rajoitettuja niiden erityisistä koulutustavoitteista).
Vartalonmuokkausjärjestelmän hyödyllisyys näyttäisi olevan psykologisissa, lääketieteellisissä ja muotipohjaisissa aloissa. Kuitenkin on mahdollista, että tällaiset järjestelmät saavuttavat korkeamman aseman ja ehkä myös enemmän epävirallisen ja mahdollisesti huolestuttavan joukon käyttötapauksia.
Julkaistu ensimmäisen kerran maanantaina, 25. elokuuta 2025












