Andersons vinkel

Fördelarna med att bli fet genom AI

mm
Lägg till Unite.AI bland dina föredragna källor på Google
Images of synthetically altered data, from the paper 'Odo: Depth-Guided Diffusion for Identity-Preserving Body Reshaping at https://arxiv.org/abs/2508.13065

En ny AI-modell kan realistiskt omforma människors kroppar i foton, göra dem feta, smala eller mer muskulösa, utan att förändra deras ansikte, kläder eller bakgrund. Modellen är tränad på en helt syntetisk dataset som visar varje identitet över flera kroppstyper.

 

Förutom den alltmer vanliga användningen av AI som en metod för att förbättra kroppens form på sociala nätverk, eller (potentiellt) för att ändra kroppstyper för VFX-ändamål, kan användningen av maskinlärning för att ändra utseendet på individer tjäna ett viktigare syfte: att hjälpa personer med ätstörningar att förstå sin egen dysmorfa tolkning av sitt utseende, samt erbjuda ett potentiellt motivationsverktyg för allmänna idrotts- och fitnessändamål:

Från artikeln 'Body size estimation in women with anorexia nervosa and healthy controls using 3D avatars', ett gränssnitt för att visualisera kroppsförändringar. Personer med kroppsdysmorfism kan ha svårt att associera en realistisk tolkning av sin kropp med en liknande bild, vilket ger kliniker en måttstock för dysmorfa svar, bland annat.

Från artikeln ‘Body size estimation in women with anorexia nervosa and healthy controls using 3D avatars’, ett gränssnitt för att visualisera kroppsförändringar. Personer med kroppsdysmorfism kan ha svårt att associera en realistisk tolkning av sin kropp med en liknande bild, vilket ger kliniker en måttstock för dysmorfa svar, bland annat. Källa: https://www.nature.com/articles/s41598-017-15339-z.pdf

Dessutom har den mycket eftertraktade modeprövningssubsträngen inom datorseende också intresse av att tillhandahålla precisa visualiseringar över ett spektrum av kroppstyper. Samtidigt har ramverk som den japanska universitetet i Tsukubas DiffBody från 2024 skapat vissa ögonblick av funktion i det här området:

Några av de omvandlingar som är möjliga med den tidigare DiffBody-tekniken. Källa: https://arxiv.org/pdf/2401.02804

Några av de omvandlingar som är möjliga med den tidigare DiffBody-tekniken. Källa: https://arxiv.org/pdf/2401.02804

Eftersom AI-modeller är optimerade för konventionellt attraktiva eller vanliga kroppstyper, är ovanliga storlekar som “feta” antingen minimalt tillgängliga i standardmodeller eller kommer med vissa straffande fördomar.

Par Nödvändigheter

En av de största utmaningarna i att skapa AI-system som kan realistiskt lägga till eller ta bort fett och muskler från bilder av individer – utan att förändra deras identitet, miljö eller kläder – är att detta innebär parträning, där AI-modellen i princip lär sig “före” och “efter” bilder som definierar vilken transformation modellen är avsedd att utföra.

Denna typ av träning har kommit tillbaka i rampljuset under sommaren på grund av framgången med Black Forest Labs Kontext serie av bildredigeringsmodeller, där denna typ av pardata användes för att lära modellerna en mängd olika omvandlingar:

Från Flux Kontext-webbplatsen, ett exempel på en omvandling som reflekterar den typ av källdata som behövs för att träna en modell som kan behålla bildens integritet när den inför stora förändringar. Källa: https://bfl.ai/models/flux-kontext

Från Flux Kontext-webbplatsen, ett exempel på en omvandling som reflekterar den typ av källdata som behövs för att träna en modell som kan behålla bildens integritet när den inför stora förändringar. Källa: https://bfl.ai/models/flux-kontext

Uppenbarligen, i fallet med att utveckla en modell som kan signifikant förändra utseendet på en person (utan att omforma hela bilden), behöver man något som är helt omöjligt i den verkliga världen: radikala “före” och “efter” bilder tagna bara sekunder isär.

Det enda alternativet är syntetisk data. Vissa projekt av den här typen har använt individuella, höginsatskrävande kontrastpar som skapats manuellt i Photoshop; dock är detta omöjligt i stor skala, och en automatiserad eller halvautomatiserad, AI-driven process för att generera paren anses alltmer vara att föredra.

Problemet med GAN-baserade och de flesta SMPL/X-baserade tillvägagångssätt (där en virtuell CGI-figur används som en sorts utbytesmekanism mellan riktiga bilder och önskade omvandlingar), och med tillvägagångssätt som använder bildkrökning, är att bakgrunden och identiteten tenderar att lida under processen.

Parametriska, vektorbaserade CGI-modeller som SMPL och SMPL-X (bland andra) tillhandahåller definierade konventionella fysiska 3D-koordinater som kan tolkas och införlivas i datorseende-ramverk. Källa: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf

Parametriska, vektorbaserade CGI-modeller som SMPL och SMPL-X (bland andra) tillhandahåller definierade konventionella fysiska 3D-koordinater som kan tolkas och införlivas i datorseende-ramverk. Källa: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf

Eftersom det är viktigt att AI-modellen lär sig att förändra endast de önskade aspekterna, istället för att lära sig att kröka bakgrunder och replikera andra oönskade fel, har ingen kroppsförändringsmodell ännu nått en perfekt lösning.

En nylig artikel från Indien föreslår dock en anmärkningsvärd förbättring av den nuvarande tekniken genom att använda den äldre Flux diffusionsmodellramverk, kompletterat med ett antal sekundära tillvägagångssätt som möjliggör en överlägsen och mer konsekvent parat dataset:

Datasetexempel från det nya projektet. Källa: https://arxiv.org/pdf/2508.13065

Datasetexempel från det nya projektet. Källa: https://arxiv.org/pdf/2508.13065

Projektet består av en ny och omfattande parat dataset; Odo, en generativ diffusionsmodell tränad på denna data; och ett specialutvecklat nytt benchmark för att kvantitativt utvärdera prestationen av mänsklig kroppsförändring. I tester hävdar författarna en anmärkningsvärd förbättring av standarden som uppnåddes av liknande jämförbara modeller.

Den nya artikeln heter Odo: Djupguiderad diffusion för identitetsbevarande kroppsförändring och kommer från tre forskare vid Fast Code AI Pvt. Ltd i Bangalore.

Data och Metod

Dataset som skapats av forskarna innehåller 7 615 högupplösta bilder (960×1280 pixlar) för varje målkroppstyp (fet, smal och muskulös).

Initialt genererades 1 523 mänskliga ansikten via FLUX.1-dev 12-miljardersparametrar diffusionsmodell, med hjälp av ett obestämt antal licensfria referensansikten från Pexels och Unsplash, för att öka mångfalden.

För att generera fullständiga kroppsbilder som innehåller dessa ansikten använde forskarna ByteDances 2024-erbjudande PuLID, en checkpoint-fine-tuned över bas-Flux, och som innehåller en kontrastiv ID-förlust som är utformad för att bevara ansiktsidentitet under transformationsprocesser:

Exempel från PuLID-projektet. Källa: https://arxiv.org/pdf/2404.16022

Exempel från PuLID-projektet. Källa: https://arxiv.org/pdf/2404.16022

Modellen fick ett ansiktsbild och en standardiserad prompt som begärde genus, kläder, pose, scen, samt kroppstyp av smal, fet eller muskulös.

De tre kroppstypsbilderna för varje identitet uppvisade ibland små förskjutningar i bakgrundsjustering och uppfattad föremålsstorlek, vilket berodde på den stokastiska beteendet hos diffusionsmodeller, där varje generation börjar från ett nytt brus seed. Även små förändringar av prompten, såsom att ändra kroppstypbeskrivningen, kan påverka modellens bana i latent utrymme och orsaka visuell drift.

För att korrigera för denna variation tillämpades en fyra-stegs automatisk efterbearbetningspipeline, med smal-bilden i varje triplet vald som referens, eftersom dess mindre silhuett exponerade mer bakgrund.

Persondetektering utfördes med RT-DETRv2, följt av segmentering med SAM 2.1 för att extrahera föremålsmasker för alla tre kroppstyper. Smal-referensbilden skickades sedan till FLUX.1 Kontext Pro (den nyare bildredigeringsystemet) för bakgrundsutfyllnad, vilket resulterade i en ren version av scenen, med föremålet borttaget.

Fet och muskulös-varianterna justerades med enhetlig skalning för att matcha höjden på den smala referensmasken och sattes samman på den rena bakgrunden vid samma bottenjustering, vilket säkerställde konsekvent ramning över alla bilder.

Författarna hävdar:

‘De resulterande transformations-tripletter (smal, fet och muskulös) har en identisk bakgrund och enhetlig föremålsstorlek. Detta tar bort irrelevanta variationer som kunde negativt påverka efterföljande träning eller utvärdering.’

Varje triplet av smal, fet och muskulös bild tillåter sex möjliga transformationspar, vilket resulterar i 45 690 teoretiska kombinationer över 7 615 identiteter.

Efter att ha filtrerat bort exempel med omatchade kläder, onaturliga poser, förvrängda lemmar, identitetsdrift eller minimal formändring, behölls 18 573 högkvalitativa par. Även om vissa mindre pose-skillnader kvarstod, visade sig modellen vara robust mot dessa variationer.

Träning och Tester

De resulterande bilderna användes för att träna Odo-modellen – en diffusionsbaserad metod för att omforma människor, med användning av Skinned Multi-Person Linear Model (SMPL, dvs. mellanliggande CGI) kartor.

Informeras av 2024 års Neural Localizers metoder, anpassades datat till SMPL-figurerna på en per-individuell basis, med de resulterande optimerade parametrarna kapabla att producera djupkarter från vilka de ändrade bilderna skulle härledas:

Schema för träningspipelinen. Den vänstra sidan visar träningsuppställningen, där SMPL-djupkarter från målbilden guider ReshapeNet via ControlNet för att utföra kroppstransformation. Funktioner från källbilden extraheras av ReferenceNet och sammanfogas i ReshapeNet med hjälp av rumslig självuppmärksamhet. Den högra sidan visar inferens, där SMPL-parametrar uppskattas från inmatningsbilden, modifieras av semantiska attribut och återges i en måldjupkarta som villkorar ReshapeNet under avbrusning för att producera den slutliga transformerade bilden.

Schema för träningspipelinen. Den vänstra sidan visar träningsuppställningen, där SMPL-djupkarter från målbilden guider ReshapeNet via ControlNet för att utföra kroppstransformation. Funktioner från källbilden extraheras av ReferenceNet och sammanfogas i ReshapeNet med hjälp av rumslig självuppmärksamhet. Den högra sidan visar inferens, där SMPL-parametrar uppskattas från inmatningsbilden, modifieras av semantiska attribut och återges i en måldjupkarta som villkorar ReshapeNet under avbrusning, för att producera den slutliga transformerade bilden.

Modellen (se schema ovan) består av ReshapeNet-modulen, stödd av tre hjälpmoduler: ReferenceNet; en IP-Adapter-modul; och en djupbaserad ControlNet-modul.

ReferenceNet extraherar detaljerade funktioner som bakgrund, kläder och identitet från inmatningsbilden och skickar dem till ReshapeNet. IP-Adapter bidrar med högnivåfunktionsguidning, medan Depth ControlNet tillämpar SMPL-baserad villkorsstyrd kroppstransformation. I linje med tidigare arbeten, användes en SDXL-baserad frusen UNet för att extrahera mellanfunktioner.

Såsom IP-Adapter-modulen, kodar den inmatningsbilden via CLIP, med de resulterande inbäddningar integrerade tillbaka i ReshapeNet via korsuppmärksamhet.

Såsom Depth ControlNet-modulen, guider den mitten- och dekodarlager av ReshapeNet med hjälp av residualanslutningar. Därefter tar den en djupkarta som återges från mål-SMPL-parametrarna och justerar den med målbilden.

ReshapeNet, baserad på SDXL UNet, är kärnnätverket i Odo. Under träning kodas målbilder in i latent utrymme med en variational autoencoder, brusas över tiden och sedan avbrusas av ReshapeNet med funktioner från ControlNet och ReferenceNet.

Kategorispecifika textprompt som “Gör personen fetare”, “Gör personen smalare” eller “Gör personen muskulös” lades till, för att guida transformationer. Medan djupkarterna fångade grova kroppssformer, tillhandahöll prompten den semantiska detaljen som behövdes för förändringar som muskelförstärkning, vilket möjliggjorde för modellen att producera mer precisa och realistiska ändringar.

Träningsimplementering

Odo tränades på projektets syntetiska dataset, kombinerat med en delmängd av DeepFashion-MultiModal-dataseten, vilket resulterade i totalt 20 000 bildpar.

DeepFashion-MultiModal-data tillhandahöll variation i kläder och ansiktsdrag, med bilder parade mot sig själva under träning. Med alla SMPL-djupkarter förberäknade för effektivitet, kördes träningen i 60 epoker på en enda NVIDIA A100 GPU med 80 GB VRAM.

Med inmatningsbilderna storleksändrade till 768×1024, användes Adam-optimeraren, vid en inlärningshastighet på 1×10⁻⁵. ReshapeNet initierades med SDXL UNet-vikter och finjusterades gemensamt med IP-Adapter från dess kontrollpunkt.

ReferenceNet initierades med SDXL-vikter och förblev frusen, medan Depth ControlNet använde förtränade vikter och förblev också frusen.

Den slutliga modellen krävde cirka 23 GB GPU-minne, och krävde 18 sekunder för enkelbildsinferens.

En Ny Metric

Bristen på dataset av den typ som behövs för det här projektet innebar att inga befintliga mått verkligen hanterade utmaningen. Därför utvecklade författarna en ny benchmark, bestående av 3 600 bildpar, med riktiga ansiktsbilder och bakgrundsbeskrivningar, tillsammans med varierande kroppsstilsvariationer.

Andra mått som användes var Strukturell Likhet Index (SSIM); Peak Signal-to-Noise Ratio (PSNR); Lärd Perceptuell Bildpatch-Likhet (LPIPS); och Skal-Korrigerad Per-Vertex-Euklidiskt Fel i neutral (T-)pose (PVE-T-SC).

Först testade författarna sin metod kvalitativt mot vilda bilder (bilder som inte setts av modellen under träning):

Kvalitativa tester. Exemplen visar omvandlingar från den ursprungliga bilden till smalare, överviktig och muskulös kroppstyp över olika poser, inklusive sittande och stående.

Kvalitativa tester. Exemplen visar omvandlingar från den ursprungliga bilden till smalare, överviktig och muskulös kroppstyp över olika poser, inklusive sittande och stående. Vänligen se källartikeln för bättre definition och detalj.

Av dessa resultat hävdar artikeln:

‘[Vår] metod hanterar effektivt olika poser, bakgrunder och kläder samtidigt som den bevarar personens identitet.

‘Förutom SMPL-målformer tillhandahåller vi textprompt – “Gör personen fetare”, “Gör personen smalare” eller “Gör personen muskulös”– för att explicit guida de önskade transformationerna…

…'[Bilden nedan] visar ytterligare vår modells förmåga att utföra olika formomvandlingar. Modellen följer SMPL-djupkarter för att generera flera variationer av smalare och fetare versioner från referensbilden.’

Ytterligare kvalitativa tester som täcker omfånget av målkroppstyper.

Ytterligare kvalitativa tester som täcker omfånget av målkroppstyper. Vänligen se källartikeln för bättre definition och detalj.

Författarna kommenterar vidare:

‘Våra resultat visar mer realistiska transformationer enligt målvikt, eftersom vår modell samtidigt justerar den övergripande kroppen, lemmar och kläder, vilket resulterar i anatomiskt konsekventa och visuellt övertygande ändringar.’

För kvantitativa tester, ställde författarna sin metod mot den öppna källkoden Flux Kontext [dev]-modellen, FLUX.1, och 2022 års erbjudande Strukturmedveten Flödesgenerering för mänsklig kroppsförändring.

För FLUX.1 Kontext [dev] utformades prompten för att instruera “Gör personen fetare”, “Gör personen smalare” eller “Gör personen muskulös”, med målvikter specificerade – men bristen på fina kontroller begränsade prestandan:

Jämförelse av Odo med Strukturmedveten Flödesgenerering för mänsklig kroppsförändring och FLUX.1 Kontext [dev] på testuppsättningen, tillsammans med avlägsnande resultat för modeller tränade utan promptvillkor i ReshapeNet, utan ReferenceNet (användande endast IP-Adapter) och med träning begränsad till BR-5K-datasetet. Tabellen innehåller också material relaterat till avlägsnande studier (BR-5K), som vi inte täcker här.

Jämförelse av Odo med Strukturmedveten Flödesgenerering för mänsklig kroppsförändring och FLUX.1 Kontext [dev] på testuppsättningen, tillsammans med avlägsnande resultat (inte täckt i den här artikeln) för modeller tränade utan promptvillkor i ReshapeNet, utan ReferenceNet (användande endast IP-Adapter) och med träning begränsad till BR-5K-datasetet.

Slutsats

Tillkomsten av Flux Kontext i år, och ännu nyligen utgivningen av de oquantifierade vikterna för Qwen Image Edit, har återigen gett parat data en central roll i hobbyist- och proffssamhällen. I en tid av växande kritik och otålighet gällande den otillräckliga precisionen hos generativ AI, är modeller av den här typen utformade för att ha en mycket högre trohet mot indata-bilderna (även om mindre modeller ibland är begränsade av sina specifika träningmål).

I det här fallet verkar nyttan av ett kroppsförändringssystem ligga i psykologiska, medicinska och modebaserade områden. Trots detta kan det vara möjligt att system av den här typen kommer att uppnå en högre nivå av framträdande, och kanske en mer avslappnad och potentiellt problematisk uppsättning av användningar.

 

Publicerad första gången måndagen den 25 augusti 2025

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai