Andersons vinkel

Fordelene ved at blive federe gennem AI

mm
Føj Unite.AI til dine foretrukne kilder på Google
Images of synthetically altered data, from the paper 'Odo: Depth-Guided Diffusion for Identity-Preserving Body Reshaping at https://arxiv.org/abs/2508.13065

Et nyt AI-system kan realistisk omforme menneskers kroppe på billeder, så de bliver federe, tyndere eller mere muskuløse, uden at ændre deres ansigt, tøj eller baggrund. Systemet er trænet på et fuldt syntetisk dataset, der viser hver identitet på tværs af multiple kropstyper.

 

Ud over den stadig mere almindelige brug af AI som metode til at forfine kropsskikkelse på sociale netværk, eller (muligvis) til at ændre kropstyper til VFX-formål, kan brugen af maskinel læring til at ændre udseendet af individer også tjene et vigtigere formål: at hjælpe individer med spiseforstyrrelser at forstå deres egen dysmorfiske fortolkning af deres udseende, samt tilbyde en potentiel motivationsværktøj til mere generelle sports- og fitnessformål:

Fra artiklen 'Body size estimation in women with anorexia nervosa and healthy controls using 3D avatars', en brugerflade til at visualisere kropsskikkelsesændringer. Individer med kropsskikkelsesforstyrrelser kan have svært ved at associerer en realistisk fortolkning af deres krop med et lignende billede, hvilket giver kliniske metoder for dysmorfiske svar, blandt andet.

Fra artiklen ‘Body size estimation in women with anorexia nervosa and healthy controls using 3D avatars’, en brugerflade til at visualisere kropsskikkelsesændringer. Individer med kropsskikkelsesforstyrrelser kan have svært ved at associerer en realistisk fortolkning af deres krop med et lignende billede, hvilket giver kliniske metoder for dysmorfiske svar, blandt andet. Kilde: https://www.nature.com/articles/s41598-017-15339-z.pdf

Derudover har den meget efterspurgte modeprøvning-understrøm i computer vision-forskning også interesse i at levere præcise visualiseringer på tværs af multiple kropstyper. Imens har rammer som 2024 DiffBody-tilbuddet fra Japans University of Tsukuba skabt nogle øjenåbnende funktioner på dette område:

Nogle af transformationerne, der er mulige med den tidligere DiffBody-teknik. Kilde: https://arxiv.org/pdf/2401.02804

Nogle af transformationerne, der er mulige med den tidligere DiffBody-teknik. Kilde: https://arxiv.org/pdf/2401.02804

Da AI-basismodeller er optimeret mod konventionelt tiltrækkende eller andre almindelige kropstyper, er usædvanlige størrelser som ‘fed’ enten minimalt tilgængelige i standardmodeller eller kommer med nogle straffende fordomme.

Par-nødvendigheder

En af de største udfordringer i at skabe AI-systemer, der kan realistisk tilføje eller fjerne fedt og muskler fra billeder af individer – uden at ændre deres identitet, omgivelser eller tøj – er, at dette indebærer parret træning, hvor AI-systemet effektivt lærer ‘før’ og ‘efter’-billeder, der definerer hvilken som helst transformation, modellen er designet til at udføre.

Dette træningsform har kommet tilbage i fremtrædende position over sommeren på grund af succesen med Black Forest Labs’ Kontext-serien af billedredigeringsmodeller, hvor denne type parret data blev brugt til at lære en række transformationer til modellerne:

Fra Flux Kontext-sitet, et eksempel på en transformation, der afspejler den type kilde-data, der er nødvendig for at træne en model, der kan fastholde billedintegritet, når der indsættes store ændringer. Kilde: https://bfl.ai/models/flux-kontext

Fra Flux Kontext-sitet, et eksempel på en transformation, der afspejler den type kilde-data, der er nødvendig for at træne en model, der kan fastholde billedintegritet, når der indsættes store ændringer. Kilde: https://bfl.ai/models/flux-kontext

Det er åbenlyst, at i tilfældet af udvikling af en model, der kan betydeligt ændre udseendet af en person (uden at genopfinde hele billedet), er der noget, der er helt umuligt i den virkelige verden: radikale ‘før’ og ‘efter’-billeder taget kun sekunder apart.

Den eneste udvej er syntetisk data. Nogle projekter af denne type har brugt individuelle, højindsats kontrastive par, der er lavet manuelt i Photoshop; dog er dette urealistisk i størrelse, og en automatiseret eller semi-automatiseret, AI-dreven proces til at generere parrene anses nu for at være mere ønskværdig.

Problemet med GAN-baserede og de fleste SMPL/X-baserede tilgange (hvor en virtuel CGI-figur bruges som en slags udvekslingsmekanisme mellem virkelige billeder og de ønskede transformationer), og med tilgange, der bruger billed-vævning, er, at baggrunden og identiteten har tendens til at lide under processen.

Parametrisk, vektorbaserede CGI-modeller som SMPL og SMPL-X (blandt andre) giver definerede konventionelle fysiske 3D-koordinater, der kan fortolkes og integreres i computer vision-rammer. Kilde: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf

Parametrisk, vektorbaserede CGI-modeller som SMPL og SMPL-X (blandt andre) giver definerede konventionelle fysiske 3D-koordinater, der kan fortolkes og integreres i computer vision-rammer. Kilde: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf

Da det er vigtigt, at AI-systemet lærer at ændre kun de ønskede aspekter, i stedet for at lære at forvrænge baggrunde og at replikere andre uønskede fejl, er der ingen krop-ændrings-system, der endnu har nået en perfekt løsning.

Et nyt paper fra Indien foreslår dog en bemærkelsesværdig fremgang på standarden gennem brugen af den ældre Flux-diffusionsmodel-ramme, suppleret med en række sekundære tilgange, der muliggør en overlegen og mere konsekvent parret dataset:

Dataset-eksempler fra det nye projekt. Kilde: https://arxiv.org/pdf/2508.13065

Dataset-eksempler fra det nye projekt. Kilde: https://arxiv.org/pdf/2508.13065

Projektet består af et nyt og omfattende parret dataset; Odo, en generativ diffusionsmodel trænet på denne data; og en særlig ny benchmark designet til at kvantitativt vurderer menneskeskikkelses-redigering-præstation. I tests hævder forfatterne en bemærkelsesværdig fremgang på standarderne opnået af lignende sammenlignelige modeller.

Det nye paper er titlen Odo: Depth-Guided Diffusion for Identity-Preserving Body Reshaping, og kommer fra tre forskere ved Fast Code AI Pvt. Ltd i Bangalore.

Data og metode

Det dataset, der er skabt af forskerne, indeholder 7.615 højopløselige billeder (960x1280px) for hver mål-kropstype (fed, tynd og muskuløs).

Initialt blev 1.523 menneskeansigter genereret gennem FLUX.1-dev-12-milliard parameter diffusionsmodellen, selvom der blev brugt et ukendt antal licensfri referenceansigter fra Pexels og Unsplash for at øge diversiteten.

Til at generere fuldkropsbilleder, der inkluderer disse ansigter, brugte forskerne ByteDances 2024-tilbud PuLID, en checkpoint finjusteret over basis-Flux, og med en kontrastiv ID-tap designet til at hjælpe med at bevare ansigtets identitet under transformationsprocesser:

Eksempler fra PuLID-projektet. Kilde: https://arxiv.org/pdf/2404.16022

Eksempler fra PuLID-projektet. Kilde: https://arxiv.org/pdf/2404.16022

Modellen modtog et ansigtsbillede og en standardiseret prompt, der bad om køn, tøj, holdning, scene, samt kropstype af tynd, fed eller muskuløs.

De tre kropstypiske billeder for hver identitet viste undertiden mindre forskelle i baggrundsalignment og opfattet subjektstørrelse, der opstod fra den stokastiske adfærd af diffusionsmodeller, hvor hver generation begynder fra en ny støjfrø. Selv små ændringer i prompten, såsom at ændre kropstypen, kan påvirke modellens trajektorie i latent rum og forårsage visuel drift.

Til at korrigere for denne variation blev en firetrins automatisk efterbehandling-pipeline anvendt, hvor tynd-billedet i hver triplet blev valgt som reference, da dets mindre silhuet afslørede mere baggrund.

Person-detektion blev udført med RT-DETRv2, efterfulgt af segmentering med SAM 2.1 for at trække subjektmasker for alle tre kropstyper. tynd-referencebilledet blev derefter passeret til FLUX.1 Kontext Pro (det nyere billedredigerings-system) til baggrundsmaling, hvilket resulterede i en ren version af scenen med subjektet fjernet.

fed og muskuløs-varianterne blev omskaleret ved hjælp af ensartet skaleringsfaktor til at matche højden af den tynde reference-maske og komponeret på den rene baggrund ved samme bund-alignment, hvilket sikrede konsekvent ramme på tværs af alle billeder.

Forfatterne skriver:

‘De resulterende transformations-tripletter (tynd, fed og muskuløs) har en identisk baggrund og ensartet subjektstørrelse. Dette fjerner irrelevante variationer, der kunne have en negativ indvirkning på efterfølgende træning eller vurdering.’

Hver triplet af tynd, fed og muskuløs billeder tillod seks mulige transformations-par, hvilket resulterede i 45.690 teoretiske kombinationer på tværs af 7.615 identiteter.

Efter at have filtreret ud eksempler med forkert tøj, unaturlige holdninger, forvrængede lemmer, identitetsdrift eller minimalt formændring, blev 18.573 højkvalitets-par beholdt. Selvom nogle mindre holdningsforskelle blev vedligeholdt, ville modellen vise sig at være robust over for disse variationer.

Træning og tests

De resulterende billeder blev brugt til at træne Odo-modellen – en diffusionsbaseret tilgang til omformning af mennesker, med brug af Skinned Multi-Person Linear Model (SMPL, dvs. mellem-CGI) kort.

Informationskilden blev 2024 Neural Localizer’s metoder, og data blev tilpasset SMPL-figuren på en per-individ-basis, med de resulterende optimerede parametre, der var i stand til at producere dybde-kort fra hvilke de ændrede billeder ville blive afledt:

Schema for trænings-pipeline. Venstre side viser træningsopsætningen, hvor SMPL-dybde-kort fra målbilledet guider ReshapeNet via ControlNet til at udføre kropstransformation. Funktioner fra kildebilledet blev trukket ud af ReferenceNet og sammenføjet med ReshapeNet ved hjælp af rummelig selv-opmærksomhed. Højre side viser inferens, hvor SMPL-parametre blev estimeret fra inputbilledet, modificeret af semantiske attributter og renderet til et mål-dybde-kort, der betingede ReshapeNet under støj-reduktion til at producere det endelige transformerende billede.

Schema for trænings-pipeline. Venstre side viser træningsopsætningen, hvor SMPL-dybde-kort fra målbilledet guider ReshapeNet via ControlNet til at udføre kropstransformation. Funktioner fra kildebilledet blev trukket ud af ReferenceNet og sammenføjet med ReshapeNet ved hjælp af rummelig selv-opmærksomhed. Højre side viser inferens, hvor SMPL-parametre blev estimeret fra inputbilledet, modificeret af semantiske attributter og renderet til et mål-dybde-kort, der betingede ReshapeNet under støj-reduktion, til at producere det endelige transformerende billede.

Modellen (se schema ovenfor) består af ReshapeNet-modulen, understøttet af tre hjælpe-moduler: ReferenceNet; en IP-Adapter-modul; og en dybde-baseret ControlNet-modul.

ReferenceNet trækker detaljerede funktioner som baggrund, tøj og identitet fra inputbilledet og passer dem til ReshapeNet. IP-Adapter bidrager med højniveaufunktion-guider, mens Depth ControlNet anvender SMPL-baseret betingelse til at guide kropstransformationen. I linje med tidligere værk, blev en SDXL-baseret frosset UNet brugt til at trække midlertidige funktioner.

Med hensyn til IP-Adapter-modulen blev denne kodet via CLIP, med de resulterende indlejninger integreret tilbage i ReshapeNet via kryds-opmærksomhed.

Med hensyn til Depth ControlNet-modulen guidede denne midterste og dekodningslagene af ReshapeNet ved hjælp af rest-forbindelser. Herefter tog den et dybde-kort, der blev renderet fra mål-SMPL-parametrene, og alignerede det med målbilledet.

ReshapeNet, baseret på SDXL UNet, er kerne-netværket i Odo. Under træning blev målbilleder kodet i latent rum med en variations-autoencoder, støjagtigt over tid og derefter støj-reduceret af ReshapeNet ved hjælp af funktioner fra ControlNet og ReferenceNet.

Kategori-specifikke tekst-prompts som ‘Gør personen federe,’ ‘Gør personen tyndere,’ eller ‘Gør personen muskuløs’ blev tilføjet for at guide transformationer. Mens dybde-kortene fik fat i grove kropsskikkelser, gav prompterne den semantiske detalje, der var nødvendig for ændringer som muskelform, hvilket tillod modellen at producere mere præcise og realistiske ændringer.

Træningsimplementering

Odo blev trænet på projektets syntetiske dataset, kombineret med en undermængde af DeepFashion-MultiModal-datasettet, hvilket resulterede i i alt 20.000 billedpar.

DeepFashion-MultiModal-dataen gav variation i tøj og ansigtstræk, med billeder parret mod sig selv under træning. Med alle SMPL-dybde-kort forhåndskalkuleret for effektivitet, løb træningen i 60 epoch på en enkelt NVIDIA A100 GPU med 80GB VRAM.

Med input-billederne omskaleret til 768×1024, blev Adam-optimeringsalgoritmen brugt, med en læringsrate på 1×10⁻⁵. ReshapeNet blev initialiseret med SDXL UNet-vægte og finjusteret sammen med IP-Adapter fra dens checkpoint.

ReferenceNet blev initialiseret med SDXL-vægte og holdt frosset, mens Depth ControlNet brugte forhåndstrænede vægte og forblev også frosset.

Den endelige model krævede cirka 23GB GPU-hukommelse og krævede 18 sekunder for enkelt-billede-inferens.

En ny metode

Manglen på dataset af den type, der er nødvendig for dette projekt, betød, at ingen eksisterende metoder rigtigt adresserede udfordringen. Derfor udviklede forfatterne en ny benchmark, bestående af 3.600 billedpar, der omfattede virkelige ansigtsbilleder og baggrundbeskrivelser, samt diverse kropsskikkelses-variationer.

Andre metoder, der blev brugt, var Structural Similarity Index (SSIM); Peak Signal-to-Noise Ratio (PSNR); Learned Perceptual Image Patch Similarity (LPIPS); og Scale Corrected Per-Vertex Euclidean error in neutral (T-)pose (PVE-T-SC).

Først testede forfatterne deres metode kvalitativt mod billeder fra den virkelige verden (billeder, der ikke var set af modellen under træning):

Kvalitative tests. Eksemplerne viser konverteringer fra det originale billede til tyndere, overvægtige og muskuløse kropstyper på tværs af forskellige holdninger, herunder siddende og stående.

Kvalitative tests. Eksemplerne viser konverteringer fra det originale billede til tyndere, overvægtige og muskuløse kropstyper på tværs af forskellige holdninger, herunder siddende og stående. Se venligst kilde-papiret for bedre definition og detaljer.

Af disse resultater skriver papiret:

‘[Vores] metode håndterer effektivt diverse holdninger, baggrunde og tøj, mens personens identitet bevares.

‘Ud over SMPL-mål-former tilbyder vi tekst-prompts – ‘Gør personen federe,’ ‘Gør personen tyndere,’ eller ‘Gør personen muskuløs’– for at guide de ønskede transformationer…

…'[Billedet nedenfor] demonstrerer yderligere vores modells evne til at udføre diverse formændringer. Modellen følger nøjagtigt SMPL-dybde-kort for at generere multiple variationer af tyndere og federe versioner fra referencebilledet.’

Yderligere kvalitative tests, der dækker området af mål-kropstyper.

Yderligere kvalitative tests, der dækker området af mål-kropstyper. Se venligst kilde-papiret for bedre definition og detaljer.

Forfatterne kommenterer yderligere:

‘Vores resultater demonstrerer mere realistiske transformationer i overensstemmelse med mål-vægt, da vores model samtidigt justerer den samlede kropsskikkelse, lem-proportioner og tøj, hvilket resulterer i anatomisk konsistente og visuelt overbevisende ændringer.’

For kvantitative tests satte forfatterne deres system op mod den åbne kilde Flux Kontext [dev]-model, FLUX.1, og 2022 tilbud Structure-Aware Flow Generation for Human Body Reshaping.

For FLUX.1 Kontext [dev] blev prompts designet til at instruere ‘Gør personen federe,’ ‘Gør personen tyndere,’ eller ‘Gør personen muskuløs’, med mål-vægt specificeret – selvom manglen på fine-kontrol begrænsede præstationen:

Sammenligning af Odo med Structure-Aware Flow Generation for Human Body Reshaping og FLUX.1 Kontext [dev] på test-sættet, sammen med ablations-resultater for modeller trænet uden prompt-konditionering i ReshapeNet, uden ReferenceNet (brugende kun IP-Adapter), og med træning begrænset til BR-5K-datasettet. Tabellen inkluderer også materiale relateret til ablations-studier (BR-5K), som vi ikke dækker her.

Sammenligning af Odo med Structure-Aware Flow Generation for Human Body Reshaping og FLUX.1 Kontext [dev] på test-sættet, sammen med ablations-resultater (ikke dækket i denne artikel) for modeller trænet uden prompt-konditionering i ReshapeNet, uden ReferenceNet (brugende kun IP-Adapter), og med træning begrænset til BR-5K-datasettet.

Konklusion

Tilkomsten af Flux Kontext dette år, og endnu mere nyligt udgivelsen af de ikke-kvantificerede vægte for Qwen Image Edit, har ført parret billed-data tilbage til forkanten af både hobby- og professionelle fællesskaber. I en tid med stigende kritik og utålmodighed overfor den upræcisehed af generativ AI, er modeller af denne type designet til en langt højere trofasthed til input-kilde-billederne (selvom mindre modeller undertiden er begrænsede af deres meget specifikke træningsmål).

I dette tilfælde synes anvendelsen af et krop-omformnings-system at ligge i psykologiske, medicinske og mode-baserede felter. Alligevel forbliver det muligt, at systemer af denne type kan opnå en højere niveau af fremtrædende og måske en mere casual og endda potentielt bekymrende sæt af anvendelser.

 

Offentliggjort mandag, 25. august 2025

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai