Andersonの視点
AIを使用して太りを見せることの利点

新しいAIシステムは、写真の中の人々の体をリアルに変形させることができます。太り、痩せ、または筋肉質になることができますが、顔、服、背景は変わりません。このシステムは、各アイデンティティを複数の体の種類で表示する完全に合成されたデータセットでトレーニングされています。
AIを使用して、ソーシャルネットワークで体の形を整えることができることは、すでに一般的になっています。さらに、VFXの目的で体の形を変えることもできます。ただし、機械学習を使用して個人の外見を変えることは、より重要な機能を果たすことができます。例えば、食事障害を持つ人々が自分の体の歪んだ解釈を理解するのに役立ちます。また、一般的なスポーツやフィットネスの目的でも、動機付けのツールとして役立ちます。

論文「女性の無食症と健康な対照群における3Dアバターを使用した体の大きさの推定」から、体の形の変化を視覚化するためのGUI。体の形の歪んだ解釈を持つ人々は、実際の体の形と同じ画像を関連付けるのに苦労する可能性があります。これにより、臨床医は歪んだ反応の尺度を得ることができます。出典:https://www.nature.com/articles/s41598-017-15339-z.pdf
さらに、コンピュータビジョン研究の分野では、さまざまな体の形の精確な視覚化を提供することが重要です。例えば、2024年のDiffBodyというフレームワークは、体の形の変化を可能にします。

DiffBodyテクニックを使用した変換の例。出典:https://arxiv.org/pdf/2401.02804
AIの基礎モデルは、一般的に美しい体の形や一般的な体の形に最適化されています。したがって、通常のモデルでは、太りすぎた体の形などの特殊な体の形は利用できないか、または偏見を持っています。
ペアの必要性
体の形を変えるAIシステムを作る上で最大の課題は、体の形を変えるだけで、背景、環境、服を変えないようにすることです。これは、ペアのトレーニングが必要です。つまり、AIシステムは「前」と「後」の画像を学習する必要があります。
この種のトレーニングは、Black Forest LabsのKontextシリーズの画像編集モデルが成功したことで、再び注目されています。このモデルでは、ペアのデータを使用して、モデルにさまざまな変換を教えることができます。

Flux Kontextサイトからの変換の例。モデルが大きな変化を加える際に、画像の完全性を維持するために必要なソースデータの種類を示しています。出典:https://bfl.ai/models/flux-kontext
明らかに、人々の外見を大幅に変えるモデルを作るには、現実の世界では不可能な「前」と「後」の画像が必要です。したがって、合成データを使用する必要があります。
この種のプロジェクトの一部は、Photoshopで手動で作成された個々の、高度なコントラストのペアを使用しましたが、これは大規模なプロジェクトでは現実的ではありません。したがって、自動化された、または半自動化されたAI駆動のプロセスが、ペアを生成するために使用されることが増えています。
GANベースのアプローチやSMPL/Xベースのアプローチ、画像の歪みを使用するアプローチには、背景やアイデンティティが損なわれるという問題があります。

SMPLやSMPL-XなどのパラメトリックベクトルベースのCGIモデルは、定義された物理的な3D座標を提供し、コンピュータビジョンフレームワークに組み込むことができます。出典:https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf
したがって、体の形を変えるシステムはまだ完璧な解決策にはなりません。
しかし、インドの最近の論文では、Flux拡散モデルフレームワークを使用して、ペアのデータセットを生成するための新しいアプローチを提案しています。

新しいプロジェクトからのデータセットの例。出典:https://arxiv.org/pdf/2508.13065
このプロジェクトでは、新しいペアのデータセット、Odoという名前の生成拡散モデル、そして人体の形を編集するパフォーマンスを評価するための新しいベンチマークが含まれています。
この論文は「Odo:Depth-Guided Diffusion for Identity-Preserving Body Reshaping」というタイトルで、Fast Code AI Pvt. Ltdの3人の研究者によって書かれました。
データと方法
研究者が作成したデータセットには、各ターゲット体の種類(太り、痩せ、筋肉質)ごとに7,615枚の高解像度画像(960x1280px)が含まれています。
最初の1,523人の顔は、FLUX.1-dev 12億パラメータの拡散モデルを使用して生成されました。さらに、PexelsとUnsplashからのライセンスフリーの参照顔画像を使用して、多様性を高めました。
これらの顔画像を使用して、ByteDanceの2024年のPuLIDを使用して、背景、服、ポーズを含む全身画像を生成しました。

PuLIDプロジェクトからの例。出典:https://arxiv.org/pdf/2404.16022
モデルは、性別、服、ポーズ、シーン、体の種類(太り、痩せ、筋肉質)を含む標準化されたプロンプトを受け取りました。
3つの体の種類の画像は、拡散モデルの確率的な動作により、背景の配置や被写体のサイズに若干の違いが生じることがありました。プロンプトをわずかに変更すると、潜在的な空間でモデルの軌道が変わり、視覚的なドリフトが生じる可能性があります。
この変動を修正するために、4段階の自動ポストプロセッシングパイプラインが適用され、薄い画像が参照画像として選択されました。
人を検出するためにRT-DETRv2が使用され、SAM 2.1を使用して被写体のマスクを抽出して、3つの体の種類すべてのマスクを抽出しました。薄い参照画像は、背景をクリーンな画像に変換するためにFLUX.1 Kontext Proに渡されました。
太りと筋肉質のバリアントは、薄い参照マスクの高さに一致するように、均一なスケーリングでリサイズされ、同じ背景に合成されました。
著者は次のように述べています:
‘結果として得られる変換のトリプレット(薄い、太り、筋肉質)は、同じ背景と一貫した被写体のスケールを持ちます。これにより、トレーニングまたは評価に悪影響を与える可能性のある無関係な変動が除去されます。’
各トリプレットには、6つの可能な変換ペアがあり、7,615のアイデンティティに対して合計45,690の組み合わせが可能でした。ただし、不適切な例をフィルタリングした後、18,573の高品質のペアが残りました。
トレーニングとテスト
生成された画像は、Odoモデルをトレーニングするために使用されました。Odoモデルは、拡散ベースのアプローチを使用して、人体の形を変えるモデルです。
2024年のNeural Localizerの方法に基づいて、データはSMPLフィギュアに適合され、最適化されたパラメータは深度マップを生成することができました。

トレーニングパイプラインのスキーマ。左側はトレーニングの設定を示し、SMPLの深度マップがReshapeNetをControlNet経由で体の変換に導きます。右側は推論を示し、SMPLパラメータが入力画像から推定され、セマンティック属性で修正され、ターゲット深度マップが生成され、ReshapeNetが最終的な変換画像を生成するために使用されます。
モデルは、ReshapeNetモジュールと3つの補助モジュールで構成されています。ReferenceNet、IP-Adapterモジュール、Depth ControlNetモジュールです。
ReferenceNetは、入力画像から詳細な特徴を抽出してReshapeNetに渡します。IP-Adapterは、高レベルの特徴ガイダンスを提供します。Depth ControlNetは、SMPLベースの条件付けを適用して体の変換を導きます。
ReshapeNetは、SDXL UNetに基づいています。トレーニング中、ターゲット画像は潜在的な空間にエンコードされ、ノイズが加えられ、ReshapeNetによって除去されました。
カテゴリ固有のテキストプロンプト、例えば「太りを増やせ」や「痩せを増やせ」、「筋肉質にせ」が追加され、変換を導きました。
トレーニングの実装
Odoは、プロジェクトの合成データセットとDeepFashion-MultiModalデータセットのサブセットを組み合わせた、合計20,000枚の画像ペアでトレーニングされました。
DeepFashion-MultiModalデータは、服や顔の特徴の多様性を提供し、画像はペアでトレーニングされました。SMPLの深度マップは事前に計算され、トレーニングは60エポックで行われ、NVIDIA A100 GPUの80GBのVRAMを使用しました。
入力画像は768×1024にリサイズされ、Adamオプティマイザは1×10⁻⁵の学習率で使用されました。ReshapeNetはSDXL UNetの重みで初期化され、IP-Adapterとともにファインチューンされました。
ReferenceNetはSDXLの重みで初期化され、凍結されました。Depth ControlNetは事前にトレーニングされた重みで初期化され、凍結されました。
最終的なモデルは約23GBのGPUメモリを必要とし、単一の画像の推論には18秒かかりました。
新しい指標
この種のプロジェクトに必要なデータセットが不足しているため、既存の指標では課題に対処できません。したがって、著者は新しいベンチマークを提案しました。3,600枚の画像ペアで構成されており、実際の顔画像、背景の説明、そしてさまざまな体の形のバリエーションが含まれています。
他の指標として、構造類似性指数(SSIM)、ピーク信号対雑音比(PSNR)、学習された感覚画像パッチ類似性(LPIPS)、スケール補正された頂点間ユークリッド距離(PVE-T-SC)が使用されました。
まず、著者は、トレーニング中にモデルに表示されなかった画像で、方法を質的的にテストしました。

質的テスト。画像は、元の画像から痩せ、太り、筋肉質な体の形への変換を示しています。座る、立つなどの姿勢も含まれています。出典:論文を参照してください。
この結果について、論文では次のように述べています:
‘私たちの方法は、さまざまな姿勢、背景、服を効果的に処理し、人物のアイデンティティを維持します。さらに、SMPLターゲット形状に加えて、変換を明示的に導くテキストプロンプト「太りを増やせ」、「痩せを増やせ」、「筋肉質にせ」を提供します。’
‘画像は、モデルがさまざまな形の変換を実行できることを示しています。モデルは、SMPLの深度マップに従って、元の画像からさまざまなバージョンを生成します。’

さらに質的テスト。ターゲット体の形の範囲をカバーしています。出典:論文を参照してください。
著者はさらに次のように述べています:
‘私たちの結果は、ターゲット重量に応じてよりリアルな変換を示しています。私たちのモデルは、全体的な体の形、四肢の比例、服を同時に調整し、解剖学的に一貫した、視覚的に説得力のある変更をもたらします。’
量的テストでは、著者はシステムを、Flux Kontext [dev]モデル、FLUX.1、および2022年の「Structure-Aware Flow Generation for Human Body Reshaping」と比較しました。
![Odo、Structure-Aware Flow Generation for Human Body Reshaping、FLUX.1 Kontext [dev]のテストセットの比較。](https://www.unite.ai/wp-content/uploads/2025/08/table-2-1.jpg)
Odo、Structure-Aware Flow Generation for Human Body Reshaping、FLUX.1 Kontext [dev]のテストセットの比較。
結論
Flux Kontextの今年の登場や、Qwen Image Editの非量子化重みのリリースにより、ペアの画像データが再び注目されています。このようなモデルは、入力ソース画像に高い忠実度を提供するように設計されています。
体の形を変えるシステムの有用性は、心理学、医学、ファッションの分野にあると思われます。ただし、このようなシステムが、より一般的で、潜在的に懸念される使用法に進化する可能性もあります。
2025年8月25日初出












