Andersonの視点
新しい服を通してAIによる仮想試着

AIモデルは、単一の写真と服の画像を動画に変換できるようになりましたが、古い2ステップシステムではよく見られたグリッチを回避しています。
コンピュータビジョン研究における「仮想試着」(VTON)カテゴリは、最も資金が豊かで最も活発な研究分野の1つです。頻繁に発表される業界と学術の共同研究からも明らかなように、ファッション業界から多大な資金が提供されています。

ペーパーの「Image-Based Virtual Try-On:A Survey」から、人物表現の種類と、仮想試着のために基本的な画像を通過させる必要があるフィルタリングと精査の段階の例。ソース – ソース
この目標のバリエーションには、画像から服を抽出することや、必要に応じてより丸みを帯びた体型に合わせることが含まれます。いくつかの画像ベースのシステムは、veesual.ai、wanna.fashion、fashn.aiなどのプラットフォームで商業的に実装されています。
ビデオの場合、Google Labsの実験的なDopplアプリは、この機能を試験的に提供しましたが、去年の夏にリリースされました。
自動再生されない場合はクリックしてください。放棄されたGoogle Dopplビデオ仮想試着プロジェクトからの抜粋。 ソース
しかし、Dopplは2026年4月にあまりにも冷たい評価を受けて終了し、視聴者は会社の画像のみの仮想試着サービスにリダイレクトされました。

Googleの画像のみの仮想試着プログラム。会社の放棄されたDopplプラットフォームからリダイレクトされます。ソース – ソース
ビデオで仮想試着を提供するプラットフォームはほとんどなく、どれも実店舗とは関連がないようです。また、すべて「最先端」で、トークンを推進するマージナルな製品です。
研究セクターからの興味深い試みはありますが、低遅延と高品質を実現するには、複雑なアーキテクチャが難しいものです。
自動再生されない場合はクリックしてください。2024年のFashion-VDMプロジェクトから、「ヘッドレス」衣類転送の例. ソース
服を実際の人物に合わせること、人物を歪めずに、動きを示す動画を作成することは、現在の最先端技術にとって非常に困難な課題です。
Vanast
これは、韓国の新しいペーパーが、衣類、人物、動きを解析するための新しい統合ソリューションを使用して、この課題に取り組もうとしています。
自動再生されない場合はクリックしてください。Vanastプロジェクトの補足資料サイトからの例. ソース
この新しいシステム、Vanastは、3つの要素、服、人物、動きを統合するためのカスタムデータセットを使用しています。
クリックして再生してください。 Vanastプロジェクトサイトからのさらに多くの例
このシステムは、Flux、Qwen、ChatGPTなどのさまざまなフレームワークを使用して、エンドツーエンドアーキテクチャに情報を提供する「トリプレット」データセットを生成します。

新しいペーパーからのデータセットのデータポイントの例、生成とトレーニングに使用。ソース – ソース
新しいペーパーは、Vanast:Human Image Animation via Synthetic Triplet Supervisionを使用した仮想試着と題されています。ソウル国立大学の4人の研究者によって書かれました。また、プロジェクトサイトもあります。
方法
著者がこの研究で述べている目的は、3つの側面、服、人物、動きを1つのフレームワークに統合することです。これは、各側面がトレーニング中に相互作用し、より一貫性のある生成を可能にするためです。

Vanastは、単一の人物写真、別々の服の画像、動きのガイダンスビデオを組み合わせて、人物が新しい服を着た動画シーケンスを生成します。ポーズガイダンスにより、動きが一貫性を保ち、フレーム間でアイデンティティと服の詳細が保存されます。
このシステムは、服の画像、人物の写真、動きのガイダンスビデオ、そしてアクションと設定を説明するテキストプロンプトを受け取り、人物が新しい服を着た動画シーケンスを生成します。
以前の研究とは異なり、Vanastは衣類とアニメーションを2つの段階ではなく、1つのプロセスで処理します。これにより、要素間の不一致や不安定性が減ります。
データセット
このプロジェクトのトレーニングは、人物画像、対応する服の画像、そして人物が服を着た動画で構成されるペアの例に基づいています。動きは、以前のアーキテクチャを使用して抽出され、フレーム間で安定したポーズガイダンスを提供します。
このデータセットは、オンラインショッピングプラットフォームからスクレイピングされたデータと、合成データで構成されています。
データは、Qwen2.5-VLビジョン言語モデル(VLM)を使用して、適切なフレームを選択し、インペイントマスクを作成して、服を分離します。

Vanastのパイプラインの概要。人物画像、服の画像、動きのガイダンスビデオが統一されたビデオ拡散モデルで処理され、動きを保存し、ポーズのシーケンスに従い、服を適用します。合成トリプレットの生成はトレーニングをサポートし、デュアルモジュール設計はアニメーションと服の転送を分離して一貫性を維持します。
このプロセスには、Qwen、Flux、ChatGPTなどのさまざまなフレームワークが使用され、服の画像を生成し、人物の画像を評価します。
さらに、HumanVidデータセットを使用して、トレーニングトリプレットを構築し、アイデンティティと背景の多様性を高めます。
このプロセスにより、服の画像を生成し、動きとアイデンティティをペアにします。
アーキテクチャ
デュアルモジュールアーキテクチャが導入され、以前の方法で見られた遅い収束と弱い制御バランスに対処します。
モデルは、Wanのテキストからビデオの拡散トランスフォーマーと、VACEプロジェクトを使用しています。
モデルは、Human Animation Module(HAM)とGarment Transfer Module(GTM)に分かれています。HAMは動きとアイデンティティを処理し、GTMは服を処理します。両者はバックボーンを共有し、機能を分散してカスケード的に統合して条件付けを改善します。
トレーニングは、バックボーンを固定し、HAMとGTMのパラメータのみを最適化することで実行されます。合成トリプレットデータセットからの入力は、WANの変分オートエンコーダ(VAE)を使用して潜在的な表現に変換されます。
動きを認識したコンテキストは、人間とポーズの情報を時間に沿って組み合わせて構築され、服の特徴は別々に処理され、トークン埋め込みに投影して合わせられます。
モデルは、服の補間もサポートしています。ここで、2つの服の表現が組み合わせて滑らかな遷移を生成し、服のアイテム間で一貫性と整合性を保ちながら、追加の最適化なしに服をブレンドできるようにします。
データとテスト
モデルは、3秒から10秒の長さの9,135本のビデオでトレーニングされました。これらのビデオは、オンラインショッピングプラットフォーム、自社生成データセット、HumanVidデータセットから取得されました。
2つの評価データセットが作成されました。1つは「インターネットデータセット」で、ショッピングモールのビデオと製品画像で構成されています。もう1つは、AlibabaのViViDデータセットの公式テストスプリットです。
ViViDデータセットには顔がないため(上記のビデオを参照)、Fluxアウトペイントを使用して追加しました。
使用されたメトリックは、L1損失、ピーク信号対雑音比(PSNR)、構造類似性指数(SSIM)、学習済み感覚画像パッチ類似性(LPIPS)、Fréchetインセプション距離(FID)、Fréchetビデオ距離(FVD)です。
テストされたシステムは、OOTDiffusion、CatVTON、OmniTry、Any2AnyTryonでした。テストされた主題から画像生成モデルの2つは、VisualCloze、MOSAIC、UNOでした。
2段階目の人間画像アニメーションの場合、StableAnimatorとDisPoseフレームワークが使用されました。
さらに、VACEもテストされ、機能をバランスよくするための努力が払われました。

インターネットとViViDデータセットでの主題から画像とアニメーションモデルの組み合わせとの定量的な比較。提案された方法は、報告されたすべてのメトリックで最高のパフォーマンスを達成しました。太字の値は各列の最高スコアを示します。
著者は、初期の結果について次のように述べています。
「私たちのモデルは、主題から画像生成モデルとアニメーションモデルの組み合わせと比較して、すべてのメトリックで最高のパフォーマンスを達成します。」
「定性的結果はさらに、私たちのアプローチが最も正確なポーズの追跡と服の転送を提供し、すべての主題から画像ベースのベースラインよりもアイデンティティをより忠実に保存することを確認しています。」

インターネットとViViDデータセットでの主題から画像とアニメーションモデルの組み合わせとの定性的比較。著者は、提案された方法がVisualCloze、MOSAIC、UNO、VACEよりも正確なポーズの追跡と服の転送を提供し、アイデンティティをより一貫して保存することを主張しています。
2番目のテストカテゴリでは、画像仮想試着とアニメーションモデルの組み合わせがテストされました。新しい作業はここでも最高のスコアを達成しました。

インターネットとViViDデータセットでの画像仮想試着とアニメーションモデルの組み合わせとの定量的な比較。提案された方法は、メトリック全体で最高のパフォーマンスを達成しました。SSIMは最も強いベースラインと比較して同等でした。太字の値は各列の最高スコアを示します。
著者はさらに述べています。
「定性的比較は、提案されたアプローチが、画像仮想試着ベースのベースラインよりも、最も実際の結果に近い結果を提供することを示しています。」

画像仮想試着モデルとアニメーションモデルの組み合わせを使用した定性的テスト。
結論
Vanastプロジェクトは、離散的なエンドツーエンドのソリューションを達成していますが、トレーニングと推論のリソース要件に関するペーパーの詳細不足は、最もアジャイルまたは敏捷なソリューションではない可能性があることを示唆しています。実際、課題自体は、最先端の技術で達成することにおいて非常に困難です。
仮想試着は、現在の最先端技術の状態では解決されない可能性のある、数多くの「月面着陸」のようなAI目標の1つです。
† 米国では利用可能ですが、他の多くの地域では地理的にブロックされています。
†† 著者は「VFID」を参照していますが、ViViDペーパーのみをリンクしています。これは、参照を正当化していないようです。著者は、実際にはFréchet Video Distance(FVD)を意味していたと思われますが、時間が足りないため確認できませんでした。必要に応じて修正を依頼してください。
初めて公開されたのは2026年4月8日です。












