Погляд Anderson

Віртуальна примерка нових одягів через штучний інтелект

mm
Додайте Unite.AI до бажаних джерел у Google
Examples of virtual try-on from the Vanast project – source: https://arxiv.org/pdf/2604.04934

Модель штучного інтелекту тепер може перетворити одне фото та зображення одягу на рухому відео людини, яка носить новий одяг, уникнувши глюків, властивих старим двоступеневим системам.

 

Категорія ‘віртуальної примерки’ (VTON) у дослідженні комп’ютерного зору є однією з найкраще фінансованих і найбільш продуктивних напрямків у літературі – головним чином через те, що, як можна побачити з частих промислово-академічних співробітництв, опублікованих щороку, ця мета отримує значне фінансування від модної індустрії:

З статті 'Image-Based Virtual Try-On: A Survey', приклади типів представлення людини та деякі етапи фільтрації та уточнення, які навіть голі зображення повинні пройти для віртуальної примерки. Джерело - https://arxiv.org/pdf/2311.04811v3

З статті ‘Image-Based Virtual Try-On: A Survey’, приклади типів представлення людини та деякі етапи фільтрації та уточнення, які навіть голі зображення повинні пройти для віртуальної примерки (VTON). Джерело

Є багато варіантів цієї мети, наприклад виділення одягу з зображень людей, та адаптація до повнішої фігури, якщо це необхідно. Деякі зображення-орієнтовані системи вже були комерційно реалізовані на платформах, таких як veesual.ai, wanna.fashion та fashn.ai.

Для відео експериментальна програма Google Labs’ Doppl експериментувала з цією функціональністю, запустивши останнім літом:

Будь ласка, натисніть, щоб відтворити відео, якщо воно не відтворюється автоматично. Відрізки з проекту Google Doppl. Джерело

Однак, Doppl закрився в квітні 2026 року після слабкого прийому, а тепер користувачів направляють до сервісу компанії віртуальної примерки зображень:

Сервіс віртуальної примерки зображень Google, куди користувачів направляють з платформи Doppl. Джерело - https://www.google.com/shopping/tryon

Сервіс віртуальної примерки зображень Google, куди користувачів направляють з платформи Doppl. Джерело

Хоча є кілька платформ, які пропонують віртуальну примерку з відео, жодна з них не parece бути пов’язаною з реальним магазином; і всі вони є “блідими” та маргінальними (і часто “сумнівними”) продуктами з токенами.

Хоча є кілька цікавих досліджень з дослідницького сектору, вони традиційно є складними архітектурами, які важко реалізувати для низької затримки та високої якості:

Будь ласка, натисніть, щоб відтворити відео, якщо воно не відтворюється автоматично. З проекту Fashion-VDM 2024 року, приклад “безголової” передачі одягу. Джерело

Справді, завдання підгонки одягу до реальної людини, без викривлення одягу чи людини, при збереженні деякого корисного демонстраційного руху (який точно показує спину продукту, коли людина повертається спиною), є величезним викликом для сучасного стану техніки.

Vanast

Це виклик, якому нова стаття з Кореї намагається відповісти, використовуючи новий і повністю інтегрований підхід до аналізу одягу + людини + руху:

Будь ласка, натисніть, щоб відтворити відео, якщо воно не відтворюється автоматично. Приклади з додаткового сайту проекту Vanast. Джерело

Нова система, названа Vanast, використовує спеціально створену базу даних, яка включає в себе всі три необхідні фактори для виконання завдання: одяг; людина; і рух:

Натисніть, щоб відтворити.Більше прикладів з сайту проекту Vanast.

Система використовує різні фреймворки, такі як Flux, Qwen і ChatGPT, для генерації “трійки” бази даних, яка може інформувати архітектуру від початку до кінця:

З нової статті, приклади даних бази даних, використаних для генерації та навчання. Джерело - https://arxiv.org/pdf/2604.04934

З нової статті, приклади даних бази даних, використаних для генерації та навчання. Джерело

Нова стаття названа Vanast: Віртуальна примерка з анімацією людини через синтетичну трійкову супервізію, і прийшла від чотирьох дослідників з Сеульського національного університету. Є також відеозавантажений сайт проекту.

Метод

Мета авторів у цій роботі полягає в тому, щоб об’єднати три вищезгадані аспекти в єдиній стадії – не тільки тому, що процес буде дискретним, але й тому, що це дає різним аспектам більше можливостей для взаємодії під час навчання, з метою більшої згуртованості генерації:

Vanast поєднує одне фото людини, окремі зображення одягу та відео-руководство рухом для генерації рухомої послідовності, в якій людина носить новий одяг, з допомогою руководства по позі, яке забезпечує послідовний рух, зберігаючи при цьому ідентичність та деталі одягу через кадри.

Vanast поєднує одне фото людини, окремі зображення одягу та відео-руководство рухом для генерації рухомої послідовності, в якій людина носить новий одяг, з допомогою руководства по позі, яке забезпечує послідовний рух, зберігаючи при цьому ідентичність та деталі одягу через кадри.

Для цього система приймає зображення цільового одягу; фото людини в іншому одязі; відео-руководство рухом, яке визначає, як людина повинна рухатися; і текстовий промпт, який описує дію та місце дії; і генерує повну відеопослідовність, в якій людина носить новий одяг, слідуючи нав’язаному руху, з кожним кадром візуально послідовним у часі.

На відміну від розділення процесу одягання та анімації на різні стадії – що було підходом у більшості попередніх робіт – Vanast обробляє одяг, ідентичність та рух разом в одному процесі, дозволяючи цим елементам взаємодіяти під час генерації, і зменшуючи види несумісностей та нестабільності, властивих попереднім методам.

База даних

Навчання проекту засноване на парних прикладах зображення людини, відповідного одягу та відео руху людини в цьому одязі, з рухом, виділеним за допомогою попередньої архітектури, для забезпечення стабільного руководства по позі через кадри.

У відсутності публічно доступної бази даних, яка б задовольняла вимогам проекту, дані були зібрані з (не вказаних) онлайн-платформ торгівлі, забезпечивши кеш відео з різноманітним одягом. Однак завдання вимагало відео однієї людини, яка носить кілька одягів, що є рідкісним знахідкою в дикій природі, і яке потребувало створення синтетичних даних.

Триступеневий процес включав вибір відповідних кадрів з відео, оброблених за допомогою моделі Qwen2.5-VL Vision-Language Model (VLM), з відповідним обрізанням та оцінкою придатності (тобто, відсутність окулювання, об’єкт у правильній позиції тощо); і створення відповідних масок для заповнення для виділення зачіплених областей – яке (у відповідності з попередньою роботою PERSE) обробляється моделлю SDXL з розсіюванням.

Перегляд трубопроводу Vanast, де зображення людини, зображення одягу та відео-руководство рухом кодуються та обробляються в єдиній відеомоделі розсіювання. Система генерує анімацію, яка зберігає ідентичність, слідує за послідовністю поз, та застосовує цільовий одяг, при цьому синтетична генерація трійки підтримує навчання, а двомодульний дизайн розділяє анімацію від передачі одягу, щоб зберегти послідовність.

Перегляд трубопроводу Vanast, де зображення людини, зображення одягу та відео-руководство рухом кодуються та обробляються в єдиній відеомоделі розсіювання. Система генерує анімацію, яка зберігає ідентичність, слідує за послідовністю поз, та застосовує цільовий одяг, при цьому синтетична генерація трійки підтримує навчання, а двомодульний дизайн розділяє анімацію від передачі одягу, щоб зберегти послідовність.

На третьому етапі Qwen знову використовується для класифікації зображень за статтю, а популярний фреймворк Flux з розсіюванням зображень потім використовується для створення змін одягу в зображенні (оскільки Flux здатний об’єднувати кілька вхідних елементів). Промпти для заповнення тексту були підібрані за допомогою ChatGPT (версія не вказана).

Для подальшого збільшення різноманітності поз та фону був введений трубопровід для створення тренувальних трійок з відео в дикій природі, використовуючи базу даних HumanVid. Такий самий процес був використаний для генерації зображення людини, яке зберігає ідентичність.

Оскільки в цих відео не існувало окремого зображення одягу, зображення одягу синтезувалися безпосередньо з відео. Кадри були вибрані з кожного відео, а Qwen використовувався для оцінки їх за видимістю спереду, перш ніж вибрати найбільш підходящого кандидата, заснованого на видимості всього тіла, ясності зображення, мінімальному окулюванні, якості освітлення та загальній композиції.

Регіон верхнього одягу був потім виділений за допомогою SegFormer, а фон видалений для виділення одягу.

Для уникнення позиційного зміщення, регіон одягу був випадковим чином зміщений всередині його обмежувального рамку, а Qwen знову використовувався для фільтрації ненадійних сегментацій. Цей процес створив синтетичні зображення одягу, спарені з рухом та ідентичністю, дозволяючи великомасштабну конструкцію трійок з неструктурованих відеоданих, при цьому підвищуючи стабільність у різних реальних умовах.

Архітектура

Був введений двомодульний архітектурний дизайн для вирішення повільної збіжності та слабкої балансировки контролю, властивих попереднім методам, які намагалися об’єднати всі умови. Підхід використовував трансформер розсіювання відео з текстом з Wan, і також використовував проект VACE (див. нижче).

Модель була розділена на Модуль анімації людини (HAM), який обробляв рух та ідентичність з вхідних даних людини та поз; і Модуль передачі одягу (GTM), який обробляв одяг з зображень одягу. Обидва мали спільний доступ до основи, при цьому інтегруючи функції у розподіленому, каскадному порядку, для поліпшення умов.

Навчання проводилось шляхом заморожування основи та оптимізації лише параметрів HAM і GTM, з їхнім внеском, збалансованим під час інтеграції функцій. Вхідні дані з синтетичної трійкової бази даних були перетворені у латентні представлення за допомогою VAE від WAN.

Контекст, залежний від руху, був побудований шляхом поєднання інформації про людину та позу в часі, тоді як функції одягу оброблялися окремо, та вирівнювалися шляхом проєкції у токенові вкладення.

Модель також була розширена для підтримки інтерполяції одягу. Тут представлення двох одягів були об’єднані для генерації гладких переходів, дозволяючи послідовне та послідовне змішування між предметами одягу, без додаткової оптимізації.

Дані та тести

Модель була навчена на 9 135 відео, довжиною від трьох до десяти секунд, отриманих з вищезгаданих “торгових центрів”; власної згенерованої бази даних авторів; та бази даних HumanVid.

З цих даних були створені дві оціночні бази даних: “Інтернет-база даних”, яка містить відео та зображення продуктів з торгових центрів; та офіційний тестовий розріз бази даних ViViD компанії Alibaba.

Оскільки дані ViViD не містять обличчя (див. вище відео для прикладу, який дуже поширений у літературі віртуальної примерки), вони були додані за допомогою Flux outpainting.

Використані метрики включали L1-помилку; піксельне співвідношення сигналу до шуму (PSNR); індекс структуальної подібності (SSIM); вчена перцептивна подібність зображень (LPIPS); відстань Фреше-Інсепшн (FID); та відстань Фреше-віде (FVD)

Системи, протестовані на передачу одягу, включали OOTDiffusion; CatVTON; OmniTry; та Any2AnyTryon. Моделі генерації зображення людини, протестовані на генерацію зображення людини, включали VisualCloze; MOSAIC; та UNO компанії ByteDance.

Для другої стадії анімації людини були використані фреймворки StableAnimator та DisPose.

У більш обмеженому контексті (оскільки це не підтримує безпосередньо мету) також був протестований VACE, з деякими зусиллями для балансування відсутньої функціональності:

Кількісний порівняльний аналіз з комбінаціями моделей генерації зображення людини та анімації на базах даних Інтернет та ViViD, де запропонована методика досягла найкращої продуктивності за всіма зареєстрованими метриками. Жирні значення вказують на найвищий бал у кожному стовпчику.

Кількісний порівняльний аналіз з комбінаціями моделей генерації зображення людини та анімації на базах даних Інтернет та ViViD, де запропонована методика досягла найкращої продуктивності за всіма зареєстрованими метриками. Жирні значення вказують на найвищий бал у кожному стовпчику.

З початкових результатів, показаних вище, автори заявляють:

‘[Наша] модель досягає найкращої продуктивності за всіма метриками при порівнянні з комбінаціями моделей генерації зображення людини та анімації.

‘Ясні результати [показані нижче] підтверджують, що наш підхід генерує найточніше слідування позі та передачу одягу, зберігаючи при цьому ідентичність більш вірно, ніж усі базові моделі генерації зображення людини.’

Ясний порівняльний аналіз на базах даних Інтернет та ViViD проти базових моделей генерації зображення людини та анімації, де запропонована методика, на думку авторів, пропонує більш точне слідування позі та передачу одягу, зберігаючи при цьому ідентичність більш послідовно, ніж VisualCloze, MOSAIC, UNO та VACE.

Ясний порівняльний аналіз на базах даних Інтернет та ViViD проти базових моделей генерації зображення людини та анімації, де запропонована методика, на думку авторів, пропонує більш точне слідування позі та передачу одягу, зберігаючи при цьому ідентичність більш послідовно, ніж VisualCloze, MOSAIC, UNO та VACE.

Для другої категорії тестів, де були протестовані комбінації віртуальної примерки зображень та моделей анімації, нова робота знову змогла досягти найвищого балу:

Кількісний порівняльний аналіз з комбінаціями моделей віртуальної примерки зображень та анімації на базах даних Інтернет та ViViD. Запропонована методика досягла найкращої загальної продуктивності за метриками, при цьому SSIM залишилася порівнянною з найсильнішою базовою лінією. Жирні значення позначають найвищий бал.

Кількісний порівняльний аналіз з комбінаціями моделей віртуальної примерки зображень та анімації на базах даних Інтернет та ViViD. Запропонована методика досягла найкращої загальної продуктивності за метриками, при цьому SSIM залишилася порівнянною з найсильнішою базовою лінією. Жирні значення позначають найвищий бал.

Автори додають:

‘Ясні порівняльні аналізи [показані нижче] демонструють, що наші результати найбільш близькі до оригіналу серед усіх базових ліній, заснованих на віртуальній примерці зображень.’

Ясні тести за допомогою базових ліній, створених шляхом комбінації моделей VTON з моделями анімації.

Ясні тести за допомогою базових ліній, створених шляхом комбінації моделей VTON з моделями анімації.

Висновок

Хоча проект Vanast досягає дискретного рішення від початку до кінця, відсутність інформації про вимоги до ресурсів навчання та висновку вказує на те, що це може не бути найгнучкішим рішенням. Насправді, сам виклик є надзвичайно складним для виконання, навіть у неоптимізованій системі – і тим більше у комерційному розгортанні, яке потребуватиме низької затримки та доступності/оцінки ефективності у масштабі..?

Віртуальна примерка є однією з “місячних цілей” штучного інтелекту, де сучасний стан техніки, поширений через різні заголовки та вибрані результати, приховує справжню складність завдання, яке, можливо, буде вирішено пізнішими та легшими технологіями, ніж трансформери.

 

Доступно у США, геоблоковано у багатьох інших регіонах, якщо не у всіх.

†† Автори посилаються на ‘VFID’, але посилаються лише на статтю ViViD, яка не виправдовує посилання, наскільки мені відомо, з обмеженим часом для його пошуку. Я припустив, що вони насправді мали на увазі відстань Фреше-відео (FVD), і також були обмежені у часі. Будь ласка, зв’яжіться зі мною для виправлень, якщо це необхідно.

Опубліковано вперше у середу, 8 квітня 2026 року

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai