Взгляд Anderson

Виртуальная примерка новой одежды с помощью ИИ

mm
Добавьте Unite.AI в избранные источники в Google
Examples of virtual try-on from the Vanast project – source: https://arxiv.org/pdf/2604.04934

Модель ИИ может превратить одну фотографию и изображения одежды в движущееся видео человека, надевающего новые наряды, избегая глюков, характерных для более старых, двухэтапных систем.

 

Категория ‘виртуальной примерки’ (VTON) в исследованиях компьютерного зрения является одной из наиболее финансируемых и плодовитых направлений в литературе – главным образом потому, что, как можно понять из частых сотрудничеств между промышленностью и академией, опубликованных каждый год, эта цель получает значительное финансирование от финансово мощной модной индустрии:

Из статьи 'Image-Based Virtual Try-On: A Survey', примеры типов представления человека и некоторых этапов фильтрации и уточнения, которые даже базовые изображения должны пройти для виртуальной примерки. Источник - https://arxiv.org/pdf/2311.04811v3

Из статьи ‘Image-Based Virtual Try-On: A Survey’, примеры типов представления человека и некоторых этапов фильтрации и уточнения, которые даже базовые изображения должны пройти для виртуальной примерки (VTON). Источник

Существует множество вариаций этой цели, таких как извлечение одежды из изображений людей, и адаптация к более полной фигуре при необходимости. Некоторые системы на основе изображений были коммерчески реализованы на платформах such as veesual.ai, wanna.fashion и fashn.ai.

Для видео экспериментальное приложение Google Labs’ Doppl экспериментировало с этой функциональностью, запущенной прошлым летом:

Пожалуйста, нажмите, чтобы воспроизвести, если видео не воспроизводится автоматически. Фрагменты из заброшенного проекта Google Doppl видео примерки.  Источник

Однако Doppl был закрыт в апреле 2026 года после сдержанной реакции, и теперь пользователи перенаправляются на службу примерки изображений компании :

Программа примерки изображений Google, на которую пользователи перенаправляются из заброшенной платформы Doppl. Источник - https://www.google.com/shopping/tryon

Программа примерки изображений Google, на которую пользователи перенаправляются из заброшенной платформы Doppl. Источник

Хотя существуют некоторые интересные попытки из исследовательского сектора, они традиционно являются сложными архитектурами, которые трудно реализовать для низкой задержки и высокого качества:

Пожалуйста, нажмите, чтобы воспроизвести, если видео не воспроизводится автоматически. Из проекта Fashion-VDM 2024 года, пример ‘бесголовой’ передачи одежды. Источник

На самом деле, задача согласования одежды с реальным человеком, не искажая ни одежду, ни человека, и сохраняя некоторое полезное демонстративное движение (которое точно показывает заднюю часть продукта, когда человек поворачивает спину), является внушительной задачей для текущего состояния искусства.

Vanast

Это задача, которую новая статья из Кореи пытается решить, используя новое и полностью интегрированное решение для парсинга одежды + человека + движения:

Пожалуйста, нажмите, чтобы воспроизвести, если видео не воспроизводится автоматически. Примеры из веб-сайта дополнительных материалов проекта Vanast. Источник 

Новая система, озаглавленная Vanast, использует специально созданную базу данных, включающую все три необходимых фактора для выполнения задачи: одежду; человека; и движение:

Нажмите, чтобы воспроизвести. Больше примеров из веб-сайта проекта Vanast.

Система использует различные фреймворки, такие как Flux, Qwen и ChatGPT, для создания ‘триплетной’ базы данных, способной информировать конечную архитектуру:

Из новой статьи, примеры точек данных базы данных, используемых для генерации и обучения. Источник - https://arxiv.org/pdf/2604.04934

Из новой статьи, примеры точек данных базы данных, используемых для генерации и обучения. Источник

Статья новая статья озаглавлена Vanast: Виртуальная примерка с анимацией человеческого изображения через синтетическое триплетное обучение, и исходит от четырех исследователей из Сеульского национального университета. Также существует видео-насыщенный веб-сайт проекта.

Метод

Заявленная цель авторов в работе заключается в объединении трех упомянутых выше аспектов в едином фреймворке – не только потому, что процесс будет дискретным, но и потому, что это дает различным аспектам больше возможностей для взаимодействия во время обучения, с целью более сплоченной генерации:

Vanast объединяет одну фотографию человека, отдельные изображения одежды и видео-руководство движения для генерации движущейся последовательности, в которой человек носит новый наряд, с руководством позы, обеспечивающим последовательное движение, а идентификатор и детали одежды сохраняются на протяжении кадров.

Vanast объединяет одну фотографию человека, отдельные изображения одежды и видео-руководство движения для генерации движущейся последовательности, в которой человек носит новый наряд, с руководством позы, обеспечивающим последовательное движение, а идентификатор и детали одежды сохраняются на протяжении кадров.

Для достижения этого системы принимает изображения целевой одежды; фотографию человека в другой одежде; видео-руководство движения, определяющее, как человек должен двигаться; и текстовый сигнал, описывающий действие и обстановку; и производит полную видео-последовательность, в которой человек кажется носящим новый наряд, следуя наложенному движению, с каждым кадром, сохраняющим визуальную последовательность во времени.

Вместо разделения примерки и анимации на разные этапы – что было подходом в большинстве подобных предыдущих работ – Vanast обрабатывает одежду, идентификатор и движение вместе в едином процессе, позволяя этим элементам взаимодействовать во время генерации и уменьшая виды несоответствий и нестабильности, характерных для более ранних методов.

База данных

Обучение для проекта основано на парных примерах изображения человека, соответствующих изображений одежды и видео человека, движущегося в этой одежде, с движением, извлеченным с помощью предыдущей архитектуры, для обеспечения стабильного руководства позы на протяжении кадров.

В отсутствие публично доступной базы данных, удовлетворяющей требованиям проекта, данные были собраны из (неуказанных) онлайн-магазинов, предоставив кэш видео с разнообразной одеждой. Однако задача требовала видео человека, носящего несколько нарядов, что является редкостью в дикой природе, и что потребовало создания синтетических данных.

Трехэтапный процесс включал выбор подходящих кадров из видео, обработанных с помощью Qwen2.5-VL Vision-Language Model (VLM), с соответствующим обрезанием и оценкой пригодности (т.е. без заслонений, объект в правильном положении и т. д.); и создание подходящих масок inpainting для изоляции затронутых областей – что (в соответствии с предыдущей работой PERSE) обрабатывается моделью SDXL распространения.

Обзор конвейера Vanast, где изображение человека, целевые изображения одежды и видео-руководство движения кодируются и обрабатываются в едином видео-модели распространения. Система генерирует анимацию, сохраняющую идентификатор, следующую последовательности позы и применяющую целевую одежду, а синтетическое триплетное обучение поддерживает обучение, а двухмодульный дизайн отделяет анимацию от передачи одежды, чтобы сохранить последовательность.

Обзор конвейера Vanast, где изображение человека, целевые изображения одежды и видео-руководство движения кодируются и обрабатываются в едином видео-модели распространения. Система генерирует анимацию, сохраняющую идентификатор, следующую последовательности позы и применяющую целевую одежду, а синтетическое триплетное обучение поддерживает обучение, а двухмодульный дизайн отделяет анимацию от передачи одежды, чтобы сохранить последовательность.

На третьем этапе Qwen снова используется для классификации изображений по полу, а популярный Flux фреймворк распространения изображений затем используется для создания изменений в одежде на изображении (поскольку Flux способен объединять несколько входных элементов). Текстовые сигналы inpainting были курированы ChatGPT (версия не указана).

Для дальнейшего увеличения разнообразия позы и фона был введен конвейер для построения обучающих триплетов из видео в дикой природе, используя HumanVid базу данных. Та же процедура была использована для генерации идентификатор-пreservation изображения человека.

Поскольку в этих видео не существовало отдельного изображения одежды, изображения одежды были синтезированы直接 из видео. Кадры были отобраны из каждого видео, и Qwen использовался для оценки их по передней видимости, прежде чем выбрать наиболее подходящий кандидат, основанный на полной видимости, ясности изображения, минимальных заслонениях, качестве освещения и общей композиции.

Регион верхней одежды был затем извлечен с помощью SegFormer, и фон был удален, чтобы изолировать одежду.

Чтобы избежать позиционного смещения, регион одежды был случайно смещен внутри своего ограничивающего прямоугольника, и Qwen использовался снова для фильтрации ненадежных сегментаций. Этот процесс произвел синтетические изображения одежды, парные с движением и идентификатором, позволяя создать большие триплеты из неструктурированных видео-данных, а также улучшить устойчивость в различных реальных условиях.

Архитектура

Была введена двухмодульная архитектура для решения медленной сходимости и слабого баланса контроля, наблюдаемых в предыдущих методах, которые пытались объединить все условия. Подход использовал текст-в-видео диффузионный трансформер из Wan, и также опирался на VACE проект (см. ниже).

Модель была разделена на Модуль анимации человека (HAM), который обрабатывал движение и идентификатор из человеческих и позных входов; и Модуль передачи одежды (GTM), который обрабатывал одежду из изображений одежды. Оба имели общий доступ к основной части, а также интегрировали функции в распределенном, каскадном порядке, чтобы улучшить условность.

Обучение проводилось путем замораживания основной части и оптимизации только параметров HAM и GTM, с их вкладами, сбалансированными во время интеграции функций. Входные данные из синтетической триплетной базы данных были преобразованы в латентные представления с помощью VAE WAN.

Контекст, осведомленный о движении, был построен путем объединения человеческой и позной информации во времени, а функции одежды обрабатывались отдельно и выравнивались путем проекции на токенные вложения.

Модель также была расширена для поддержки интерполяции одежды. Здесь представления из двух одежд были объединены для генерации плавных переходов, позволяя последовательному и связному смешиванию между предметами одежды, без дополнительной оптимизации.

Данные и тесты

Модель была обучена на 9 135 видео, с длиной от трех до десяти секунд, полученных из упомянутых выше ‘магазинных сайтов’; собственной сгенерированной базы данных авторов; и HumanVid базы данных.

Из них были созданы две базы данных для оценки: ‘Интернет-база данных’, включающая видео и изображения продуктов из торговых центров; и официальный тестовый раздел базы данных Alibaba ViViD.

Поскольку база данных ViViD не имеет лиц (см. выше видео, для примера, который очень распространен в литературе виртуальной примерки), они были добавлены с помощью Flux outpainting.

Используемые метрики включали L1 потерю; Пиковое соотношение сигнал-шум (PSNR); Индекс структурированного подобия (SSIM); Учитываемое подобие патчей изображений (LPIPS); Расстояние Фреше-Инсепшн (FID); и Расстояние Фреше-виде (FVD)

Системы, протестированные на передачу одежды, включали OOTDiffusion; CatVTON; OmniTry; и Any2AnyTryon. Модели генерации изображения человека, протестированные, включали VisualCloze; MOSAIC; и UNO от ByteDance.

Для второй стадии анимации человека были использованы фреймворки StableAnimator и DisPose.

В более ограниченном контексте (поскольку он не поддерживает напрямую цель) VACE также был протестирован, с некоторыми усилиями по балансировке недостающей функциональности:

Количественное сравнение с комбинациями моделей субъект-изображение и анимации на Интернет- и ViViD базах данных, где предложенный метод достиг лучшей производительности во всех сообщаемых метриках. Жирные значения указывают на лучший балл в каждом столбце.

Количественное сравнение с комбинациями моделей субъект-изображение и анимации на Интернет- и ViViD базах данных, где предложенный метод достиг лучшей производительности во всех сообщаемых метриках. Жирные значения указывают на лучший балл в каждом столбце.

Из первых результатов, показанных выше, авторы заявляют:

‘[Наша] модель достигает лучшей производительности во всех метриках при сравнении с комбинациями моделей субъект-изображение и анимации.

‘Качественные результаты [показаны ниже] подтверждают, что наш подход производит наиболее точное следование позе и передачу одежды, сохраняя идентификатор более верно, чем все базовые модели субъект-изображение.’

Качественное сравнение на Интернет- и ViViD базах данных против базовых моделей субъект-изображение и анимации, где предложенный метод, по утверждению авторов, предлагает более точное выравнивание позы и передачу одежды, сохраняя идентификатор более последовательно, чем VisualCloze, MOSAIC, UNO и VACE.

Качественное сравнение на Интернет- и ViViD базах данных против базовых моделей субъект-изображение и анимации, где предложенный метод, по утверждению авторов, предлагает более точное выравнивание позы и передачу одежды, сохраняя идентификатор более последовательно, чем VisualCloze, MOSAIC, UNO и VACE.

Для второй категории тестов, где комбинации виртуальных примерок изображений и моделей анимации были протестированы, новая работа снова смогла достичь высшего балла:

Количественное сравнение с комбинациями моделей виртуальной примерки изображений и анимации на Интернет- и ViViD базах данных. Предложенный метод достиг лучшей общей производительности во всех метриках, с SSIM, оставаясь сравнимым с сильнейшим базовым методом. Жирные значения обозначают высший балл.

Количественное сравнение с комбинациями моделей виртуальной примерки изображений и анимации на Интернет- и ViViD базах данных. Предложенный метод достиг лучшей общей производительности во всех метриках, с SSIM, оставаясь сравнимым с сильнейшим базовым методом. Жирные значения обозначают высший балл.

Авторы добавляют:

‘Качественные сравнения [показаны ниже] демонстрируют, что наши результаты наиболее близко соответствуют реальным данным среди всех базовых моделей виртуальной примерки изображений.’

Качественные тесты, использующие базовые модели, созданные путем комбинации моделей VTON и анимации.

Качественные тесты, использующие базовые модели, созданные путем комбинации моделей VTON и анимации.

Заключение

Хотя проект Vanast достигает дискретного решения конца в конец, отсутствие деталей в статье о требованиях к ресурсам обучения и вывода указывает на то, что это может не быть наиболее гибким или ловким решением. На самом деле, задача сама по себе является чрезвычайно трудной для достижения даже в неоптимизированной системе – и тем более в коммерческой реализации, которая потребует низкой задержки и доступности/рентабельности в масштабе..?

Виртуальная примерка является одной из ‘лунных’ целей ИИ, где текущее состояние искусства, как оно распространяется через различные заголовки и отобранные результаты, скрывает фактическую трудность задачи, которая, возможно, в конечном итоге будет решена более поздними и более легкими технологиями, чем трансформеры.

 

Доступно в США, геоблокировано во многих других регионах, если не во всех.

†† Авторы ссылаются на ‘VFID’, но ссылаются только на статью ViViD, которая не оправдывает ссылку, насколько я могу судить, с ограниченным временем для ее поиска. Я предполагаю, что они фактически имели в виду расстояние Фреше-видео (FVD), и также были ограничены во времени. Пожалуйста, свяжитесь со мной для исправлений, если необходимо.

Опубликовано впервые в среду, 8 апреля 2026 года

Писатель о машинном обучении, специалист в области синтеза человеческих изображений. Бывший руководитель контента исследований в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио сайт: martinanderson.ai
Контакт: [email protected]