Взгляд Anderson

Преимущества набора веса с помощью ИИ

mm
Добавьте Unite.AI в избранные источники в Google
Images of synthetically altered data, from the paper 'Odo: Depth-Guided Diffusion for Identity-Preserving Body Reshaping at https://arxiv.org/abs/2508.13065

Новая система ИИ может реалистично изменить форму тела людей на фотографиях, делая их толще, стройнее или более мускулистыми, не меняя лицо, одежду или фон. Система обучена на полностью синтетическом наборе данных, который показывает каждую личность в различных типах тела.

 

Помимо все более распространенного использования ИИ как метода уточнения формы тела в социальных сетях или (потенциально) для изменения типов тела для целей визуальных эффектов, использование машинного обучения для изменения внешности людей может служить более важной функцией: помогать людям с расстройствами питания понимать свою собственную дисморфную интерпретацию своего внешнего вида, а также предлагать потенциальный мотивационный инструмент для более общих спортивных и фитнес-целей:

Из статьи 'Оценка размера тела у женщин с анорексией и здоровыми контролями с помощью 3D-аватаров', интерфейс для визуализации изменений формы тела. Люди с дисморфией тела могут испытывать трудности в ассоциации реалистичной интерпретации своего тела с подобным изображением, тем самым давая клиницистам метрику для дисморфных реакций, среди других целей. Источник: https://www.nature.com/articles/s41598-017-15339-z.pdf

Из статьи ‘Оценка размера тела у женщин с анорексией и здоровыми контролями с помощью 3D-аватаров’, интерфейс для визуализации изменений формы тела. Люди с дисморфией тела могут испытывать трудности в ассоциации реалистичной интерпретации своего тела с подобным изображением, тем самым давая клиницистам метрику для дисморфных реакций, среди других целей. Источник: https://www.nature.com/articles/s41598-017-15339-z.pdf

Кроме того, широко разрабатываемый подпроект в области компьютерного зрения, связанный с попробовать одежду, также имеет интерес в предоставлении точных визуализаций на различных типах тела. Тем временем, такие фреймворки, как предложение 2024 года DiffBody от Университета Цукубы в Японии, создали некоторые впечатляющие функции в этой области:

Некоторые из возможных преобразований с помощью предыдущей техники DiffBody. Источник: https://arxiv.org/pdf/2401.02804

Некоторые из возможных преобразований с помощью предыдущей техники DiffBody. Источник: https://arxiv.org/pdf/2401.02804

Поскольку модели ИИ оптимизированы для конвенционально привлекательных или других распространенных типов тела, необычные размеры, такие как “ожирение”, либо минимально представлены в стандартных моделях, либо сопровождаются значительными предубеждениями.

Необходимые пары

Одной из самых больших проблем при создании систем ИИ, которые могут реалистично добавлять или удалять жир и мышцы с фотографий людей, не меняя их лицо, среду или одежду, является то, что это включает в себя парное обучение, где система ИИ эффективно учится на “до” и “после” изображениях, которые определяют любое преобразование, которое модель должна выполнить.

Такой тип обучения вернулся в центр внимания этим летом благодаря успеху серии моделей Kontext от Black Forest Labs, где использовались такие парные данные для обучения моделей на различные преобразования:

Из сайта Flux Kontext, пример преобразования, отражающего тип исходных данных, необходимых для обучения модели, сохраняющей целостность изображения при внесении значительных изменений. Источник: https://bfl.ai/models/flux-kontext

Из сайта Flux Kontext, пример преобразования, отражающего тип исходных данных, необходимых для обучения модели, сохраняющей целостность изображения при внесении значительных изменений. Источник: https://bfl.ai/models/flux-kontext

Очевидно, что в случае разработки модели, которая может значительно изменить внешность человека (без переосмысления всего изображения), необходимо нечто совершенно невозможное в реальном мире: радикальные “до” и “после” изображения, сделанные всего через несколько секунд.

Единственная возможность – синтетические данные. Некоторые проекты такого типа использовали индивидуальные, ручные контрастные пары, созданные вручную в Photoshop; однако это нереалистично в масштабе, и сейчас все больше считается, что предпочтительным является автоматизированный или полуавтоматический, ИИ-ориентированный процесс генерации пар.

Проблема с GAN-основанными и большинством SMPL/X-основанных подходов (где виртуальная CGI-фигура используется как своего рода обменный механизм между реальными изображениями и желаемыми преобразованиями), и с подходами, которые используют деформацию изображения, заключается в том, что фон и идентичность склонны страдать в процессе.

Параметрические, векторные CGI-модели, такие как SMPL и SMPL-X (среди других), предоставляют определенные конвенциональные физические 3D-координаты, которые можно интерпретировать и включать в фреймворки компьютерного зрения. Источник: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf

Параметрические, векторные CGI-модели, такие как SMPL и SMPL-X (среди других), предоставляют определенные конвенциональные физические 3D-координаты, которые можно интерпретировать и включать в фреймворки компьютерного зрения. Источник: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf

Поскольку важно, чтобы ИИ научился изменять только желаемые аспекты, а не учился искажать фоны и воспроизводить другие нежелательные ошибки, ни одна система изменения тела еще не достигла идеального решения.

Однако одна недавняя статья из Индии предлагает заметный прогресс в состоянии дел с помощью использования старого фреймворка диффузионной модели Flux, дополненного рядом второстепенных подходов, которые позволяют получить лучший и более последовательный парный набор данных:

Примеры набора данных из нового проекта. Источник: https://arxiv.org/pdf/2508.13065

Примеры набора данных из нового проекта. Источник: https://arxiv.org/pdf/2508.13065

Проект включает в себя новый и обширный парный набор данных; Odo, генеративную диффузионную модель, обученную на этом наборе данных; и специальную новую метрику, разработанную для количественной оценки производительности редактирования формы человека.

Статья называется Odo: Depth-Guided Diffusion for Identity-Preserving Body Reshaping и исходит от трех исследователей из Fast Code AI Pvt. Ltd в Бангалоре.

Данные и метод

Набор данных, созданный исследователями, включает 7 615 высококачественных изображений (960×1280 пикселей) для каждого целевого типа тела (толстый, тонкий и мускулистый).

Первоначально 1 523 человеческих лица были сгенерированы с помощью FLUX.1-dev 12-миллиардного параметра диффузионной модели, используя неопределенное количество лицензионных изображений лиц из Pexels и Unsplash для увеличения разнообразия.

Для генерации полных изображений тела, включающих эти лица, исследователи использовали предложение ByteDance 2024 года PuLID, контрольную точку, дообученную на базовой модели Flux, и включающую контрастивную потерю идентичности, разработанную для сохранения идентичности лица во время преобразовательных процессов:

Примеры из проекта PuLID. Источник: https://arxiv.org/pdf/2404.16022

Примеры из проекта PuLID. Источник: https://arxiv.org/pdf/2404.16022

Модель получала изображение лица и стандартизированный запрос, запрашивающий пол, одежду, позу, сцену, а также тип тела тонкий, толстый или мускулистый.

Три изображения тела для каждой идентичности иногда демонстрировали незначительные сдвиги в выравнивании фона и воспринимаемом размере объекта, возникающие из-за стохастического поведения моделей диффузии, где каждая генерация начинается с нового шума семя. Даже незначительные изменения запроса, такие как изменение описания типа тела, могут повлиять на траекторию модели в латентном пространстве и вызвать визуальный дрейф.

Для коррекции этого варианта был применен четырехэтапный автоматический постобработочный конвейер, где тонкое изображение в каждом триплете было выбрано в качестве эталона, поскольку его меньший силуэт открывал больше фона.

Обнаружение человека выполнялось с помощью RT-DETRv2, за которым следовало сегментирование с помощью SAM 2.1 для извлечения масок объектов для всех трех типов тела. Изображение тонкого эталона затем передавалось в FLUX.1 Kontext Pro (новую систему редактирования изображений) для заполнения фона, в результате чего получалось чистое изображение сцены, без объекта.

Варианты толстый и мускулистый были изменены в размере с помощью униформального масштабирования для соответствия высоте эталонной маски тонкого типа, и составлены на чистом фоне в одном и том же нижнем выравнивании, обеспечивая последовательную компоновку во всех изображениях.

Авторы заявляют:

‘Результатом являются преобразовательные тройки (тонкий, толстый и мускулистый), имеющие идентичный фон и униформированный масштаб объекта. Это удаляет нерелевантные вариации, которые могли бы негативно повлиять на последующее обучение или оценку.’

Каждая тройка из тонких, толстых и мускулистых изображений позволяла шесть возможных пар преобразований, в результате чего получалось 45 690 теоретических комбинаций по 7 615 идентичностям.

После фильтрации примеров с несоответствующей одеждой, неестественными позами, искаженными конечностями, дрейфом идентичности или минимальным изменением формы оставалось 18 573 высококачественных пар. Хотя некоторые незначительные различия поз остались, модель оказалась устойчивой к этим вариациям.

Обучение и тесты

Результатом стали изображения, использованные для обучения модели Odo – диффузионного подхода к изменению формы человека с использованием карт SMPL (SMPL, т.е. промежуточной CGI) для каждого человека.

Информированный методами Neural Localizer’s 2024 года, данные были приведены в соответствие с моделью SMPL для каждого человека, и полученные оптимизированные параметры позволяли производить карты глубины из которых будут получены измененные изображения:

Схема конвейера обучения. Левая часть показывает настройку обучения, где карты глубины SMPL из целевого изображения направляют ReshapeNet через ControlNet для выполнения преобразования тела. Особенности из исходного изображения извлекаются ReferenceNet и объединяются в ReshapeNet с помощью пространственного само-внимания. Правая часть показывает вывод, где параметры SMPL оцениваются из входного изображения, изменяются семантическими атрибутами и рендерятся в целевую карту глубины, которая обусловливает ReshapeNet во время денойзинга для производства окончательного преобразованного изображения.

Схема конвейера обучения. Левая часть показывает настройку обучения, где карты глубины SMPL из целевого изображения направляют ReshapeNet через ControlNet для выполнения преобразования тела. Особенности из исходного изображения извлекаются ReferenceNet и объединяются в ReshapeNet с помощью пространственного само-внимания. Правая часть показывает вывод, где параметры SMPL оцениваются из входного изображения, изменяются семантическими атрибутами и рендерятся в целевую карту глубины, которая обусловливает ReshapeNet во время денойзинга для производства окончательного преобразованного изображения.

Модель (см. схему выше) состоит из модуля ReshapeNet, поддерживаемого тремя вспомогательными модулями: ReferenceNet; модуль IP-Adapter; и модуль depth-based ControlNet.

ReferenceNet извлекает подробные особенности, такие как фон, одежду и идентичность, из входного изображения и передает их в ReshapeNet. IP-Adapter вносит вклад в высокоуровневое руководство особенностями, в то время как Depth ControlNet применяет условливание на основе SMPL для направления преобразования тела. В соответствии с предыдущими работами, использовался SDXL-основанный замороженный UNet для извлечения промежуточных особенностей.

Что касается модуля IP-Adapter, он кодирует входное изображение с помощью CLIP, и полученные вложения интегрируются обратно в ReshapeNet с помощью кросс-аттенции.

Что касается модуля Depth ControlNet, он направляет средние и декодерские слои ReshapeNet с помощью резидуальных соединений. Затем он принимает карту глубины, отрендеренную из целевых параметров SMPL, и выравнивает ее с целевым изображением.

ReshapeNet, основанный на SDXL UNet, является основной сетью Odo. Во время обучения целевые изображения кодируются в латентное пространство с помощью вариационного автоэнкодера, затем шумятся во времени и денойзятся ReshapeNet с помощью особенностей из ControlNet и ReferenceNet.

Категорио-специфические текстовые запросы, такие как “Сделайте человека толще”, “Сделайте человека стройнее” или “Сделайте человека мускулистым”, добавлялись для направления преобразований. Хотя карты глубины захватывали грубые формы тела, запросы предоставляли семантические детали, необходимые для изменений, таких как определение мышц, позволяя модели производить более точные и реалистичные модификации.

Реализация обучения

Odo был обучен на синтетическом наборе данных проекта, объединенном с подмножеством набора данных DeepFashion-MultiModal, в результате чего получилось в общей сложности 20 000 пар изображений.

Набор данных DeepFashion-MultiModal обеспечил разнообразие в одежде и чертах лица, с изображениями, сопоставленными с собой во время обучения. С предварительно вычисленными картами глубины SMPL для эффективности обучение проводилось в течение 60 эпох на одном GPU NVIDIA A100 с 80 ГБ видеопамяти.

С входными изображениями, измененными до размера 768×1024, использовался оптимизатор Adam с скоростью обучения 1×10⁻⁵. ReshapeNet был инициализирован с весами SDXL UNet и дообучен совместно с IP-Adapter из его контрольной точки.

ReferenceNet был инициализирован с весами SDXL и оставался замороженным, в то время как Depth ControlNet использовал предварительно обученные веса и также оставался замороженным.

Окончательная модель требовала около 23 ГБ видеопамяти, и для вывода одного изображения требовалось 18 секунд.

Новая метрика

Отсутствие наборов данных, необходимых для этого типа проектов, означало, что ни одна из существующих метрик не решала эту задачу. Поэтому авторы разработали новую метрику, состоящую из 3600 пар изображений, включающих реальные изображения лиц и описания фонов, а также различные вариации формы тела.

Другие использованные метрики включали Структурный коэффициент подобия (SSIM); Пиковая отношение сигнал/шум (PSNR); Обученная перцептуальная подобия изображений (LPIPS); и Масштабно-корректированная пер-вертексная евклидова ошибка в нейтральной (Т-)позе (PVE-T-SC).

Сначала авторы протестировали свой метод качественно на изображениях из дикой природы (изображениях, не виденных моделью во время обучения):

Качественные тесты. Примеры преобразований из исходного изображения в более толстые, полные и мускулистые типы тела в различных позах, включая сидение и стояние.

Качественные тесты. Примеры преобразований из исходного изображения в более толстые, полные и мускулистые типы тела в различных позах, включая сидение и стояние. Пожалуйста, обратитесь к исходной статье для лучшего качества и деталей.

Из этих результатов статья гласит:

‘Наш метод эффективно обрабатывает различные позы, фоны и одежду, сохраняя идентичность человека.

‘В дополнение к целевым формам SMPL мы предоставляем текстовые запросы – “Сделайте человека толще”, “Сделайте человека стройнее” или “Сделайте человека мускулистым” – для явного направления желаемых преобразований…

…'[Изображение ниже] еще больше демонстрирует способность нашей модели выполнять различные преобразования формы. Модель точно следует картам глубины SMPL для генерации нескольких вариантов более толстых и стройных версий из эталонного изображения.’

Дополнительные качественные тесты, охватывающие диапазон целевых типов тела.

Дополнительные качественные тесты, охватывающие диапазон целевых типов тела. Пожалуйста, обратитесь к исходной статье для лучшего качества и деталей.

Авторы далее комментируют:

‘Наши результаты демонстрируют более реалистичные преобразования в соответствии с целевым весом, поскольку наша модель одновременно корректирует общую форму тела, пропорции конечностей и одежду, в результате чего получаются анатомически последовательные и визуально убедительные модификации.’

Для количественных тестов авторы сравнили свою систему с открытым исходным кодом моделью Flux Kontext [dev], FLUX.1, и предложением 2022 года Structure-Aware Flow Generation for Human Body Reshaping.

Для FLUX.1 Kontext [dev] запросы были разработаны для инструкции “Сделайте человека толще”, “Сделайте человека стройнее” или “Сделайте человека мускулистым”, с указанием целевых весов – хотя отсутствие тонких контролей ограничивало производительность:

Сравнение Odo с Structure-Aware Flow Generation for Human Body Reshaping и FLUX.1 Kontext [dev] на тестовом наборе, а также результаты абляции для моделей, обученных без условливания запроса в ReshapeNet, без ReferenceNet (используя только IP-Adapter) и с ограничением обучения на наборе данных BR-5K. Таблица также включает материал, связанный с исследованиями абляции (BR-5K), который мы здесь не рассматриваем.

Сравнение Odo с Structure-Aware Flow Generation for Human Body Reshaping и FLUX.1 Kontext [dev] на тестовом наборе, а также результаты абляции для моделей, обученных без условливания запроса в ReshapeNet, без ReferenceNet (используя только IP-Adapter) и с ограничением обучения на наборе данных BR-5K.

Вывод

Появление Flux Kontext в этом году, и более недавний выпуск невзвешенных весов для Qwen Image Edit, вернули парные данные в центр внимания как хобби, так и профессионалов. В климате растущей критики и нетерпения к неточности генеративного ИИ модели такого типа предназначены для более высокой точности исходных изображений (хотя модели меньшего масштаба иногда ограничены своими конкретными целями обучения).

В данном случае полезность системы изменения тела, по-видимому, лежит в психологических, медицинских и модных областях. Однако возможно, что системы такого типа достигнут более высокого уровня известности и, возможно, более повседневного и даже потенциально тревожного набора применений.

 

Опубликовано в первый раз в понедельник, 25 августа 2025 года

Писатель о машинном обучении, специалист в области синтеза человеческих изображений. Бывший руководитель контента исследований в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио сайт: martinanderson.ai
Контакт: [email protected]