Взгляд Anderson
Восстановление и редактирование изображений человека с помощью ИИ

Новое сотрудничество между Университетом Калифорнии в Мерседе и Adobe представляет собой достижение в области восстановления изображений человека – задачи, связанной с «раскрытием» скрытых или закрытых частей изображений людей, для целей таких как виртуальная примерка, анимация и редактирование фотографий.

Помимо ремонта поврежденных изображений или изменения их по желанию пользователя, системы восстановления изображений человека, такие как CompleteMe, могут накладывать новые одежды (через сопутствующее изображение-справку, как в среднем столбце этих двух примеров) на существующие изображения. Эти примеры взяты из обширного дополнительного PDF для новой статьи. Источник: https://liagm.github.io/CompleteMe/pdf/supp.pdf
Новый подход, озаглавленный CompleteMe: восстановление изображений человека на основе справочных изображений, использует дополнительные входные изображения, чтобы «предложить» системе, какой контент должен заменить скрытую или отсутствующую часть изображения человека (отсюда применимость к фреймворкам виртуальной примерки).

Система CompleteMe может приспособить справочный контент к скрытой или закрытой части изображения человека.
Новая система использует двойную архитектуру U-Net и блок внимания, ориентированного на область (RFA), который集中ует ресурсы на соответствующей области восстановления изображения.
Исследователи также предлагают новую и сложную систему оценки для оценки задач восстановления на основе справочных изображений (поскольку CompleteMe является частью существующей и продолжающейся исследовательской ветви в области компьютерного зрения, но не имела до сих пор схемы оценки).
В тестах и в хорошо масштабированном пользовательском исследовании новый метод показал себя лучше в большинстве метрик и в целом. В некоторых случаях соперничающие методы были полностью запутаны подходом, основанным на справочных изображениях.

Из дополнительного материала: метод AnyDoor имеет особые трудности с интерпретацией справочного изображения.
В статье говорится:
‘Обширные эксперименты на нашей системе оценки показывают, что CompleteMe превосходит методы, основанные на справочных изображениях и не основанные на них, в плане количественных метрик, качественных результатов и пользовательских исследований. ‘
‘В частности, в сложных сценариях, включающих сложные позы, сложные узоры одежды и характерные аксессуары, наша модель последовательно достигает лучшей визуальной достоверности и семантической согласованности.’
К сожалению, страница проекта на GitHub не содержит кода и не обещает его предоставить, и инициатива, которая также имеет скромную страницу проекта, представляется как проприетарная архитектура.

Дополнительный пример субъективной производительности новой системы по сравнению с предыдущими методами. Более подробная информация представлена позже в статье.
Метод
Фреймворк CompleteMe основан на справочном U-Net, который обрабатывает интеграцию вспомогательных материалов в процесс, и на сплоченном U-Net, который обеспечивает более широкий спектр процессов для получения окончательного результата, как показано в концептуальной схеме ниже:

Концептуальная схема CompleteMe. Источник: https://arxiv.org/pdf/2504.20042
Система сначала кодирует входное изображение с маской в латентное представление. Одновременно справочный U-Net обрабатывает несколько справочных изображений – каждый из которых показывает разные части тела – для извлечения подробных пространственных 特征.
Эти особенности проходят через блок внимания, ориентированного на область, встроенный в сплоченный U-Net, где они выбираются с помощью соответствующих масок регионов, обеспечивая, чтобы модель обращала внимание только на соответствующие области справочных изображений.
Замаскированные особенности затем интегрируются с глобальными семантическими особенностями, полученными из CLIP, через декуплированный кросс-аттеншн, что позволяет модели реконструировать отсутствующий контент с помощью как мелких деталей, так и семантической согласованности.
Чтобы повысить реализм и надежность, процесс маскирования входных данных сочетает случайные сетчатые затенения с масками формы человеческого тела, каждая из которых применяется с равной вероятностью, увеличивая сложность отсутствующих областей, которые модель должна заполнить.
Для справки
Предыдущие методы восстановления изображений на основе справочных изображений обычно полагались на семантический уровень кодировщиков. Проекты этого типа включают CLIP и DINOv2, которые извлекают глобальные особенности из справочных изображений, но часто теряют мелкие пространственные детали, необходимые для точного сохранения идентичности.

Из выпуска статьи о более старом подходе DINOv2, который включен в сравнительные тесты новой статьи: цветные наложения показывают первые три главных компонента из анализа главных компонентов (PCA), примененного к фрагментам изображений в каждом столбце, подчеркивая, как DINOv2 объединяет подобные части объектов по разным изображениям. Источник: https://arxiv.org/pdf/2304.07193
CompleteMe решает эту проблему с помощью специализированного справочного U-Net, инициализированного из Stable Diffusion 1.5, но работающего без шага шума диффузии*.
Каждое справочное изображение, покрывающее разные части тела, кодируется в подробные латентные особенности через этот U-Net. Глобальные семантические особенности также извлекаются отдельно с помощью CLIP, и оба набора особенностей кэшируются для эффективного использования во время интеграции на основе внимания. Таким образом, система может гибко обрабатывать несколько справочных входных данных, сохраняя при этом мелкозернистую информацию о внешности.
Оркестрация
Сплоченный U-Net управляет окончательными стадиями процесса восстановления. Адаптированный из варианта inpainting Stable Diffusion 1.5, он принимает в качестве входных данных маскированное исходное изображение в латентной форме, а также подробные пространственные особенности, извлеченные из справочных изображений, и глобальные семантические особенности, извлеченные из кодировщика CLIP.
Эти различные входные данные объединяются через блок RFA, который играет решающую роль в направлении внимания модели к наиболее релевантным областям справочного материала.
До входа в механизм внимания справочные особенности явно маскируются, чтобы удалить нерелевантные области, а затем конкатенируются с латентным представлением исходного изображения, обеспечивая, чтобы внимание было направлено как можно более точно.
Чтобы повысить эту интеграцию, CompleteMe включает декуплированный механизм кросс-аттеншна, адаптированный из фреймворка IP-Adapter:

IP-Adapter, часть которого включена в CompleteMe, является одним из наиболее успешных и часто используемых проектов за последние три бурные года разработки архитектур моделей диффузии. Источник: https://ip-adapter.github.io/
Это позволяет модели обрабатывать пространственно детализированные визуальные особенности и более широкий семантический контекст через отдельные потоки внимания, которые позже объединяются, в результате чего получается согласованная реконструкция, которая, по мнению авторов, сохраняет как идентичность, так и мелкие детали.
Оценка
В отсутствие подходящего набора данных для восстановления изображений человека на основе справочных изображений исследователи предложили свой собственный. Набор данных (без названия) был построен путем отбора выбранных пар изображений из набора данных WPose, разработанного для проекта Adobe Research 2023 года UniHuman.

Примеры поз из проекта Adobe Research 2023 года UniHuman. Источник: https://github.com/adobe-research/UniHuman?tab=readme-ov-file#data-prep
Исследователи вручную нарисовали исходные маски, чтобы указать области inpainting, в конечном итоге получив 417 трипартитных групп изображений, состоящих из исходного изображения, маски и справочного изображения.

Два примера групп, полученных изначально из справочного набора данных WPose и тщательно отобранных исследователями новой статьи.
Авторы использовали большую языковую модель LLaVA, чтобы сгенерировать текстовые подсказки, описывающие исходные изображения.
Метрики, использованные для оценки, были более обширными, чем обычно; кроме обычных пиковой сигнал-шумовой отношения (PSNR), индекса структурированного сходства (SSIM) и обученной перцептивной сходства патчей изображений (LPIPS, в данном случае для оценки маскированных областей), исследователи использовали DINO для оценки сходства; DreamSim для оценки результатов генерации; и CLIP.
Данные и тесты
Для проверки работы авторы использовали как модель Stable Diffusion V1.5 по умолчанию, так и модель inpainting 1.5. Изображение-кодировщик системы использовал модель Vision CLIP, вместе с проекционными слоями – скромными нейронными сетями, которые перестраивают или выравнивают выходные данные CLIP, чтобы они соответствовали внутренним размерам особенностей, используемых моделью.
Обучение проводилось в течение 30 000 итераций на восьми GPU NVIDIA A100†, под наблюдением среднеквадратичной ошибки (MSE), при размере партии 64 и скорости обучения 2×10-5. Различные элементы случайным образом удалялись в течение обучения, чтобы предотвратить переобучение системы на данных.
Набор данных был изменен из набора данных Parts to Whole, который сам основан на наборе данных DeepFashion-MultiModal.

Примеры из набора данных Parts to Whole, использованные при разработке отобранных данных для CompleteMe. Источник: https://huanngzh.github.io/Parts2Whole/
Авторы заявляют:
‘Чтобы удовлетворить нашим требованиям, мы перестроили обучающие пары, используя затененные изображения с несколькими справочными изображениями, которые отражают различные аспекты внешности человека, вместе с их короткими текстовыми метками. ‘
‘Каждый образец в нашем обучающем наборе данных включает шесть типов внешности: верхняя одежда, нижняя одежда, одежда для всего тела, волосы или головные уборы, лицо и обувь. Для стратегии маскирования мы применяем случайное сетчатое затенение в 50% случаев между 1 и 30 раз, а в остальных 50% случаях используем маску формы человеческого тела, чтобы увеличить сложность маскирования. ‘
‘После процесса построения мы получили 40 000 пар изображений для обучения.’
Соперничающие предыдущие методы без справочных изображений, которые были протестированы, включали Large occluded human image completion (LOHC) и модель inpainting BrushNet; методы, основанные на справочных изображениях, включали Paint-by-Example; AnyDoor; LeftRefill; и MimicBrush.
Авторы начали с количественного сравнения по вышеуказанным метрикам:

Результаты начального количественного сравнения.
Что касается количественной оценки, авторы отмечают, что CompleteMe достигает最高 баллов по большинству перцептивных метрик, включая CLIP-I, DINO, DreamSim и LPIPS, которые призваны отражать семантическую согласованность и достоверность внешности между выходными данными и справочным изображением.
Однако модель не превосходит все базовые методы во всех отношениях. Заметно, что BrushNet набирает最高 балл по CLIP-T, LeftRefill лидирует по SSIM и PSNR, а MimicBrush немного превосходит по CLIP-I.
Хотя CompleteMe демонстрирует последовательно сильные результаты в целом, различия в производительности являются скромными в некоторых случаях, и определенные метрики остаются под контролем соперничающих предыдущих методов. Авторы представляют эти результаты как доказательство сбалансированной силы CompleteMe как по структурным, так и по перцептивным измерениям.
Иллюстрации для качественных тестов, проведенных в рамках исследования, слишком многочисленны, чтобы их можно было воспроизвести здесь, и мы направляем читателя не только к исходной статье, но и к обширному дополнительному PDF, который содержит многие дополнительные качественные примеры.
Мы выделяем основные качественные примеры, представленные в основной статье, вместе с выбором дополнительных случаев, взятых из пула дополнительных изображений, представленных ранее в этой статье:

Первоначальные качественные результаты, представленные в основной статье. Пожалуйста, обратитесь к исходной статье для лучшего разрешения.
Об авторах качественных результатов, представленных выше, говорится:
‘Учитывая маскированные входные данные, эти методы без справочных изображений генерируют правдоподобный контент для маскированных областей, используя приоритетные изображения или текстовые подсказки. ‘
‘Однако, как указано в красном квадрате, они не могут воспроизвести конкретные детали, такие как татуировки или уникальные узоры одежды, поскольку им не хватает справочных изображений, чтобы руководить реконструкцией идентичной информации.’
Второе сравнение, часть которого показана ниже, фокусируется на четырех методах, основанных на справочных изображениях: Paint-by-Example, AnyDoor, LeftRefill и MimicBrush. Здесь была предоставлена только одна справочная картинка и текстовая подсказка.

Качественное сравнение с методами, основанными на справочных изображениях. CompleteMe производит более реалистичные завершения и лучше сохраняет конкретные детали из справочного изображения.
Авторы заявляют:
‘Учитывая маскированное изображение человека и справочное изображение, другие методы могут генерировать правдоподобный контент, но часто не сохраняют контекстную информацию из справочного изображения точно. ‘
‘В некоторых случаях они генерируют нерелевантный контент или неправильно сопоставляют соответствующие части из справочного изображения. Напротив, CompleteMe эффективно завершает маскированную область, точно сохраняя идентичную информацию и правильно сопоставляя соответствующие части тела из справочного изображения.’
Чтобы оценить, насколько хорошо модели соответствуют человеческому восприятию, авторы провели пользовательское исследование с участием 15 аннотаторов и 2895 пар образцов. Каждая пара сравнивала выход CompleteMe с одним из четырех методов, основанных на справочных изображениях: Paint-by-Example, AnyDoor, LeftRefill или MimicBrush.
Аннотаторы оценивали каждый результат на основе визуального качества завершенной области и степени, в которой она сохраняла идентичность из справочного изображения – и здесь, оценивая общее качество и идентичность, CompleteMe получил более определенный результат:

Результаты пользовательского исследования.
Заключение
Если что-то и подрывает качественные результаты в этом исследовании, то это их огромное количество, поскольку при ближайшем рассмотрении становится ясно, что новая система является наиболее эффективным входом в эту относительно нишевую, но интенсивно преследуемую область нейронной редактирования изображений.
Однако для этого требуется немного больше заботы и приближения к оригинальному PDF, чтобы оценить, насколько хорошо система адаптирует справочный материал к закрытой области по сравнению (почти во всех случаях) с предыдущими методами.

Мы настоятельно рекомендуем читателю тщательно изучить первоначально запутанную, если не подавляющую лавину результатов, представленных в дополнительном материале.
* Интересно отметить, как теперь уже сильно устаревший выпуск V1.5 остается любимцем исследователей – частично из-за наследия одинаковых тестов, но также потому, что он является наименее цензурированным и, возможно, наиболее легко обучаемым из всех итераций Stable Diffusion, и не разделяет цензурного ограничения FOSS Flux выпусков.
† Характеристика VRAM не указана – это было бы либо 40 ГБ, либо 80 ГБ на карту.
Опубликовано впервые во вторник, 29 апреля 2025 года












