Взгляд Anderson

Улучшение точности редактирования изображений с помощью ИИ

mm
Добавьте Unite.AI в избранные источники в Google
Images from the paper ' Tight Inversion: Image-Conditioned Inversion for Real Image Editing'

Хотя модель Firefly от Adobe является одной из лучших доступных в настоящее время, пользователи Photoshop, которые попробовали ее генеративные функции, заметили, что она не может легко редактировать существующие изображения – вместо этого она полностью заменяет выбранную пользователем область на изображение, основанное на текстовом запросе пользователя (хотя Firefly хорошо интегрирует полученную сгенерированную секцию в контексте изображения).

В текущей бета-версии Photoshop может хотя бы использовать ссылочное изображение в качестве частичного изображения-запроса, что позволяет Adobe догнать функциональность, которую пользователи Stable Diffusion наслаждались более двух лет, благодаря сторонним фреймворкам, таким как Controlnet:

Текущая бета-версия Adobe Photoshop позволяет использовать ссылочные изображения при генерации нового контента внутри выбора – хотя это пока что дело случая.

Текущая бета-версия Adobe Photoshop позволяет использовать ссылочные изображения при генерации нового контента внутри выбора – хотя это пока что дело случая.

Это иллюстрирует открытую проблему в области синтеза изображений – трудность, с которой модели диффузии сталкиваются при редактировании существующих изображений без реализации полномасштабного «переосмысления» выбора, указанного пользователем.

Хотя это диффузионное заполнение выполняет запрос пользователя, оно полностью переосмысливает исходный предмет, не принимая во внимание исходное изображение (за исключением смешивания нового поколения с окружением). Источник: https://arxiv.org/pdf/2502.20376

Хотя это диффузионное заполнение выполняет запрос пользователя, оно полностью переосмысливает исходный предмет, не принимая во внимание исходное изображение (за исключением смешивания нового поколения с окружением). Источник: https://arxiv.org/pdf/2502.20376

Эта проблема возникает потому, что модели диффузии генерируют изображения посредством итеративной денойзинга, где каждый этап процесса обусловлен текстовым запросом, предоставленным пользователем. С текстовым запросом, преобразованным в токены вложения, и с гипермасштабной моделью, такой как Stable Diffusion или Flux, содержащей сотни тысяч (или миллионы) gầnко соответствующих вложений, связанных с запросом, процесс имеет рассчитанное условное распределение для достижения; и каждый шаг является шагом к этому «условному распределению».

Итак, это текст в изображение – сценарий, в котором пользователь «надеется на лучшее», поскольку нет возможности точно знать, каким будет сгенерированное изображение.

Вместо этого многие пытались использовать мощную генеративную способность модели диффузии для редактирования существующих изображений – но это требует балансирования между точностью и гибкостью.

Когда изображение проецируется в латентное пространство модели с помощью методов, таких как DDIM-инверсия, цель состоит в том, чтобы восстановить исходное изображение как можно ближе, при этом позволяя вносить значимые изменения. Проблема заключается в том, что чем более точно изображение восстанавливается, тем больше модель придерживается своей исходной структуры, что затрудняет внесение значительных изменений.

Вместе с многими другими диффузионными фреймворками редактирования изображений, предложенными в последние годы, архитектура Renoise имеет трудности с внесением любых реальных изменений в внешний вид изображения, с только формальным указанием на галстук-бабочку у основания горла кошки.

Вместе с многими другими диффузионными фреймворками редактирования изображений, предложенными в последние годы, архитектура Renoise имеет трудности с внесением любых реальных изменений в внешний вид изображения, с только формальным указанием на галстук-бабочку у основания горла кошки.

С другой стороны, если процесс отдает приоритет редактируемости, модель ослабляет свою хватку на исходном изображении, что делает его проще вносить изменения – но за счет общей последовательности с исходным изображением:

Миссия выполнена – но это трансформация, а не коррекция, для большинства фреймворков редактирования изображений на основе ИИ.

Миссия выполнена – но это трансформация, а не коррекция, для большинства фреймворков редактирования изображений на основе ИИ.

Поскольку это проблема, с которой даже ресурсы Adobe борются, мы можем разумно считать, что задача заметна и может не иметь простых решений, если они вообще существуют.

Тight Inversion

Следовательно, примеры в новой статье, опубликованной на этой неделе, привлекли мое внимание, поскольку работа предлагает ценное и заметное улучшение текущего состояния дел в этой области, доказав, что может применять тонкие и изысканные редактирования к изображениям, проецируемым в латентное пространство модели – без того, чтобы редактирования были незначительными или подавляли исходный контент в исходном изображении:

С применением Tight Inversion к существующим методам инверсии, исходный выбор учитывается более детальным образом, и преобразования соответствуют исходному материалу, вместо того, чтобы переписывать его.

С применением Tight Inversion к существующим методам инверсии, исходный выбор учитывается более детальным образом, и преобразования соответствуют исходному материалу, вместо того, чтобы переписывать его.

Хоббиисты и практики LDM могут узнать этот тип результата, поскольку большая часть его может быть создана в сложном рабочем процессе с помощью внешних систем, таких как Controlnet и IP-Adapter.

Фактически, новый метод – называемый Tight Inversion – действительно использует IP-Adapter, а также специальную модель, основанную на лицах, для изображений человека.

Из оригинальной статьи 2023 года об IP-Adapter, примеры создания подходящих редактирований исходного материала. Источник: https://arxiv.org/pdf/2308.06721

Из оригинальной статьи 2023 года об IP-Adapter, примеры создания подходящих редактирований исходного материала. Источник: https://arxiv.org/pdf/2308.06721

Основное достижение Tight Inversion заключается в том, что оно процедурно сложные методы в единую модальность плагина, который можно применить к существующим системам, включая многие из наиболее популярных распределений LDM.

Естественно, это означает, что Tight Inversion (TI), как и вспомогательные системы, которые оно использует, использует исходное изображение в качестве фактором условности для своей редактированной версии, вместо того, чтобы полагаться только на точные текстовые запросы:

Дополнительные примеры способности Tight Inversion применять действительно смешанные редактирования к исходному материалу.

Дополнительные примеры способности Tight Inversion применять действительно смешанные редактирования к исходному материалу.

Хотя авторы признают, что их подход не свободен от традиционной и постоянной напряженности между точностью и редактируемостью в диффузионных методах редактирования изображений, они сообщают о результатах на уровне состояния дел при внедрении TI в существующие системы по сравнению с базовым показателем.

Новая работа называется Tight Inversion: Image-Conditioned Inversion for Real Image Editing и исходит от пяти исследователей из Тель-Авивского университета и Snap Research.

Метод

Первоначально используется большая языковая модель (LLM) для генерации набора различных текстовых запросов, из которых генерируется изображение. Затем применяется упомянутая выше DDIM-инверсия к каждому изображению с тремя текстовыми условиями: текстовый запрос, использованный для генерации изображения; сокращенная версия того же; и пустой (пустой) запрос.

С полученным шумом, возвращенным из этих процессов, изображения снова генерируются с тем же условием, и без классификаторной направленности (CFG).

Оценки инверсии DDIM по различным метрикам с разными настройками запросов.

Оценки инверсии DDIM по различным метрикам с разными настройками запросов.

Как мы видим из графика выше, оценки по различным метрикам улучшаются с увеличением длины текста. Метрики, использованные для этого, были пиковая отношение сигнала к шуму (PSNR); евклидово расстояние L2; структурный показатель подобия (SSIM); и наученная перцептивная подобия патчей изображения (LPIPS).

Осведомленность об изображении

По сути, Tight Inversion меняет способ, которым хост-модель диффузии редактирует реальные изображения, обусловливая процесс инверсии самим изображением, а не полагаясь только на текст.

Обычно инверсия изображения в пространство шума модели диффузии требует оценки начального шума, который, при денойзинге, восстанавливает вход. Стандартные методы используют текстовый запрос для направления этого процесса; но несовершенный запрос может привести к ошибкам, потерям деталей или изменению структур.

Tight Inversion вместо этого использует IP-Adapter для подачи визуальной информации в модель, чтобы она восстанавливала изображение с большей точностью, преобразуя исходные изображения в токены условности и проецируя их в конвейер инверсии.

Эти параметры можно редактировать: увеличение влияния исходного изображения делает восстановление почти идеальным, в то время как уменьшение его позволяет вносить более творческие изменения. Это делает Tight Inversion полезным как для тонких изменений, таких как изменение цвета рубашки, так и для более значительных редактирований, таких как замена объектов – без обычных побочных эффектов других методов инверсии, таких как потеря мелких деталей или неожиданные аномалии в фоновом контенте.

Авторы заявляют:

‘Мы отмечаем, что Tight Inversion можно легко интегрировать с предыдущими методами инверсии (например, Edit Friendly DDPM, ReNoise) путем [замены родного диффузионного ядра на модель, измененную с помощью IP-Adapter], и Tight Inversion последовательно улучшает эти методы как с точки зрения восстановления, так и с точки зрения редактируемости.’

Данные и тесты

Исследователи оценили TI на его способность восстанавливать и редактировать реальные изображения. Все эксперименты использовали Stable Diffusion XL с планировщиком DDIM, как описано в оригинальной статье о Stable Diffusion; и все тесты использовали 50 шагов денойзинга при масштабе направленности по умолчанию 7,5.

Для условности изображения использовался IP-Adapter-plus sdxl vit-h. Для тестов с несколькими шагами исследователи использовали SDXL-Turbo с планировщиком Euler, и также провели эксперименты с FLUX.1-dev, обусловливая модель в последнем случае на PuLID-Flux, используя RF-Inversion на 28 шагах.

PulID использовался только в случаях, когда изображения содержали человеческие лица, поскольку это область, для которой PulID был обучен – и хотя это замечательно, что для этой одной возможной категории запросов используется специализированная подсистема, наша чрезмерная заинтересованность в генерации человеческих лиц предполагает, что полагаться исключительно на более широкие веса базовой модели, такой как Stable Diffusion, может быть недостаточно для стандартов, которые мы требуем для этой конкретной задачи.

Тесты на восстановление проводились для качественной и количественной оценки. На изображении ниже показаны качественные примеры для инверсии DDIM:

Качественные результаты для инверсии DDIM. Каждый ряд показывает высокодетальное изображение рядом с его восстановленными версиями, с каждым шагом, использующим прогрессивно более точные условия во время инверсии и денойзинга. По мере того, как условность становится более точной, качество восстановления улучшается. Правый столбец демонстрирует лучшие результаты, где исходное изображение само используется в качестве условия, достигая наивысшей точности. CFG не использовался на любом этапе. Пожалуйста, обратитесь к исходному документу для лучшего разрешения и деталей.

Качественные результаты для инверсии DDIM. Каждый ряд показывает высокодетальное изображение рядом с его восстановленными версиями, с каждым шагом, использующим прогрессивно более точные условия во время инверсии и денойзинга. По мере того, как условность становится более точной, качество восстановления улучшается. Правый столбец демонстрирует лучшие результаты, где исходное изображение само используется в качестве условия, достигая наивысшей точности. CFG не использовался на любом этапе. Пожалуйста, обратитесь к исходному документу для лучшего разрешения и деталей.

В статье говорится:

‘Эти примеры подчеркивают, что обусловливание процесса инверсии на изображении значительно улучшает восстановление в высокодетальных регионах.

‘Заметно, что в третьем примере [изображения ниже] наш метод успешно восстанавливает татуировку на спине правого боксера. Кроме того, поза ноги боксера более точно сохраняется, и татуировка на ноге становится видимой.’

Дополнительные качественные результаты для инверсии DDIM. Описательные условия улучшают инверсию DDIM, с обусловливанием изображения, превосходящим текст, особенно на сложных изображениях.

Дополнительные качественные результаты для инверсии DDIM. Описательные условия улучшают инверсию DDIM, с обусловливанием изображения, превосходящим текст, особенно на сложных изображениях.

Авторы также протестировали Tight Inversion в качестве модуля, который можно вставить в существующие системы, противопоставив модифицированные версии их базовому показателю.

Три системы, протестированные в этом случае, были упомянутыми выше DDIM-инверсией и RF-Inversion; и также ReNoise, которая разделяет часть авторства со статьей, обсуждаемой здесь. Поскольку результаты DDIM не имеют трудностей с достижением 100% восстановления, исследователи сосредоточились только на редактируемости.

(Качественные изображения результатов сформированы так, что трудно воспроизвести здесь, поэтому мы направляем читателя к исходному PDF для полного освещения и лучшего разрешения, несмотря на то, что некоторые выборки представлены ниже)

Слева, качественные результаты восстановления для Tight Inversion с SDXL. Справа, восстановление с Flux. Расположение этих результатов в опубликованной работе затрудняет их воспроизведение здесь, поэтому, пожалуйста, обратитесь к исходному PDF для истинного впечатления от различий, полученных.

Слева, качественные результаты восстановления для Tight Inversion с SDXL. Справа, восстановление с Flux. Расположение этих результатов в опубликованной работе затрудняет их воспроизведение здесь, поэтому, пожалуйста, обратитесь к исходному PDF для истинного впечатления от различий, полученных.

Здесь авторы комментируют:

‘Как показано, интеграция Tight Inversion с существующими методами последовательно улучшает восстановление. Например, наш метод точно восстанавливает перила в левом примере и человека в синей рубашке в правом примере [на рисунке 5 статьи].’

Авторы также протестировали систему количественно. В соответствии с предыдущими работами, они использовали набор валидации MS-COCO и отмечают, что результаты (показанные ниже) улучшили восстановление по всем метрикам для всех методов.

Сравнение метрик производительности систем с и без Tight Inversion.

Сравнение метрик производительности систем с и без Tight Inversion.

Далее авторы протестировали способность системы редактировать фотографии, противопоставив ее базовым версиям предыдущих подходов prompt2prompt; Edit Friendly DDPM; LED-ITS++; и RF-Inversion.

Показаны ниже выборки качественных результатов для SDXL и Flux (и мы направляем читателя к довольно сжатому расположению исходной статьи для дальнейших примеров).

Выборки из обширных качественных результатов (довольно запутанно) разбросанных по статье. Мы направляем читателя к исходному PDF для лучшего разрешения и осмысленной ясности.

Выборки из обширных качественных результатов (довольно запутанно) разбросанных по статье. Мы направляем читателя к исходному PDF для лучшего разрешения и осмысленной ясности.

Авторы утверждают, что Tight Inversion последовательно превосходит существующие методы инверсии, найдя лучший баланс между восстановлением и редактируемостью. Стандартные методы, такие как инверсия DDIM и ReNoise, могут хорошо восстановить изображение, но, как отмечается в статье, они часто испытывают трудности с сохранением мелких деталей при внесении изменений.

Напротив, Tight Inversion использует обусловливание изображения, чтобы привязать выход модели более тесно к исходному, предотвращая нежелательные искажения. Авторы утверждают, что даже когда конкурирующие подходы производят восстановления, которые кажутся точными, введение изменений часто приводит к артефактам или структурным несоответствиям, и что Tight Inversion смягчает эти проблемы.

Наконец, количественные результаты были получены путем оценки Tight Inversion против MagicBrush с использованием инверсии DDIM и LEDITS++, измеренной с помощью CLIP Sim.

Количественные сравнения Tight Inversion против MagicBrush.

Количественные сравнения Tight Inversion против MagicBrush.

Авторы заключают:

‘В обоих графиках четко наблюдается компромисс между сохранением изображения и соответствием целевому редактированию. Tight Inversion обеспечивает лучший контроль над этим компромиссом и лучше сохраняет исходное изображение, сохраняя при этом соответствие редактированию [запроса]. ‘

‘Обратите внимание, что сходство CLIP выше 0,3 между изображением и текстовым запросом указывает на правдоподобное соответствие между изображением и запросом.’

Вывод

Хотя Tight Inversion не представляет собой «прорыв» в одной из самых острых проблем синтеза изображений на основе LDM, оно консолидирует ряд трудоемких вспомогательных подходов в унифицированный метод редактирования изображений на основе ИИ.

Хотя напряженность между редактируемостью и точностью не исчезает при этом методе, она заметно уменьшается, согласно представленным результатам. Учитывая, что центральная задача, которую решает эта работа, может оказаться в конечном итоге неразрешимой, если подойти к ней на ее собственных условиях (а не рассматривать архитектуры, основанные на LDM, в будущих системах), Tight Inversion представляет собой желаемое инкрементальное улучшение в текущем состоянии дел.

 

Опубликовано впервые в пятницу, 28 февраля 2025 года

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai