Взгляд Anderson
Использование внимания человека может улучшить изображения, сгенерированные ИИ

Новые исследования из Китая предложили метод для улучшения качества изображений, сгенерированных моделями Latent Diffusion Models (LDM), такими как Stable Diffusion.
Метод фокусируется на оптимизации выделяющихся регионов изображения – областей, которые наиболее вероятно привлекут внимание человека.

Новые исследования показали, что карты салиентности (четвертый столбец слева) можно использовать как фильтр или «маску» для управления вниманием в процессе денойзинга в сторону областей изображения, которые наиболее вероятно привлекут внимание человека. Источник: https://arxiv.org/pdf/2410.10257
Традиционные методы оптимизируют все изображение равномерно, тогда как новый подход использует детектор салиентности для выявления и приоритизации более «важных» регионов, как это делают люди.
В количественных и качественных тестах метод исследователей смог превзойти предыдущие модели, основанные на диффузии, как в плане качества изображения, так и в плане соответствия текстовым подсказкам.
Новый подход также занял первое место в тесте восприятия человека с 100 участниками.
Естественный отбор
Салиентность, способность приоритизировать информацию в реальном мире и в изображениях, является неотъемлемой частью человеческого зрения.
Простой пример этого – повышенное внимание к деталям, которое классическое искусство уделяет важным областям картины, таким как лицо в портрете или мачты корабля в морской теме; в таких примерах внимание художника сосредоточено на центральной теме, что означает, что общие детали, такие как фон портрета или далекие волны шторма, более грубые и представительны, чем детальные.
Информированные человеческими исследованиями, методы машинного обучения возникли за последнее десятилетие, которые могут воспроизвести или хотя бы приблизиться к человеческому локусу интереса в любой картине.

Объектная сегментация (семантическая сегментация) может помочь в выделении аспектов изображения и разработке соответствующих карт салиентности. Источник: https://arxiv.org/pdf/1312.6034
В ходе исследовательской литературы наиболее популярным детектором карт салиентности за последние пять лет является инициатива 2016 года Gradient-weighted Class Activation Mapping (Grad-CAM), которая позже эволюционировала в улучшенную Grad-CAM++ систему, среди других вариантов и усовершенствований.
Grad-CAM использует градиент активации семантического токена (такого как «собака» или «кот») для создания визуальной карты того, где концепция или аннотация, вероятно, представлена в изображении.

Примеры из оригинальной статьи Grad-CAM. Во втором столбце руководимая обратная передача индивидуализирует все вкладывающиеся особенности. В третьем столбце семантические карты нарисованы для двух концепций «собака» и «кот». Четвертый столбец представляет собой конкатенацию двух предыдущих выводов. Пятый – карта окклюзии (маскирования), соответствующая выводу; и, наконец, в шестом столбце визуализируются Grad-CAM на уровне ResNet-18. Источник: https://arxiv.org/pdf/1610.02391
Опросы людей о результатах, полученных этими методами, показали соответствие между этими математическими индивидуациями ключевых интересных точек в изображении и человеческим вниманием (при просмотре изображения).
SGOOL
Новая статья рассматривает, что салиентность может принести в текст-изображение (и, потенциально, текст-видео) системы, такие как Stable Diffusion и Flux.
При интерпретации текстовой подсказки пользователем модели Latent Diffusion исследуют свою обученную латентную область для обученных визуальных концепций, соответствующих используемым словам или фразам. Затем они парсят эти найденные данные через процесс денойзинга, где случайный шум постепенно эволюционирует в творческую интерпретацию текстовой подсказки пользователя.
Однако на этом этапе модель придает равное внимание каждой части изображения. С момента популяризации моделей диффузии в 2022 году, с запуском доступной Dall-E генераторов изображений, и последующим открытием фреймворка Stability.ai’s Stable Diffusion, пользователи обнаружили, что «необходимые» разделы изображения часто недооценены.
Учитывая, что в типичном изображении человека лицо (которое имеет максимальную важность для зрителя) занимает не более 10-35% от общего изображения, этот демократический метод распределения внимания работает против природы человеческого восприятия и истории искусства и фотографии.
Когда кнопки на джинсах человека получают такое же вычислительное усилие, как и их глаза, распределение ресурсов можно считать неоптимальным.
Следовательно, новый метод, предложенный авторами, озаглавленный Управление салиентностью оптимизации диффузионных латентов (SGOOL), использует карту салиентности для увеличения внимания к пренебрегаемым областям изображения, уделяя меньше ресурсов разделам, которые, вероятно, останутся на периферии внимания зрителя.
Метод
Пipeline SGOOL включает в себя генерацию изображения, карту салиентности и оптимизацию, с общим изображением и салиентностью-разработанным изображением, обрабатываемыми совместно.

Концептуальная схема для SGOOL.
Вложения модели диффузии оптимизируются напрямую с тонкой настройкой, удаляя необходимость в обучении конкретной модели. Метод выборки Denoising Diffusion Implicit Model (DDIM) из Стэнфордского университета, знакомый пользователям Stable Diffusion, адаптирован для включения вторичной информации, предоставляемой картами салиентности.
Статья гласит:
«Мы сначала используем детектор салиентности, чтобы имитировать человеческую систему внимания и выделить салиентные регионы. Чтобы избежать повторного обучения дополнительной модели, наш метод напрямую оптимизирует диффузионные латенты.
«Кроме того, SGOOL использует обратимый процесс диффузии и наделяет его преимуществами постоянной реализации памяти. Таким образом, наш метод становится параметро-эффективным и готовым к тонкой настройке. Были проведены обширные эксперименты с несколькими метриками и оценкой человека.»
Поскольку этот метод требует нескольких итераций процесса денойзинга, авторы приняли Direct Optimization Of Diffusion Latents (DOODL) фреймворк, который предоставляет обратимый процесс диффузии – хотя он все еще применяет внимание ко всей картинке.
Чтобы определить области человеческого интереса, исследователи использовали фреймворк TransalNet Университета Данди 2022 года.

Примеры обнаружения салиентности из проекта TransalNet 2022 года. Источник: https://discovery.dundee.ac.uk/ws/portalfiles/portal/89737376/1_s2.0_S0925231222004714_main.pdf
Салиентные регионы, обработанные TransalNet, затем обрезались для генерации заключительных салиентных разделов, которые, вероятно, будут наиболее интересны реальным людям.
Разница между текстом пользователя и изображением должна быть рассмотрена в плане определения функции потерь, которая может определить, работает ли процесс. Для этого использовалась версия Contrastive Language–Image Pre-training (CLIP) от OpenAI – теперь основа сектора исследований синтеза изображений – вместе с учетом оцененной семантической дистанции между текстовой подсказкой и глобальным (не-салиентным) изображением.
Авторы утверждают:
«[Окончательная функция потерь] касается отношений между салиентными частями и глобальным изображением одновременно, что помогает сбалансировать локальные детали и глобальную последовательность в процессе генерации.
«Эта осведомленная о салиентности функция потерь используется для оптимизации латентного изображения. Градиенты вычисляются на шумных [латентных] и используются для усиления эффекта условирования входной подсказки на салиентные и глобальные аспекты исходного сгенерированного изображения.»
Данные и тесты
Чтобы протестировать SGOOL, авторы использовали «ванилльную» распределение Stable Diffusion V1.4 (обозначаемое как «SD» в результатах тестов) и Stable Diffusion с руководством CLIP (обозначаемое как «базовый» в результатах).
Система была оценена против трех публичных наборов данных: CommonSyntacticProcesses (CSP), DrawBench и DailyDallE*.
Последний содержит 99 подробных подсказок от художника, представленного в одной из блог-постов OpenAI, в то время как DrawBench предлагает 200 подсказок по 11 категориям. CSP состоит из 52 подсказок, основанных на восьми различных грамматических случаях.
Для SD, базового и SGOOL в тестах использовалась модель CLIP над ViT/B-32 для генерации изображений и текстовых вложений. Использовалась одна и та же подсказка и случайное семя. Размер вывода был 256×256, и использовались значения по умолчанию и настройки TransalNet.
Помимо метрики балла CLIP, использовался оцененный Балл предпочтения человека (HPS), а также реальный тест с 100 участниками.

Количественные результаты, сравнивающие SGOOL с предыдущими конфигурациями.
В отношении количественных результатов, представленных в таблице выше, статья гласит:
«Наша модель значительно превосходит SD и Базовый на всех наборах данных как по баллу CLIP, так и по HPS. Средние результаты нашей модели по баллу CLIP и HPS на 3,05 и 0,0029 выше, чем у второго места, соответственно.»
Авторы также оценили ящики результатов HPS и баллов CLIP по отношению к предыдущим подходам:

Ящики для баллов HPS и CLIP, полученных в тестах.
Они комментируют:
«Можно увидеть, что наша модель превосходит другие модели, что указывает на то, что наша модель более способна генерировать изображения, соответствующие подсказкам.
«Однако на ящике не легко визуализировать сравнение из-за размера этой метрики оценки [0, 1]. Поэтому мы продолжаем рисовать соответствующие гистограммы.
«Можно увидеть, что SGOOL превосходит SD и Базовый на всех наборах данных как по баллу CLIP, так и по HPS. Количественные результаты демонстрируют, что наша модель может генерировать более семантически последовательные и предпочитаемые человеком изображения.»
Исследователи отмечают, что хотя базовая модель может улучшить качество изображения, она не учитывает салиентные области изображения. Они утверждают, что SGOOL, достигая компромисса между глобальной и салиентной оценкой изображения, получает лучшие изображения.
В качественных (автоматических) сравнениях количество оптимизаций было установлено на 50 для SGOOL и DOODL.


Качественные результаты для тестов. Пожалуйста, обратитесь к исходной статье для лучшего определения.
Здесь авторы наблюдают:
«В первом ряду предметы подсказки – «поющая кошка» и «барбер-шоп квартет». В изображении, сгенерированном SD, четыре кошки, и содержание изображения плохо соответствует подсказке.
«Кошка игнорируется в изображении, сгенерированном Базовым, и в изображении не хватает деталей в изображении лица и деталей. DOODL пытается сгенерировать изображение, соответствующее подсказке.
«Однако, поскольку DOODL оптимизирует глобальное изображение напрямую, люди в изображении оптимизируются к кошке.»
Они дальше отмечают, что SGOOL, напротив, генерирует изображения, которые более соответствуют исходной подсказке.
В тесте восприятия человека 100 волонтеров оценили тестовые изображения по качеству и семантической последовательности (т. е. насколько они соответствовали исходному текстовому подсказке). Участники имели неограниченное время для принятия решений.

Результаты теста восприятия человека.
Как отмечает статья, метод авторов заметно предпочитается предыдущим подходам.
Заключение
Не久 после того, как недостатки, рассмотренные в этой статье, стали очевидными в локальных установках Stable Diffusion, различные специальные методы (такие как After Detailer) появились для того, чтобы заставить систему применять дополнительное внимание к областям, которые представляют больший интерес для человека.
Однако этот подход требует, чтобы система диффузии сначала прошла через свой нормальный процесс применения равного внимания ко всей картинке, с увеличением работы, выполняемой как дополнительный этап.
Доказательства из SGOOL показывают, что применение базовой психологии человека к приоритизации разделов изображения может значительно улучшить первоначальный вывод, без пост-обработки.
* Статья предоставляет один и тот же ссылку для этого, что и для CommonSyntacticProcesses.
Опубликовано в среду, 16 октября 2024 года.












