Взгляд Anderson
Искусственно сгенерированные изображения для рекламы, нацеленные на вашу демографическую группу – и, в конечном итоге, на вас?

Рекламодатели стремятся адаптировать рекламу к отдельным зрителям, чтобы стимулировать клики, и хотя создание индивидуальных рекламных материалов для каждого человека в настоящее время не является praktichnym, новые исследования предполагают, что искусственно сгенерированные изображения могут быть эффективно нацелены на конкретные демографические группы.
Персонализированная реклама, представленная в научно-фантастическом боевике Стивена Спилберга 2002 года Миноритеты, оставила неизгладимое, даже жуткое впечатление на культуру, с ее ярким изображением проактивных рекламных щитов, которые распознают людей в толпе и кричат рекламные сообщения прямо на них.
Многие потребительские группы могут рассматривать этот уровень распознавания зрителей как кошмар, и хотя прогресс в этом направлении был замедлен из-за последствий скандала с Cambridge Analytica скандала, идеал прямого, высоко нацеленного взаимодействия остается ценной целью в рекламе.
В действительности, системы, которые могут детализировать характеристики конкретного зрителя остаются в постоянном развитии – хотя в таких случаях корпоративные исследования должны принять меры для уважения законов о личной идентификационной информации (PII); законы, которые были укреплены в Европе за последнее десятилетие, с этими улучшенными защитами, распространенными в других местах через Брюссельский эффект.
Привет, ты!
Теперь, когда искусственно сгенерированная реклама и маркетинговый контент становятся все более популярными, рекламодателям все равно приходится сталкиваться с потенциальными затратами на рекламу, нацеленную на конкретных людей, где изображения и текст генерируются оппортунистически и на лету.
Например, даже если индивидуальное изображение могло быть сгенерировано очень быстро, затраты в масштабе были бы значительными. Кроме того, автоматические онлайн-аукционы рекламы работают в критических, миллисекундных временных рамках, что делает пользовательскую индивидуальную контентную рекламу сложной, на данный момент; и видеоконтент еще более отдаленной перспективой.
Однако технические препятствия, связанные с решением более высокого уровня демографических когортных групп в сетевой аудитории (через ноутбуки, телефоны, умные телевизоры и т. д.), не так серьезны – и новое международное академическое/отраслевое сотрудничество предлагает способ создания отдельных рекламных изображений для разных демографических групп, включая факторы, такие как возраст и местоположение:

Из новой работы: примеры персонализированного генерирования рекламы, где один и тот же продукт представлен в разных стилях для разных групп зрителей. Верхний ряд показывает исходные изображения продукта. Следующие три ряда показывают версии, адаптированные к трем различным типам аудитории на продукт, на основе различий в характеристиках, таких как возраст, образ жизни или эстетические предпочтения. Эти типы групп не предопределены, а обнаруживаются автоматически.
Новая структура – озаглавленная Один размер, много подходит (OSMF) – направлена на мостирование разрыва между широкотаргетной рекламой и нереально детальной персонализацией, генерируя разные рекламные изображения для автоматически обнаруженных групп аудитории, используя продукт-осведомленное кластеризование для согласования визуального контента с предпочтениями кликов различных демографических групп
Авторы утверждают:
‘[Мы] представляем объединенную структуру, которая согласовывает разнообразные групповые предпочтения в крупномасштабном генерировании рекламных изображений.
‘OSMF начинается с продукто-адаптивного группирования, которое динамически организует пользователей на основе их атрибутов и характеристик продукта, представляя каждую группу с богатыми коллективными предпочтениями.’
Тестирование против сравнимых структур показало результаты на уровне состояния искусства.
Хотя работа определяет разнообразные когортные группы, статья не конкретизирует, какие демографические характеристики представлены каждой G-группировкой, хотя они, вероятно, соответствуют традиционным рыночным сегментам.
Следовательно, не легко определить, основываясь на различных примерах, данных в основной статье и приложении, почему определенные фоны или освещение могут понравиться одной когорте больше, чем другой, поскольку мы не знаем характеристик любой когорты:

Нет постоянных ‘синего для мальчиков, розового для девочек’ стилей, среди когорт-специфических стилей изображений, которые могли бы выдать, какой тип человека принадлежит к какой группе – определения, как видно из существующей литературы, намного более сложны и тонки.
Что, возможно, более беспокоит тех, кто осторожен в отношении практик нацеливания на рекламу, является возможность эксплуатации инсайтов на уровне пользователя при генерировании конкретных изображений в рекламе**.
Новая статья называется Один размер, много подходит: Согласование разнообразных групповых предпочтений в крупномасштабном генерировании рекламных изображений и исходит от 17 исследователей из Национальной лаборатории распознавания образов в Пекине; ‘Школы ИИ в UCAS’; китайской электронной коммерческой компании JINGDONG; Гонконгского университета науки и технологий в Гуанчжоу; и лаборатории распознавания образов в Нанкинском университете науки и технологий.
Метод
Система использует адаптивное кластеризование (метод, который находит естественные группировки, связывая характеристики пользователей с их реакцией на различные продукты) для группирования пользователей, основываясь на том, как их характеристики формируют визуальные предпочтения в данном контексте продукта. Реализация этого подхода авторами называется Продукт-осведомленное адаптивное группирование (PAAG).
Эти группировки не фиксированы заранее, а обнаруживаются из закономерностей в данных.
Условный генератор изображений, озаглавленный Генерация изображений, обусловленная предпочтениями (PCIG), затем использует профиль каждой группы для создания рекламных изображений, соответствующих предпочтениям группы:

OSMF группирует пользователей по тому, как их характеристики формируют предпочтения продукта, затем использует эти групповые профили для генерирования рекламных изображений, соответствующих вкусам каждой группы. PAAG обрабатывает группирование, а PCIG создает изображения, используя подсказки и обратную связь, настроенные на каждую группу.
Генератор изображений использует неуказанную версию Stable Diffusion, вместе с подходящим набором ControlNet (последний, чтобы помочь поддерживать последовательность среди различных когортных поколений).
В рабочем процессе PAAG сначала кодирует отношения между функциями пользователя и как текстовыми, так и изображаемыми аспектами продукта, используя набор посвященных кодировщиков и механизм перекрестного внимания для объединения их в объединенную предпочтительную встраивание, отражающее насколько вероятно, что пользователь кликнет на конкретную рекламу.
PAAG затем моделирует, как различные комбинации атрибутов пользователя взаимодействуют как с названиями продукта, так и с изображениями продукта. Текстовые и изображаемые функции извлекаются с помощью CLIP и ResNet-основанных кодировщиков, и атрибуты пользователя, такие как пол, местоположение, возраст или устройство, передаются через MLP, который позволяет перекрестное внимание над функциями продукта и изображения.
Результатное встраивание представляет собой вероятность клика каждого пользователя для конкретного продукта в определенном визуальном контексте. Как только эти встраивания предпочтений пользователя-продукта получены, PAAG использует K-means кластеризацию для группирования пользователей, которые реагируют аналогично на данный продукт.
PAAG выбирает лучшее количество пользовательских групп для каждого продукта, проверяя, насколько хорошо кластеры разделяются. Вместо использования только одной средней точки для каждой группы он выборочно использует несколько точек на разных расстояниях, чтобы захватить более широкий диапазон предпочтений.
Эти профили групп затем передаются в виде токенов в группо-осведомленную многомодальную большую языковую модель (G-MLLM), которая использует их для генерирования рекламных изображений, адаптированных к каждой группе.
Генерирование изображений на основе предпочтений пользователя
На стороне пользователя G-MLLM учится предсказывать, какие члены группы, вероятно, кликнут следующими, и как описать общие характеристики в естественном языке. На стороне продукта он учится суммировать продукт, показанный на изображении, и генерировать рекламные подписи, которые соответствуют как продукту, так и группе.
Чтобы отразить реальное поведение пользователя, модель расширена до группо-осведомленной модели вознаграждения (GRM). GRM обучается на собственном Групповом предпочтении рекламного изображения (GAIP) исследователей† (см. ниже) для сравнения пар изображений для одного и того же продукта и определения, какое из них работает лучше с данной группой, используя реальные данные о кликах.
Этот сигнал вознаграждения затем используется для тонкой настройки G-MLLM с помощью Group-DPO, метода, который учит его отдавать предпочтение подсказкам, которые приводят к лучшему групповому взаимодействию.
Данные и тесты
Разработка GAIP
Отмечая историческую нехватку наборов данных, связанных с групповыми предпочтениями в рекламе, и что предыдущие коллекции, такие как Personalized Soups и CG4CTR, являются либо слишком маломасштабными, либо слишком плохо определёнными, исследователи разработали свою собственную коллекцию, упомянутую выше GAIP, полученную из ‘промышленных рекламных журналов’ неуказанной электронной коммерческой платформы.
Журналы были собраны за три недели, с каждой записью, регистрирующей изображение продукта и название, профиль зрителя (включая возраст, уровень расходов и чувствительность к промоакциям) и то, был ли кликнута реклама.
Набор данных включает более 40 миллионов пользователей, 2 миллиона продуктов и почти 10 миллионов рекламных изображений, с высокой визуальной разнообразностью среди предметов.
Пользователи были сгруппированы PAAG в различные кластеры для каждого продукта, и рассчитан коэффициент кликов (CTR) для каждого изображения внутри каждой группы:

Из дополнительных материалов новой статьи, небольшой взгляд на некоторые определяющие критерии для GAIT.
GAIP затем формируется как набор кортежей (рекламное изображение, название продукта, встраивание группы, группо-специфический CTR) пары каждого изображения и названия с его CTR и встраиванием группы, которая увидела его.
Чтобы обеспечить надежность, сохраняются только продукты с достаточной экспозицией, в результате чего получается набор данных из 610 172 групповых образцов.
GAIP значительно больше, чем предыдущие наборы данных: в то время как большинство предыдущих тестов включают менее десяти пользовательских групп, GAIP включает почти 600 000 реальных групповых записей предпочтений, предлагая более глубокие знания о групповых предпочтениях.
Тесты
Для обучения конвейера PCIG исследователи извлекли изображаемые и текстовые функции, используя ResNet и текстовый кодировщик CLIP, затем отобразили их в 128-мерные встраивания через обучаемые линейные слои. Чтобы сохранить эффективность, PAAG был ограничен пятью группами пользователей на продукт.
Встраивания групп были построены с помощью стратегии выборочного процентного сэмплирования, выбирая несколько точек из 15-го, 55-го и 95-го процентилей, чтобы захватить как основные, так и периферийные предпочтения.
LLaVA использовалась в качестве основы для G-MLLM, и предварительное обучение проводилось в течение десяти эпох с косинусным графиком обучения расписания при скорости обучения 2e-6, требующей внушительных пяти дней обучения на кластере из восьми GPU NVIDIA H100, каждая с 80 ГБ видеопамяти.
GRM была обучена путем реконструкции GAIP с парными изображениями продукта, затем инициализирована с теми же весами, что и G-MLLM. Во время финального этапа Group-DPO GRM была заморожена, и G-MLLM дообучена с помощью LoRA в течение трех эпох – снова, со скоростью обучения 2e-5, на том же кластере NVIDIA.
Метрики, использованные для первой оценки, были NDCG@5 и AUROC. NDCG@5 измерял, насколько по-разному каждая группа ранжировала один и тот же набор рекламных изображений, с более низкими значениями, указывающими на более четкое разделение предпочтений; и AUROC использовалась для оценки, насколько хорошо каждая модель различала кликнутый и не кликнутый контент.
Все метрики были рассчитаны на результатах кластеризации из 1000 продуктов, в общей сложности около 100 000 образцов, и использовались для сравнения PAAG с тремя предыдущими системами: CACS; WIYD; и JAC:

Результаты моделирования предпочтений, сравненные с предыдущими методами. Более низкие значения NDCG@5 и более высокие значения AUROC указывают на лучшую производительность. Лучшие результаты выделены жирным шрифтом, вторые лучшие – подчеркнуты.
Из этих результатов авторы комментируют:
‘[Наш] метод достигает лучшей производительности по обоим метрикам. Конкретно, PAAG достигает наименьшего значения NDCG@5 (0,3066), превосходя лучшую базовую линию (CACS), что указывает на более различимые межгрупповые закономерности предпочтений для эффективной групповой рекламной генерации.
‘Кроме того, PAAG достигает наивысшего значения AUROC (0,6372), улучшая сильнейшую базовую линию (WIYD) на 0,0159.’
Второй раунд тестов проверил, может ли система лучше соответствовать рекламу правильным группам пользователей:

Сравнение онлайн-CTR, показывающее, что группо-персонализированная генерация (‘Наш’) превосходит все базовые линии, включая CAIG и предварительно обученную G-MLLM.
Здесь PCIG показала более высокие показатели кликов, чем старые модели, такие как CAIG и G-MLLM, с улучшением на 5,5%. GRM также была протестирована офлайн, проверяя, может ли она правильно выбрать лучшую рекламу в паре, основываясь на групповых предпочтениях. Она превзошла все базовые линии, включая общие модели, с приростом на 4,7% по сравнению с CAIG.
Окончательный качественный тест был проведен для оценки того, может ли PCIG отразить групповые предпочтения в стиле своих сгенерированных изображений. Как показано на рисунке ниже, один и тот же продукт был представлен по-разному для каждой группы, с изменениями в палитре, тоне и визуальной композиции:

Полные результаты качественных тестов, предварительно просмотренные ранее в статье.
Эти вариации, по утверждению авторов, соответствовали предполагаемым предпочтениям кликов для каждой группы, показывая, что PCIG может производить стилистически разнообразные выходные данные, сохраняя при этом актуальность и привлекательность. Авторы заявляют:
‘[PCIG] обеспечивает стилистически разнообразные изображения, чтобы удовлетворить предпочтения кликов различных групп пользователей, тем самым демонстрируя свою сильную способность адаптировать генерацию к гетерогенным требованиям пользователей и захватить тонкие, тонкие различия предпочтений среди различных групп пользователей, подчеркивая ее потенциал для группо-осведомленной генерации рекламных изображений в масштабе.’
Заключение
Возможно, наиболее интригующим аспектом этого проекта является неизвестная корреляция между стилями вывода изображений для групп-целевой рекламы для одного и того же продукта (из которых есть несколько страниц примеров в дополнительных материалах статьи, которые мы не можем воспроизвести здесь).
Можно ли предположить, что городские фоны связаны с возрастом, т. е. с выпускниками, начинающими свою карьеру, и что сельские среды ориентированы на более процветающие типы поколения X, которые идентифицируют открытую дорогу как своего рода ‘окончательную свободу’? Можно интерпретировать эти тестовые выходные данные весь день.
Потенциал таких систем зависит от двух факторов: проницательности и задержки. Проницательность зависит от того, могут ли возникающие системы отслеживания все еще извлечь достаточно значимой информации из пользователей, чтобы поддержать эффективную когортную рекламу, а также заложить основу для более точной, индивидуально нацеленной рекламы в будущем.
Задержка представляет собой более значительную проблему, поскольку эти индивидуальные рекламные изображения должны генерироваться и доставляться почти мгновенно; хотя некоторые недавние модели текст-изображение могут производить результаты всего за несколько секунд, даже эта задержка может быть слишком длинной для реальных аукционов рекламы.
Одним из возможных решений является генерирование изображений локально, на GPU браузера, избегая сетевых круговых поездок; или создание ряда изображений заранее, предварительно закэшированных на клиенте.
** Этот аспект опущен в новой статье, как и потенциал новых ИИ-рамок для глубокой фальсификации часто смягчается использованием милых животных фигур (а не ИИ-порнографии) в новых исследованиях. Тем не менее, тип изображений, показанный в работе, представляет собой рекламодателей на их лучшем поведении, а не демонстрирует, насколько личными визуальные рекламные объявления могут стать в конечном итоге, когда методы нацеливания потребителей объединяются с быстротечной генеративной ИИ.
** Я не могу определить эту учреждение с именем, поскольку ‘UCAS’ обычно разрешается до хорошо известного британского университета приложения очистки- дома. Я приветствую разъяснение.
† Которую исследователи обещают выпустить в связанном репозитории GitHub.
Опубликовано в первый раз в четверг, 5 февраля 2026 года












