Взгляд Anderson

Новая Исследование Предлагает Правдиво ‘Персонализированную’ Рекламу

mm
Добавьте Unite.AI в избранные источники в Google
A woman looks at a laptop displaying a news website, reacting with surprise as a banner advertisement on the page shows a smiling woman who closely resembles her.

В переопределении ‘самопродвижения’, новый метод использует собственные клики пользователя для создания индивидуальных веб-реклам на основе его собственной истории.

 

Хотя рекламные агентства стремятся опровергнуть идею о том, что существуют рекламные каналы, которые могут показывать рекламу на основе того, о чем вы только что говорили в комфорте своего дома, степень ‘персонализации’, продемонстрированная рекламой на веб-сайтах и в социальных сетях, тем не менее получила заголовки в последние годы.

Идеальный сценарий для рекламодателя всегда был таким, чтобы показанная реклама была ‘точным совпадением’ для зрителя. В пределах общественного сопротивления онлайн-отслеживанию и любых предотвратительных мер, которые пользователь мог установить против такого мониторинга, генеративный ИИ (отложив страхи вокруг LLM-рекламы в мире после поиска) вполне способен производить рекламные изображения и текст в режиме реального времени.

Однако основной упор исследований и большинство реализаций на данный момент были основаны на агрегированных статистиках использования, так что любая сгенерированная реклама для зрителя была бы основана на предполагаемой когортной группе зрителя, а не на его собственной уникальной истории.

Теперь новое исследовательское сотрудничество между Китаем и США представляет систему для генерации рекламных изображений и текста для отдельных пользователей, изучая их собственные прошлые клики при входе на сайт, выходя за рамки когортных предположений, которые управляли большинством персонализированных исследований рекламы на данный момент:

Примеры индивидуальных реклам, демонстрирующие индивидуальные рекламные объявления. Конечно, без истории пользователя в качестве контекста, полное влияние можно только представить. Источник - https://arxiv.org/pdf/2605.12138

Примеры индивидуальных реклам, демонстрирующие индивидуальные рекламные объявления. Конечно, без истории пользователя в качестве контекста, полное влияние можно только представить. Источник

Необычно, новый подход отказывается от диффузионных моделей в пользу авторегрессивной архитектуры – основное различие заключается в том, что диффузионные модели постепенно уточняют изображение из визуального шума, тогда как авторегрессивные модели генерируют контент по одному кусочку, предсказывая каждый новый элемент на основе всего, что было до этого.

Для поддержки новой генеративной модели авторы разработали то, что они утверждают, является первым крупномасштабным набором изображений и текста для персонализированной рекламы, а также новую метрику, предназначенную для оценки этой конкретной задачи. В тестах они обнаружили, что их подход превосходит как общие базовые линии, так и существующие методы и рамки, которые в настоящее время решают эту проблему.

Закрытый Сад

Стоит отметить, что предложенный объем работы не предлагает рекламодателям способ обойти новые меры против отслеживания третьих лиц, а вместо этого дает достаточно большому ритейлеру власть над популяцией входящего клиента с рекламой, которая напрямую относится к этому конкретному человеку.

Это не обязательно ограничивается клиентами, которые в настоящее время просматривают сайт ритейлера: в зависимости от степени, в которой пользователь предоставил ритейлеру возможность отслеживать его на других сайтах, он может быть представлен с целевой рекламой на любом количестве других веб-сайтов, которые участвуют в аукционах рекламы, которые использует сам ритейлер.

Такой вид рекламного охвата обычно ограничивается крупномасштабными, высокообъемными магазинами, такими как Amazon, на Западе (и мы отмечаем, что аналогично крупный китайский ритейлер принимал участие в новой работе – см. ниже), хотя любой аналогично крупный магазин (например, популярная социальная платформа) мог бы в теории сгенерировать аналогичную генеративную структуру.

Новая статья озаглавлена Дизайн Вашей Рекламы: Персонализированная Генерация Изображений и Текста Рекламы с Объединенными Авторегрессивными Моделями и исходит от 18 авторов из Университета Сунь Ят-сена в Гуанчжоу, Северо-Восточного Университета и китайского крупнейшего ритейлера JD.com (который имеет тот самый доступ к истории и привычкам покупателей). Код был размещен на GitHub, а соответствующие чекпоинты также были размещены.

Данные и Метод

Набор данных, созданный для проекта, озаглавлен Персонализированная Реклама изображений и текста (PAd1M), и работает на основе данных, предоставленных участником проекта JD.com. Авторы заявляют:

‘Каждый продукт обычно предоставляет более десяти кандидатных изображений и текстов, обеспечивая, что разнообразные предпочтения могут быть полностью обнаружены. Для обеспечения надежной модели предпочтений мы собираем полные истории кликов пользователей как по изображениям, так и по текстам, фильтруя пользователей с недостаточной активностью, чтобы уменьшить шум.

‘Это дает нам набор данных из 1 145 371 пользователей, с 18 923 555 кликнутых изображений и текстов продукта, в среднем более шестнадцати многомодальных исторических поведений на пользователя.’

Для каждого пользователя был выбран один из ранее кликнутых пар ‘изображение-текст’ в качестве целевого примера, после чего сам продукт был выделен из изображения с помощью Grounded SAM.

Описания и ключевые продажные моменты, предоставленные продавцом, были затем прикреплены к записи, создавая набор данных, в котором каждое целевое рекламное объявление сопровождается прозрачным изображением продукта; структурированной информацией о продукте; и историей предыдущих взаимодействий с изображениями и текстами, предназначенной для захвата предыдущих интересов и предпочтений пользователя:

Профиль пользователя из набора данных PAd1M, показывающий целевое рекламное объявление рядом с информацией о продукте, использованной для его генерации, и историческими взаимодействиями с изображениями и текстами, использованными для моделирования предпочтений этого пользователя.

Профиль пользователя из набора данных PAd1M, показывающий целевое рекламное объявление рядом с информацией о продукте, использованной для его генерации, и историческими взаимодействиями с изображениями и текстами, использованными для моделирования предпочтений этого пользователя.

Результатом является набор данных, имеющий масштаб более миллиона пользователей и почти 19 миллионов кликнутых записей изображений и текстов, при этом авторы заявляют, что коллекция существенно больше, чем предыдущие наборы данных персонализации.

Кроме того, данные, необычно для этого направления исследований, объединяют как изображения, так и текст, позволяя моделировать предпочтения пользователей на нескольких модальностях, а не в пределах одной области.

PAd1M также включает в себя отслеживание индивидуальных предпочтений; в отличие от предыдущих наборов данных рекламы, которые были построены вокруг показателей кликабельности, агрегированных по крупным группам, PAd1M связывает взаимодействия с конкретными пользователями из данных JD.com.

Для метрик, помимо стандартных выборов BLEU и ROUGE, исследователи разработали свою собственную метрику под названием Сходство Фона Продукта (PBS). Основанная на предыдущей инициативе MoCo-v3, PBS была обучена на 681 123 парах изображений, показывающих один и тот же продукт на разных фонах, позволяя метрике сосредоточиться на контекстуальных вариациях, а не на самом продукте:

Сходство Фона Продукта (PBS) присваивает явно разные баллы сходства рекламным объявлениям, содержащим один и тот же продукт, но размещающим его в разных визуальных контекстах, в отличие от конкурирующих метрик, которые производят гораздо меньшие различия.

Сходство Фона Продукта (PBS) присваивает явно разные баллы сходства рекламным объявлениям, содержащим один и тот же продукт, но размещающим его в разных визуальных контекстах. Напротив, конкурирующие метрики производят гораздо меньшие различия.

В процессе обучения каждое изображение было сопоставлено с самим собой в качестве положительного примера, в то время как изображение одного и того же продукта, размещенного в разном окружении, служило отрицательным примером, стратегия обучения, предназначенная для повышения чувствительности к контексту фона. Результаты оценки, по мнению статьи, указывают на более крупные различия в сходстве между совпадающими и несовпадающими фонами, чем те, которые производятся CLIP, DINO v3 или вышеупомянутым MoCov3.

Как показано в верхней левой части изображения ниже*, исследователи’ Объединенная Генеративная Рекламная (Uni-AdGen) модель использует авторегрессивную архитектуру видения-языка для генерации как рекламного текста, так и изображений. Процесс руководствуется структурированной инструкцией, включающей определение задачи, и описание продукта, вместе с ключевыми продажными моментами:

Обзор метода.

Обзор метода.

Специальные разделительные токены определяют часть последовательности, зарезервированную для рекламного текста. После генерации текста специальный токен изображения запускает генерацию изображения, в то время как завершающий токен изображения отмечает его завершение, при этом сгенерированные токены затем отправляются в отдельные декодеры текста и изображений.

Для изображений используется декодер VQ-GAN из LlamaGen, чтобы преобразовать дискретные токены изображений обратно в пиксели.

Таким образом, объединенная архитектура генерирует текст и изображения в рамках одного предсказания следующего токена -фреймворка, а не полагается на отдельные конвейеры – метод, принятый для предыдущих систем рекламы с аналогичным объемом.

В процессе обучения модель изучает обе модальности вместе, с токенами текста, предсказываемыми на основе входной последовательности и ранее сгенерированного текста. Токены изображения затем предсказываются с помощью входной последовательности, сгенерированного текста и ранее сгенерированных токенов изображения.

Чтобы сохранить сгенерированные рекламные объявления, связанные с продвигаемым продуктом, Uni-AdGen использует модуль восприятия переднего плана, основанный на DINO v2, чтобы внедрить информацию из прозрачных изображений продукта в авторегрессивную модель.

Инструкция-тюнинг (обучение модели следовать инструкциям генерации продукта, полученным из описаний и ключевых продажных моментов) также использовался для улучшения соблюдения описаний и ключевых продажных моментов, предоставленных продавцом, при этом GPT-4o использовался для фильтрации неподходящих примеров обучения.

Персонализация полагалась на коARSE-до-тонкую модуль понимания предпочтений. Исторические взаимодействия сначала фильтровались через конвейер Выборка Похожести Продукта (PSS), чтобы отдавать предпочтение продуктам, похожим на целевой предмет. Остальные записи затем обрабатывались на Мультимодальном Извлечении Предпочтений стадии, предназначенной для выявления визуальных и текстовых элементов, наиболее вероятно отражающих интересы пользователя – при этом эти предпочтения вставлялись в подсказку, чтобы руководить генерацией.

Тесты

Авторы заявляют, что их подход к тестированию получен из DeepSeek’s Janus-Pro 7B.

Модель была обучена при размере партии четыре, под оптимизатором AdamW при скорости обучения 5e-5. Базовая модель была дообучена через LoRA, при этом модуль восприятия переднего плана и мультимодальное извлечение предпочтений были полностью дообучены (т.е. в отличие от LoRA, веса базовой модели были постоянно изменены).

Все тесты проводились на NVIDIA B200 GPU с 192ГБ видеопамяти. Для генерации изображений использовались PickScore, ImageReward и ASE, чтобы измерить визуальное качество, в то время как m-BLEU и m-ROUGE использовались для оценки рекламного текста. Человеческие оценщики также оценивали реализм изображения и качество компоновки, а также текстовую точность и плавность, при этом все метрики вычислялись на 500 продуктах.

Для генерации изображений базовые линии состояли из Qwen2.5-VL и GPT-4o для создания фоновых подсказок из изображений продукта, за которыми следовали ReliableAd, PosterMaker и Flux-Fill для генерации окончательных рекламных объявлений. Сравнения генерации текста проводились против Qwen2.5, Qwen3 и DeepSeek-R1.

Первоначальные количественные результаты базовой линии для генерации рекламы показаны ниже:

Производительность на общем бенчмарке генерации рекламы. Uni-AdGen совпал или превзошел сильнейшие базовые линии генерации изображений по качеству эстетики и PickScore, в то время как объединенная модель изображения и текста достигла высшего балла m-ROUGE среди всех подходов генерации текста. Результаты оценки человека остались конкурентоспособными в обеих модальностях.

Производительность на общем бенчмарке генерации рекламы. Uni-AdGen совпал или превзошел сильнейшие базовые линии генерации изображений по качеству эстетики и PickScore, в то время как объединенная модель изображения и текста достигла высшего балла m-ROUGE среди всех подходов генерации текста. Результаты оценки человека остались конкурентоспособными в обеих модальностях.

Из этих результатов авторы заявляют:

‘Наш метод достигает лучшей производительности в ImageReward и занимает второе место в PickScore и оценке человека, демонстрируя свою превосходную производительность в эстетике и доступности. Хотя ReliableAd лидирует в оценке человека, он отстает значительно в эстетических метриках. Напротив, PosterMaker и Flux-Fill генерируют визуально привлекательные изображения, но страдают от заметных ограничений использования.

‘Благодаря эффективным подходам к контролю, наш метод успешно достигает оптимального баланса между визуальным контентом и практической полезностью.’

Персонализированная генерация рекламы оценивалась на 500 пользователях с записанными историями взаимодействий, используя вышеупомянутый PBS для измерения сходства изображений, и BLEU и ROUGE для сравнения сгенерированного текста с продуктами, которые пользователи фактически кликнули.

Поскольку общие базовые линии рекламы, использованные в предыдущем эксперименте, не могли включать истории пользователей, сравнения были смещены в сторону систем, предназначенных для персонализации. Для генерации изображений в качестве базовых линий были выбраны Flux-Kontext и Pigeon. Flux-Kontext был снабжен сеткой исторических изображений пользователя рядом с целевым изображением продукта, позволяя предыдущим предпочтениям влиять на генерацию.

Поскольку Pigeon не поддерживает управляемое размещение продукта, модуль восприятия переднего плана, разработанный для Uni-AdGen, был интегрирован для сохранения последовательности продукта. Для генерации текста использовались Qwen3 и DeepSeek-R1, при этом исторические описания продукта вставлялись直接 в шаблоны инструкций, чтобы обеспечить контекст пользователя:

Результаты персонализированной генерации рекламы. Uni-AdGen превзошел Flux-Kontext, Pigeon, Qwen3 и DeepSeek-R1 по всем сообщенным метрикам персонализации, в то время как исследование удаления указало, что исторические данные пользователей, выборка похожести продукта и мультимодальное извлечение предпочтений каждый внес значительный вклад.

Результаты персонализированной генерации рекламы. Uni-AdGen превзошел Flux-Kontext, Pigeon, Qwen3 и DeepSeek-R1 по всем сообщенным метрикам персонализации, в то время как исследование удаления указало, что исторические данные пользователей, выборка похожести продукта и мультимодальное извлечение предпочтений каждый внес значительный вклад.

Здесь авторы комментируют:

‘Визуализированные результаты [включенные в изображение ниже] показывают, что Flux-Kontext не понимает предпочтения пользователей и остается восприимчивым к шумовым данным, что приводит к значительному отклонению от реальных данных, например, к нерелевантным предметам в изображении мотоцикла.’

Примеры персонализированной генерации рекламы. По сравнению с Flux-Kontext, Pigeon, Qwen3 и DeepSeek-R1, Uni-AdGen произвел изображения, которые более точно соответствуют визуальному стилю и контексту рекламных объявлений, которые пользователи фактически кликнули, в то время как генерировал текст, который захватил большую часть атрибутов продукта и ключевых продажных моментов, присутствующих в реальных примерах. Сопоставленные термины выделены зеленым цветом.

Примеры персонализированной генерации рекламы. По сравнению с Flux-Kontext, Pigeon, Qwen3 и DeepSeek-R1, Uni-AdGen произвел изображения, которые более точно соответствуют визуальному стилю и контексту рекламных объявлений, которые пользователи фактически кликнули, в то время как генерировал текст, который захватил большую часть атрибутов продукта и ключевых продажных моментов, присутствующих в реальных примерах. Сопоставленные термины выделены зеленым цветом.

Качественные примеры, по мнению авторов, указывают на то, что Flux-Kontext и Pigeon часто производили выходные данные, отклоняющиеся от визуальных характеристик рекламных объявлений, которые пользователи ранее кликнули; в то время как текст, сгенерированный Qwen3 и DeepSeek-R1, опускал некоторые ключевые продажные моменты, присутствующие в реальных примерах.

Заключение

Полезность этого проекта зависит полностью от согласия пользователя, и расширение охвата этой ‘предсказательной’ системы за пределы области, контролируемой историей пользователя – в данном случае JD.com – требует еще более расслабленного набора явных разрешений пользователя, в большинстве территорий.

Однако система основана на гипермасштабном сетевом эффекте, действующем в таком сценарии, и на (возможно, слегка оптимистичной) идее о том, что пользователи найдут эту действительно персонализированную и даже предвидящую систему рекомендаций полезной, а не навязчивой, по крайней мере, в контексте закрытого сада ритейлера.

 

* Это изображение основано на тревожной новой тенденции ‘собранных фигур’ в исследовательских статьях, когда иллюстрации, которые ранее были 3-4 отдельными фигурами, теперь объединяются в одну (для соблюдения руководств по подаче статьи на максимальную длину основной статьи) и используются только в качестве справочного материала, часто без адекватного объяснения в сопровождающей подписи.

‘m’-префикс указывает на сравнение с несколькими кандидатными текстами.

Опубликовано впервые во вторник, 2 июня 2026 года. Исправлено 18:21 EET, чтобы исправить окончательное ‘стену’ на ‘закрытый сад’ в последнем абзаце.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai