Погляд Anderson

Нові дослідження пропонують真正у “персоналізацію” реклами

mm
Додайте Unite.AI до бажаних джерел у Google
A woman looks at a laptop displaying a news website, reacting with surprise as a banner advertisement on the page shows a smiling woman who closely resembles her.

У переозначенні “самопromoції” новий метод видобуває власні кліки користувача для створення індивідуальних веб-реклам на основі їхньої власної історії.

 

Хоча рекламні агентства намагаються спростувати ідею про те, що рекламні канали можуть служити рекламою на основі того, про що ви тільки що говорили в зручному домі, ступінь “персоналізації”, продемонстрований рекламою на веб-сайтах і в соціальних мережах, все ж таки зібрав заголовки за останні роки.

Ідеальний сценарій для рекламодавця завжди був таким, щоб реклама, яку вони подавали, була “точною підходящою” для глядача. У межах публічної реакції на онлайн-відстеження та будь-яких захисних заходів, які користувач міг встановити проти такого моніторингу, генерація AI (відкладаючи страхи навколо LLM реклами у пост-пошуковому світі) цілком здатна виробляти рекламні зображення та текст швидко для реального розгортання.

Однак, основний напрямок досліджень і більша частина реалізації на сьогодні була заснована на агрегованих статистиках використання, так що будь-яка реклама, згенерована для глядача, була б заснована на передбачуваній когорті групи глядача, а не на його власній унікальній історії.

Тепер, нове дослідження спільної роботи між Китаєм і США пропонує систему генерації рекламних зображень і тексту для індивідуальних користувачів шляхом навчання їхньої власної історії кліків при вході на сайт, рухаючись далі за когортні припущення, які керували більшістю персоналізованої рекламної науки до цього:

Приклади генерації індивідуальних реклам.

Приклади генерації індивідуальних реклам. Очевидно, без історії користувача як контексту, повний вплив можна тільки уявити. Джерело – https://arxiv.org/pdf/2605.12138

Незвично, новий підхід відкидає дифузійні моделі на користь авторегресивної архітектури – основна різниця полягає в тому, що дифузійні моделі поступово уточнюють зображення з візуального шуму, тоді як авторегресивні моделі генерують контент по одному разу, передбачаючи кожен новий елемент з усього, що передувало.

Для підтримки нової генерації моделі автори розробили, що вони називають першою великомасштабною базою даних зображень і тексту для персоналізованої реклами, а також нову метрику, призначену для оцінки цієї конкретної задачі. У тестах вони виявили, що їхній підхід перевершив як загальні базові лінії, так і існуючі методи та рамки, які наразі звертаються до цієї проблеми.

Закритий сад

Варто відзначити запропонований масштаб роботи, який не пропонує рекламодавцям спосіб обійти нові заходи проти відстеження третьої сторони, а радше дає досить великому рітейлеру можливість поповнити залогіненого клієнта рекламою, яка безпосередньо стосується цієї конкретної особи.

Це не обов’язково обмежується клієнтами, які зараз перебувають на сайті рітейлера: залежно від ступеня, в якому користувач надав рітейлеру можливість відстежувати їх на інших сайтах, вони могли бути представлені націленою рекламою на будь-якій кількості інших веб-сайтів, які беруть участь у рекламних аукціонах, які сам рітейлер використовує.

Цей тип рекламної дії зазвичай обмежується великомасштабними, високими рітейлерами, такими як Amazon, на Заході (і ми відзначаємо, що аналогічний китайський рітейлер взяв участь у новій роботі – див. нижче), хоча будь-яка подібна проблема (наприклад, популярна соціальна платформа) могла б теоретично створити подібну генераційну структуру.

Нова стаття називається Дизайн вашої реклами: персоналізована генерація рекламних зображень і тексту з уніфікованими авторегресивними моделями і походить від 18 авторів з Університету Сунь Ят-сена в Гуанчжоу, Північно-Східного університету та найбільшого китайського рітейлера JD.com (останній з яких має той самий доступ до історії та звичок покупців). Код був зроблений доступним через GitHub, а відповідні чекпойнти також були зроблені доступними.

Дані та метод

База даних, створена для проекту, називається Персоналізована реклама зображення-текст (PAd1M) і працює на даних, наданих учасником проекту JD.com. Автори заявляють:

‘Кожен продукт зазвичай надає понад десять кандидатських зображень і текстів, забезпечуючи можливість повністю виявити різноманітні вподобання. Для надійного моделювання вподобань ми збираємо повну історію кліків користувача як над зображеннями, так і над текстами, фільтруючи користувачів з недостатньою активністю, щоб зменшити шум.

‘Це дає нам базу даних з 1 145 371 користувачем, з 18 923 555 кліковими продуктами зображень і текстів, у середньому понад шістнадцять багатомодальних історичних поведінок на користувача.’

Для кожного користувача був вибраний один раніше клікований зображення-текстовий пар, після чого сам продукт був виділений з зображення за допомогою Grounded SAM.

Описи та ключові продажні моменти постачальника були потім прикріплені до запису, створюючи базу даних, в якій кожна цільова реклама супроводжується прозорим зображенням продукту; структурованою інформацією про продукт; та історією попередніх взаємодій з зображеннями та текстами, призначеною для захоплення попередніх інтересів та вподобань користувача:

Профіль користувача з бази даних PAd1M, який показує цільову рекламу поряд з інформацією про продукт, використаною для її генерації, та історією взаємодій з зображеннями та текстами, використаною для моделювання вподобань користувача.

Профіль користувача з бази даних PAd1M, який показує цільову рекламу поряд з інформацією про продукт, використаною для її генерації, та історією взаємодій з зображеннями та текстами, використаною для моделювання вподобань користувача.

Результатна база даних пропонує масштаб понад мільйон користувачів і майже 19 мільйонів клікових записів зображень і текстів, при цьому автори заявляють, що збірка є суттєво більшою, ніж попередні персоналізовані бази даних.

Крім того, дані, незвично для цього напрямку досліджень, поєднують як зображення, так і текст, дозволяючи моделювати вподобання користувача через кілька модальностей, а не в межах однієї області.

PAd1M також пропонує індивідуальне відстежування вподобань; на відміну від попередніх рекламних баз даних, які були побудовані навколо показників клікування, агрегованих по великим групам, PAd1M пов’язує взаємодії з конкретними користувачами з даних JD.com.

Для метрик, окрім стандартних варіантів BLEU і ROUGE, дослідники розробили свою власну спеціальну міру під назвою Симетрія фону продукту (PBS). На основі попередньої ініціативи MoCo-v3 PBS була навчена на 681 123 парах зображень, що показують той самий продукт на різних фонах, дозволяючи метриці зосередитися на контекстній варіації, а не на самому продукті:

Симетрія фону продукту (PBS) призначає явно різні коефіцієнти схожості рекламам, які містять той самий продукт, але розміщують його в різних візуальних контекстах. Насправді, конкуруючі метрики дають значно менші розриви.

Симетрія фону продукту (PBS) призначає явно різні коефіцієнти схожості рекламам, які містять той самий продукт, але розміщують його в різних візуальних контекстах. Насправді, конкуруючі метрики дають значно менші розриви.

Під час навчання кожне зображення було спаровано з ним самим як позитивним прикладом, тоді як зображення того самого продукту в іншому середовищі служило негативним прикладом, навчальна стратегія, призначена для підвищення чутливості до контексту фону. Результати оцінки, на думку статті, вказують на більші відмінності у схожості між відповідними та не відповідними фонами, ніж ті, які були вироблені CLIP, DINO v3 або вищезгаданою MoCov3.

Як показано в верхньому лівому розділі зображення нижче*, дослідницька Уніфікована генераційна рекламна (Uni-AdGen) модель використовує авторегресивну візуально-мовну архітектуру для генерації як рекламного тексту, так і зображень. Процес керується структурованою інструкцією, яка включає визначення завдання, а також опис продукту та ключові продажні моменти:

Перегляд методу.

Перегляд методу.

Спеціальні роздільні токени визначають частину послідовності, зарезервованої для рекламного тексту. Після генерації тексту спеціальний токен зображення спрацьовує генерацію зображення, тоді як закриваючий токен зображення позначає її завершення, при цьому згенеровані токени надсилаються до окремих декодерів тексту та зображення.

Для зображень використовується декодер VQ-GAN з LlamaGen, щоб перетворити дискретні токени зображення назад у пікселі.

Цим чином, уніфікована архітектура генерує текст і зображення в рамках однієї передбачення наступного токену рамки, а не покладається на окремі канали – метод, прийнятий для попередніх рекламних систем з подібним масштабом.

Під час навчання модель вчиться обидві модальності разом, з токенами тексту, передбачуваними на основі вхідної послідовності та раніше згенерованим текстом. Токени зображення потім передбачаються за допомогою вхідної послідовності, згенерованого тексту та раніше згенерованих токенів зображення.

Щоб保持ати згенеровані рекламні оголошення пов’язаними з рекламованим продуктом, Uni-AdGen використовує модуль сприйняття переднього плану на основі DINO v2, щоб ввести інформацію з прозорих зображень продукту в авторегресивну модель.

Інструкційна настройка (навчання моделі слідувати інструкціям генерації продукту, отриманим з описів і ключових продажних моментів) також була використана для покращення дотримання описів і ключових продажних моментів постачальника, з GPT-4o, використаним для фільтрації непридатних навчальних прикладів.

Персоналізація залежала від грубої до тонкої модульної обробки вподобань. Історичні взаємодії були спочатку відфільтровані через pipeline вибірки подібності продукту (PSS), щоб надати перевагу продуктам, подібним до цільового предмета. Залишні записи були потім оброблені багатомодальною стадією видобування вподобань, призначеною для ідентифікації візуальних та текстових елементів, які найбільш імовірно відображатимуть інтереси користувача – ці вподобання були вставлені в запиту, щоб керувати генерацією.

Тести

Автори заявляють, що їхній підхід до тестування походить від DeepSeek’s Janus-Pro 7B.

Модель була навчена з величиною партії чотири, під оптимізатором AdamW з темпом навчання 5e-5. Базова модель була донастроєна за допомогою LoRA, з повністю донастроєним (тобто, на відміну від LoRA, базові ваги моделі були постійно змінені).

Усі тести були проведені на GPU NVIDIA B200 з 192 ГБ відеопам’яті. Для генерації зображень були використані PickScore, ImageReward і ASE, щоб виміряти візуальну якість, тоді як m-BLEU і m-ROUGE були використані для оцінки рекламного тексту. Людські оцінювачі додатково оцінили реалізм зображення та якість макету, а також текстову точність і плавність, при цьому всі метрики були обчислені по 500 продуктам.

Для генерації зображень базові лінії складалися з Qwen2.5-VL і GPT-4o для створення фонових промптів з продуктових зображень, за якими слідували ReliableAd, PosterMaker і Flux-Fill для генерації остаточної реклами. Порівняння генерації тексту проводилися проти Qwen2.5, Qwen3 і DeepSeek-R1.

Початкові базові кількісні результати генерації реклами показані нижче:

Виступ на загальному бенчмарку генерації реклами. Uni-AdGen дорівнює або перевершує найсильніші базові лінії генерації зображень за якістю естетики та PickScore, тоді як уніфікована модель зображення-текст досягла найвищого балу m-ROUGE серед усіх підходів генерації тексту. Результати людської оцінки залишилися конкурентоспроможними в обидвох модальностях.

Виступ на загальному бенчмарку генерації реклами. Uni-AdGen дорівнює або перевершує найсильніші базові лінії генерації зображень за якістю естетики та PickScore, тоді як уніфікована модель зображення-текст досягла найвищого балу m-ROUGE серед усіх підходів генерації тексту. Результати людської оцінки залишилися конкурентоспроможними в обидвох модальностях.

З цих результатів автори заявляють:

‘Наш метод досягає найкращої продуктивності в ImageReward і займає друге місце в обидвох PickScore і людській оцінці, демонструючи свою вищі продуктивність в естетичних і високих показниках доступності. Хоча ReliableAd лідирує в людській оцінці, він значно відстає в естетичних метриках. Навпаки, PosterMaker і Flux-Fill генерують візуально привабливі зображення, але страждають від помітних обмежень з точки зору придатності.

‘Дякую ефективним підходам до контролю, наш метод успішно досягає оптимального балансу між візуальним вмістом і практичною корисністю.’

Персоналізована генерація реклами була оцінена на 500 користувачах з записаною історією взаємодій, використовуючи вищезгадану PBS для вимірювання подібності зображень, а BLEU і ROUGE для порівняння згенерованого тексту з продуктами, які користувачі фактично клікали.

Оскільки загальні базові лінії реклами, використані в попередньому експерименті, не могли включати історію користувача, порівняння було перенесено на системи, призначені для персоналізації. Для генерації зображень були вибрані Flux-Kontext і Pigeon як базові лінії. Flux-Kontext був забезпечений сіткою історичних зображень користувача поряд з цільовим продуктом зображенням, дозволяючи попереднім вподобанням впливати на генерацію.

Оскільки Pigeon не підтримує контрольоване розміщення продукту за замовчуванням, модуль сприйняття переднього плану, розроблений для Uni-AdGen, був інтегрований для збереження консистентності продукту. Для генерації тексту були використані Qwen3 і DeepSeek-R1, з історичними описами продукту, вставленими безпосередньо в їхні шаблони інструкцій, щоб надати контекст, специфічний для користувача:

Результати персоналізованої генерації реклами. Uni-AdGen перевершив Flux-Kontext, Pigeon, Qwen3 і DeepSeek-R1 по всіх зареєстрованих метриках персоналізації, тоді як дослідження видалення вказувало, що історичні дані користувача, вибірка подібності продукту (PSS) і багатомодальне видобування вподобань кожне внесли помітні прибутки.

Результати персоналізованої генерації реклами. Uni-AdGen перевершив Flux-Kontext, Pigeon, Qwen3 і DeepSeek-R1 по всіх зареєстрованих метриках персоналізації, тоді як дослідження видалення вказувало, що історичні дані користувача, вибірка подібності продукту (PSS) і багатомодальне видобування вподобань кожне внесли помітні прибутки.

Тут автори коментують:

‘Візуалізовані результати [включені в зображення нижче] показують, що Flux-Kontext не може зрозуміти вподобання користувача і залишається чутливим до шумів рівня зразка, що призводить до суттєвого відхилення від фактичних даних, наприклад, ірелевантних предметів у зображенні мотоцикла.’

Приклади персоналізованої генерації реклами. У порівнянні з Flux-Kontext, Pigeon, Qwen3 і DeepSeek-R1, Uni-AdGen виробив зображення, які більш тісно збігалися з візуальним стилем і контекстом реклам, які користувачі фактично клікали, тоді як генерував текст, який захоплював більшу частку атрибутів продукту та ключових продажних моментів, присутніх у прикладах з фактичними даними. Сумісні терміни виділені зеленим кольором.

Приклади персоналізованої генерації реклами. У порівнянні з Flux-Kontext, Pigeon, Qwen3 і DeepSeek-R1, Uni-AdGen виробив зображення, які більш тісно збігалися з візуальним стилем і контекстом реклам, які користувачі фактично клікали, тоді як генерував текст, який захоплював більшу частку атрибутів продукту та ключових продажних моментів, присутніх у прикладах з фактичними даними. Сумісні терміни виділені зеленим кольором.

Кваліфіковані приклади, на думку авторів, вказують на те, що Flux-Kontext і Pigeon часто виробляли виходи, що відхиляються від візуальних характеристик реклам, які користувачі раніше клікали; тим часом, текст, згенерований Qwen3 і DeepSeek-R1, опустив деякі ключові продажні моменти, присутні у прикладах з фактичними даними.

Висновок

Корисність цього проекту залежить цілком від згоди користувача, а розширення сфери дії цієї “передбачувальної” системи за межі сфери контролю над історією користувача – в цьому випадку JD.com – вимагає ще більш розслабленого набору явних дозволів користувача, у більшості територій.

Однак, система заснована на гіпермасштабному мережевому ефекті, який діє в такому сценарії, і на (можливо, трохи оптимістичній) ідеї про те, що користувачі знайдуть цю真正у персоналізовану та навіть передбачувану систему рекомендацій корисною, а не нав’язливою, хоча б у контексті закритого саду рітейлера.

 

* Це зображення будується на турбувній новій тенденції “зібраних фігур” у дослідницьких статтях, коли ілюстрації, які раніше були б 3-4 окремими фігурами, зібрані в одну (для виконання вказівок щодо максимальної довжини основної статті) і використовуються лише як допоміжний матеріал, часто без достатнього пояснення в супровідному підписі.

‘m’-префікс вказує на порівняння з кількома кандидатськими текстами.

Перша публікація відбулася у вівторок, 2 червня 2026 року. Виправлено о 18:21 EET, щоб виправити останнє слово “стіну” на “закритий сад” в останньому абзаці.

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai