Погляд Anderson
AI-генеровані рекламні зображення, які націлені на вашу демографічну групу – І, зрештою, на вас?

Рекламодавці намагаються адаптувати рекламу до окремих глядачів, щоб збільшити кількість кліків, і хоча створення індивідуальних творів для кожного людини зараз є недоцільним, нове дослідження свідчить про те, що AI-генероване зображення може бути ефективно націлене на конкретні демографічні групи.
Персоналізована реклама, представлена в науково-фантастичному бойовику Стівена Спілберга 2002 року Мінориті Репорт, залишила довговічне, навіть лякаюче враження на культуру, із яскравим зображенням проактивних рекламних білбордів, які розпізнають людей у натовпі та вигукують промо-повідомлення прямо їм.
Багато споживчих груп можуть розглядати такий рівень розпізнавання глядачів як кошмар, і хоча прогрес у цьому напрямку був сповільнений через наслідки скандалу з Cambridge Analytica скандалу, ідеал прямого, високоточного взаємодії залишається цінною метою в рекламі.
Фактично, системи, які можуть фокусуватися на характеристиках окремого глядача все ще знаходяться у стадії розробки – хоча в таких випадках корпоративні дослідження повинні приймати заходи для дотримання законів щодо особистої ідентифікації інформації (PII); законів, які були посилені в Європі за останні десять років, а ці покращені захисти поширюються в інші регіони через Брюссельський ефект.
Привіт!
Тепер, коли AI-генероване рекламне вміст становиться все більш популярним, рекламодавці повинні все ж таки враховувати потенційні витрати на рекламу, націлену на окремих осіб, де зображення та текст генеруються оперативно та на ходу.
Наприклад, навіть якщо індивідуальне зображення можна було б генерувати дуже швидко, витрати на масштабі були б суттєвими. Крім того, автоматичні онлайн-аукціони рекламних процесів працюють у критичних, мілісекундних рамках часу, що робить контент з індивідуальними зображеннями для користувачів складним на даний момент; а відеоконтент ще більш віддаленою перспективою.
Однак, технічні перешкоди, пов’язані з адресуванням вищого рівня демографічних когортних груп в інтернет-аудиторії (через ноутбуки, телефони, смарт-телевізори тощо) не такі серйозні – і нове міжнародне академічне/промислове співробітництво пропонує спосіб створення окремих рекламних зображень для різних демографічних груп, включаючи такі фактори, як вік та місце розташування:

З нової роботи: приклади персоналізованого генерування рекламних зображень, де одне продукт відображається в різних стилях для різних груп глядачів. Джерело
Нова структура – названа Одного розміру, багато підходів (OSMF) – спрямована на подолання розриву між широкомасштабною рекламою та недоцільною індивідуалізацією, генеруючи різні рекламні зображення для автоматично відкритих аудиторних груп, використовуючи продукт-орієнтоване кластеризація для узгодження візуального контенту з клік-преференціями окремих демографічних груп
Автори заявляють:
‘[Ми] пропонуємо єдину структуру, яка узгоджує різноманітні групові клік-преференції у великомасштабному генерації рекламних зображень.
‘OSMF починається з продукто-орієнтованого адаптивного групування, яке динамічно організовує користувачів на основі їхніх атрибутів та характеристик продукту, представляючи кожну групу з багатими колективними преференційними ознаками.’
Тестований проти порівняльних структур, автори стверджують про досягнення найкращих результатів.
Хоча робота ідентифікує різні когортні групи, статті не конкретизують, які демографічні характеристики представлені кожною G групою, хоча ці групи, ймовірно, відображають традиційні ринкувальні сегменти.
Отже, не легко зрозуміти, на основі прикладів, наведених у статті та додатку, чому певні фони чи освітлення можуть приваблювати одну когорту більше, ніж іншу, оскільки ми не знаємо ознак жодної когорти:

Не існує постійних стилів, таких як ‘синій для хлопчиків, рожевий для дівчаток’ тощо, серед стилів зображень для кожної когорти, які могли б видати, до якої групи належить людина – визначення, як видно з існуючої літератури, значно складніше та тонше.
Що, можливо, більш занепокоєно для тих, хто сумнівається щодо практики націлювання рекламних оголошень, є можливість використання інформації про користувачів для генерації конкретних зображень у рекламі**.
Нова робота стаття називається Одного розміру, багато підходів: узгодження різноманітних групових клік-преференцій у великомасштабному генерації рекламних зображень, і походять від 17 дослідників з Національної лабораторії розпізнавання закономірностей у Пекіні; ‘Школи штучного інтелекту в UCAS’; китайської електронної комерційної компанії JINGDONG; Гонконзького університету науки і технологій у Гуанчжоу; і лабораторії розпізнавання закономірностей у Нанкінському університеті науки і технологій.
Метод
Система використовує адаптивне кластеризація (метод, який знаходить природні групи, пов’язуючи ознаки користувачів з їхньою реакцією на різні продукти) для групування користувачів, на основі того, як їхні ознаки формують візуальні преференції у конкретному продукті.
Ці групи не фіксовані заздалегідь, а відкриті з даних.
Умовний генератор зображень, названий Преференційно-умовний генератор зображень (PCIG), використовує профіль кожної групи для створення рекламних зображень, які відповідають смакам групи:

OSMF групує користувачів за тим, як їхні ознаки формують продуктивні преференції, а потім використовує ці групові профіль для генерації рекламних зображень, які відповідають смакам кожної групи. PAAG займається групуванням, а PCIG створює зображення, використовуючи підказки та зворотний зв’язок, налаштовані для кожної групи.
Генератор зображень використовує невизначену версію Stable Diffusion, разом з відповідним ControlNet набором (останній для підтримання узгодженості серед різних когортних генерацій).
У робочому процесі PAAG спочатку кодує взаємозв’язок між ознаками користувачів та текстовими та зображувальними аспектами продукту, використовуючи набір спеціальних кодувальників та механізм крос-уваги для об’єднання їх у єдиний преференційний ембеддинг, який відображає ймовірність того, що користувач клікне на певне оголошення.
PAAG потім моделює, як різні комбінації ознак користувачів взаємодіють з продуктами та їхніми зображеннями. Текстові та зображувальні ознаки витягуються за допомогою CLIP та ResNet-орієнтованих кодувальників, а ознаки користувачів, такі як стать, місце розташування, вік або пристрій, проходять через MLP, який дозволяє крос-увагу над продуктивними текстовими та зображувальними ознаками.
Результатний ембеддинг представляє ймовірність клікання кожного користувача для певного продукту у конкретному візуальному контексті. Як тільки ці ембеддинги преференцій користувачів-продуктів отримані, PAAG використовує K-means кластеризацію для групування користувачів, які реагують схоже на певний продукт.
PAAG вибирає найкращу кількість користувацьких груп для кожного продукту, перевіряючи, як добре кластери відокремлюються. Замість використання лише однієї середньої точки для кожної групи, він вибірково вибирає кілька точок на різних відстанях, щоб захопити ширший діапазон преференцій.
Ці профіль групи потім передаються як токени до групо-орієнтованої багатозадачної великомасштабної мови моделі (G-MLLM), яка використовує їх для генерації рекламних зображень, адаптованих до кожної групи.
Генерація зображень на основі користувацьких преференцій
На стороні користувача G-MLLM вчиться передбачати, які члени групи ймовірно клікнуть далі та як описати спільні ознаки природною мовою. На стороні продукту він вчиться підсумовувати продукт, показаний на зображенні, та генерувати рекламні підписи, які відповідають як продукту, так і групі.
Для відображення реальної поведінки користувачів модель розширюється до групо-орієнтованої моделі винагороди (GRM). GRM тренується на власному GAIP наборі даних† (див. нижче) для порівняння пар зображень для одного продукту та визначення, яке з них працювало краще з певною групою, використовуючи реальні дані про кліки:
Це сигнал винагороди потім використовується для тонкої настройки G-MLLM з Group-DPO, методом, який вчить її віддавати перевагу підказкам, які ведуть до кращої групової взаємодії.
Дані та тести
Розробка GAIP
Відзначаючи історичну нестачу наборів даних, пов’язаних з груповими рекламними преференціями, і те, що попередні колекції, такі як Персоналізовані супи та CG4CTR, є або занадто малими, або занадто погано визначеними, дослідники створили власну колекцію, вищезгаданий GAIP, отриманий з ‘промислових рекламних журналів’ невизначеної електронної комерційної платформи.
Журнали були зібрані протягом трьох тижнів, причому кожен запис містив зображення продукту та назву, профіль глядача (включаючи вік, рівень витрат та чутливість до промо-акцій) та інформацію про те, чи було оголошення клікнуте.
Набір даних включає понад 40 мільйонів користувачів, 2 мільйони продуктів та майже 10 мільйонів рекламних зображень, з високою візуальною різноманітністю серед товарів.
Користувачів групували за допомогою PAAG у різні кластери для кожного продукту, а рівень кліків (CTR) обчислювався для кожного зображення в кожній групі:

З нового паперу додаткового матеріалу, маленький погляд на деякі визначальні критерії для GAIT.
GAIP утворюється як набір кортежів (рекламне зображення, назва продукту, групова ембеддинг, групо-специфічний CTR) пари кожне зображення та назву з його CTR та ембеддингом групи, яка бачила його.
Для забезпечення надійності зберігаються лише продукти з достатнім охопленням, що призводить до набору даних із 610 172 групових зразків.
GAIP значно більший, ніж попередні набори даних: тоді як більшість попередніх бенчмарків включають менше десяти користувацьких груп, GAIP включає майже 600 000 реальних групових преференційних записів, забезпечуючи глибші знання про групові преференції.
Тести
Для навчання трубопроводу PCIG дослідники витягнули зображувальні та текстові ознаки за допомогою ResNet та текстового кодувальника CLIP, а потім відображили їх на 128-мірні ембеддинги через навчальні лінійні шари. Для підтримання ефективності PAAG обмежувався п’ятьма користувацькими групами на продукт.
Групова ембеддинг була побудована за допомогою стратегії вибіркової вибірки на основі процентилів, вибірково вибираючи кілька точок з 15-го, 55-го та 95-го процентилів, щоб захопити як ядро, так і периферійні преференції.
LLaVA був використаний як основа для G-MLLM, а попереднє тренування проводилось протягом десяти епох з косинусним графіком навчання графіком при темпі навчання 2e-6, що вимагало формідабельних п’яти днів тренування на кластері з восьми NVIDIA H100 GPU, кожна з 80 ГБ відеопам’яті.
GRM був тренований шляхом реконструкції GAIP з парними парами продуктів, а потім ініціалізований з тим же вагами, що й G-MLLM. Під час остаточного етапу Group-DPO GRM був заморожений, а G-MLLM донастроєний за допомогою LoRA протягом трьох епох – знову ж таки, при темпі навчання 2e-5, на тому ж кластері NVIDIA.
Метрики, використані для першої оцінки, були NDCG@5 та AUROC. NDCG@5 вимірював, наскільки кожна група ранжувала одне й те саме набір рекламних зображень, причому нижчі значення вказували на чіткіше розрізнення преференцій; а AUROC використовувався для оцінки, наскільки добре кожна модель розрізняла клікнуті та неклікнуті вмісти.
Всі метрики обчислювались на результатах кластеризації з 1 000 продуктів, що складалося з близько 100 000 зразків, і використовувалися для порівняння PAAG проти трьох попередніх систем: CACS; WIYD; та JAC:

Результати моделювання преференцій у порівнянні з попередніми методами. Нижчі значення NDCG@5 та вищі значення AUROC вказують на кращу продуктивність. Найкращі результати виділені жирним шрифтом, другі за якістю – підкреслені.
З цих результатів автори коментують:
‘[Наш] метод досягає вищої продуктивності за обома метриками. Конкретно, PAAG досягає найнижчого значення NDCG@5 (0,3066), випереджаючи найкращу базову систему (CACS), вказуючи на більш чітке міжгрупне преференційне розрізнення для ефективної групової рекламної генерації.
‘Крім того, PAAG досягає найвищого значення AUROC (0,6372), покращуючи найкращу базову систему (WIYD) на 0,0159.’
Другий раунд тестів перевіряв, чи може система краще підібрати рекламу до відповідних користувацьких груп:

Онлайн-порівняння рівня кліків, яке показує, що групово-персоналізована генерація (‘Наш’) перевершує всі базові системи, включаючи CAIG та попередньо треновану G-MLLM.
Тут PCIG показав вищу кількість кліків, ніж старіші моделі, такі як CAIG та G-MLLM, із покращенням на 5,5%. GRM також був протестований офлайн шляхом перевірки його здатності правильно вибрати краще оголошення в парі, на основі групових преференцій. Він перевершив усі базові системи, включаючи загальні моделі, із виграшем у 4,7% над CAIG.
Останній кваліфікаційний тест був проведений для оцінки здатності PCIG відображати групові преференції у стилі згенерованих зображень. Як показано на наступному зображенні, одне й те саме продукт було відображено по-різному для кожної групи, із змінами у палітрі, тоні та візуальній композиції:

Повні результати кваліфікаційних тестів, попередньо показані в статті.
Ці варіації, на думку авторів, узгоджувалися з припущеними клік-преференціями для кожної групи, показуючи, що PCIG міг виробляти стилістично різні виходи, зберігаючи при цьому актуальність та привабливість. Автори заявляють:
‘[PCIG] забезпечує стилістично різноманітні зображення, щоб задовольнити клік-преференції різних користувацьких груп, тим самим демонструючи свою сильну здатність адаптувати генерацію до гетерогенних вимог користувачів та захоплювати тонкі, тонкі преференційні відмінності серед різноманітних користувацьких груп, підкреслюючи свій потенціал для групової рекламної генерації зображень у великомасштабі.’
Висновок
Можливо, найцікавішим аспектом цього проекту є невідома кореляція між стилями виведення зображень для однієї групи для одного продукту (з яких є кілька сторінок прикладів у додатковому матеріалі статті, ніж ми можемо тут відтворити).
Чи можемо ми припустити, що міські фони пов’язані з віком, тобто з випускниками, які починають свою кар’єру, а сільські середовища орієнтовані на більш заможні типи покоління X, які ідентифікують відкриту дорогу як一种 ‘останньої свободи’? Можна розглядати ці тестові виходи весь день.
Потенціал таких систем залежить від двох факторів: надбання інформації та затримки. Надбання інформації залежить від того, чи можуть нові системи відстежування все ще витягувати достатньо значущої інформації від користувачів для підтримки ефективної когортної рекламної генерації, а також чи можуть вони закладати основу для більш точної, індивідуально націленої реклами в майбутньому.
Затримка становить більшу проблему, оскільки ці індивідуальні рекламні зображення повинні генеруватися та доставлятися майже миттєво; хоча деякі недавні текст-до-зображення моделі можуть виробляти результати за кілька секунд, навіть ця затримка може бути занадто довгою для реальних аукціонів рекламних оголошень.
Одним із можливих рішень є генерація зображень локально, на GPU браузера, уникання мережевих кругообігу; або створення набору зображень попередньо, попередньо закешованих на клієнтській стороні.
** Цей аспект опущений у новій роботі, так само, як і потенціал нових AI-рамок для глибоких підробок часто пом’якшується за допомогою милих тваринних фігур (замість AI-порнографії) у нових дослідженнях. Тим не менш, тип зображень, показаний у роботі, представляє рекламодавців на їхньому найкращому поведінці, а не показує, наскільки особисті візуальні оголошення можуть стати в майбутньому, коли методи споживчої націлювання поєднуються з швидкою генерацією AI.
** Я не можу ідентифікувати цю названу установу, оскільки ‘UCAS’ зазвичай розшифровується як добре відомий британський університетський центр прийому. Я вітаю роз’яснення.
† Який дослідники обіцяють випустити на пов’язаному репозиторії GitHub.
Перша публікація четверга, 5 лютого 2026 року












