Andersonův úhel
Umělecky vytvořené reklamní obrázky generované pomocí AI, které cílí na vaši demografickou skupinu – a nakonec i na vás?

Reklamní agentury se snaží přizpůsobit reklamy jednotlivým divákům, aby zvýšily počet kliknutí, a zatímco vytváření reklamních materiálů pro každého člověka je v současné době nerealistické, nové výzkumy naznačují, že obrázky generované pomocí umělé inteligence (AI) by mohly být brzy cíleně zaměřeny na konkrétní demografické skupiny.
Personalizovaná reklama, která se objevila ve sci-fi filmu Stevena Spielberga z roku 2002 Minority Report, zanechala trvalý a dokonce i znepokojivý dojem na kulturu, se svými živými billboardy, které rozpoznávají lidi v davu a přímo je oslovují.
Mnohé spotřebitelské skupiny mohou považovat tento level rozpoznávání diváků za noční můru, a přestože pokrok směrem k němu byl zpomalen v důsledku skandálu Cambridge Analytica, ideál přímého a vysoce cíleného zapojení zůstává ceněným cílem v reklamě.
Skutečností je, že systémy, které mohou rozdělit charakteristiky konkrétního diváka, zůstávají v neustálém vývoji – ačkoli v takových případech musí firemní výzkum přijmout opatření, aby respektoval zákony týkající se osobních údajů (PII); zákony, které byly v Evropě v posledních deseti letech posíleny a které se rozšířily do ostatních částí světa prostřednictvím Bruselského efektu.
Ahoj, ty!
Nyní, když reklamy a marketingový obsah generovaný pomocí AI jsou na vzestupu, musí reklamní agentury čelit potenciálním nákladům na reklamy cílené na konkrétní osoby, kde jsou obrázky a text generovány příležitostně a na vyžádání.
Příkladmo, i když by mohla být vytvořena reklamní kampaň velmi rychle, náklady by byly významné. Kromě toho automatické online aukční procesy pro reklamy fungují v kritických časových rámcích, což činí obtížným generovat reklamní obsah pro konkrétní uživatele, a videoobsah je ještě vzdálenější perspektivou.
Jednak technické překážky spojené s cílením na vyšší úroveň demografických skupin v síťovém publiku (prostřednictvím laptopů, telefonů, chytrých televizorů atd.) nejsou tak závažné – a nová mezinárodní akademicko-průmyslová spolupráce navrhuje způsob, jak vytvořit samostatné reklamní obrázky pro různé demografické skupiny, včetně faktorů jako věk a umístění:

Z nové práce: příklady personalizované generace reklam, kde je jeden produkt zobrazen v různých stylech pro různé skupiny diváků. První řada ukazuje původní produktové obrázky. Další tři řádky ukazují verze přizpůsobené třem odlišným typům publika pro každý produkt, založené na rozdílech v charakteristikách, jako je věk, životní styl nebo estetické preference. Tyto typy nejsou předem definovány, ale jsou automaticky objeveny.
Nový rámec – nazvaný Jedna velikost, mnoho tvarů (OSMF) – má za cíl mostovat mezeru mezi širokou cílenou reklamou a nerealisticky podrobnou personalizací, generováním různých reklamních obrázků pro automaticky objevené skupiny publika, pomocí produktově-aware clusteringu pro zarovnání vizuálního obsahu s klikacími preferencemi odlišných demografických skupin
Autorům se podařilo:
‘[My] představujeme sjednocený rámec, který zarovnává rozdílné skupinové preference v velkém měřítku generace reklamních obrázků.
‘OSMF začíná produktově-aware adaptivní skupinováním, které dynamicky organizuje uživatele na základě jejich atributů a produktových charakteristik, reprezentujících každou skupinu bohatými kolektivními preferenčními funkcemi.’
Testováno proti srovnatelným rámcům, autoři prohlašují, že dosáhli špičkových výsledků.
Ačkoli práce identifikuje rozdílné skupinové typy, článek není specifický ohledně toho, které demografické charakteristiky jsou reprezentovány každým G typem, ačkoli tyto typy se pravděpodobně mapují na tradiční tržní segmentační skupiny.
Tudíž není snadné určit, na základě různých příkladů uvedených v článku a v příloze, proč by určitá pozadí nebo osvětlení mohla být atraktivnější pro jednu skupinu než pro jinou, protože nevíme, jaké jsou charakteristiky žádné skupiny:

Není zde žádné konzistentní ‘modrá pro chlapce, růžová pro dívky’ styl, napříč skupinově specifickými styly, které by mohly prozradit, jaký typ osoby patří do které skupiny – definice, jak je patrné z existující literatury, jsou mnohem komplexnější a jemnější.
Co je možná znepokojivější pro ty, kteří jsou znepokojeni praktikami cílené reklamy, je možnost využít per-user poznatků při generování specifických obrázků v reklamách**.
Nový článek je nazvaný Jedna velikost, mnoho tvarů: Zarovnávání rozdílných skupinových preferencí v velkém měřítku generace reklamních obrázků a pochází od 17 výzkumníků z Národní laboratoře rozpoznávání vzorů v Pekingu; ‘Školy AI na UCAS’; čínské e-commerce společnosti JINGDONG; Hongkongské univerzity vědy a technologie v Kantonu; a Laboratoře rozpoznávání vzorů na Nanjing University of Science and Technology.
Metoda
Systém používá adaptivní clusterování (metodu, která nachází přirozená seskupení propojením uživatelských atributů s jejich reakcemi na různé produkty) pro seskupení uživatelů, na základě toho, jak jejich atributy formují vizuální preference v konkrétním produktovém kontextu. Implementace této metody autorů se nazývá Produktově-aware adaptivní seskupování (PAAG).
Tato seskupení nejsou pevně stanovená, ale jsou objevena z dat.
Podmíněný generátor obrázků, nazvaný Preference-kondicionovaný generátor obrázků (PCIG), pak používá profil každé skupiny pro vytvoření reklamních obrázků, které odpovídají skupinovým preferencím:

OSMF seskupuje uživatele podle toho, jak jejich atributy formují produktové preference, a poté používá tyto skupinové profily pro generování reklamních obrázků, které odpovídají skupinovým preferencím. PAAG zajišťuje seskupování, a PCIG vytváří obrázky pomocí podnětů a zpětné vazby přizpůsobené každé skupině.
Obrázkový generátor využívá neurčenou verzi Stable Diffusion, spolu s vhodným ControlNet (posledně zmíněný pomáhá udržovat konzistenci mezi různými generacemi skupin).
V pracovním postupu PAAG nejprve kóduje vztah mezi uživatelskými atributy a textovými a obrazovými aspekty produktu, pomocí sady dedikovaných kódérů a mezi-pozornostního mechanismu pro sloučení do sjednoceného preferenčního vloženého prostoru, který odráží pravděpodobnost, že uživatel klikne na konkrétní reklamu.
PAAG poté modeluje, jak různé kombinace uživatelských atributů interagují s produkčními názvy a obrázky. Textové a obrazové funkce jsou extrahovány pomocí CLIP a ResNet-založených kódérů, a uživatelské atributy, jako je pohlaví, umístění, věk nebo zařízení, jsou předány MLP, který umožňuje mezi-pozornost nad produkčními textovými a obrazovými funkcemi.
Výsledný vložený prostor reprezentuje pravděpodobnost kliknutí každého uživatele pro konkrétní produkt v konkrétním vizuálním kontextu. Jakmile jsou tyto uživatelské produktové preferenční vložené prostory získány, PAAG používá K-means clusterování pro seskupení uživatelů, kteří reagují podobně na konkrétní produkt.
PAAG vybírá nejlepší počet uživatelských skupin pro každý produkt kontrolou toho, jak dobře se cluster rozdělí. Místo použití pouze jednoho průměrného bodu pro skupinu, PAAG vzorkuje několik bodů ve různých vzdálenostech, aby zachytil širší rozsah preferencí.
Tyto skupinové profily jsou poté předány jako tokeny do skupinově-aware multimodálního velkého jazykového modelu (G-MLLM), který je používá pro generování reklamních obrázků přizpůsobených každé skupině.
Generace obrázků na základě uživatelských preferencí
Na straně uživatele G-MLLM učí předpovídat, kteří členové skupiny pravděpodobně kliknou jako další a jak popsat společné rysy v přirozeném jazyce. Na straně produktu se učí shrnout produkt zobrazený v obrázku a generovat reklamní styl popisky, které odpovídají jak produktu, tak skupině.
Pro odraz skutečného uživatelského chování je model rozšířen do skupinově-aware odměňovacího modelu (GRM). GRM je trénován na vlastním Skupinově-aware reklamní image preference (GAIP) datasetu† (viz níže) pro srovnání párů obrázků pro stejný produkt a identifikaci, který z nich fungoval lépe s konkrétní skupinou, pomocí skutečných klikacích dat.
Tento signál odměny je poté použit pro fine-tuning G-MLLM s Group-DPO, metodou, která učí dávat přednost podnětům, které vedou k lepší skupinové angažovanosti.
Data a testy
Vývoj GAIP
Poznamenávajíce historicky chybějící datové sady související se skupinovými reklamními preferencemi a že předchozí sbírky, jako je Personalizované polévky a CG4CTR, jsou buď příliš malé, nebo příliš špatně specifikované, výzkumníci vyvinuli svou vlastní sbírku, zmíněný GAIP, odvozený z ‘průmyslových reklamních logů’ neurčené e-commerce platformy.
Logy byly shromážděny během tří týdnů, s každým záznamem zaznamenávajícím produktový obrázek a název, profil diváka (včetně věku, úrovně výdajů a citlivosti na propagaci) a zda byla reklama kliknuta.
Dataset zahrnuje více než 40 milionů uživatelů, 2 miliony produktů a téměř 10 milionů reklamních obrázků, s vysokou vizuální variabilitou napříč položkami.
Uživatelé byli seskupeni PAAG do odlišných clusterů pro každý produkt, a klikací poměr (CTR) byl vypočten pro každou image v rámci každé skupiny:

Z nové práce, malý pohled na některé z definujících kritérií pro GAIT.
GAIP je poté vytvořen jako sada tuplů (reklamní obrázek, produktový název, skupinový vložený prostor, skupinový CTR) párující každou image a název s jeho CTR a vloženým prostorem skupiny, která jej viděla.
Pro zajištění spolehlivosti jsou uchovány pouze produkty s dostatečnou expozicí, což vede k datasetu 610 172 skupinových vzorků.
GAIP je podstatně větší než předchozí datové sady: zatímco většina předchozích benchmarků zahrnuje méně než deset uživatelských skupin, GAIP zahrnuje téměř 600 000 skutečných skupinových preferenčních záznamů, poskytujících hlubší pohled do skupinových preferencí.
Testy
Pro trénování PCIG potrubí výzkumníci extrahovali image a textové funkce pomocí ResNet a CLIP textového kódéru, poté je mapovali na 128-dimenzionální vložené prostory pomocí učitelných lineárních vrstev. Pro udržení efektivity byl PAAG omezen na pět uživatelských skupin pro produkt.
Skupinové vložené prostory byly konstruovány pomocí percentilové vzorkovací strategie, která vybírá více bodů z 15., 55. a 95. percentilů, aby zachytila jak jádro, tak periferní preference.
LLaVA byl použit jako základní model pro G-MLLM, a předtrénování bylo provedeno po dobu deseti epoch s kosinem učícího plánu při učícím tempu 2e-6, vyžadujícím pět dní trénování na clusteru osmi NVIDIA H100 GPU, každém s 80GB VRAM.
GRM byl trénován rekonstrukcí GAIP s párovými produkčními obrázky, poté inicializován se stejnými váhami jako G-MLLM. Během finální fáze Group-DPO byl GRM zmrazen, a G-MLLM fine-tuned pomocí LoRA po dobu tří epoch – opět, při učícím tempu 2e-5, na stejném NVIDIA clusteru.
Metriky použité pro první hodnocení byly NDCG@5 a AUROC. NDCG@5 měřil, jak odlišně každá skupina řadí stejné sady reklamních obrázků, s nižšími hodnotami indikujícími jasnější oddělení preferencí; a AUROC byl použit pro hodnocení, jak dobře každý model rozlišoval kliknuté a nekliknuté obsah.
Všechny metriky byly vypočteny z clusterů z 1 000 produktů, celkem asi 100 000 vzorků, a byly použity pro srovnání PAAG proti třem předchozím systémům: CACS; WIYD; a JAC:

Výsledky modelování preferencí ve srovnání s předchozími metodami. Nižší NDCG@5 a vyšší AUROC indikují lepší výkon. Nejlepší skóre jsou tučně, druhé nejlepší podtržené.
Z těchto výsledků autoři komentují:
‘[Naše] metoda dosahuje špičkových výsledků na obou metrikách. Konkrétně, PAAG dosahuje nejnižší NDCG@5 (0,3066), překonávající nejlepší benchmark (CACS), indikující více odlišné meziskupinové preference pro efektivní skupinovou generaci reklam.
‘Kromě toho PAAG dosahuje nejvyšší AUROC (0,6372), zlepšující se o 0,0159 oproti nejsilnějšímu benchmarku (WIYD).’
Druhé kolo testů zkontrolovalo, zda systém může lépe přizpůsobit reklamy správným uživatelským skupinám:

Online srovnání CTR ukazující, že skupinově personalizovaná generace (‘Ours’) překonává všechny benchmarky, včetně CAIG a pretrained G-MLLM.
Zde PCIG ukázal silnější klikací sazby než starší modely, jako je CAIG a G-MLLM, s 5,5% zlepšením. GRM byl také testován offline kontrolou, zda může správně vybrat lepší reklamu v páru, založené na skupinových preferencích. Překonal všechny benchmarky, včetně obecných modelů, s 4,7% zlepšením oproti CAIG.
Konečný kvalitativní test byl proveden pro vyhodnocení, zda PCIG může odrážet skupinové preference ve stylu generovaných obrázků. Jak je vidět na obrázku níže, stejný produkt byl zobrazen odlišně pro každou skupinu, s změnami v paletě, tónu a vizuální kompozici:

Plné výsledky kvalitativních testů, které byly dříve ukázány v článku.
Tyto variace se shodují, autoři tvrdí, s odvozenými klikacími preferencemi pro každou skupinu, ukazující, že PCIG může produkovat stylisticky odlišné výstupy, zatímco zachovává relevanci a atraktivitu. Autoři prohlašují:
‘[PCIG] zajišťuje stylisticky rozmanité obrázky, aby akomodovaly klikací preference odlišných uživatelských skupin, tím demonstrováně silnou schopnost přizpůsobit generaci heterogenním uživatelským požadavkům a zachytit jemné, detailní preference rozdílných uživatelských skupin, zdůrazňujíc jejich potenciál pro skupinově-aware generaci reklamních obrázků v měřítku.’
Závěr
Možná nejzajímavějším aspektem tohoto projektu je neznámá korelace mezi výstupními styly napříč skupinově cílenými obrázky pro stejný produkt (z nichž je několik stránek více příkladů v přílohách článku než můžeme reprodukovat zde).
Můžeme předpokládat, že městská pozadí jsou související s věkem, tj. s absolventy, kteří začínají, a že venkovská prostředí jsou zaměřena na prosperující typy Gen X, kteří identifikují otevřenou cestu jako určitý druh ‘konečné svobody’? Můžeme Rorschach tyto testovací výstupy celý den.
Potenciál takových systémů spočívá ve dvou faktorech: vhled a latence. Vhled závisí na tom, zda se vyvíjející sledovací systémy mohou stále extrahovat dostatečné množství významných informací z uživatelů, aby podpořily efektivní skupinově-cílenou reklamu, a současně položily základy pro přesnější, individuálně-cílenou reklamu v budoucnu.
Latence představuje větší výzvu, protože tyto přizpůsobené reklamní obrázky musí být generovány a doručeny téměř okamžitě; ačkoli některé nedávné text-to-image modely mohou produkovat výsledky za pouhých několik sekund, i tato zpoždění může být příliš dlouhá pro reálné aukce reklam.
Jedním z možných řešení je generovat obrázky místně, na GPU prohlížeče, a tím se vyhnout síťovým round-tripům; nebo vytvořit sadu obrázků předem, přednačtených na klientovi.
** Tento aspekt je vynechán v nové práci, stejně jako potenciál nových rámců AI pro hlubokou falzifikaci je často zmírněn použitím roztomilých zvířecích postav (místo AI porna) v nových studiích. Přestože typy obrázků ukázány v práci reprezentují reklamní agentury ve svém nejlepším chování, spíše než zobrazují, jak osobní vizuální reklamy by mohly nakonec být, když spotřebitelské cílení metodiky spolupracují s rychlo-odpovědí generativní AI.
** Nemohu identifikovat tuto instituci, protože ‘UCAS’ obecně odpovídá dobře známé britské univerzitní aplikaci clearing-house. Vítám upřesnění.
† Který výzkumníci slibují uvolnit na přidruženém GitHub repozitáři.
Poprvé publikováno ve čtvrtek, 5. února 2026












