Kąt Andersona
Obrazy reklamowe generowane przez AI, ukierunkowane na Twoją grupę demograficzną – I, ostatecznie, Ciebie?

Reklamodawcy dążą do dostosowania reklam do poszczególnych widzów, aby zwiększyć liczbę kliknięć, a chociaż tworzenie reklam na zamówienie dla każdej osoby jest obecnie niepraktyczne, nowe badania sugerują, że obrazy generowane przez AI mogą być skutecznie ukierunkowane na określone grupy demograficzne.
Personalizowana reklama przedstawiona w filmie Stevena Spielberga z 2002 roku Raport mniejszości wywarła trwałe, nawet niepokojące wrażenie na kulturze, ze swoją wyrazistą prezentacją proaktywnych billboardów reklamowych, które rozpoznają ludzi w tłumie i krzyczą reklamowe hasła bezpośrednio do nich.
Wiele grup konsumentów może postrzegać ten poziom rozpoznawania widza jako koszmar, a chociaż postępy w kierunku tego celu zostały spowolnione przez skandal Cambridge Analytica , idea bezpośredniej, wysoko ukierunkowanej interakcji pozostaje cenionym celem w reklamie.
W rzeczywistości systemy, które mogą dotrzeć do cech określonego widza pozostają w ciągłym rozwoju – chociaż w takich przypadkach badania korporacyjne muszą podjąć środki w celu poszanowania przepisów dotyczących osobistych informacji identyfikujących (PII); przepisów, które zostały wzmocnione w Europie w ciągu ostatniej dekady, a które rozprzestrzeniły się na inne miejsca za pośrednictwem efektu brukselskiego.
Cześć!
Teraz, gdy reklamy i treści marketingowe generowane przez AI są w zanadrzu, reklamodawcy muszą jednak zmierzyć się z potencjalnym kosztem reklam AI ukierunkowanych na określone osoby, gdzie obraz i tekst są wywoływane oportunisticznie i na bieżąco.
Na przykład, nawet jeśli można było wygenerować obraz na zamówienie bardzo szybko, koszty w skali byłyby znaczące. Dodatkowo, automatyczne procesy aukcji reklam online działają w krytycznych, milisekundowych ramach czasowych, co utrudnia tworzenie niestandardowych treści wizualnych dla użytkowników; a treści wideo są jeszcze bardziej odległym celem.
Jednakże techniczne przeszkody związane z dotarciem do wyższego poziomu grup demograficznych w sieciowej publiczności (za pośrednictwem laptopów, telefonów, smart TV itd.) nie są tak poważne – a nowe międzynarodowe akademicko-przemysłowe współpracy proponują sposób tworzenia odrębnych obrazów reklamowych dla różnych grup demograficznych, w tym takich czynników, jak wiek i położenie:

Z nowej pracy: przykłady personalizowanej generacji reklam, gdzie jeden produkt jest renderowany w różnych stylach dla różnych grup widzów.
Nowy framework – zatytułowany Jedna wielkość, wiele dopasowań (OSMF) – ma na celu zmostkowanie luki między reklamami o szerokim zasięgu a niepraktycznie szczegółową personalizacją, generując różne obrazy reklamowe dla automatycznie odkrytych grup publiczności, przy użyciu grupowania świadomego produktu, aby dopasować treści wizualne do preferencji kliknięć różnych grup demograficznych.
Autorzy stwierdzają:
‘[Prezentujemy] zintegrowany framework, który dopasowuje różne grupowe preferencje kliknięć w generacji obrazów reklamowych w dużym zakresie.
‘OSMF rozpoczyna się od grupowania adaptacyjnego świadomego produktu, które dynamicznie organizuje użytkowników na podstawie ich atrybutów i cech produktu, reprezentując każdą grupę bogatymi wspólnymi cechami preferencji.’
Ztestowano framework przeciwko porównywalnym frameworkom, a autorzy twierdzą, że osiągnęli wyniki na poziomie stanu sztuki.
Chociaż praca identyfikuje różne grupy demograficzne, artykuł nie określa, które cechy demograficzne są reprezentowane przez każdą G grupę, chociaż wydają się one prawdopodobnie mapować na tradycyjne grupy segmentacji rynku.
Dlatego też nie jest łatwo powiedzieć, na podstawie różnych przykładów podanych w głównym artykule i załączniku, dlaczego określone tła lub oświetlenie mogłyby przypadać bardziej do gustu jednej grupie niż innej, ponieważ nie znamy cech żadnej grupy:

Nie ma spójnych stylów, takich jak ‘niebieski dla chłopców, różowy dla dziewcząt’ itp., w stylach obrazów specyficznych dla grupy, które mogłyby zdradzić, jaki typ osoby należy do której grupy – definicje, jak wynika z istniejącej literatury, są o wiele bardziej złożone i subtelne.
Czym może być bardziej niepokojące dla tych, którzy są czujni wobec praktyk targetowania reklam, jest możliwość wykorzystania wglądu w poszczególne użytkowników przy generowaniu konkretnych obrazów w reklamach**.
Artykuł nowy jest zatytułowany Jedna wielkość, wiele dopasowań: Dopasowanie różnych grupowych preferencji kliknięć w generacji obrazów reklamowych w dużym zakresie, i pochodzi od 17 badaczy z Narodowego Laboratorium Rozpoznawania Wzorców w Pekinie; ‘Szkoły AI w UCAS’; chińskiej firmy e-commerce JINGDONG; Uniwersytetu Nauki i Technologii w Hongkongu w Kantonie; i Laboratorium Rozpoznawania Wzorców na Uniwersytecie Nauki i Technologii w Nanjing.
Metoda
System wykorzystuje grupowanie adaptacyjne (metodę, która znajduje naturalne grupy, łącząc cechy użytkowników z ich reakcją na różne produkty) w celu grupowania użytkowników, na podstawie tego, jak ich cechy kształtują preferencje wizualne w danym ustawieniu produktu. Implementacja autorów tego podejścia jest zatytułowana Grupowanie adaptacyjne świadome produktu (PAAG).
Te grupy nie są ustalone z wyprzedzeniem, ale są odkrywane z wzorców w danych.
Generator obrazu warunkowego, zatytułowany Generacja obrazu warunkowego preferencjami (PCIG), wykorzystuje następnie profil każdej grupy do tworzenia reklamowych obrazów, które odpowiadają gustom grupy:

OSMF grupuje użytkowników na podstawie tego, jak ich cechy kształtują preferencje produktu, a następnie wykorzystuje profile grup do generowania reklamowych obrazów dopasowanych do gustów każdej grupy. PAAG zajmuje się grupowaniem, a PCIG tworzy obrazy przy użyciu podpowiedzi i informacji zwrotnej dostosowanych do każdej grupy.
Generator obrazu wykorzystuje niesprecyzowaną wersję Stable Diffusion, wraz z odpowiednim pakietem ControlNet (ten ostatni, aby pomóc w utrzymaniu spójności wśród różnych generacji kohorty).
W przepływie pracy, PAAG najpierw koduje relację między cechami użytkowników a tekstowymi i wizualnymi aspektami produktu, przy użyciu zestawu dedykowanych kodera i mechanizmu uwagi krzyżowej, aby połączyć je w jedną, zunifikowaną osadzenie preferencji, które odzwierciedla prawdopodobieństwo kliknięcia użytkownika na konkretną reklamę.
PAAG modeluje następnie, w jaki sposób różne kombinacje atrybutów użytkownika oddziałują z tytułami produktów i obrazami produktów. Cechy tekstowe i wizualne są wyodrębniane przy użyciu CLIP i ResNet-opartych kodera, a atrybuty użytkownika, takie jak płeć, położenie, wiek lub urządzenie, są przekazywane przez MLP, co umożliwia uwagę krzyżową nad cechami produktu i obrazem.
Wynikowe osadzenie reprezentuje prawdopodobieństwo kliknięcia każdego użytkownika dla konkretnego produktu w określonym kontekście wizualnym. Gdy tylko uzyskano te osadzenia preferencji użytkowników i produktów, PAAG wykorzystuje K-means clustering, aby pogrupować użytkowników, którzy reagują podobnie na dany produkt.
PAAG wybiera najlepszą liczbę grup użytkowników dla każdego produktu, sprawdzając, jak dobrze klastry oddzielają się. Zamiast używać tylko jednego średniego punktu na grupę, próbuje kilku punktów w różnych odległościach, aby uchwycić szerszy zakres preferencji.
Te profile grup są następnie przekazywane jako tokeny do modelu językowego wielomodalnego świadomego grupy (G-MLLM), który wykorzystuje je do generowania reklamowych obrazów dostosowanych do każdej grupy.
Generacja obrazu na podstawie preferencji użytkowników
Po stronie użytkownika G-MLLM uczy się przewidywać, którzy członkowie grupy są najbardziej prawdopodobni do kliknięcia i jak opisać wspólne cechy w naturalnym języku. Po stronie produktu uczy się podsumowywać produkt przedstawiony na obrazie i generować stylizowane podpisy reklamowe, które odpowiadają zarówno produktowi, jak i grupie.
Aby odzwierciedlić rzeczywiste zachowanie użytkowników, model jest rozszerzony do modelu nagradzania świadomego grupy (GRM). GRM jest szkolony na własnym zbiorze danych GAIP (patrz poniżej), aby porównać pary obrazów dla tego samego produktu i określić, który z nich działa lepiej z określoną grupą, przy użyciu rzeczywistych danych kliknięć.
Ten sygnał nagrody jest następnie wykorzystywany do dostrojenia G-MLLM z Group-DPO, metody, która uczy go faworyzować podpowiedzi, które prowadzą do lepszej interakcji na poziomie grupy.
Dane i testy
Rozwój GAIP
Zauważając historyczny brak zbiorów danych związanych z preferencjami reklamowymi grup, oraz że poprzednie kolekcje, takie jak Personalized Soups i CG4CTR, są albo zbyt mało rozległe, albo zbyt źle określone, badacze opracowali własną kolekcję, wspomniany wcześniej GAIP, pochodzący z ‘przemysłowych logów reklamowych’ niesprecyzowanej platformy e-commerce.
Dane logowania zostały zebrane w ciągu trzech tygodni, a każdy wpis rejestrował obraz produktu i tytuł, profil widza (w tym wiek, poziom wydatków i wrażliwość na promocje) oraz to, czy reklama została kliknięta.
Zbiór danych obejmuje ponad 40 milionów użytkowników, 2 miliony produktów i prawie 10 milionów reklamowych obrazów, z wysoką różnorodnością wizualną wśród elementów.
Użytkownicy zostali pogrupowani przez PAAG w odrębne klastry dla każdego produktu, a wskaźnik klikalności (CTR) został obliczony dla każdego obrazu w każdej grupie:

Z materiałów uzupełniających nowego artykułu, mały wgląd w niektóre z kryteriów definiujących GAIT.
GAIP jest następnie utworzony jako zestaw krotek (reklamowy obraz, tytuł produktu, osadzenie grupy, CTR specyficzne dla grupy) łącząc każdy obraz i tytuł z jego CTR i osadzeniem grupy, która go zobaczyła.
Aby zapewnić niezawodność, zatrzymano tylko produkty z wystarczającą ekspozycją, co skutkowało zbiorem danych 610 172 próbek na poziomie grupy.
GAIP jest znacznie większy niż poprzednie zbiory danych: podczas gdy większość poprzednich benchmarków obejmuje mniej niż dziesięć grup użytkowników, GAIP zawiera prawie 600 000 rzeczywistych rekordów preferencji grupowych, zapewniając głębsze spojrzenie na preferencje na poziomie grupy.
Testy
Aby przeszkolić pipeline PCIG, badacze wyodrębnili cechy obrazu i tekstu przy użyciu ResNet i kodera tekstu CLIP, a następnie mapowali je na 128-wymiarowe osadzenia za pomocą uczonych warstw liniowych. Aby utrzymać wydajność, PAAG został ograniczony do pięciu grup użytkowników na produkt.
Osadzenia grup zostały utworzone przy użyciu strategii próbkowania opartej na percentylach, pobierając wiele punktów z 15., 55. i 95. percentyli, aby uchwycić zarówno rdzeń, jak i peryferyjne preferencje.
LLaVA został wykorzystany jako podstawa dla G-MLLM, a pre-trenowanie zostało przeprowadzone w ciągu dziesięciu epok z harmonogramem uczenia cosinusoidalnym przy stopy uczenia 2e-6, wymagając imponujących pięciu dni szkolenia na klastrze ośmiu procesorów NVIDIA H100, każdy z 80 GB pamięci VRAM.
GRM został przeszkolony przez odtworzenie GAIP z parami obrazów produktów, a następnie zainicjowany z tymi samymi wagami co G-MLLM. Podczas końcowego etapu Group-DPO, GRM został zamrożony, a G-MLLM dostrojony przy użyciu LoRA przez trzy epoki – ponownie przy stopy uczenia 2e-5, na tym samym klastrze NVIDIA.
Metryki wykorzystane w pierwszej ocenie były NDCG@5 i AUROC. NDCG@5 mierzył, jak różnie każda grupa klasyfikowała te same zestawy reklamowych obrazów, z niższymi wartościami wskazującymi na wyraźniejsze rozróżnienie preferencji; AUROC został wykorzystany do oceny, jak dobrze każdy model rozróżniał kliknięte od nieklikniętego contenu.
Wszystkie metryki zostały obliczone na wynikach klastryzacji z 1000 produktów, łącznie około 100 000 próbek, i zostały wykorzystane do porównania PAAG z trzema poprzednimi systemami: CACS; WIYD; i JAC:

Wyniki modelowania preferencji w porównaniu z poprzednimi metodami. Niższe NDCG@5 i wyższe AUROC wskazują na lepszą wydajność. Najlepsze wyniki są pogrubione, a drugie najlepsze są podkreślone.
Z tych wyników autorzy komentują:
‘[Nasza] metoda osiąga lepszą wydajność w obu metrykach. Konkretnie, PAAG osiąga najniższy NDCG@5 (0,3066), przewyższając najlepszą bazę porównawczą (CACS), co wskazuje na bardziej wyraźne wzorce preferencji międzygrupowych dla skutecznej generacji reklam na poziomie grupy.
‘Ponadto PAAG osiąga najwyższy AUROC (0,6372), poprawiając wynik najlepszej bazy porównawczej (WIYD) o 0,0159.’
Druga runda testów sprawdziła, czy system może lepiej dopasować reklamy do odpowiednich grup użytkowników:

Porównanie wskaźników klikalności online, pokazujące, że generacja z personalizacją grupową (‘Nasza’) przewyższa wszystkie bazy porównawcze, w tym CAIG i pre-trenowany G-MLLM.
Tutaj PCIG pokazał silniejsze wskaźniki klikalności niż starsze modele, takie jak CAIG i G-MLLM, z 5,5% poprawą. GRM został również przetestowany offline, sprawdzając, czy może poprawnie wybrać lepszą reklamę w parze, na podstawie preferencji grupy. Przewyższył wszystkie bazy porównawcze, w tym ogólne modele, z zyskiem 4,7% w stosunku do CAIG.
Ostateczny test jakościowy został przeprowadzony w celu oceny, czy PCIG może odzwierciedlić preferencje na poziomie grupy w stylu generowanych obrazów. Jak widać na poniższym obrazie, ten sam produkt został wyrenderowany inaczej dla każdej grupy, z zmianami w paletach, tonach i kompozycjach wizualnych:

Pełne wyniki testów jakościowych, zapowiedziane wcześniej w artykule.
Te wariacje były zgodne, twierdzą autorzy, z wnioskowanymi preferencjami kliknięć dla każdej grupy, pokazując, że PCIG może produkować stylistycznie różnorodne dane wyjściowe, zachowując przy tym istotność i atrakcyjność. Autorzy stwierdzają:
‘[PCIG] zapewnia stylistycznie różnorodne obrazy, aby dostosować się do preferencji kliknięć odrębnych grup użytkowników, tym samym demonstrując swoją silną zdolność do adaptacji generacji do zróżnicowanych potrzeb użytkowników i uchwycenia subtelnych, drobnych różnic preferencji wśród zróżnicowanych grup użytkowników, podkreślając swoją potencjalną zdolność do generacji reklam na poziomie grupy w skali.’
Podsumowanie
Być może najbardziej interesującym aspektem tego projektu jest nieznana korelacja między stylami wyjściowymi w obrazach ukierunkowanych na grupy dla tego samego produktu (z których jest kilka stron w materiałach uzupełniających artykułu, których nie możemy tutaj odtworzyć).
Czy możemy założyć, że miejskie tła są związane z wiekiem, tj. z absolwentami rozpoczynającymi karierę, i że wiejskie środowiska są skierowane do bardziej zamożnych typów pokolenia X, którzy identyfikują otwartą drogę jako rodzaj ‘ostatecznej wolności’? Można patrzeć na te testowe dane przez cały dzień.
Potencjał takich systemów opiera się na dwóch czynnikach: wglądzie i opóźnieniu. Wgląd zależy od tego, czy nowe systemy śledzące mogą nadal wyodrębnić wystarczająco istotne informacje od użytkowników, aby wesprzeć skuteczną reklamę ukierunkowaną na grupy, oraz czy mogą położyć podwaliny pod jeszcze bardziej precyzyjne, indywidualnie ukierunkowane reklamy w przyszłości.
Opóźnienie stanowi większe wyzwanie, ponieważ te niestandardowe obrazy reklamowe muszą być generowane i dostarczane niemal natychmiast; chociaż niektóre niedawne modele tekst-obraz mogą produkować wyniki w zaledwie kilka sekund, nawet to opóźnienie może być zbyt długie dla aukcji reklam w czasie rzeczywistym.
Jednym z możliwych rozwiązań jest generowanie obrazów lokalnie, na GPU przeglądarki, unikając tras sieciowych; lub tworzenie szeregu obrazów z wyprzedzeniem, pre-załadowanych na kliencie.
** Ten aspekt jest pominięty w nowym artykule, podobnie jak potencjał nowych ram AI do głębokiej manipulacji jest często łagodzony przez użycie przyjaznych postaci zwierząt (zamiast AI pornografii) w nowych badaniach. Niemniej jednak rodzaj obrazów przedstawionych w pracy reprezentuje reklamodawców w ich najlepszym zachowaniu, a nie to, jak osobiste wizualne reklamy mogą ostatecznie się stać, gdy metody targetowania konsumentów łączą się z szybko reagującą generatywną AI.
** Nie mogę zidentyfikować tej instytucji, ponieważ ‘UCAS’ zwykle odnosi się do dobrze znanej brytyjskiej instytucji aplikacji uniwersyteckiej. Zachęcam do wyjaśnienia.
† Badacze obiecują opublikować go w powiązanym repozytorium GitHub.
Pierwotnie opublikowane w czwartek, 5 lutego 2026












