Andersonův úhel

Nová výzkum navrhuje skutečně “personalizovanou” reklamu

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
A woman looks at a laptop displaying a news website, reacting with surprise as a banner advertisement on the page shows a smiling woman who closely resembles her.

V redefinici “sebe-propagace” nový metod mine uživatele vlastní kliky pro vytvoření přizpůsobených webových reklam na základě jejich vlastní historie.

 

Přestože reklamní agentury jsou ochotny vyvrátit myšlenku, že existují reklamní kanály, které mohou zobrazovat reklamy na základě toho, co jste právě říkali v pohodlí svého domova, rozsah “personalizace” prokázán reklamami na webových stránkách a sociálních médiích získal záhlaví v posledních letech.

Ideální scénář pro reklamního agenta byl vždycky takový, aby reklama byla “přesným fitem” pro diváka. V rámci omezení veřejného tlaku proti online sledování a preventivních opatření, která uživatel mohl instalovat proti takovému sledování, generativní AI (která vedle strachu z LLM reklamy v post-search světě) je schopna produkovat reklamní obrázky a texty dostatečně rychle pro reálné nasazení.

Nicméně, hlavní směr výzkumu a většina implementací v této oblasti do dneška byly založeny na agregovaných statistikách využití, takže jakákoli generovaná reklama pro diváka by byla založena na divákově odhadnutém kohortním skupině spíše než na jeho vlastní unikátní historii.

Nyní, nová výzkumná spolupráce mezi Čínou a USA představuje systém pro generování reklamních obrazů a textu pro jednotlivé uživatele tím, že se učí z jejich vlastních minulých kliknutí, když jsou přihlášeni na web, a přechází beyond kohortních předpokladů, které ovládly většinu personalizované reklamní výzkumu do dneška:

Příklad generací zobrazující individuálně přizpůsobené reklamy. Samozřejmě, bez uživatele historie jako kontextu, plný dopad lze pouze představit. Zdroj - https://arxiv.org/pdf/2605.12138

Příklad generací zobrazující individuálně přizpůsobené reklamy. Samozřejmě, bez uživatele historie jako kontextu, plný dopad lze pouze představit. Zdroj

Neobvykle, nový přístup se zřekne difuzních modelů ve prospěch autoregresivního architektury – primární rozdíl spočívá v tom, že difuzní modely postupně zlepšují obraz z vizuálního šumu, zatímco autoregresivní modely generují obsah kousek po kousku, předpovídající každý nový prvek z všeho, co předcházelo.

Pro podporu nového generativního modelu, autoři vyvinuli to, co tvrdí, že je první velká image-textová datová sada pro personalizovanou reklamu, jakož i novou metriku navrženou pro vyhodnocení této konkrétní úlohy. Při testech, zjistili, že jejich přístup překonal jak obecné baseline, tak stávající metody a rámce, které目前 řeší tuto výzvu.

Walled Garden

Je třeba poznamenat, že navrhovaný rozsah práce, který nenabízí reklamním agenturám způsob, jak obejít nová opatření proti třetím stranám sledování, ale spíše dává dostatečně velkému prodejci možnost osadit přihlášeného zákazníka reklamami, které přímo souvisejí s touto konkrétní osobou.

Toto není nutně omezeno na klienty, kteří právě procházejí prodejcovu vlastní webovou stránku: v závislosti na rozsahu, ve kterém uživatel udělil prodejci oprávnění k sledování jeho aktivit na jiných webových stránkách, mohl by být prezentován cílenými reklamami na libovolném počtu dalších webových stránek, které se účastní aukcí reklamy, které prodejce sám používá.

Tento typ reklamního dosahu se obvykle omezuje na velké, rozsáhlé prodejce, jako je Amazon, na západě (a poznamenáváme, že analogicky velký čínský prodejce se účastnil nové práce – viz níže), i když jakýkoli podobně velký prodejce (jako populární sociální média) by teoreticky mohl vygenerovat podobný generativní rámec.

Nová práce je nazvaná Navrhněte svou reklamu: Personalizovaná reklama obrazu a textu s jednotným autoregresivním modelem, a pochází od 18 autorů z Univerzity Sun Yat-Sen v Kantonu, Northeastern University a čínského největšího prodejce, JD.com (který má ten cenný přístup k historii a zvyklostem zákazníků). Kód byl zpřístupněn prostřednictvím GitHubu, a relevantní kontrolní body jsou k dispozici.

Data a Metoda

Datová sada vytvořená pro projekt je nazvaná Personalizovaná reklama obraz-text (PAd1M), a je poháněna daty poskytnutými projektem contributor JD.com. Autoři uvádějí:

‘Každý produkt obvykle poskytuje více než deset kandidátních obrazů a textu, zajišťujících, že rozmanité preference mohou být plně detekovány. Pro spolehlivé modelování preferencí, sbíráme kompletní historii kliknutí uživatelů přes oba obrazy a texty, filtrování uživatelů s nedostatečnou aktivitou pro snížení šumu.

‘To vede k datové sadě 1 145 371 uživatelů, s 18 923 555 kliknutými produktovými obrazy a texty, průměrně více než šestnáct multimodálních historických chování na uživatele.’

Pro každého uživatele, jeden dříve kliknutý obraz-textový pár byl vybrán jako cílový příklad, po kterém byl produkt sám izolován z obrazu pomocí Grounded SAM.

Prodejní popisy a prodejní body byly poté připojeny k záznamu, vytvářející datovou sadu, ve které je každý cílový reklamní materiál doprovázen transparentním produktovým obrazem; strukturovanou produktovou informací; a historií dřívějších obrazových a textových interakcí, určenou k zachycení uživatele předchozích zájmů a preferencí:

Uživatelský profil z datové sady PAd1M, zobrazující cílovou reklamu vedle produktové informace, která ji generovala, a historických obrazových a textových interakcí, které modelovaly uživatele preference.

Uživatelský profil z datové sady PAd1M, zobrazující cílovou reklamu vedle produktové informace, která ji generovala, a historických obrazových a textových interakcí, které modelovaly uživatele preference.

Výsledná datová sada nabízí rozsah více než milion uživatelů a téměř 19 milionů kliknutých obrazů a textů, s autory, kteří uvádějí, že sbírka je podstatně větší než předchozí personalizační datové sady.

<p Navíc, data, neobvykle pro tento směr výzkumu, kombinují jak obrazy, tak text, umožňující uživatelům preferencí být modelovány napříč několika modalitami, spíše než v rámci jediné domény.

PAd1M také obsahuje individuální úroveň sledování preferencí; na rozdíl od předchozích reklamních datových sad, které byly postaveny kolem kliknutí agregovaných přes velké skupiny, PAd1M spojuje interakce s konkrétními uživateli z dat JD.com.

Pro metriky, kromě standardních voleb BLEU a ROUGE, výzkumníci vyvinuli svou vlastní měřicí metriku nazvanou Produktová pozadí podobnost (PBS). Založena na předchozí MoCo-v3 iniciativě, PBS byla trénována na 681 123 obrazových párech zobrazujících stejný produkt proti různým pozadí, umožňující metrice zaměřit se na kontextové variace spíše než na produkt sám:

Produktová pozadí podobnost (PBS) přiřazuje výrazně odlišné podobnostní skóre reklamám, které obsahují stejný produkt, ale umístí ho do různých vizuálních kontextů, na rozdíl od konkurenčních metrik, které produkují mnohem menší separace.

Produktová pozadí podobnost (PBS) přiřazuje výrazně odlišné podobnostní skóre reklamám, které obsahují stejný produkt, ale umístí ho do různých vizuálních kontextů. Naopak, konkurenční metriky produkují mnohem menší separace.

Během trénování, každý obraz byl spárován se sebou jako pozitivní příklad, zatímco obraz stejného produktu umístěného v odlišném nastavení sloužil jako negativní příklad, trénovací strategie určená ke zvýšení citlivosti na kontext pozadí. Výsledky vyhodnocení, práce tvrdí, ukazují větší rozdíly v podobnosti mezi shodnými a neshodnými pozadími než ty, které produkují CLIP, DINO v3, nebo výše zmíněný MoCov3.

Jako je ukázáno v horní části obrázku níže*, výzkumníků Jednotný generativní reklamní (Uni-AdGen) model používá autoregresivní vizuální-jazykovou architekturu pro generování reklamních textů a obrazů. Proces je řízen strukturovanou instrukcí, která zahrnuje definici úkolu, a produktovou popis, spolu s prodejními body:

Přehled metody.

Přehled metody.

Zvláštní omezující tokeny definují část sekvence vyhrazené pro reklamní kopii. Po generování textu, speciální obrazový token spouští generování obrazu, zatímco uzavírací obrazový token označuje jeho dokončení, s vygenerovanými tokeny následně odeslanými do samostatných textových a obrazových dekodérů.

Pro obrazy, LlamaGen’s VQ-GAN dekodér se používá pro převod diskrétních obrazových tokenů zpět do pixelů.

Tímto způsobem, jednotná architektura generuje text a obrazy v rámci jediného next-token prediction rámce, spíše než spoléhání se na samostatné potrubí – metodu přijatou pro dřívější reklamní systémy se podobným rozsahem.

Během trénování, model učí obě modalitní společně, s textovými tokeny předpovídanými na základě vstupní sekvence a dříve vygenerovaného textu. Obrazové tokeny jsou poté předpovídané pomocí vstupní sekvence, vygenerovaného textu a dříve vygenerovaných obrazových tokenů.

Pro udržení vygenerovaných reklamních materiálů spojených s propagovaným produktem, Uni-AdGen používá foreground-perception modul založený na DINO v2, pro vstřikování informací z transparentních produktových obrazů do autoregresivního modelu.

Instruction-tuning (trénování modelu pro následování produktově specifických generativních instrukcí odvozených z popisů a prodejních bodů) byl také použit pro zlepšení shody s prodejními popisy a prodejními body, s GPT-4o použitým pro filtrování nevhodných trénovacích příkladů.

Personalizace spoléhala na coarse-to-fine modul pro pochopení preferencí. Historické interakce byly nejdříve filtrovány prostřednictvím Produktové podobnosti vzorkování (PSS) potrubí pro favorizaci produktů podobných cílovému produktu. Zbývající záznamy byly poté zpracovány Multimodální preferenční extrakcí fází navrženou pro identifikaci vizuálních a textových prvků, které jsou nejpravděpodobněji odrážet uživatele zájmy – s těmito preferencemi vloženými do podnětu, pro vedení generace.

Testy

Autoři uvádějí, že jejich testovací přístup je odvozen z DeepSeek’s Janus-Pro 7B.

Model byl trénován v batch size čtyř, pod AdamW optimalizátoru na učení rychlost 5e-5. Základní model byl jemně trénován prostřednictvím LoRA, s plně jemně trénovaným (tj. na rozdíl od LoRA, základní modelová váha byla trvale změněna).

Všechny testy byly spuštěny na NVIDIA B200 GPU s 192GB VRAM. Pro generování obrazů, PickScore, ImageReward, a ASE byly použity pro měření vizuální kvality, zatímco m-BLEU a m-ROUGE byly použity pro vyhodnocení reklamního textu. Lidské hodnotitelé také vyhodnotili realističnost obrazu a kvalitu rozložení, spolu s textovou přesností a plynulostí, se všemi metrikami vypočtenými napříč 500 produkty.

Pro generování obrazů, baseline sestávaly z Qwen2.5-VL a GPT-4o pro vytváření pozadí promptů z produktových obrazů, následované ReliableAd, PosterMaker, a Flux-Fill pro generování konečných reklamních materiálů. Textové generace srovnání byly provedeny proti Qwen2.5, Qwen3, a DeepSeek-R1.

Počáteční baseline kvantitativní výsledky pro generování reklamních materiálů jsou ukázány níže:

Výkon na obecném reklamním generativním benchmarku. Uni-AdGen odpovídal nebo překonal nejsilnější image-generační baseline na estetické kvalitě a PickScore, zatímco jednotný image-text model dosáhl nejvyšší m-ROUGE skóre mezi všemi textovými generativními přístupy. Lidské vyhodnocovací výsledky zůstaly konkurenceschopné napříč oběma modalitami.

Výkon na obecném reklamním generativním benchmarku. Uni-AdGen odpovídal nebo překonal nejsilnější image-generační baseline na estetické kvalitě a PickScore, zatímco jednotný image-text model dosáhl nejvyšší m-ROUGE skóre mezi všemi textovými generativními přístupy. Lidské vyhodnocovací výsledky zůstaly konkurenceschopné napříč oběma modalitami.

Z těchto výsledků, autoři uvádějí:

‘[Naše] metoda dosahuje nejlepšího výkonu v ImageReward a zaujímá druhé místo v obou PickScore a lidské vyhodnocení, demonstruje jeho nadřazený výkon v estetické a dostupné míře. Zatímco ReliableAd vede v lidském vyhodnocení, výrazně zaostává v estetických metrikách. Naopak, PosterMaker a Flux-Fill generují vizuálně atraktivní obrazy, ale trpí zřetelnými omezeními použitelnosti.

‘Díky efektivnímu kontrolnímu přístupu, [naše] metoda úspěšně dosahuje optimálního vyvážení mezi vizuálním obsahem a praktickou užitečností.’

Personalizované generování reklamních materiálů bylo vyhodnoceno na 500 uživatelích s zaznamenanou historií interakcí, pomocí výše zmíněného PBS pro měření obrazové podobnosti, a BLEU a ROUGE pro srovnání vygenerovaného textu proti produktům, které uživatelé skutečně klikli.

Vzhledem k tomu, že obecné reklamní baseline použité v předchozím experimentu nemohly zahrnovat uživatelské historie, srovnání byla přesunuta do systémů navržených pro personalizaci. Pro generování obrazů, Flux-Kontext a Pigeon byly vybrány jako baseline. Flux-Kontext byl zásoben mřížkou historických uživatelských obrazů vedle cílového produktového obrazu, umožňující předchozím preferencím ovlivnit generování.

Pošto, že Pigeon nemá původně podporu pro řízené produktové umístění, foreground-perception modul vyvinutý pro Uni-AdGen byl integrován pro zachování produktové konzistence. Pro textovou generaci, Qwen3 a DeepSeek-R1 byly použity, s historickými produktovými popisy vloženými přímo do jejich instrukčních šablon pro poskytnutí uživatelsky specifického kontextu:

Personalizované generování reklamních materiálů. Uni-AdGen překonal Flux-Kontext, Pigeon, Qwen3, a DeepSeek-R1 napříč všemi hlášenými personalizačními metrikami, zatímco studie odstranění indikovala, že historická uživatelská data, Produktová podobnost vzorkování (PSS), a multimodální preference extrakce každý přispěl měřitelnými zisky.

Personalizované generování reklamních materiálů. Uni-AdGen překonal Flux-Kontext, Pigeon, Qwen3, a DeepSeek-R1 napříč všemi hlášenými personalizačními metrikami, zatímco studie odstranění indikovala, že historická uživatelská data, Produktová podobnost vzorkování (PSS), a multimodální preference extrakce každý přispěl měřitelnými zisky.

Zde autoři komentují:

‘Vizualizované výsledky [zobrazené v obrázku níže] ukazují, že Flux-Kontext selhává v pochopení uživatelských preferencí a zůstává náchylný k vzorkové úrovni šumu, vedoucí k významnému odchýlení od ground truth, jako je například irelevantní položky v motorovém obrazu.’

Příklady personalizovaného generování reklamních materiálů. Ve srovnání s Flux-Kontextem, Pigeonem, Qwen3, a DeepSeek-R1, Uni-AdGen produkoval obrazy, které více odpovídaly vizuálním stylům a kontextu reklam, které uživatelé skutečně klikli, zatímco generoval text, který zachytil větší podíl produktových atributů a prodejních bodů přítomných v ground-truth příkladech. Shodné termíny jsou zvýrazněny zeleně.

Příklady personalizovaného generování reklamních materiálů. Ve srovnání s Flux-Kontextem, Pigeonem, Qwen3, a DeepSeek-R1, Uni-AdGen produkoval obrazy, které více odpovídaly vizuálním stylům a kontextu reklam, které uživatelé skutečně klikli, zatímco generoval text, který zachytil větší podíl produktových atributů a prodejních bodů přítomných v ground-truth příkladech. Shodné termíny jsou zvýrazněny zeleně.

Kvalitativní příklady, autoři tvrdí, indikují, že Flux-Kontext a Pigeon často produkovaly výstupy, které se odchýlily od vizuálních charakteristik reklam, které uživatelé dříve klikli; zatímco text generovaný Qwen3 a DeepSeek-R1 opomněl některé prodejní body přítomné v ground-truth příkladech.

Závěr

Užitečnost tohoto projektu závisí zcela na uživatelském souhlasu, a prodloužení dosahu tohoto “prediktivního” systému beyond rámec domény, která kontroluje uživatelskou historii – v tomto případě JD.com – vyžaduje ještě uvolněnější sadu výslovných uživatelských oprávnění, ve většině území.

Však, systém je založen na hyperscale síťovém efektu, který funguje v takové situaci, a na (možná slightly nadějné) myšlence, že uživatelé budou považovat tento typ skutečně personalizované a dokonce prediktivní recommender systému za užitečný spíše než intruzivní, alespoň v rámci kontextu retailového giganta “walled garden”.

 

* Tento obraz staví na znepokojivém novém trendu “kombinovaných obrázků” ve výzkumných pracích, kde ilustrace, které by dříve tvořily 3-4 samostatné obrázky, jsou kombinovány do jednoho (pro účely splnění pokynů pro odeslání na maximum délky hlavní práce) a používají se pouze jako referenční materiál, často bez dostatečného vysvětlení v doprovodné popisku.

‘m’-prefix označuje srovnání s více kandidátními texty.

Poprvé publikováno úterý, 2. června 2026. Opraveno 18:21 EET, aby se opravila konečná “wall” na “walled” v posledním odstavci.

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai