Andersons vinkel

Ny forskning föreslår riktigt “personanpassad” reklam

mm
Lägg till Unite.AI bland dina föredragna källor på Google
A woman looks at a laptop displaying a news website, reacting with surprise as a banner advertisement on the page shows a smiling woman who closely resembles her.

I en omdefiniering av “självreklam”, utvecklar en ny metod annonser på webben som är skräddarsydda för varje användares specifika historia genom att utnyttja användarens egna klick.

 

Även om annonsbyråer är angelägna om att avfärda idén att annonskanaler kan visa annonser baserat på vad man just sagt i hemmet, har den typen av “personanpassning” som visas i annonser på webbplatser och sociala medier fått uppmärksamhet under de senaste åren.

Den ideala situationen för annonsören har alltid varit att den visade annonsen ska vara en “exakt match” för tittaren. Inom ramen för allmänna reaktioner mot online-spårning och de förebyggande åtgärder som användaren kan ha vidtagit för att förhindra sådan övervakning, kan generativ AI (bortsett från farhågor kring LLM-reklam i en värld efter sökning) producera annonsbilder och texter tillräckligt snabbt för att kunna användas i realtid.

Men huvuddelen av forskningen och de flesta implementationer inom detta område har hittills baserats på sammanslagna användarstatistik, så att varje annons som genereras för en tittare skulle baseras på tittarens förmodade kohortgrupp snarare än deras unika historia.

Nu presenterar en ny forskningssamarbete mellan Kina och USA ett system för att generera annonsbilder och texter för enskilda användare genom att lära av deras tidigare klick när de är inloggade på en webbplats, och gått bortom de kohortbaserade antaganden som har styrt de flesta personanpassade reklamsforskningar hittills:

Exempel på generering av individuellt anpassade annonser. Naturligtvis kan den fulla effekten bara föreställas utan användarens historia som sammanhang. Källa - https://arxiv.org/pdf/2605.12138

Exempel på generering av individuellt anpassade annonser. Naturligtvis kan den fulla effekten bara föreställas utan användarens historia som sammanhang. Källa

Ovanligt nog undviker den nya metoden diffusionsbaserade modeller till förmån för en autoregressiv arkitektur – den primära skillnaden är att diffusionsmodeller gradvis förfinar en bild från visuellt brus, medan autoregressiva modeller genererar innehåll ett stycke i taget, och förutsäger varje nytt element baserat på allt som kom före.

För att stödja den nya generativa modellen utvecklade författarna vad de påstår är den första stora skalan av bild/text-dataset för personanpassad reklam, samt en ny mått som är utformad för att utvärdera denna specifika uppgift. I tester fann de att deras tillvägagångssätt överträffade både allmänna baseline och befintliga metoder och ramverk som för närvarande adresserar denna utmaning.

Stängd trädgård

Det är värt att notera det föreslagna omfånget av arbetet, som inte erbjuder annonsörer ett sätt att kringgå nya åtgärder mot tredjeparts-spårning, utan snarare ger en tillräckligt stor återförsäljare möjlighet att fylla en inloggad kund med annonser som direkt relaterar till den specifika personen.

Detta är inte nödvändigtvis begränsat till kunder som för närvarande bläddrar på återförsäljarens egen webbplats: beroende på den utsträckning som användaren har gett återförsäljaren möjlighet att spåra dem över andra webbplatser, kan de visas annonser i vilken webbplats som helst som deltar i annonsauktioner som återförsäljaren själv använder.

Denna typ av annonsnärvaro tenderar att vara begränsad till högvolym, högskaliga utgångar som Amazon i väst (och vi noterar att en liknande stor kinesisk återförsäljare har deltagit i det nya arbetet – se nedan), men varje liknande stor enhet (såsom en populär social medieplattform) kunde i teorin generera en liknande generativ ram.

Den nya artikeln heter Designa din annons: Personanpassad annonsbild- och textgenerering med enhetliga autoregressiva modeller, och kommer från 18 författare på Sun Yat-Sen University i Guangzhou, Northeastern University och Kinas största återförsäljare, JD.com (den senare har tillgång till kundernas historik och vanor). Koden har gjorts tillgänglig via GitHub, och relevanta kontrollpunkter har gjorts tillgängliga.

Data och metod

Datamängden som konstruerades för projektet heter Personanpassad annonsbild-text (PAd1M), och drivs av data som tillhandahålls av projektmedarbetaren JD.com. Författarna skriver:

‘Varje produkt tillhandahåller vanligtvis mer än tio kandidatbilder och texter, vilket säkerställer att de olika preferenserna kan upptäckas fullständigt. För att möjliggöra tillförlitlig preferensmodellering samlar vi in fullständiga användarklickhistorik över både bilder och texter, och filtrerar bort användare med otillräcklig aktivitet för att minska brus.

‘Detta resulterar i en datamängd på 1 145 371 användare, med 18 923 555 klickade produktbilder och texter, i genomsnitt mer än sexton multimodala beteenden per användare.’

För varje användare valdes ett tidigare klickat bild-textpar som målexempel, varefter produkten i sig isolerades från bilden med hjälp av Grounded SAM.

Säljartillhandahållna beskrivningar och säljpunkter bifogades sedan till posten, vilket skapade en datamängd där varje målannons åtföljdes av en transparent produktbild; strukturerad produktinformation; och en historik av tidigare bild- och textinteraktioner, avsedd att fånga användarens tidigare intressen och preferenser:

En användarprofil från PAd1M-datamängden, som visar en målannons tillsammans med produktinformationen som användes för att generera den, och de historiska bild- och textinteraktionerna som användes för att modellera användarens preferenser.

En användarprofil från PAd1M-datamängden, som visar en målannons tillsammans med produktinformationen som användes för att generera den, och de historiska bild- och textinteraktionerna som användes för att modellera användarens preferenser.

Den resulterande datamängden erbjuder en skala på över en miljon användare, och nästan 19 miljoner klickade bild- och textposter, med författarna som påstår att samlingen är avsevärt större än tidigare personanpassningsdatamängder.

Dessutom kombinerar datamängden, ovanligt för denna forskningsgren, både bilder och text, vilket gör det möjligt att modellera användarpreferenser över flera modaliteter, snarare än inom en enda domän.

PAd1M har också individuell preferensspårning; till skillnad från de flesta tidigare annonsdatamängder, som byggdes kring klickfrekvenser som aggregerades över stora grupper, länkar PAd1M interaktioner till specifika användare från JD.com-data.

För mått, utöver de standardvalen BLEU och ROUGE, utvecklade forskarna sin egen anpassade mätning med titeln Produktbakgrundslikhet (PBS). Baserat på den tidigare MoCo-v3-initiativet, tränades PBS på 681 123 bildpar som visar samma produkt mot olika bakgrunder, vilket gör att måttet kan fokusera på kontextuell variation snarare än produkten i sig:

Produktbakgrundslikhet (PBS) tilldelar tydligt olika likhetspoäng till annonser som innehåller samma produkt men placerar den i olika visuella sammanhang, till skillnad från jämförbara mått, som producerar mycket mindre separationer.

Produktbakgrundslikhet (PBS) tilldelar tydligt olika likhetspoäng till annonser som innehåller samma produkt, men placerar den i olika visuella sammanhang. Omvänt producerar jämförbara mått mycket mindre separationer.

Under träning parades varje bild med sig själv som ett positivt exempel, medan en bild av samma produkt placerad i en annan miljö fungerade som ett negativt exempel, en träningsstrategi avsedd att öka känsligheten för bakgrundscontext. Utvärderingsresultat, hävdar artikeln, indikerar större likhets skillnader mellan matchande och icke-matchande bakgrunder än de som produceras av CLIP, DINO v3 eller den ovannämnda MoCov3.

Som visas i den övre vänstra delen av bilden nedan* använder forskarnas Enhetlig annonsgenereringsmodell (Uni-AdGen) en autoregressiv vision-språksarkitektur för att generera både annonsbilder och text. Processen styrs av en strukturerad instruktion som innehåller uppgiftsdefinitionen, en produktbeskrivning, samt säljpunkter:

Metodöversikt.

Metodöversikt.

Särskilda avgränsningstoken definierar den del av sekvensen som är reserverad för annonskopior. Efter att texten har genererats utlöser en dedikerad bildtoken bildgenerering, medan en avslutande bildtoken markerar dess slutförande, och de genererade token skickas sedan till separata text- och bilddekodare.

För bilder används LlamaGen’s VQ-GAN-dekodare för att omvandla diskreta bildtoken tillbaka till pixlar.

På detta sätt genererar den enhetliga arkitekturen text och bilder inom ett enda nästa token-förutsägelse-ramverk, snarare än att förlita sig på separata pipelines – den metod som antagits för tidigare annonsystem med en liknande ambition.

Under träning lär sig modellen båda modaliteterna tillsammans, med texttoken förutsagda baserat på inmatningssekvensen och tidigare genererad text. Bildtoken förutsägs sedan med hjälp av inmatningssekvensen, den genererade texten och tidigare genererade bildtoken.

För att hålla de genererade annonserna knutna till den marknadsförda produkten använder Uni-AdGen en foreground-perception-modul baserad på DINO v2, för att injicera information från transparenta produktbilder i den autoregressiva modellen.

Instruktionsjustering (träning av modellen att följa produktspecifika generationsinstruktioner som hämtats från beskrivningar och säljpunkter) användes också för att förbättra överensstämmelsen med säljartillhandahållna beskrivningar och säljpunkter, med GPT-4o som användes för att filtrera bort olämpliga träningsexempel.

Personanpassning byggde på en grovtillfin-modul för preferensförståelse. Historiska interaktioner filtrerades först genom en Produktlikhetssampling (PSS)-pipeline för att föredra produkter som liknade målartikeln. De återstående posterna bearbetades sedan av en Multimodal Preferensutvinning-stadium, utformat för att identifiera de visuella och textuella element som mest sannolikt återspeglar användarens intressen – och dessa preferenser infogades i prompten för att styra generationen.

Tester

Författarna påstår att deras testtillvägagångssätt är hämtat från DeepSeek’s Janus-Pro 7B.

Modellen tränades med en batchstorlek på fyra, under AdamW-optimeraren vid en inlärningshastighet på 5e-5. Den grundläggande modellen finjusterades via LoRA, med fullständig finjustering (dvs. till skillnad från LoRA, ändrades de grundläggande modellvikterna permanent).

Alla tester kördes på en NVIDIA B200 GPU med 192 GB VRAM. För bildgenerering användes PickScore, ImageReward och ASE för att mäta visuell kvalitet, medan m-BLEU och m-ROUGE användes för att utvärdera annons-text. Mänskliga utvärderare bedömde också bildrealism och layoutkvalitet, samt textuell noggrannhet och flyt, med alla mått beräknade över 500 produkter.

För bildgenerering bestod baslinjerna av Qwen2.5-VL och GPT-4o för att skapa bakgrundsfraser från produktbilder, följt av ReliableAd, PosterMaker och Flux-Fill för att generera de slutliga annonserna. Textgenereringsjämförelser utfördes mot Qwen2.5, Qwen3 och DeepSeek-R1.

Initiala baseline-kvantitativa resultat för annonsgenerering visas nedan:

Prestanda på den allmänna annons-genereringsbaslinjen. Uni-AdGen matchade eller överträffade de starkaste bildgenereringsbaslinjerna på estetisk kvalitet och PickScore, medan den enhetliga bild- och textmodellen uppnådde den högsta m-ROUGE-poängen bland alla textgenereringsmetoder. Mänskliga utvärderingsresultat förblev konkurrenskraftiga över båda modaliteterna.

Prestanda på den allmänna annons-genereringsbaslinjen. Uni-AdGen matchade eller överträffade de starkaste bildgenereringsbaslinjerna på estetisk kvalitet och PickScore, medan den enhetliga bild- och textmodellen uppnådde den högsta m-ROUGE-poängen bland alla textgenereringsmetoder. Mänskliga utvärderingsresultat förblev konkurrenskraftiga över båda modaliteterna.

Av dessa resultat skriver författarna:

‘Vår metod uppnår den bästa prestandan i ImageReward och rankas som nummer två i både PickScore och mänsklig utvärdering, vilket visar dess överlägsna prestanda i estetisk och tillgänglig hastighet. Medan ReliableAd leder i mänsklig utvärdering, ligger den efter i estetiska mått. Omvänt genererar PosterMaker och Flux-Fill visuellt tilltalande bilder, men lider av märkbara begränsningar i användbarhet.

‘Tack vare effektiva kontrollmetoder uppnår vår metod framgångsrikt en optimal balans mellan visuellt innehåll och praktisk användbarhet.’

Personanpassad annonsgenerering utvärderades på 500 användare med registrerad interaktionshistorik, med användning av den ovannämnda PBS för att mäta bildlikhet, och BLEU och ROUGE för att jämföra genererad text med produkter som användarna faktiskt klickade på.

Eftersom de allmänna annonsbaslinjerna som användes i den tidigare experimenten inte kunde inkorporera användarhistorik, skiftades jämförelserna till system som var utformade för personanpassning. För bildgenerering valdes Flux-Kontext och Pigeon som baslinjer. Flux-Kontext tillhandahölls med en rutnät av historiska användarbilder bredvid målproduktbilden, vilket tillät tidigare preferenser att påverka generationen.

Eftersom Pigeon inte stöder kontrollerad produktplacering som standard, integrerades den foreground-perception-modul som utvecklats för Uni-AdGen för att bevara produktkonsistens. För textgenerering användes Qwen3 och DeepSeek-R1, med historiska produktbeskrivningar infogade direkt i deras instruktionsmallar för att ge användarspecifik kontext:

Personanpassad annons-genereringsresultat. Uni-AdGen överträffade Flux-Kontext, Pigeon, Qwen3 och DeepSeek-R1 över alla rapporterade personanpassningsmått, medan avlägsningsstudien indikerade att historiska användardata, Produktlikhetssampling (PSS) och multimodal preferensutvinning alla bidrog med mätbara vinster.

Personanpassad annons-genereringsresultat. Uni-AdGen överträffade Flux-Kontext, Pigeon, Qwen3 och DeepSeek-R1 över alla rapporterade personanpassningsmått, medan avlägsningsstudien indikerade att historiska användardata, Produktlikhetssampling (PSS) och multimodal preferensutvinning alla bidrog med mätbara vinster.

Här kommenterar författarna:

‘De visualiserade resultaten [inkluderade i bilden nedan] visar att Flux-Kontext misslyckas med att förstå användarpreferenser och förblir känslig för sampel-nivåbrus, vilket resulterar i betydande avvikelse från grundvärdet, såsom irrelevanta artiklar i motorcykelbilden.’

Exempel på personanpassad annons-generering. Jämfört med Flux-Kontext, Pigeon, Qwen3 och DeepSeek-R1 producerade Uni-AdGen bilder som mer nära matchade den visuella stilen och sammanhanget i annonser som användare faktiskt klickade på, samtidigt som de genererade text som fångade en större andel av produktattribut och säljpunkter som fanns i grundvärdet. Överensstämmande termer är markerade i grönt.

Exempel på personanpassad annons-generering. Jämfört med Flux-Kontext, Pigeon, Qwen3 och DeepSeek-R1 producerade Uni-AdGen bilder som mer nära matchade den visuella stilen och sammanhanget i annonser som användare faktiskt klickade på, samtidigt som de genererade text som fångade en större andel av produktattribut och säljpunkter som fanns i grundvärdet. Överensstämmande termer är markerade i grönt.

De kvalitativa exemplen, hävdar författarna, indikerar att Flux-Kontext och Pigeon ofta producerade utgång som avvek från de visuella egenskaperna hos annonser som användare tidigare klickat på; medan text genererad av Qwen3 och DeepSeek-R1 utelämnade vissa säljpunkter som fanns i grundvärdet.

Slutsats

Användbarheten av detta projekt beror helt på användar-samtycke, och att utöka räckvidden för detta “prediktiva” system bortom den domän som kontrollerar användarhistoriken – i detta fall JD.com – kräver en ännu mer avslappnad uppsättning uttryckliga användar-tillstånd, i de flesta territorier.

Men systemet bygger på den typen av hyperskale-nätverkseffekt som är i bruk i en sådan situation, och på idén (kanske lite förhoppningsfullt) att användare kommer att finna detta slags riktigt personanpassade och till och med profetiska rekommendationssystem användbart snarare än intrångsamt, åtminstone inom ramen för en detaljhandelsjättes “stängda trädgård”.

 

* Denna bild bygger på den oroande nya trenden av “samlade figurer” i forskningsartiklar, där illustrationer som tidigare skulle ha varit 3-4 olika figurer nu kombineras till en (i syfte att följa inlämningsriktlinjer om den maximala längden på huvudartikeln) och används enbart som referensmaterial, ofta utan tillräcklig förklaring i den åtföljande bildtexten.

‘m’-prefix indikerar jämförelse med flera kandidattexter.

Publicerad första gången tisdagen den 2 juni 2026. Ändrad 18:21 EET för att korrigera den sista “väggen” till “stängd trädgård” i den sista meningen.

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai