Andersons vinkel
Ny forskning foreslår virkelig ’tilpasset’ reklame

I en gjendefinering av ‘selvpromotering’, presenterer en ny metode en måte å mine en brukers egne klikk for å lage skreddersydd nettannonser basert på deres egen unike historie.
Selv om reklamebyråer er ivrig etter å avvise ideen om at reklamekanaler kan servere annonser basert på hva du nettopp sa i komforten av ditt hjem, har likevel omfattende overskrifter i løpet av de siste årene.
Den ideelle situasjonen for annonsøren har alltid vært at annonsen som serveres er en ‘nøyaktig passform’ for seeren. Innenfor grensene av offentlig motstand mot online-sporing, og hva som helst forebyggende tiltak brukeren måtte ha installert mot en slik overvåking, er generativ AI (bortsett fra frykten rundt LLM-reklame i en post-søkeverden) fullt kapabel til å produsere annonsbilder og tekst raskt nok for å kunne brukes i sanntid.
Likevel har hovedvekten av forskning og de fleste implementeringer i denne retningen hittil vært basert på sammenslåtte bruksstatistikk, slik at enhver annons som genereres for en seer ville være basert på seerens antatte kohortgruppe snarere enn deres egen unike historie.
Nå presenterer en ny forskningssamarbeid mellom Kina og USA et system for å generere annonsbilder og tekst for enkelte brukere ved å lære fra deres egne tidligere klikk når de er logget inn på en nettside, og gått bort fra kohortbaserte antagelser som har styrt de fleste tilpassede reklameforskning hittil:

Eksempler på genereringer som viser individuelt tilpassede annonser. Selvfølgelig kan full effekt bare forestilles uten brukerens historie som kontekst. Kilde
Uvanligvis forkaster den nye tilnærmingen difusjonsbaserte modeller til fordel for en autoregressiv arkitektur – hvor hovedforskjellen er at difusjonsmodeller gradvis forbedrer et bilde fra visuelt støy, mens autoregressive modeller genererer innhold ett stykke av gangen, og forutsier hvert nytt element fra alt som kom før.
For å støtte den nye generative modellen, utviklet forfatterne hva de hevder er den første storstilte bilde- og tekstdataset for tilpasset reklame, samt en ny målemetode designet for å evaluere denne svært spesifikke oppgaven. I tester fant de at deres tilnærming overgikk både generelle standarder og eksisterende metoder og rammer som nå håndterer denne utfordringen.
Walled Garden
Det er verdt å merke seg den foreslåtte omfanget av arbeidet, som ikke tilbyr annonsører en måte å unngå nye tiltak mot tredjeparts-sporing, men heller gir en tilstrekkelig stor forhandler muligheten til å populere en logg inn-kunde med annonser som direkte relaterer til den enkelte personen.
Dette er ikke nødvendigvis begrenset til klienter som for øyeblikket surfer på forhandlerens egen nettside: Avhengig av omfanget av hvilken brukeren har gitt forhandleren tillatelse til å spore dem på andre nettsider, kan de bli presentert med målrettede annonser på en rekke andre nettsider som deltar i annonsauksjoner som forhandleren selv bruker.
Dette type annonsereffekt tenderer å være begrenset til høyvolum, stor-skala utgangspunkter som Amazon, i vesten (og vi merker at en analogt størrelse kinesisk forhandler har deltatt i det nye arbeidet – se under), selv om noen lignende størrelse (såsom en populær sosial medieplattform) i teorien kunne generere en lignende generativ ramme.
Den nye artikkelen har tittelen Design Your Ad: Tilpasset reklame bilde- og tekstgenerering med Unified Autoregressive Models, og kommer fra 18 forfattere over Sun Yat-Sen University i Guangzhou, Northeastern University, og Kinas største forhandler, JD.com (den sistnevnte har den verdifulle tilgangen til kjøpernes historier og vaner). Koden er gjort tilgjengelig via GitHub, og de relevante kontrollpunktene er gjort tilgjengelige også.
Data og Metode
Datasettet som er konstruert for prosjektet, har tittelen Tilpasset reklame bilde- og tekst (PAd1M), og er drevet av data levert av prosjektbidragsyter JD.com. Forfatterne sier:
‘Hver produkt tilbyr vanligvis mer enn ti kandidatbilder og tekst, og sikrer at de forskjellige preferansene kan fullt ut avdekkes. For å aktivere pålitelig preferansemodellering, samler vi inn fullstendige bruker-klikkhistorier over både bilder og tekst, og filtrerer ut brukere med utilstrekkelig aktivitet for å redusere støy.
‘Dette resulterer i et datasett på 1 145 371 brukere, med 18 923 555 klikkede produktbilder og tekst, og en gjennomsnittlig mer enn seksten multimodale historiske atferder per bruker.’
For hver bruker ble ett tidligere klikket bilde- og tekstpar valgt som mål, etterfulgt av at produktet selv ble isolert fra bildet ved hjelp av Grounded SAM.
Selger-leverte beskrivelser og salgsargumenter ble deretter festet til rekorden, og skapte et datasett hvor hver målannonce ble akkompagnert av et gjennomsiktig produktbilde; strukturert produktinformasjon; og en historie av tidligere bilde- og tekstinteraksjoner, ment å fange brukerens tidligere interesser og preferanser:

En brukerprofil fra PAd1M-datasettet, som viser en målannonce sammen med produktinformasjonen som ble brukt til å generere den, og de historiske bilde- og tekstinteraksjonene som ble brukt til å modellere brukerens preferanser.
Det resulterende datasettet tilbyr en skala på over en million brukere, og nesten 19 millioner klikkede bilde- og tekstrekorder, og forfatterne sier at samlingen er vesentlig større enn tidligere tilpassede datasett.
I tillegg kombinerer data, uvanlig for denne type forskning, både bilder og tekst, og lar brukerpreferanser bli modellert på tvers av flere modi, snarere enn innenfor en enkelt domene.
PAd1M har også individuell preferanse-sporing; i motsetning til de fleste tidligere reklamedatasett, som var bygget rundt klikk-rater aggregert over store grupper, kobler PAd1M interaksjoner til spesifikke brukere fra JD.com-data.
For målemetoder, foruten de standard valgene av BLEU og ROUGE, har forskerne utviklet sin egen målemetode kalt Produkt Bakgrunn Likhet (PBS). Basert på den tidligere MoCo-v3-initiativet, ble PBS trent på 681 123 bildepar som viste samme produkt mot forskjellige bakgrunner, og lar målemetoden fokusere på kontekstuell variasjon snarere enn produktet selv:

Produkt Bakgrunn Likhet (PBS) tildeler merkbart forskjellige likhetspoeng til annonser som inneholder samme produkt, men plasserer det i forskjellige visuelle kontekster. I motsetning til konkurranse-målemetoder, produserer disse mye mindre separasjoner.
Under trening, ble hvert bilde parret med seg selv som et positivt eksempel, mens et bilde av samme produkt plassert i en forskjellig setting fungerte som et negativt eksempel, en treningsstrategi ment å øke sensitiviteten til bakgrunnskontekst. Evalueringresultatene, hevder artikkelen, indikerer større likhetsforskjeller mellom sammenfallende og ikke-sammenfallende bakgrunner enn de som produseres av CLIP, DINO v3, eller den ovennevnte MoCov3.
Som vist i øvre-venstre del av bildet nedenfor*, bruker forskernes Unified Advertisement Generative (Uni-AdGen) modell en autoregressiv visuelt-språklig arkitektur for å generere både annons-tekst og bilder. Prosessen styres av en strukturert instruksjon som inkluderer oppgave-definisjonen, og en produktbeskrivelse, samt nøkkel-salgsargumenter:

Metodeoversikt.
Spesielle avgrensningstoken definerer den delen av sekvensen som er reservert for annons-tekst. Etter at teksten er generert, utløser en dedikert bilde-token bilde-generering, mens en lukket bilde-token markerer dens fullføring, og de genererte tokene sendes deretter til separate tekst- og bilde-dekodere.
For bilder, brukes LlamaGen’s VQ-GAN-dekoder for å konvertere diskrete bilde-token tilbake til piksler.
På denne måten genererer den unifiede arkitekturen tekst og bilder innenfor en enkelt neste-token-prediksjonsramme, snarere enn å stole på separate rørledninger – metoden som ble brukt for tidligere reklamesystemer med en lignende omfang.
Under trening, lærer modellen begge modi sammen, med tekst-token forutsagt basert på inndata-sekvensen og tidligere generert tekst. Bilde-token blir deretter forutsagt ved hjelp av inndata-sekvensen, den genererte teksten og tidligere genererte bilde-token.
For å holde genererte annonser knyttet til det promerte produktet, bruker Uni-AdGen en forgrunns-persepsjonsmodul basert på DINO v2, for å injisere informasjon fra gjennomsiktige produktbilder inn i den autoregressive modellen.
Instruksjonstuning (trening av modellen for å følge produkt-spesifikke genererings-instruksjoner avledet fra beskrivelser og salgsargumenter) ble også brukt for å forbedre overholdelse av selger-leverte beskrivelser og salgsargumenter, med GPT-4o brukt til å filtrere ut ubrukelige treningseksempler.
Tilpassing ble basert på en grovt-til-fint preferanse-forståelsesmodul. Historiske interaksjoner ble først filtrert gjennom en Produkt Likhet-prøving (PSS) pipeline for å favorisere produkter som ligner målproduktet. De gjenværende rekordene ble deretter behandlet av en Multimodal Preferanse-utvinning fase designet for å identifisere de visuelle og tekstuelle elementene som mest sannsynlig ville reflektere brukerens interesser – og disse preferansene ble deretter injisert i prompten for å guide generering.
Tester
Forfatterne sier at deres testtilnærming er avledet fra DeepSeek’s Janus-Pro 7B.
Modellen ble trent med en batch-størrelse på fire, under AdamW-optimalisatoren med en læringsrate på 5e-5. Grunnmodellen ble finjustert via LoRA, med forgrunns-persepsjon og multimodal preferanse-utvinning fullstendig finjustert (dvs. til forskjell fra LoRA, ble grunnmodell-vektene permanent endret).
Alle tester ble kjørt på en NVIDIA B200 GPU med 192GB VRAM. For bilde-generering, ble PickScore, ImageReward, og ASE brukt til å måle visuell kvalitet, mens m-BLEU og m-ROUGE† ble brukt til å evaluere annons-tekst. Menneskelige evaluatoren vurderer også bilde-realisme og layout-kvalitet, samt tekstuell nøyaktighet og flyt, med alle målemetoder beregnet over 500 produkter.
For bilde-generering, bestod standardene av Qwen2.5-VL og GPT-4o for å lage bakgrunnsprompter fra produktbilder, etterfulgt av ReliableAd, PosterMaker, og Flux-Fill for å generere de endelige annonser. Tekst-genererings-sammenligninger ble gjort mot Qwen2.5, Qwen3, og DeepSeek-R1.
Initielle standard-kvantitative resultater for annons-generering vises nedenfor:

Ytelse på den generelle annons-genererings-standard. Uni-AdGen matchet eller overgikk de sterkeste bilde-genererings-standardene på estetisk kvalitet og PickScore, mens den unifiede bilde- og tekst-modellen oppnådde den høyeste m-ROUGE-poengsummen blant alle tekst-genererings-tilnærminger. Menneskelig evaluering-resultater forble konkurransedyktige over begge modi.
Av disse resultater sier forfatterne:
‘[Vår] metode oppnår den beste ytelsen i ImageReward og rangerer som nummer to i både PickScore og menneskelig evaluering, og demonstrerer sin overlegne ytelse i estetisk og høy tilgjengelighet. Mens ReliableAd leder i menneskelig evaluering, ligger det betraktelig etter i estetiske målemetoder. Omvendt genererer PosterMaker og Flux-Fill visuelt tiltalende bilder, men lider under merkbare bruksbegrensninger.
‘Takket være effektive kontroll-tilnærminger, oppnår vår metode en optimal balanse mellom visuell innhold og praktisk nytte.’
Tilpasset annons-generering ble evaluert på 500 brukere med registrerte interaksjons-historier, ved hjelp av ovennevnte PBS for å måle bilde-lignhet, og BLEU og ROUGE for å sammenligne generert tekst mot produkter brukerne faktisk klikket.
Fordi de generelle annons-standardene som ble brukt i det foregående eksperimentet ikke kunne inkorporere bruker-historier, ble sammenligningene flyttet til systemer designet for tilpasning. For bilde-generering, ble Flux-Kontext og Pigeon valgt som standarder. Flux-Kontext ble levert med en grid av historiske bruker-bilder sammen med målprodukt-bildet, og tillot tidligere preferanser å påvirke generering.
Ettersom Pigeon ikke naturlig støtter kontrollert produkt-plassering, ble forgrunns-persepsjonsmodulen utviklet for Uni-AdGen integrert for å bevare produkt-konsistens. For tekst-generering, ble Qwen3 og DeepSeek-R1 brukt, med historiske produkt-beskrivelser injisert direkte i deres instruksjons-maler for å gi bruker-spesifik kontekst:

Tilpasset annons-genererings-resultater. Uni-AdGen overgikk Flux-Kontext, Pigeon, Qwen3, og DeepSeek-R1 over alle rapporterte tilpasnings-målemetoder, mens ablasjons-studien indikerte at historiske bruker-data, Produkt Likhet-prøving (PSS), og multimodal preferanse-utvinning hver bidro med målbare gevinster.
Her kommenterer forfatterne:
‘De visualiserte resultater [inkludert i bildet nedenfor] viser at Flux-Kontext mislykkes i å forstå bruker-preferanser og forblir sårbare for støy på prøve-nivå, resulterer i betydelig avvik fra grunn-sannhet, som de irrelevante elementene i motorsykkel-bildet.’

Eksempler på tilpasset annons-generering. I sammenligning med Flux-Kontext, Pigeon, Qwen3, og DeepSeek-R1, produserte Uni-AdGen bilder som bedre matchet den visuelle stilen og konteksten av annonser brukerne faktisk klikket, mens generert tekst fanget en større proporsjon av produkt-egenskaper og salgsargumenter til stede i grunn-sannhets-eksemplene. Matchende termer er høydet i grønt.
De kvalitative eksemplene, hevder forfatterne, indikerer at Flux-Kontext og Pigeon ofte produserte utgaver som avvek fra de visuelle egenskapene til annonser som brukerne tidligere hadde klikket; i mellomtiden, tekst generert av Qwen3 og DeepSeek-R1 utelot noen salgsargumenter til stede i grunn-sannhets-eksemplene.
Konklusjon
Nyttien av dette prosjektet avhenger fullstendig av bruker-samtykke, og å utvide rekkevidden av dette ‘predictive’ systemet utenfor omfanget av domenet som kontrollerer bruker-historien – i dette tilfellet, JD.com – krever en enda mer avslappet sett med eksplisitte bruker-tillatelser, i de fleste territorier.
Likevel er systemet basert på den type hyperskala nettverks-effekt som er i virksomhet i en slik situasjon, og på ideen (kanskje litt optimistisk) om at brukerne vil finne dette type virkelig tilpassede og til og med profetiske anbefalinger nyttig snarere enn intrusivt, innenfor konteksten av en detaljhandels-gigantens inngjerdet hage.
* Dette bildet bygger på den bekymringsverdige nye trenden av ‘sammenslåtte figurer’ i forskningsartikler, hvor illustrasjoner som tidligere ville ha vært 3-4 separate figurer, nå samles inn i én (for å følge innsendings-retningslinjene for maksimal lengde på hovedartikkelen) og brukes som referansemateriale, ofte uten tilstrekkelig forklaring i den tilhørende underteksten.
† ‘m’-prefiks indikerer sammenligning med flere kandidat-tekster.
Først publisert tirsdag, 2. juni 2026. Endret 18:21 EET for å korrigere slutten ‘vegg’ til ‘inngjerdet’ i siste avsnitt.












