Unghiul lui Anderson
O nouă cercetare propune publicitate cu adevărat “personalizată”

Într-o redefinire a “autopromovării”, o nouă metodă extrage informații din click-urile unui utilizator pentru a crea reclame web personalizate pe baza istoricului său.
Deși agențiile de publicitate sunt încântate să demonteze ideea că există canale de publicitate care pot afișa reclame bazate pe ceea ce ai discutat recent în confortul casei tale, nivelul de “personalizare” demonstrat de reclamele de pe site-urile web și aplicațiile de social media a atras atenția mass-mediei în ultimii ani.
Scenariul ideal pentru un anunțător a fost întotdeauna ca reclama afișată să fie un “fit exact” pentru vizualizator. În limitele reacției publice împotriva urmăririi online și a măsurilor de prevenire pe care utilizatorul le-ar fi putut instala împotriva unei astfel de monitorizări, inteligența artificială generativă (lăsând deoparte temerile legate de publicitatea LLM într-o lume post-căutare) este capabilă să producă imagini și texte de reclame suficient de rapid pentru a fi utilizate în timp real.
În orice caz, principala direcție a cercetării și a majorității implementărilor în acest domeniu până în prezent s-a axat pe statisticile agregate de utilizare, astfel încât orice reclamă generată pentru un vizualizator ar fi bazată pe grupul de cohorte presupus al vizualizatorului, mai degrabă decât pe istoricul său unic.
Acum, o nouă colaborare de cercetare între China și Statele Unite prezintă un sistem pentru generarea de imagini și texte de reclame pentru utilizatori individuali prin învățarea din click-urile lor trecute atunci când sunt conectați la un site, mergând dincolo de ipotezele bazate pe cohorte care au guvernat majoritatea cercetărilor de publicitate personalizată până în prezent:

Exemple de generații care prezintă reclame personalizate. Desigur, fără contextul istoric al utilizatorului, impactul complet poate fi doar imaginat. Sursă
În mod neobișnuit, noua abordare evită modelele bazate pe difuzie în favoarea unei arhitecturi autoregresive – principala diferență fiind că modelele de difuzie rafinează gradual o imagine din zgomot vizual, în timp ce modelele autoregresive generează conținut într-o singură bucată, prevăzând fiecare element nou din tot ceea ce a precedat.
Pentru a sprijini noul model generativ, autorii au dezvoltat ceea ce susțin a fi primul set de date de imagine/text la scară largă pentru publicitate personalizată, precum și o metrică nouă proiectată pentru a evalua această sarcină specifică. În testele efectuate, ei au constatat că abordarea lor a depășit atât liniile de bază generale, cât și metodele și cadrele existente care abordează această provocare.
Grădină închisă
Este demn de remarcat scopul propus al lucrării, care nu oferă anunțătorilor o modalitate de a ocoli noile măsuri împotriva urmăririi de către terți, ci mai degrabă oferă un retailer suficient de mare puterea de a popula un client conectat cu reclame care se referă direct la acea persoană.
Aceasta nu este neapărat limitată la clienții care navighează în prezent pe site-ul retailerului: în funcție de nivelul la care utilizatorul a acordat retailerului puterea de a-l urmări pe alte site-uri, el ar putea fi prezentat cu reclame țintite pe orice site web care participă la licitațiile de publicitate pe care le folosește retailerul.
Acest tip de publicitate are tendința de a fi limitat la magazine de mare volum, cum ar fi Amazon, în vest (și notăm că un retailer chinez de dimensiuni analoge a participat la noua lucrare – a se vedea mai jos), deși orice preocupare similară (cum ar fi o platformă de social media populară) ar putea, în teorie, să genereze un cadru generativ similar.
Noul articol se intitulează Proiectați-vă reclama: Generare de imagini și texte de publicitate personalizate cu modele autoregresive unificate și provine de la 18 autori de la Universitatea Sun Yat-Sen din Guangzhou, Universitatea Northeastern și cel mai mare retailer din China, JD.com (ultimul având acces la istoricul și obiceiurile cumpărătorilor). Codul a fost făcut disponibil prin GitHub, iar punctele de control au fost făcute disponibile și ele.
Date și Metodă
Setul de date construit pentru proiect se numește Imagine-text de publicitate personalizată (PAd1M) și este alimentat de date furnizate de contributorul proiectului JD.com. Autorii afirmă:
‘Fiecare produs oferă de obicei mai mult de zece imagini și texte candidate, asigurând că preferințele diverse pot fi detectate pe deplin. Pentru a permite modelarea preferințelor de încredere, colectăm istoricul complet al click-urilor de utilizator pe imagini și texte, filtrând utilizatorii cu activitate insuficientă pentru a reduce zgomotul.’
‘Acest lucru ne oferă un set de date de 1.145.371 de utilizatori, cu 18.923.555 de imagini de produse și texte click-ate, în medie mai mult de șaisprezece comportamente multimodale istorice pe utilizator.’
Pentru fiecare utilizator, s-a selectat o pereche de imagine-text click-ată anterior ca exemplu țintă, după care produsul în sine a fost izolat din imagine folosind Grounded SAM.
Descrierile și punctele de vânzare furnizate de vânzător au fost apoi atașate la înregistrare, creând un set de date în care fiecare reclamă țintă este însoțită de o imagine de produs transparentă; informații structurate despre produs; și un istoric de interacțiuni anterioare cu imagini și texte, menit să capteze interesele și preferințele anterioare ale utilizatorului:

Un profil de utilizator din setul de date PAd1M, care prezintă o reclamă țintă lângă informațiile despre produs utilizate pentru a o genera, și interacțiunile istorice cu imagini și texte utilizate pentru a modela preferințele utilizatorului.
Setul de date rezultat oferă o scară de peste un milion de utilizatori și aproape 19 milioane de înregistrări de imagini și texte click-ate, autorii afirmând că colecția este substanțial mai mare decât seturile de date de personalizare anterioare.
În plus, datele, în mod neobișnuit pentru acest tip de cercetare, combină atât imagini, cât și texte, permițând modelarea preferințelor utilizatorilor pe multiple modalități, mai degrabă decât într-un singur domeniu.
PAd1M prezintă, de asemenea, urmărirea preferințelor la nivel individual; în contrast cu seturile de date de publicitate anterioare, care au fost construite în jurul ratelor de click agregate pe grupuri mari, PAd1M leagă interacțiunile de utilizatori specifici din datele JD.com.
Pentru metrici, pe lângă alegerile standard de BLEU și ROUGE, cercetătorii au dezvoltat propria măsurătoare personalizată numită Asemănare a fundalului produsului (PBS). Bazat pe inițiativa MoCo-v3 anterioară, PBS a fost antrenat pe 681.123 de perechi de imagini care prezintă același produs pe fundaluri diferite, permițând metricii să se concentreze pe variația contextuală în loc de produsul în sine:

Asemănare a fundalului produsului (PBS) atribuie scoruri de asemănare marcat diferite pentru reclame care conțin același produs, dar îl plasează în contexte vizuale diferite. În schimb, metricile concurente produc separări mult mai mici.
În timpul antrenamentului, fiecare imagine a fost pereche cu ea însăși ca exemplu pozitiv, în timp ce o imagine a aceluiași produs plasat într-un context diferit a servit ca exemplu negativ, o strategie de antrenament menită să crească sensibilitatea la contextul fundal.
Rezultatele evaluării, articolul susține, indică diferențe de asemănare mai mari între fundaluri care se potrivesc și cele care nu se potrivesc decât cele produse de CLIP, DINO v3 sau menționatul MoCov3.
În timp ce reglarea instrucțiunilor (antrenarea modelului pentru a urma instrucțiuni de generare specifice produsului derivate din descrieri și puncte de vânzare) a fost utilizată pentru a îmbunătăți aderarea la descrierile și punctele de vânzare furnizate de vânzător, GPT-4o a fost utilizat pentru a filtra exemplele de antrenament inadecvate.
Personalizarea s-a bazat pe un modul de înțelegere a preferințelor de la gros la fin. Interacțiunile istorice au fost filtrate mai întâi printr-un flux de eșantionare a similarității produsului pentru a favoriza produse asemănătoare cu articolul țintă. Înregistrările rămase au fost apoi procesate de o etapă de extragere a preferințelor multimodale concepută pentru a identifica elementele vizuale și textuale care reflectă cel mai probabil interesele utilizatorului – aceste preferințe fiind inserate în prompt, pentru a ghida generarea.
Teste
Autorii afirmă că abordarea lor de testare se bazează pe Janus-Pro 7B de la DeepSeek.
Modelul a fost antrenat la o dimensiune a lotului de patru, sub optimizatorul AdamW la o rată de învățare de 5e-5. Modelul de bază a fost perfecționat prin LoRA, cu percepția fundalului și extragerea preferințelor multimodale pe deplin perfecționate (adică, spre deosebire de LoRA, greutățile modelului de bază au fost alterate permanent).
Toate testele au fost efectuate pe un GPU NVIDIA B200 cu 192 GB de VRAM. Pentru generarea de imagini, PickScore, ImageReward și ASE au fost utilizate pentru a măsura calitatea vizuală, în timp ce m-BLEU și m-ROUGE† au fost utilizate pentru a evalua textul de reclamă. Evaluatorii umani au evaluat, de asemenea, realismul și calitatea layout-ului imaginilor, precum și acuratețea și fluența textului, toate metricile fiind calculate pe 500 de produse.
Pentru generarea de imagini, liniile de bază au constat din Qwen2.5-VL și GPT-4o pentru crearea de prompturi de fundal din imagini de produse, urmată de ReliableAd, PosterMaker și Flux-Fill pentru generarea de reclame finale. Comparările de generare de texte au fost efectuate împotriva Qwen2.5, Qwen3 și DeepSeek-R1.
Rezultatele inițiale ale liniilor de bază cantitative pentru generarea de reclame sunt prezentate mai jos:

Performanță pe banchiza generală de generare de reclame. Uni-AdGen a egalat sau a depășit liniile de bază puternice de generare de imagini în ceea ce privește calitatea estetică și PickScore, în timp ce modelul unificat de imagine și text a obținut cel mai mare scor m-ROUGE printre toate abordările de generare de texte. Rezultatele evaluării umane au rămas competitive pe ambele modalități.
Dintre aceste rezultate, autorii afirmă:
‘Metoda noastră obține cea mai bună performanță în ImageReward și se clasează pe locul doi atât în PickScore, cât și în evaluarea umană, demonstrând performanța sa superioară în ceea ce privește estetica și rata de disponibilitate ridicată. În timp ce ReliableAd conduce la evaluarea umană, el se află în urmă în metricile estetice. În schimb, PosterMaker și Flux-Fill generează imagini atractive din punct de vedere vizual, dar suferă de limitări evidente de utilizare.’
‘Datorită abordărilor noastre eficiente de control, metoda noastră reușește să atingă un echilibru optim între conținutul vizual și utilitatea practică.’
Generarea de reclame personalizate a fost evaluată pe 500 de utilizatori cu istoricuri de interacțiune înregistrate, utilizând PBS pentru a măsura asemănarea imaginilor și BLEU și ROUGE pentru a compara textul generat cu produsele pe care utilizatorii le-au click-at în realitate.
Deoarece liniile de bază generale de publicitate utilizate în experimentul anterior nu au putut încorpora istoricul utilizatorilor, comparările au fost mutate către sisteme proiectate pentru personalizare. Pentru generarea de imagini, Flux-Kontext și Pigeon au fost selectate ca linii de bază. Flux-Kontext a fost alimentat cu o grilă de imagini istorice ale utilizatorului lângă imaginea produsului țintă, permițând preferințelor anterioare să influențeze generarea.
Deoarece Pigeon nu suportă în mod nativ plasarea controlată a produsului, modulul de percepție a fundalului dezvoltat pentru Uni-AdGen a fost integrat pentru a păstra consistența produsului.
Pentru generarea de texte, Qwen3 și DeepSeek-R1 au fost utilizate, cu descrieri istorice de produse inserate direct în șabloanele de instrucțiune pentru a oferi contextul specific utilizatorului:

Rezultatele generării de reclame personalizate. Uni-AdGen a depășit Flux-Kontext, Pigeon, Qwen3 și DeepSeek-R1 în toate metricile de personalizare raportate, în timp ce studiul de ablație a indicat că datele istorice ale utilizatorilor, eșantionarea similarității produsului și extragerea preferințelor multimodale au contribuit cu câștiguri măsurabile.
Aici autorii comentează:
‘Rezultatele vizualizate (inclusiv imaginea de mai jos) arată că Flux-Kontext nu reușește să înțeleagă preferințele utilizatorilor și rămâne susceptibil la zgomotul de nivel de eșantion, ceea ce duce la o abatere semnificativă de la adevărul real, cum ar fi articolele irelevante din imaginea motocicletei.’

Exemple de generare de reclame personalizate. În comparație cu Flux-Kontext, Pigeon, Qwen3 și DeepSeek-R1, Uni-AdGen a produs imagini care se potrivesc mai bine cu stilul vizual și contextul reclamelor pe care utilizatorii le-au click-at în realitate, în timp ce a generat texte care captează o proporție mai mare a atributele și punctelor de vânzare ale produsului prezente în exemplele reale. Termenii care se potrivesc sunt evidențiați în verde.
Exemplele calitative, autorii susțin, indică faptul că Flux-Kontext și Pigeon adesea produc ieșiri care se abat de la caracteristicile vizuale ale reclamelor pe care utilizatorii le-au click-at anterior; în același timp, textul generat de Qwen3 și DeepSeek-R1 omite unele puncte de vânzare prezente în exemplele reale.
Concluzie
Utilitatea acestui proiect depinde în întregime de opt-in-ul utilizatorului, iar extinderea sferei acestui sistem “predictiv” dincolo de domeniul care controlează istoricul utilizatorului – în acest caz, JD.com – necesită un set și mai relaxat de permisiuni explicite ale utilizatorului, în majoritatea teritoriilor.
În orice caz, sistemul se bazează pe efectul de rețea hiperscalabilă care funcționează într-un astfel de scenariu și pe ideea (poate puțin optimistă) că utilizatorii vor găsi acest tip de sistem de recomandare personalizat și chiar prezicător util, mai degrabă decât intruziv, cel puțin în contextul grădinii închise a unui gigant al retailului.
* Această imagine se bazează pe tendința îngrijorătoare nouă de ‘figuri compilate’ în articolele de cercetare, în care ilustrațiile care ar fi fost odinioară 3-4 figuri separate sunt compilate într-una (în scopul respectării ghidurilor de depunere privind lungimea maximă a articolului principal) și sunt utilizate doar ca material de referință, adesea fără explicații adecvate în legenda însoțitoare.
† ‘m’-prefix indică comparație cu multiple texte candidate.
Publicat pentru prima dată marți, 2 iunie 2026. Revizuit la 18:21 EET pentru a corecta ‘perete’ cu ‘grădină închisă’ în ultimul paragraf.












