Unghiul lui Anderson

O nouă cercetare propune publicitate cu adevărat “personalizată”

mm
Adaugă Unite.AI la sursele tale preferate pe Google
A woman looks at a laptop displaying a news website, reacting with surprise as a banner advertisement on the page shows a smiling woman who closely resembles her.

Într-o redefinire a “autopromovării”, o nouă metodă extrage informații din click-urile unui utilizator pentru a crea reclame web personalizate pe baza istoricului său.

 

Deși agențiile de publicitate sunt încântate să demonteze ideea că există canale de publicitate care pot afișa reclame bazate pe ceea ce ai discutat recent în confortul casei tale, nivelul de “personalizare” demonstrat de reclamele de pe site-urile web și aplicațiile de social media a atras atenția mass-mediei în ultimii ani.

Scenariul ideal pentru un anunțător a fost întotdeauna ca reclama afișată să fie un “fit exact” pentru vizualizator. În limitele reacției publice împotriva urmăririi online și a măsurilor de prevenire pe care utilizatorul le-ar fi putut instala împotriva unei astfel de monitorizări, inteligența artificială generativă (lăsând deoparte temerile legate de publicitatea LLM într-o lume post-căutare) este capabilă să producă imagini și texte de reclame suficient de rapid pentru a fi utilizate în timp real.

În orice caz, principala direcție a cercetării și a majorității implementărilor în acest domeniu până în prezent s-a axat pe statisticile agregate de utilizare, astfel încât orice reclamă generată pentru un vizualizator ar fi bazată pe grupul de cohorte presupus al vizualizatorului, mai degrabă decât pe istoricul său unic.

Acum, o nouă colaborare de cercetare între China și Statele Unite prezintă un sistem pentru generarea de imagini și texte de reclame pentru utilizatori individuali prin învățarea din click-urile lor trecute atunci când sunt conectați la un site, mergând dincolo de ipotezele bazate pe cohorte care au guvernat majoritatea cercetărilor de publicitate personalizată până în prezent:

Exemple de generații care prezintă reclame personalizate. Desigur, fără contextul istoric al utilizatorului, impactul complet poate fi doar imaginat. Sursă - https://arxiv.org/pdf/2605.12138

Exemple de generații care prezintă reclame personalizate. Desigur, fără contextul istoric al utilizatorului, impactul complet poate fi doar imaginat. Sursă

În mod neobișnuit, noua abordare evită modelele bazate pe difuzie în favoarea unei arhitecturi autoregresive – principala diferență fiind că modelele de difuzie rafinează gradual o imagine din zgomot vizual, în timp ce modelele autoregresive generează conținut într-o singură bucată, prevăzând fiecare element nou din tot ceea ce a precedat.

Pentru a sprijini noul model generativ, autorii au dezvoltat ceea ce susțin a fi primul set de date de imagine/text la scară largă pentru publicitate personalizată, precum și o metrică nouă proiectată pentru a evalua această sarcină specifică. În testele efectuate, ei au constatat că abordarea lor a depășit atât liniile de bază generale, cât și metodele și cadrele existente care abordează această provocare.

Grădină închisă

Este demn de remarcat scopul propus al lucrării, care nu oferă anunțătorilor o modalitate de a ocoli noile măsuri împotriva urmăririi de către terți, ci mai degrabă oferă un retailer suficient de mare puterea de a popula un client conectat cu reclame care se referă direct la acea persoană.

Aceasta nu este neapărat limitată la clienții care navighează în prezent pe site-ul retailerului: în funcție de nivelul la care utilizatorul a acordat retailerului puterea de a-l urmări pe alte site-uri, el ar putea fi prezentat cu reclame țintite pe orice site web care participă la licitațiile de publicitate pe care le folosește retailerul.

Acest tip de publicitate are tendința de a fi limitat la magazine de mare volum, cum ar fi Amazon, în vest (și notăm că un retailer chinez de dimensiuni analoge a participat la noua lucrare – a se vedea mai jos), deși orice preocupare similară (cum ar fi o platformă de social media populară) ar putea, în teorie, să genereze un cadru generativ similar.

Noul articol se intitulează Proiectați-vă reclama: Generare de imagini și texte de publicitate personalizate cu modele autoregresive unificate și provine de la 18 autori de la Universitatea Sun Yat-Sen din Guangzhou, Universitatea Northeastern și cel mai mare retailer din China, JD.com (JD ) (ultimul având acces la istoricul și obiceiurile cumpărătorilor). Codul a fost făcut disponibil prin GitHub, iar punctele de control au fost făcute disponibile și ele.

Date și Metodă

Setul de date construit pentru proiect se numește Imagine-text de publicitate personalizată (PAd1M) și este alimentat de date furnizate de contributorul proiectului JD.com. Autorii afirmă:

‘Fiecare produs oferă de obicei mai mult de zece imagini și texte candidate, asigurând că preferințele diverse pot fi detectate pe deplin. Pentru a permite modelarea preferințelor de încredere, colectăm istoricul complet al click-urilor de utilizator pe imagini și texte, filtrând utilizatorii cu activitate insuficientă pentru a reduce zgomotul.’

‘Acest lucru ne oferă un set de date de 1.145.371 de utilizatori, cu 18.923.555 de imagini de produse și texte click-ate, în medie mai mult de șaisprezece comportamente multimodale istorice pe utilizator.’

Pentru fiecare utilizator, s-a selectat o pereche de imagine-text click-ată anterior ca exemplu țintă, după care produsul în sine a fost izolat din imagine folosind Grounded SAM.

Descrierile și punctele de vânzare furnizate de vânzător au fost apoi atașate la înregistrare, creând un set de date în care fiecare reclamă țintă este însoțită de o imagine de produs transparentă; informații structurate despre produs; și un istoric de interacțiuni anterioare cu imagini și texte, menit să capteze interesele și preferințele anterioare ale utilizatorului:

Un profil de utilizator din setul de date PAd1M, care prezintă o reclamă țintă lângă informațiile despre produs utilizate pentru a o genera, și interacțiunile istorice cu imagini și texte utilizate pentru a modela preferințele utilizatorului.

Un profil de utilizator din setul de date PAd1M, care prezintă o reclamă țintă lângă informațiile despre produs utilizate pentru a o genera, și interacțiunile istorice cu imagini și texte utilizate pentru a modela preferințele utilizatorului.

Setul de date rezultat oferă o scară de peste un milion de utilizatori și aproape 19 milioane de înregistrări de imagini și texte click-ate, autorii afirmând că colecția este substanțial mai mare decât seturile de date de personalizare anterioare.

În plus, datele, în mod neobișnuit pentru acest tip de cercetare, combină atât imagini, cât și texte, permițând modelarea preferințelor utilizatorilor pe multiple modalități, mai degrabă decât într-un singur domeniu.

PAd1M prezintă, de asemenea, urmărirea preferințelor la nivel individual; în contrast cu seturile de date de publicitate anterioare, care au fost construite în jurul ratelor de click agregate pe grupuri mari, PAd1M leagă interacțiunile de utilizatori specifici din datele JD.com.

Pentru metrici, pe lângă alegerile standard de BLEU și ROUGE, cercetătorii au dezvoltat propria măsurătoare personalizată numită Asemănare a fundalului produsului (PBS). Bazat pe inițiativa MoCo-v3 anterioară, PBS a fost antrenat pe 681.123 de perechi de imagini care prezintă același produs pe fundaluri diferite, permițând metricii să se concentreze pe variația contextuală în loc de produsul în sine:

Asemănare a fundalului produsului (PBS) atribuie scoruri de asemănare marcat diferite pentru reclame care conțin același produs, dar îl plasează în contexte vizuale diferite, în contrast cu metricile concurente, care produc separări mult mai mici.

Asemănare a fundalului produsului (PBS) atribuie scoruri de asemănare marcat diferite pentru reclame care conțin același produs, dar îl plasează în contexte vizuale diferite. În schimb, metricile concurente produc separări mult mai mici.

În timpul antrenamentului, fiecare imagine a fost pereche cu ea însăși ca exemplu pozitiv, în timp ce o imagine a aceluiași produs plasat într-un context diferit a servit ca exemplu negativ, o strategie de antrenament menită să crească sensibilitatea la contextul fundal.

Rezultatele evaluării, articolul susține, indică diferențe de asemănare mai mari între fundaluri care se potrivesc și cele care nu se potrivesc decât cele produse de CLIP, DINO v3 sau menționatul MoCov3.

În timp ce reglarea instrucțiunilor (antrenarea modelului pentru a urma instrucțiuni de generare specifice produsului derivate din descrieri și puncte de vânzare) a fost utilizată pentru a îmbunătăți aderarea la descrierile și punctele de vânzare furnizate de vânzător, GPT-4o a fost utilizat pentru a filtra exemplele de antrenament inadecvate.

Personalizarea s-a bazat pe un modul de înțelegere a preferințelor de la gros la fin. Interacțiunile istorice au fost filtrate mai întâi printr-un flux de eșantionare a similarității produsului pentru a favoriza produse asemănătoare cu articolul țintă. Înregistrările rămase au fost apoi procesate de o etapă de extragere a preferințelor multimodale concepută pentru a identifica elementele vizuale și textuale care reflectă cel mai probabil interesele utilizatorului – aceste preferințe fiind inserate în prompt, pentru a ghida generarea.

Teste

Autorii afirmă că abordarea lor de testare se bazează pe Janus-Pro 7B de la DeepSeek.

Modelul a fost antrenat la o dimensiune a lotului de patru, sub optimizatorul AdamW la o rată de învățare de 5e-5. Modelul de bază a fost perfecționat prin LoRA, cu percepția fundalului și extragerea preferințelor multimodale pe deplin perfecționate (adică, spre deosebire de LoRA, greutățile modelului de bază au fost alterate permanent).

Toate testele au fost efectuate pe un GPU NVIDIA B200 cu 192 GB de VRAM. Pentru generarea de imagini, PickScore, ImageReward și ASE au fost utilizate pentru a măsura calitatea vizuală, în timp ce m-BLEU și m-ROUGE† au fost utilizate pentru a evalua textul de reclamă. Evaluatorii umani au evaluat, de asemenea, realismul și calitatea layout-ului imaginilor, precum și acuratețea și fluența textului, toate metricile fiind calculate pe 500 de produse.

Pentru generarea de imagini, liniile de bază au constat din Qwen2.5-VL și GPT-4o pentru crearea de prompturi de fundal din imagini de produse, urmată de ReliableAd, PosterMaker și Flux-Fill pentru generarea de reclame finale. Comparările de generare de texte au fost efectuate împotriva Qwen2.5, Qwen3 și DeepSeek-R1.

Rezultatele inițiale ale liniilor de bază cantitative pentru generarea de reclame sunt prezentate mai jos:

Schema Uni-AdGen pentru crearea reclamelor personalizate din text și imagini. Instrucțiunile includ descrierea produsului, sarcina și principalele argumente de vânzare.

Schema Uni-AdGen pentru crearea reclamelor personalizate din text și imagini. Instrucțiunile includ descrierea produsului, sarcina și principalele argumente de vânzare.


Scriitor în învățare automată, specialist de domeniu în sinteza imaginilor umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai de la DNEG.
Site web: martinanderson.ai
Contact: martin@martinanderson.ai