Unghiul lui Anderson

Imagini publicitare generate de inteligența artificială care vizează demografia dvs. – Și, în cele din urmă, pe dvs?

mm
Adaugă Unite.AI la sursele tale preferate pe Google
Montage of AI-generated images depicting frames from an online video aimed at three different age groups. Z-Image Turbo via Krita Diffusion AI.

Reclamenții își propun să personalizeze reclamele pentru a atrage clicuri, iar în timp ce creațiile personalizate pentru fiecare persoană sunt în prezent impracticabile, o nouă cercetare sugerează că imagini generate de inteligență artificială ar putea fi în curând direcționate eficient către grupuri demografice specifice.

 

Reclamele personalizate prezentate în filmul științifico-fantastic din 2002 al lui Steven Spielberg, Raportul minorității, au lăsat o impresie durabilă, chiar înfricoșătoare asupra culturii, cu reprezentarea vividă a panourilor publicitare proactive care recunosc oamenii în mulțimi și strigă mesaje promoționale direct la ei.

Multe grupuri de consumatori pot considera acest nivel de recunoaștere a vizualizatorilor ca un coșmar, și deși progresul către acesta a fost încetinit de consecințele scandalului Cambridge Analytica scandal, idealul de implicare directă și puternic vizată rămâne un obiectiv prețuit în publicitate.

Într-adevăr, sistemele care pot să se concentreze asupra caracteristicilor unui anumit vizualizator rămân în dezvoltare constantă – deși în astfel de cazuri, cercetarea corporativă trebuie să ia măsuri pentru a respecta legile privind informațiile cu caracter personal (PII); legi care au fost consolidate în Europa în ultimul deceniu, cu aceste protecții îmbunătățite răspândite în altă parte prin Efectul Bruxelles.

Salut!

Acum, reclamele și conținutul de marketing generate de inteligență artificială sunt în creștere, reclamenții trebuie, totuși, să se confrunte cu costul potențial al reclamelor generate de inteligență artificială direcționate către indivizi specifici, unde imaginea și textul sunt generate oportunist și la momentul oportun.

De exemplu, chiar dacă o imagine personalizată ar putea fi generată foarte rapid, costurile la scară ar fi semnificative. În plus, procesele automate de licitații publicitare online funcționează la intervale de timp critice, la nivel de milisecunde, ceea ce face ca conținutul de imagine personalizat să fie dificil, pentru moment; și conținutul video este o perspectivă și mai îndepărtată.

Însă, obstacolele tehnice implicate în abordarea grupurilor demografice de nivel superior într-o audiență bazată pe internet (prin laptopuri, telefoane, televizoare inteligente etc.) nu sunt atât de severe – și o nouă colaborare academică și industrială internațională propune o modalitate de a crea imagini publicitare separate pentru diferite grupuri demografice, incluzând factori precum vârsta și locația:

Din noua lucrare: exemple de generare de reclame personalizate, unde un singur produs este reprezentat în diferite stiluri pentru diferite grupuri de vizualizatori. Rândul superior arată imaginile originale ale produsului. Următoarele trei rânduri arată versiuni adaptate la trei tipuri distincte de audiență pe produs, pe baza diferențelor în caracteristici precum vârsta, stilul de viață sau preferința estetică. Aceste tipuri de grup nu sunt predefinite, ci sunt descoperite în mod automat. Fiecare rând corespunde unui grup; fiecare coloană arată un produs diferit. Sursă - https://arxiv.org/pdf/2602.02033

Din noua lucrare: exemple de generare de reclame personalizate, unde un singur produs este reprezentat în diferite stiluri pentru diferite grupuri de vizualizatori.

Noul cadru – intitulat Una mărime, multe încăperi (OSMF) – își propune să acopere golul dintre publicitatea cu țintă largă și personalizarea extrem de granulară, prin generarea de imagini publicitare diferite pentru grupuri de audiență descoperite în mod automat, utilizând aglomerarea conștientă de produs pentru a alinia conținutul vizual cu preferințele de clic ale grupurilor demografice specifice.

Autorii afirmă:

‘[Noi] prezentăm un cadru unitar care aliniază diversele preferințe de clic la nivel de grup în generarea de imagini publicitare la scară largă.

‘OSMF începe cu gruparea adaptivă conștientă de produs, care organizează dinamic utilizatorii pe baza atributelor și caracteristicilor produsului, reprezentând fiecare grup prin caracteristici de preferință colectivă bogate.’

Testate împotriva unor cadre comparabile, autorii afirmă că au obținut rezultate de ultimă oră.

Deși lucrarea identifică grupuri demografice diverse, articolul nu specifică care caracteristici demografice sunt reprezentate de fiecare G grupare, deși acestea par să corespundă grupurilor tradiționale de segmentare a pieței de piață.

Prin urmare, nu este ușor de spus, pe baza exemplelor prezentate în articolul principal și în apendice, de ce anumite fundaluri sau iluminare ar putea atrage un grup mai mult decât altul, deoarece nu cunoaștem caracteristicile niciunui grup:

Nu există stiluri consistente 'albastru pentru băieți, roz pentru fete' etc. în stilurile de imagine specifice grupului, care ar putea dezvălui ce tip de persoană aparține în ce grup – definițiile, așa cum reies din literatura existentă, sunt mult mai complexe și subtile.

Nu există stiluri consistente ‘albastru pentru băieți, roz pentru fete’ etc. în stilurile de imagine specifice grupului, care ar putea dezvălui ce tip de persoană aparține în ce grup – definițiile, așa cum reies din literatura existentă, sunt mult mai complexe și subtile.

Ceea ce este poate mai îngrijorător, pentru cei care se tem de practicile de direcționare a reclamelor, este posibilitatea de a exploata insight-urile la nivel de utilizator în generarea de imagini specifice în reclame**.

Noul articol se intitulează Una mărime, multe încăperi: Alinierea diverselor preferințe de clic la nivel de grup în generarea de imagini publicitare la scară largă și provine de la 17 cercetători de la Laboratorul Național de Recunoaștere a Modelelor de la Beijing; Școala de Inteligență Artificială de la UCAS; compania de comerț electronic chineză JINGDONG; Universitatea Științifică și Tehnică din Hong Kong, Guangzhou; și Laboratorul de Recunoaștere a Modelelor de la Universitatea de Știință și Tehnică din Nanjing.

Metodă

Sistemul utilizează aglomerarea adaptivă (o metodă care găsește grupări naturale prin legarea caracteristicilor utilizatorilor de răspunsul lor la diferite produse) pentru a grupa utilizatorii, pe baza modului în care caracteristicile lor influențează preferințele vizuale într-un anumit context de produs. Implementarea autorilor a acestei abordări se numește Gruparea adaptivă conștientă de produs (PAAG).

Aceste grupări nu sunt fixate dinainte, ci sunt descoperite din modelele din date.

Un generator de imagini condițional, intitulat Generare de imagini condiționate de preferințe (PCIG), utilizează apoi profilul fiecărui grup pentru a crea imagini publicitare care corespund gusturilor grupului:

OSMF grupează utilizatorii pe baza modului în care caracteristicile lor influențează preferințele de produs, apoi utilizează profilurile grupului pentru a genera imagini publicitare care corespund gusturilor fiecărui grup. PAAG se ocupă de grupare, iar PCIG creează imaginile utilizând prompturi și feedback adaptate fiecărui grup.

OSMF grupează utilizatorii pe baza modului în care caracteristicile lor influențează preferințele de produs, apoi utilizează profilurile grupului pentru a genera imagini publicitare care corespund gusturilor fiecărui grup.

Generatorul de imagini utilizează o versiune nespecificată a Stable Diffusion, împreună cu un set corespunzător ControlNet (ultimul, pentru a ajuta la menținerea coerenței în cadrul generațiilor de cohortă).

În fluxul de lucru, PAAG codifică mai întâi relația dintre caracteristicile utilizatorilor și atât aspectele textuale, cât și cele vizuale ale produsului, utilizând un set de codificatori dedicați și un mecanism de atenție încrucișată pentru a le combina într-o încorporare de preferințe unificată care reflectă probabilitatea ca un utilizator să cliqueze pe o anumită reclamă.

PAAG modelează apoi modul în care diferitele combinații de caracteristici ale utilizatorilor interacționează cu atât titlurile produselor, cât și imaginile produselor. Caracteristicile textuale și vizuale sunt extrase utilizând CLIP și ResNet-bazate pe codificatori, iar caracteristicile utilizatorilor, cum ar fi sexul, locul, vârsta sau dispozitivul, sunt trecute printr-un MLP, care permite atenția încrucișată peste caracteristicile textuale și vizuale ale produsului.

Încorporarea rezultată reprezintă probabilitatea de clic a fiecărui utilizator pentru un anumit produs într-un context vizual specific. Odată ce aceste încorporări de preferințe ale utilizatorului-produs sunt obținute, PAAG utilizează K-means clustering pentru a grupa utilizatorii care răspund similar la un anumit produs.

PAAG alege numărul optim de grupuri de utilizatori pentru fiecare produs, verificând cât de bine se separă clusterelor.

Aceste profile de grup sunt apoi transmise ca token-uri către modelul de limbaj mare conștient de grup (G-MLLM), care le utilizează pentru a genera imagini publicitare personalizate pentru fiecare grup.

Generarea de imagini pe baza preferințelor utilizatorilor

Pe partea utilizatorului, G-MLLM învață să prezică care membri ai grupului sunt mai probabil să cliqueze următorul și cum să descrie trăsăturile comune în limbaj natural. Pe partea produsului, învață să rezume produsul prezentat în imagine și să genereze titluri de reclame care corespund atât produsului, cât și grupului.

Pentru a reflecta comportamentul real al utilizatorilor, modelul este extins într-un model de recompensă conștient de grup (GRM). GRM este antrenat pe propria bază de date GAIP (a se vedea mai jos) a cercetătorilor pentru a compara perechi de imagini pentru același produs și pentru a identifica care dintre ele a funcționat mai bine cu un anumit grup, utilizând date reale de clic.

Acest semnal de recompensă este apoi utilizat pentru a ajusta G-MLLM cu Group-DPO, o metodă care îl învață să favorizeze prompturile care duc la o implicare mai bună la nivel de grup.

Date și teste

Dezvoltarea GAIP

Observând lipsa istorică a seturilor de date legate de preferințele publicitare la nivel de grup și că colecțiile anterioare, cum ar fi Personalized Soups și CG4CTR, sunt fie prea mici, fie prea puțin specificate, cercetătorii au dezvoltat propria colecție, GAIP, derivată din jurnalele de publicitate industriale ale unei platforme de comerț electronic nespecificate.

Jurnalele au fost colectate pe o perioadă de trei săptămâni, fiecare intrare înregistrând imaginea produsului și titlul, profilul vizualizatorului (inclusiv vârsta, nivelul de cheltuieli și sensibilitatea la promovări) și dacă reclama a fost clicată.

Setul de date include peste 40 de milioane de utilizatori, 2 milioane de produse și aproape 10 milioane de imagini publicitare, cu o varietate vizuală ridicată între articole.

Utilizatorii au fost grupați de PAAG în clusteri distincti pentru fiecare produs, iar rata de clic (CTR) a fost calculată pe imagine în cadrul fiecărui grup:

Din materialul suplimentar al noului articol, o mică privire asupra unor criterii de definire a GAIT.

Din materialul suplimentar al noului articol, o mică privire asupra unor criterii de definire a GAIT.

GAIP este apoi format ca un set de tuple (imagine publicitară, titlu produs, încorporare de grup, CTR specific grupului) care asociază fiecare imagine și titlu cu CTR-ul și încorporarea grupului care a văzut-o.

Pentru a asigura fiabilitatea, se păstrează doar produsele cu expunere suficientă, rezultând un set de date de 610.172 de mostre la nivel de grup.

GAIP este semnificativ mai mare decât seturile de date anterioare: în timp ce majoritatea benchmark-urilor anterioare implică mai puțin de zece grupuri de utilizatori, GAIP include aproape 600.000 de înregistrări reale de preferințe la nivel de grup, oferind perspective mai profunde asupra preferințelor la nivel de grup.

Teste

Pentru a antrena pipeline-ul PCIG, cercetătorii au extras caracteristici de imagine și text utilizând ResNet și codificatorul de text CLIP, apoi le-au mapat la încorporări de 128 de dimensiuni prin straturi liniare invățabile. Pentru a menține eficiența, PAAG a fost limitat la cinci grupuri de utilizatori pe produs.

Încorporările de grup au fost construite utilizând o strategie de eșantionare bazată pe percentil, extrăgând multiple puncte din percentilele 15, 55 și 95, pentru a captura atât preferințele centrale, cât și periferice.

LLaVA a fost utilizat ca spate pentru G-MLLM, iar preantrenarea a fost efectuată pe zece epoci cu un program de învățare a ratei cosinusoidal la o rată de învățare de 2e-6, necesitând o perioadă impresionantă de cinci zile de antrenament pe un cluster de opt GPU-uri NVIDIA H100, fiecare cu 80GB de VRAM.

GRM a fost antrenat prin reconstruirea GAIP cu perechi de imagini de produs potrivite, apoi initializat cu aceleași greutăți ca G-MLLM. În etapa finală Group-DPO, GRM a fost înghețat, iar G-MLLM a fost ajustat utilizând LoRA timp de trei epoci – din nou, la o rată de învățare de 2e-5, pe același cluster NVIDIA.

Metricile utilizate pentru prima evaluare au fost NDCG@5 și AUROC. NDCG@5 a măsurat cât de diferit a clasificat fiecare grup aceleași set de imagini publicitare, cu valori mai mici indicând o separare mai clară a preferințelor; și AUROC a fost utilizat pentru a evalua cât de bine a distins fiecare model conținutul clicat de cel neclicat.

Toate metricile au fost calculate pe rezultatele clusterizării din 1.000 de produse, totalizând aproximativ 100.000 de mostre, și au fost utilizate pentru a compara PAAG cu trei sisteme anterioare: CACS; WIYD; și JAC:

Rezultatele modelării preferințelor comparate cu metodele anterioare. NDCG@5 mai mic și AUROC mai mare indică o performanță mai bună. Cele mai bune scoruri sunt în aldine, iar cele mai bune scoruri sunt subliniate.

Rezultatele modelării preferințelor comparate cu metodele anterioare.

Dintre aceste rezultate, autorii comentează:

‘[Metoda noastră] obține o performanță superioară în ambele metrici. Concret, PAAG atinge cel mai mic NDCG@5 (0,3066), depășind cea mai bună bază de comparație (CACS), indicând modele de preferințe intergrup mai distincte pentru generarea de reclame la nivel de grup eficientă.

‘În plus, PAAG atinge cel mai ridicat AUROC (0,6372), îmbunătățindu-se față de cea mai puternică bază de comparație (WIYD) cu 0,0159.’

Un al doilea tur de teste a verificat dacă sistemul poate să corespundă mai bine reclamele cu grupurile de utilizatori corecte:

Compararea clicurilor online, arătând că generarea personalizată de grup ('Ours') depășește toate bazele de comparație, inclusiv CAIG și G-MLLM preantrenat.

Compararea clicurilor online, arătând că generarea personalizată de grup (‘Ours’) depășește toate bazele de comparație.

Aici, PCIG a arătat rate de clic mai puternice decât modelele mai vechi, cum ar fi CAIG și G-MLLM, cu o îmbunătățire de 5,5%. GRM a fost, de asemenea, testat offline, verificându-se dacă poate alege corect cea mai bună reclamă dintr-o pereche, pe baza preferințelor grupului. A depășit toate bazele de comparație, inclusiv modelele generale, cu un câștig de 4,7% față de CAIG.

Un test calitativ final a fost efectuat pentru a evalua dacă PCIG poate reflecta preferințele la nivel de grup în stilul imaginilor generate:

Rezultate complete pentru testele calitative, prezentate anterior în articol.

Rezultate complete pentru testele calitative, prezentate anterior în articol.

Aceste variații au corespuns, susțin autorii, preferințelor de clic inferate pentru fiecare grup, demonstrând că PCIG poate produce ieșiri stilistic diverse, păstrând în același timp relevanța și atracția. Autorii afirmă:

‘[PCIG] asigură imagini stilistic diverse pentru a satisface preferințele de clic ale grupurilor de utilizatori distincte, demonstrând astfel o capacitate puternică de a adapta generarea la cerințele eterogene ale utilizatorilor și de a captura diferențele fine de preferințe între grupurile de utilizatori variate, subliniind potențialul său pentru generarea de imagini publicitare conștiente de grup la scară.’

Concluzie

Poate cel mai interesant aspect al acestui proiect este corelația necunoscută între stilurile de ieșire pentru imagini direcționate către grupuri pentru același produs (din care există mai multe exemple în materialul suplimentar al articolului decât putem reproduce aici).

Putem presupune că mediile urbane sunt legate de vârstă, adică de absolvenți care își încep cariera, și că mediile rurale sunt direcționate către tipurile mai prosperate de Gen X care identifică drumul deschis ca o formă de ‘ultimă libertate’? Putem interpreta aceste ieșiri de testare toată ziua.

Potentialul unor astfel de sisteme se bazează pe două factori: insight și latență. Insight depinde de capacitatea sistemelor emergente de urmărire de a extrage încă informații semnificative de la utilizatori pentru a susține publicitatea eficientă la nivel de grup, precum și de a pune bazele pentru reclame mai precise și individualizate în viitor.

Latența reprezintă o provocare mai mare, deoarece aceste imagini publicitare personalizate trebuie generate și livrate aproape instantaneu; deși unele modele recente de text-la-imagine pot produce rezultate în doar câteva secunde, chiar și această întârziere poate fi prea lungă pentru licitațiile publicitare în timp real.

O posibilă soluție este să se producă imaginile local, pe GPU-ul browserului, evitând astfel tururile de rețea; sau să se creeze un set de imagini în prealabil, preîncărcate pe client.

 

** Acest aspect este evitat în noul articol, la fel cum potențialul de abuz al noilor cadre de inteligență artificială este adesea atenuat prin utilizarea unor figuri de animale drăguțe (în loc de pornografie generată de IA) în studii noi. Cu toate acestea, tipul de imagini prezentate în lucrare reprezintă reclamenții la cel mai bun comportament, mai degrabă decât să arate cât de personale pot deveni reclamele vizuale în cele din urmă, pe măsură ce metodele de direcționare a consumatorilor se alătură inteligenței artificiale cu răspuns rapid.

** Nu pot identifica această instituție numită, deoarece ‘UCAS’ se rezolvă în general la o cunoscută casă de clearing universitară din Regatul Unit. Aștept clarificări.

Care cercetătorii promit să o lanseze pe repo-ul GitHub asociat.

Publicat pentru prima dată joi, 5 februarie 2026

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai