Η γωνία του Anderson
Εικόνες διαφημίσεων που δημιουργούνται από τον AI και στοχεύουν στο δημογραφικό σας – Και, τελικά, εσάς;

Οι διαφημιστές στοχεύουν να προσαρμόσουν τις διαφημίσεις σε κάθε άτομο για να αυξήσουν τους κλικ, και ενώ οι εξατομικευμένες δημιουργίες για κάθε άτομο είναι για το παρόν ακατόρθωτες, νέα έρευνα υποδηλώνει ότι οι εικόνες που δημιουργούνται από τον AI θα μπορούσαν σύντομα να στοχεύουν αποτελεσματικά σε συγκεκριμένες δημογραφικές ομάδες.
Η εξατομικευμένη διαφήμιση που παρουσιάζεται στην ταινία του Steven Spielberg του 2002, Minority Report, έχει αφήσει μια διαρκή, ακόμα και τρομακτική εντύπωση στην κουλτούρα, με την εικονική της απεικόνιση των διαφημιστικών πινακίδων που αναγνωρίζουν τους ανθρώπους στα πλήθη και φωνάζουν προωθητικά μηνύματα απευθείας σε αυτούς.
Πολυάριθμες ομάδες καταναλωτών μπορεί να θεωρήσουν αυτό το επίπεδο αναγνώρισης του θεατή σαν εφιάλτη, και αν και η πρόοδος προς αυτό το στάδιο επιβραδύνθηκε από τις επιπτώσεις του σκανδάλου της Cambridge Analytica, το ιδανικό της άμεσης, υψηλά στοχευμένης εμπλοκής παραμένει ένα πολύτιμο στόχο στη διαφήμιση.
Στην πραγματικότητα, οι συστήματα που μπορούν να διεισδύσουν στις ιδιότητες ενός συγκεκριμένου θεατή παραμένουν σε συνεχή ανάπτυξη – αν και σε τέτοιες περιπτώσεις η εταιρική έρευνα πρέπει να λάβει μέτρα για να σεβαστούν τους νόμους σχετικά με τις προσωπικά αναγνωρίσιμες πληροφορίες (PII)· νόμους που έχουν ενισχυθεί στην Ευρώπη τα τελευταία δέκα χρόνια, με αυτές τις βελτιωμένες προστασίες να εξαπλώνονται αλλού μέσω του αποτέλεσματος των Βρυξελλών.
Γεια σας!
Τώρα που οι διαφημίσεις και το περιεχόμενο μάρκετινγκ που δημιουργούνται από τον AI βρίσκονται σε άνοδο, οι διαφημιστές πρέπει ωστόσο να αντιμετωπίσουν το πιθανό κόστος των διαφημίσεων του AI που στοχεύουν σε συγκεκριμένα άτομα, όπου οι εικόνες και ο κείμενος δημιουργούνται με ευκαιριακό και επί τόπου τρόπο.
Για παράδειγμα, ακόμη και αν μια εξατομικευμένη εικόνα θα μπορούσε να δημιουργηθεί πολύ γρήγορα, το κόστος σε μεγάλη κλίμακα θα ήταν σημαντικό. Επιπλέον, οι αυτόματες διαδικασίες διαδικτυακών διαφημιστικών πλειστηριασμών λειτουργούν σε κρίσιμους χρονικούς πλαισιούς σε χιλιοστά του δευτερολέπτου, γεγονός που καθιστά τη διαφημιστική περιεχόμενο που προσανατολίζεται στον χρήστη προκλητικό, για το παρόν· και το περιεχόμενο βίντεο είναι ακόμη πιο μακρινή προοπτική.
Ωστόσο, τα τεχνικά εμπόδια που εμπλέκονται στη διεύθυνση υψηλότερου επιπέδου ομάδων δημογραφικών κοόρτ σε μια διαδικτυακή ακροατήριο (μέσω laptop, κινητών, smart TV κ.λπ.) δεν είναι τόσο σοβαρά – και μια νέα διεθνής ακαδημαϊκή/βιομηχανική συνεργασία προτείνει έναν τρόπο για τη δημιουργία ξεχωριστών εικόνων διαφήμισης για διαφορετικές δημογραφικές ομάδες, συμπεριλαμβανομένων παραγόντων όπως η ηλικία και η τοποθεσία:

Από το νέο έργο: παραδείγματα εξατομικευμένης γεννήτριας διαφήμισης, όπου ένα μονό προϊόν αποδίδεται σε διαφορετικούς στυλ για διαφορετικές ομάδες θεατών.
Το νέο πλαίσιο – με τίτλο Ένα Μέγεθος, Πολλά Φिट (OSMF) – στοχεύει να γεφυρώσει το χάσμα μεταξύ της ευρείας στοχευμένης διαφήμισης και της ακατόρθωτης εξατομικευμένης προσαρμογής, δημιουργώντας διαφορετικές εικόνες διαφήμισης για αυτόματα ανακαλυφθείσες ομάδες θεατών, χρησιμοποιώντας προϊόν-ευαίσθητη ομαδοποίηση για να συσχετίσει το οπτικό περιεχόμενο με τις προτιμήσεις κλικ των διαφορετικών δημογραφικών ομάδων.
Οι συγγραφείς αναφέρουν:
‘[Παρουσιάζουμε] ένα ενοποιημένο πλαίσιο που συσχετίζει τις διαφορετικές ομαδικές προτιμήσεις κλικ σε μεγάλη κλίμακα γεννήτρια διαφήμισης εικόνων.
‘Το OSMF ξεκινά με προϊόν-ευαίσθητη προσαρμοστική ομαδοποίηση, η οποία οργανώνει δυναμικά τους χρήστες με βάση τα χαρακτηριστικά τους και τα χαρακτηριστικά του προϊόντος, αντιπροσωπεύοντας κάθε ομάδα με πλούσιες συλλογικές προτιμήσεις.
Επιβεβαιώνουν τα αποτελέσματα.
Για παράδειγμα, ακόμη και αν μια εξατομικευμένη εικόνα θα μπορούσε να δημιουργηθεί πολύ γρήγορα, το κόστος σε μεγάλη κλίμακα θα ήταν σημαντικό. Επιπλέον, οι αυτόματες διαδικτυακές διαφημιστικές διαδικασίες πλειστηριασμών λειτουργούν σε κρίσιμους χρονικούς πλαισιούς σε χιλιοστά του δευτερολέπτου, γεγονός που καθιστά τη διαφημιστική περιεχόμενο που προσανατολίζεται στον χρήστη προκλητικό, για το παρόν· και το περιεχόμενο βίντεο είναι ακόμη πιο μακρινή προοπτική.
Ωστόσο, τα τεχνικά εμπόδια που εμπλέκονται στη διεύθυνση υψηλότερου επιπέδου ομάδων δημογραφικών κοόρτ σε μια διαδικτυακή ακροατήριο (μέσω laptop, κινητών, smart TV κ.λπ.) δεν είναι τόσο σοβαρά – και μια νέα διεθνής ακαδημαϊκή/βιομηχανική συνεργασία προτείνει έναν τρόπο για τη δημιουργία ξεχωριστών εικόνων διαφήμισης για διαφορετικές δημογραφικές ομάδες, συμπεριλαμβανομένων παραγόντων όπως η ηλικία και η τοποθεσία:

Από το νέο έργο: παραδείγματα εξατομικευμένης γεννήτριας διαφήμισης, όπου ένα μονό προϊόν αποδίδεται σε διαφορετικούς στυλ για διαφορετικές ομάδες θεατών.
Μέθοδος
Το σύστημα χρησιμοποιεί προσαρμοστική ομαδοποίηση (μια μέθοδος που βρίσκει φυσικές ομαδοποιήσεις συνδέοντας τα χαρακτηριστικά του χρήστη με το πώς ανταποκρίνονται σε διαφορετικά προϊόντα) για να ομαδοποιήσει τους χρήστες, με βάση τα χαρακτηριστικά τους που διαμορφώνουν τις οπτικές προτιμήσεις σε ένα δεδομένο προϊόν. Η εφαρμογή των συγγραφέων αυτής της προσέγγισης ονομάζεται Προϊόν-ευαίσθητη Προσαρμοστική Ομαδοποίηση (PAAG).
Αυτές οι ομαδοποιήσεις δεν είναι προκαθορισμένες, αλλά ανακαλύπτονται από τα πρότυπα στα δεδομένα.
Ένας συνθηκικός γεννήτορας εικόνων, με τίτλο Προτιμήσεις-Συνθηκική Γεννήτρια Εικόνων (PCIG), χρησιμοποιεί το προφίλ κάθε ομάδας για να δημιουργήσει διαφημιστικές εικόνες που ταιριάζουν στις προτιμήσεις της ομάδας:

Το OSMF ομαδοποιεί τους χρήστες με βάση τα χαρακτηριστικά τους που διαμορφώνουν τις προτιμήσεις προϊόντων, και στη συνέχεια χρησιμοποιεί αυτά τα προφίλ ομάδας για να δημιουργήσει διαφημιστικές εικόνες που ταιριάζουν στις προτιμήσεις της ομάδας.
Γεννήτρια Εικόνων με βάση τις Προτιμήσεις του Χρήστη
Στην πλευρά του χρήστη, το G-MLLM μαθαίνει να προβλέπει ποιοι μέλη της ομάδας είναι πιθανό να κάνουν κλικ και πώς να περιγράψουν κοινά χαρακτηριστικά σε φυσική γλώσσα. Στην πλευρά του προϊόντος, μαθαίνει να συνοψίζει το προϊόν που εμφανίζεται σε μια εικόνα και να δημιουργεί διαφημιστικές λεζάντες που ταιριάζουν και στο προϊόν και στην ομάδα.
Για να αντανακλούν την πραγματική συμπεριφορά του χρήστη, το μοντέλο επεκτείνεται σε ένα ομαδο-ευαίσθητο μοντέλο ανταμοιβής (GRM). Το GRM εκπαιδεύεται στο δικό του Δataset Προτιμήσεων Εικόνων Διαφήμισης Ομάδας (GAIP) για να συγκρίνει ζευγάρια εικόνων για το ίδιο προϊόν και να αναγνωρίσει ποια εικόνα λειτουργεί καλύτερα με μια δεδομένη ομάδα, χρησιμοποιώντας πραγματικά δεδομένα κλικ:
Δεδομένα και Τεστ
Ανάπτυξη του GAIP
Σημειώνοντας την ιστορική έλλειψη συνόλων δεδομένων που σχετίζονται με τις προτιμήσεις διαφήμισης ομάδας, και ότι προηγούμενες συλλογές όπως Προσωπικές Σούπες και CG4CTR είναι είτε πολύ μικρής κλίμακας είτε πολύ κακώς καθορισμένες, οι ερευνητές ανέπτυξαν τη δική τους συλλογή, το GAIP, που προέρχεται από τα “βιομηχανικά αρχεία διαφήμισης” μιας μη καθορισμένης εταιρείας ηλεκτρονικού εμπορίου.
Τα αρχεία συλλέχθηκαν σε διάστημα τριών εβδομάδων, με κάθε εγγραφή να καταγράφει την εικόνα προϊόντος και τον τίτλο, το προφίλ του θεατή (συμπεριλαμβανομένων ηλικίας, επιπέδου δαπάνης και ευαισθησίας στις προωθήσεις) και αν η διαφήμιση κλικαρίστηκε.
Το σύνολο δεδομένων περιλαμβάνει πάνω από 40 εκατομμύρια χρήστες, 2 εκατομμύρια προϊόντα και σχεδόν 10 εκατομμύρια εικόνες διαφήμισης, με υψηλή οπτική ποικιλία μεταξύ των αντικειμένων.
Οι χρήστες ομαδοποιήθηκαν από την PAAG σε διακριτές ομάδες για κάθε προϊόν, και ο ρυθμός κλικ (CTR) υπολογίστηκε ανά εικόνα μέσα σε κάθε ομάδα:

Από το συμπληρωματικό υλικό της νέας εργασίας, μια μικρή ματιά σε κάποια από τα καθοριστικά κριτήρια για το GAIT.
Το GAIP αποτελείται από ένα σύνολο τουπλέ (εικόνα διαφήμισης, τίτλος προϊόντος, εμφύτευση ομάδας, CTR ομάδας) που ζευγαρώνει κάθε εικόνα και τίτλο με το CTR και την εμφύτευση της ομάδας που την είδε.
Για να διασφαλιστεί η αξιοπιστία, μόνο τα προϊόντα με επαρκή έκθεση διατηρούνται, με αποτέλεσμα ένα σύνολο δεδομένων 610.172 δειγμάτων επιπέδου ομάδας.
Το GAIP είναι σημαντικά μεγαλύτερο από τα προηγούμενα σύνολα δεδομένων: ενώ τα περισσότερα προηγούμενα βENCHMARKS περιλαμβάνουν λιγότερες από δέκα ομάδες χρηστών, το GAIP περιλαμβάνει σχεδόν 600.000 πραγματικές εγγραφές προτιμήσεων ομάδας, προσφέροντας βαθύτερες γνώσεις για τις προτιμήσεις επιπέδου ομάδας.
Τεστ
Για να εκπαιδεύσουν τη διαδικασία PCIG, οι ερευνητές εξήγαγαν χαρακτηριστικά εικόνων και κειμένου χρησιμοποιώντας ResNet και τον κωδικοποιητή κειμένου CLIP, και στη συνέχεια τα χαρτογράφησαν σε 128-διαστάσεις εμβυτεύματα μέσω μαθητών γραμμικών στρωμάτων. Για να διατηρηθεί η αποδοτικότητα, η PAAG περιορίστηκε σε πέντε ομάδες χρηστών ανά προϊόν.
Τα εμβυτεύματα ομάδας κατασκευάστηκαν χρησιμοποιώντας μια στρατηγική δειγματοληψίας με βάση το εκατοστό, τραβώντας πολλαπλά σημεία από το 15ο, 55ο και 95ο εκατοστό, για να καταγράψουν τόσο τις κεντρικές όσο και τις περιφερειακές προτιμήσεις.
Η LLaVA χρησιμοποιήθηκε ως η πλάτη για το G-MLLM, και η προ-εκπαίδευση διεξήχθη σε δέκα epochs με ένα χρονοδιάγραμμα μάθησης συνός σε ρυθμό μάθησης 2e-6, απαιτώντας μια φοβερή πέντε ημέρες εκπαίδευσης σε ένα cluster οκτώ NVIDIA H100 GPU, κάθε一个 με 80GB VRAM.
Το GRM εκπαιδεύτηκε ανακατασκευάζοντας το GAIP με ζευγάρια εικόνων προϊόντων, και στη συνέχεια αρχικοποιήθηκε με τα ίδια βάρη όπως το G-MLLM. Κατά τη διάρκεια του τελικού σταδίου Group-DPO, το GRM πάγωσε, και το G-MLLM επι-εκπαιδεύτηκε χρησιμοποιώντας LoRA για τρεις epochs – και πάλι, σε ρυθμό μάθησης 2e-5, στο ίδιο cluster NVIDIA.
Οι μετρήσεις που χρησιμοποιήθηκαν για την πρώτη αξιολόγηση ήταν NDCG@5 και AUROC. Η NDCG@5 μετρούσε πόσο διαφορετικά κάθε ομάδα κατέτασσε τις ίδιες εικόνες διαφήμισης, με χαμηλότερες τιμές που δείχνουν μεγαλύτερη διαφοροποίηση στις προτιμήσεις· και η AUROC χρησιμοποιήθηκε για να αξιολογήσει πόσο καλά κάθε μοντέλο διάκρινε κλικαρίστρες από μη κλικαρίστρες.
Όλες οι μετρήσεις υπολογίστηκαν στα αποτελέσματα ομαδοποίησης από 1.000 προϊόντα, που ανέρχονται σε περίπου 100.000 δείγματα, και χρησιμοποιήθηκαν για να συγκρίνουν την PAAG με τρεις προηγούμενες συστήματα: CACS· WIYD· και JAC:

Αποτελέσματα μοντελοποίησης προτιμήσεων σε σύγκριση με προηγούμενες μεθόδους.
Από αυτά τα αποτελέσματα, οι συγγραφείς αναφέρουν:
‘[Η μέθοδός μας] επιτυγχάνει υπεροχή απόδοση και στις δύο μετρήσεις. Συγκεκριμένα, η PAAG επιτυγχάνει την χαμηλότερη NDCG@5 (0,3066), ξεπερνώντας την καλύτερη βάση (CACS), που δείχνει περισσότερες διαφορετικές προτιμήσεις μεταξύ των ομάδων για αποτελεσματική γεννήτρια διαφήμισης ομάδας.
‘Επιπλέον, η PAAG επιτυγχάνει την υψηλότερη AUROC (0,6372), βελτιώνοντας την ισχυρότερη βάση (WIYD) κατά 0,0159.’
Μια δεύτερη σειρά τεστ ελέγχει αν το σύστημα μπορεί να ταιριάξει καλύτερα τις διαφημίσεις με τις σωστές ομάδες χρηστών:

Σύγκριση CTR online που δείχνει ότι η γεννήτρια εξατομικευμένης ομάδας (‘Δικό μας’) υπερέχει όλων των βάσεων.
Εδώ, η PCIG έδειξε ισχυρότερες ρυθμούς κλικ από παλαιότερα μοντέλα όπως το CAIG και το G-MLLM, με βελτίωση 5,5%. Το GRM επίσης ελέγχθηκε εκτός σύνδεσης, ελέγχοντας αν θα μπορούσε να επιλέξει σωστά την καλύτερη διαφήμιση σε ένα ζευγάρι, με βάση τις προτιμήσεις της ομάδας. Ξεπέρασε όλες τις βάσεις, συμπεριλαμβανομένων γενικών μοντέλων, με κέρδος 4,7% πάνω από το CAIG.
Ένα τελικό ποιοτικό τεστ διεξήχθη για να αξιολογήσει αν η PCIG θα μπορούσε να αντανακλούν τις προτιμήσεις επιπέδου ομάδας στο στυλ των γεννημένων εικόνων. Όπως φαίνεται στην εικόνα παρακάτω, το ίδιο προϊόν αποδίδεται διαφορετικά για κάθε ομάδα, με αλλαγές στο παλέττα, τον τόνο και τη σύνθεση:

Πλήρη αποτελέσματα για τα ποιοτικά τεστ, που προεπισκοπήθηκαν νωρίτερα στο άρθρο.
Αυτές οι παραλλαγές, ισχυρίζονται οι συγγραφείς, συσχετίζονται με τις προτιμήσεις κλικ που υπονοούνται για κάθε ομάδα, δείχνοντας ότι η PCIG θα μπορούσε να παράγει στυλιστικά διαφορετικά εξόδους ενώ διατηρεί τη σχετικότητα και την έλξη. Οι συγγραφείς αναφέρουν:
‘[Η PCIG] διασφαλίζει τις στυλιστικά διαφορετικές εικόνες για να ταιριάξουν τις προτιμήσεις κλικ των διαφορετικών ομάδων χρηστών, και έτσι αποδεικνύει την ισχυρή ικανότητά της να προσαρμόσει τη γεννήτρια σε ετερογενείς απαιτήσεις χρηστών και να καταγράψει λεπτές, λεπτομερείς διαφορές προτιμήσεων σε διάφορες ομάδες χρηστών, υπογραμμίζοντας το δυναμικό της για γεννήτρια διαφήμισης ομάδας σε μεγάλη κλίμακα.’
Συμπέρασμα
Πιθανώς το πιο ενδιαφέρον χαρακτηριστικό αυτού του έργου είναι η άγνωστη συσχέτιση μεταξύ στυλ εξόδου σε εικόνες που στοχεύουν σε ομάδες για το ίδιο προϊόν (από τα οποία υπάρχουν πολλές σελίδες παραδείγματα στο συμπληρωματικό υλικό της εργασίας που δεν μπορούμε να αναπαράγουμε εδώ).
Μπορούμε να υποθέσουμε ότι αστικές φόντα σχετίζονται με ηλικία, δηλαδή με απόφοιτους που ξεκινούν, και ότι αγροτικές περιβάλλοντα στοχεύουν σε πιο ευημερούσες τύπους Gen X που ταυτίζουν το ανοιχτό δρόμο ως一种 “τελική ελευθερία”; Μπορούμε να δούμε αυτές τις δοκιμαστικές εξόδους όλη την ημέρα.
Το δυναμικό τέτοιων συστημάτων βασίζεται σε δύο παράγοντες: έμπνευση και καθυστέρηση. Η έμπνευση εξαρτάται από το αν οι αναδυόμενες συστήματα παρακολούθησης θα μπορούσαν ακόμα να εξάγουν αρκετές σημαντικές πληροφορίες από τους χρήστες για να υποστηρίξουν αποτελεσματική διαφήμιση ομάδας, και να βάλουν τα θεμέλια για πιο ακριβείς, εξατομικευμένες διαφημίσεις στο μέλλον.
Η καθυστέρηση θέτει μεγαλύτερη πρόκληση,既然 αυτές οι εξατομικευμένες εικόνες διαφήμισης πρέπει να δημιουργηθούν και να παραδοθούν σχεδόν αμέσως· αν και κάποια πρόσφατα μοντέλα κειμένου-σε-εικόνα μπορούν να παράγουν αποτελέσματα σε λίγα δευτερόλεπτα, ακόμη και αυτή η καθυστέρηση μπορεί να είναι πολύ μεγάλη για τις διαδικτυακές διαφημιστικές πλειστηριασμούς σε πραγματικό χρόνο.
Ένα πιθανό αντίδοτο είναι να παράγουν τις εικόνες τοπικά, στο GPU του προγράμματος περιήγησης, αποφεύγοντας τις περιφερειακές διαδρομές· ή να δημιουργήσουν μια ποικιλία εικόνων προληπτικά, προ-κεκαχωμένες στο πελάτη.
** Αυτό το аспект elides στην νέα εργασία, όπως και η πιθανότητα για sâuоко abuse των νέων πλαισίων AI (για παράδειγμα, deepfake abuse) συχνά απαλύνεται από τη χρήση γλυκών ζωικών σχημάτων (αντί για AI πορνογραφία) στις νέες μελέτες. Παρόλα αυτά, το είδος εικόνων που παρουσιάζεται στην εργασία αντιπροσωπεύει διαφημιστές στην καλύτερη συμπεριφορά τους, και όχι το πώς θα μπορούσαν οι προσωπικές οπτικές διαφημίσεις να γίνουν στο μέλλον, καθώς οι μεθόδους στόχευσης καταναλωτών συνδυάζονται με γρήγορη απάντηση γεννήτριας AI.
** Δεν μπορώ να αναγνωρίσω αυτήν την ονομασμένη ιδρύματος,既然 το ‘UCAS’ γενικά αντιστοιχεί σε ένα γνωστό βρετανικό clearing-house αιτήσεων πανεπιστημίου. Καλωσορίζω διευκρινίσεις.
† Που οι ερευνητές υποσχέθηκαν να δημοσιεύσουν στο σχετικό repository GitHub.
Πρώτη δημοσίευση Πέμπτη, 5 Φεβρουαρίου 2026












