Η γωνία του Anderson

Νέα Έρευνα Προτείνει Πραγματικά Προσωποποιημένη Διαφήμιση

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
A woman looks at a laptop displaying a news website, reacting with surprise as a banner advertisement on the page shows a smiling woman who closely resembles her.

Σε μια επαναedefinition του ‘αυτοπροώθησης’, μια νέα μέθοδος εξορύσσει τα δικά σας κλικ για να δημιουργήσει εξατομικευμένες διαφημίσεις ιστού με βάση την ιδιαίτερη ιστορία σας.

 

Αν και οι διαφημιστικές εταιρείες είναι ενθουσιασμένες να ανασκευάσουν την ιδέα ότι υπάρχουν διαφημιστικά κανάλια που μπορούν να σας προβάλλουν διαφημίσεις με βάση ό,τι μόλις είπατε στο σπίτι σας, το βαθμό ‘προσωποποίησης’ που έχουν δείξει οι διαφημίσεις στους ιστότοπους και τις εφαρμογές κοινωνικών μέσων έχει ωστόσο παραγάγει επικεφαλίδες τα τελευταία χρόνια.

Η ιδανική περίπτωση για τον διαφημιστή ήταν πάντα ότι η διαφήμιση που προβάλλεται να είναι ‘απόλυτο fit’ για τον θεατή. Μέσα στα όρια δημόσιου ανταγωνισμού για την παρακολούθηση στο διαδίκτυο και όποια προληπτικά μέτρα ο χρήστης μπορεί να έχει εγκαταστήσει ενάντια σε τέτοια παρακολούθηση, η γεννητική τεχνητή νοημοσύνη (αφήνοντας στην άκρη τους φόβους γύρω από διαφήμιση LLM σε ένα μετα-αναζήτηση κόσμο) είναι αρκετά ικανή να παράγει εικόνες διαφήμισης και κείμενο σε πραγματικό χρόνο.

Ωστόσο, η κύρια ώθηση της έρευνας και η większość των εφαρμογών σε αυτή τη γραμμή μέχρι σήμερα έχουν βασιστεί γύρω από συγκεντρωτικές στατιστικές χρήσης, ώστε οποιαδήποτε διαφήμιση που παράγεται για έναν θεατή να βασίζεται στην υποτιθέμενη ομάδα κοόρτη του θεατή αντί για την ιδιαίτερη ιστορία του.

Τώρα, μια νέα έρευνα συνεργασίας μεταξύ Κίνας και ΗΠΑ παρουσιάζει ένα σύστημα για την παραγωγή διαφημιστικών εικόνων και κειμένου για ατομικούς χρήστες, μαθαίνοντας από τα δικά τους προηγούμενα κλικ όταν συνδεθούν σε einen ιστότοπο, μεταβαίνοντας πέρα από τις υποθέσεις κοόρτης που έχουν κυβερνήσει την περισσότερη έρευνα προσωποποιημένης διαφήμισης μέχρι σήμερα:

Παραδείγματα εξατομικευμένων διαφημίσεων. Φυσικά, χωρίς την ιστορία του χρήστη ως контекст, η πλήρης επίδραση μπορεί μόνο να φανταστεί. Πηγή - https://arxiv.org/pdf/2605.12138

Παραδείγματα εξατομικευμένων διαφημίσεων. Φυσικά, χωρίς την ιστορία του χρήστη ως контекστ, η πλήρης επίδραση μπορεί μόνο να φανταστεί. Πηγή

Ασυνήθιστα, η νέα προσέγγιση απορρίπτει διαχύτη-βασισμένα μοντέλα υπέρ ενός αυτορεγουλωτού αρχιτεκτονικού στυλ – η κύρια διαφορά είναι ότι διαχύτη μοντέλα βελτιώνουν逐渐 μια εικόνα από οπτική θόρυβη, ενώ αυτορεγουλωτά μοντέλα παράγουν περιεχόμενο ένα κομμάτι κάθε φορά, προβλέποντας κάθε νέο στοιχείο από όλα αυτά που προηγήθηκαν.

Για να υποστηρίξει το νέο γεννητικό μοντέλο, οι συγγραφείς ανέπτυξαν αυτό που ισχυρίζονται ότι είναι το πρώτο μεγάλης κλίμακας σύνολο εικόνων/κειμένου για προσωποποιημένη διαφήμιση, καθώς και einen νέο δείκτη που σχεδιάστηκε για να αξιολογήσει αυτήν την πολύ συγκεκριμένη εργασία. Σε δοκιμές, βρήκαν ότι η προσέγγισή τους ξεπέρασε τόσο τις γενικές βάσεις όσο και τις υφιστάμενες μεθόδους και πλαισιά που αντιμετωπίζουν αυτήν την πρόκληση.

Κλειστός Κήπος

Αξίζει να σημειωθεί ο προτεινόμενος σκοπός του έργου, ο οποίος δεν προσφέρει στους διαφημιστές έναν τρόπο να παραβιάσουν τα νέα μέτρα κατά της τρίτων παρακολούθησης, αλλά αντίθετα δίνει σε einen μεγάλο λιανοπωλητή την δύναμη να πληρώσει einen συνδεδεμένο πελάτη με διαφημίσεις που σχετίζονται直接 με εκείνον τον άνθρωπο.

Αυτό δεν είναι απαραίτητα περιορισμένο στους πελάτες που είναι τώρα στην ιστοσελίδα του λιανοπωλητή: ανάλογα με το βαθμό στον οποίο ο χρήστης έχει χορηγήσει στον λιανοπωλητή την δύναμη να τον παρακολουθήσει σε άλλους ιστότοπους, μπορεί να του παρουσιαστούν στοχευμένες διαφημίσεις σε οποιονδήποτε άλλον ιστότοπο που συμμετέχει σε διαφημιστικές δημοπρασίες που ο λιανοπωλητής χρησιμοποιεί.

Είδος διαφήμιστικής εμβέλειας τείνει να περιοριστεί σε υψηλού όγκου, υψηλού επιπέδου εκδοτήρες όπως η Amazon, στη Δύση (και σημειώνουμε ότι ένας αναλογικά μεγαλύτερος Κινέζος λιανοπωλητής έχει συμμετάσχει στο νέο έργο – δείτε παρακάτω), αν και οποιαδήποτε παρόμοια μεγέθη εταιρεία (όπως ένας δημοφιλής ιστότοπος κοινωνικών μέσων) θα μπορούσε θεωρητικά να δημιουργήσει ένα παρόμοιο γεννητικό πλαίσιο.

Το νέο έγγραφο έχει τον τίτλο Σχεδιάστε τη Διαφήμιση Σας: Προσωποποιημένη Διαφήμιση Εικόνας και Κειμένου με Ενοποιημένα Αυτορεγουλωτά Μοντέλα, και προέρχεται από 18 συγγραφείς σε Πανεπιστήμιο Sun Yat-Sen στη Γκουανγκτζόου, Πανεπιστήμιο Northeastern και τον μεγαλύτερο λιανοπωλητή της Κίνας, JD.com (ο οποίος έχει αυτήν την πολύτιμη πρόσβαση στην ιστορία και τις συνήθειες των αγοραστών). Ο κώδικας έχει δημοσιευθεί μέσω GitHub, και οι σχετικές σημεία ελέγχου έχουν δημοσιευθεί επίσης.

Δεδομένα και Μέθοδος

Το σύνολο δεδομένων που κατασκευάστηκε για το έργο έχει τον τίτλο Προσωποποιημένη Διαφήμιση Εικόνας-Κειμένου (PAd1M), και τροφοδοτείται από δεδομένα που παρέχονται από τον συνεργάτη του έργου JD.com. Οι συγγραφείς δηλώνουν:

‘Κάθε προϊόν συνήθως παρέχει περισσότερες από δέκα υποψήφιες εικόνες και κείμενο, εξασφαλίζοντας ότι οι διαφορετικές προτιμήσεις μπορούν να ανιχνευτούν πλήρως. Για να ενεργοποιήσετε αξιόπιστη μοντελοποίηση προτίμησης, συλλέγουμε πλήρη ιστορικά κλικ χρηστών και σε εικόνες και κείμενο, φιλτράροντας τους χρήστες με ανεπαρκή δραστηριότητα για να μειώσουμε τον θόρυβο.

‘Αυτό μας δίνει ένα σύνολο δεδομένων 1.145.371 χρηστών, με 18.923.555 κλικ εικόνων και κειμένου προϊόντων, με μέσο όρο περισσότερες από δεκαέξι πολυσχιδιακές ιστορικές συμπεριφορές ανά χρήστη.’

Για κάθε χρήστη, ένα προηγουμένως κλικ εικόνας-κειμένου ζευγάρι επιλέχθηκε ως το στόχο παράδειγμα, μετά από οποίο το προϊόν selbst απομονώθηκε από την εικόνα χρησιμοποιώντας Grounded SAM.

Περιγραφές και πωλησιακά σημεία που παρέχονται από τον πωλητή wurden então προσαρτημένα στο ρεκόρ, δημιουργώντας ένα σύνολο δεδομένων στο οποίο κάθε στόχος διαφήμιση συνοδεύεται από eine διαφανή εικόνα προϊόντος: δομημένη πληροφορία προϊόντος και μια ιστορία προηγούμενων εικόνων και κειμένου αλληλεπιδράσεων, που προορίζεται να καταγράψει τις προηγούμενες ενδιαφέροντα και προτιμήσεις του χρήστη:

Ένα προφίλ χρήστη από το σύνολο δεδομένων PAd1M, που δείχνει μια στόχο διαφήμιση μαζί με τις πληροφορίες προϊόντος που χρησιμοποιήθηκαν για να τη δημιουργήσουν, και τις ιστορικές εικόνες και κειμένου αλληλεπιδράσεις που χρησιμοποιήθηκαν για να μοντελοποιήσουν τις προτιμήσεις του χρήστη.

Ένα προφίλ χρήστη από το σύνολο δεδομένων PAd1M, που δείχνει μια στόχο διαφήμιση μαζί με τις πληροφορίες προϊόντος που χρησιμοποιήθηκαν για να τη δημιουργήσουν, και τις ιστορικές εικόνες και κειμένου αλληλεπιδράσεις που χρησιμοποιήθηκαν για να μοντελοποιήσουν τις προτιμήσεις του χρήστη.

Το αποτέλεσμα σύνολο δεδομένων προσφέρει μια κλίμακα πάνω από 1 εκατομμύριο χρήστες και σχεδόν 19 εκατομμύρια κλικ εικόνων και κειμένου εγγραφών, με τους συγγραφείς να δηλώνουν ότι η συλλογή είναι σημαντικά μεγαλύτερη από τις προηγούμενες βάσεις δεδομένων προσωποποίησης.

Επιπλέον, τα δεδομένα, ασυνήθιστα για αυτήν την κατηγορία ερευνών, συνδυάζουν και εικόνες και κείμενο, επιτρέποντας στις προτιμήσεις χρηστών να μοντελοποιηθούν σε πολλαπλά μοντέλα, αντί να μοντελοποιηθούν μέσα σε ένα μόνο домήιο.

Pad1M επίσης χαρακτηρίζεται από ατομική-επίπεδο παρακολούθηση προτίμησης: αντίθετα με τις προηγούμενες βάσεις δεδομένων διαφήμισης, οι οποίες χτίστηκαν γύρω από ποσοστά κλικ που συναθροίζονται σε μεγάλες ομάδες, PAd1M συνδέει αλληλεπιδράσεις με συγκεκριμένους χρήστες από τα δεδομένα JD.com.

Για μετρήσεις, εκτός από τις τυπικές επιλογές BLEU και ROUGE, οι ερευνητές ανέπτυξαν το δικό τους μετρητή με τίτλο Ομοιότητα Φόντου Προϊόντος (PBS). Βασισμένο στο προηγούμενο MoCo-v3 πρωτοβουλία, PBS εκπαιδεύτηκε σε 681.123 ζευγάρια εικόνων που δείχνουν το ίδιο προϊόν σε διαφορετικά φόντα, επιτρέποντας στον μετρητή να επικεντρωθεί στην контекστιακή παραλλαγή αντί για το προϊόν selbst:

Ομοιότητα Φόντου Προϊόντος (PBS) αναθέτει σηματικά διαφορετικές βαθμολογίες ομοιότητας σε διαφημίσεις που περιέχουν το ίδιο προϊόν, αλλά το τοποθετούν σε διαφορετικά οπτικά περιβάλλοντα, σε αντίθεση με άλλους μετρητές, οι οποίοι παράγουν πολύ μικρότερες αποστάσεις.

Ομοιότητα Φόντου Προϊόντος (PBS) αναθέτει σηματικά διαφορετικές βαθμολογίες ομοιότητας σε διαφημίσεις που περιέχουν το ίδιο προϊόν, αλλά το τοποθετούν σε διαφορετικά οπτικά περιβάλλοντα. Αντίθετα, άλλοι μετρητές παράγουν πολύ μικρότερες αποστάσεις.

Κατά τη διάρκεια της εκπαίδευσης, κάθε εικόνα ζευγαρώθηκε με τον εαυτό της ως θετικό παράδειγμα, ενώ μια εικόνα του ίδιου προϊόντος σε ένα διαφορετικό περιβάλλον υπηρέτησε ως αρνητικό παράδειγμα, μια στρατηγική εκπαίδευσης που προορίζεται να αυξήσει την ευαισθησία στο φόντο.

Αποτελέσματα αξιολόγησης, το έγγραφο ισχυρίζεται, δείχνουν μεγαλύτερες διαφορές ομοιότητας μεταξύ ταιριαστών και μη ταιριαστών φόντων από αυτές που παράγονται από CLIP, DINO v3, ή το προαναφερθέν MoCov3.

Όπως φαίνεται στην επάνω-αριστερή ενότητα της εικόνας παρακάτω*, το Ενοποιημένο Γεννητικό Μοντέλο Διαφήμισης (Uni-AdGen) των ερευνητών χρησιμοποιεί μια αυτορεγουλωτή αρχιτεκτονική οράματος-γλώσσας για να παράγει και διαφημιστικό κείμενο και εικόνες. Η διαδικασία καθοδηγείται από μια δομημένη οδηγία που περιλαμβάνει τον ορισμό της εργασίας και μια περιγραφή προϊόντος, μαζί με κρίσιμους πωλησιακούς σημεία:

Επισκόπηση μεθόδου.

Επισκόπηση μεθόδου.

Ειδικοί διαχωριστικοί token ορίζουν το τμήμα της ακολουθίας που είναι διατηρημένο για διαφημιστικό κείμενο. Μετά τη δημιουργία του κειμένου, ένα αφιερωμένο εικόνας token προκαλεί τη δημιουργία εικόνας, ενώ ένα κλείσιμο εικόνας token σηματοδοτεί την ολοκλήρωσή της, με τα δημιουργημένα token να στέλνονται σε ξεχωριστούς αποκωδικοποιητές κειμένου και εικόνας.

Για εικόνες, ο αποκωδικοποιητής VQ-GAN του LlamaGen χρησιμοποιείται για να μετατρέψει διακριτά token εικόνας πίσω σε pixels.

Με αυτόν τον τρόπο, η ενοποιημένη αρχιτεκτονική παράγει κείμενο και εικόνες μέσα σε ένα μόνο πρόβλεψη επόμενου token πλαίσιο, αντί να βασίζεται σε ξεχωριστές διαδικασίες – η μέθοδος που υιοθετήθηκε για προηγούμενα συστήματα διαφήμισης με παρόμοιο πεδίο.

Κατά τη διάρκεια της εκπαίδευσης, το μοντέλο μαθαίνει και τα δύο μοντέλα μαζί, με token κειμένου που προβλέπονται με βάση την εισαγμένη ακολουθία και το προηγουμένως δημιουργημένο κείμενο. Token εικόνας προβλέπονται χρησιμοποιώντας την εισαγμένη ακολουθία, το δημιουργημένο κείμενο και τα προηγουμένως δημιουργημένα token εικόνας.

Για να διατηρήσει τις δημιουργημένες διαφημίσεις συνδεδεμένες με το προωθούμενο προϊόν, το Uni-AdGen χρησιμοποιεί ένα foreground-perception module που βασίζεται στο DINO v2, για να ενject πληροφορίες από διαφανείς εικόνες προϊόντων στο αυτορεγουλωτό μοντέλο.

Instruction-tuning (εκπαίδευση του μοντέλου να ακολουθεί οδηγίες δημιουργίας προϊόντος που προέρχονται από περιγραφές και πωλησιακά σημεία) χρησιμοποιήθηκε επίσης για να βελτιώσει την συμμόρφωση με τις περιγραφές και τα πωλησιακά σημεία που παρέχονται από τον πωλητή, με GPT-4o να χρησιμοποιείται για να φιλτράρει ακατάλληλα παραδείγματα εκπαίδευσης.

Η προσωποποίηση βασίστηκε σε ένα coarse-to-fine μοντέλο κατανόησης προτίμησης. Ιστορικές αλληλεπιδράσεις φιλτράρονταν πρώτα μέσω ενός πipelines Product Similarity Sampling (PSS) για να ευνοήσουν προϊόντα που μοιάζουν με το στόχο αντικείμενο. Τα υπόλοιπα ρεκόρ επεξεργάζονταν τότε από ένα Multimodal Preference Extraction στάδιο που σχεδιάστηκε για να αναγνωρίσει τα οπτικά και κειμενικά στοιχεία που είναι πιο πιθανό να αντανακλούν τα ενδιαφέροντα του χρήστη – με αυτές τις προτιμήσεις να εισάγονται στο prompt, για να καθοδηγήσουν τη δημιουργία.

Δοκιμές

Οι συγγραφείς δηλώνουν ότι η προσέγγισή τους δοκιμής προέρχεται από DeepSeek’s Janus-Pro 7B.

Το μοντέλο εκπαιδεύτηκε σε ένα μέγεθος batch των τεσσάρων, υπό τον AdamW βελτιωτή σε μια ταχύτητα μάθησης 5e-5. Το βασικό μοντέλο ήταν fine-tuned μέσω LoRA, με την foreground perception και την multimodal preference extraction πλήρως fine-tuned (δηλαδή, αντίθετα με το LoRA, τα βάρη του βασικού μοντέλου τροποποιήθηκαν μόνιμα).

Όλες οι δοκιμές εκτελέστηκαν σε μια NVIDIA B200 GPU με 192GB VRAM. Για τη δημιουργία εικόνας, PickScore, ImageReward, και ASE χρησιμοποιήθηκαν για να μετρήσουν την ποιότητα εικόνας, ενώ m-BLEU και m-ROUGE χρησιμοποιήθηκαν για να αξιολογήσουν το διαφημιστικό κείμενο. Ανθρώπινοι αξιολογητές αξιολόγησαν επίσης την πραγματικότητα εικόνας και την ποιότητα διάταξης, μαζί με την ακρίβεια και την ευεξία κειμένου, με όλα τα μετρητικά να υπολογίζονται σε 500 προϊόντα.

Για τη δημιουργία εικόνας, οι βάσεις που χρησιμοποιήθηκαν ως σύγκριση αποτελούσαν Qwen2.5-VL και GPT-4o για τη δημιουργία προτύπων φόντου από εικόνες προϊόντων, ακολουθούμενα από ReliableAd, PosterMaker, και Flux-Fill για τη δημιουργία των τελικών διαφημίσεων. Οι συγκρίσεις κειμένου διεξήχθησαν ενάντια στο Qwen2.5, Qwen3, και DeepSeek-R1.

Αρχικές βάσεις ποσοτικών αποτελεσμάτων για τη δημιουργία διαφήμισης εμφανίζονται παρακάτω:

Επίδραση στο γενικό πρότυπο δημιουργίας διαφήμισης. Το Uni-AdGen ισοφάρισε ή ξεπέρασε τις ισχυρότερες βάσεις δημιουργίας εικόνας σε αισθητική ποιότητα και PickScore, ενώ το ενοποιημένο μοντέλο εικόνας και κειμένου πέτυχε το υψηλότερο m-ROUGE σκορ μεταξύ όλων των προσεγγίσεων κειμένου. Τα αποτελέσματα αξιολόγησης ανθρώπων παρέμειναν ανταγωνιστικά σε cả τα δύο μοντέλα.

Επίδραση στο γενικό πρότυπο δημιουργίας διαφήμισης. Το Uni-AdGen ισοφάρισε ή ξεπέρασε τις ισχυρότερες βάσεις δημιουργίας εικόνας σε αισθητική ποιότητα και PickScore, ενώ το ενοποιημένο μοντέλο εικόνας και κειμένου πέτυχε το υψηλότερο m-ROUGE σκορ μεταξύ όλων των προσεγγίσεων κειμένου. Τα αποτελέσματα αξιολόγησης ανθρώπων παρέμειναν ανταγωνιστικά σε cả τα δύο μοντέλα.

Από αυτά τα αποτελέσματα, οι συγγραφείς δηλώνουν:

‘Η μέθοδός μας επιτυγχάνει την καλύτερη απόδοση σε ImageReward και κατατάσσεται δεύτερη και σε PickScore και ανθρώπινη αξιολόγηση, αποδεικνύοντας την υπεροχή της σε αισθητική και υψηλή διαθέσιμη ποσοστό. Ενώ το ReliableAd προηγείται στην ανθρώπινη αξιολόγηση, υστερεί σημαντικά σε αισθητικές μετρήσεις. Αντίθετα, το PosterMaker και το Flux-Fill παράγουν οπτικά ελκυστικές εικόνες αλλά υποφέρουν από προφανείς περιορισμούς χρηστικότητας.

‘Χάρη στις αποτελεσματικές προσεγγίσεις ελέγχου, η μέθοδός μας επιτυγχάνει με επιτυχία μια ιδανική ισορροπία μεταξύ οπτικού περιεχομένου και πρακτικής उपयσιμότητας.’

Προσωποποιημένη δημιουργία διαφήμισης αξιολογήθηκε σε 500 χρήστες με καταγεγραμμένες ιστορίες αλληλεπιδράσεων, χρησιμοποιώντας τον προαναφερθέν PBS για να μετρήσει την ομοιότητα εικόνας, και BLEU και ROUGE για να συγκρίνει το δημιουργημένο κείμενο με προϊόντα που οι χρήστες είχαν πραγματικά κάνει κλικ.

Επειδή οι γενικές βάσεις διαφήμισης που χρησιμοποιήθηκαν στην προηγούμενη πειραματική διαδικασία δεν μπορούσαν να ενσωματώσουν ιστορίες χρηστών, οι συγκρίσεις μεταφέρθηκαν σε συστήματα που σχεδιάστηκαν για προσωποποίηση. Για τη δημιουργία εικόνας, Flux-Kontext και Pigeon επιλέχθηκαν ως βάσεις. Το Flux-Kontext προμήθευσε με einen πίνακα ιστορικών εικόνων χρήστη μαζί με την εικόνα προϊόντος-στόχο, επιτρέποντας στις προηγούμενες προτιμήσεις να επηρεάσουν τη δημιουργία.

Επειδή το Pigeon δεν υποστηρίζει φυσικά ελεγχόμενη τοποθέτηση προϊόντος, το foreground-perception module που αναπτύχθηκε για το Uni-AdGen ενσωματώθηκε για να διατηρήσει τη συνέπεια προϊόντος. Για τη δημιουργία κειμένου, Qwen3 και DeepSeek-R1 χρησιμοποιήθηκαν, με ιστορικές περιγραφές προϊόντων που εισάγονται直接 στο πρότυπο οδηγιών τους για να παρέχουν контекστ προσωποποίησης:

Αποτελέσματα προσωποποιημένης δημιουργίας διαφήμισης. Το Uni-AdGen ξεπέρασε το Flux-Kontext, Pigeon, Qwen3, και DeepSeek-R1 σε όλα τα μετρημένα μετρητικά προσωποποίησης, ενώ η μελέτη ablation έδειξε ότι τα ιστορικά δεδομένα χρηστών, η δειγματοληψία ομοιότητας προϊόντος (PSS), και η εξαγωγή προτίμησης multimodal συνεισέφεραν μετρητές κέρδη.

Αποτελέσματα προσωποποιημένης δημιουργίας διαφήμισης. Το Uni-AdGen ξεπέρασε το Flux-Kontext, Pigeon, Qwen3, και DeepSeek-R1 σε όλα τα μετρημένα μετρητικά προσωποποίησης, ενώ η μελέτη ablation έδειξε ότι τα ιστορικά δεδομένα χρηστών, η δειγματοληψία ομοιότητας προϊόντος (PSS), και η εξαγωγή προτίμησης multimodal συνεισέφεραν μετρητές κέρδη.

Εδώ οι συγγραφείς σχολιάζουν:

‘Τα οπτικά αποτελέσματα [περιλαμβάνονται στην εικόνα παρακάτω] δείχνουν ότι το Flux-Kontext αποτυγχάνει να κατανοήσει τις προτιμήσεις του χρήστη και παραμένει ευάλωτο σε θόρυβο δείγματος, οδηγώντας σε σημαντική απόκλιση από την πραγματικότητα, όπως τα μη σχετικά αντικείμενα στην εικόνα μοτοσικλέτας.’

Παραδείγματα προσωποποιημένης δημιουργίας διαφήμισης. Σε σύγκριση με το Flux-Kontext, Pigeon, Qwen3, και DeepSeek-R1, το Uni-AdGen παρήγαγε εικόνες που ταιριάζουν περισσότερο με τον οπτικό στυλ και το контекστ διαφημίσεων που οι χρήστες είχαν πραγματικά κάνει κλικ, ενώ παράγοντας κείμενο που κατέγραψε μεγαλύτερο ποσοστό των χαρακτηριστικών προϊόντων και πωλησιακών σημείων που παρουσιάζονται στα παραδείγματα πραγματικότητας. Τα ταιριαστά όροι είναι υπογραμμισμένα με πράσινο.

Παραδείγματα προσωποποιημένης δημιουργίας διαφήμισης. Σε σύγκριση με το Flux-Kontext, Pigeon, Qwen3, και DeepSeek-R1, το Uni-AdGen παρήγαγε εικόνες που ταιριάζουν περισσότερο με τον οπτικό στυλ και το контекστ διαφημίσεων που οι χρήστες είχαν πραγματικά κάνει κλικ, ενώ παράγοντας κείμενο που κατέγραψε μεγαλύτερο ποσοστό των χαρακτηριστικών προϊόντων και πωλησιακών σημείων που παρουσιάζονται στα παραδείγματα πραγματικότητας. Τα ταιριαστά όροι είναι υπογραμμισμένα με πράσινο.

Τα ποιοτικά παραδείγματα, οι συγγραφείς ισχυρίζονται, δείχνουν ότι το Flux-Kontext και το Pigeon συχνά παρήγαγαν εξόδους που απομακρύνθηκαν από τις οπτικές ιδιότητες διαφημίσεων που οι χρήστες είχαν προηγουμένως κάνει κλικ: ενώ το κείμενο που παράγεται από το Qwen3 και το DeepSeek-R1 παρέλειψε κάποια πωλησιακά σημεία που παρουσιάζονται στα παραδείγματα πραγματικότητας.

Συμπέρασμα

Η χρησιμότητα αυτού του έργου εξαρτάται完全 από την opt-in του χρήστη, και η επέκταση της εμβέλειας αυτού του ‘προβλεπτικού’ συστήματος πέρα από το πεδίο του τομέα που ελέγχει την ιστορία του χρήστη – σε αυτήν την περίπτωση, JD.com – απαιτεί ακόμη πιο χαλαρά σύνολα ρητών разрешений χρήστη, σε meisten περιοχές.

Ωστόσο, το σύστημα βασίζεται στο είδος του υπερκλίμακας δικτύου που λειτουργεί σε τέτοια περίπτωση, και στην (ίσως ελαφρώς εύκολη) ιδέα ότι οι χρήστες θα βρουν αυτό το είδος πραγματικά προσωποποιημένης και ακόμη και προφητικής συστήματος recommender χρήσιμο αντί για ενοχλητικό, τουλάχιστον μέσα στο контекστ ενός λιανοπωλητή-γίγαντα.

 

* Αυτή η εικόνα κτίζει στην ανησυχητική νέα τάση ‘συνδυασμένων σχημάτων’ σε ερευνητικά έγγραφα, όπου εικονογραφήσεις που θα ήταν κάποτε 3-4 διαφορετικά σχήματα συνδυάζονται σε ένα (για τον σκοπό της υπακοής στις οδηγίες υποβολής για το μέγιστο μήκος του κύριου εγγράφου) και χρησιμοποιούνται μόνο ως αναφορά υλικό, συχνά χωρίς επαρκή εξήγηση στο συνοδευτικό σχόλιο.

‘m’-prefix υποδηλώνει σύγκριση με πολλαπλά υποψήφια κείμενα.

Πρώτη δημοσίευση Τρίτη, 2 Ιουνίου 2026. Τροποποιήθηκε 18:21 EET για να διορθώσει το τελικό ‘τοίχο’ σε ‘κλειστό κήπο’ στην τελευταία παράγραφο.

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai