Η γωνία του Anderson

Προετοιμασία για Διαφήμιση σε Μεγάλες Γλωσσικές Μοντέλα

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
Source: ChatGPT-4o and https://commons.wikimedia.org/wiki/File:Microsoft_Surface_Laptop_7.jpg

Νέα έρευνα δείχνει πώς οι διαφημίσεις θα μπορούσαν σύντομα να ενσωματωθούν直接 μέσα στις απαντήσεις τύπου ChatGPT – όχι ως banner ή pop-up, αλλά υφασμένες στην ίδια την απάντηση. Ένας νέος δείκτης δοκιμών ελέγχει πώς καλά αυτές οι απαντήσεις με διαφημίσεις μπορούν να παραμείνουν χρήσιμες, πιστευτές και κερδοφόρες, και μπορεί να απαιτήσει ένα συμβιβασμό μεταξύ μιας αποδεκτής εμπειρίας χρήστη και κλικ.

 

Καθώς η ευρεία και αυξανόμενη δημοτικότητα των Μεγάλων Γλωσσικών Μοντέλων υπονομεύει τις παραδοσιακές μεθόδους διαφήμισης που έχουν ενεργοποιήσει το διαδίκτυο σχεδόν από την ίδρυσή του, όποιος είναι εξοικειωμένος με τις τακτικές κατοχής αγοράς των επενδυτικών κεφαλαίων θα αναρωτιέται πόσο ακόμη τα chatbot του AI θα μπορέσουν να κρατήσουν τις διαφημίσεις εκτός από τις απαντήσεις τους.

Καθώς το Netflix και μια επεκτεινόμενη λίστα υπηρεσιών streaming δείχνει, η παραδοσιακή στρατηγική της καλωδιακής εποχής της συνδυασμένης πληρωμένης συνδρομής με ενσωματωμένες διαφημίσεις (συχνά δικαιολογημένες ως τρόπος για να giữ τις κόστος καταναλωτών xuống) κερδίζει ξανά έδαφος· και η μετατόπιση προς την ενσωμάτωση διαφημίσεων直接 στις εξόδους των LLM αρχίζει να φαίνεται λιγότερο εικασιακή και περισσότερο σαν μια φυσική υιοθέτηση του μοντέλου.

Από το έγγραφο 'Διαδικτυακές Διαφημίσεις με LLMs: Ευκαιρίες και Προκλήσεις', ένα assez αντιπροσωπευτικό παράδειγμα της μετάβασης που περιμένουν οι περισσότεροι άνθρωποι όταν τα LLMs κερδοφόρησαν. Πηγή: https://www.sigecom.org/exchanges/volume_22/2/FEIZI.pdf

Από το έγγραφο ‘Διαδικτυακές Διαφημίσεις με LLMs: Ευκαιρίες και Προκλήσεις’, ένα assez αντιπροσωπευτικό παράδειγμα της μετάβασης που περιμένουν οι περισσότεροι άνθρωποι όταν τα LLMs κερδοφόρησαν. Πηγή: https://www.sigecom.org/exchanges/volume_22/2/FEIZI.pdf

Η προοπτική της ενσωμάτωσης διαφημίσεων σε ένα αναδυόμενο μέσο που ήδη έχει αξιοσημείωτα ζητήματα με πιστευτικότητα, μπορεί να φαίνεται προωθημένη· ωστόσο η κλίμακα επένδυσης σε γεννητικές AI κατά τους τελευταίους δώδεκα μήνες υποδηλώνει ότι η αγορά δεν ορίζεται τώρα από μια προσεκτική ή περιστασιακή στάση· και με μεγαλύτερες εταιρείες όπως το OpenAI που επιχειρηματολογούν για υπερχρέωση και χρειάζονται ένα πρώιμο επιστροφή στην επένδυση, η ιστορία δείχνει ότι η περίοδος του μέλιτος των διαφημιστικών εξόδων μπορεί να τελειώνει.

GEM-Bench

Με αυτό το κλίμα και αυτές τις επιχειρηματικές απαιτήσεις στο μυαλό, ένα ενδιαφέρον νέο έγγραφο από τη Σιγκαπούρη προσφέρει το πρώτο δείκτης που στοχεύει στις διεπαφές chatbot του AI, μαζί με νέους ποσοτικούς μετρητές για το τι μπορεί να αποδειχθεί ένα από τα πιο εκρηκτικά διαφημιστικά πεδία στα 100 χρόνια.

Πιθανότατα αισιόδοξα, οι συγγραφείς υποθέτουν μια καθαρή διαίρεση μεταξύ ‘αληθινών’ περιεχομένων και διαφημιστικών περιεχομένων, όπου η ‘απομάκρυνση’ από τις τυποποιημένες απαντήσεις σε διαφημιστικό υλικό είναι khá εύκολη να εντοπιστεί:

Παραδείγματα του είδους της ενσωμάτωσης διαφήμισης που μπορεί να συμβεί υπό δύο μοντέλα που μελετώνται στο νέο έγγραφο. Πηγή: https://arxiv.org/pdf/2509.14221

Παραδείγματα του είδους της ενσωμάτωσης διαφήμισης που μπορεί να συμβεί υπό δύο μοντέλα που μελετώνται στο νέο έγγραφο. Πηγή: https://arxiv.org/pdf/2509.14221

Παραμένει να δούμε εάν οι διαφημιστές θα ζητήσουν να έχουν το διαφημιστικό υλικό τους πιο υποβλητικά ενσωματωμένο στην έξοδο από τα παραδείγματα που δίνονται στο έγγραφο.

Ωστόσο, αυτά είναι θέματα για αργότερα· για την ώρα, το πεδίο είναι τόσο νεαρό που ακόμη και βασική ορολογία λείπει, ή αλλιώς δεν έχει ορισθεί.

Το έγγραφο εισάγει λοιπόν την Γεννητική Μηχανή Marketing (GEM) ως ένα νέο πλαίσιο για την κερδοφόρηση των chatbot που βασίζονται σε LLM, ενσωματώνοντας σχετικές διαφημίσεις直接 στις γεννημένες απαντήσεις.

Οι ερευνητές αναφέρουν την Απάντηση με Διαφημιστικό Εγχύσιμο (AIR) ως την κεντρική πρόκληση στη GEM, και υποστηρίζουν ότι τα υπάρχοντα δείκτες δεν είναι κατάλληλα για τη μελέτη της. Για να καλύψουν αυτό το κενό, εισάγουν αυτό που ισχυρίζονται ότι είναι ο πρώτος δείκτης που σχεδιάστηκε ειδικά για αυτόν τον σκοπό.

Το GEM-Bench αποτελείται από τρία επιμελημένα σύνολα δεδομένων που καλύπτουν σενάρια chatbot και μηχανών αναζήτησης. Περιλαμβάνει επίσης μια οντολογία μετρητών που σχεδιάστηκε για να αξιολογήσει πολλαπλά σημεία της ικανοποίησης και της εμπλοκής του χρήστη, μαζί με μια σειρά βασικών μεθόδων που εφαρμόζονται σε ένα modulaire multi-agent πλαίσιο.

Οι συγγραφείς υποστηρίζουν ότι ενώ οι απλές μεθόδους που βασίζονται σε προτροπές μπορούν να επιτύχουν σεβαστές μετρητές εμπλοκής, όπως αυξημένα ποσοστά κλικ, αυτά tend να μειώνουν την ικανοποίηση του χρήστη. Από την άλλη πλευρά, οι προσεγγίσεις που εισάγουν διαφημίσεις σε προ-γεννημένες, διαφημιστικές-ελεύθερες απαντήσεις δείχνουν βελτιώσεις στην εμπιστοσύνη και την ποιότητα της απάντησης – αν και με το κόστος μεγαλύτερου υπολογιστικού φορτίου.

Αυτά τα συμβιβασμούς, το έγγραφο υποστηρίζει, υπογραμμίζουν την ανάγκη για πιο αποτελεσματικές και αποτελεσματικές τεχνικές για την ενσωμάτωση διαφημίσεων στις γεννητικές εξόδους.

Το νέο έργο έχει τον τίτλο GEM-Bench: Ένας Δείκτης για την Γεννητική Μηχανή Marketing, και προέρχεται από τέσσερις ερευνητές στο Εθνικό Πανεπιστήμιο της Σιγκαπούρης.

Μέθοδος

Ο περίγραμμα για τη Γεννητική Μηχανή Marketing (GEM) δανείζεται από τις βασικές αρχές της Μηχανής Αναζήτησης Marketing (SEM). Η παραδοσιακή SEM λειτουργεί με την αντιστοίχιση ερωτημάτων σε διαφημίσεις μέσω ενός πολλαπλού σταδίου pipeline όπου οι διαφημιστές bieten σε λέξεις-κλειδιά· το σύστημα αναγνωρίζει ποια ερωτήματα ενεργοποιούν διαφημίσεις· το σύστημα εκτιμά πόσο πιθανό είναι κάθε διαφήμιση να κλικ· και στη συνέχεια αναθέτει την τοποθέτηση μέσω μιας δημοπρασίας που ισορροπεί τις προσφορές με την προβλεπόμενη εμπλοκή.

Αντίθετα, η προσέγγιση GEM προσαρμόζει τα ίδια στάδια στα LLM, αλλά αντιμετωπίζει νέες προκλήσεις σε κάθε βήμα: δεν υπάρχουν σταθερές διαφημιστικές θέσεις, οπότε το σύστημα πρέπει να αποφασίσει εάν μια ερώτηση μπορεί να πάρει μια διαφήμιση και πού να την εισάγει στο ελεύθερο κείμενο· η εκτίμηση του ποσοστού κλικ γίνεται πιο δύσκολη χωρίς δομημένα σχέδια· και η σχετικότητα πρέπει να ισορροπηθεί με την ικανοποίηση του χρήστη,既然 οι διαφημίσεις είναι υφασμένες直接 στην έξοδο του μοντέλου.

Μια από τις βασικές μεθόδους που μελετώνται στο έργο, Ad-Chat, αντιπροσωπεύει μια απλή μέθοδο όπου το διαφημιστικό υλικό εισάγεται στο σύστημα προτροπής πριν από τη γεννήτηση της απάντησης. Αυτό σημαίνει ότι το μοντέλο παράγει μια απάντηση με τη διαφήμιση ήδη ενσωματωμένη, καθοδηγούμενο από einen προ-φορτωμένο προγραμματισμό.

Η άλλη προσέγγιση, Ad-LLM, αναπτύχθηκε από τους συγγραφείς ως μέρος του νέου δείκτη. Το Ad-LLM ακολουθεί μια modulaire οδό, πρώτα γεννώντας μια καθαρή, διαφημιστική-ελεύθερη απάντηση· επιλέγοντας μια σχετική διαφήμιση· αναγνωρίζοντας το καλύτερο σημείο εισαγωγής με βάση τη σημασιολογική ροή· και τελικά ανασχηματίζοντας την έξοδο για να ενσωματώσει τη διαφήμιση ομαλά:

Σύγκριση μεταξύ Ad-Chat και της μεθόδου 'Ad-LLM' των συγγραφέων. Το Ad-Chat εισάγει διαφημίσεις μέσω της προτροπής του συστήματος πριν από τη γεννήτηση, με περιορισμένο έλεγχο τοποθέτησης. Το Ad-LLM διαχωρίζει τη γεννήτηση της απάντησης και την εισαγωγή της διαφήμισης, επιλέγοντας σημεία εισαγωγής με βάση τη σημασιολογική ροή, και βελτιώνοντας το αποτέλεσμα. Και τα δύο αξιολογούνται χρησιμοποιώντας μετρητές GEM-Bench για ικανοποίηση και εμπλοκή

Σύγκριση μεταξύ Ad-Chat και της μεθόδου ‘Ad-LLM’ των συγγραφέων. Το Ad-Chat εισάγει διαφημίσεις μέσω της προτροπής του συστήματος πριν από τη γεννήτηση, με περιορισμένο έλεγχο τοποθέτησης. Το Ad-LLM διαχωρίζει τη γεννήτηση της απάντησης και την εισαγωγή της διαφήμισης, επιλέγοντας σημεία εισαγωγής με βάση τη σημασιολογική ροή, και βελτιώνοντας το αποτέλεσμα. Και τα δύο αξιολογούνται χρησιμοποιώντας μετρητές GEM-Bench για ικανοποίηση και εμπλοκή.

Ενώ το Ad-Chat είναι φθηνότερο και μερικές φορές πιο πειστικό, tend να μειώνει την εμπιστοσύνη και την ακρίβεια. Το Ad-LLM επιτυγχάνει καλύτερα στα μετρητές ικανοποίησης του χρήστη, αλλά με μεγαλύτερο κόστος.

Δεδομένα

Για τη γεννήτηση απαντήσεων με διαφημίσεις, δύο τύποι συνόλων δεδομένων δημιουργήθηκαν αρχικά: ένα σύνολο ερωτημάτων-απαντήσεων (Χρήστης) και μια βάση δεδομένων διαφημίσεων (AdDB).

Καθώς τα ερωτήματα των χρηστών ορίζουν ευκαιρίες διαφήμισης στις απαντήσεις του LLM, το ‘διαφημιστικό απόθεμα’ μπορεί να θεωρηθεί ότι υπάρχει σε αυτές τις απαντήσεις, αν και αυτό ορίζεται όχι μόνο από την εφαρμοσιμότητα του ερωτήματος του χρήστη αλλά και το βαθμό στον οποίο το σύστημα θα υπακούσει στις δικές του κανόνες για την ισορροπία της ακεραιότητας έναντι των απαιτήσεων των διαφημιστών.

Σε κάθε περίπτωση, οι διαφημίσεις θα εμφανίζονται μόνο στις απαντήσεις, ακόμη και αν (βλέπε σχήμα παραπάνω) τα αιτήματα των χρηστών μπορεί να είναι κρυφά επαυξημένα για να διευκολύνουν τη διαδικασία εξυπηρέτησης διαφημίσεων.

Για το σενάριο του chatbot, οι συγγραφείς κατασκεύασαν δύο σύνολα ερωτημάτων: MT-Ανθρώπινος και LM-Αγορά.

Το MT-Ανθρώπινος προέρχεται από το τμήμα ανθρωπιστικών επιστημών του MT-Bench, ενός multi-στροφικού δείκτη για LLM, και περιέχει ερωτήματα που πιθανότατα να περιέχουν διαφημιστικό υλικό.

Το LM-Αγορά κατασκευάστηκε από πάνω από μισό εκατομμύριο πραγματικά ερωτήματα ChatGPT που συλλέχθηκαν από LMSYS-Chat-1M, φιλτραρισμένα για αγγλικές marketing-σχετικές προτροπές, και ομαδοποιημένα ανά θέμα χρησιμοποιώντας σημασιολογικές ενσωματώσεις.

Σε cả τις περιπτώσεις, τα τελικά ερωτήματα επιλέχθηκαν μέσω μιας πολλαπλής σταδίου pipeline που συνδύασε αυτόματη ομαδοποίηση, βαθμολογία LLM, και ανθρώπινη επαλήθευση, με στόχο την αναγνώριση προτρόπων όπου η εισαγωγή διαφήμισης θα ήταν φυσική και πιθανή.

Για να αξιολογήσουν την ποιότητα των απαντήσεων με διαφημίσεις, το GEM ορίζει μια οντολογία μετρητών που καλύπτει τόσο την ικανοποίηση του χρήστη όσο και την εμπλοκή. Αυτό περιλαμβάνει ποσοτικά μετρητές όπως ροή της απάντησης, συνέχεια, και ποσοστό κλικ, καθώς και ποιοτικά πρότυπα όπως εμπιστοσύνη, ακρίβεια, και φυσικότητα – μετρητές που προορίζονται να αντανακλούν τόσο πόσο καλά μια διαφήμιση ταιριάζει σε μια απάντηση, όσο και πόσο πιθανό είναι οι χρήστες να την αντιληφθούν και να αλληλεπιδράσουν με αυτήν.

Σχετικά με τη ‘Φυσικότητα’, το έγγραφο αναφέρει:

‘[Φυσικότητα] μετρά το βαθμό στον οποίο η εισαγωγή διαφήμισης διαταράσσει τη ροή και τη φυσικότητα της συζήτησης, με βάση την ενοχλητικότητα και την αυθεντικότητα. Η ενοχλητικότητα εξετάζει εάν η διαφήμιση δημιουργεί μια “απρόσκλητη” ή “απρόβλεπτη” αίσθηση κατά τη διάρκεια της ανάγνωσης, διαταράσσοντας την συνεχή εστίαση του χρήστη στο θέμα.

‘Η αυθεντικότητα αξιολογεί εάν η διαφήμιση υπονομεύει την “ανθρώπινη επαφή” ή τη “φυσική ροή” της συζήτησης, καθιστώντας την απάντηση να φαίνεται σκληρή, τυποποιημένη και λιγότερο αυθεντική.’

Για να δημιουργηθεί ένα παραδοσιακό σενάριο αναζήτησης για τη φάση δοκιμών, οι συγγραφείς δημιούργησαν ένα σύνολο δεδομένων με τίτλο CA-Prod από το AdsCVLR εμπορικό σώμα, το οποίο περιέχει 300.000 ζευγάρια ερωτημάτων-διαφημίσεων, κάθε ένα αποτελούμενο από μια λέξη-κλειδί, μεταδεδομένα, και một χειροκίνητο λεζάντα που σηματοδοτεί τη σχετικότητα:

Από το αρχικό έγγραφο, παραδείγματα από το σύνολο δεδομένων AdsCVLR, το οποίο βοήθησε να παρέχει υλικό για τις δοκιμές των συγγραφέων. Πηγή: http://www.jdl.link/doc/2011/20221224_AdsCVLR.pdf

Από το αρχικό έγγραφο, παραδείγματα από το σύνολο δεδομένων AdsCVLR, το οποίο βοήθησε να παρέχει υλικό για τις δοκιμές των συγγραφέων. Πηγή: http://www.jdl.link/doc/2011/20221224_AdsCVLR.pdf

Εγγραφές με λείπαντα πεδία αφαιρέθηκαν, και μόνο ερωτήματα που περιείχαν τόσο θετικές όσο και αρνητικές διαφημίσεις (βλέπε εικόνα παραπάνω για παραδείγματα) διατηρήθηκαν.

Για να βελτιώσουν τα δεδομένα, οι διαφημίσεις ομαδοποιήθηκαν σε έξι θεματικές ομάδες (εξοπλισμός γκαζόν και κήπου, παπούτσια σλιπ-ον, οικιακές用品, διατροφικά συμπληρώματα, συσκευές Android, και γυναικεία φορέματα) χρησιμοποιώντας σημασιολογικές ενσωματώσεις και K-means ομαδοποίηση.

Ερωτήματα ανατέθηκαν σε θέματα σύμφωνα με τις θετικές διαφημίσεις τους, με υπερβολικά σπάνια ή πυκνά σύνολα εξαιρεμένα, πριν 120 ερωτήματα και 2.215 μοναδικά προϊόντα τελικά δειγματοληπθούν για το δείκτη.

Δοκιμές

Για να αξιολογήσουν πόσο καλά οι διάφορες στρατηγικές εισαγωγής διαφημίσεων εκτελέστηκαν, ο δείκτης αντιμετώπισε τρία βασικά ερωτήματα: πόσο αποτελεσματικές ήταν κάθε μέθοδος σε σχέση με τους ορισμένους μετρητές ικανοποίησης και εμπλοκής: πώς οι εσωτερικές σχεδιαστικές επιλογές στο Ad-LLM θα μπορούσαν να επηρεάσουν τα αποτελέσματά του: και πώς το υπολογιστικό κόστος θα συγκρινόταν σε σύγκριση με τα συστήματα.

Οι συγγραφείς αξιολόγησαν το Ad-Chat και τρεις παραλλαγές της πιπερίλης Ad-LLM, κάθε eine από τις οποίες διέφερε στο πώς οι διαφημίσεις ανακτήθηκαν (είτε από την προτροπή είτε από την γεννημένη απάντηση), και εάν η τελική έξοδος ανασχηματιζόταν για ευ流.

Όλες οι μεθόδους εκτελέστηκαν χρησιμοποιώντας doubao-1-5-lite-32k ως το βασικό μοντέλο και κρίθηκαν με gpt-4.1-mini.

Αποτελεσματικότητα του Ad-Chat και των παραλλαγών Ad-LLM σε σχέση με τα σύνολα δεδομένων MT-Ανθρώπινος, LM-Αγορά, και CA-Prod. Ποσοτικά μετρητές περιλαμβάνουν ροή απάντησης (RF), συνέχεια απάντησης (RC), ροή διαφήμισης (AF), συνέχεια διαφήμισης (AC), ποσοστό εισαγωγής (IR), ποσοστό κλικ (CTR), και συνολικούς βαθμούς. Ποιοτικά μετρητές καλύπτουν ακρίβεια, φυσικότητα, προσωπικότητα, εμπιστοσύνη, ενημέρωση, κλικ(-παρά), και συνολική απόδοση.

Αποτελεσματικότητα του Ad-Chat και των παραλλαγών Ad-LLM σε σχέση με τα σύνολα δεδομένων MT-Ανθρώπινος, LM-Αγορά, και CA-Prod. Ποσοτικά μετρητές περιλαμβάνουν ροή απάντησης (RF), συνέχεια απάντησης (RC), ροή διαφήμισης (AF), συνέχεια διαφήμισης (AC), ποσοστό εισαγωγής (IR), ποσοστό κλικ (CTR), και συνολικούς βαθμούς. Ποιοτικά μετρητές καλύπτουν ακρίβεια, φυσικότητα, προσωπικότητα, εμπιστοσύνη, ενημέρωση, κλικ(-παρά), και συνολική απόδοση.

Σε όλα τα τρία σύνολα δεδομένων, το Ad-LLM παρήγαγε ισχυρότερα αποτελέσματα από το Ad-Chat και στις μετρητές ικανοποίησης και εμπλοκής. Όπως φαίνεται στον πίνακα αποτελεσμάτων παραπάνω, η καλύτερη παραλλαγή Ad-LLM βελτίωσε το Ad-Chat κατά 8,4, 1,5, και 3,8 τοις εκατό σε συνολικούς ποσοτικούς βαθμούς: και κατά 10,7, 10,4, και 8,6 τοις εκατό σε ποιοτικούς βαθμούς για MT-Ανθρώπινος, LM-Αγορά, και CA-Prod αντίστοιχα.

Από αυτά τα αποτελέσματα, οι συγγραφείς αναφέρουν:

‘Αυτά τα αποτελέσματα δείχνουν ότι η γεννήτηση μιας απάντησης και η επόμενη εισαγωγή διαφημίσεων οδηγούν σε καλύτερη ποιότητα απάντησης σε σύγκριση με την απλή προσέγγιση της εξάρτησης από την προτροπή του συστήματος.

‘Για συγκεκριμένες διαστάσεις ικανοποίησης και εμπλοκής του χρήστη, το Ad-Chat δείχνει μια σημαντική απόσταση απόδοση σε σύγκριση με τις λύσεις Ad-LLM σε όλα τα τρία σύνολα δεδομένων, ιδιαίτερα στις διαστάσεις όπως ακρίβεια, προσωπικότητα, και εμπιστοσύνη.’

Επιπλέον, το Ad-LLM έδειξε τις ισχυρότερες κερδώσεις του σε ακρίβεια, προσωπικότητα, και εμπιστοσύνη, ξεπερνώντας το Ad-Chat κατά μέχρι 17,6%, 23,3%, και 17,2% αντίστοιχα. Σύμφωνα με το έγγραφο, αυτές οι διαφορές θα μπορούσαν να οφείλονται στο τρόπο με τον οποίο το Ad-Chat χρησιμοποιεί προτροπές συστήματος για να οδηγήσει το μοντέλο προς πιο προσωποποιημένη και προωθητική γλώσσα – την οποία οι συγγραφείς υποστηρίζουν ότι μπορεί να οδηγήσει σε einen ‘πωλητή-όπως’ τόνο που μειώνει την ακρίβεια και την εμπιστοσύνη.

Το Ad-Chat επίσης παρήγαγε χαμηλότερα ποσοστά εισαγωγής, ακόμη και όταν αξιολογήθηκε σε ερωτήματα που επιλέχθηκαν για την καταλληλότητα διαφήμισης, και οι συγγραφείς αποδίδουν αυτό στην εξάρτηση από τις προτροπές του συστήματος (τις οποίες χαρακτηρίζουν ως δύσκολο να ελεγχθούν).

Στο σενάριο της μηχανής αναζήτησης, ωστόσο, το Ad-Chat πέτυχε ένα 8,6% υψηλότερο ποσοστό κλικ, το οποίο το έγγραφο υποστηρίζει ότι μπορεί να αντανακλούν το πλεονέκτημα της χρήσης ενός LLM για την ανάκτηση υποψηφίων προϊόντων, αντί να βασίζονται μόνο στις σημασιολογικές ενσωματώσεις:

Σύγκριση των συνολικών βαθμών απόδοσης σε τέσσερις κριτές (GPT-4.1-mini, Qwen-max, claude-3-5-haiku, kimi-k2) για το Ad-Chat και τρεις παραλλαγές Ad-LLM (GI-R, GIR-R, GIR-P) στα σύνολα δεδομένων MT-Ανθρώπινος, LM-Αγορά, και CA-Prod. Ενώ οι βαθμοί ποικίλλουν ανά κριτή, το Ad-LLM υπερέχει συνεχώς το Ad-Chat σε όλες τις συνθήκες.

Σύγκριση των συνολικών βαθμών απόδοσης σε τέσσερις κριτές (GPT-4.1-mini, Qwen-max, claude-3-5-haiku, kimi-k2) για το Ad-Chat και τρεις παραλλαγές Ad-LLM (GI-R, GIR-R, GIR-P) στα σύνολα δεδομένων MT-Ανθρώπινος, LM-Αγορά, και CA-Prod. Ενώ οι βαθμοί ποικίλλουν ανά κριτή, το Ad-LLM υπερέχει συνεχώς το Ad-Chat σε όλες τις συνθήκες.

Οι κριτές επιλέχθηκαν για να διαφέρουν από το βασικό μοντέλο doubao-1-5-lite-32k, βοηθώντας να μειώσουν την προκατάληψη από την ευθυγράμμιση της οικογένειας μοντέλων. Το GIR-R κατετάγη πρώτο ή δεύτερο σε κάθε περίπτωση, υποδεικνύοντας μια ευρεία συμφωνία μεταξύ των κριτών σχετικά με την υπεροχή του Ad-LLM. Η ανάλυση σε μεμονωμένες ποιοτικές διαστάσεις ακολουθεί στενά το μοτίβο που φαίνεται στα προηγούμενα αποτελέσματα (παραπάνω).

Συμπερασματικά, το έγγραφο σημειώνει ότι και το Ad-Chat και το Ad-LLM απαιτούν υψηλότερους πόρους από τα πιο καινοτόμα και αποτελεσματικά μοντέλα, και ότι η ανάγκη για χρήση LLM πράκτορες σε αυτό το είδος συναλλαγής θα μπορούσε να αντιπροσωπεύει σημαντική υπέρβαση. Αν και θα μπορούσε να φανταστεί ότι προβλήματα καθυστέρησης (συνήθως κρίσιμα σε σενάρια εξυπηρέτησης διαφημίσεων) θα μπορούσαν να προκύψουν από τη χρήση LLM αυτού του είδους (αν και αυτό δεν αντιμετωπίζεται ειδικά στο έγγραφο).

Εν πάση περιπτώσει, η υλοποίηση της στρατηγικής Ad-Chat από τους συγγραφείς (η πάνω σειρά στο προηγούμενο σχήμα που εμφανίστηκε στην αρχή του άρθρου) αποδείχθηκε ότι προσφέρει το υψηλότερο ποσοστό κλικ, αν και είχε το υψηλότερο συνδεδεμένο κόστος LLM.

Συμπέρασμα

Αν και δεν είναι έκπληξη ότι η βιβλιογραφία θα συζητήσει τις μεθόδους με τις οποίες τα LLM μπορούν να φέρουν διαφήμιση, υπάρχει στην πραγματικότητα πολύ λίγη δημόσια έρευνα sobre αυτό το θέμα· αυτό κάνει το τρέχον έγγραφο, και αυτό που μπορούμε να ερμηνεύσουμε ως τον προκάτοχό του, ενδιαφέροντα.

Όποιος έχει δουλέψει με ένα τμήμα πωλήσεων διαφήμισης, ή πωλήσεων αποθέματος, θα γνωρίζει ότι οι διαφημιστές πάντα θέλουν περισσότερα – ιδανικά, να έχουν διαφημίσεις που παρουσιάζονται ως περιεχόμενο γεγονός, απόλυτα μη διακρινόμενο από τη ροή περιεχομένου του ξενιστή· και θα πληρώσουν ένα σημαντικό premium για αυτό (μαζί με τον ξενιστή, ο οποίος così κινδυνεύει με την αξιοπιστία και τη στάση του με τους αναγνώστες και άλλους τύπους μετόχων).

Επομένως, θα είναι ενδιαφέρον να δούμε το βαθμό, εάν υπάρχει, στο οποίο οι διαφημιστικές κωδικές που οραματίζονται σε αυτά τα δύο έγγραφα θα είναι κινητοποιημένες να κρυφτούν πιο ψηλά σε μια απάντηση LLM, και πιο κοντά στο ‘φορτίο’.

 

Πρώτη δημοσίευση Πέμπτη, 18 Σεπτεμβρίου 2025

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]