Andersons hoek

Voorbereiden op reclame in grote taalmodellen

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google
Source: ChatGPT-4o and https://commons.wikimedia.org/wiki/File:Microsoft_Surface_Laptop_7.jpg

Nieuw onderzoek toont aan hoe reclame binnenkort rechtstreeks in antwoorden van ChatGPT-stijl kan worden geÃŊntegreerd – niet als banners of pop-ups, maar ingebed in het antwoord zelf. Een nieuwe benchmark test hoe goed deze reclame-geÃŊnjecteerde antwoorden behulpzaam, geloofwaardig en winstgevend kunnen blijven, en kan een compromis tussen een acceptabele gebruikerservaring en doorklikken vereisen.

 

Terwijl de wijdverbreide en groeiende populariteit van grote taalmodellen de traditionele reclamemethoden die het internet bijna sinds zijn ontstaan hebben aangedreven, ondermijnt, zal iedereen die bekend is met de marktveroveringstactieken van venture capitalists zich afvragen hoe lang AI-chatbots nog kunnen weerstaan aan het opnemen van reclame-inhoud in hun antwoorden.

Terwijl Netflix en een groeiend aantal streamingdiensten demonstreren, is de traditionele kabel-eratijd strategie van het combineren van betaalde abonnementen met ingebedde reclame (vaak gerechtvaardigd als een manier om consumentenkosten laag te houden) weer in zwang; en de verschuiving naar het integreren van reclame rechtstreeks in LLM-uitvoer begint minder speculatief te worden en meer als een natuurlijke aanvaarding van dat model.

Uit het paper 'Online Advertisements with LLMs: Opportunities and Challenges', een vrij representatief voorbeeld van de overgang die de meeste mensen verwachten wanneer LLM's worden gemonetariseerd. Bron: https://www.sigecom.org/exchanges/volume_22/2/FEIZI.pdf

Uit het paper ‘Online Advertisements with LLMs: Opportunities and Challenges’, een vrij representatief voorbeeld van de overgang die de meeste mensen verwachten wanneer LLM’s worden gemonetariseerd. Bron: https://www.sigecom.org/exchanges/volume_22/2/FEIZI.pdf

Het vooruitzicht van het opnemen van reclame in een opkomend medium dat al opvallende problemen heeft met geloofwaardigheid, kan overhaast lijken; toch suggereert de omvang van de investeringen in generatieve AI in de afgelopen twaalf maanden dat de markt op dit moment niet wordt gekenmerkt door een voorzichtige of omzichtige houding; en met grotere spelers zoals OpenAI die mogelijk overbelast zijn en een vroeg rendement op een enorme investering nodig hebben, geeft de geschiedenis aan dat de huwelijksreis van reclamevrije uitvoer mogelijk ten einde loopt.

GEM-Bench

Met deze klimaat en met deze zakelijke imperatieven in gedachten, biedt een interessant nieuw paper van Singapore de eerste benchmark voor AI-chatbot-interfaces, samen met nieuwe kwantificerende metrieken voor wat mogelijk een van de meest explosieve reclamearena’s in 100 jaar kan worden.

Misschien te optimistisch, gaan de auteurs ervan uit dat er een nette scheiding is tussen ‘echte’ inhoud en reclame-inhoud, waarbij de ‘afleiding’ van standaardantwoorden naar marketingtekst vrij gemakkelijk te herkennen is:

Voorbeelden van de soort reclame-integratie die kan plaatsvinden onder twee modellen die in het nieuwe paper worden bestudeerd. Bron: https://arxiv.org/pdf/2509.14221

Voorbeelden van de soort reclame-integratie die kan plaatsvinden onder twee modellen die in het nieuwe paper worden bestudeerd. Bron: https://arxiv.org/pdf/2509.14221

Het blijft te zien of adverteerders zelf zullen proberen om hun reclame-inhoud subtieler in de uitvoer te integreren dan in de voorbeelden die in het paper worden gegeven.

De onderzoekers identificeren Ad-Injected Response (AIR) generatie als de centrale uitdaging in GEM, en betogen dat bestaande benchmarks niet goed zijn aangepast voor het bestuderen ervan. Om deze lacune te vullen, introduceren ze wat zij claimen de eerste benchmark te zijn die specifiek voor dit doel is ontworpen.

GEM-Bench bestaat uit drie gecureerde datasets die chatbot- en zoekmachine-scenario’s omvatten. Het omvat ook een metrieken-ontologie die is ontworpen om meerdere facetten van gebruikerservaring en betrokkenheid te beoordelen, evenals een reeks basismethoden die zijn geÃŊmplementeerd in een modulair multi-agent framework.

De auteurs beweren dat, hoewel eenvoudige prompt-gebaseerde methoden respectabele betrokkenheidsmetrieken kunnen bereiken, zoals verhoogde doorklikratio’s (CTR), ze de gebruikerservaring tendens te degraderen. Benaderingen die reclame in vooraf gegenereerde, reclamevrije antwoorden invoegen, laten verbeteringen zien in vertrouwen en antwoordkwaliteit – hoewel tegen een hogere computationele overhead.

Deze compromissen, betoogt het paper, benadrukken de noodzaak van meer effectieve en efficiÃŦnte technieken voor het integreren van reclame in generatieve uitvoer.

Het nieuwe werk heeft de titel GEM-Bench: A Benchmark for Ad-Injected Response Generation within Generative Engine Marketing, en komt van vier onderzoekers aan de National University of Singapore.

Methode

De omtrek van Generative Engine Marketing (GEM) leent van de basisprincipes van Search Engine Marketing (SEM). Traditionele SEM werkt door queries aan reclame te koppelen via een multistage-pipeline waarin adverteerders bieden op trefwoorden; het systeem identificeert welke queries reclame triggeren; het systeem schat hoe waarschijnlijk elke reclame is om te worden aangeklikt; en vervolgens toewijst het reclame via een veiling die biedt met voorspelde betrokkenheid.

Door contrast, past de GEM-benadering dezelfde stadia aan voor LLM’s, maar stuit op nieuwe uitdagingen bij elke stap: er zijn geen vaste reclameplekken, dus het systeem moet beslissen of een query een reclame kan bevatten en waar deze in de vrije tekst moet worden ingevoegd; het schatten van doorklikratio’s wordt moeilijker zonder gestructureerde lay-outs; en relevantie moet worden afgewogen tegen gebruikerservaring, omdat de reclame rechtstreeks in de uitvoer van het model wordt ingevoegd in plaats van als zelfstandige kopie te worden geserveerd.

Een van de basismethoden die in het werk worden bestudeerd, Ad-Chat, vertegenwoordigt een eenvoudige methode waarbij reclame-inhoud in het systeemprompt wordt ingevoegd voordat het model een antwoord genereert. Dit betekent dat het model een antwoord produceert met de reclame al ingebed, geleid door een vooraf geladen agenda.

De andere benadering, Ad-LLM, werd door de auteurs ontwikkeld als onderdeel van de nieuwe benchmark. Ad-LLM volgt een modulaire route, eerst een schoon, reclamevrij antwoord genereren; een relevante reclame selecteren; het beste invoegpunt identificeren op basis van semantische flow; en tenslotte de uitvoer herschrijven om de reclame soepel te integreren:

Vergelijking tussen Ad-Chat en de 'Ad-LLM'-methode van de auteurs. Ad-Chat injecteert reclame via het systeemprompt voordat het wordt gegenereerd, met beperkte plaatsingscontrole. Ad-LLM scheidt antwoordgeneratie en reclame-injectie, kiest invoegpunten op basis van semantische flow en verfijnt het resultaat. Beide worden gescoord met GEM-Bench-metrieken voor tevredenheid en betrokkenheid

Vergelijking tussen Ad-Chat en de ‘Ad-LLM’-methode van de auteurs. Ad-Chat injecteert reclame via het systeemprompt voordat het wordt gegenereerd, met beperkte plaatsingscontrole. Ad-LLM scheidt antwoordgeneratie en reclame-injectie, kiest invoegpunten op basis van semantische flow en verfijnt het resultaat. Beide worden gescoord met GEM-Bench-metrieken voor tevredenheid en betrokkenheid.

Terwijl Ad-Chat goedkoper en soms overtuigender is, heeft het de neiging om vertrouwen en nauwkeurigheid te verminderen. Ad-LLM presteert beter op gebruikerservaringsmetrieken, maar tegen een hogere kost.

Gegevens

Voor AIR-generatie werden twee soorten datasets gegenereerd: een gebruikersqueryset (Gebruiker) en een reclamedatabase (AdDB).

De ads zullen alleen verschijnen in antwoorden, zelfs als (zie schema hierboven) gebruikersaanvragen in het geheim kunnen worden aangevuld om het reclameproces te accommoderen.

Voor het chatbot-scenario hebben de auteurs twee query-datasets gebouwd: MT-Human en LM-Market.

MT-Human werd getrokken uit de geesteswetenschappelijke sectie van MT-Bench, een multi-turn benchmark voor LLM’s, en bevat vragen die waarschijnlijk reclame-inhoud kunnen bevatten.

LM-Market werd gebouwd uit meer dan een half miljoen echte ChatGPT-queries verzameld door LMSYS-Chat-1M, gefilterd voor Engelstalige marketing-gerelateerde prompts, en gegroepeerd door onderwerp met behulp van semantische embeddings.

Om de kwaliteit van reclame-geÃŊnjecteerde antwoorden te evalueren, definieert GEM een metrieken-ontologie die zowel gebruikerservaring als betrokkenheid omvat. Dit omvat kwantitatieve metrieken zoals antwoordstroom, coherentie en doorklikratio, evenals kwalitatieve standaarden zoals vertrouwen, nauwkeurigheid en natuurlijkheid – metrieken die zijn ontworpen om zowel hoe goed een reclame in een antwoord past als hoe waarschijnlijk gebruikers zijn om het te zien en te interacteren.

Met betrekking tot ‘Natuurlijkheid’ stelt het paper:

‘[Natuurlijkheid] meet de mate waarin reclame-injectie de stroom en natuurlijkheid van het gesprek verstoort, op basis van interruptiviteit en authenticiteit. Interruptiviteit onderzoekt of de reclame een “uitstap” of “abrupt” gevoel creÃŦert tijdens het lezen, waardoor de gebruiker zijn continue focus op het onderwerp verliest.

‘Authenticiteit evalueert of de reclame de “menselijke touch” of “natuurlijke flow” van het gesprek ondermijnt, waardoor het antwoord stijf, formeel en minder authentiek lijkt.’

Om een traditionele zoekmachine-scenario te creÃŦren voor de testfase, hebben de auteurs een dataset getiteld CA-Prod gemaakt van de AdsCVLR-commerciele corpus, dat 300.000 query-reclameparen bevat, elk bestaande uit een trefwoord, metadata en een handmatige label dat relevantie markeert:

Uit het oorspronkelijke bronpaper, voorbeelden uit de AdsCVLR-dataset, die materiaal hebben geleverd voor de tests van de auteurs. Bron: http://www.jdl.link/doc/2011/20221224_AdsCVLR.pdf

Uit het oorspronkelijke bronpaper, voorbeelden uit de AdsCVLR-dataset, die materiaal hebben geleverd voor de tests van de auteurs. Bron: http://www.jdl.link/doc/2011/20221224_AdsCVLR.pdf

Records met ontbrekende velden werden verwijderd, en alleen queries met zowel positieve als negatieve reclame (zie afbeelding hierboven voor voorbeelden) werden behouden.

Om de gegevens te verfijnen, werden reclame’s gegroepeerd in zes onderwerpgroepen (tuingereedschap en -apparatuur, slip-on schoenen, huishoudelijke artikelen, voedingssupplementen, Android-apparaten en vrouwelijke jurken) met behulp van semantische embeddings en K-means clustering.

Queries werden vervolgens toegewezen aan onderwerpen op basis van hun positieve reclame, met overmatig schaarse of dichte sets uitgesloten, voordat 120 queries en 2.215 unieke producten uiteindelijk werden bemonsterd voor de benchmark.

Tests

Om te evalueren hoe goed de verschillende reclame-injectie-strategieÃŦn presteerden, heeft de benchmark drie kernvragen aangepakt: hoe effectief elke methode was over de gedefinieerde tevredenheids- en betrokkenheidsmetrieken; hoe de interne ontwerpkeuzes binnen Ad-LLM de resultaten zouden kunnen beÃŊnvloeden; en hoe de computationele kosten zouden kunnen worden vergeleken over systemen.

De auteurs hebben Ad-Chat en drie varianten van de Ad-LLM-pipeline van de auteurs geÃŦvalueerd, elk met een andere manier van reclame-opname (hetzij via het prompt of via het gegenereerde antwoord) en of het eindresultaat werd herschreven voor vloeiendheid.

Alle methoden werden uitgevoerd met doubao-1-5-lite-32k als basismodel en beoordeeld met gpt-4.1-mini.

Effectiviteit van Ad-Chat en Ad-LLM-varianten over de MT-Human-, LM-Market- en CA-Prod-datasets. Kwantitatieve metrieken omvatten antwoordstroom (RF), antwoordcoherentie (RC), reclamestroom (AF), reclamecoherentie (AC), injectieratio (IR), doorklikratio (CTR) en totaalscores. Kwalitatieve metrieken omvatten nauwkeurigheid, natuurlijkheid, persoonlijkheid, vertrouwen, opmerking, doorklikken en totale prestaties.

Effectiviteit van Ad-Chat en Ad-LLM-varianten over de MT-Human-, LM-Market- en CA-Prod-datasets. Kwantitatieve metrieken omvatten antwoordstroom (RF), antwoordcoherentie (RC), reclamestroom (AF), reclamecoherentie (AC), injectieratio (IR), doorklikratio (CTR) en totaalscores. Kwalitatieve metrieken omvatten nauwkeurigheid, natuurlijkheid, persoonlijkheid, vertrouwen, opmerking, doorklikken en totale prestaties.

Over alle drie datasets produceerde Ad-LLM betere resultaten dan Ad-Chat op zowel tevredenheids- als betrokkenheidsmetrieken. Zoals te zien is in de resultaatentabel hierboven, verbeterde de beste Ad-LLM-variant Ad-Chat met 8,4, 1,5 en 3,8 procent in totaalkwantitatieve scores; en met 10,7, 10,4 en 8,6 procent in kwalitatieve scores voor MT-Human, LM-Market en CA-Prod respectievelijk.

Van deze resultaten stellen de auteurs:

‘Deze resultaten laten zien dat het genereren van een ruw antwoord en vervolgens het injecteren van reclame een betere antwoordkwaliteit oplevert in vergelijking met de eenvoudigere benadering van het alleen vertrouwen op systeemprompt-injectie.

‘Voor specifieke gebruikerservaring- en betrokkenheidsdimensies toont Ad-Chat consistent een aanzienlijke prestatiekloof ten opzichte van Ad-LLM-oplossingen over alle drie datasets, met name in dimensies zoals nauwkeurigheid, persoonlijkheid en vertrouwen.’

Verder toonde Ad-LLM zijn sterkste verbeteringen in nauwkeurigheid, persoonlijkheid en vertrouwen, waarin het Ad-Chat overtrof met maximaal 17,6%, 23,3% en 17,2% respectievelijk. Volgens het paper zouden deze verschillen kunnen voortkomen uit de manier waarop Ad-Chat systeemprompts gebruikt om het model naar meer persoonlijke en promotionele taal te sturen – wat de auteurs beweren kan leiden tot een ‘verkopersachtige’ toon die nauwkeurigheid en vertrouwen vermindert.

Ad-Chat produceerde ook lagere injectieratio’s, zelfs toen het werd geÃŦvalueerd op queries die waren geselecteerd voor reclamegeschiktheid, en de auteurs schrijven dit toe aan een afhankelijkheid van prompt-gebaseerde cues (die zij karakteriseren als moeilijk te controleren).

In de zoekmachine-instelling bereikte Ad-Chat echter een 8,6% hogere doorklikratio, wat het paper suggereert kan worden toegeschreven aan het gebruik van een LLM om productkandidaten op te halen, in plaats van alleen te vertrouwen op semantische embeddings:

Vergelijking van totale prestatiescores over vier rechtermodellen (GPT-4.1-mini, Qwen-max, claude-3-5-haiku, kimi-k2) voor Ad-Chat en drie Ad-LLM-varianten (GI-R, GIR-R, GIR-P) op de MT-Human-, LM-Market- en CA-Prod-datasets. Terwijl scores variÃŦren per rechter, presteert Ad-LLM consistent beter dan Ad-Chat over alle condities.

Vergelijking van totale prestatiescores over vier rechtermodellen (GPT-4.1-mini, Qwen-max, claude-3-5-haiku, kimi-k2) voor Ad-Chat en drie Ad-LLM-varianten (GI-R, GIR-R, GIR-P) op de MT-Human-, LM-Market- en CA-Prod-datasets. Terwijl scores variÃŦren per rechter, presteert Ad-LLM consistent beter dan Ad-Chat over alle condities.

De tweede resultaatentabel (hierboven weergegeven) illustreert dat Ad-LLM-oplossingen over alle drie datasets consistent beter presteren dan Ad-Chat over vier rechtermodellen; GPT-4.1-mini; Qwen-max; Claude-3-5-haiku; en Kimi-k2.

Deze rechters werden gekozen om te verschillen van het basismodel doubao-1-5-lite-32k, waardoor de bias van model-familie-alignering wordt verminderd. GIR-R eindigde als eerste of tweede in elk geval, wat suggereert dat er een brede overeenstemming is onder de rechters over de superioriteit van Ad-LLM. De opsplitsing over individuele kwalitatieve dimensies volgt nauw het patroon dat in de onmiddellijk voorafgaande resultaten (hierboven) wordt gezien.

In afsluiting merkt het paper op dat zowel Ad-Chat als Ad-LLM hogere middelen vereisen dan de meer innovatieve en effectieve modellen, en dat de noodzaak om LLM-agents in dit soort transacties te gebruiken een aanzienlijke overhead kan vertegenwoordigen. Hoewel men zich zou kunnen voorstellen dat latentieproblemen (meestal kritiek in reclame-scenario’s) zouden kunnen ontstaan door het gebruik van LLM’s op deze manier (hoewel dit niet specifiek in het paper wordt aangepakt).

In elk geval bleek de implementatie van de Ad-Chat-strategie van de auteurs (de bovenste rij in het eerder getoonde schema) de hoogste doorklikratio te bieden, hoewel het de hoogste LLM-kosten had.

Conclusie

Hoewel het niet verrassend is dat de literatuur zou speculeren over de methoden waarmee LLM’s reclame kunnen dragen, is er eigenlijk weinig openbaar onderzoek naar dit onderwerp beschikbaar; dit maakt het huidige paper, en wat we redelijkerwijs kunnen interpreteren als zijn voorganger, interessant.

Iedereen die heeft gewerkt met een reclameverkoopafdeling, of inventaris verkoopt, weet dat adverteerders altijd meer willen – idealiter, om reclame te presenteren als feitelijke inhoud, volledig ononderscheidbaar van de host-inhoudstroom; en ze zullen een aanzienlijke premie betalen voor dit (samen met de host, die daarmee zijn geloofwaardigheid en positie bij lezers en andere soorten stakeholders riskeert).

Daarom zal het interessant zijn om te zien in hoeverre de reclame-geÃŊnjecteerde codicils die in de twee papers worden geschetst, zouden kunnen worden gestimuleerd om verder omhoog in een LLM-antwoord te kruipen, en dichter bij de ‘payload’.

 

First published donderdag, 18 september 2025

Schrijver over machine learning, domeinspecialist in humane beeldsynthese. Voormalig hoofd van onderzoeksinhoud bij Metaphysic.ai, tot de opheffing ervan in DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]