Andersons vinkel

Forberedelse til reklamer i store sprogmodeller

mm
FÃļj Unite.AI til dine foretrukne kilder pÃĨ Google
Source: ChatGPT-4o and https://commons.wikimedia.org/wiki/File:Microsoft_Surface_Laptop_7.jpg

Nyt forskning viser, hvordan reklamer snart kan indlejres direkte i ChatGPT-lignende svar – ikke som banner eller pop-ups, men vÃĶvet ind i svaret selv. En ny benchmark test, hvordan godt disse reklame-indsprÃļjtede svar kan blive brugbare, trovÃĶrdige og profitable, og kan krÃĶve en afvejning mellem en acceptabel brugeroplevelse og klik.

 

Som den udbredte og voksende popularitet af store sprogmodeller underminerer de traditionelle reklamemetoder, der har drevet internettet nÃĶsten siden dets oprettelse, vil enhver, der er bekendt med venturekapitalisters markedsindtagelsestaktikker, undre sig over, hvor lÃĶnge AI-chatbots kan holde sig tilbage fra at inkludere reklameindhold i deres svar.

Som Netflix og en udvidende rÃĶkke af streamingtjenester demonstrerer, er den traditionelle kabel-ÃĶra-strategi for at kombinere betalte abonnementer med indlejrede reklamer (ofte berettiget som en mÃĨde at holde forbrugeromkostningerne nede) ved at genopblive; og skiftet mod at inkorporere reklamer direkte i LLM-outputs er begyndt at se mindre spekulativt ud og mere som en naturlig tilpasning af den model.

Fra papiret 'Online Reklamer med LLM'er: Muligheder og Udfordringer', et ret reprÃĶsentativt eksempel pÃĨ overgangen, som de fleste mennesker forventer, nÃĨr LLM'er moneteres. Kilde: https://www.sigecom.org/exchanges/volume_22/2/FEIZI.pdf

Fra papiret ‘Online Reklamer med LLM’er: Muligheder og Udfordringer’, et ret reprÃĶsentativt eksempel pÃĨ overgangen, som de fleste mennesker forventer, nÃĨr LLM’er moneteres. Kilde: https://www.sigecom.org/exchanges/volume_22/2/FEIZI.pdf

Udsigten til at inkludere reklamer i en opkomment medium, der allerede har bemÃĶrkelsesvÃĶrdige problemer med trovÃĶrdighed, kan synes forhastet; dog investeringen i generativ AI over de sidste tolv mÃĨneder antyder, at markedet ikke er defineret af en forsigtig eller omhyggelig holdning; og med stÃļrre spillere som OpenAI, der kan siges at vÃĶre over-belÃĨnt og har brug for en tidlig afkast pÃĨ massive investeringer, tyder historien pÃĨ, at honningmÃĨnedeperioden med reklamefrie outputs kan vÃĶre ved at lÃļbe ud.

GEM-Bench

Med denne klima og disse forretningsimperativer i mente, tilbyder et interessant nyt papir fra Singapore den fÃļrste benchmark rettet mod AI-chatbot-grÃĶnseflader, sammen med nye kvantificeringsmetrikker for, hvad der kan vise sig at vÃĶre en af de mest eksplosive reklamearenaer i 100 ÃĨr.

Forfatterne antager mÃĨske optimistisk en klar skillelinje mellem ‘sandt’ indhold og reklameindhold, hvor ‘afvigelsen’ fra standard-svar til marketing-kopi er ret let at spotte:

Eksempler pÃĨ den type reklameintegration, der kan komme til at ske under to modeller, der er studeret i det nye papir. Kilde: https://arxiv.org/pdf/2509.14221

Eksempler pÃĨ den type reklameintegration, der kan komme til at ske under to modeller, der er studeret i det nye papir. Kilde: https://arxiv.org/pdf/2509.14221

Det er endnu ikke klart, om reklamegivere selv vil, som de har tendens til, sÃļge at have deres reklameindhold mere subtilt integreret i output end i de eksempler, der er givet i papiret.

Men disse er emner for senere; for Ãļjeblikket er feltet sÃĨ ny, at selv grundlÃĶggende terminologi mangler eller ikke er fastlagt.

Papiret introducerer derfor Generative Engine Marketing (GEM) som en ny ramme for at moneterisere LLM-baserede chatbots, ved at indlejre relevante reklamer direkte i genererede svar.

Forskerne identificerer Ad-Injected Response (AIR) generation som den centrale udfordring i GEM og argumenterer for, at eksisterende benchmarks er dÃĨrligt egnede til at studere det. For at udfylde denne lukke introducerer de, hvad de pÃĨstÃĨr at vÃĶre den fÃļrste benchmark, der specifikt er designet til dette formÃĨl.

GEM-Bench bestÃĨr af tre kuraterede datasets, der spÃĶnder over chatbot- og sÃļgemaskinescenarioer. Det inkluderer ogsÃĨ en metrik-ontologi designet til at vurdere multiple aspekter af brugertilfredshed og engagement, samt en samling af baseline-metoder implementeret inden for en modulÃĶr multi-agent-ramme.

Forfatterne pÃĨstÃĨr, at selv om simple prompt-baserede metoder kan opnÃĨ respektabelt engagement-metrikker, sÃĨsom forhÃļjede klik-gennem-rater (CTR), tenderer de til at degradere brugertilfredshed. Til gengÃĶld viser tilgange, der indsÃĶtter reklamer i forudgenererede, reklamefrie svar, forbedringer i tillid og svarkvalitet – dog til en hÃļjere beregningsmÃĶssig omkostning.

Disse kompromiser, argumenterer papiret, fremhÃĶver behovet for mere effektive og effektive teknikker til at integrere reklamer i generative outputs.

Det nye arbejde er titlen GEM-Bench: En Benchmark for Ad-Injected Response Generation inden for Generative Engine Marketing og kommer fra fire forskere ved National University of Singapore.

Metode

Oversigten over Generative Engine Marketing (GEM) lÃĨner fra grundprincipperne i Search Engine Marketing (SEM). Traditionel SEM fungerer ved at matche forespÃļrgsler til reklamer gennem en multistage-pipeline, hvor reklamegivere byder pÃĨ nÃļgleord; systemet identificerer, hvilke forespÃļrgsler udlÃļser reklamer; systemet estimerer, hvor sandsynligt det er, at hver reklame klikkes; og derefter allokerer placering gennem en auktion, der balancerer bud med forventet engagement.

I modsÃĶtning hertil tilpasser GEM-tilgangen disse faser til LLM’er, men stÃĨr over for nye udfordringer pÃĨ hvert trin: der er ingen faste reklamepladser, sÃĨ systemet mÃĨ afgÃļre, om en forespÃļrgsel kan tage en reklame og hvor den skal indsÃĶttes i fri tekst; estimering af klik-gennem-rater bliver svÃĶrere uden strukturerede layouts; og relevans mÃĨ balanceres mod brugertilfredshed, da reklamerne er vÃĶvet direkte ind i modellens egen output og ikke serveres som selvstÃĶndig kopi.

En af baseline-studierne i arbejdet, Ad-Chat, reprÃĶsenterer en simpel metode, hvor reklameindhold indsÃĶttes i systemprompten fÃļr modellen genererer et svar. Dette betyder, at modellen producerer et svar med reklamen allerede indlejret, guidet af en forudindlÃĶst dagsorden.

Den anden tilgang, Ad-LLM, blev udviklet af forfatterne som en del af den nye benchmark-tilbud. Ad-LLM fÃļlger en modulÃĶr vej, fÃļrst genererer en ren, reklamefri besked; vÃĶlger en relevant reklame; identificerer det bedste indsÃĶtningspunkt baseret pÃĨ semantisk flow; og til sidst omskriver outputtet for at integrere reklamen smukt:

Sammenligning mellem Ad-Chat og forfatternes 'Ad-LLM'-metode. Ad-Chat indsÃĶtter reklamer via systemprompten fÃļr generation, med begrÃĶnset indsÃĶtningskontrol. Ad-LLM adskiller respons-generation og reklameindsÃĶtning, vÃĶlger indsÃĶtningspunkter baseret pÃĨ semantisk flow og raffinerer resultatet. Begge vurderes ved hjÃĶlp af GEM-Bench-metrikker for tilfredshed og engagement

Sammenligning mellem Ad-Chat og forfatternes ‘Ad-LLM’-metode. Ad-Chat indsÃĶtter reklamer via systemprompten fÃļr generation, med begrÃĶnset indsÃĶtningskontrol. Ad-LLM adskiller respons-generation og reklameindsÃĶtning, vÃĶlger indsÃĶtningspunkter baseret pÃĨ semantisk flow og raffinerer resultatet. Begge vurderes ved hjÃĶlp af GEM-Bench-metrikker for tilfredshed og engagement.

Mens Ad-Chat er billigere og nogle gange mere overbevisende, tenderer den til at reducere tillid og nÃļjagtighed. Ad-LLM performer bedre pÃĨ brugertilfredsheds-metrikker, men til en hÃļjere omkostning.

Data

Til AIR-generation blev to typer af datasets genereret initialt: en brugerforespÃļrgsel-sÃĶt (Bruger) og en reklamedatabase (ReklameDB).

Siden brugerforespÃļrgsler definerer reklame-muligheder i LLM’ens svar, kan ‘reklame-inventaret’ siges at eksistere i disse svar, selv om dette ikke kun defineres af brugerforespÃļrgslens anvendelighed, men ogsÃĨ af, i hvilken udstrÃĶkning systemet vil overholde sine egne regler om at balancere integritet mod reklamegivernes imperativer.

Under alle omstÃĶndigheder vil reklamerne kun dukke op i svar, selv om (se schema ovenfor) brugeranmodninger kan vÃĶre hemmeligt forstÃĶrket for at tilpasse reklame-serveringsprocessen.

Til chatbot-scenariet konstruerede forfatterne to forespÃļrgsel-datasets: MT-Menneske og LM-Marked.

MT-Menneske blev trukket fra humaniora-delen af MT-Bench, en multi-turn-benchmark for LLM’er, og indeholder spÃļrgsmÃĨl, der sandsynligvis kan indeholde reklameindhold.

LM-Marked blev bygget fra over en halv million virkelige ChatGPT-forespÃļrgsler samlet af LMSYS-Chat-1M, filtreret for engelsk-sprogede marketing-relaterede forespÃļrgsler og grupperet efter emne ved hjÃĶlp af semantiske indlejring.

I begge tilfÃĶlde blev de endelige forespÃļrgsler valgt gennem en multi-stage-pipeline, der kombinerer automatiseret klustering, LLM-vurdering og menneskelig verificering, med det formÃĨl at identificere forespÃļrgsler, hvor reklameindsÃĶtning ville vÃĶre naturlig og plausibel.

For at evaluere kvaliteten af reklame-indsprÃļjtede svar definerer GEM en mÃĨlings-ontologi, der dÃĶkker bÃĨde brugertilfredshed og engagement. Dette tager i betragtning kvantitative metrikker, herunder respons-flow, koherens og klik-gennem-rate, samt kvalitative standarder som tillid, nÃļjagtighed og naturalitet – metrikker, der er designet til at reflektere bÃĨde, hvor godt en reklame passer ind i et svar, og hvor sandsynligt brugere er til at opfatte og interagere med den.

Med hensyn til ‘Naturalitet’ fastslÃĨr papiret:

‘[Naturalitet] mÃĨler, i hvilken udstrÃĶkning reklameindsÃĶtning forstyrrer flowet og naturaliteten i samtalen, baseret pÃĨ interruptivitet og autenticitet. Interruptivitet undersÃļger, om reklamen skaber en “spring ud” eller “abrupt” fÃļlelse under lÃĶsning, og bryder brugerens kontinuerlige fokus pÃĨ emnet.

‘Autenticitet vurderer, om reklamen undergraver “menneskeligt touch” eller “naturlig flow” i samtalen, og gÃļr svaret til at se stift, formel og mindre autentisk.’

For at generere en traditionel sÃļgemaskine-scenario til testfasen oprettede forfatterne en dataset med titlen CA-Prod fra AdsCVLR-korpus, der indeholder 300.000 forespÃļrgsel-reklame-par, hver bestÃĨende af et nÃļgleord, metadata og en manuel mÃĶrkning, der markerer relevans:

Fra det oprindelige kildepapir, eksempler fra AdsCVLR-dataset, der hjalp med at levere materiale til forfatternes tests. Kilde: http://www.jdl.link/doc/2011/20221224_AdsCVLR.pdf

Fra det oprindelige kildepapir, eksempler fra AdsCVLR-dataset, der hjalp med at levere materiale til forfatternes tests. Kilde: http://www.jdl.link/doc/2011/20221224_AdsCVLR.pdf

Poster med manglende felter blev fjernet, og kun forespÃļrgsler, der indeholdt bÃĨde positive og negative reklamer (se billedet ovenfor for eksempler), blev beholdt.

For at raffinere dataene blev reklamer grupperet i seks emne-grupper (have- og haven-redskaber, slip-on-sko, husstandensartikler, ernÃĶrings-supplementer, Android-enheder og kvinde-kjoler) ved hjÃĶlp af semantiske indlejring og K-means-klustering.

ForespÃļrgsler blev derefter tildelt til emner efter deres positive reklamer, med for sparsomme eller tÃĶtte sÃĶt udeladt, fÃļr 120 forespÃļrgsler og 2.215 unikke produkter endelig blev udvalgt til benchmarket.

Tests

For at evaluere, hvor godt de varierende reklame-indsprÃļjtningsstrategier fungerede, tog benchmarket fat pÃĨ tre kerne-spÃļrgsmÃĨl: hvor effektiv hver metode var pÃĨ tvÃĶrs af definerede tilfredshed- og engagement-metrikker; hvordan de interne designvalg inden for Ad-LLM kunne pÃĨvirke resultaterne; og hvordan den beregningsmÃĶssige omkostning ville sammenlignes pÃĨ tvÃĶrs af systemer.

Forfatterne evaluerede Ad-Chat og tre varianter af forfatternes Ad-LLM-pipeline, hver af dem forskellig i, hvordan reklamer blev hentet (enten fra prompten eller fra det genererede svar), og i, om den endelige output blev omskrevet for flydende sprog:

Effektiviteten af Ad-Chat og Ad-LLM-varianter pÃĨ tvÃĶrs af MT-Menneske-, LM-Marked- og CA-Prod-datasets. Kvantitative metrikker inkluderer respons-flow (RF), respons-koherens (RC), reklame-flow (AF), reklame-koherens (AC), indsÃĶtningsrate (IR), klik-gennem-rate (CTR) og samlede score. Kvalitative metrikker dÃĶkker nÃļjagtighed, naturalitet, personlighed, tillid, opmÃĶrksomhed, klik (gennem) og samlet prÃĶstation.

Effektiviteten af Ad-Chat og Ad-LLM-varianter pÃĨ tvÃĶrs af MT-Menneske-, LM-Marked- og CA-Prod-datasets. Kvantitative metrikker inkluderer respons-flow (RF), respons-koherens (RC), reklame-flow (AF), reklame-koherens (AC), indsÃĶtningsrate (IR), klik-gennem-rate (CTR) og samlede score. Kvalitative metrikker dÃĶkker nÃļjagtighed, naturalitet, personlighed, tillid, opmÃĶrksomhed, klik (gennem) og samlet prÃĶstation.

PÃĨ tvÃĶrs af alle tre datasets producerede Ad-LLM stÃĶrkere resultater end Ad-Chat pÃĨ bÃĨde tilfredshed- og engagement-metrikker. Som vist i resultattabellen ovenfor forbedrede den bedste Ad-LLM-variant sig over Ad-Chat med 8,4, 1,5 og 3,8 procent i samlede kvantitative score; og med 10,7, 10,4 og 8,6 procent i kvalitative score for MT-Menneske-, LM-Marked- og CA-Prod henholdsvis.

Af disse resultater fastslÃĨr forfatterne:

‘Disse resultater demonstrerer, at generation af et rÃĨt svar og efterfÃļlgende indsÃĶtning af reklamer giver bedre responskvalitet i forhold til den mere simple tilgang, hvor man kun afhÃĶnger af systemprompt-indsÃĶtning.

‘For bestemte brugertilfredshed- og engagement-dimensioner viser Ad-Chat konsekvent en betydelig prÃĶstationsgap i forhold til Ad-LLM-lÃļsninger pÃĨ tvÃĶrs af alle tre datasets, isÃĶr i dimensioner som nÃļjagtighed, personlighed og tillid.’

Yderligere viste Ad-LLM sine stÃĶrkeste forbedringer i nÃļjagtighed, personlighed og tillid, overgÃĨende Ad-Chat med op til 17,6%, 23,3% og 17,2% henholdsvis. IfÃļlge papiret kunne disse forskelle skyldes, at Ad-Chat bruger systemprompts til at styre modellen mod mere personlig og promoverende sprog – hvilket forfatterne pÃĨstÃĨr kan fÃļre til en ‘salgsmands-agtig’ tone, der reducerer nÃļjagtighed og tillid.

Ad-Chat producerede ogsÃĨ lavere indsÃĶtningsrater, selv nÃĨr vurderet pÃĨ forespÃļrgsler valgt til reklame-egnethed, og forfatterne tilskriver dette en afhÃĶngighed af prompt-baserede signaler (som de karakteriserer som svÃĶre at kontrollere).

I sÃļgemaskine-scenariet opnÃĨede Ad-Chat dog en 8,6% hÃļjere klik-gennem-rate, hvilket papiret antyder kan skyldes fordelene ved at bruge en LLM til at hente produkt-kandidater i stedet for at afhÃĶnge af semantiske indlejring alene:

Sammenligning af samlede prÃĶstations-score pÃĨ tvÃĶrs af fire dommer-modeller (GPT-4.1-mini, Qwen-max, claude-3-5-haiku, kimi-k2) for Ad-Chat og tre Ad-LLM-varianter (GI-R, GIR-R, GIR-P) pÃĨ MT-Menneske-, LM-Marked- og CA-Prod-datasets. Selv om scorene varierer efter dommer, overgÃĨr Ad-LLM konsekvent Ad-Chat pÃĨ tvÃĶrs af alle betingelser.

Sammenligning af samlede prÃĶstations-score pÃĨ tvÃĶrs af fire dommer-modeller (GPT-4.1-mini, Qwen-max, claude-3-5-haiku, kimi-k2) for Ad-Chat og tre Ad-LLM-varianter (GI-R, GIR-R, GIR-P) pÃĨ MT-Menneske-, LM-Marked- og CA-Prod-datasets. Selv om scorene varierer efter dommer, overgÃĨr Ad-LLM konsekvent Ad-Chat pÃĨ tvÃĶrs af alle betingelser.

PÃĨ tvÃĶrs af alle tre datasets producerede Ad-LLM konsekvent bedre resultater end Ad-Chat pÃĨ bÃĨde tilfredshed- og engagement-metrikker. Som vist i resultattabellen ovenfor forbedrede den bedste Ad-LLM-variant sig over Ad-Chat med 8,4, 1,5 og 3,8 procent i samlede kvantitative score; og med 10,7, 10,4 og 8,6 procent i kvalitative score for MT-Menneske-, LM-Marked- og CA-Prod henholdsvis.

I slutningen af papiret bemÃĶrker forfatterne, at bÃĨde Ad-Chat og Ad-LLM krÃĶver hÃļjere ressourcer end de mere innovative og effektive modeller, og at behovet for at bruge LLM-agenter i denne type transaktion kan reprÃĶsentere en betydelig omkostning. Selv om man kunne forestille sig, at latency-problemer (som normalt er kritiske i reklame-serverings-scenarier) kunne opstÃĨ fra LLM-brug af denne type (dog ikke specifikt behandlet i papiret).

Under alle omstÃĶndigheder beviste forfatternes implementering af Ad-Chat-strategien (den Ãļverste rÃĶkke i det tidligere schema, der vises tidligt i artiklen) at tilbyde den hÃļjeste klik-gennem-rate, selv om den havde den hÃļjeste tilknyttede LLM-omkostning.

Konklusion

Selv om det ikke er overraskende, at litteraturen ville spekulere over metoderne, hvorpÃĨ LLM’er kan bÃĶre reklamer, er der faktisk ret lidt offentligt tilgÃĶngelig forskning pÃĨ dette omrÃĨde; dette gÃļr det nuvÃĶrende papir, og hvad vi kan rimeligt fortolke som dets forgÃĶnger, til interessant lÃĶsning.

Enhver, der har arbejdet med en reklame-salgsafdeling eller solgt inventory, vil vide, at reklamegivere altid vil have mere – idealiseret, at have reklamer prÃĶsenteret som faktisk indhold, helt uadskilt fra vÃĶrtsindholdstrÃļmmen; og de vil betale en betydelig prÃĶmie for dette (sammen med vÃĶrten, der derved risikerer sin trovÃĶrdighed og

Derfor vil det vÃĶre interessant at se, i hvilken udstrÃĶkning, hvis overhovedet, de reklame-ladne kodikler, der er forestillet pÃĨ tvÃĶrs af de to papirer, kan blive incentiviseret til at krÃĶbe lÃĶngere op ad en LLM’s respons og nÃĶrmere ‘payload’. FÃļrst publiceret torsdag, 18. september 2025

Forfatter til maskinlÃĶringsartikler, domÃĶneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold pÃĨ Metaphysic.ai, indtil oplÃļsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: [email protected]