Andersons vinkel
Forberedelse til reklamer i store sprogmodeller

Nyt forskning viser, hvordan reklamer snart kan indlejres direkte i ChatGPT-lignende svar – ikke som banner eller pop-ups, men vævet ind i svaret selv. En ny benchmark test, hvordan godt disse reklame-indsprøjtede svar kan blive brugbare, troværdige og profitable, og kan kræve en afvejning mellem en acceptabel brugeroplevelse og klik.
Som den udbredte og voksende popularitet af store sprogmodeller underminerer de traditionelle reklamemetoder, der har drevet internettet næsten siden dets oprettelse, vil enhver, der er bekendt med venturekapitalisters markedsindtagelsestaktikker, undre sig over, hvor længe AI-chatbots kan holde sig tilbage fra at inkludere reklameindhold i deres svar.
Som Netflix og en udvidende række af streamingtjenester demonstrerer, er den traditionelle kabel-æra-strategi for at kombinere betalte abonnementer med indlejrede reklamer (ofte berettiget som en måde at holde forbrugeromkostningerne nede) ved at genopblive; og skiftet mod at inkorporere reklamer direkte i LLM-outputs er begyndt at se mindre spekulativt ud og mere som en naturlig tilpasning af den model.

Fra papiret ‘Online Reklamer med LLM’er: Muligheder og Udfordringer’, et ret repræsentativt eksempel på overgangen, som de fleste mennesker forventer, når LLM’er moneteres. Kilde: https://www.sigecom.org/exchanges/volume_22/2/FEIZI.pdf
Udsigten til at inkludere reklamer i en opkomment medium, der allerede har bemærkelsesværdige problemer med troværdighed, kan synes forhastet; dog investeringen i generativ AI over de sidste tolv måneder antyder, at markedet ikke er defineret af en forsigtig eller omhyggelig holdning; og med større spillere som OpenAI, der kan siges at være over-belånt og har brug for en tidlig afkast på massive investeringer, tyder historien på, at honningmånedeperioden med reklamefrie outputs kan være ved at løbe ud.
GEM-Bench
Med denne klima og disse forretningsimperativer i mente, tilbyder et interessant nyt papir fra Singapore den første benchmark rettet mod AI-chatbot-grænseflader, sammen med nye kvantificeringsmetrikker for, hvad der kan vise sig at være en af de mest eksplosive reklamearenaer i 100 år.
Forfatterne antager måske optimistisk en klar skillelinje mellem ‘sandt’ indhold og reklameindhold, hvor ‘afvigelsen’ fra standard-svar til marketing-kopi er ret let at spotte:

Eksempler på den type reklameintegration, der kan komme til at ske under to modeller, der er studeret i det nye papir. Kilde: https://arxiv.org/pdf/2509.14221
Det er endnu ikke klart, om reklamegivere selv vil, som de har tendens til, søge at have deres reklameindhold mere subtilt integreret i output end i de eksempler, der er givet i papiret.
Men disse er emner for senere; for øjeblikket er feltet så ny, at selv grundlæggende terminologi mangler eller ikke er fastlagt.
Papiret introducerer derfor Generative Engine Marketing (GEM) som en ny ramme for at moneterisere LLM-baserede chatbots, ved at indlejre relevante reklamer direkte i genererede svar.
Forskerne identificerer Ad-Injected Response (AIR) generation som den centrale udfordring i GEM og argumenterer for, at eksisterende benchmarks er dårligt egnede til at studere det. For at udfylde denne lukke introducerer de, hvad de påstår at være den første benchmark, der specifikt er designet til dette formål.
GEM-Bench består af tre kuraterede datasets, der spænder over chatbot- og søgemaskinescenarioer. Det inkluderer også en metrik-ontologi designet til at vurdere multiple aspekter af brugertilfredshed og engagement, samt en samling af baseline-metoder implementeret inden for en modulær multi-agent-ramme.
Forfatterne påstår, at selv om simple prompt-baserede metoder kan opnå respektabelt engagement-metrikker, såsom forhøjede klik-gennem-rater (CTR), tenderer de til at degradere brugertilfredshed. Til gengæld viser tilgange, der indsætter reklamer i forudgenererede, reklamefrie svar, forbedringer i tillid og svarkvalitet – dog til en højere beregningsmæssig omkostning.
Disse kompromiser, argumenterer papiret, fremhæver behovet for mere effektive og effektive teknikker til at integrere reklamer i generative outputs.
Det nye arbejde er titlen GEM-Bench: En Benchmark for Ad-Injected Response Generation inden for Generative Engine Marketing og kommer fra fire forskere ved National University of Singapore.
Metode
Oversigten over Generative Engine Marketing (GEM) låner fra grundprincipperne i Search Engine Marketing (SEM). Traditionel SEM fungerer ved at matche forespørgsler til reklamer gennem en multistage-pipeline, hvor reklamegivere byder på nøgleord; systemet identificerer, hvilke forespørgsler udløser reklamer; systemet estimerer, hvor sandsynligt det er, at hver reklame klikkes; og derefter allokerer placering gennem en auktion, der balancerer bud med forventet engagement.
I modsætning hertil tilpasser GEM-tilgangen disse faser til LLM’er, men står over for nye udfordringer på hvert trin: der er ingen faste reklamepladser, så systemet må afgøre, om en forespørgsel kan tage en reklame og hvor den skal indsættes i fri tekst; estimering af klik-gennem-rater bliver sværere uden strukturerede layouts; og relevans må balanceres mod brugertilfredshed, da reklamerne er vævet direkte ind i modellens egen output og ikke serveres som selvstændig kopi.
En af baseline-studierne i arbejdet, Ad-Chat, repræsenterer en simpel metode, hvor reklameindhold indsættes i systemprompten før modellen genererer et svar. Dette betyder, at modellen producerer et svar med reklamen allerede indlejret, guidet af en forudindlæst dagsorden.
Den anden tilgang, Ad-LLM, blev udviklet af forfatterne som en del af den nye benchmark-tilbud. Ad-LLM følger en modulær vej, først genererer en ren, reklamefri besked; vælger en relevant reklame; identificerer det bedste indsætningspunkt baseret på semantisk flow; og til sidst omskriver outputtet for at integrere reklamen smukt:

Sammenligning mellem Ad-Chat og forfatternes ‘Ad-LLM’-metode. Ad-Chat indsætter reklamer via systemprompten før generation, med begrænset indsætningskontrol. Ad-LLM adskiller respons-generation og reklameindsætning, vælger indsætningspunkter baseret på semantisk flow og raffinerer resultatet. Begge vurderes ved hjælp af GEM-Bench-metrikker for tilfredshed og engagement.
Mens Ad-Chat er billigere og nogle gange mere overbevisende, tenderer den til at reducere tillid og nøjagtighed. Ad-LLM performer bedre på brugertilfredsheds-metrikker, men til en højere omkostning.
Data
Til AIR-generation blev to typer af datasets genereret initialt: en brugerforespørgsel-sæt (Bruger) og en reklamedatabase (ReklameDB).
Siden brugerforespørgsler definerer reklame-muligheder i LLM’ens svar, kan ‘reklame-inventaret’ siges at eksistere i disse svar, selv om dette ikke kun defineres af brugerforespørgslens anvendelighed, men også af, i hvilken udstrækning systemet vil overholde sine egne regler om at balancere integritet mod reklamegivernes imperativer.
Under alle omstændigheder vil reklamerne kun dukke op i svar, selv om (se schema ovenfor) brugeranmodninger kan være hemmeligt forstærket for at tilpasse reklame-serveringsprocessen.
Til chatbot-scenariet konstruerede forfatterne to forespørgsel-datasets: MT-Menneske og LM-Marked.
MT-Menneske blev trukket fra humaniora-delen af MT-Bench, en multi-turn-benchmark for LLM’er, og indeholder spørgsmål, der sandsynligvis kan indeholde reklameindhold.
LM-Marked blev bygget fra over en halv million virkelige ChatGPT-forespørgsler samlet af LMSYS-Chat-1M, filtreret for engelsk-sprogede marketing-relaterede forespørgsler og grupperet efter emne ved hjælp af semantiske indlejring.
I begge tilfælde blev de endelige forespørgsler valgt gennem en multi-stage-pipeline, der kombinerer automatiseret klustering, LLM-vurdering og menneskelig verificering, med det formål at identificere forespørgsler, hvor reklameindsætning ville være naturlig og plausibel.
For at evaluere kvaliteten af reklame-indsprøjtede svar definerer GEM en målings-ontologi, der dækker både brugertilfredshed og engagement. Dette tager i betragtning kvantitative metrikker, herunder respons-flow, koherens og klik-gennem-rate, samt kvalitative standarder som tillid, nøjagtighed og naturalitet – metrikker, der er designet til at reflektere både, hvor godt en reklame passer ind i et svar, og hvor sandsynligt brugere er til at opfatte og interagere med den.
Med hensyn til ‘Naturalitet’ fastslår papiret:
‘[Naturalitet] måler, i hvilken udstrækning reklameindsætning forstyrrer flowet og naturaliteten i samtalen, baseret på interruptivitet og autenticitet. Interruptivitet undersøger, om reklamen skaber en “spring ud” eller “abrupt” følelse under læsning, og bryder brugerens kontinuerlige fokus på emnet.
‘Autenticitet vurderer, om reklamen undergraver “menneskeligt touch” eller “naturlig flow” i samtalen, og gør svaret til at se stift, formel og mindre autentisk.’
For at generere en traditionel søgemaskine-scenario til testfasen oprettede forfatterne en dataset med titlen CA-Prod fra AdsCVLR-korpus, der indeholder 300.000 forespørgsel-reklame-par, hver bestående af et nøgleord, metadata og en manuel mærkning, der markerer relevans:

Fra det oprindelige kildepapir, eksempler fra AdsCVLR-dataset, der hjalp med at levere materiale til forfatternes tests. Kilde: http://www.jdl.link/doc/2011/20221224_AdsCVLR.pdf
Poster med manglende felter blev fjernet, og kun forespørgsler, der indeholdt både positive og negative reklamer (se billedet ovenfor for eksempler), blev beholdt.
For at raffinere dataene blev reklamer grupperet i seks emne-grupper (have- og haven-redskaber, slip-on-sko, husstandensartikler, ernærings-supplementer, Android-enheder og kvinde-kjoler) ved hjælp af semantiske indlejring og K-means-klustering.
Forespørgsler blev derefter tildelt til emner efter deres positive reklamer, med for sparsomme eller tætte sæt udeladt, før 120 forespørgsler og 2.215 unikke produkter endelig blev udvalgt til benchmarket.
Tests
For at evaluere, hvor godt de varierende reklame-indsprøjtningsstrategier fungerede, tog benchmarket fat på tre kerne-spørgsmål: hvor effektiv hver metode var på tværs af definerede tilfredshed- og engagement-metrikker; hvordan de interne designvalg inden for Ad-LLM kunne påvirke resultaterne; og hvordan den beregningsmæssige omkostning ville sammenlignes på tværs af systemer.
Forfatterne evaluerede Ad-Chat og tre varianter af forfatternes Ad-LLM-pipeline, hver af dem forskellig i, hvordan reklamer blev hentet (enten fra prompten eller fra det genererede svar), og i, om den endelige output blev omskrevet for flydende sprog:

Effektiviteten af Ad-Chat og Ad-LLM-varianter på tværs af MT-Menneske-, LM-Marked- og CA-Prod-datasets. Kvantitative metrikker inkluderer respons-flow (RF), respons-koherens (RC), reklame-flow (AF), reklame-koherens (AC), indsætningsrate (IR), klik-gennem-rate (CTR) og samlede score. Kvalitative metrikker dækker nøjagtighed, naturalitet, personlighed, tillid, opmærksomhed, klik (gennem) og samlet præstation.
På tværs af alle tre datasets producerede Ad-LLM stærkere resultater end Ad-Chat på både tilfredshed- og engagement-metrikker. Som vist i resultattabellen ovenfor forbedrede den bedste Ad-LLM-variant sig over Ad-Chat med 8,4, 1,5 og 3,8 procent i samlede kvantitative score; og med 10,7, 10,4 og 8,6 procent i kvalitative score for MT-Menneske-, LM-Marked- og CA-Prod henholdsvis.
Af disse resultater fastslår forfatterne:
‘Disse resultater demonstrerer, at generation af et råt svar og efterfølgende indsætning af reklamer giver bedre responskvalitet i forhold til den mere simple tilgang, hvor man kun afhænger af systemprompt-indsætning.
‘For bestemte brugertilfredshed- og engagement-dimensioner viser Ad-Chat konsekvent en betydelig præstationsgap i forhold til Ad-LLM-løsninger på tværs af alle tre datasets, især i dimensioner som nøjagtighed, personlighed og tillid.’
Yderligere viste Ad-LLM sine stærkeste forbedringer i nøjagtighed, personlighed og tillid, overgående Ad-Chat med op til 17,6%, 23,3% og 17,2% henholdsvis. Ifølge papiret kunne disse forskelle skyldes, at Ad-Chat bruger systemprompts til at styre modellen mod mere personlig og promoverende sprog – hvilket forfatterne påstår kan føre til en ‘salgsmands-agtig’ tone, der reducerer nøjagtighed og tillid.
Ad-Chat producerede også lavere indsætningsrater, selv når vurderet på forespørgsler valgt til reklame-egnethed, og forfatterne tilskriver dette en afhængighed af prompt-baserede signaler (som de karakteriserer som svære at kontrollere).
I søgemaskine-scenariet opnåede Ad-Chat dog en 8,6% højere klik-gennem-rate, hvilket papiret antyder kan skyldes fordelene ved at bruge en LLM til at hente produkt-kandidater i stedet for at afhænge af semantiske indlejring alene:

Sammenligning af samlede præstations-score på tværs af fire dommer-modeller (GPT-4.1-mini, Qwen-max, claude-3-5-haiku, kimi-k2) for Ad-Chat og tre Ad-LLM-varianter (GI-R, GIR-R, GIR-P) på MT-Menneske-, LM-Marked- og CA-Prod-datasets. Selv om scorene varierer efter dommer, overgår Ad-LLM konsekvent Ad-Chat på tværs af alle betingelser.
På tværs af alle tre datasets producerede Ad-LLM konsekvent bedre resultater end Ad-Chat på både tilfredshed- og engagement-metrikker. Som vist i resultattabellen ovenfor forbedrede den bedste Ad-LLM-variant sig over Ad-Chat med 8,4, 1,5 og 3,8 procent i samlede kvantitative score; og med 10,7, 10,4 og 8,6 procent i kvalitative score for MT-Menneske-, LM-Marked- og CA-Prod henholdsvis.
I slutningen af papiret bemærker forfatterne, at både Ad-Chat og Ad-LLM kræver højere ressourcer end de mere innovative og effektive modeller, og at behovet for at bruge LLM-agenter i denne type transaktion kan repræsentere en betydelig omkostning. Selv om man kunne forestille sig, at latency-problemer (som normalt er kritiske i reklame-serverings-scenarier) kunne opstå fra LLM-brug af denne type (dog ikke specifikt behandlet i papiret).
Under alle omstændigheder beviste forfatternes implementering af Ad-Chat-strategien (den øverste række i det tidligere schema, der vises tidligt i artiklen) at tilbyde den højeste klik-gennem-rate, selv om den havde den højeste tilknyttede LLM-omkostning.
Konklusion
Selv om det ikke er overraskende, at litteraturen ville spekulere over metoderne, hvorpå LLM’er kan bære reklamer, er der faktisk ret lidt offentligt tilgængelig forskning på dette område; dette gør det nuværende papir, og hvad vi kan rimeligt fortolke som dets forgænger, til interessant læsning.
Enhver, der har arbejdet med en reklame-salgsafdeling eller solgt inventory, vil vide, at reklamegivere altid vil have mere – idealiseret, at have reklamer præsenteret som faktisk indhold, helt uadskilt fra værtsindholdstrømmen; og de vil betale en betydelig præmie for dette (sammen med værten, der derved risikerer sin troværdighed og
Derfor vil det være interessant at se, i hvilken udstrækning, hvis overhovedet, de reklame-ladne kodikler, der er forestillet på tværs af de to papirer, kan blive incentiviseret til at kræbe længere op ad en LLM’s respons og nærmere ‘payload’. Først publiceret torsdag, 18. september 2025












