Andersons vinkel
Klare til reklame i store språkmodeller

Ny forskning viser hvordan annonser kan bli innbygd direkte i ChatGPT-liknende svar – ikke som banner eller pop-up-vinduer, men innvevd i svaret selv. En ny benchmark tester hvor godt disse annonse-injekserte svarene kan forbli nyttige, troverdige og lønnsomme, og kan kreve en avveining mellom en akseptabel brukeropplevelse og klikk-gjennom-rater.
Som den vidt utbredte og voksende populariteten til store språkmodeller undergraver de tradisjonelle annonseringsmetodene som har drevet internettet nesten siden dets opphav, vil alle som er kjent med venturekapitalisters markedserobringstaktikker være curøse på hvor lenge AI-chatboter vil kunne holde tilbake med å inkludere annonseinnhold i deres svar.
Som Netflix og en utvidet rekke av strømmetjenester demonstrerer, er den tradisjonelle kabel-erastategien for å kombinere betalte abonnementer med innbygde annonser (ofte begrunnet som en måte å holde forbrukerkostnadene nede) igjen på fremmarsj; og skiftet mot å inkorporere annonser direkte i LLM-utdata begynner å se mindre spekulativt ut og mer som en naturlig tilpasning av denne modellen.

Fra papiret ‘Online Advertisements with LLMs: Opportunities and Challenges’, et ganske representativt eksempel på overgangen de fleste mennesker forventer når LLM-er moneteres. Kilde: https://www.sigecom.org/exchanges/volume_22/2/FEIZI.pdf
Perspektivet på å inkludere annonser i en fremvoksende medium som allerede har merkede problemer med troverdighet, kan synes forhastet; dog skalainvesteringen i generativ AI over de siste tolv månedene antyder at markedet ikke for tiden er definert av en forsiktig eller omhyggelig holdning; og med større spillere som OpenAI som kan være over-belastet og trenger en tidlig avkastning på massive investeringer, indikerer historien at bryllupsperioden med annonsefrie utdata kan være på utgangen.
GEM-Bench
Med denne klimaen og disse forretningsimperativene i mente, tilbyr et interessant nytt papir fra Singapore den første benchmark rettet mot AI-chatbot-grensesnitt, sammen med nye kvantifiserende metrikker for hva som kan vise seg å være en av de mest eksplosive annonseringsarenaene på 100 år.
Kanskje optimistisk, antar forfatterne en ren skille mellom ‘ekte’ innhold og annonseinnhold, hvor ‘avviket’ fra standard-svar til markedsføringskopi er ganske lett å spore:

Eksempler på den type annons-integrasjon som kan komme til å skje under to modeller studert i det nye papiret. Kilde: https://arxiv.org/pdf/2509.14221
Det er å se om annonsererne selv vil, som de har tendert til å gjøre, søke å få sitt annons-innhold mer subtilt innarbeidet i utdata enn i eksemplene gitt i papiret.
Likevel er disse saker for senere; for øyeblikket er feltet så nytt at selv grunnleggende terminologi mangler, eller er ikke fastsatt.
Papiret innfører derfor Generative Engine Marketing (GEM) som en ny ramme for å moneterisere LLM-baserte chatboter, ved å innbygge relevante annonser direkte i genererte svar.
Forskerne identifiserer Ad-Injected Response (AIR) generering som den sentrale utfordringen i GEM, og argumenterer for at eksisterende benchmarks er dårlig tilpasset å studere dette. For å fylle denne gapet, innfører de hva de hevder å være den første benchmark spesifikt designet for dette formålet.
GEM-Bench består av tre kurerte datasett som omfatter chatbot- og søkemotorscenarioer. Det inkluderer også en metrikk-ontologi designet for å vurdere flere aspekter av brukertilfredshet og engasjement, sammen med en samling av baseline-metoder implementert i en modulær multi-agent-ramme.
Forfatterne hevder at mens enkle prompt-baserte metoder kan oppnå respektabelt engasjement, som forhøyet klikk-gjennom-rater, tenderer de til å degradere brukertilfredshet. Til gjengjeld viser tilnærminger som setter inn annonser i forhånds-genererte, annonsefrie svar forbedringer i tillit og svarkvalitet – om enn til en høyere beregningskostnad.
Disse avveininger, argumenterer papiret, fremhever behovet for mer effektive og effisiente tekniker for å integrere annonser i generative utdata.
Det nye arbeidet heter GEM-Bench: En Benchmark for Ad-Injected Response Generation within Generative Engine Marketing, og kommer fra fire forskere ved National University of Singapore.
Metode
Opplegg for Generative Engine Marketing (GEM) låner fra grunnprinsippene til Search Engine Marketing (SEM). Tradisjonell SEM fungerer ved å matche forespørsler til annonser gjennom en flertrinns pipeline hvor annonserer byr på nøkkelord; systemet identifiserer hvilke forespørsler utløser annonser; systemet estimerer hvor sannsynlig hver annons er å bli klikket; og deretter tildeler plassering gjennom en auksjon som balanserer byr med forventet engasjement.
I motsetning til dette tilpasser GEM-tilnærmingen de samme trinnene til LLM-er, men møter nye utfordringer på hvert trinn: det er ingen faste annons-plasser, så systemet må bestemme om en forespørsel kan ta en annons og hvor den skal settes inn i fritt tekst; estimat av klikk-gjennom-rater blir vanskeligere uten strukturerte layout; og relevans må balanseres mot brukertilfredshet, ettersom annonserne er innvevd direkte i modellens egen utdata og ikke serveres som selvstendig kopi.
En av baseline-studiene i arbeidet, Ad-Chat, representerer en enkel metode hvor annons-innhold settes inn i system-prompten før modellen genererer et svar. Dette betyr at modellen produserer et svar med annonsen allerede innbygd, guidet av en forhånds-lastet agenda.
Den andre tilnærmingen, Ad-LLM, ble utviklet av forfatterne som en del av den nye benchmark-tilbudet. Ad-LLM tar en modulær vei, først genererer en ren, annonsefri beskjed; velger en relevant annons; identifiserer den beste innsettingspunktet basert på semantisk flyt; og til slutt om-skriver utdata for å integrere annonsen jevnt:

Sammenligning mellom Ad-Chat og forfatterens ‘Ad-LLM’-metode. Ad-Chat injiserer annonser via system-prompten før generering, med begrenset plasseringskontroll. Ad-LLM skiller svar-generering og annons-injeksjon, velger innsettingspunkter basert på semantisk flyt, og finjusterer resultatet. Begge er scoret med GEM-Bench-metrikker for tilfredshet og engasjement.
Mens Ad-Chat er billigere og noen ganger mer overbevisende, tenderer den til å redusere tillit og nøyaktighet. Ad-LLM utfører bedre på brukertilfredshets-metrikker, men til en høyere kostnad.
Data
For AIR-generering ble to typer datasett generert opprinnelig: en bruker-forespørsel-samling (Bruker) og en annons-database (AnnonsDB).
Ettersom bruker-forespørsler definerer annonseringsmuligheter i LLM-ers svar, kan ‘annons-inventaret’ sies å eksistere i disse svarene, selv om dette ikke bare defineres av bruken av brukerens forespørsel, men også av hvor mye systemet vil følge sine egne regler om å balansere integritet mot annonserernes imperativ.
Uansett, vil annonserne bare dukke opp i svar, selv om (se skjema ovenfor) bruker-forespørsler kan hemmelig bli utvidet for å akkommodere annons-tjenesteprosessen.
For chatbot-scenariet konstruerte forfatterne to forespørsel-datasett: MT-Human og LM-Market.
MT-Human ble trukket fra humaniora-delen av MT-Bench, en multi-turn-benchmark for LLM-er, og inneholder spørsmål som sannsynligvis kan akkommodere annons-innhold.
LM-Market ble bygget fra over en halv million ekte ChatGPT-forespørsler samlet inn av LMSYS-Chat-1M, filtrert for engelsk-språklige markedsrelaterte forespørsler, og gruppert etter tema ved hjelp av semantiske innlegg.
I begge tilfeller ble de endelige forespørslerne valgt gjennom en flertrinns pipeline som kombinerer automatisk klustering, LLM-scoring og menneskelig verifisering, med målet å identifisere forespørsler hvor annons-injeksjon ville være naturlig og plausibel.
For å vurdere kvaliteten på annons-injekserte svar, definerer GEM en målings-ontologi som dekker både brukertilfredshet og engasjement. Dette inkluderer kvantitative metrikker som svar-flyt, koherens og klikk-gjennom-rate, samt kvalitative standarder som tillit, nøyaktighet og naturalitet – metrikker som er ment å reflektere både hvor godt en annons passer inn i et svar og hvor sannsynlig brukere er å oppfatte og interagere med den.
Med hensyn til ‘Naturalitet’, sier papiret:
‘[Naturalitet] måler hvor mye annons-injeksjon forstyrer flyten og naturaliteten i samtalen, basert på interruptivitet og autentisitet. Interruptivitet undersøker om annonsen skaper en “hopp ut” eller “brått” følelse under lesing, og bryter brukerens kontinuerlige fokus på temaet.
‘Autentisitet vurderer om annonsen undergraver “menneskelig berøring” eller “naturlig flyt” i samtalen, og gjør svaret mer rigidt, formel og mindre autentisk.’
For å generere en tradisjonell søkemotorscenario for testfasen, skapte forfatterne et datasett kalt CA-Prod fra AdsCVLR-kommersielt korpus, som inneholder 300 000 forespørsel-annons-par, hver bestående av et nøkkelord, metadata og en manuell merking som indikerer relevans:

Fra originalkilden, eksempler fra AdsCVLR-datasettet, som hjalp til å gi materiale for forfatterens tester. Kilde: http://www.jdl.link/doc/2011/20221224_AdsCVLR.pdf
Poster med manglende felt ble fjernet, og bare forespørsler som inneholdt både positive og negative annonser (se bilde ovenfor for eksempler) ble beholdt.
For å finjustere dataene, ble annonser gruppert i seks tematiske grupper (gård- og hageutstyr, slip-on-sko, husholdningsartikler, ernærings-supplementer, Android-enheter og kvinners kjoler) ved hjelp av semantiske innlegg og K-means-klustering.
Forespørsler ble deretter tildelt til temaer i henhold til deres positive annonser, med for tynt eller tett sett ekskludert, før 120 forespørsler og 2 215 unike produkter ble til slutt samplet for benchmarken.
Tester
For å vurdere hvor godt de ulike annons-injeksjons-strategiene fungerte, tok benchmarken opp tre kjerne-spørsmål: hvor effektiv hver metode var over definerte tilfredshets- og engasjements-metrikker; hvordan de interne design-valgene i Ad-LLM kunne påvirke resultater; og hvordan den beregningsmessige kostnaden ville sammenlignes over systemer.
Forfatterne evaluerte Ad-Chat og tre varianter av Ad-LLM-pipeline, hver av dem forskjellige i hvordan annonser ble hentet (enten fra prompten eller fra det genererte svaret), og om det endelige utgangspunktet ble om-skrevet for flyt.
Alle metoder ble kjørt med doubao-1-5-lite-32k som basis-modell og ble bedømt med gpt-4.1-mini.

Effektivitet av Ad-Chat og Ad-LLM-varianter over MT-Human-, LM-Market- og CA-Prod-datasettene. Kvantitative metrikker inkluderer svar-flyt (RF), svar-koherens (RC), annons-flyt (AF), annons-koherens (AC), injeksjons-rate (IR), klikk-gjennom-rate (CTR) og sammenlagt-poeng. Kvalitative metrikker dekker nøyaktighet, naturalitet, personlighet, tillit, merking, klikk (gjennom) og sammenlagt-ytelse.
Over alle tre datasettene produserte Ad-LLM sterkere resultater enn Ad-Chat på både tilfredshets- og engasjements-målinger. Som vist i resultattabellen ovenfor, forbedret den beste Ad-LLM-varianten Ad-Chat med 8,4, 1,5 og 3,8 prosent i sammenlagt-kvantitative poeng; og med 10,7, 10,4 og 8,6 prosent i kvalitative poeng for MT-Human-, LM-Market- og CA-Prod-henholdsvis.
Av disse resultater sier forfatterne:
‘Disse resultater demonstrerer at generering av et råt svar og deretter injeksjon av annonser gir bedre svarkvalitet sammenlignet med den enklere tilnærmingen til å bare stole på system-prompt-injeksjon.
‘For bestemte brukertilfredshets- og engasjements-dimensjoner viser Ad-Chat en betydelig ytelsesforskjell sammenlignet med Ad-LLM-løsninger over alle tre datasettene, spesielt i dimensjoner som nøyaktighet, personlighet og tillit.’
Videre viste Ad-LLM sine sterkeste forbedringer i nøyaktighet, personlighet og tillit, og overgikk Ad-Chat med opptil 17,6, 23,3 og 17,2 prosent henholdsvis. Ifølge papiret kan disse forskjellene skyldes måten Ad-Chat bruker system-prompter til å styre modellen mot mer personlig og promotivt språk – som forfatterne hevder kan føre til en ‘selger-liknende’ tone som reduserer nøyaktighet og tillit.
Ad-Chat produserte også lavere injeksjons-rater, selv når den ble evaluert på forespørsler valgt for annons-egnet, og forfatterne tilskriver dette en avhengighet av prompt-baserte signaler (som de karakteriserer som vanskelige å kontrollere).
I søkemotorscenarioet, derimot, oppnådde Ad-Chat en 8,6 prosent høyere klikk-gjennom-rate, og papiret antyder at dette kan reflektere fordelen med å bruke en LLM til å hente produkt-kandidater, i stedet for å bare stole på semantiske innlegg:

Sammenligning av sammenlagt-ytelsespoeng over fire dommer-modeller (GPT-4.1-mini, Qwen-max, claude-3-5-haiku, kimi-k2) for Ad-Chat og tre Ad-LLM-varianter (GI-R, GIR-R, GIR-P) på MT-Human-, LM-Market- og CA-Prod-datasettene. Mens poengene varierer med dommer, overgår Ad-LLM konsekvent Ad-Chat over alle forhold.
Over alle tre datasettene produserte Ad-LLM konsekvent bedre resultater enn Ad-Chat på både tilfredshets- og engasjements-målinger. Som vist i resultattabellen ovenfor, overgikk den beste Ad-LLM-varianten Ad-Chat med 8,4, 1,5 og 3,8 prosent i sammenlagt-kvantitative poeng; og med 10,7, 10,4 og 8,6 prosent i kvalitative poeng for MT-Human-, LM-Market- og CA-Prod-henholdsvis.
I tillegg til disse resultater, sier forfatterne:
‘Disse resultater demonstrerer at generering av et råt svar og deretter injeksjon av annonser gir bedre svarkvalitet sammenlignet med den enklere tilnærmingen til å bare stole på system-prompt-injeksjon.
‘For bestemte brukertilfredshets- og engasjements-dimensjoner viser Ad-Chat en betydelig ytelsesforskjell sammenlignet med Ad-LLM-løsninger over alle tre datasettene, spesielt i dimensjoner som nøyaktighet, personlighet og tillit.’
Konklusjon
Selv om det ikke er overraskende at litteraturen skulle spekulere på metodene for å få LLM-er til å bære annonser, er det faktisk ganske lite offentlig tilgjengelig forskning på dette området; dette gjør det nåværende papiret, og hva vi kan fornuftig tolke som dets forgjenger, interessant lesning.
Alle som har arbeidet med en annonse-salg-avdeling, eller som har solgt annonse-inventar, vet at annonserer alltid vil ha mer – ideal sett, å ha annonser presentert som faktisk innhold, helt uanskillig fra verts-innhold-strømmen; og de vil betale en betydelig premie for dette (sammen med verts-partner, som risikerer sin troverdighet og stilling med lesere og andre typer interessenter).
Derfor vil det være interessant å se omfanget, hvis noen, av de annons-beladde kodicillene som er forutsett over de to papirene, kan bli motivert til å klatre lengre opp i en LLMs svar, og nærmere ‘lasten’. Først publisert torsdag, 18. september 2025












