Andersons vinkel

Klare til reklame i store sprÃĨkmodeller

mm
Legg til Unite.AI blant dine foretrukne kilder pÃĨ Google
Source: ChatGPT-4o and https://commons.wikimedia.org/wiki/File:Microsoft_Surface_Laptop_7.jpg

Ny forskning viser hvordan annonser kan bli innbygd direkte i ChatGPT-liknende svar – ikke som banner eller pop-up-vinduer, men innvevd i svaret selv. En ny benchmark tester hvor godt disse annonse-injekserte svarene kan forbli nyttige, troverdige og lÃļnnsomme, og kan kreve en avveining mellom en akseptabel brukeropplevelse og klikk-gjennom-rater.

 

Som den vidt utbredte og voksende populariteten til store sprÃĨkmodeller undergraver de tradisjonelle annonseringsmetodene som har drevet internettet nesten siden dets opphav, vil alle som er kjent med venturekapitalisters markedserobringstaktikker vÃĶre curÃļse pÃĨ hvor lenge AI-chatboter vil kunne holde tilbake med ÃĨ inkludere annonseinnhold i deres svar.

Som Netflix og en utvidet rekke av strÃļmmetjenester demonstrerer, er den tradisjonelle kabel-erastategien for ÃĨ kombinere betalte abonnementer med innbygde annonser (ofte begrunnet som en mÃĨte ÃĨ holde forbrukerkostnadene nede) igjen pÃĨ fremmarsj; og skiftet mot ÃĨ inkorporere annonser direkte i LLM-utdata begynner ÃĨ se mindre spekulativt ut og mer som en naturlig tilpasning av denne modellen.

Fra papiret 'Online Advertisements with LLMs: Opportunities and Challenges', et ganske representativt eksempel pÃĨ overgangen de fleste mennesker forventer nÃĨr LLM-er moneteres. Kilde: https://www.sigecom.org/exchanges/volume_22/2/FEIZI.pdf

Fra papiret ‘Online Advertisements with LLMs: Opportunities and Challenges’, et ganske representativt eksempel pÃĨ overgangen de fleste mennesker forventer nÃĨr LLM-er moneteres. Kilde: https://www.sigecom.org/exchanges/volume_22/2/FEIZI.pdf

Perspektivet pÃĨ ÃĨ inkludere annonser i en fremvoksende medium som allerede har merkede problemer med troverdighet, kan synes forhastet; dog skalainvesteringen i generativ AI over de siste tolv mÃĨnedene antyder at markedet ikke for tiden er definert av en forsiktig eller omhyggelig holdning; og med stÃļrre spillere som OpenAI som kan vÃĶre over-belastet og trenger en tidlig avkastning pÃĨ massive investeringer, indikerer historien at bryllupsperioden med annonsefrie utdata kan vÃĶre pÃĨ utgangen.

GEM-Bench

Med denne klimaen og disse forretningsimperativene i mente, tilbyr et interessant nytt papir fra Singapore den fÃļrste benchmark rettet mot AI-chatbot-grensesnitt, sammen med nye kvantifiserende metrikker for hva som kan vise seg ÃĨ vÃĶre en av de mest eksplosive annonseringsarenaene pÃĨ 100 ÃĨr.

Kanskje optimistisk, antar forfatterne en ren skille mellom ‘ekte’ innhold og annonseinnhold, hvor ‘avviket’ fra standard-svar til markedsfÃļringskopi er ganske lett ÃĨ spore:

Eksempler pÃĨ den type annons-integrasjon som kan komme til ÃĨ skje under to modeller studert i det nye papiret. Kilde: https://arxiv.org/pdf/2509.14221

Eksempler pÃĨ den type annons-integrasjon som kan komme til ÃĨ skje under to modeller studert i det nye papiret. Kilde: https://arxiv.org/pdf/2509.14221

Det er ÃĨ se om annonsererne selv vil, som de har tendert til ÃĨ gjÃļre, sÃļke ÃĨ fÃĨ sitt annons-innhold mer subtilt innarbeidet i utdata enn i eksemplene gitt i papiret.

Likevel er disse saker for senere; for Ãļyeblikket er feltet sÃĨ nytt at selv grunnleggende terminologi mangler, eller er ikke fastsatt.

Papiret innfÃļrer derfor Generative Engine Marketing (GEM) som en ny ramme for ÃĨ moneterisere LLM-baserte chatboter, ved ÃĨ innbygge relevante annonser direkte i genererte svar.

Forskerne identifiserer Ad-Injected Response (AIR) generering som den sentrale utfordringen i GEM, og argumenterer for at eksisterende benchmarks er dÃĨrlig tilpasset ÃĨ studere dette. For ÃĨ fylle denne gapet, innfÃļrer de hva de hevder ÃĨ vÃĶre den fÃļrste benchmark spesifikt designet for dette formÃĨlet.

GEM-Bench bestÃĨr av tre kurerte datasett som omfatter chatbot- og sÃļkemotorscenarioer. Det inkluderer ogsÃĨ en metrikk-ontologi designet for ÃĨ vurdere flere aspekter av brukertilfredshet og engasjement, sammen med en samling av baseline-metoder implementert i en modulÃĶr multi-agent-ramme.

Forfatterne hevder at mens enkle prompt-baserte metoder kan oppnÃĨ respektabelt engasjement, som forhÃļyet klikk-gjennom-rater, tenderer de til ÃĨ degradere brukertilfredshet. Til gjengjeld viser tilnÃĶrminger som setter inn annonser i forhÃĨnds-genererte, annonsefrie svar forbedringer i tillit og svarkvalitet – om enn til en hÃļyere beregningskostnad.

Disse avveininger, argumenterer papiret, fremhever behovet for mer effektive og effisiente tekniker for ÃĨ integrere annonser i generative utdata.

Det nye arbeidet heter GEM-Bench: En Benchmark for Ad-Injected Response Generation within Generative Engine Marketing, og kommer fra fire forskere ved National University of Singapore.

Metode

Opplegg for Generative Engine Marketing (GEM) lÃĨner fra grunnprinsippene til Search Engine Marketing (SEM). Tradisjonell SEM fungerer ved ÃĨ matche forespÃļrsler til annonser gjennom en flertrinns pipeline hvor annonserer byr pÃĨ nÃļkkelord; systemet identifiserer hvilke forespÃļrsler utlÃļser annonser; systemet estimerer hvor sannsynlig hver annons er ÃĨ bli klikket; og deretter tildeler plassering gjennom en auksjon som balanserer byr med forventet engasjement.

I motsetning til dette tilpasser GEM-tilnÃĶrmingen de samme trinnene til LLM-er, men mÃļter nye utfordringer pÃĨ hvert trinn: det er ingen faste annons-plasser, sÃĨ systemet mÃĨ bestemme om en forespÃļrsel kan ta en annons og hvor den skal settes inn i fritt tekst; estimat av klikk-gjennom-rater blir vanskeligere uten strukturerte layout; og relevans mÃĨ balanseres mot brukertilfredshet, ettersom annonserne er innvevd direkte i modellens egen utdata og ikke serveres som selvstendig kopi.

En av baseline-studiene i arbeidet, Ad-Chat, representerer en enkel metode hvor annons-innhold settes inn i system-prompten fÃļr modellen genererer et svar. Dette betyr at modellen produserer et svar med annonsen allerede innbygd, guidet av en forhÃĨnds-lastet agenda.

Den andre tilnÃĶrmingen, Ad-LLM, ble utviklet av forfatterne som en del av den nye benchmark-tilbudet. Ad-LLM tar en modulÃĶr vei, fÃļrst genererer en ren, annonsefri beskjed; velger en relevant annons; identifiserer den beste innsettingspunktet basert pÃĨ semantisk flyt; og til slutt om-skriver utdata for ÃĨ integrere annonsen jevnt:

Sammenligning mellom Ad-Chat og forfatterens 'Ad-LLM'-metode. Ad-Chat injiserer annonser via system-prompten fÃļr generering, med begrenset plasseringskontroll. Ad-LLM skiller svar-generering og annons-injeksjon, velger innsettingspunkter basert pÃĨ semantisk flyt, og finjusterer resultatet. Begge er scoret med GEM-Bench-metrikker for tilfredshet og engasjement

Sammenligning mellom Ad-Chat og forfatterens ‘Ad-LLM’-metode. Ad-Chat injiserer annonser via system-prompten fÃļr generering, med begrenset plasseringskontroll. Ad-LLM skiller svar-generering og annons-injeksjon, velger innsettingspunkter basert pÃĨ semantisk flyt, og finjusterer resultatet. Begge er scoret med GEM-Bench-metrikker for tilfredshet og engasjement.

Mens Ad-Chat er billigere og noen ganger mer overbevisende, tenderer den til ÃĨ redusere tillit og nÃļyaktighet. Ad-LLM utfÃļrer bedre pÃĨ brukertilfredshets-metrikker, men til en hÃļyere kostnad.

Data

For AIR-generering ble to typer datasett generert opprinnelig: en bruker-forespÃļrsel-samling (Bruker) og en annons-database (AnnonsDB).

Ettersom bruker-forespÃļrsler definerer annonseringsmuligheter i LLM-ers svar, kan ‘annons-inventaret’ sies ÃĨ eksistere i disse svarene, selv om dette ikke bare defineres av bruken av brukerens forespÃļrsel, men ogsÃĨ av hvor mye systemet vil fÃļlge sine egne regler om ÃĨ balansere integritet mot annonserernes imperativ.

Uansett, vil annonserne bare dukke opp i svar, selv om (se skjema ovenfor) bruker-forespÃļrsler kan hemmelig bli utvidet for ÃĨ akkommodere annons-tjenesteprosessen.

For chatbot-scenariet konstruerte forfatterne to forespÃļrsel-datasett: MT-Human og LM-Market.

MT-Human ble trukket fra humaniora-delen av MT-Bench, en multi-turn-benchmark for LLM-er, og inneholder spÃļrsmÃĨl som sannsynligvis kan akkommodere annons-innhold.

LM-Market ble bygget fra over en halv million ekte ChatGPT-forespÃļrsler samlet inn av LMSYS-Chat-1M, filtrert for engelsk-sprÃĨklige markedsrelaterte forespÃļrsler, og gruppert etter tema ved hjelp av semantiske innlegg.

I begge tilfeller ble de endelige forespÃļrslerne valgt gjennom en flertrinns pipeline som kombinerer automatisk klustering, LLM-scoring og menneskelig verifisering, med mÃĨlet ÃĨ identifisere forespÃļrsler hvor annons-injeksjon ville vÃĶre naturlig og plausibel.

For ÃĨ vurdere kvaliteten pÃĨ annons-injekserte svar, definerer GEM en mÃĨlings-ontologi som dekker bÃĨde brukertilfredshet og engasjement. Dette inkluderer kvantitative metrikker som svar-flyt, koherens og klikk-gjennom-rate, samt kvalitative standarder som tillit, nÃļyaktighet og naturalitet – metrikker som er ment ÃĨ reflektere bÃĨde hvor godt en annons passer inn i et svar og hvor sannsynlig brukere er ÃĨ oppfatte og interagere med den.

Med hensyn til ‘Naturalitet’, sier papiret:

‘[Naturalitet] mÃĨler hvor mye annons-injeksjon forstyrer flyten og naturaliteten i samtalen, basert pÃĨ interruptivitet og autentisitet. Interruptivitet undersÃļker om annonsen skaper en “hopp ut” eller “brÃĨtt” fÃļlelse under lesing, og bryter brukerens kontinuerlige fokus pÃĨ temaet.

‘Autentisitet vurderer om annonsen undergraver “menneskelig berÃļring” eller “naturlig flyt” i samtalen, og gjÃļr svaret mer rigidt, formel og mindre autentisk.’

For ÃĨ generere en tradisjonell sÃļkemotorscenario for testfasen, skapte forfatterne et datasett kalt CA-Prod fra AdsCVLR-kommersielt korpus, som inneholder 300 000 forespÃļrsel-annons-par, hver bestÃĨende av et nÃļkkelord, metadata og en manuell merking som indikerer relevans:

Fra originalkilden, eksempler fra AdsCVLR-datasettet, som hjalp til ÃĨ gi materiale for forfatterens tester. Kilde: http://www.jdl.link/doc/2011/20221224_AdsCVLR.pdf

Fra originalkilden, eksempler fra AdsCVLR-datasettet, som hjalp til ÃĨ gi materiale for forfatterens tester. Kilde: http://www.jdl.link/doc/2011/20221224_AdsCVLR.pdf

Poster med manglende felt ble fjernet, og bare forespÃļrsler som inneholdt bÃĨde positive og negative annonser (se bilde ovenfor for eksempler) ble beholdt.

For ÃĨ finjustere dataene, ble annonser gruppert i seks tematiske grupper (gÃĨrd- og hageutstyr, slip-on-sko, husholdningsartikler, ernÃĶrings-supplementer, Android-enheter og kvinners kjoler) ved hjelp av semantiske innlegg og K-means-klustering.

ForespÃļrsler ble deretter tildelt til temaer i henhold til deres positive annonser, med for tynt eller tett sett ekskludert, fÃļr 120 forespÃļrsler og 2 215 unike produkter ble til slutt samplet for benchmarken.

Tester

For ÃĨ vurdere hvor godt de ulike annons-injeksjons-strategiene fungerte, tok benchmarken opp tre kjerne-spÃļrsmÃĨl: hvor effektiv hver metode var over definerte tilfredshets- og engasjements-metrikker; hvordan de interne design-valgene i Ad-LLM kunne pÃĨvirke resultater; og hvordan den beregningsmessige kostnaden ville sammenlignes over systemer.

Forfatterne evaluerte Ad-Chat og tre varianter av Ad-LLM-pipeline, hver av dem forskjellige i hvordan annonser ble hentet (enten fra prompten eller fra det genererte svaret), og om det endelige utgangspunktet ble om-skrevet for flyt.

Alle metoder ble kjÃļrt med doubao-1-5-lite-32k som basis-modell og ble bedÃļmt med gpt-4.1-mini.

Effektivitet av Ad-Chat og Ad-LLM-varianter over MT-Human-, LM-Market- og CA-Prod-datasettene. Kvantitative metrikker inkluderer svar-flyt (RF), svar-koherens (RC), annons-flyt (AF), annons-koherens (AC), injeksjons-rate (IR), klikk-gjennom-rate (CTR) og sammenlagt-poeng. Kvalitative metrikker dekker nÃļyaktighet, naturalitet, personlighet, tillit, merking, klikk (gjennom) og sammenlagt-ytelse.

Effektivitet av Ad-Chat og Ad-LLM-varianter over MT-Human-, LM-Market- og CA-Prod-datasettene. Kvantitative metrikker inkluderer svar-flyt (RF), svar-koherens (RC), annons-flyt (AF), annons-koherens (AC), injeksjons-rate (IR), klikk-gjennom-rate (CTR) og sammenlagt-poeng. Kvalitative metrikker dekker nÃļyaktighet, naturalitet, personlighet, tillit, merking, klikk (gjennom) og sammenlagt-ytelse.

Over alle tre datasettene produserte Ad-LLM sterkere resultater enn Ad-Chat pÃĨ bÃĨde tilfredshets- og engasjements-mÃĨlinger. Som vist i resultattabellen ovenfor, forbedret den beste Ad-LLM-varianten Ad-Chat med 8,4, 1,5 og 3,8 prosent i sammenlagt-kvantitative poeng; og med 10,7, 10,4 og 8,6 prosent i kvalitative poeng for MT-Human-, LM-Market- og CA-Prod-henholdsvis.

Av disse resultater sier forfatterne:

‘Disse resultater demonstrerer at generering av et rÃĨt svar og deretter injeksjon av annonser gir bedre svarkvalitet sammenlignet med den enklere tilnÃĶrmingen til ÃĨ bare stole pÃĨ system-prompt-injeksjon.

‘For bestemte brukertilfredshets- og engasjements-dimensjoner viser Ad-Chat en betydelig ytelsesforskjell sammenlignet med Ad-LLM-lÃļsninger over alle tre datasettene, spesielt i dimensjoner som nÃļyaktighet, personlighet og tillit.’

Videre viste Ad-LLM sine sterkeste forbedringer i nÃļyaktighet, personlighet og tillit, og overgikk Ad-Chat med opptil 17,6, 23,3 og 17,2 prosent henholdsvis. IfÃļlge papiret kan disse forskjellene skyldes mÃĨten Ad-Chat bruker system-prompter til ÃĨ styre modellen mot mer personlig og promotivt sprÃĨk – som forfatterne hevder kan fÃļre til en ‘selger-liknende’ tone som reduserer nÃļyaktighet og tillit.

Ad-Chat produserte ogsÃĨ lavere injeksjons-rater, selv nÃĨr den ble evaluert pÃĨ forespÃļrsler valgt for annons-egnet, og forfatterne tilskriver dette en avhengighet av prompt-baserte signaler (som de karakteriserer som vanskelige ÃĨ kontrollere).

I sÃļkemotorscenarioet, derimot, oppnÃĨdde Ad-Chat en 8,6 prosent hÃļyere klikk-gjennom-rate, og papiret antyder at dette kan reflektere fordelen med ÃĨ bruke en LLM til ÃĨ hente produkt-kandidater, i stedet for ÃĨ bare stole pÃĨ semantiske innlegg:

Sammenligning av sammenlagt-ytelsespoeng over fire dommer-modeller (GPT-4.1-mini, Qwen-max, claude-3-5-haiku, kimi-k2) for Ad-Chat og tre Ad-LLM-varianter (GI-R, GIR-R, GIR-P) pÃĨ MT-Human-, LM-Market- og CA-Prod-datasettene. Mens poengene varierer med dommer, overgÃĨr Ad-LLM konsekvent Ad-Chat over alle forhold.

Sammenligning av sammenlagt-ytelsespoeng over fire dommer-modeller (GPT-4.1-mini, Qwen-max, claude-3-5-haiku, kimi-k2) for Ad-Chat og tre Ad-LLM-varianter (GI-R, GIR-R, GIR-P) pÃĨ MT-Human-, LM-Market- og CA-Prod-datasettene. Mens poengene varierer med dommer, overgÃĨr Ad-LLM konsekvent Ad-Chat over alle forhold.

Over alle tre datasettene produserte Ad-LLM konsekvent bedre resultater enn Ad-Chat pÃĨ bÃĨde tilfredshets- og engasjements-mÃĨlinger. Som vist i resultattabellen ovenfor, overgikk den beste Ad-LLM-varianten Ad-Chat med 8,4, 1,5 og 3,8 prosent i sammenlagt-kvantitative poeng; og med 10,7, 10,4 og 8,6 prosent i kvalitative poeng for MT-Human-, LM-Market- og CA-Prod-henholdsvis.

I tillegg til disse resultater, sier forfatterne:

‘Disse resultater demonstrerer at generering av et rÃĨt svar og deretter injeksjon av annonser gir bedre svarkvalitet sammenlignet med den enklere tilnÃĶrmingen til ÃĨ bare stole pÃĨ system-prompt-injeksjon.

‘For bestemte brukertilfredshets- og engasjements-dimensjoner viser Ad-Chat en betydelig ytelsesforskjell sammenlignet med Ad-LLM-lÃļsninger over alle tre datasettene, spesielt i dimensjoner som nÃļyaktighet, personlighet og tillit.’

Konklusjon

Selv om det ikke er overraskende at litteraturen skulle spekulere pÃĨ metodene for ÃĨ fÃĨ LLM-er til ÃĨ bÃĶre annonser, er det faktisk ganske lite offentlig tilgjengelig forskning pÃĨ dette omrÃĨdet; dette gjÃļr det nÃĨvÃĶrende papiret, og hva vi kan fornuftig tolke som dets forgjenger, interessant lesning.

Alle som har arbeidet med en annonse-salg-avdeling, eller som har solgt annonse-inventar, vet at annonserer alltid vil ha mer – ideal sett, ÃĨ ha annonser presentert som faktisk innhold, helt uanskillig fra verts-innhold-strÃļmmen; og de vil betale en betydelig premie for dette (sammen med verts-partner, som risikerer sin troverdighet og stilling med lesere og andre typer interessenter).

Derfor vil det vÃĶre interessant ÃĨ se omfanget, hvis noen, av de annons-beladde kodicillene som er forutsett over de to papirene, kan bli motivert til ÃĨ klatre lengre opp i en LLMs svar, og nÃĶrmere ‘lasten’. FÃļrst publisert torsdag, 18. september 2025

Forfatter innen maskinlÃĶring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble opplÃļst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: [email protected]