Andersons vinkel

FÃķrberedelser fÃķr reklam i stora sprÃĨkmodeller

mm
LÃĪgg till Unite.AI bland dina fÃķredragna kÃĪllor pÃĨ Google
Source: ChatGPT-4o and https://commons.wikimedia.org/wiki/File:Microsoft_Surface_Laptop_7.jpg

Ny forskning visar hur annonser snart kan infogas direkt i ChatGPT-liknande svar – inte som banner eller popups, utan vÃĪvda in i svaret sjÃĪlvt. En ny benchmark testar hur vÃĪl dessa annonsinjektioner kan fÃķrbli anvÃĪndbara, trovÃĪrdiga och lÃķnsamma, och kan krÃĪva en avvÃĪgning mellan en acceptabel anvÃĪndarupplevelse och klickfrekvenser.

 

Som den allmÃĪnna och vÃĪxande populariteten fÃķr stora sprÃĨkmodeller undergrÃĪver de traditionella reklammetoderna som har drivit internet nÃĪstan sedan dess fÃķdelse, kommer alla som ÃĪr bekanta med venturekapitalisters marknadsstrategier att undra hur lÃĪnge AI-chattbotar kommer att kunna hÃĨlla tillbaka frÃĨn att inkludera reklammaterial i sina svar.

Som Netflix och en vÃĪxande lista av streamingtjÃĪnster demonstrerar, ÃĨtervinner den traditionella kabeleran-strategin att kombinera betalda prenumerationer med infogade annonser (ofta motiverade som ett sÃĪtt att hÃĨlla konsumentkostnaderna nere) momentum; och skiftet mot att infoga annonser direkt i LLM-utdata bÃķrjar att framstÃĨ som mindre spekulativt och mer som en naturlig anpassning av den modellen.

FrÃĨn artikeln 'Onlineannonser med LLM: MÃķjligheter och utmaningar', ett ganska representativt exempel pÃĨ den ÃķvergÃĨng som de flesta mÃĪnniskor fÃķrvÃĪntar sig nÃĪr LLM monteras. KÃĪlla: https://www.sigecom.org/exchanges/volume_22/2/FEIZI.pdf

FrÃĨn artikeln ‘Onlineannonser med LLM: MÃķjligheter och utmaningar’, ett ganska representativt exempel pÃĨ den ÃķvergÃĨng som de flesta mÃĪnniskor fÃķrvÃĪntar sig nÃĪr LLM monteras. KÃĪlla: https://www.sigecom.org/exchanges/volume_22/2/FEIZI.pdf

Perspektivet att inkludera annonser i en ny medium som redan har betydande problem med trovÃĪrdighet, kan tyckas fÃķrhastat; men omfattningen av investeringar i generativ AI under de senaste tolv mÃĨnaderna tyder pÃĨ att marknaden inte fÃķr nÃĪrvarande definieras av en fÃķrsiktig eller cirkumspekt instÃĪllning; och med stÃķrre aktÃķrer som OpenAI som kan vara Ãķverbelastade och behÃķver en tidig avkastning pÃĨ massiva investeringar, tyder historien pÃĨ att den smekmÃĨnadsperioden med annonsfria utdata kan vara pÃĨ vÃĪg att ta slut.

GEM-Bench

Med denna klimat och med dessa affÃĪrsmÃĪssiga imperativ i ÃĨtanke, erbjuder en intressant ny artikel frÃĨn Singapore den fÃķrsta benchmarken riktad mot AI-chattgrÃĪnssnitt, tillsammans med nya kvantifierbara mÃĨtt fÃķr vad som kan visa sig vara en av de mest explosiva reklamarenorna under de senaste 100 ÃĨren.

Kanske optimistiskt antar fÃķrfattarna en tydlig grÃĪns mellan “sann” innehÃĨll och reklam, dÃĪr “avvikelsen” frÃĨn standardsvaren till marknadsinnehÃĨll ÃĪr ganska lÃĪtt att upptÃĪcka:

Exempel pÃĨ den typ av annonsintegration som kan komma att bli verklighet under de tvÃĨ modeller som studeras i den nya artikeln. KÃĪlla: https://arxiv.org/pdf/2509.14221

Exempel pÃĨ den typ av annonsintegration som kan komma att bli verklighet under de tvÃĨ modeller som studeras i den nya artikeln. KÃĪlla: https://arxiv.org/pdf/2509.14221

Det ÃĨterstÃĨr att se om annonsÃķrerna sjÃĪlva kommer att, som de har fÃķr vana, fÃķrsÃķka fÃĨ sin annonsinnehÃĨll mer subtilt integrerat i utdata ÃĪn i exemplen som ges i artikeln.

Men dessa ÃĪr frÃĨgor fÃķr senare; fÃķr tillfÃĪllet ÃĪr fÃĪltet sÃĨ nytt att till och med grundlÃĪggande terminologi saknas, eller ocksÃĨ inte ÃĪr faststÃĪlld.

Artikeln infÃķr dÃĪrfÃķr Generative Engine Marketing (GEM) som en ny ram fÃķr att montera LLM-baserade chattbotar, genom att infoga relevanta annonser direkt i genererade svar.

Forskarna identifierar Ad-Injected Response (AIR) generation som den centrala utmaningen i GEM, och hÃĪvdar att befintliga benchmarkar ÃĪr dÃĨligt anpassade fÃķr att studera den. FÃķr att fylla denna lucka introducerar de vad de pÃĨstÃĨr vara den fÃķrsta benchmarken som specifikt ÃĪr utformad fÃķr detta ÃĪndamÃĨl.

GEM-Bench bestÃĨr av tre kuraterade datamÃĪngder som omfattar chattbot- och sÃķkmotorscenarier. Den innehÃĨller ocksÃĨ en mÃĨttontologi som ÃĪr utformad fÃķr att bedÃķma flera aspekter av anvÃĪndartillfredsstÃĪllelse och engagemang, tillsammans med en uppsÃĪttning basmetoder som implementeras inom ett modulÃĪrt multiagentramverk.

FÃķrfattarna hÃĪvdar att medan enkla promptbaserade metoder kan uppnÃĨ respektabla engagemangsmÃĨtt, sÃĨsom fÃķrhÃķjda klickfrekvenser (CTR), tenderar de att fÃķrsÃĪmra anvÃĪndartillfredsstÃĪllelse. TillvÃĪgagÃĨngssÃĪtt som infogar annonser i fÃķrgenererade, annonsfria svar visar fÃķrbÃĪttringar i tillit och svarkvalitet – men till en hÃķgre berÃĪkningskostnad.

Dessa avvÃĪgningar, hÃĪvdar artikeln, betonar behovet av mer effektiva och effektiva tekniker fÃķr att infoga annonser i genererade utdata.

Den nya artikeln heter GEM-Bench: En benchmark fÃķr Ad-Injected Response Generation inom Generative Engine Marketing, och kommer frÃĨn fyra forskare vid National University of Singapore.

Metod

Den Ãķvergripande ramen fÃķr Generative Engine Marketing (GEM) lÃĨnar frÃĨn de grundlÃĪggande principerna fÃķr Search Engine Marketing (SEM). Traditionell SEM fungerar genom att matcha frÃĨgor till annonser via en multistegsprocess dÃĪr annonsÃķrer budar pÃĨ nyckelord; systemet identifierar vilka frÃĨgor som utlÃķser annonser; systemet uppskattar hur sannolikt varje annons ÃĪr att klickas; och sedan tilldelar placering genom en auktion som balanserar bud med fÃķrvÃĪntat engagemang.

I kontrast anpassar GEM-tillvÃĪgagÃĨngssÃĪttet samma stadier till LLM, men stÃĨr infÃķr nya utmaningar vid varje steg: det finns inga fasta annonsplatser, sÃĨ systemet mÃĨste bestÃĪmma om en frÃĨga kan ta en annons och var den ska infogas i fritt text; att uppskatta klickfrekvenser blir svÃĨrare utan strukturerade layouter; och relevans mÃĨste balanseras mot anvÃĪndartillfredsstÃĪllelse, eftersom annonserna ÃĪr vÃĪvda direkt in i modellens egen utdata snarare ÃĪn serveras som fristÃĨende kopior.

En av de baslinjer som studeras i arbetet, Ad-Chat, representerar en enkel metod dÃĪr annonsinnehÃĨll infogas i systemprompten innan modellen genererar ett svar. Detta innebÃĪr att modellen producerar ett svar med annonsen redan infogad, styrd av en fÃķrinstÃĪlld agenda.

Den andra tillvÃĪgagÃĨngssÃĪttet, Ad-LLM, utvecklades av fÃķrfattarna som en del av den nya benchmarken. Ad-LLM tar en modulÃĪr vÃĪg, fÃķrst genererar ett rent, annonsfritt svar; vÃĪljer en relevant annons; identifierar den bÃĪsta infogningspunkten baserat pÃĨ semantisk flÃķde; och slutligen skriver om utdata fÃķr att integrera annonsen smidigt:

JÃĪmfÃķrelse mellan Ad-Chat och fÃķrfattarnas 'Ad-LLM'-metod. Ad-Chat injicerar annonser via systemprompten innan generering, med begrÃĪnsad placeringskontroll. Ad-LLM separerar svarsgenerering och annonsinjektion, vÃĪljer infogningspunkter baserat pÃĨ semantiskt flÃķde, och finslipar resultatet. BÃĨda bedÃķms med GEM-Bench-mÃĨtt fÃķr tillfredsstÃĪllelse och engagemang

JÃĪmfÃķrelse mellan Ad-Chat och fÃķrfattarnas ‘Ad-LLM’-metod. Ad-Chat injicerar annonser via systemprompten innan generering, med begrÃĪnsad placeringskontroll. Ad-LLM separerar svarsgenerering och annonsinjektion, vÃĪljer infogningspunkter baserat pÃĨ semantiskt flÃķde, och finslipar resultatet. BÃĨda bedÃķms med GEM-Bench-mÃĨtt fÃķr tillfredsstÃĪllelse och engagemang.

Medan Ad-Chat ÃĪr billigare och ibland mer Ãķvertygande, tenderar den att minska tillit och exakthet. Ad-LLM presterar bÃĪttre pÃĨ anvÃĪndartillfredsstÃĪllelse-mÃĨtt, men till en hÃķgre kostnad.

Data

FÃķr AIR-generering skapades tvÃĨ typer av datamÃĪngder initialt: en anvÃĪndarfrÃĨgesats (AnvÃĪndare) och en annonsdatabas (AdDB).

Eftersom anvÃĪndarfrÃĨgor definierar annonseringsmÃķjligheter i LLM:s svar, kan “annonsinventeringen” sÃĪgas existera i dessa svar, ÃĪven om detta definieras inte bara av frÃĨgans tillÃĪmplighet utan ocksÃĨ av den utstrÃĪckning till vilken systemet kommer att fÃķlja sina egna regler om att balansera integritet mot annonsÃķrernas imperativ.

I vilket fall som helst kommer annonserna endast att visas i svar, ÃĪven om (se schema ovan) anvÃĪndarbegÃĪranden kan vara hemligt utÃķkade fÃķr att underlÃĪtta annonsprocessen.

FÃķr chattbotscenariot konstruerade fÃķrfattarna tvÃĨ frÃĨgedatamÃĪngder: MT-Human och LM-Market.

MT-Human drogs frÃĨn humanioradelen av MT-Bench, en multi-turn-benchmark fÃķr LLM, och innehÃĨller frÃĨgor som sannolikt kan innehÃĨlla annonsinnehÃĨll.

LM-Market byggdes frÃĨn Ãķver en halv miljon riktiga ChatGPT-frÃĨgor som samlades in av LMSYS-Chat-1M, filtrerade fÃķr engelsksprÃĨkiga marknadsrelaterade frÃĨgor, och grupperades efter ÃĪmne med hjÃĪlp av semantiska inbÃĪddningar.

I bÃĨda fallen valdes de slutliga frÃĨgorna ut genom en multistegsprocess som kombinerade automatisk klusteranalys, LLM-poÃĪng och mÃĪnsklig verifiering, med mÃĨlet att identifiera frÃĨgor dÃĪr annonsinjektion skulle vara naturlig och rimlig.

FÃķr att utvÃĪrdera kvaliteten pÃĨ annonsinjektioner definierar GEM ett mÃĨttontologi som tÃĪcker bÃĨde anvÃĪndartillfredsstÃĪllelse och engagemang. Detta omfattar kvantitativa mÃĨtt som svarflÃķde, koherens och klickfrekvens, samt kvalitativa standarder som tillit, exakthet och naturalitet – mÃĨtt som avser att reflektera bÃĨde hur vÃĪl en annons passar in i ett svar och hur sannolikt anvÃĪndare ÃĪr att uppfatta och interagera med den.

Med avseende pÃĨ “Naturalitet” hÃĪvdar artikeln:

‘[Naturalitet] mÃĪter i vilken utstrÃĪckning annonsinjektion stÃķr svarflÃķdet och naturaliteten i konversationen, baserat pÃĨ avbrott och ÃĪkthet. Avbrott undersÃķker om annonsen skapar en “hoppa ut” eller “plÃķtslig” kÃĪnsla under lÃĪsning, vilket bryter anvÃĪndarens kontinuerliga fokus pÃĨ ÃĪmnet.

‘Äkthet utvÃĪrderar om annonsen undergrÃĪver “mÃĪnsklig berÃķring” eller “naturlig flÃķde” i konversationen, vilket gÃķr svaret rigid, formel och mindre ÃĪkta.’

FÃķr att generera en traditionell sÃķkmotormiljÃķ fÃķr testfasen skapade fÃķrfattarna en datamÃĪngd med titeln CA-Prod frÃĨn AdsCVLR-kommersiella korpusen, som innehÃĨller 300 000 frÃĨga-annonspar, var och en bestÃĨende av ett nyckelord, metadata och en manuell etikett som markerar relevans:

FrÃĨn den ursprungliga kÃĪllartikeln, exempel frÃĨn AdsCVLR-databasen, som hjÃĪlpte till att tillhandahÃĨlla material fÃķr fÃķrfattarnas tester. KÃĪlla: http://www.jdl.link/doc/2011/20221224_AdsCVLR.pdf

FrÃĨn den ursprungliga kÃĪllartikeln, exempel frÃĨn AdsCVLR-databasen, som hjÃĪlpte till att tillhandahÃĨlla material fÃķr fÃķrfattarnas tester. KÃĪlla: http://www.jdl.link/doc/2011/20221224_AdsCVLR.pdf

Poster med saknade fÃĪlt togs bort, och endast frÃĨgor som innehÃķll bÃĨde positiva och negativa annonser (se bild ovan fÃķr exempel) behÃķlls.

FÃķr att finslipa data grupperades annonserna i sex ÃĪmnesgrupper (grÃĪsmatte- och trÃĪdgÃĨrdsmaskiner, slip-on skor, hushÃĨllsartiklar, nÃĪringsÃĪmnen, Android-enheter och kvinnors klÃĪnningar) med hjÃĪlp av semantiska inbÃĪddningar och K-means-klusteranalys.

FrÃĨgorna tilldelades sedan till ÃĪmnen enligt deras positiva annonser, med fÃķr tunna eller tÃĪta uppsÃĪttningar uteslutna, innan 120 frÃĨgor och 2 215 unika produkter slutligen valdes ut fÃķr benchmarken.

Tester

FÃķr att utvÃĪrdera hur vÃĪl de varierande annonsinjektionsstrategierna presterade, tog benchmarken upp tre kÃĪrnfrÃĨgor: hur effektiv varje metod var Ãķver de definierade tillfredsstÃĪllelse- och engagemangsmÃĨtten; hur de interna designvalen inom Ad-LLM kunde pÃĨverka dess resultat; och hur den berÃĪkningsmÃĪssiga kostnaden skulle jÃĪmfÃķras Ãķver system.

FÃķrfattarna utvÃĪrderade Ad-Chat och tre varianter av Ad-LLM-pipelinen, var och en av vilka skiljer sig ÃĨt i hur annonser hÃĪmtades (antingen frÃĨn prompten eller frÃĨn det genererade svaret) och om den slutliga utdatatoken skrevs om fÃķr flyt.

Alla metoder kÃķrdes med doubao-1-5-lite-32k som basmodell och bedÃķmdes med gpt-4.1-mini.

Effektivitet hos Ad-Chat och Ad-LLM-varianter Ãķver MT-Human-, LM-Market- och CA-Prod-databaserna. Kvantitativa mÃĨtt inkluderar svarflÃķde (RF), svarkoherens (RC), annonsflÃķde (AF), annonskoherens (AC), injiceringsfrekvens (IR), klickfrekvens (CTR) och totala poÃĪng. Kvalitativa mÃĨtt omfattar exakthet, naturalitet, personlighet, tillit, uppmÃĪrksamhet, klick och total prestanda.

Effektivitet hos Ad-Chat och Ad-LLM-varianter Ãķver MT-Human-, LM-Market- och CA-Prod-databaserna. Kvantitativa mÃĨtt inkluderar svarflÃķde (RF), svarkoherens (RC), annonsflÃķde (AF), annonskoherens (AC), injiceringsfrekvens (IR), klickfrekvens (CTR) och totala poÃĪng. Kvalitativa mÃĨtt omfattar exakthet, naturalitet, personlighet, tillit, uppmÃĪrksamhet, klick och total prestanda.

Över alla tre databaserna producerade Ad-LLM starkare resultat ÃĪn Ad-Chat pÃĨ bÃĨde tillfredsstÃĪllelse- och engagemangsmÃĨtt. Som visas i resultattabellen ovan fÃķrbÃĪttrade den bÃĪsta Ad-LLM-varianten Ad-Chat med 8,4, 1,5 och 3,8 procent i totala kvantitativa poÃĪng; och med 10,7, 10,4 och 8,6 procent i kvalitativa poÃĪng fÃķr MT-Human, LM-Market och CA-Prod, respectively.

Av dessa resultat hÃĪvdar fÃķrfattarna:

‘Dessa resultat visar att generering av ett rÃĨtt svar och efterfÃķljande injicering av annonser ger bÃĪttre svarkvalitet jÃĪmfÃķrt med den enklare metoden att enbart lita pÃĨ systempromptinjektion.

‘FÃķr specifika anvÃĪndartillfredsstÃĪllelse- och engagemangsdimensioner visar Ad-Chat konsekvent en betydande prestandagap jÃĪmfÃķrt med Ad-LLM-lÃķsningar Ãķver alla tre databaserna, sÃĪrskilt i dimensioner som exakthet, personlighet och tillit.’

Ytterligare visade Ad-LLM sina starkaste vinster i exakthet, personlighet och tillit, och ÃķvertrÃĪffade Ad-Chat med upp till 17,6%, 23,3% och 17,2% respectively. Enligt artikeln kan dessa skillnader bero pÃĨ det sÃĪtt Ad-Chat anvÃĪnder systemprompten fÃķr att styra modellen mot mer personlig och promotoriskt sprÃĨk – som fÃķrfattarna hÃĪvdar kan leda till en “fÃķrsÃĪljningsliknande” ton som minskar exakthet och tillit.

Ad-Chat producerade ocksÃĨ lÃĪgre injiceringsfrekvenser, ÃĪven nÃĪr de utvÃĪrderades pÃĨ frÃĨgor som valts ut fÃķr annonslÃĪmplighet, och fÃķrfattarna tillskriver detta en tillit till promptbaserade signaler (som de karakteriserar som svÃĨra att kontrollera).

I sÃķkmotormiljÃķn uppnÃĨdde Ad-Chat en 8,6% hÃķgre klickfrekvens, vilket artikeln fÃķreslÃĨr kan reflektera fÃķrdelen med att anvÃĪnda en LLM fÃķr att hÃĪmta produktkandidater, snarare ÃĪn att enbart lita pÃĨ semantiska inbÃĪddningar:

JÃĪmfÃķrelse av totala prestandapoÃĪng Ãķver fyra domarmodeller (GPT-4.1-mini, Qwen-max, claude-3-5-haiku, kimi-k2) fÃķr Ad-Chat och tre Ad-LLM-varianter (GI-R, GIR-R, GIR-P) pÃĨ MT-Human-, LM-Market- och CA-Prod-databaserna. Medan poÃĪng varierar mellan domare, ÃķvertrÃĪffar Ad-LLM konsekvent Ad-Chat Ãķver alla fÃķrhÃĨllanden.

JÃĪmfÃķrelse av totala prestandapoÃĪng Ãķver fyra domarmodeller (GPT-4.1-mini, Qwen-max, claude-3-5-haiku, kimi-k2) fÃķr Ad-Chat och tre Ad-LLM-varianter (GI-R, GIR-R, GIR-P) pÃĨ MT-Human-, LM-Market- och CA-Prod-databaserna. Medan poÃĪng varierar mellan domare, ÃķvertrÃĪffar Ad-LLM konsekvent Ad-Chat Ãķver alla fÃķrhÃĨllanden.

Den andra resultattabellen (visad ovan) visar att Ad-LLM-lÃķsningar konsekvent ÃķvertrÃĪffar Ad-Chat Ãķver alla tre databaserna, enligt de fyra domarmodellerna; GPT-4.1-mini; Qwen-max; Claude-3-5-haiku; och Kimi-k2.

Dessa domare valdes fÃķr att skilja sig frÃĨn basmodellen doubao-1-5-lite-32k, vilket hjÃĪlper till att minska bias frÃĨn modellfamiljejustering. GIR-R rankades som fÃķrsta eller andra i varje fall, vilket tyder pÃĨ en bred ÃķverensstÃĪmmelse mellan domarna om Ad-LLM:s ÃķverlÃĪgsenhet. Den detaljerade nedbrytningen Ãķver enskilda kvalitativa dimensioner fÃķljer nÃĪra det mÃķnster som ses i de omedelbart fÃķregÃĨende resultaten (visade lÃĪngre ovan).

I slutet av artikeln noterar fÃķrfattarna att bÃĨde Ad-Chat och Ad-LLM krÃĪver hÃķgre resurser ÃĪn de mer innovativa och effektiva modellerna, och att behovet av att anvÃĪnda LLM-agenter i den hÃĪr typen av transaktion kan representera en betydande ÃķverhÃĪng. Även om man kan fÃķrestÃĪlla sig att latensproblem (vanligtvis kritiska i annonsvisningsscenarier) kan uppstÃĨ frÃĨn LLM-anvÃĪndning av det hÃĪr slaget (ÃĪven om detta inte specifikt diskuteras i artikeln).

I vilket fall som helst visade fÃķrfattarnas implementering av Ad-Chat-strategin (den Ãķvre raden i det tidigare schemat som visas i bÃķrjan av artikeln) den hÃķgsta klickfrekvensen, ÃĪven om den hade den hÃķgsta associerade LLM-kostnaden.

Slutsats

Även om det inte ÃĪr fÃķrvÃĨnande att litteraturen skulle spekulera om metoderna fÃķr att LLM kan bÃĪra reklam, finns det faktiskt ganska lite offentligt tillgÃĪnglig forskning pÃĨ ÃĪmnet; detta gÃķr den aktuella artikeln, och vad som kan tolkas som dess fÃķregÃĨngare, intressant lÃĪsning.

Den som har arbetat med en annonsfÃķrsÃĪljningsavdelning eller sÃĨlt inventarier kommer att veta att annonsÃķrer alltid vill ha mer – idealiskt, att ha annonser presenterade som faktiskt innehÃĨll, helt otydliga frÃĨn vÃĪrdinnehÃĨllsstrÃķmmen; och de kommer att betala en betydande premium fÃķr detta (tillsammans med vÃĪrden, som dÃĪrmed riskerar sin trovÃĪrdighet och stÃĪllning med lÃĪsare och andra typer av intressenter).

DÃĪrfÃķr kommer det att vara intressant att se i vilken utstrÃĪckning, om nÃĨgon, de annonsbelastade kodikaler som fÃķrutspÃĨs i de tvÃĨ artiklarna kan vara motiverade att krypa lÃĪngre upp i en LLM:s svar, och nÃĪrmare “nyttolasten”. Publicerad fÃķrsta gÃĨngen torsdagen den 18 september 2025

FÃķrfattare pÃĨ maskinlÃĪrning, domÃĪnspecialist inom mÃĪnsklig bildsyntes. Fd chef fÃķr forskningsinnehÃĨll pÃĨ Metaphysic.ai, till dess upplÃķsning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: [email protected]