Andersonin kulma
Valmistautuminen mainontaan suurten kielen mallien kanssa

Uusi tutkimus osoittaa, miten mainokset voivat pian sisältyä suoraan ChatGPT-tyyppisten vastausten sisään – ei banneereina tai ponnahdusikkunoina, vaan vastauksen itsensä sisällä. Uusi vertailu testaa, miten hyvin nämä mainosläpissyt vastaukset voivat säilyttää hyödyllisyytensä, uskottavuutensa ja tuottavuutensa, ja saattaa vaatia kompromissin hyväksyttävän käyttökokemuksen ja klikkauksien välillä.
Suuret kielen mallit ovat yleisiä ja kasvavassa suosiossa, ja ne uhkaavat perinteisiä mainostusmenetelmiä, jotka ovat voineet internetin lähes alusta alkaen. Kaikki, jotka ovat tuttuja venture-rahastojen markkinavaltaustaktiikoista, pohtivat, kuinka kauan AI-keskustelubotit voivat pitää mainos sisällön pois vastauksistaan.
Netflix ja laajeneva joukko suoratoistopalveluita osoittavat, että perinteinen kaapeli-aikakauden strategia, jossa yhdistetään maksulliset tilaukset ja sisällytetty mainonta (usein perusteltuna keinona pitää kuluttajien kustannukset alhaalla), on saavuttamassa uudelleen menestystä; ja siirtymisen sisällyttämiseen mainoksia suoraan LLM-tulosteisiin on alkanut näyttää vähemmän spekulatiiviselta ja enemmän luonnolliselta soveltamiselta.

Tutkimuksesta ‘Online Advertisements with LLMs: Opportunities and Challenges’, esimerkki siirtymisestä, jota useimmat odottavat, kun LLM:t rahoittavat. Lähde: https://www.sigecom.org/exchanges/volume_22/2/FEIZI.pdf
Mahdollisuus sisällyttää mainoksia uuteen mediumiin, jolla on jo merkittäviä ongelmia uskottavuuden suhteen, saattaa näyttää hätäiseltä; kuitenkin sijoitusten laajuus generatiivisessa tekoälyssä viimeisen 12 kuukauden aikana viittaa siihen, että markkinaa ei määritellä tällä hetkellä varovaisella tai pidättyvällä asenteella; ja kun suuremmat toimijat, kuten OpenAI, ovat selvästi ylivelkaantuneita ja tarvitsevat varhaisen tuoton massiivisesta sijoituksesta, historia osoittaa, että mainosvapaan tuotannon kausi saattaa olla päättymässä.
GEM-Bench
Tällä ilmapiirillä ja näillä liiketoimintaperiaatteilla mielessä, uusi tutkimus Singaporesta tarjoaa ensimmäisen vertailun, joka on suunniteltu AI-keskustelurajapintoja varten, yhdessä uusien mitta- ja arviointitapojen kanssa, joista voi olla yksi 100 vuoden aikana räjähtävin mainosalue.
Luultavasti optimistisesti, tutkimuksen tekijät olettavat selkeän jaon “oikean” sisällön ja mainos sisällön välillä, jossa “poikkeama” standardivastauksista markkinointikappaleisiin on helppo havaita:

Esimerkkejä siitä, minkälaisia mainos integraatioita voi tulla, kuten tutkimuksessa tutkittujen mallien mukaan. Lähde: https://arxiv.org/pdf/2509.14221
On nähtävä, haluavatko mainostajat itse, kuten on ollut heidän tapana, saada mainos sisällön sulautettua outputiin häikäilemättömämmin kuin tutkimuksessa esitetyissä esimerkeissä.
Tällä hetkellä kenttä on niin nuori, että perustermistikää puuttuu tai ei ole vakiintunut.
Tutkimus esittää Generatiivinen moottorin markkinointi (GEM) uutena kehyksenä LLM-pohjaisia keskustelubotteja rahoittamiseksi sisällyttämällä relevantteja mainoksia suoraan generoituviin vastauksiin.
Tutkijat tunnistavat mainosläpissyt vastaus (AIR) -tuotannon GEM:n keskeiseksi haasteeksi ja väittävät, että olemassa olevat vertailut eivät sovellu sen tutkimiseen. Täyttämään tämän aukon, he esittävät, mitä he väittävät olevan ensimmäinen vertailu, joka on suunniteltu tätä tarkoitusta varten.
GEM-Bench koostuu kolmesta kokoelmasta, jotka kattavat keskustelubotti- ja hakukoneskenaariot. Se sisältää myös mittatietoontologian, joka arvioi useita käyttäjän tyytyväisyyden ja sitoutumisen ulottuvuuksia, sekä joukon perusmenetelmiä, jotka on toteutettu modulaarisessa monitoimijakehyksessä.
Tutkijat väittävät, että vaikka yksinkertaiset ohjepohjaiset menetelmät voivat saavuttaa kunnioitettavia sitoutumismittoja, kuten korkeampia klikkausmääriä, ne usein heikentävät käyttäjän tyytyväisyyttä. Toisaalta, lähestymistavat, jotka sisällyttävät mainoksia ennen generoituviin, mainosvapaisiin vastauksiin, osoittavat parantuneita luottamusta ja vastauslaatua – vaikka suuremman laskennallisen ylityön kustannuksella.
Nämä vaihtoehtoisuudet, tutkimus väittää, korostavat tarvetta tehokkaammille ja tehokkaammille tekniikoille mainosten integroimiseksi generatiivisiin tuloksiin.
Uusi tutkimus on nimeltään GEM-Bench: Vertailu mainosläpissyt vastausgeneroinnista generatiivisessa moottorin markkinoinnissa, ja se on neljän tutkijan työ National University of Singaporesta.
Menetelmä
GEM:n (Generatiivinen moottorin markkinointi) hahmotelma perustuu hakukoneen markkinoinnin (SEM) perusperiaatteisiin. Perinteinen SEM toimii siten, että mainostajat tarjoavat tarjouksia avainsanoista; järjestelmä tunnistaa, mitkä kyselyt laukaisevat mainokset; järjestelmä arvioi, kuinka todennäköisesti kunkin mainoksen klikkaaminen on; ja sitten järjestelmä jakaa mainokset huutokaupan kautta, jossa tasapainotetaan tarjouksia ja ennustettua sitoutumista.
Toisaalta GEM-lähestymistapa sovittaa nämä vaiheet LLM:ien yhteyteen, mutta kohtaa uusia haasteita jokaisessa vaiheessa: ei ole kiinteitä mainospaikkoja, joten järjestelmän on päätettävä, voitko kyselyyn sisällyttää mainoksen ja minne se sisällytetään vapaaseen tekstiin; klikkausmäärien arvioiminen muodostuu vaikeammaksi ilman rakenteellisia layouteja; ja relevanttiys on tasapainotettava käyttäjän tyytyväisyyden kanssa, koska mainokset ovat sisällytettyä mallin omiin tuloksiin eikä erillisiin kappaleisiin.
Yksi tutkimuksessa tutkituista perusmenetelmistä, Ad-Chat, edustaa yksinkertaista menetelmää, jossa mainos sisältö sisällytetään järjestelmän ohjelmaan ennen mallin generoimista. Tämä tarkoittaa, että malli tuottaa vastauksen, jossa mainos on jo sisällytetty, ohjatuna ennalta määritellyllä agendalla.
Toinen lähestymistapa, Ad-LLM, kehitettiin tutkimuksessa osana uutta vertailua. Ad-LLM seuraa modulaarista polkua, jossa ensin generoidaan puhdas, mainosvapaa vastaus; valitaan relevantti mainos; tunnistetaan paras sisällyttämiskohta semanttisen virran perusteella; ja lopulta kirjoitetaan uudelleen output, jotta mainos integroidaan sileästi:

Vertailu Ad-Chat ja tutkijoiden ‘Ad-LLM’ -menetelmän välillä. Ad-Chat sisällyttää mainoksia järjestelmän ohjelmaan ennen generoimista, rajoitetulla sijoitusohjauksella. Ad-LLM erottaa vastausgeneroinnin ja mainos sisällyttämisen, valitsee sisällyttämiskohtia semanttisen virran perusteella ja viimeistelee tuloksen. Molemmat arvioidaan GEM-Bench -mittauksilla tyytyväisyydestä ja sitoutumisesta.
Vaikka Ad-Chat on halvempi ja joskus persuusivisempi, se usein vähentää luottamusta ja tarkkuutta. Ad-LLM suoriutuu paremmin käyttäjän tyytyväisyyden mittauksilla, mutta suuremmalla laskennallisella ylityöllä.
Data
AIR-generoinnissa kaksi tyyppistä kokoelmaa luotiin aluksi: käyttäjän kyselykokoelma (Käyttäjä) ja mainos tietokanta (AdDB).
Koska käyttäjän kyselyt määrittävät mainosmahdollisuuksia LLM-vastauksissa, “mainosvarasto” voidaan sanoa olevan näissä vastauksissa, vaikka se määritellään sekä kyselyn soveltuvuuden että järjestelmän omien sääntöjen mukaan, jotka tasapainottavat eheys ja mainostajien vaatimukset.
Millään tapaa mainokset eivät ilmesty muualla kuin vastauksissa, vaikka (ks. yllä oleva kaavio) käyttäjän pyynnöt voidaan salaa täydentää mainos palveluprosessissa.
Keskustelubottiskenaariota varten tutkijat rakensivat kaksi kyselykokoelmaa: MT-Human ja LM-Market.
MT-Human otettiin humanistisen osuuden MT-Bench:sta, monivaiheisen LLM-benchmarkin, ja sisältää kysymyksiä, jotka voivat sisältää mainos sisällön.
LM-Market rakennettiin yli puolen miljoonan ChatGPT-kyselyn LMSYS-Chat-1M:sta, suodatettuna englanninkielisiksi markkinointiin liittyviksi kyselyiksi, ja ryhmitelty semanttisten upotusten ja K-means -klusteroinnin avulla.
Molemmissa tapauksissa lopulliset kyselyt valittiin monivaiheisen putkilinjan kautta, joka yhdisti automaattisen klusteroinnin, LLM-arvioinnin ja ihmisen verifioinnin, tavoitteena tunnistaa kyselyt, joissa mainos sisällyttäminen olisi luonnollista ja uskottavaa.
Jotta voidaan arvioida mainosläpissyt vastausten laatua, GEM määrittää mittatietoontologian, joka kattaa sekä käyttäjän tyytyväisyyden että sitoutumisen. Tämä sisältää määrällisiä mittauksia, kuten vastausvirran, koherenssin ja klikkausmäärän, sekä laadullisia standardeja, kuten luottamusta, tarkkuutta ja luonnollisuutta – mittauksia, jotka pyrkivät heijastamaan sekä sitä, miten hyvin mainos sopii vastaukseen, että sitä, kuinka todennäköisesti käyttäjät havaitsevat ja vuorovaikuttavat sen kanssa.
Luonnollisuudesta tutkimus toteaa:
‘[Luonnollisuus] mittaa, kuinka paljon mainos sisällyttäminen häiritsee keskustelun virtausta ja luonnollisuutta, perustuen keskeytykseen ja aitousarvoon. Keskeytyksen tarkastelu siitä, luoko mainos “hyppää” tai “äkki” -tunteen luettaessa, rikkoen käyttäjän jatkuvaan keskittyminen aiheeseen.
‘Aitous arvioi, voittaako mainos “ihmisen kosketuksen” tai “luonnollisen virran” keskustelussa, tehdessään vastauksesta jäykän, kaavanomaisen ja vähemmän aitoisen.’
Perinteisen hakukoneskenaarioon testivaiheessa varten tutkijat loivat kokoelman nimeltä CA-Prod AdsCVLR:n kaupallisen korpuksen avulla, joka sisältää 300 000 kysely-mainosparia, joista kunkin koostuu avainsanasta, metatiedoista ja manuaalisesta merkinnästä, joka osoittaa relevanttisuuden:

Alkuperäisestä tutkimuksesta, esimerkkejä AdsCVLR -kokoelmasta, joka tarjosi aineistoa tutkijoiden testeihin. Lähde: http://www.jdl.link/doc/2011/20221224_AdsCVLR.pdf
Tiedot, joissa puuttui kenttiä, poistettiin, ja säilytettiin vain kyselyt, joissa oli sekä positiivisia että negatiivisia mainoksia (ks. yllä oleva kuva esimerkkejä),
Ja mainokset ryhmiteltiin kuuteen aiheeseen (puutarha- ja puutarhakalusteet, slip-on kengät, talousvälineet, ravintolisät, Android-laitteet ja naisten mekot) semanttisten upotusten ja K-means -klusteroinnin avulla.
Kyselyt määriteltiin aiheisiin positiivisten mainosten perusteella, ja liian harvat tai tiheät joukot poistettiin, ennen kuin 120 kyselyä ja 2 215 yksilöllistä tuotetta lopulta valittiin benchmarkiin.
Testit
Arvioidakseen, miten hyvin erilaiset mainos sisällyttämisstrategiat suoriutuivat, vertailu käsitteli kolme keskeistä kysymystä: miten tehokkaita kunkin menetelmä oli määritettyjen tyytyväisyyden ja sitoutumisen mittareiden suhteen; miten Ad-LLM:n sisäiset suunnitteluratkaisut vaikuttivat sen tuloksiin; ja miten laskennallinen kustannus vertautui järjestelmiin.
Tutkijat arvioivat Ad-Chatin ja kolme varianttia Ad-LLM -putkilinjasta, joista kunkin erona oli, miten mainoksia haettiin (joko ohjelmasta tai generoidusta vastauksesta) ja onko lopullinen output uudelleenkirjoitettu sujuvuuden vuoksi.
Kaikki menetelmät suoritettiin doubao-1-5-lite-32k:n avulla perusmallina ja arvioitiin gpt-4.1-mini:n avulla.

Ad-Chatin ja Ad-LLM -varianttien tehokkuus MT-Human, LM-Market ja CA-Prod -kokoelmissa. Määrälliset mittaukset kattavat vastausvirran (RF), vastauskoherenssin (RC), mainosvirran (AF), mainoskoherenssin (AC), injektiorajan (IR), klikkausmäärän (CTR) ja yleiset pisteet. Laadulliset mittaukset kattavat tarkkuuden, luonnollisuuden, persoonallisuuden, luottamuksen, huomion, klikkaamisen ja yleisen suorituskyvyn.
Kaikissa kolmessa kokoelmassa Ad-LLM tuotti vahvemmat tulokset kuin Ad-Chat sekä tyytyväisyyden että sitoutumisen mittauksilla. Tuloksetaulukosta (yllä) nähdään, että parhain Ad-LLM -variantti paransi Ad-Chatia 8,4, 1,5 ja 3,8 prosentilla yleisissä määrällisissä pisteissä; ja 10,7, 10,4 ja 8,6 prosentilla laadullisissa pisteissä MT-Human, LM-Market ja CA-Prod -kokoelmissa.
Tutkijat toteavat tuloksista:
‘Nämä tulokset osoittavat, että raakavastauksen generoiminen ja sen jälkeen mainos sisällyttäminen antaa paremman vastauslaadun verrattuna yksinkertaiseen lähestymistapaan, joka riippuu ainoastaan järjestelmän ohjelmointia.
‘Tiettyjen käyttäjän tyytyväisyyden ja sitoutumisen ulottuvuuksien osalta Ad-Chat osoittaa jatkuvasti merkittävän suorituskykyeroa Ad-LLM -ratkaisuihin verrattuna kaikissa kolmessa kokoelmassa, erityisesti ulottuvuuksissa, kuten tarkkuus, persoonallisuus ja luottamus.’
Lisäksi Ad-LLM osoitti vahvimmat parannukset tarkkuudessa, persoonallisuudessa ja luottamuksessa, jossa se ylitti Ad-Chatin jopa 17,6%, 23,3% ja 17,2%:lla. Tutkimuksen mukaan nämä erot voivat johtua siitä, miten Ad-Chat käyttää järjestelmän ohjelmointia ohjaamaan mallia kohti enemmän personalisoitua ja mainosperäistä kieltä – mikä tutkijoiden mukaan voi johtaa “myyntimäiseen” sävyyn, joka vähentää tarkkuutta ja luottamusta.
Ad-Chat myös tuotti alhaisempia injektioratoja, jopa kyselyissä, jotka oli valittu mainoskelpoisuuden perusteella, ja tutkijat pitävät tätä seurausena riippuvuudesta ohjelmointiin perustuvista vihjeistä (joita he kuvaavat vaikeiksi hallittaviksi).
Hakukoneskenaariossa Ad-Chat saavutti 8,6% korkeamman klikkausmäärän, mitä tutkimus selittää LLM:n käytöllä tuotteen hakemiseen, eikä pelkästään semanttisten upotusten avulla:

Vertailu yleisistä suorituskyvypisteistä neljän tuomarin mallin (GPT-4.1-mini, Qwen-max, claude-3-5-haiku, kimi-k2) osalta Ad-Chat ja kolmen Ad-LLM -variantin (GI-R, GIR-R, GIR-P) osalta MT-Human, LM-Market ja CA-Prod -kokoelmissa. Vaikka pisteet vaihtelevat tuomareittain, Ad-LLM suoriutuu jatkuvasti paremmin kuin Ad-Chat kaikissa olosuhteissa.
Toinen taulukko (yllä) osoittaa, että kaikissa kolmessa kokoelmassa Ad-LLM -ratkaisut suoriutuvat jatkuvasti paremmin kuin Ad-Chat neljän tuomarin mallin (GPT-4.1-mini, Qwen-max, claude-3-5-haiku, kimi-k2) osalta; GIR-R sijoittui joko ensimmäiseksi tai toiseksi jokaisessa tapauksessa, viitaten laajaan sopimukseen tuomareiden kesken Ad-LLM:n ylivoimaisuudesta. Yksittäisten laadullisten ulottuvuuksien jakautuminen seuraa läheisesti edellä mainittua tulosta.
Tutkimuksen lopussa todetaan, että sekä Ad-Chat että Ad-LLM vaativat suurempia resursseja kuin innovatiivisemmat ja tehokkaammat mallit, ja että LLM-agenttien käyttö tällaisissa transaktioissa voi edustaa merkittävää ylityötä. Vaikka latenssiongelmat (yleensä kriittisiä mainonnan jakelutilanteissa) voivat syntyä LLM:n käytöstä (vaikka tutkimus ei tätä erityisesti käsitä),
Tutkijoiden Ad-Chat -strategian toteutus (yllä olevan kaavion yläosa) osoitti kuitenkin korkeimman klikkausmäärän, vaikka sillä oli korkein liitety LLM-kustannus.
Johtopäätös
Vaikka ei ole yllättävää, että kirjallisuus spekuloi LLM:ien mainostusmenetelmistä, on vain vähän julkaistua tutkimusta aiheesta; tämä tekee tämän tutkimuksen ja sen edeltäjän mielenkiintoiseksi aiheeksi.
Jokainen, joka on työskennellyt mainosmyyntiosastossa tai myynyt inventaariota, tietää, että mainostajat aina haluavat enemmän – ihannetapauksessa, he haluavat esittää mainoksiaan tosiasioina, jotka eivät eroa juurikaan isäntäsisällöstä; ja he maksavat merkittävän premiumin siitä (yhdessä isäntän kanssa, joka näin ollen vaarantaa uskottavuutensa ja asemansa lukijoiden ja muiden sidosryhmien keskuudessa).
On mielenkiintoista nähdä, missä määrin, jos lainkaan, mainosläpissyt kodikolit, jotka on kuvattu kahdessa tutkimuksessa, voivat olla kannustettuja etenemään ylemmäs LLM-vastauksessa ja lähemmäs “lastia”, ja miten tämä vaikuttaa mainonnan sisällyttämiseen ja sen vaikutukseen.
Tämä julkaistiin ensimmäisen kerran torstaina, 18. syyskuuta 2025












