Andersonův úhel
Příprava na reklamu v velkých jazykových modelech

Nový výzkum ukazuje, jak reklamy mohou být brzy vloženy přímo do odpovědí stylu ChatGPT – ne jako bannery nebo vyskakovací okna, ale vtaveny do samotné odpovědi. Nová referenční hodnota testuje, jak dobře tyto reklamy vložené do odpovědí mohou zůstat užitečné, věrohodné a ziskové, a může vyžadovat kompromis mezi přijatelným uživatelským zážitkem a kliky.
Jak široká a rostoucí popularita velkých jazykových modelů podkopává tradiční metody reklamy, které poháněly internet téměř od jeho vzniku, každý, kdo je obeznámen s taktikami trhu rizikového kapitálu, se bude ptát, jak dlouho ještě AI chatboti budou moci vzdorovat zahrnování reklamního obsahu do svých odpovědí.
Jak Netflix a rostoucí počet streamovacích služeb demonstrují, tradiční kabelová strategie kombinující placené předplatné s vloženou reklamou (často ospravedlňovanou jako způsob, jak udržet nízké náklady pro spotřebitele) opět získává na významu; a posun směrem k začleňování reklam přímo do výstupů LLM začíná připadat méně spekulativní a více jako přirozený adopter tohoto modelu.

Z paperu ‘Online Advertisements with LLMs: Opportunities and Challenges’, poměrně reprezentativní příklad přechodu, kterého většina lidí očekává, když LLMs monetizují. Zdroj: https://www.sigecom.org/exchanges/volume_22/2/FEIZI.pdf
Perspektiva zahrnování reklam do nového média, které již má pozoruhodné problémy s důvěryhodností, může vypadat předčasně; nicméně rozsah investic do generativního AI za posledních dvanáct měsíců naznačuje, že trh není v současné době definován opatrným nebo obezřetným postojem; a s většími hráči, jako je OpenAI, které jsou zřejmě nadměrně zadlužené a potřebují brzkou návratnost masivních investic, historie ukazuje, že období bez reklam může brzy skončit.
GEM-Bench
S touto klimatickou a obchodními imperativy na mysli, zajímavá nová práce ze Singapuru nabízí první referenční hodnotu zaměřenou na rozhraní AI chatbotů, spolu s novými kvantitativními metrikami pro to, co se může ukázat jako jedna z nejexplosivnějších reklamních arén za 100 let.
Možná optimisticky, autoři předpokládají jasný rozdílu mezi “skutečným” obsahem a reklamním obsahem, kde “odchylka” od standardních odpovědí do marketingového textu je poměrně snadno rozpoznatelná:

Příklady toho, jak by mohla vypadat integrace reklam podle dvou modelů studovaných v novém paperu. Zdroj: https://arxiv.org/pdf/2509.14221
Zbývá zjistit, zda sami inzerenti budou, jako je jejich tendence, snažit se své reklamní obsah více jemně vtavit do výstupu než v příkladech uvedených v paperu.
Jinak řečeno, tyto jsou záležitosti pro pozdější dobu; prozatím je pole tak zárodkové, že i základní terminologie chybí, nebo není ještě dohodnuta.
Paper tedy zavádí Generative Engine Marketing (GEM) jako nový rámec pro monetizaci LLM-založených chatbotů, vtáváním relevantních reklam přímo do generovaných odpovědí.
Vědci identifikují Ad-Injected Response (AIR) generaci jako centrální výzvu v GEM, a argumentují, že stávající referenční hodnoty jsou špatně přizpůsobeny pro studium této problematiky. Aby vyplnili tuto mezeru, představují, co tvrdí, že je první referenční hodnota speciálně navržená pro tento účel.
GEM-Bench se skládá ze tří kurátorovaných datových sad pokrývajících scénáře chatbotů a vyhledávačů. Zahrnuje také metrickou ontologii navrženou pro hodnocení více aspektů uživatelské spokojenosti a zapojení, spolu s sadou základních metod implementovaných v modulárním multi-agentním rámci.
Autoři tvrdí, že zatímco jednoduché prompt-založené metody mohou dosáhnout respektabilních ukazatelů zapojení, jako je zvýšená míra kliknutí (CTR), tendují k degradaci uživatelské spokojenosti. Naopak, přístupy, které vkládají reklamy do předem vygenerovaných, bezreklamních odpovědí, ukazují zlepšení v důvěře a kvalitě odpovědi – i když za cenu vyššího výpočetního zatížení.
Tyto kompromisy, paper tvrdí, zdůrazňují potřebu více účinných a efektivních technik pro integraci reklam do generativních výstupů.
Nová práce se jmenuje GEM-Bench: Referenční hodnota pro Ad-Injected Response Generation v rámci Generative Engine Marketing, a pochází od čtyř výzkumníků z National University of Singapore.
Metoda
Nástin pro Generative Engine Marketing (GEM) půjčuje z základních principů Search Engine Marketing (SEM). Tradiční SEM funguje tak, že odpovídá dotazům na reklamy prostřednictvím vícestupňového potrubí, kde inzerenti nabízejí na klíčová slova; systém identifikuje, které dotazy spouštějí reklamy; systém odhaduje, jak pravděpodobně bude každá reklama kliknuta; a poté přiděluje umístění prostřednictvím aukce, která vyvažuje nabídky s předpovězeným zapojením.
Naproti tomu přístup GEM přizpůsobuje stejné fáze LLM, ale čelí novým výzvám na každém kroku: nejsou žádné pevné reklamní sloty, takže systém musí rozhodnout, zda dotaz může obsahovat reklamu a kde ji vložit do volného textu; odhadnutí míry kliknutí se stává obtížnějším bez strukturovaných layoutů; a relevance musí být vyvážena proti uživatelské spokojenosti, protože reklamy jsou vtávány přímo do modelových vlastních výstupů, a notak jako samostatný text.
Jedna z základních metod studovaných v práci, Ad-Chat, reprezentuje jednoduchou metodu, kde reklamní obsah je vložen do systému promptu před generováním odpovědi. To znamená, že model produkuje odpověď s již vloženou reklamou, řízenou předem načtenou agendou.
Druhý přístup, Ad-LLM, byl vyvinut autory jako součást nové referenční hodnoty. Ad-LLM využívá modulární cestu, nejprve generuje čistou, bezreklamní odpověď; vybírá relevantní reklamu; identifikuje nejlepší bod vložení na základě semantického toku; a nakonec přepisuje výstup, aby integroval reklamu hladce:

Srovnání mezi Ad-Chat a autory ‘Ad-LLM’ metodou. Ad-Chat vkládá reklamy prostřednictvím systému promptu před generováním, s omezenou kontrolou umístění. Ad-LLM odděluje generování odpovědi a vložení reklamy, volí body vložení na základě semantického toku a rafinuje výsledek. Obě metody jsou hodnoceny pomocí GEM-Bench metrik pro spokojenost a zapojení.
Zatímco Ad-Chat je levnější a někdy více přesvědčivý, tenduje ke snížení důvěry a přesnosti. Ad-LLM vykazuje lepší výsledky na metrikách uživatelské spokojenosti, ale za vyšší cenu.
Data
Pro generaci AIR byly inicializovány dva typy datových sad: sada uživatelských dotazů (Uživatel) a reklamní databáze (AdDB).
Pokud uživatelské dotazy definují reklamní příležitosti v odpovědích LLM, lze říci, že “inventář reklam” existuje v těchto odpovědích, i když je definován nejen aplikovatelností uživatelského dotazu, ale také rozsahem, v jakém systém bude dodržovat své vlastní pravidla o vyvážení integrity proti imperativům inzerentů.
V každém případě budou reklamy zobrazeny pouze v odpovědích, i když (viz schéma výše) uživatelské požadavky mohou být tajně rozšířeny, aby akomodovaly proces podávání reklam.
Pro scénář chatbotu autoři sestavili dvě dotazové datové sady: MT-Human a LM-Market.
MT-Human byl vytažen z humanitární části MT-Bench, multi-turn benchmarku pro LLM, a obsahuje otázky, které pravděpodobně akomodují reklamní obsah.
LM-Market byl postaven z více než půl milionu skutečných dotazů ChatGPT shromážděných LMSYS-Chat-1M, filtrovaných pro anglicky mluvící marketingové dotazy, a seskupených podle tématu pomocí semantických vložek.
V obou případech byly konečné dotazy vybrány prostřednictvím vícestupňového potrubí kombinujícího automatizované klustering, hodnocení LLM, a lidskou verifikaci, s cílem identifikovat dotazy, kde by vložení reklamy bylo přirozené a uvěřitelné.
Pro hodnocení kvality reklamních odpovědí GEM definuje měřicí ontologii pokrývající jak uživatelskou spokojenost, tak zapojení. To zahrnuje kvantitativní metriky, včetně response flow, koherence, a kliknutí, jakož i kvalitativní standardy, jako je důvěra, přesnost, a přirozenost – metriky určené k odrážení, jak dobře reklama zapadá do odpovědi, a jak pravděpodobně uživatelé budou vnímat a interagovat s ní.
Pokud jde o “přirozenost”, paper uvádí:
‘[Přirozenost] měří rozsah, v jakém vložení reklamy narušuje tok a přirozenost konverzace, na základě přerušivosti a autentičnosti. Přerušivost zkoumá, zda reklama vytváří “skok” nebo “náhlý” pocit během čtení, porušující uživatelovu kontinuální pozornost na téma.
‘Autentičnost hodnotí, zda reklama podkopává “lidský dotek” nebo “přirozený tok” konverzace, činí odpověď rigidní, formální a méně autentickou.’
Pro generování tradičního scénáře vyhledávače pro testovací fázi autoři vytvořili datovou sadu nazvanou CA-Prod z AdsCVLR komerční sbírky, která obsahuje 300 000 párů dotaz-reklama, každý sestávající z klíčového slova, metadat a ručně označené relevance:

Z původního zdrojového paperu, příklady z AdsCVLR datové sady, která pomohla poskytnout materiál pro testy autorů. Zdroj: http://www.jdl.link/doc/2011/20221224_AdsCVLR.pdf
Záznamy s chybějícími poli byly odstraněny, a pouze dotazy obsahující obě pozitivní a negativní reklamy (viz obrázek výše pro příklady) byly zachovány.
Pro rafinaci dat byly reklamy seskupeny do šesti tematických skupin (zahradní a zahradnické vybavení, šlapky, domácí potřeby, doplňky stravy, zařízení Android, a ženské šaty) pomocí semantických vložek a K-means klusteringu.
Dotazy byly poté přiřazeny k tématům podle svých pozitivních reklam, s příliš řídkými nebo hustými sadami vyloučenými, předtím, než byly konečně vybrány 120 dotazů a 2 215 unikátních produktů pro referenční hodnotu.
Testy
Pro vyhodnocení toho, jak dobře různé strategie vkládání reklam fungují, referenční hodnota řeší tři základní otázky: jak efektivní je každá metoda napříč definovanými metrikami spokojenosti a zapojení; jak vnitřní designové volby v Ad-LLM ovlivňují její výsledky; a jak se bude porovnávat výpočetní náklad napříč systémy.
Autoři vyhodnotili Ad-Chat a tři varianty Ad-LLM pipeline, z nichž každá se lišila v tom, jak byly reklamy získány (buď z promptu nebo z vygenerované odpovědi), a zda byl konečný výstup přepisován pro plynulost.
Všechny metody byly spuštěny pomocí doubao-1-5-lite-32k jako základní model a byly hodnoceny pomocí gpt-4.1-mini.

Efektivita Ad-Chat a Ad-LLM variant napříč MT-Human, LM-Market a CA-Prod datovými sadami. Kvantitativní metriky zahrnují tok odpovědi (RF), koherenci odpovědi (RC), tok reklamy (AF), koherenci reklamy (AC), míru vložení (IR), míru kliknutí (CTR), a celkové skóre. Kvalitativní metriky pokrývají přesnost, přirozenost, osobnost, důvěru, pozornost, kliknutí a celkový výkon.
Napříč všemi třemi datovými sadami Ad-LLM vyprodukoval silnější výsledky než Ad-Chat na obou metrikách spokojenosti a zapojení. Jak je vidět v tabulce výsledků výše, nejlepší varianta Ad-LLM zlepšila Ad-Chat o 8,4, 1,5 a 3,8 procent v celkovém kvantitativním skóre; a o 10,7, 10,4 a 8,6 procent v kvalitativních skórech pro MT-Human, LM-Market a CA-Prod, resp.
Z těchto výsledků autoři uvádějí:
‘Tyto výsledky ukazují, že generování čisté odpovědi a následné vložení reklam vede k lepší kvalitě odpovědi ve srovnání s jednodušší metodou, která spoléhá pouze na systémový prompt.’
‘Pro konkrétní rozměry uživatelské spokojenosti a zapojení Ad-Chat konzistentně vykazuje podstatnou mezeru ve výkonu ve srovnání s Ad-LLM řešeními napříč všemi třemi datovými sadami, zejména v rozměrech, jako je přesnost, osobnost a důvěra.’
Dále Ad-LLM ukázal své nej silnější zisky v přesnosti, osobnosti a důvěře, překonávající Ad-Chat o až 17,6%, 23,3% a 17,2%, resp. Podle paperu tyto rozdíly mohou pocházet z toho, jak Ad-Chat používá systémový prompt pro řízení modelu směrem k více personalizovanému a reklamnímu jazyku – což autoři tvrdí, může vést k “prodejnímu” tónu, který snižuje přesnost a důvěru.
Ad-Chat také produkoval nižší míru vložení, i když byl hodnocen na dotazech vybraných pro reklamní vhodnost, a autoři připisují toto skutečnosti, že Ad-Chat spoléhá na prompt-založené signály (které charakterizují jako obtížně ovladatelné).
V scénáři vyhledávače však Ad-Chat dosáhl o 8,6% vyšší míry kliknutí, což paper naznačuje, může odrážet výhodu použití LLM pro získání kandidátů na produkty, spíše než spoléhání se pouze na semantické vložky:

Srovnání celkového výkonu skóre napříč čtyřmi soudními modely (GPT-4.1-mini, Qwen-max, claude-3-5-haiku, kimi-k2) pro Ad-Chat a tři Ad-LLM varianty (GI-R, GIR-R, GIR-P) na MT-Human, LM-Market a CA-Prod datových sadách. Zatímco skóre se liší podle soudního modelu, Ad-LLM konzistentně překonává Ad-Chat napříč všemi podmínkami.
Druhá tabulka výsledků (zobrazená výše) ilustruje, že na všech třech datových sadách Ad-LLM řešení konzistentně překonávají Ad-Chat napříč čtyřmi soudními modely; GPT-4.1-mini; Qwen-max; Claude-3-5-haiku; a Kimi-k2.
Tito soudci byli vybráni tak, aby se lišili od základního modelu doubao-1-5-lite-32k, což pomáhá snížit zkreslení z modelové rodiny. GIR-R se umístil na prvním nebo druhém místě ve všech případech, naznačující širokou shodu mezi soudci o převaze Ad-LLM. Rozbory jednotlivých kvalitativních dimenzí úzce následují vzorec viditelný v předchozích výsledcích (zobrazených výše).
Při uzavírání paperu autoři poznamenávají, že obě Ad-Chat a Ad-LLM vyžadují vyšší zdroje než inovativnější a efektivnější modely, a že potřeba použití LLM agentů v tomto typu transakce může představovat značné zatížení. Ačkoli by se dalo předpokládat, že problémy s latencí (obvykle kritické v scénářích podávání reklam) by mohly vzniknout z použití LLM tohoto typu (i když to paper nezmiňuje speciálně).
V každém případě implementace Ad-Chat strategie (horní řádek v předchozím schématu zobrazeném na začátku článku) prokázala nejvyšší míru kliknutí, i když měla nejvyšší spojený LLM náklad.
Závěr
Ačkoli není překvapivé, že literatura spekuluje o metodách, kterými LLM mohou nést reklamu, je ve skutečnosti poměrně málo veřejně dostupných výzkumů na toto téma; to činí aktuální paper, a co lze rozumně interpretovat jako jeho předchůdce, zajímavou četbou.
Kdokoli, kdo pracoval s reklamním prodejním oddělením, nebo prodával inventář, ví, že inzerenti vždy chtějí více – ideálně, aby reklamy byly prezentovány jako faktický obsah, zcela nerozlišitelné od hostitelského obsahu; a zaplatí značný příplatek za to (spolu s hostitelem, který tak riskuje svou důvěryhodnost a postavení u čtenářů a dalších typů stakeholderů).
Tudíž bude zajímavé vidět, do jaké míry, pokud vůbec, reklamní klausule představené v obou paperech mohou být motivovány k postupu dále nahoru v odpovědi LLM a blíže k “nákladu”.
První zveřejnění čtvrtek, 18. září 2025












