Погляд Anderson

Підготовка до реклами в великих мовних моделях

mm
Додайте Unite.AI до бажаних джерел у Google
Source: ChatGPT-4o and https://commons.wikimedia.org/wiki/File:Microsoft_Surface_Laptop_7.jpg

Нові дослідження показують, як рекламу можна скоро впровадити безпосередньо в відповіді типу ChatGPT – не як банери чи попапи, а вплетену в саму відповідь. Новий бенчмарк перевіряє, наскільки добре ці відповіді з рекламою можуть залишатися корисними, правдоподібними та прибутковими, і може вимагати компромісу між прийнятним користувацьким досвідом та кліком.

 

Оскільки поширена і зростаюча популярність великих мовних моделей підірвала традиційні методи реклами, які живили інтернет майже з його початку, кожен, хто знайомий зі стратегіями захоплення ринку венчурними капіталістами, буде думати, як довго ще AI-чатботи зможуть утримуватися від включення рекламного контенту в свої відповіді.

Як Netflix і розширюється перелік сервісів потокового мовлення демонструють, традиційна стратегія кабельної ери, яка поєднує платні підписки з вплетеною рекламою (часто виправданою як спосіб збереження витрат споживачів), знову набуває імпульсу; і перехід до впровадження рекламних оголошень безпосередньо в виходи LLM починає виглядати менш спекулятивним і більше як природний наслідник цієї моделі.

З папери 'Онлайн-реклама з LLM: можливості та виклики', досить репрезентативний приклад переходу, якого більшість людей очікує, коли LLM монетизується. Джерело: https://www.sigecom.org/exchanges/volume_22/2/FEIZI.pdf

З папери ‘Онлайн-реклама з LLM: можливості та виклики’, досить репрезентативний приклад переходу, якого більшість людей очікує, коли LLM монетизується. Джерело: https://www.sigecom.org/exchanges/volume_22/2/FEIZI.pdf

Перспектива включення реклами в новому середовищі, яке вже має помітні проблеми з достовірністю, може здатися поспішною; проте масштаб інвестицій у генерацію AI за останні дванадцять місяців свідчить про те, що ринок зараз не визначається обережною чи обережною позицією; і з більшіми гравцями, такими як OpenAI, які можна вважати надзвичайно закредитованими і потребують раннього повернення на величезні інвестиції, історія свідчить про те, що період медового місяця безрецензійної продукції може закінчуватися.

GEM-Bench

З урахуванням цього клімату та цих бізнес-імперативів, цікава нова робота з Сінгапуру пропонує перший бенчмарк, орієнтований на інтерфейси чат-ботів AI, разом з новими кількісними метриками для того, що може виявитися однією з найбільш вибухових рекламних арен у 100 років.

Можливо, оптимістично, автори припускають чіткий розрив між “правдивим” контентом і рекламним контентом, де “відхилення” від стандартних відповідей у маркетинговий текст досить легко помітити:

Приклади того, яким може бути інтеграція реклами за двома моделями, вивченими в новій роботі. Джерело: https://arxiv.org/pdf/2509.14221

Приклади того, яким може бути інтеграція реклами за двома моделями, вивченими в новій роботі. Джерело: https://arxiv.org/pdf/2509.14221

Залишається побачити, чи самі рекламодавці будуть, як це було їхньою тенденцією, намагатися зробити свій рекламний контент більш тонко вплетеним у вихідні дані, ніж у прикладах, наведених у папері.

Однак ці питання залишаються на майбутнє; поки що галузь така нова, що навіть базова термінологія відсутня або ще не визначена.

Отже, робота вводить Генеративний маркетинг двигунів (GEM) як нову основу для монетизації чат-ботів на основі LLM, впроваджуючи відповідні рекламні оголошення безпосередньо у згенеровані відповіді.

Дослідники ідентифікують Ін’єкцію відповіді з рекламою (AIR) як центральну проблему в GEM і стверджують, що існуючі бенчмарки погано підходять для вивчення цього питання. Для заповнення цієї прогалини вони вводять те, що вони називають першим бенчмарком, спеціально розробленим для цієї мети.

GEM-Bench складається з трьох кураторських наборів даних, що охоплюють сценарії чат-бота та пошукової системи. Він також включає метрику онтології, розробленої для оцінки декількох аспектів задоволеності користувача та залучення, разом з набором базових методів, реалізованих у модульній багатофункціональній основі.

Автори стверджують, що хоча прості методи на основі підказок можуть досягти поважних метрик залучення, таких як підвищені показники клікування (CTR), вони схильні погіршувати задоволеність користувача. Натомість підходи, які вставляють рекламу в попередньо згенеровані, безрецензійні відповіді, показують покращення довіри та якості відповідей – хоча й за рахунок більшої обчислювальної складності.

Ці компроміси, стверджує робота, підкреслюють необхідність більш ефективних і ефективних методів інтеграції реклами у генерацію.

Нова робота називається GEM-Bench: Бенчмарк для генерації відповідей з ін’єкцією реклами в генеративному маркетингу двигунів і походить від чотирьох дослідників Національного університету Сінгапуру.

Метод

Нарис для Генеративного маркетингу двигунів (GEM) позичає з базових принципів Маркетингу пошукових систем (SEM). Традиційний SEM працює шляхом поєднання запитів з рекламою через багатостадійний трубопровід, у якому рекламодавці роблять ставки на ключові слова; система визначає, які запити викликають рекламу; система оцінює, наскільки ймовірно, що кожна реклама буде клікована; і потім розподіляє розміщення через аукціон, який балансує ставки з передбачуваним залученням.

Натомість підхід GEM адаптує ті самі етапи до LLM, але стикається з новими викликами на кожному етапі: немає фіксованих слотів для реклами, тому система повинна вирішити, чи може запит прийняти рекламу і де вставити її у вільний текст; оцінка показників клікування стає складнішою без структурованих макетів; і актуальність повинна бути збалансована з задоволенням користувача, оскільки реклама вплетена безпосередньо у вихідні дані моделі, а не подається як окремий текст.

Одна з базових ліній, вивчених у роботі, Ad-Chat, представляє простий метод, при якому рекламний контент вставляється у системну підказку до генерації відповіді. Це означає, що модель генерує відповідь з уже вплетеною рекламою, керовану попередньо завантаженою програмою.

Інший підхід, Ad-LLM, був розроблений авторами як частина нового бенчмарку. Ad-LLM використовує модульний шлях, спочатку генеруючи чисту, безрецензійну відповідь; обираючи відповідну рекламу; визначаючи найкращу точку вставки на основі семантичного потоку; і, нарешті, переписуючи вихідні дані для безшовної інтеграції реклами:

Порівняння між Ad-Chat і методом авторів 'Ad-LLM'. Ad-Chat впроваджує рекламу через системну підказку до генерації, з обмеженим контролем над розміщенням. Ad-LLM розділяє генерацію відповіді та ін'єкцію реклами, обираючи точки вставки на основі семантичного потоку та уточнюючи результат. Обидва оцінюються за допомогою метрик GEM-Bench для задоволеності та залучення

Порівняння між Ad-Chat і методом авторів ‘Ad-LLM’. Ad-Chat впроваджує рекламу через системну підказку до генерації, з обмеженим контролем над розміщенням. Ad-LLM розділяє генерацію відповіді та ін’єкцію реклами, обираючи точки вставки на основі семантичного потоку та уточнюючи результат. Обидва оцінюються за допомогою метрик GEM-Bench для задоволеності та залучення.

Хоча Ad-Chat дешевший і іноді більш переконливий, він схильний знижувати довіру та точність. Ad-LLM показує кращі результати за метрики задоволеності користувача, хоча й за вищої ціни.

Дані

Для генерації відповідей з ін’єкцією реклами спочатку були згенеровані два типи наборів даних: набір запитів користувача (Користувач) і база даних реклами (AdDB).

Оскільки запити користувача визначають рекламні можливості у відповідях LLM, “інвентар реклами” можна вважати наявним у цих відповідях, хоча це визначається не тільки придатністю запиту користувача, але й тим, наскільки система буде дотримуватися своїх власних правил про баланс цілісності проти імперативів рекламодавців.

У будь-якому випадку, реклама з’явиться лише у відповідях, навіть якщо (див. схему вище) запити користувача можуть бути таємно доповнені для розміщення реклами.

Для сценарію чат-бота автори сконструювали два набори запитів: MT-Human і LM-Market.

MT-Human був взятий з гуманітарної частини MT-Bench, багатотурного бенчмарка для LLM, і містить питання, які можуть вміщувати рекламний контент.

LM-Market був побудований з більш ніж півмільйона реальних запитів ChatGPT, зібраних LMSYS-Chat-1M, відфільтрованих для англійських маркетингових запитів, і згрупованих за темами за допомогою семантичних вкладень.

У обидвох випадках остаточні запити були вибрані через багатостадійний трубопровід, що поєднує автоматичне кластеризування, оцінку LLM і верифікацію людини, з метою ідентифікації запитів, де вставка реклами буде природною та правдоподібною.

Для оцінки якості відповідей з ін’єкцією реклами GEM визначає міру онтології, що охоплює як задоволеність користувача, так і залучення. Це включає кількісні метрики, такі як потік відповіді, співвідношення і показник клікування, а також якісні стандарти, такі як довіра, точність і природність – метрики, призначені для відображення як того, наскільки добре реклама вписується у відповідь, так і того, наскільки ймовірно, що користувачі сприйматимуть і взаємодіятимуть з нею.

Відносно “Природності”, робота стверджує:

‘[Природність] вимірює ступінь, у якій вставка реклами порушує потік і природність розмови, на основі переривності та автентичності. Переривність перевіряє, чи створює реклама “вистриб” або “раптове” відчуття під час читання, порушуючи безперервну увагу користувача на тему.

‘Аутентичність оцінює, чи підкреслює реклама “людський дотик” або “природний потік” розмови, роблячи відповідь жорсткою, формульною та менш автентичною.’

Для генерації традиційного сценарію пошукової системи для фази тестування автори створили набір даних під назвою CA-Prod з AdsCVLR комерційного корпусу, який містить 300 000 пар запит-реклама, кожна з яких складається з ключового слова, метаданих і ручної мітки, що позначає актуальність:

З оригінальної джерельної праці, приклади з набору даних AdsCVLR, який допоміг надати матеріал для тестів авторів. Джерело: http://www.jdl.link/doc/2011/20221224_AdsCVLR.pdf

З оригінальної джерельної праці, приклади з набору даних AdsCVLR, який допоміг надати матеріал для тестів авторів. Джерело: http://www.jdl.link/doc/2011/20221224_AdsCVLR.pdf

Записи з відсутніми полями були видалені, а залишилися лише запити, які містять як позитивну, так і негативну рекламу (див. зображення вище для прикладів).

Для уточнення даних реклама була згрупована у шість тематичних груп (садово-господарське обладнання, шлепанці, домашні речі, додатки до харчування, пристрої Android і жіночі сукні) за допомогою семантичних вкладень і кластеризації методом k-середніх.

Запити були потім призначені до тем згідно з їхніми позитивними рекламами, з надто розрідженими або щільними наборами, виключеними, перш ніж було вибрано 120 запитів і 2215 унікальних продуктів для бенчмарка.

Тести

Для оцінки того, наскільки добре різні стратегії ін’єкції реклами працюють, бенчмарк розглянув три основні питання: наскільки ефективним є кожен метод за визначеними метриками задоволеності та залучення; як внутрішні дизайнерські рішення всередині Ad-LLM можуть вплинути на його результати; і як обчислювальна вартість порівняється між системами.

Автори оцінили Ad-Chat і три варіанти трубопроводу Ad-LLM, кожний з яких відрізнявся тим, як реклама була отримана (або з підказки, або з згенерованої відповіді), і тим, чи було остаточне виходи переписано для плавності.

Усі методи були запущені за допомогою Doubao-1-5-lite-32k як базової моделі і оцінені за допомогою GPT-4.1-mini.

Ефективність Ad-Chat і варіантів Ad-LLM на наборах даних MT-Human, LM-Market і CA-Prod. Кількісні метрики включають потік відповіді (RF), співвідношення відповіді (RC), потік реклами (AF), співвідношення реклами (AC), показник ін'єкції (IR), показник клікування (CTR) і загальні оцінки. Якісні метрики охоплюють точність, природність, особистість, довіру, помітність, клікування (або показник клікування) і загальну продуктивність.

Ефективність Ad-Chat і варіантів Ad-LLM на наборах даних MT-Human, LM-Market і CA-Prod. Кількісні метрики включають потік відповіді (RF), співвідношення відповіді (RC), потік реклами (AF), співвідношення реклами (AC), показник ін’єкції (IR), показник клікування (CTR) і загальні оцінки. Якісні метрики охоплюють точність, природність, особистість, довіру, помітність, клікування (або показник клікування) і загальну продуктивність.

На всіх трьох наборах даних Ad-LLM продемонстрував кращі результати, ніж Ad-Chat, як за метриками задоволеності, так і за метриками залучення. Як показано у таблиці результатів вище, найкращий варіант Ad-LLM покращив результати Ad-Chat на 8,4, 1,5 і 3,8 відсотка у загальних кількісних оцінках; і на 10,7, 10,4 і 8,6 відсотка у загальних якісних оцінках для MT-Human, LM-Market і CA-Prod відповідно.

З цих результатів автори стверджують:

‘Ці результати демонструють, що генерація сирої відповіді та подальша ін’єкція реклами дають кращу якість відповіді у порівнянні з простішим підходом, який спирається виключно на ін’єкцію реклами через системну підказку.

‘Для окремих вимірів задоволеності користувача та залучення Ad-Chat постійно демонструє суттєву прогалину у продуктивності порівняно з рішеннями Ad-LLM на всіх трьох наборах даних, особливо у вимірах, таких як точність, особистість і довіра.’

Крім того, Ad-LLM показав свої найкращі результати за точністю, особистістю та довірою, перевершивши Ad-Chat на 17,6, 23,3 і 17,2 відсотка відповідно. Згідно з роботою, ці відмінності можуть бути результатом того, як Ad-Chat використовує системні підказки для спрямування моделі до більш персоналізованої та промовистої мови – яку автори вважають здатною привести до “продавцького” тону, що знижує точність і довіру.

Ad-Chat також продемонстрував нижчі показники ін’єкції, навіть при оцінці запитів, вибраних за придатністю для реклами, і автори приписують це залежності від підказок (які вони вважають важкими для контролю).

У контексті пошукової системи, однак, Ad-Chat досягнув на 8,6 відсотка вищого показника клікування, що, на думку авторів, може відображати перевагу використання LLM для отримання кандидатів на продукти, а не залежності лише від семантичних вкладень:

Порівняння загальних оцінок продуктивності за чотири моделі суддів (GPT-4.1-mini, Qwen-max, claude-3-5-haiku, kimi-k2) для Ad-Chat і трьох варіантів Ad-LLM (GI-R, GIR-R, GIR-P) на наборах даних MT-Human, LM-Market і CA-Prod. Хоча оцінки різняться за суддями, Ad-LLM постійно перевершує Ad-Chat у всіх умовах.

Порівняння загальних оцінок продуктивності за чотири моделі суддів (GPT-4.1-mini, Qwen-max, claude-3-5-haiku, kimi-k2) для Ad-Chat і трьох варіантів Ad-LLM (GI-R, GIR-R, GIR-P) на наборах даних MT-Human, LM-Market і CA-Prod. Хоча оцінки різняться за суддями, Ad-LLM постійно перевершує Ad-Chat у всіх умовах.

На всіх трьох наборах даних рішення Ad-LLM постійно перевершують Ad-Chat за всі чотири моделі суддів; GPT-4.1-mini; Qwen-max; Claude-3-5-haiku; і Kimi-k2.

Ці судді були вибрані для того, щоб відрізнятися від базової моделі Doubao-1-5-lite-32k, що допомагає зменшити упередженість від сімейної приналежності моделі. GIR-R зайняв перше або друге місце в кожному випадку, що свідчить про широке погодження серед суддів щодо переваги Ad-LLM. Розподіл за окремими якісними вимірами тісно слідує за законом, спостережуваним у результатах, наведених вище.

У висновку робота зауважує, що як Ad-Chat, так і Ad-LLM вимагають більших ресурсів, ніж більш інноваційні та ефективні моделі, і що необхідність використання агентів LLM у цьому типу транзакції може представляти суттєву витрату. Хоча можна уявити, що питання затримки (зазвичай критичні в сценаріях подачі реклами) можуть виникнути з використанням LLM такого типу (хоча це не розглядається конкретно у роботі).

У будь-якому випадку, реалізація авторами стратегії Ad-Chat (верхній ряд у схемі, показаній на початку статті) пропонувала найвищий показник клікування, хоча й мав найвищу пов’язану з цим витрату LLM.

Висновок

Хоча не дивно, що література спекулює про методи, за допомогою яких LLM можуть нести рекламу, насправді існує досить мало публічно доступних досліджень на цю тему; це робить поточну роботу, а також її попередницю, цікавими матеріалами.

Хто працював з відділом продажу реклами або продавав інвентар, знає, що рекламодавці завжди хочуть більше – ідеально, щоб рекламу подавали як фактичний контент, абсолютно нерозрізнюваний від основного потоку контенту; і вони будуть платити суттєву премію за це (разом з господарем, який тим самим ризикує своєю репутацією та становищем серед читачів і інших типів зацікавлених сторін).

Отже, буде цікаво побачити, якою мірою, якщо взагалі, рекламні додатки, передбачені в обох роботах, можуть бути стимульовані до руху далі вгору у відповіді LLM і ближче до “вантажу”.

 

Перша публікація – четвер, 18 вересня 2025 року

Письменник про машинне навчання, спеціаліст у галузі синтезу зображень людини. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розпуску в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: [email protected]