Взгляд Anderson
Подготовка к рекламе в больших языковых моделях

Новые исследования показывают, как реклама может быть встроена直接 в ответы, подобные ChatGPT, не как баннеры или всплывающие окна, а вплетена в сам ответ. Новая оценка проверяет, насколько хорошо эти ответы с рекламой могут оставаться полезными, правдоподобными и прибыльными, и может потребовать компромисса между приемлемым пользовательским опытом и кликами.
Поскольку широкая и растущая популярность больших языковых моделей подрывает традиционные методы рекламы, которые питали интернет почти с его начала, любой, знакомый с тактиками захвата рынка венчурных капиталистов, будет задумываться, как долго еще AI-чаты смогут удерживаться от включения рекламного контента в свои ответы.
Как Netflix и растущий список сервисов потокового вещания демонстрируют, традиционная стратегия кабельной эры, сочетающая платные подписки с встроенной рекламой (часто оправданной как способ снизить потребительские затраты), вновь набирает обороты; и сдвиг в сторону включения рекламы непосредственно в выходные данные LLM начинает появляться менее спекулятивным и более как естественный приемник этой модели.

Из статьи ‘Онлайн-реклама с LLM: Возможности и проблемы’, довольно представительный пример перехода, который большинство людей ожидают, когда LLM монетизируется. Источник: https://www.sigecom.org/exchanges/volume_22/2/FEIZI.pdf
Перспектива включения рекламы в новую среду, которая уже имеет заметные проблемы с достоверностью, может показаться поспешной; однако масштаб инвестиций в генеративный AI за последние двенадцать месяцев говорит о том, что рынок в настоящее время не определяется осторожным или обдуманным отношением; и с более крупными игроками, такими как OpenAI, которые, по-видимому, чрезмерно зависят и нуждаются в раннем возврате на огромные инвестиции, история показывает, что медовый месяц без рекламного контента может подходить к концу.
GEM-Bench
С учетом этого климата и этих бизнес-императивов, интересная новая статья из Сингапура предлагает первый эталон, направленный на интерфейсы чат-ботов AI, вместе с новыми количественными метриками для того, что может оказаться одной из самых взрывных рекламных арен в 100 лет.
Возможно, оптимистично, авторы предполагают четкое разделение между ‘истинным’ контентом и рекламным контентом, где ‘отклонение’ от стандартных ответов в маркетинговый текст довольно легко заметить:

Примеры того, какой интеграции рекламы может быть в двух моделях, изученных в новой статье. Источник: https://arxiv.org/pdf/2509.14221
Остается быть увиденным, будут ли сами рекламодатели, как было их тенденцией, стремиться иметь свой рекламный контент более тонко вплетенным в выходные данные, чем в примерах, приведенных в статье.
Однако это вопросы для позже; на данный момент область настолько новая, что даже базовая терминология отсутствует или еще не устоялась.
Статья поэтому вводит Генеративный двигатель маркетинга (GEM) как новую основу для монетизации чат-ботов на основе LLM, путем встраивания релевантной рекламы непосредственно в сгенерированные ответы.
Исследователи определяют Генерацию ответов с встроенной рекламой (AIR) как центральную задачу в GEM и утверждают, что существующие эталоны плохо подходят для изучения ее. Чтобы заполнить этот пробел, они вводят то, что они утверждают, является первым эталоном, специально разработанным для этой цели.
GEM-Bench состоит из трех отобранных наборов данных, охватывающих сценарии чат-ботов и поисковых систем. Он также включает метрическую онтологию, разработанную для оценки нескольких аспектов удовлетворенности и вовлеченности пользователей, а также набор базовых методов, реализованных в модульной многоагентной структуре.
Авторы утверждают, что хотя простые методы, основанные на подсказках, могут достичь уважительных метрик вовлеченности, таких как повышенные показатели кликов (CTR), они склонны ухудшать удовлетворенность пользователей. Напротив, подходы, которые вставляют рекламу в предварительно сгенерированные, без рекламы ответы, показывают улучшения в доверии и качестве ответа – хотя и с большей вычислительной нагрузкой.
Эти компромиссы, по мнению статьи, подчеркивают необходимость более эффективных и эффективных методов интеграции рекламы в генеративные выходные данные.
Новая работа называется GEM-Bench: Эталон для генерации ответов с встроенной рекламой в генеративном двигателе маркетинга и исходит от четырех исследователей из Национального университета Сингапура.
Метод
Набросок для Генеративного двигателя маркетинга (GEM) заимствует из базовых принципов маркетинга поисковых систем (SEM). Традиционный SEM работает, сопоставляя запросы с рекламой через многоступенчатый конвейер, в котором рекламодатели предлагают на ключевые слова; система определяет, какие запросы запускают рекламу; система оценивает, насколько вероятно, что каждая реклама будет кликнута; и затем распределяет размещение через аукцион, который балансирует предложения с прогнозируемым вовлечением.
Напротив, подход GEM адаптирует те же этапы к LLM, но сталкивается с новыми проблемами на каждом шаге: нет фиксированных рекламных слотов, поэтому система должна решить, может ли запрос принять рекламу и где вставить ее в свободный текст; оценка показателей кликов становится более трудной без структурированных макетов; и релевантность должна быть сбалансирована с удовлетворенностью пользователей, поскольку реклама вплетена непосредственно в выходные данные модели, а не подается как отдельный текст.
Одна из базовых линий, изученных в работе, Ad-Chat, представляет собой простой метод, при котором рекламный контент вставляется в системную подсказку до генерации ответа. Это означает, что модель производит ответ с уже встроенной рекламой, руководствуясь предварительно загруженной программой.
Другой подход, Ad-LLM, был разработан авторами в рамках нового эталона. Ad-LLM использует модульный путь, сначала генерируя чистый, без рекламы ответ; выбирая релевантную рекламу; определяя лучшую точку вставки на основе семантического потока; и, наконец, переписывая выходные данные, чтобы интегрировать рекламу гладко:

Сравнение между Ad-Chat и методом ‘Ad-LLM’ авторов. Ad-Chat вставляет рекламу через системную подсказку до генерации, с ограниченным контролем над размещением. Ad-LLM отделяет генерацию ответа и вставку рекламы, выбирая точки вставки на основе семантического потока и уточняя результат. Оба оцениваются с помощью метрик GEM-Bench для удовлетворенности и вовлеченности.
Хотя Ad-Chat дешевле и иногда более убедителен, он склонен снижать доверие и точность. Ad-LLM работает лучше на метриках удовлетворенности пользователей, но с большей вычислительной нагрузкой.
Данные
Для генерации ответов с встроенной рекламой были сначала сгенерированы два типа наборов данных: набор запросов пользователей (Пользователь) и база данных рекламы (AdDB).
Поскольку запросы пользователей определяют возможности рекламы в ответах LLM, ‘инвентарь рекламы’ можно сказать, существует в этих ответах, хотя это определяется не только применимостью запроса пользователя, но и тем, насколько система будет следовать своим собственным правилам о балансировании целостности и императивов рекламодателей.
В любом случае, реклама будет появляться только в ответах, даже если (см. схему выше) запросы пользователей могут быть тайно дополнены, чтобы приспособиться к процессу подачи рекламы.
Для сценария чат-бота авторы построили два набора запросов: MT-Human и LM-Market.
MT-Human был взят из гуманитарной части MT-Bench, многоступенчатого эталона для LLM, и содержит вопросы, которые могут включать рекламный контент.
LM-Market был построен из более чем полумиллиона реальных запросов ChatGPT, собранных LMSYS-Chat-1M, отфильтрованных для англоязычных маркетинговых запросов и сгруппированных по темам с помощью семантических вложений.
В обоих случаях окончательные запросы были выбраны через многоступенчатый конвейер, сочетающий автоматическое кластеризование, оценку LLM и проверку человека, с целью определения подсказок, где вставка рекламы будет естественной и правдоподобной.
Чтобы оценить качество ответов с встроенной рекламой, GEM определяет измерительную онтологию, охватывающую как удовлетворенность пользователей, так и вовлеченность. Это включает количественные метрики, такие как поток ответа, когерентность и показатель кликов, а также качественные стандарты, такие как доверие, точность и естественность – метрики, предназначенные для отражения как того, насколько хорошо реклама вписывается в ответ, так и того, насколько вероятно, что пользователи будут воспринимать и взаимодействовать с ней.
Что касается ‘Естественности’, статья гласит:
‘[Естественность] измеряет, насколько вставка рекламы нарушает поток и естественность разговора, основанную на прерывании и аутентичности. Прерывание проверяет, создает ли реклама ‘выпрыгивающее’ или ‘внезапное’ чувство во время чтения, нарушающее непрерывное внимание пользователя на тему.
‘Аутентичность оценивает, не подрывает ли реклама ‘человеческий оттенок’ или ‘естественный поток’ разговора, делая ответ более жестким, формульным и менее аутентичным.’
Чтобы сгенерировать традиционный сценарий поисковой системы для фазы тестирования, авторы создали набор данных под названием CA-Prod из AdsCVLR коммерческого корпуса, который содержит 300 000 пар запрос-реклама, каждая из которых состоит из ключевого слова, метаданных и ручной метки, обозначающей релевантность:

Из оригинальной статьи, примеры из набора данных AdsCVLR, который помог предоставить материал для тестов авторов. Источник: http://www.jdl.link/doc/2011/20221224_AdsCVLR.pdf
Записи с пропущенными полями были удалены, и оставлены только запросы, содержащие как положительную, так и отрицательную рекламу (см. изображение выше для примеров).
Чтобы уточнить данные, реклама была сгруппирована в шесть тематических групп (оборудование для газонов и садов, туфли, товары для дома, продукты питания, устройства Android и платья для женщин) с помощью семантических вложений и кластеризации K-means.
Запросы затем были назначены темам в соответствии с их положительной рекламой, с чрезмерно разреженными или плотными наборами, исключенными, прежде чем 120 запросов и 2215 уникальных продуктов были окончательно отобраны для эталона.
Тесты
Чтобы оценить, насколько хорошо разные стратегии вставки рекламы работают, эталон решает три основные вопроса: насколько эффективен каждый метод по метрикам удовлетворенности и вовлеченности; как внутренние дизайнерские решения внутри Ad-LLM могут повлиять на его результаты; и как вычислительная нагрузка будет сравниваться между системами.
Авторы оценили Ad-Chat и три варианта подхода Ad-LLM, каждый из которых отличается тем, как реклама извлекается (либо из подсказки, либо из сгенерированного ответа), и тем, переписывается ли окончательный выход для плавности.
Все методы были запущены с использованием Doubao-1-5-lite-32k в качестве базовой модели и оценены с помощью GPT-4.1-mini.

Эффективность Ad-Chat и вариантов Ad-LLM на наборах данных MT-Human, LM-Market и CA-Prod. Количественные метрики включают поток ответа (RF), когерентность ответа (RC), поток рекламы (AF), когерентность рекламы (AC), показатель вставки (IR), показатель кликов (CTR) и общий балл. Качественные метрики охватывают точность, естественность, личность, доверие, уведомление, клик (процент кликов) и общую производительность.
На всех трех наборах данных Ad-LLM произвел более сильные результаты, чем Ad-Chat, по метрикам удовлетворенности и вовлеченности. Как показано в таблице результатов выше, лучший вариант Ad-LLM улучшил Ad-Chat на 8,4, 1,5 и 3,8 процента в общих количественных баллах; и на 10,7, 10,4 и 8,6 процента в качественных баллах для MT-Human, LM-Market и CA-Prod соответственно.
Из этих результатов авторы заявляют:
‘Эти результаты демонстрируют, что генерация сырого ответа и последующая вставка рекламы дает лучшее качество ответа по сравнению с более простым подходом, основанным исключительно на вставке рекламы через системную подсказку.
‘Для конкретных размеров удовлетворенности и вовлеченности пользователей Ad-Chat последовательно демонстрирует значущий разрыв в производительности по сравнению с решениями Ad-LLM на всех трех наборах данных, особенно в размерах, таких как точность, личность и доверие.’
Кроме того, Ad-LLM показал свои самые сильные улучшения в точности, личности и доверии, превзойдя Ad-Chat на 17,6, 23,3 и 17,2 процента соответственно. Согласно статье, эти различия могут быть результатом того, что Ad-Chat использует системные подсказки для направления модели к более персонализированному и промоциональному языку – который, по мнению авторов, может привести к ‘продавец-подобному’ тону, снижающему точность и доверие.
Ad-Chat также произвел более низкие показатели вставки, даже при оценке запросов, выбранных для пригодности рекламы, и авторы приписывают это зависимости от подсказок (которые они характеризуют как трудные для контроля).
В сценарии поисковой системы, однако, Ad-Chat достиг 8,6 процента более высокого показателя кликов, что, по мнению статьи, может отражать преимущество использования LLM для извлечения кандидатов на продукцию, а не полагаться исключительно на семантические вложения:

Сравнение общих баллов производительности на четырех моделях судей (GPT-4.1-mini, Qwen-max, claude-3-5-haiku, kimi-k2) для Ad-Chat и трех вариантов Ad-LLM (GI-R, GIR-R, GIR-P) на наборах данных MT-Human, LM-Market и CA-Prod. Хотя баллы варьируются по судьям, Ad-LLM последовательно превосходит Ad-Chat во всех условиях.
На всех трех наборах данных решения Ad-LLM последовательно превосходят Ad-Chat по метрикам удовлетворенности и вовлеченности. Как показано в таблице результатов выше, лучший вариант Ad-LLM улучшил Ad-Chat на 8,4, 1,5 и 3,8 процента в общих количественных баллах; и на 10,7, 10,4 и 8,6 процента в качественных баллах для MT-Human, LM-Market и CA-Prod соответственно.
Во втором таблице результатов (показанном выше) видно, что на всех трех наборах данных решения Ad-LLM последовательно превосходят Ad-Chat на четырех моделях судей; GPT-4.1-mini; Qwen-max; Claude-3-5-haiku; и Kimi-k2.
Эти судьи были выбраны для различия от базовой модели Doubao-1-5-lite-32k, что помогает уменьшить предвзятость от выравнивания модели. GIR-R занял первое или второе место в каждом случае, что говорит о широком согласии судей на превосходстве Ad-LLM. Разбивка по отдельным качественным размерам тесно следует шаблону, наблюдаемому в предыдущих результатах (показанных выше).
В заключение статья отмечает, что и Ad-Chat, и Ad-LLM требуют более высоких ресурсов, чем более инновационные и эффективные модели, и что необходимость использования агентов LLM в этом типе транзакции может представлять значительную нагрузку. Хотя можно представить, что проблемы с задержкой (обычно критические в сценариях подачи рекламы) могут возникнуть из-за использования LLM такого типа (хотя это не обсуждается конкретно в статье).
В любом случае, реализация стратегии Ad-Chat авторами (верхний ряд в ранее показанной схеме) оказалась иметь самый высокий показатель кликов, хотя и имела самый высокий связанный с этим LLM-стоимость.
Вывод
Хотя не удивительно, что литература будет спекулировать о методах, с помощью которых LLM могут нести рекламу, на самом деле существует довольно мало публично доступных исследований на эту тему; это делает текущую статью, и то, что можно рассматривать как её предшественника, интересной.
Любой, кто работал с отделом продаж рекламы или продавал инвентарь, будет знать, что рекламодатели всегда хотят больше – идеально, чтобы реклама представлялась как фактический контент, совершенно неотличимый от основного потока контента; и они будут платить значительную премию за это (вместе с хостом, который тем самым рискует своей достоверностью и репутацией среди читателей и других типов заинтересованных сторон).
Следовательно, будет интересно увидеть, насколько, если вообще, рекламные кодициллы, представленные в двух статьях, будут стимулированы к ползучему движению вверх по ответу LLM и ближе к ‘полезной нагрузке’.
Опубликовано в первый раз в четверг, 18 сентября 2025 года












