Kąt Andersona
Przygotowanie do reklam w dużych modelach językowych

Naukowcy odkryli, jak reklamy mogą być wbudowane bezpośrednio w odpowiedzi stylu ChatGPT – nie jako banery czy wyskakujące okna, ale jako część samej odpowiedzi. Nowy benchmark testuje, jak dobrze te odpowiedzi z reklamami mogą być przydatne, wiarygodne i opłacalne, i może wymagać kompromisu między akceptowalnym doświadczeniem użytkownika a klikalnością.
Wraz ze wzrostem popularności dużych modeli językowych, które podważają tradycyjne metody reklamowe, które napędzają internet od jego powstania, każdy, kto jest zaznajomiony z taktykami wchodzącymi na rynek, zastanawia się, jak długo AI chatboty będą mogły powstrzymać się od umieszczania treści reklamowych w swoich odpowiedziach.
Podobnie jak Netflix i rosnąca liczba usług streamingowych pokazuje, tradycyjna strategia łączenia płatnych subskrypcji z wbudowanymi reklamami (często uzasadnianymi jako sposób na obniżenie kosztów dla konsumentów) zyskuje na popularności; i tendencja do włączania reklam bezpośrednio do danych wyjściowych LLM zaczyna wyglądać mniej spekulatywnie i bardziej jak naturalne przyjęcie tego modelu.

Z artykułu ‘Reklamy online z LLM: możliwości i wyzwania’, dość reprezentatywny przykład przejścia, którego większość ludzi oczekuje, gdy LLM zostaną zmonetyzowane. Źródło: https://www.sigecom.org/exchanges/volume_22/2/FEIZI.pdf
Perspektywa umieszczenia reklam w środowisku, które już ma znaczące problemy z wiarygodnością, może wydawać się przedwczesna; jednak skala inwestycji w generatywne AI w ciągu ostatnich dwunastu miesięcy sugeruje, że rynek nie jest obecnie definiowany przez ostrożne lub rozważne podejście; i z większymi graczami, takimi jak OpenAI, które można uznać za przewyższające swoje możliwości i potrzebujące wczesnego zwrotu z ogromnych inwestycji, historia wskazuje, że okres miodowy bez reklam może dobiegać końca.
GEM-Bench
W tym klimacie i z tymi wymogami biznesowymi, interesujący nowy artykuł z Singapuru oferuje pierwszy benchmark skierowany do interfejsów czatbotów AI, wraz z nowymi metrykami ilościowymi, które mogą okazać się jednym z najbardziej eksplozywnych obszarów reklamowych w ciągu 100 lat.
Możliwe, że optymistycznie, autorzy zakładają wyraźny podział między “prawdziwą” treścią a treścią reklamową, gdzie “odstępstwo” od standardowych odpowiedzi do kopii marketingowej jest dość łatwe do zauważenia:

Przykłady rodzaju integracji reklam, które mogą wystąpić w ramach dwóch modeli badanych w nowym artykule. Źródło: https://arxiv.org/pdf/2509.14221
Nie wiadomo jeszcze, czy sami reklamodawcy będą, jak to miało miejsce w przeszłości, próbowali umieścić swoje treści reklamowe w sposób bardziej subtelny w danych wyjściowych niż w przykładach podanych w artykule.
Jednak te sprawy są kwestią przyszłości; na razie pole jest tak młode, że nawet podstawowa terminologia jest nieobecna lub nieustalona.
Artykuł wprowadza więc Generatywny Silnik Marketingowy (GEM) jako nową ramę dla monetyzacji czatbotów opartych na LLM, poprzez umieszczanie odpowiednich reklam bezpośrednio w generowanych odpowiedziach.
Badacze identyfikują Generowanie odpowiedzi z wstrzykniętymi reklamami (AIR) jako centralne wyzwanie w GEM i twierdzą, że istniejące benchmarki są słabo przystosowane do badania tego. Aby wypełnić tę lukę, wprowadzają to, co twierdzą, że jest pierwszym benchmarkiem zaprojektowanym specjalnie do tego celu.
GEM-Bench składa się z trzech wyselekcjonowanych zestawów danych, obejmujących scenariusze czatbotów i wyszukiwarek. Zawiera również ontologię metryk zaprojektowaną do oceny wielu aspektów satysfakcji i zaangażowania użytkowników, wraz z zestawem metod bazowych wdrożonych w ramach modułowego, wieloagentowego frameworku.
Autorzy twierdzą, że chociaż proste metody oparte na podpowiedziach mogą osiągnąć szanujące metryki zaangażowania, takie jak podniesione wskaźniki klikalności (CTR), tendencja jest taka, że obniżają one satysfakcję użytkowników. Z drugiej strony, podejścia, które wstrzykują reklamy do wcześniej wygenerowanych, bezreklamowych odpowiedzi, pokazują poprawy w zaufaniu i jakości odpowiedzi – choć przy wyższych kosztach obliczeniowych.
Te kompromisy, artykuł twierdzi, podkreślają potrzebę bardziej efektywnych i wydajnych technik integracji reklam z generowanymi danymi wyjściowymi.
Nowa praca ma tytuł GEM-Bench: Benchmark dla generowania odpowiedzi z wstrzykniętymi reklamami w ramach Generatywnego Silnika Marketingowego, i pochodzi od czterech badaczy z Narodowego Uniwersytetu w Singapurze.
Metoda
Zarys dla Generatywnego Silnika Marketingowego (GEM) pochodzi z podstawowych zasad Marketingu Silnika Wyszukiwania (SEM). Tradycyjny SEM działa, dopasowując zapytania do reklam za pomocą wieloetapowego potoku, w którym reklamodawcy licytują na słowa kluczowe; system identyfikuje, które zapytania wyzwalać będą reklamy; system szacuje, jak prawdopodobne jest, że każda reklama zostanie kliknięta; i następnie przydziela miejsce za pomocą aukcji, która równoważy oferty z przewidywanym zaangażowaniem.
W przeciwieństwie do tego, podejście GEM adaptuje te same etapy do LLM, ale staje przed nowymi wyzwaniami na każdym etapie: nie ma stałych miejsc reklamowych, więc system musi zdecydować, czy zapytanie może zawierać reklamę i gdzie ją umieścić w tekście; szacowanie wskaźników klikalności staje się trudniejsze bez strukturalnych układów; i istotność musi być zrównoważona z satysfakcją użytkownika, ponieważ reklamy są wplecione bezpośrednio w dane wyjściowe modelu, a nie są obsługiwane jako samodzielna kopia.
Jedna z linii bazowych badanych w pracy, Ad-Chat, reprezentuje prostą metodę, w której treści reklamowe są wstrzykiwane do systemu przed wygenerowaniem odpowiedzi. Oznacza to, że model produkuje odpowiedź z już wbudowaną reklamą, kierowaną przez wcześniej załadowaną agendę.
Inna metoda, Ad-LLM, została opracowana przez autorów jako część nowego benchmarku. Ad-LLM przyjmuje modułowy ścieżek, najpierw generując czystą, bezreklamową odpowiedź; wybierając odpowiednią reklamę; identyfikując najlepsze miejsce wstrzyknięcia na podstawie przepływu semantycznego; i na końcu przebudowując dane wyjściowe, aby płynnie zintegrować reklamę:

Porównanie między Ad-Chat a metodą ‘Ad-LLM’ autorów. Ad-Chat wstrzykuje reklamy za pomocą systemu przed generowaniem, z ograniczoną kontrolą nad umiejscowieniem. Ad-LLM oddziela generowanie odpowiedzi i wstrzyknięcie reklamy, wybierając punkty wstrzyknięcia na podstawie przepływu semantycznego i udoskonalając wynik. Obie są oceniane przy użyciu metryk GEM-Bench dla satysfakcji i zaangażowania.
Jednak Ad-Chat jest tańszy i czasami bardziej przekonywujący, tendencja jest taka, że obniża zaufanie i dokładność. Ad-LLM działa lepiej w metrykach satysfakcji użytkownika, ale przy wyższych kosztach.
Dane
Do generowania odpowiedzi z wstrzykniętymi reklamami, wygenerowano początkowo dwa rodzaje zestawów danych: zestaw zapytań użytkowników (Użyty) i bazę danych reklam (AdDB).
Ponieważ zapytania użytkowników definiują możliwości reklamowe w odpowiedziach LLM, “inwentarz reklam” można powiedzieć, że istnieje w tych odpowiedziach, choć jest to określone nie tylko przez stosowność zapytania użytkownika, ale także przez stopień, w jakim system będzie przestrzegał własnych zasad dotyczących balansowania integralności z imperatywami reklamodawców.
W każdym razie reklamy pojawią się tylko w odpowiedziach, nawet jeśli (patrz schemat powyżej) zapytania użytkowników mogą być tajnie uzupełnione, aby uwzględnić proces obsługi reklam.
Dla scenariusza czatbota autorzy zbudowali dwa zestawy zapytań: MT-Human i LM-Market.
MT-Human został pobrany z części humanistycznej MT-Bench, benchmarku wieloetapowego dla LLM, i zawiera pytania, które mogą zawierać treści reklamowe.
LM-Market został zbudowany z ponad pół miliona prawdziwych zapytań ChatGPT zebranych przez LMSYS-Chat-1M, przefiltrowanych dla angielskich zapytań marketingowych, i pogrupowanych według tematu przy użyciu osadzeń semantycznych.
W obu przypadkach ostateczne zapytania zostały wybrane za pomocą wieloetapowego potoku łączącego automatyczne klasterowanie, ocenę LLM i weryfikację ludzką, z celem identyfikacji zapytań, w których wstrzyknięcie reklamy byłoby naturalne i prawdopodobne.
Aby ocenić jakość odpowiedzi z wstrzykniętymi reklamami, GEM definiuje ontologię pomiaru, obejmującą zarówno satysfakcję użytkownika, jak i zaangażowanie. Obejmuje to metryki ilościowe, takie jak przepływ odpowiedzi, spójność i wskaźnik klikalności, a także metryki jakościowe, takie jak zaufanie, dokładność i naturalność – metryki mające na celu odzwierciedlenie, jak dobrze reklama pasuje do odpowiedzi i jak prawdopodobne jest, że użytkownicy ją zobaczą i z nią interakcjonują.
W odniesieniu do “Naturalności”, artykuł stwierdza:
‘[Naturalność] mierzy stopień, w jakim wstrzyknięcie reklamy zakłóca przepływ i naturalność rozmowy, na podstawie interruptivności i autentyczności. Interruptivność sprawdza, czy reklama tworzy “wyskakujące” lub “nagłe” uczucie podczas czytania, łamiąc ciągłą uwagę użytkownika na temat.
‘Autentyczność ocenia, czy reklama podważa “ludzki dotyk” lub “naturalny przepływ” rozmowy, sprawiając, że odpowiedź wydaje się sztywna, sformalizowana i mniej autentyczna.’
Aby wygenerować tradycyjny scenariusz wyszukiwarki do fazy testowej, autorzy stworzyli zestaw danych zatytułowany CA-Prod z korpusu AdsCVLR, który zawiera 300 000 par zapytań i reklam, każda składająca się z słowa kluczowego, metadanych i ręcznej etykiety oznaczającej istotność:

Z oryginalnego artykułu, przykłady z zestawu danych AdsCVLR, które pomogły dostarczyć materiał do testów autorów. Źródło: http://www.jdl.link/doc/2011/20221224_AdsCVLR.pdf
Rekordy z brakującymi polami zostały usunięte, a tylko zapytania zawierające zarówno pozytywne, jak i negatywne reklamy (patrz powyżej przykłady) zostały zachowane.
Aby udoskonalić dane, reklamy zostały pogrupowane w sześć grup tematycznych (sprzęt ogrodniczy i ogrodowy, buty, przedmioty gospodarstwa domowego, suplementy odżywcze, urządzenia z systemem Android i ubrania damske) przy użyciu osadzeń semantycznych i klasterowania K-means.
Zapytania zostały następnie przypisane do tematów zgodnie z ich pozytywnymi reklamami, z wykluczeniem zbyt rzadkich lub gęstych zestawów, zanim ostatecznie wybrano 120 zapytań i 2 215 unikalnych produktów do benchmarku.
Testy
Aby ocenić, jak dobrze różne strategie wstrzyknięcia reklam radzą sobie, benchmark rozważył trzy podstawowe pytania: jak skuteczne każda metoda była w określonych metrykach satysfakcji i zaangażowania; jak wewnętrzne wybory projektowe w ramach Ad-LLM mogą wpłynąć na wyniki; i jak koszt obliczeniowy będzie się porównywał w systemach.
Autorzy oceniali Ad-Chat i trzy warianty potoku Ad-LLM autorów, z których każdy różnił się sposobem, w jaki reklamy były pobierane (albo z podpowiedzi, albo z wygenerowanej odpowiedzi), i tym, czy ostateczne dane wyjściowe były przeredagowane pod kątem płynności.
Wszystkie metody zostały uruchomione przy użyciu doubao-1-5-lite-32k jako modelu bazowego i oceniono przy użyciu gpt-4.1-mini.

Skuteczność Ad-Chat i wariantów Ad-LLM w zestawach danych MT-Human, LM-Market i CA-Prod. Metryki ilościowe obejmują przepływ odpowiedzi (RF), spójność odpowiedzi (RC), przepływ reklamy (AF), spójność reklamy (AC), wskaźnik wstrzyknięcia (IR), wskaźnik klikalności (CTR) i ogólne wyniki. Metryki jakościowe obejmują dokładność, naturalność, osobowość, zaufanie, zauważalność, klikalność i ogólne wyniki.
Przez wszystkie trzy zestawy danych Ad-LLM wyprodukował lepsze wyniki niż Ad-Chat w obu metrykach satysfakcji i zaangażowania. Jak widać w tabeli wyników powyżej, najlepszy wariant Ad-LLM poprawił wyniki Ad-Chat o 8,4, 1,5 i 3,8 procent w ilościowych wynikach ogólnych; i o 10,7, 10,4 i 8,6 procent w wynikach jakościowych dla MT-Human, LM-Market i CA-Prod odpowiednio.
Z tych wyników autorzy stwierdzają:
‘Te wyniki pokazują, że generowanie surowej odpowiedzi i następne wstrzyknięcie reklamy daje lepszą jakość odpowiedzi w porównaniu z prostszym podejściem, które polega tylko na wstrzyknięciu reklam do podpowiedzi systemu.
‘Dla konkretnych wymiarów satysfakcji i zaangażowania użytkowników Ad-Chat wykazuje istotną lukę w wydajności w porównaniu z rozwiązaniami Ad-LLM we wszystkich trzech zestawach danych, szczególnie w wymiarach takich jak dokładność, osobowość i zaufanie.’
Dalej, Ad-LLM wykazał największe zyski w dokładności, osobowości i zaufaniu, przewyższając Ad-Chat o 17,6%, 23,3% i 17,2% odpowiednio. Według artykułu, te różnice mogą wynikać z faktu, że Ad-Chat używa podpowiedzi systemu, aby skierować model ku bardziej personalizowanemu i promocyjnemu językowi – co autorzy twierdzą może prowadzić do “tonu sprzedawcy”, który obniża dokładność i zaufanie.
Ad-Chat również wyprodukował niższe wskaźniki wstrzyknięcia, nawet przy ocenianiu zapytań wybranych ze względu na ich przydatność do reklam, i autorzy przypisują to zależności od podpowiedzi systemu (które określają jako trudne do kontrolowania).
W ustawieniu wyszukiwarki Ad-Chat osiągnął o 8,6% wyższy wskaźnik klikalności, co artykuł sugeruje może odzwierciedlać przewagę używania LLM do pobierania kandydatów produktów, zamiast polegania wyłącznie na osadzeniach semantycznych:

Porównanie ogólnych wyników wydajności w czterech modelach sędziowskich (GPT-4.1-mini, Qwen-max, claude-3-5-haiku, kimi-k2) dla Ad-Chat i trzech wariantów Ad-LLM (GI-R, GIR-R, GIR-P) w zestawach danych MT-Human, LM-Market i CA-Prod. Chociaż wyniki różnią się w zależności od sędziego, Ad-LLM konsekwentnie przewyższa Ad-Chat we wszystkich warunkach.
Druga tabela wyników (pokazana powyżej) ilustruje, że we wszystkich trzech zestawach danych rozwiązania Ad-LLM konsekwentnie przewyższają Ad-Chat w czterech modelach sędziowskich; GPT-4.1-mini; Qwen-max; Claude-3-5-haiku; i Kimi-k2.
Te sędziowie zostali wybrani, aby różnić się od modelu bazowego doubao-1-5-lite-32k, co pomaga zmniejszyć stronniczość wynikającą z powiązań rodzinnych modeli. GIR-R zajął pierwsze lub drugie miejsce we wszystkich przypadkach, co sugeruje szeroką zgodność sędziów co do przewagi Ad-LLM. Rozkład na poszczególne wymiary jakościowe ściśle naśladuje wzorzec widoczny w poprzednich wynikach (pokazanych powyżej).
Na zakończenie artykuł zauważa, że zarówno Ad-Chat, jak i Ad-LLM wymagają wyższych zasobów niż bardziej innowacyjne i skuteczne modele, i że potrzeba używania agentów LLM w tego rodzaju transakcji może stanowić znaczne obciążenie. Chociaż można by się spodziewać, że problemy z opóźnieniami (zwykle krytyczne w scenariuszach serwowania reklam) mogą wynikać z użycia LLM w tym kontekście (chociaż nie jest to specjalnie omawiane w artykule).
W każdym razie wdrożenie strategii Ad-Chat przez autorów (górny wiersz w schemacie przedstawionym na początku artykułu) okazało się oferować najwyższy wskaźnik klikalności, chociaż miał najwyższy związany z tym koszt LLM.
Wnioski
Chociaż nie jest zaskakujące, że literatura spekuluje na temat metod, za pomocą których LLM mogą przenosić reklamy, w rzeczywistości jest niewiele dostępnych badań na ten temat; to sprawia, że obecny artykuł, a także to, co można uznać za jego poprzednika, są interesującymi materiałami.
Ktoś, kto pracował z działem sprzedaży reklam, lub sprzedaży inwentarza, wie, że reklamodawcy zawsze chcą więcej – idealnie, aby reklamy były prezentowane jako treści faktualne, całkowicie nierozróżnialne od strumienia treści gospodarza; i są skłonni zapłacić znaczną premię za to (wraz z gospodarzem, który ryzykuje swoją wiarygodność i pozycję wśród czytelników i innych rodzajów interesariuszy). Zatem będzie interesujące zobaczyć, w jakim stopniu, jeśli w ogóle, ad-ladenne kodeksy przewidziane w obu pracach mogą być zachęcane do przesunięcia się wyżej w odpowiedzi LLM i bliżej “ładunku”. Po raz pierwszy opublikowane w czwartek, 18 września 2025.
Po raz pierwszy opublikowane w czwartek, 18 września 2025












