Anderson의 관점

대규모 언어 모델에서 광고에 대한 준비

mm
Unite.AI를 Google의 선호 소스에 추가
Source: ChatGPT-4o and https://commons.wikimedia.org/wiki/File:Microsoft_Surface_Laptop_7.jpg

새로운 연구에 따르면 ChatGPT 스타일의 답변에 광고가 직접 삽입될 수 있으며, 배너나 팝업이 아닌 답변 자체에 삽입될 수 있다고 합니다. 새로운 벤치마크는 이러한 광고가 삽입된 답변의 유용성, 신뢰성, 수익성을 테스트하며, 사용자 경험과 클릭률 사이의 트레이드오프가 필요할 수 있습니다.

 

대규모 언어 모델의广泛하고 증가하는 인기로 인해 전통적인 광고 방법이 깨지면서, 벤처 캐피탈의 시장 점유 전략에 익숙한 사람들은 AI 챗봇이 광고 콘텐츠를 포함하지 않도록 얼마나 더 지속할 수 있는지 궁금해할 것입니다.

넷플릭스와 확대되는 스트리밍 서비스는 전통적인 케이블 시대 전략을 다시 채택하고 있습니다. 이는 유료 구독과 삽입 광고의 조합으로 소비자 비용을 낮추는 방식입니다. 이러한 전환은 LLM 출력에 광고를 직접 삽입하는 방향으로 이동하고 있습니다.

LLM이 수익화될 때 대부분의 사람들이 예상하는 전환의 대표적인 예입니다. 출처: https://www.sigecom.org/exchanges/volume_22/2/FEIZI.pdf

LLM이 수익화될 때 대부분의 사람들이 예상하는 전환의 대표적인 예입니다. 출처: https://www.sigecom.org/exchanges/volume_22/2/FEIZI.pdf

신뢰성과 관련된 문제가 이미 있는 새로운 매체에 광고를 포함하는 것은 조급한 결정처럼 보일 수 있습니다. 그러나 최근 12개월 동안 생성적 AI에 대한 투자 규모는 시장이 현재 신중하거나 주의 깊게 접근하지 않고 있음을 시사합니다.

GEM-Bench

이러한 비즈니스 압력과 함께, 싱가포르의 새로운 논문은 AI 챗봇 인터페이스에 대한 첫 번째 벤치마크를 제공하며, 광고 삽입 응답의 유용성과 신뢰성을 평가하는 새로운 지표를 제시합니다.

저자들은 ‘진짜’ 콘텐츠와 광고 콘텐츠 사이의 명확한 구분을 가정합니다. 여기서 마케팅 복사본으로의 전환은 쉽게 식별할 수 있습니다.

새로운 논문에서 연구된 두 가지 모델에 따라 발생할 수 있는 광고 통합의 예입니다. 출처: https://arxiv.org/pdf/2509.14221

새로운 논문에서 연구된 두 가지 모델에 따라 발생할 수 있는 광고 통합의 예입니다. 출처: https://arxiv.org/pdf/2509.14221

광고주들이 광고 콘텐츠를 출력에 더 미묘하게 통합하도록 시도할 수 있습니다.

현재 이 분야는 매우 초기 단계이며, 기본적인 용어조차 없습니다.

이 논문에서는 LLM 기반 챗봇을 수익화하기 위한 새로운 프레임워크인 ‘생성 엔진 마케팅(GEM)’을 제시하며, 관련 광고를 직접 생성된 응답에 삽입합니다.

연구자들은 ‘광고 삽입 응답(AIR) 생성’을 GEM의 핵심 도전으로 식별하며, 기존의 벤치마크는 이를 연구하기에 적합하지 않다고 주장합니다. 이를 해결하기 위해, 저자들은 이 목적을 위해 설계된 첫 번째 벤치마크를 제시합니다.

GEM-Bench는 챗봇과 검색 엔진 시나리오를 포함하는 세 가지 데이터셋으로 구성되며, 사용자 만족도와 참여도를 평가하는 지표를 포함합니다.

저자들은 단순한 프롬프트 기반 방법은 참여 지표에서 좋은 성과를 내지만 사용자 만족도를 저하한다고 주장합니다. 반면, 광고가 삽입된 응답을 생성하는 접근법은 신뢰도와 응답 품질을 개선합니다.

이러한 트레이드오프는 더 효과적이고 효율적인 광고 삽입 기술의 필요성을 강조합니다.

Method

GEM의 개요는 검색 엔진 마케팅(SEM)의 기본 원칙에서借用됩니다. 전통적인 SEM은 쿼리와 광고를 매칭하는 다단계 파이프라인을 통해 작동합니다.

반면, GEM 접근법은 LLM에 이러한 단계를 적용하지만, 각 단계에서 새로운 도전을 직면합니다.

저자들은 두 가지 접근법을 연구합니다. 하나는 Ad-Chat으로, 시스템 프롬프트에 광고 콘텐츠를 삽입하여 모델이 광고가 포함된 답변을 생성하도록 합니다.

もう 하나는 Ad-LLM으로, 먼저 광고가 없는 깨끗한 답변을 생성한 다음 관련 광고를 선택하고, 의미 흐름에 따라 삽입 지점을 식별하여 출력을 매끄럽게 통합합니다.

Ad-Chat과 Ad-LLM 방법의 비교입니다. Ad-Chat은 시스템 프롬프트를 통해 광고를 삽입하며, 제한된 삽입 제어가 가능합니다. Ad-LLM은 응답 생성과 광고 삽입을 분리하며, 의미 흐름에 따라 삽입 지점을 선택하고 결과를 정련합니다.

Ad-Chat과 Ad-LLM 방법의 비교입니다.

Data

AIR 생성을 위해 두 가지 유형의 데이터셋이 생성되었습니다. 하나는 사용자 쿼리 세트(User)이고, 다른 하나는 광고 데이터베이스(AdDB)입니다.

사용자 쿼리는 LLM의 응답에서 광고 기회를 정의하므로, ‘광고 재고’는 이러한 응답에서 존재합니다.

광고는 응답에서만 나타날 수 있지만, 사용자 요청은 광고 제공 프로세스를 수용하기 위해 비밀리에 보강될 수 있습니다.

챗봇 시나리오를 위해, 저자들은 두 개의 쿼리 데이터셋을 구성했습니다. 하나는 MT-Human이고, 다른 하나는 LM-Market입니다.

MT-Human은 LLM을 위한 다중 회기 벤치마크인 MT-Bench의 인문학 부분에서 가져왔으며, 광고 콘텐츠를 수용할 수 있는 질문을 포함합니다.

LM-Market는 ChatGPT 쿼리 50만 개 이상을 수집하여 마케팅 관련 영어 프롬프트를 필터링하고, 의미 임베딩을 사용하여 주제별로 클러스터링했습니다.

쿼리는 자동 클러스터링, LLM 스코어링, 인간 검증을 통해 선택되었습니다.

광고 삽입 응답의 품질을 평가하기 위해, GEM은 사용자 만족도와 참여도를 평가하는 측정 온톨로지를 정의합니다.

이 온톨로지는 응답 흐름, 일관성, 클릭률을 포함하는 정량적 지표와 신뢰성, 정확성, 자연스러움을 포함하는 질적 표준을 포함합니다.

Tests

벤치마크는 세 가지 핵심 질문에 답하려고 합니다. 각 방법의 효과는 만족도와 참여도 지표에서 어떻게 나타나는지, Ad-LLM의 내부 설계 선택이 결과에 어떻게 영향을 미치는지, 그리고 계산 비용은 어떻게 비교되는지입니다.

저자들은 Ad-Chat과 Ad-LLM의 세 가지 변형을 평가했습니다.

모든 방법은 Doubao-1-5-lite-32k를 기본 모델로 사용하고, GPT-4.1-mini로 평가되었습니다.

Ad-Chat과 Ad-LLM 변형의 효과는 MT-Human, LM-Market, CA-Prod 데이터셋에서 평가되었습니다.

Ad-Chat과 Ad-LLM 변형의 효과는 MT-Human, LM-Market, CA-Prod 데이터셋에서 평가되었습니다.

세 가지 데이터셋 모두에서 Ad-LLM은 만족도와 참여도 지표에서 Ad-Chat보다 더 나은 결과를 보였습니다.

저자들은 이러한 결과가 Ad-LLM이 더 나은 응답 품질을 제공함을 보여준다고 주장합니다.

Conclusion

LLM이 광고를 포함할 수 있는 방법에 대한 연구는 아직 초기 단계입니다. 이 논문은 이러한 분야에서 흥미로운 연구입니다.

광고 판매 부서나 인벤토리를 판매하는 사람들은 광고주가 항상 더 많은 것을 원하며, 이상적으로는 광고를 사실 콘텐츠로 표시하고 싶어합니다.

따라서 두 논문에서 제시된 광고가 포함된 코드가 얼마나 효과적으로 삽입될 수 있는지 interessant할 것입니다.

 

최초로 게시된 날짜는 2025년 9월 18일입니다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: [email protected]