Anderson의 관점

대형 언어 모델에서 광고를 준비하기

mm
Unite.AI를 Google의 선호 소스에 추가
Source: ChatGPT-4o and https://commons.wikimedia.org/wiki/File:Microsoft_Surface_Laptop_7.jpg

새로운 연구에 따르면 광고가 곧 ChatGPT 스타일 답변에 직접 삽입될 수 있으며, 배너나 팝업이 아니라 응답 자체에 얽혀 들어간다고 합니다. 새로운 벤치마크는 이러한 광고 삽입 응답이 얼마나 유용하고 신뢰할 수 있으며 수익성을 유지할 수 있는지를 테스트하며, 허용 가능한 사용자 경험과 클릭률 사이의 균형을 필요로 할 수 있습니다.

 

대형 언어 모델의 광범위하고 성장하는 인기가 전통적인 광고 방식을 약화시킵니다 거의 인터넷 초창기부터 인터넷을 견인해 온 전통적인 광고 방식을 약화시키면서, 벤처 캐피털리스트들의 시장 장악 전략에 익숙한 사람들은 AI 챗봇이 언제까지 응답에 광고 콘텐츠를 포함하는 것을 자제할 수 있을지 궁금해 할 것입니다.

Netflix와 늘어나는 스트리밍 서비스들이 보여주듯이, 유료 구독과 삽입 광고를 결합하는 전통적인 케이블 시대 전략(소비자 비용을 낮추는 방법으로 정당화되곤 함)이 다시 활기를 찾고 있으며; 광고를 LLM 출력에 직접 포함하는 방향으로의 전환이 덜 투기적인 것으로 보이기 시작하고, 그 모델을 자연스럽게 받아들이는 모습과 더 닮아가고 있습니다.

‘Online Advertisements with LLMs: Opportunities and Challenges’ 논문에서, LLM이 수익화를 할 때 대부분 사람들이 기대하는 전환의 상당히 대표적인 예시. Source: https://www.sigecom.org/exchanges/volume_22/2/FEIZI.pdf

‘Online Advertisements with LLMs: Opportunities and Challenges’ 논문에서, LLM이 수익화를 할 때 대부분 사람들이 기대하는 전환의 상당히 대표적인 예시. Source: https://www.sigecom.org/exchanges/volume_22/2/FEIZI.pdf

이미 신뢰성에 대한 눈에 띄는 문제가 있는 신흥 매체에 광고를 포함하는 전망은 성급하게 보일 수 있지만, 지난 12개월간 생성 AI에 대한 투자 규모는 시장이 현재 신중하거나 조심스러운 태도로 정의되지 않음을 시사합니다; 그리고 OpenAI와 같은 대형 기업들이 과도하게 레버리지를 사용하고 대규모 투자의 조기 회수를 필요로한다는 점에서, 광고 없는 출력의 초기 호황기가 사라지고 있음을 역사는 보여줍니다.

GEM-Bench

이러한 분위기와 비즈니스 과제를 염두에 두고, 싱가포르에서 나온 흥미로운 새로운 논문이 AI 챗봇 인터페이스를 목표로 하는 최초의 벤치마크를 제공하며, 100년 동안 가장 폭발적인 광고 분야가 될 가능성이 있는 새로운 정량화 지표들을 제시합니다.

아마도 낙관적으로, 저자들은 ‘진짜’ 콘텐츠와 광고 콘텐츠 사이에 명확한 구분이 있다고 가정하며, 표준 응답에서 마케팅 카피로의 ‘전환’을 매우 쉽게 식별할 수 있다고 주장합니다:

새 논문에서 연구된 두 모델 하에서 발생할 수 있는 광고 통합 유형의 예시. Source: https://arxiv.org/pdf/2509.14221

새 논문에서 연구된 두 모델 하에서 발생할 수 있는 광고 통합 유형의 예시. Source: https://arxiv.org/pdf/2509.14221

광고주들이 논문에 제시된 예시보다 더 미묘하게 광고 콘텐츠를 출력에 녹여내려는 경향을 보일지는 아직 확인이 필요합니다.

하지만 이는 나중에 다룰 문제이며, 현재는 분야가 아직 매우 초기 단계라 기본 용어조차 부족하거나 확정되지 않았습니다.

따라서 논문은 LLM 기반 챗봇을 수익화하기 위한 새로운 프레임워크로 Generative Engine Marketing (GEM)을 도입하며, 관련 광고를 생성된 응답에 직접 삽입합니다.

연구자들은 Ad-Injected Response (AIR) 생성이 GEM의 핵심 과제라고 규정하고, 기존 벤치마크가 이를 연구하기에 부적합하다고 주장합니다. 이 격차를 메우기 위해, 이 목적에 특화된 최초의 벤치마크라고 주장하는 것을 소개합니다.

GEM-Bench는 챗봇 및 검색 엔진 시나리오를 포괄하는 세 개의 선별된 데이터셋으로 구성됩니다. 또한 사용자 만족도와 참여도의 다양한 측면을 평가하도록 설계된 메트릭 온톨로지를 포함하며, 모듈식 다중 에이전트 프레임워크 내에 구현된 일련의 기본 방법들을 제공합니다.

저자들은 간단한 프롬프트 기반 방법이 클릭률(CTR) 상승과 같은 괜찮은 참여 지표를 달성할 수 있지만, 사용자 만족도를 저하시킬 경향이 있다고 주장합니다. 반면, 사전에 생성된 광고 없는 응답에 광고를 삽입하는 접근법은 신뢰도와 응답 품질을 향상시키지만, 그만큼 계산 비용이 증가합니다.

논문은 이러한 트레이드오프가 생성 출력에 광고를 통합하기 위한 보다 효과적이고 효율적인 기술의 필요성을 강조한다고 주장합니다.

새 연구는 GEM-Bench: Generative Engine Marketing 내 광고 삽입 응답 생성 벤치마크라는 제목이며, 싱가포르 국립대학의 네 명 연구자가 발표했습니다.

방법

Generative Engine Marketing(GEM)의 개요는 Search Engine Marketing(SEM)의 기본 원칙을 차용합니다. 전통적인 SEM은 광고주가 키워드에 입찰하는 다단계 파이프라인을 통해 쿼리를 광고와 매칭하고, 시스템은 어떤 쿼리가 광고를 트리거하는지 식별하며, 각 광고가 클릭될 가능성을 추정하고, 입찰과 예측 참여도를 균형 있게 조정하는 경매를 통해 배치를 할당합니다.

대조적으로 GEM 접근법은 동일한 단계를 LLM에 적용하지만 각 단계마다 새로운 과제에 직면합니다. 고정된 광고 슬롯이 없기 때문에 시스템은 쿼리가 광고를 수용할 수 있는지와 자유 형식 텍스트에 어디에 삽입할지를 결정해야 합니다; 구조화된 레이아웃이 없으므로 클릭률을 추정하기가 더 어려워지고; 광고가 독립적인 카피가 아니라 모델 자체 출력에 직접 삽입되므로 관련성을 사용자 만족도와 균형 잡아야 합니다.

연구에서 조사된 기준선 중 하나인 Ad-Chat은 모델이 응답을 생성하기 전에 시스템 프롬프트에 광고 내용을 삽입하는 간단한 방법을 의미합니다. 이는 모델이 미리 로드된 의제에 따라 광고가 이미 포함된 답변을 생성한다는 뜻입니다.

다른 접근법인 Ad-LLM은 저자들이 새로운 벤치마크의 일환으로 개발했습니다. Ad-LLM은 모듈식 절차를 따르며, 먼저 깨끗하고 광고가 없는 답변을 생성하고; 관련 광고를 선택하고; 의미 흐름을 기반으로 최적의 삽입 지점을 식별한 뒤; 마지막으로 광고가 자연스럽게 통합되도록 출력을 재작성합니다:

Ad-Chat과 저자들의 'Ad-LLM' 방법 간의 비교. Ad-Chat은 생성 전에 시스템 프롬프트를 통해 광고를 삽입하며 배치 제어가 제한됩니다. Ad-LLM은 응답 생성과 광고 삽입을 분리하고 의미 흐름을 기반으로 삽입 지점을 선택한 뒤 결과를 다듬습니다. 두 방법 모두 만족도와 참여도를 평가하는 GEM-Bench 지표로 점수를 매깁니다.

Ad-Chat과 저자들의 ‘Ad-LLM’ 방법 간의 비교. Ad-Chat은 생성 전에 시스템 프롬프트를 통해 광고를 삽입하며 배치 제어가 제한됩니다. Ad-LLM은 응답 생성과 광고 삽입을 분리하고 의미 흐름을 기반으로 삽입 지점을 선택한 뒤 결과를 다듬습니다. 두 방법 모두 만족도와 참여도를 평가하는 GEM-Bench 지표로 점수를 매깁니다.

Ad-Chat은 비용이 저렴하고 때때로 설득력이 높지만 신뢰도와 정확성을 떨어뜨리는 경향이 있습니다. Ad-LLM은 사용자 만족도 지표에서 더 좋은 성과를 보이지만 비용이 더 많이 듭니다.

데이터

AIR 생성을 위해 처음에 두 종류의 데이터셋이 생성되었습니다: 사용자 쿼리 집합 (User)과 광고 데이터베이스 (AdDB).

사용자 쿼리가 LLM 응답에서 광고 기회를 정의하기 때문에 ‘광고 인벤토리’는 이러한 응답에 존재한다고 볼 수 있습니다. 이는 단순히 사용자의 쿼리 적용 가능성뿐만 아니라 시스템이 광고주의 요구와 무결성 사이의 균형을 맞추는 자체 규칙을 얼마나 따르는가에 따라 결정됩니다.

어쨌든 광고는 응답에만 나타나며, (위 스키마 참조) 사용자 요청이 광고 제공 과정을 수용하도록 비밀리에 보강되더라도 마찬가지입니다.

챗봇 시나리오를 위해 저자들은 두 개의 쿼리 데이터셋을 구성했습니다: MT-Human와 LM-Market.

MT-Human은 LLM을 위한 다중 턴 벤치마크인 MT-Bench의 인문학 부문에서 추출되었으며, 광고 내용을 수용할 가능성이 높은 질문들을 포함합니다.

LM-Market는 LMSYS-Chat-1M이 수집한 50만 건이 넘는 실제 ChatGPT 쿼리를 기반으로 구축되었으며, 영어 마케팅 관련 프롬프트로 필터링하고 semantic embeddings를 사용해 주제별로 클러스터링했습니다.

두 경우 모두 최종 쿼리는 자동 clustering, LLM 점수화, 인간 검증을 결합한 다단계 파이프라인을 통해 선택되었으며, 광고 삽입이 자연스럽고 타당할 프롬프트를 식별하는 것이 목표였습니다.

광고가 삽입된 응답의 품질을 평가하기 위해 GEM은 사용자 만족도와 참여도를 모두 포괄하는 측정 온톨로지를 정의합니다. 여기에는 response flow, coherence, click-through rate와 같은 정량적 지표와 trust, accuracy, naturalness와 같은 정성적 기준이 포함됩니다—이 지표들은 광고가 응답에 얼마나 잘 맞는지와 사용자가 이를 인식하고 상호작용할 가능성을 모두 반영하도록 설계되었습니다.

‘Naturalness’에 관해 논문은 다음과 같이 말합니다:

‘[Naturalness]는 광고 삽입이 대화의 흐름과 자연스러움을 방해하는 정도를 중단성 및 진정성에 기반해 측정합니다. 중단성은 광고가 읽는 동안 “점프 아웃”이나 “갑작스러운” 느낌을 만들어 사용자의 주제에 대한 지속적인 집중을 깨는지를 검토합니다.

‘Authenticity는 광고가 대화의 “인간적 감각”이나 “자연스러운 흐름”을 약화시켜 응답을 경직되고 형식적이며 덜 진정성 있게 만드는지를 평가합니다.’

테스트 단계에서 전통적인 검색 엔진 시나리오를 생성하기 위해, 저자들은 CA-Prod라는 데이터셋을 AdsCVLR 상업 코퍼스에서 만들었으며, 이 코퍼스는 300,000개의 쿼리-광고 쌍을 포함하고 각각 키워드, 메타데이터, 그리고 관련성을 표시하는 수동 라벨을 가지고 있습니다:

원본 논문에서 발췌한 AdsCVLR 데이터셋의 예시로, 저자들의 테스트에 필요한 자료를 제공했습니다. 출처: http://www.jdl.link/doc/2011/20221224_AdsCVLR.pdf

원본 논문에서 발췌한 AdsCVLR 데이터셋의 예시로, 저자들의 테스트에 필요한 자료를 제공했습니다. 출처: http://www.jdl.link/doc/2011/20221224_AdsCVLR.pdf

필드가 누락된 레코드는 제거했으며, 긍정 광고와 부정 광고가 모두 포함된 쿼리(위 이미지 예시 참조)만을 남겼습니다.

데이터를 정제하기 위해 광고를 여섯 개의 주제 그룹(정원 및 가드닝 장비, 슬립온 신발, 가정용품, 영양 보충제, 안드로이드 기기, 및 여성용 드레스)으로 의미 임베딩과 K-평균 클러스터링을 사용해 군집화했습니다.

그 후 쿼리는 긍정 광고에 따라 주제에 할당되었으며, 지나치게 희소하거나 밀집된 집합은 제외하고 최종적으로 벤치마크를 위해 120개의 쿼리와 2,215개의 고유 제품을 샘플링했습니다.

테스트

다양한 광고 삽입 전략의 성능을 평가하기 위해, 벤치마크는 세 가지 핵심 질문을 다루었습니다: 정의된 만족도 및 참여 지표 전반에 걸쳐 각 방법이 얼마나 효과적인가; Ad-LLM 내부 설계 선택이 결과에 어떤 영향을 미칠 수 있는가; 그리고 시스템 간 계산 비용은 어떻게 비교되는가.

저자들은 광고를 검색하는 방식(프롬프트에서 또는 생성된 응답에서)과 최종 출력이 유창성을 위해 재작성되는지 여부에 따라 차별화된 Ad-Chat과 저자들의 Ad-LLM 파이프라인 세 변형을 평가했습니다.

모든 방법은 doubao-1-5-lite-32k를 기본 모델로 사용했으며, gpt-4.1-mini로 평가했습니다.

MT-Human, LM-Market, CA-Prod 데이터셋 전반에 걸친 Ad-Chat 및 Ad-LLM 변형의 효과성. 정량적 지표에는 응답 흐름(RF), 응답 일관성(RC), 광고 흐름(AF), 광고 일관성(AC), 삽입 비율(IR), 클릭률(CTR), 전체 점수가 포함됩니다. 정성적 지표는 정확성, 자연스러움, 개성, 신뢰, 인지, 클릭(통과), 전반적 성능을 다룹니다.

MT-Human, LM-Market, CA-Prod 데이터셋 전반에 걸친 Ad-Chat 및 Ad-LLM 변형의 효과성. 정량적 지표에는 응답 흐름(RF), 응답 일관성(RC), 광고 흐름(AF), 광고 일관성(AC), 삽입 비율(IR), 클릭률(CTR), 전체 점수가 포함됩니다. 정성적 지표는 정확성, 자연스러움, 개성, 신뢰, 인지, 클릭(통과), 전반적 성능을 다룹니다.

세 데이터셋 모두에서 Ad-LLM은 만족도와 참여 측면에서 Ad-Chat보다 더 강력한 결과를 보였습니다. 위 결과 표에 나타난 바와 같이, 최고의 Ad-LLM 변형은 전체 정량 점수에서 Ad-Chat보다 각각 8.4%, 1.5%, 3.8% 향상했으며, MT-Human, LM-Market, CA-Prod에 대한 정성 점수에서는 각각 10.7%, 10.4%, 8.6% 상승했습니다.

이러한 결과에 대해 저자들은 다음과 같이 말합니다:

‘이 결과는 원시 응답을 생성한 뒤 광고를 삽입하는 것이 시스템 프롬프트 삽입만을 사용하는 단순한 접근 방식보다 더 나은 응답 품질을 제공한다는 것을 보여줍니다.’

‘특정 사용자 만족도 및 참여 차원에서, Ad-Chat은 세 데이터셋 모두에서 Ad-LLM 솔루션에 비해 상당한 성능 격차를 지속적으로 보이며, 특히 정확성, 개성, 신뢰와 같은 차원에서 두드러집니다.’

또한 Ad-LLM은 정확성, 개성, 신뢰에서 가장 큰 향상을 보였으며, 각각 Ad-Chat보다 최대 17.6%, 23.3%, 17.2% 높은 성과를 기록했습니다. 논문에 따르면 이러한 차이는 Ad-Chat이 시스템 프롬프트를 사용해 모델을 보다 개인화되고 홍보적인 언어로 유도하는 방식 때문이며, 이는 정확성과 신뢰를 저하시킬 수 있는 ‘판매원 같은’ 어조를 초래할 수 있다고 저자들은 주장합니다.

Ad-Chat은 광고 적합성에 맞춰 선택된 쿼리에서도 낮은 삽입 비율을 보였으며, 이는 프롬프트 기반 신호에 의존하는 것이 제어하기 어렵다는 저자들의 해석과 일치합니다.

검색 엔진 환경에서는 Ad-Chat이 클릭률을 8.6% 더 높게 달성했으며, 이는 논문에서 LLM을 사용해 제품 후보를 검색하는 것이 의미 임베딩만을 활용하는 것보다 이점을 제공할 수 있음을 시사합니다:

Ad-Chat 및 세 Ad-LLM 변형(GI-R, GIR-R, GIR-P)의 전체 성능 점수를 네 가지 평가 모델(GPT-4.1-mini, Qwen-max, claude-3-5-haiku, kimi-k2)에서 비교한 결과. 평가자에 따라 점수는 차이가 있지만, Ad-LLM은 모든 조건에서 일관되게 Ad-Chat보다 우수한 성과를 보였습니다.

Ad-Chat과 세 가지 Ad-LLM 변형(GI-R, GIR-R, GIR-P)에 대한 네 가지 평가 모델(GPT-4.1-mini, Qwen-max, claude-3-5-haiku, kimi-k2)의 전체 성능 점수를 MT-Human, LM-Market, CA-Prod 데이터셋에서 비교한 결과입니다. 평가자마다 점수는 차이가 있지만, Ad-LLM은 모든 조건에서 일관되게 Ad-Chat보다 우수합니다.

위에 표시된 두 번째 결과 표는 세 개 데이터셋 모두에서 Ad-LLM 솔루션이 네 가지 평가 모델(GPT-4.1-mini, Qwen-max, Claude-3-5-haiku, Kimi-k2) 모두에 걸쳐 일관되게 Ad-Chat보다 우수함을 보여줍니다.

이 평가자들은 기본 모델 doubao-1-5-lite-32k와 차별화되도록 선택되어 모델 계열 정렬에 따른 편향을 줄이는 데 도움이 되었습니다. GIR-R은 모든 경우에서 1위 또는 2위를 차지했으며, 이는 평가자들 사이에서 Ad-LLM의 우수성에 대한 폭넓은 합의를 시사합니다. 개별 정성적 차원별 분석은 바로 앞의 결과(위에 더 표시된)와 거의 동일한 패턴을 보입니다.

마지막으로, 논문은 Ad-Chat과 Ad-LLM 모두 보다 혁신적이고 효과적인 모델보다 더 많은 자원을 필요로 하며, 이러한 거래에서 LLM 에이전트를 사용해야 하는 필요성이 상당한 오버헤드를 초래할 수 있다고 지적합니다. 일반적으로 광고 제공 시나리오에서 중요한 지연 문제는 이와 같은 LLM 사용으로 인해 발생할 수 있다고 추정되지만, 논문에서는 이에 대해 구체적으로 다루지 않았습니다.

어쨌든, 저자들이 구현한 Ad-Chat 전략(기사 시작 부분에 표시된 초기 스키마의 상단 행)은 가장 높은 클릭률을 제공했지만, 그에 상응하는 LLM 비용도 가장 높았습니다.

결론

문헌이 LLM이 광고를 수행할 수 있는 방법을 추측할 것이라는 점은 놀랍지 않지만, 실제로 공개적으로 이용 가능한 연구는 매우 적습니다; 이는 현재 논문과 우리가 합리적으로 그 전작이라고 해석할 수 있는 것이 흥미로운 소재가 됩니다.

광고 영업 부서나 재고 판매를 경험한 사람이라면 광고주가 항상 더 많은 것을 원한다는 것을 알 것입니다—이상적으로는 광고가 사실 콘텐츠로 제시되어 호스트 콘텐츠 스트림과 전혀 구분되지 않기를 원하며, 이를 위해 광고주는 상당한 프리미엄을 지불합니다(이와 동시에 호스트는 독자 및 기타 이해관계자와의 신뢰와 위상을 위험에 빠뜨리게 됩니다).

따라서 두 논문에서 구상된 광고가 풍부한 부속 조항이 LLM의 응답 상위로, 즉 ‘페이로드’에 더 가까워지도록 유인될 정도를 살펴보는 것이 흥미로울 것입니다.

 

2025년 9월 18일 목요일 최초 게시

머신러닝 분야 작가이자 인간 이미지 합성 도메인 전문가. Metaphysic.ai에서 연구 콘텐츠 책임자를 역임했으며, DNEG의 Brahma.ai로 통합될 때까지 근무했습니다.
웹사이트: martinanderson.ai
연락처: martin@martinanderson.ai