Anderson의 관점

새로운 연구,真正로 ‘개인화된’ 광고 제안

mm
Unite.AI를 Google의 선호 소스에 추가
A woman looks at a laptop displaying a news website, reacting with surprise as a banner advertisement on the page shows a smiling woman who closely resembles her.

사용자의 과거 클릭 기록을 분석해 개인별 웹 광고를 만드는 새로운 방법이 제안됐다. 기존의 집단별 타기팅을 넘어, 한 사람의 실제 관심사에 맞춘 이미지와 문구를 생성한다.

광고업계는 집 안에서 나눈 말을 엿듣고 곧바로 관련 광고를 보여 준다는 주장을 부인하지만, 웹사이트와 소셜 미디어 광고의 정교한 개인화는 오랫동안 논란을 불러왔다. 광고주에게 이상적인 광고는 보는 사람의 관심사에 정확히 들어맞는 광고다. 온라인 추적에 대한 반발과 이용자의 추적 차단 수단을 감안하더라도, 생성형 AI는 광고 이미지와 문구를 거의 실시간으로 만들 수 있다. 다만 대규모 언어 모델 광고와 검색 이후의 광고 환경에 대한 별도 우려는 남아 있다.

지금까지 이 분야의 연구와 실제 도입은 주로 집계된 이용 통계에 의존했다. 따라서 광고는 한 사용자의 고유한 이력보다, 그가 속할 것으로 추정되는 집단에 맞춰졌다. 중국과 미국의 공동 연구진은 로그인한 이용자의 과거 클릭을 학습해 개별 이용자용 광고 이미지와 문구를 만드는 체계를 제안했다.

이용자별로 생성한 광고 이미지의 예시. 각 이용자의 클릭 이력을 모르면 개인화의 효과 전체를 이 그림만으로 판단할 수는 없다.

이용자별로 생성한 광고 이미지의 예시. 각 이용자의 클릭 이력을 모르면 개인화의 효과 전체를 이 그림만으로 판단할 수는 없다. 출처

이 접근법은 시각적 잡음에서 이미지를 점차 형성하는 확산 모델 대신, 이전에 생성한 요소를 바탕으로 다음 요소를 예측하는 자기회귀 모델을 사용한다. 연구진은 이를 위해 대규모 개인화 광고 이미지·텍스트 데이터셋과 전용 평가 지표를 만들었으며, 실험에서 일반적인 비교 모델과 기존 개인화 광고 방식보다 높은 성능을 보고했다.

폐쇄형 생태계

제안된 체계는 광고주가 제3자 추적을 막는 새로운 보호 조치를 우회하도록 만드는 기술이 아니다. 충분한 이용자 규모와 클릭 이력을 가진 소매업체가 로그인한 고객에게 그 사람의 이력과 직접 관련된 광고를 만들 수 있게 한다.

광고가 반드시 해당 소매업체 사이트에만 표시되는 것은 아니다. 이용자가 다른 사이트에서도 자신을 추적할 권한을 업체에 얼마나 허용했는지에 따라, 업체가 참여하는 광고 경매를 통해 다른 웹사이트에도 맞춤 광고가 노출될 수 있다. 이런 범위는 서구권의 아마존처럼 규모가 매우 큰 사업자에게 주로 가능하지만, 비슷한 규모의 소셜 미디어 플랫폼도 원칙적으로 유사한 시스템을 구축할 수 있다.

논문 제목은 Design Your Ad: Personalized Advertising Image and Text Generation with Unified Autoregressive Models다. 중국 중산대학교와 미국 노스이스턴대학교, 중국 소매업체 JD.com의 연구자 18명이 참여했다. JD.com은 고객의 쇼핑 습관과 클릭 이력에 접근할 수 있는 데이터 제공자다. 연구진은 코드와 모델 체크포인트도 공개했다.

데이터와 방법

연구진이 만든 데이터셋은 Personalized Advertising image-text(PAd1M)로, JD.com이 제공한 자료를 바탕으로 한다. 제품마다 보통 후보 이미지와 문구가 10개 넘게 있어 선호도의 차이를 포착할 수 있다고 연구진은 설명한다. 이용자의 이미지·텍스트 클릭 이력을 수집하되 활동이 너무 적은 이용자는 제외해 잡음을 줄였다. 그 결과 이용자 1,145,371명과 클릭한 제품 이미지·문구 18,923,555건을 확보했으며, 이용자당 평균 기록은 16건을 넘었다.

각 이용자가 과거에 클릭한 이미지·문구 쌍 가운데 하나를 생성 목표로 선택하고, Grounded SAM으로 사진에서 제품을 분리했다. 여기에 판매자가 제공한 제품 설명과 판매 포인트를 연결했다. 따라서 각 목표 광고에는 배경이 제거된 제품 이미지, 구조화된 제품 정보, 이용자의 이전 이미지·텍스트 반응 이력이 함께 제공된다.

PAd1M 데이터셋의 이용자 예시. 목표 광고, 제품 정보, 선호도 분석에 사용한 과거 이미지·문구 상호작용을 함께 보여 준다.

PAd1M 데이터셋의 이용자 예시. 목표 광고, 제품 정보, 선호도 분석에 사용한 과거 이미지·문구 상호작용을 함께 보여 준다.

연구진에 따르면 PAd1M은 이용자 100만 명 이상과 클릭 기록 약 1,900만 건으로 이전의 개인화 데이터셋보다 훨씬 크다. 이미지와 문구를 함께 담아 한 가지 형식에 갇히지 않고 선호도를 모델링할 수 있으며, 집단의 평균 클릭률에 의존하던 기존 광고 데이터와 달리 상호작용을 JD.com의 개별 이용자와 연결한다.

연구진은 문구 평가에 통상적인 BLEU와 ROUGE를 사용했다. 이미지에는 Product Background Similarity(PBS)라는 새 지표를 개발했다. MoCo-v3를 바탕으로, 같은 제품이 서로 다른 배경에 놓인 이미지 쌍 681,123개를 학습시켜 제품 자체보다 배경 맥락의 차이에 민감하도록 했다.

제품 배경 유사도(PBS) 지표의 예시. 같은 제품이라도 배경 맥락이 달라지면 PBS는 비교 지표보다 유사도 차이를 더 뚜렷하게 구분한다.

제품 배경 유사도(PBS) 지표의 예시. 같은 제품이라도 배경 맥락이 달라지면 PBS는 비교 지표보다 유사도 차이를 더 뚜렷하게 구분한다.

학습할 때 동일한 이미지는 양성 예제로, 같은 제품을 다른 환경에 놓은 이미지는 음성 예제로 삼았다. 논문에 따르면 PBS는 배경이 일치하는 광고와 일치하지 않는 광고 사이의 유사도 차이를 CLIP, DINO v3, MoCo-v3보다 더 크게 구분했다.

연구진의 Unified Advertisement Generative(Uni-AdGen) 모델은 자기회귀 방식의 시각·언어 구조에서 광고 문구와 이미지를 함께 만든다. 작업 정의, 제품 설명, 주요 판매 포인트를 담은 구조화된 지시문이 생성 과정을 이끈다.

제품 설명과 이용자 선호도를 입력받아 광고 문구와 이미지를 하나의 자기회귀 모델에서 만드는 Uni-AdGen의 처리 과정.

제품 설명과 이용자 선호도를 입력받아 광고 문구와 이미지를 하나의 자기회귀 모델에서 만드는 Uni-AdGen의 처리 과정.

특수 구분 토큰이 광고 문구의 범위를 정한다. 문구 생성이 끝나면 전용 이미지 토큰이 이미지 생성을 시작하고 종료 토큰이 끝을 표시한다. 생성된 토큰은 각각 텍스트와 이미지 디코더로 전달된다. 이미지에는 LlamaGen의 VQ-GAN 디코더를 사용해 이산 토큰을 화소로 되돌린다. 즉, 별도 파이프라인 두 개를 이어 붙이는 대신 하나의 다음 토큰 예측 체계에서 문구와 이미지를 생성한다.

학습 중 모델은 입력과 앞서 생성한 문구로 다음 텍스트 토큰을 예측하고, 이어서 입력·생성 문구·이전 이미지 토큰을 이용해 이미지 토큰을 예측한다. 광고가 실제 제품과 맞도록 DINO v2 기반의 전경 인식 모듈이 배경을 제거한 제품 이미지의 정보를 모델에 주입한다. 판매자의 설명과 판매 포인트를 더 잘 따르도록 제품별 지시문으로 지시 미세조정도 했으며, 부적합한 학습 예제를 걸러내는 데 GPT-4o를 사용했다.

개인화에는 거친 선별에서 세밀한 분석으로 이어지는 선호도 이해 모듈을 사용했다. 먼저 Product Similarity Sampling(PSS)으로 과거 상호작용 가운데 목표 제품과 비슷한 항목을 우선 선택한다. 그다음 Multimodal Preference Extraction 단계에서 이용자의 관심사를 드러내는 시각·문구 요소를 추출해 프롬프트에 넣고 결과 생성을 안내한다.

실험

연구진은 실험 설계가 DeepSeek의 Janus-Pro 7B에서 유래했다고 설명한다. 배치 크기 4, AdamW 최적화 방식, 학습률 5e-5로 모델을 학습했다. 기본 모델에는 LoRA 미세조정을 적용하고, 전경 인식과 멀티모달 선호도 추출 모듈은 가중치 전체를 미세조정했다. 모든 실험은 192GB VRAM을 갖춘 NVIDIA B200 GPU에서 실행했다.

이미지의 시각적 품질은 PickScore, ImageReward, ASE로 측정했다. 광고 문구에는 m-BLEU와 m-ROUGE를 적용했다. 사람 평가자도 이미지의 사실성과 배치, 문구의 정확성과 유창성을 평가했다. 모든 지표는 제품 500개를 대상으로 계산했다.

일반 광고 이미지 생성의 비교 대상은 제품 이미지에서 배경 프롬프트를 만드는 Qwen2.5-VL과 GPT-4o, 최종 광고를 만드는 ReliableAd, PosterMaker, Flux-Fill이었다. 문구 생성에서는 Qwen2.5, Qwen3, DeepSeek-R1과 비교했다.

일반 광고 생성 벤치마크 결과. Uni-AdGen은 이미지의 미적 품질과 PickScore에서 강한 비교 모델과 비슷하거나 앞섰고, 통합 모델의 광고 문구는 가장 높은 m-ROUGE 점수를 기록했다.

일반 광고 생성 벤치마크 결과. Uni-AdGen은 이미지의 미적 품질과 PickScore에서 강한 비교 모델과 비슷하거나 앞섰고, 통합 모델의 광고 문구는 가장 높은 m-ROUGE 점수를 기록했다.

일반 광고 생성 실험에서 Uni-AdGen은 ImageReward에서 최고 점수를 얻었고 PickScore와 사람 평가에서는 2위를 기록했다. 연구진은 ReliableAd가 사람 평가에서 앞섰지만 미적 품질 지표에서는 뒤졌으며, PosterMaker와 Flux-Fill은 보기 좋은 이미지를 만들었어도 실제 사용성에 한계가 있었다고 설명한다. 이들은 자사 방식이 시각적 품질과 실용성의 균형을 잡았다고 평가했다.

개인화 광고 생성은 상호작용 이력이 있는 이용자 500명으로 따로 평가했다. 이미지에는 PBS를, 문구에는 BLEU와 ROUGE를 사용해 이용자가 실제 클릭했던 제품 광고와 비교했다. 앞선 실험의 일반 광고 모델은 이용자 이력을 받아들이지 못하므로, 이미지 개인화에는 Flux-Kontext와 Pigeon을 비교 대상으로 삼았다. Flux-Kontext에는 과거에 이용자가 클릭한 이미지들을 격자로 묶어 목표 제품 이미지와 함께 제공했다. Pigeon에는 제품을 일관되게 배치하도록 Uni-AdGen의 전경 인식 모듈을 결합했다. 문구 비교에는 Qwen3와 DeepSeek-R1을 사용하고 과거 제품 설명을 프롬프트에 넣어 이용자별 맥락을 제공했다.

개인화 광고 생성 결과. Uni-AdGen은 보고된 개인화 지표 모두에서 Flux-Kontext, Pigeon, Qwen3, DeepSeek-R1보다 앞섰다. 이용자 이력과 PSS, 멀티모달 선호도 추출의 기여도도 확인됐다.

개인화 광고 생성 결과. Uni-AdGen은 보고된 개인화 지표 모두에서 Flux-Kontext, Pigeon, Qwen3, DeepSeek-R1보다 앞섰다. 이용자 이력과 PSS, 멀티모달 선호도 추출의 기여도도 확인됐다.

보고된 개인화 지표 모두에서 Uni-AdGen은 Flux-Kontext, Pigeon, Qwen3, DeepSeek-R1보다 높은 성능을 보였다. 구성 요소를 하나씩 제거한 실험에서는 이용자 이력, Product Similarity Sampling, 멀티모달 선호도 추출이 각각 성능 개선에 기여하는 것으로 나타났다.

개인화 광고 예시. Uni-AdGen은 이용자가 실제 클릭한 광고의 시각적 스타일과 맥락에 더 가깝게 이미지를 만들고, 실제 예시에 있던 제품 특징과 판매 포인트를 더 많이 담은 문구를 생성했다. 일치하는 용어는 녹색으로 표시했다.

개인화 광고 예시. Uni-AdGen은 이용자가 실제 클릭한 광고의 시각적 스타일과 맥락에 더 가깝게 이미지를 만들고, 실제 예시에 있던 제품 특징과 판매 포인트를 더 많이 담은 문구를 생성했다. 일치하는 용어는 녹색으로 표시했다.

정성적 예시에 대해 연구진은 Flux-Kontext와 Pigeon의 결과가 이용자가 과거 클릭한 광고의 시각적 특성과 자주 어긋났고, Qwen3와 DeepSeek-R1의 문구에는 실제 광고에 있던 판매 포인트가 일부 빠졌다고 설명한다. 오토바이 이미지에 관련 없는 물건이 들어간 사례처럼 개별 예제의 잡음도 비교 모델에 영향을 줬다.

결론

이 기술의 효용은 이용자가 자신의 이력 활용에 동의하는지에 전적으로 달려 있다. 이 사례의 JD.com처럼 이력을 보유한 서비스의 범위 밖으로 광고 시스템을 확장하려면, 많은 지역에서 훨씬 폭넓고 명시적인 이용자 허락이 필요할 것이다.

동시에 이 체계는 초대형 플랫폼의 네트워크 효과를 전제로 한다. 소매업체의 폐쇄형 생태계 안에서라도 이용자가 이렇게까지 개별화되고 앞서 예측하는 추천을 불편한 감시보다 유용한 서비스로 받아들일지는 아직 확실하지 않다.

그림 주: 논문의 일부 그림은 원래 여러 개로 나뉘었을 내용을 하나로 합쳐 놓아, 캡션만으로 각 부분을 이해하기 어렵다. 본문의 이미지 설명은 이를 보완한다.

지표 주: m-BLEU와 m-ROUGE의 ‘m’은 여러 후보 문구와 비교한다는 뜻이다.

2026년 6월 2일 처음 게시.

머신러닝 분야 작가이자 인간 이미지 합성 도메인 전문가. Metaphysic.ai에서 연구 콘텐츠 책임자를 역임했으며, DNEG의 Brahma.ai로 통합될 때까지 근무했습니다.
웹사이트: martinanderson.ai
연락처: martin@martinanderson.ai