Anderson의 관점

AI 생성 광고 이미지: 대상 Dân을 위한 맞춤형 광고

mm
Unite.AI를 Google의 선호 소스에 추가
Montage of AI-generated images depicting frames from an online video aimed at three different age groups. Z-Image Turbo via Krita Diffusion AI.

광고주는 클릭을 유도하기 위해 시청자 개인에게 광고를 맞추려 한다. 아직 한 사람마다 별도의 광고 소재를 만드는 일은 비현실적이지만, 새 연구는 AI 생성 이미지를 특정 인구 집단에 효과적으로 맞출 수 있는 시대가 곧 올 수 있다고 말한다.

Steven Spielberg의 2002년 SF 영화 Minority Report는 군중 속 사람을 알아보고 이름을 부르며 메시지를 외치는 광고판을 보여줬다. 이 개인화 광고 장면은 문화적으로 오래되고 불편한 인상을 남겼다.

많은 소비자 단체는 이런 수준의 인식 기술을 악몽으로 볼 수 있다. Cambridge Analytica 스캔들의 여파로 개발 속도가 늦어졌지만, 광고 업계에는 직접적이고 정밀한 참여가 여전히 중요한 목표다.

특정 시청자의 특성까지 파고드는 시스템은 계속 개발되고 있다. 다만 기업 연구는 개인식별정보(PII) 관련 법을 지켜야 한다. 유럽은 지난 10년 동안 보호를 강화했고, Brussels Effect를 통해 비슷한 규정이 다른 지역에도 퍼졌다.

바로 당신을 위한 광고

AI 생성 광고와 마케팅 콘텐츠가 늘면서, 광고주는 이미지와 문구를 순간적으로 만들어 특정 개인에게 보여줄 때의 비용을 고려해야 한다.

개인 맞춤 이미지를 빠르게 생성할 수 있어도 대규모 비용은 상당하다. 자동 온라인 광고 경매는 밀리초 단위로 움직이므로 당장은 사용자별 이미지 생성이 어렵고, 영상 개인화는 더 먼 문제다.

하지만 노트북, 휴대전화, 스마트 TV 등 온라인 시청자를 상위 인구 집단으로 나눠 겨냥하는 기술 장벽은 훨씬 낮다. 국제 학계·산업 협력 연구는 나이와 지역 같은 요소에 따라 집단별 광고 이미지를 만드는 방식을 제안했다.

하나의 제품을 서로 다른 시청자 집단에 맞는 스타일로 생성한 사례. 윗줄은 원본 제품 이미지이고, 다음 세 줄은 나이·생활 방식·미적 선호 같은 특성이 다른 세 집단에 맞춘 버전이다. 집단 유형은 미리 정한 것이 아니라 자동으로 발견된다.출처

One Size, Many Fits(OSMF)라는 프레임워크는 넓은 대상 광고와 지나치게 세밀해 비현실적인 개인화를 연결한다. 제품을 인식하는 클러스터링으로 자동 발견된 시청자 집단마다 다른 광고 이미지를 만들고, 집단별 클릭 선호와 시각 콘텐츠를 맞춘다.

OSMF는 Product-Aware Adaptive Grouping을 통해 사용자 속성과 제품 특성에 따라 사람들을 동적으로 묶고, 각 집단을 풍부한 집단 선호 특징으로 표현한다. 저자들은 비교 프레임워크보다 최고 수준의 결과를 얻었다고 주장한다.

연구는 다양한 코호트를 찾지만 각 G 그룹이 어떤 인구통계 특성을 뜻하는지는 구체적으로 밝히지 않는다. 전통적 시장 세분화와 연결될 가능성이 크지만, 논문과 부록의 예시만으로는 왜 특정 배경이나 조명이 어느 집단에 더 매력적인지 알기 어렵다.

집단별 이미지에는 ‘남아는 파랑, 여아는 분홍’처럼 소속을 쉽게 드러내는 일관된 스타일이 없다. 기존 연구에서 보듯 실제 집단 정의는 훨씬 복잡하고 미묘하다.

타기팅 광고를 경계하는 사람에게 더 우려스러운 점은 사용자별 통찰을 활용해 광고 이미지를 개인 단위로 생성할 가능성이다.

논문 제목은 One Size, Many Fits: Aligning Diverse Group-Wise Click Preferences in Large-Scale Advertising Image Generation이며 Beijing의 National Laboratory of Pattern Recognition, ‘School of AI at UCAS’, 중국 전자상거래 기업 JINGDONG, Hong Kong University of Science and Technology at Guangzhou, Nanjing University of Science and Technology의 Pattern Recognition Lab 등에서 17명이 참여했다.

방법

시스템은 사용자의 특성이 특정 제품 환경에서 시각 선호에 미치는 방식을 이용해 자연스러운 집단을 찾는 적응형 클러스터링을 사용한다. 이 구현을 Product-Aware Adaptive Grouping(PAAG)이라고 한다. 집단은 미리 고정하지 않고 데이터의 패턴에서 발견한다.

Preference-Conditioned Image Generation(PCIG)이라는 조건부 이미지 생성기는 각 그룹의 프로필을 이용해 예상 취향에 맞는 광고를 만든다.

OSMF는 사용자 특성이 제품 선호를 만드는 방식으로 사람들을 그룹화하고, 그 프로필을 사용해 각 집단 취향에 맞는 광고 이미지를 생성한다. PAAG가 그룹화를 담당하고 PCIG가 그룹별 프롬프트와 피드백으로 이미지를 만든다.

이미지 생성기는 버전이 명시되지 않은 Stable Diffusion과 ControlNet 조합을 사용한다. ControlNet은 여러 집단용 생성물 사이에서 제품 일관성을 유지하는 역할을 한다.

PAAG는 전용 인코더와 cross-attention으로 사용자 특징과 제품의 텍스트·이미지 요소 관계를 하나의 선호 임베딩으로 결합한다. 이 임베딩은 특정 광고를 클릭할 가능성을 표현한다.

CLIP과 ResNet 기반 인코더가 제품 제목과 이미지를 처리하고, 성별·지역·나이·기기 같은 사용자 속성은 MLP를 거쳐 제품 텍스트 및 이미지 특징과 cross-attention을 수행한다.

그 결과는 특정 시각적 맥락에서 한 사용자가 제품을 클릭할 가능성을 나타낸다. PAAG는 이 사용자-제품 선호 임베딩에 K-means를 적용해 같은 제품에 비슷하게 반응하는 사용자를 묶는다.

각 제품에 가장 잘 맞는 그룹 수는 클러스터의 분리 정도로 정한다. 그룹을 평균점 하나로 표현하지 않고 중심에서 서로 다른 거리에 있는 여러 점을 표본화해 더 넓은 선호 범위를 포착한다.

이 그룹 프로필은 group-aware multimodal large language model(G-MLLM)에 토큰으로 전달된다. 사용자 쪽에서는 다음에 클릭할 가능성이 높은 집단원을 예측하고 공통 특성을 자연어로 설명한다. 제품 쪽에서는 이미지의 상품을 요약하고 상품과 집단 양쪽에 맞는 광고 문구를 만든다.

실제 행동을 반영하기 위해 모델을 group-aware reward model(GRM)로 확장했다. GRM은 연구진이 만든 Grouped Advertising Image Preference(GAIP) 데이터셋으로 학습하며, 같은 제품의 이미지 쌍을 비교해 실제 클릭률 기준으로 특정 집단에 어느 광고가 더 잘 작동했는지 판단한다.

이 보상 신호로 Group-DPO를 사용해 G-MLLM을 미세 조정하고, 집단 단위 참여를 높이는 프롬프트를 선호하도록 만든다.

GAIP 데이터셋

집단 광고 선호 자료가 부족하고 Personalized Soups나 CG4CTR 같은 기존 모음이 너무 작거나 정의가 불분명해, 연구진은 공개되지 않은 전자상거래 플랫폼의 산업 광고 로그에서 GAIP를 만들었다.

로그는 3주 동안 수집됐다. 각 항목은 제품 이미지와 제목, 나이·지출 수준·프로모션 민감도 등을 포함한 시청자 프로필, 광고 클릭 여부를 기록했다.

데이터에는 사용자 4천만 명 이상, 제품 200만 개, 광고 이미지 약 1천만 장이 포함됐고 제품마다 시각적 다양성이 컸다. PAAG가 제품별로 사용자를 구분한 뒤 집단 안에서 각 이미지의 클릭률(CTR)을 계산했다.

논문 보충 자료에 나온 GAIP 정의 기준의 일부.

GAIP의 한 항목은 광고 이미지, 제품 제목, 집단 임베딩, 집단별 CTR로 구성된다. 신뢰성을 위해 충분히 노출된 제품만 남겨 610,172개의 집단 단위 표본을 얻었다.

기존 벤치마크가 대부분 10개 미만 사용자 그룹을 다루는 데 비해 GAIP는 현실의 집단 선호 기록 약 60만 건을 담는다.

시험

PCIG 학습에서는 ResNet과 CLIP 텍스트 인코더로 이미지·문자 특징을 추출하고 학습 가능한 선형층으로 128차원 임베딩에 매핑했다. 효율을 위해 제품당 사용자 그룹은 최대 다섯 개로 제한했다.

집단 임베딩은 15·55·95백분위에서 여러 점을 뽑는 표본화로 구성해 중심 선호와 주변 선호를 모두 담았다.

G-MLLM의 기반은 LLaVA였다. 학습률 2×10-6의 cosine schedule로 10에포크 사전 학습했으며, VRAM 80GB NVIDIA H100 GPU 8대에서 5일이 걸렸다.

GRM은 GAIP에서 제품 이미지 쌍을 맞춰 다시 구성한 자료로 학습했고 G-MLLM과 같은 가중치로 초기화했다. 최종 Group-DPO 단계에서는 GRM을 고정하고 같은 GPU 클러스터에서 학습률 2×10-5, 3에포크로 LoRA 미세 조정했다.

첫 평가 지표는 NDCG@5와 AUROC였다. NDCG@5는 각 집단이 같은 광고 이미지 세트를 얼마나 다르게 순위화하는지 측정하며, 낮을수록 선호가 뚜렷하게 분리된다. AUROC는 클릭 콘텐츠와 비클릭 콘텐츠를 구별하는 능력을 평가한다.

제품 1천 개, 표본 약 10만 건의 클러스터링 결과를 대상으로 PAAG를 CACS, WIYD, JAC와 비교했다.

기존 방법과의 선호 모델링 비교. 낮은 NDCG@5와 높은 AUROC가 더 좋다. 최고 결과는 굵게, 두 번째는 밑줄로 표시됐다.

PAAG는 두 지표에서 모두 가장 좋은 성능을 냈다. NDCG@5는 0.3066으로 최강 기준 CACS보다 낮아 집단 간 선호 패턴이 더 분명했다. AUROC는 0.6372로 가장 높았고 최강 기준 WIYD보다 0.0159 향상됐다.

두 번째 시험은 시스템이 올바른 사용자 집단에 광고를 더 잘 맞추는지 평가했다.

온라인 CTR 비교. 집단 개인화 생성 방식인 ‘Ours’가 CAIG와 사전 학습 G-MLLM을 포함한 모든 기준을 능가했다.

PCIG는 CAIG와 G-MLLM보다 클릭률이 높아 5.5% 개선됐다. GRM이 그룹 선호에 따라 이미지 쌍 중 더 좋은 광고를 고르는 오프라인 시험에서도 모든 기준을 이겼고 CAIG보다 4.7% 향상됐다.

마지막 정성 시험은 PCIG 생성 스타일에 집단 선호가 반영되는지 살폈다. 같은 제품을 그룹마다 다른 팔레트, 분위기, 시각 구도로 렌더링했다.

기사 앞부분에서 일부를 본 정성 시험의 전체 결과.

저자들은 이런 차이가 각 집단에서 추론한 클릭 선호와 맞았으며, PCIG가 제품의 관련성과 매력을 유지하면서도 스타일이 다른 결과를 만들었다고 설명한다. 즉 서로 다른 사용자 수요의 미세한 차이에 맞춰 대규모 집단 인식 광고 이미지를 생성할 수 있다는 주장이다.

결론

가장 흥미로운 지점은 같은 제품을 각 그룹에 맞춰 만든 이미지 스타일과 실제 집단 특성 사이의 알려지지 않은 상관관계다. 도시 배경은 사회생활을 시작한 젊은 층을, 시골길은 탁 트인 도로를 자유로 보는 경제력 있는 Gen X를 뜻한다고 가정할 수 있을까. 결과를 보며 끝없이 심리 투사식 해석을 할 수 있다.

이런 시스템의 가능성은 통찰과 지연시간에 달렸다. 통찰은 추적 기술이 사용자에게서 집단 광고에 충분한 정보를 계속 뽑아낼 수 있는지, 동시에 장래의 개인 단위 광고 기반까지 마련할 수 있는지에 달려 있다.

지연시간은 더 어렵다. 맞춤 이미지를 거의 즉시 만들고 전달해야 하며, 최신 텍스트-이미지 모델의 몇 초도 실시간 광고 경매에는 너무 길 수 있다.

브라우저 GPU에서 로컬 생성해 네트워크 왕복을 피하거나, 많은 이미지를 미리 만들고 클라이언트에 캐시하는 방법이 대안이 될 수 있다.

** 논문은 개인별 이미지 악용 가능성을 직접 다루지 않는다. 새 AI 연구가 딥페이크 위험을 귀여운 동물 사례로 순화하는 것과 비슷하다. 제시된 이미지는 광고주가 가장 모범적으로 행동한 모습이며, 빠른 생성형 AI와 소비자 타기팅이 결합했을 때 시각 광고가 얼마나 개인적으로 변할 수 있는지는 보여주지 않는다.

** ‘UCAS’라는 기관은 확인하지 못했다. 일반적으로 이 약어는 영국 대학 입학 지원 기관을 가리키므로 추가 설명이 필요하다.

† 연구진은 관련 GitHub 저장소에 데이터를 공개하겠다고 약속했다.

2026년 2월 5일 최초 게재.

머신러닝 분야 작가이자 인간 이미지 합성 도메인 전문가. Metaphysic.ai에서 연구 콘텐츠 책임자를 역임했으며, DNEG의 Brahma.ai로 통합될 때까지 근무했습니다.
웹사이트: martinanderson.ai
연락처: martin@martinanderson.ai