Anderson의 관점

새로운 연구,真正로 ‘개인화된’ 광고 제안

mm
Unite.AI를 Google의 선호 소스에 추가
A woman looks at a laptop displaying a news website, reacting with surprise as a banner advertisement on the page shows a smiling woman who closely resembles her.

자아 홍보의 재정의에서, 새로운 방법은 사용자의 클릭 기록을 사용하여 사용자의 특정한 기록에 기반한 맞춤형 웹 광고를 생성한다.

 

광고 대행사들은 광고가 사용자의 집에서 말한 내용에 기반하여 광고를 제공하는 광고 파이프라인이 존재한다는 아이디어를 부인하려는 경향이 있지만, 웹사이트와 소셜 미디어 앱에서 광고의 ‘개인화’ 정도는 최근 몇 년 동안 헤드라인을 장식해왔다.

광고주에게 이상적인 시나리오는 제공된 광고가 시청자에게 정확히 맞는 경우이다. 온라인 추적에 대한 공개적인 반발과 사용자가 설치할 수 있는 예방 조치의 한계 내에서, 생성된 AI(대규모 언어 모델에서의 광고에 대한 두려움을 제외하고)는 광고 이미지와 텍스트를 실시간에 빠르게 생성할 수 있다.

그러나 이 분야의 연구와 구현의 주요 내용은 집단 사용 통계를 기반으로 하여 각 사용자에게 생성된 광고는 사용자의 추정된 코호트 그룹에 기반한 것이지, 사용자의 고유한 기록에 기반한 것이 아니다.

이제 중국과 미국의 새로운 연구 협력은 사용자가 로그인한 사이트에서 사용자의 과거 클릭 기록을 학습하여 개별 사용자에게 광고 이미지를 생성하는 시스템을 제안한다. 이는 대부분의 개인화 광고 연구에서 지배적인 코호트 기반 가정을 넘어서는 것이다.

개별 맞춤형 광고를 보여주는 예제 생성. 사용자의 기록이 없으면 전체적인 영향을 상상할 수 없다. 출처 - https://arxiv.org/pdf/2605.12138

개별 맞춤형 광고를 보여주는 예제 생성. 사용자의 기록이 없으면 전체적인 영향을 상상할 수 없다. 출처

새로운 접근 방식은 확산 기반 모델을 거부하고, 자율 회귀 아키텍처를 사용한다. 이는 확산 모델이 시각적 노이즈에서 이미지를 점진적으로 개선하는 반면, 자율 회귀 모델은 내용을 한 번에 생성하며, 이전에 생성된 모든 것에서 새로운 요소를 예측한다.

ウォールド 가든

이 연구의 제안된 범위는 광고주에게 새로운 제3자 추적 방지 조치를 회피하는 방법을 제공하지 않는다. 대신에, 충분히 큰 소매업체에게 로그인한 고객에게 직접 관련된 광고를 제공하는 능력을 제공한다.

이러한 종류의 광고 범위는 일반적으로 높은 볼륨과 높은 규모의 아마존과 같은 아웃レット에 제한되지만, 이와 유사한 규모의 관심사(예: 인기 있는 소셜 미디어 플랫폼)는 이와 유사한 생성 프레임워크를 생성할 수 있다.

데이터 및 방법

이 프로젝트의 데이터셋은 개인화 광고 이미지-텍스트(PAd1M)로 불리며, JD.com에서 제공한 데이터로 구동된다. 저자들은 다음과 같이 말한다:

‘각 제품은 일반적으로 10개 이상의 후보 이미지와 텍스트를 제공하여 다양한 선호도를 완전히 감지할 수 있다. 신뢰할 수 있는 선호도 모델링을 위해, 우리는 이미지와 텍스트에 대한 전체 사용자 클릭 기록을 수집하여 노이즈를 줄이고, 불충분한 활동을 가진 사용자를 필터링한다.

‘이로 인해 1,145,371명의 사용자와 18,923,555개의 클릭한 제품 이미지와 텍스트가 생성되며, 사용자당 16개 이상의 멀티모달 histórico 행동이 평균된다.’

각 사용자에 대해 이전에 클릭한 이미지-텍스트 쌍이 선택되어 타겟 예제로 사용되며, 제품 자체는 Grounded SAM을 사용하여 이미지에서 분리된다.

판매자 제공 설명과 판매 포인트가 레코드에 첨부되어, 각 타겟 광고는 투명한 제품 이미지, 구조화된 제품 정보 및 사용자의 이전 관심과 선호도를 반영하는 이미지 및 텍스트 상호작용의 기록과 함께 생성된다.

PAd1M 데이터셋에서 사용자 프로필, 타겟 광고와 함께 생성된 제품 정보 및 사용자의 선호도를 모델링하는 데 사용된 역사적 이미지 및 텍스트 상호작용

PAd1M 데이터셋에서 사용자 프로필, 타겟 광고와 함께 생성된 제품 정보 및 사용자의 선호도를 모델링하는 데 사용된 역사적 이미지 및 텍스트 상호작용

결과적으로, 데이터셋은 100만 명이 넘는 사용자와 거의 1,900만 개의 클릭한 이미지 및 텍스트 레코드를 제공하며, 저자들은 이 컬렉션이 이전 개인화 데이터셋보다 훨씬 크다고 말한다.

또한, 데이터는 이미지와 텍스트를 모두 결합하여 사용자의 선호도를 단일 도메인 내에서가 아니라 여러 모달리티에서 모델링할 수 있도록 한다.

PAd1M은 또한 개별 수준의 선호도 추적을 특징으로 하며, 이전 광고 데이터셋과 달리 대규모 그룹에서 집계된 클릭률을 기반으로 하는 것이 아니라, JD.com 데이터에서 특정 사용자와 연결된 상호작용을 연결한다.

테스트

저자들은 자신의 테스트 접근 방식이 DeepSeek의 Janus-Pro 7B에서 파생되었다고 말한다.

모델은 AdamW 최적화 알고리즘과 5e-5의 학습률을 사용하여 배치 크기 4에서 훈련되었다. 기본 모델은 LoRA를 통해 미세 조정되었으며, 전경 인식 및 멀티모달 선호도 추출은 완전히 미세 조정되었다.

모든 테스트는 192GB의 VRAM이 있는 NVIDIA B200 GPU에서 실행되었다. 이미지 생성을 위해 PickScore, ImageReward 및 ASE를 사용하여 시각적 품질을 측정했으며, m-BLEU 및 m-ROUGE를 사용하여 광고 텍스트를 평가했다.

인간 평가자들은 또한 이미지의 현실성과 레이아웃 품질 및 텍스트의 정확성과 유창성을 평가했다.

초기 기준선 정량 결과는 아래와 같다:

일반 광고 생성 벤치마크의 성능. Uni-AdGen은 가장 강력한 이미지 생성 기준선과 PickScore에서 최고의 성능을 보였으며, 통합 이미지 및 텍스트 모델은 모든 텍스트 생성 접근 방식에서最高의 m-ROUGE 점수를 달성했다.

일반 광고 생성 벤치마크의 성능. Uni-AdGen은 가장 강력한 이미지 생성 기준선과 PickScore에서 최고의 성능을 보였으며, 통합 이미지 및 텍스트 모델은 모든 텍스트 생성 접근 방식에서最高의 m-ROUGE 점수를 달성했다.

저자들은 다음과 같이 말한다:

‘我们的 방법은 ImageReward와 인간 평가에서 최고의 성능을 보이며, PickScore와 인간 평가에서 2위를 차지한다. 이는 우리의 방법이 미적 품질과 높은 사용 가능성을 갖춘 광고를 생성할 수 있음을 보여준다. ReliableAd는 인간 평가에서最高의 성능을 보이지만, 미적 지표에서 현저히 뒤처진다. 반면, PosterMaker와 Flux-Fill은 시각적으로 매력적인 이미지를 생성하지만, 현저한 사용성 제한을 겪는다.’

개인화된 광고 생성을 평가하기 위해, 500명의 사용자와 기록된 상호작용 기록을 사용하여 PBS를 사용하여 이미지 유사성을 측정하고, BLEU 및 ROUGE를 사용하여 생성된 텍스트를 비교했다.

기본선은 Flux-Kontext와 Pigeon을 사용하여 이미지 생성과 Qwen3 및 DeepSeek-R1을 사용하여 텍스트 생성을 위해 선택되었다.

결론

이 프로젝트의 유용성은 사용자의 동의에 완전히 의존하며, 이 ‘예측’ 시스템의 범위를 사용자 기록을 제어하는 도메인의 범위를 넘어서 확장하려면 사용자의 명시적인 허가가 필요하다.

그러나 이 시스템은 이러한 시나리오에서 작동하는 초대형 네트워크 효과와 사용자가 이러한 종류의真正로 개인화되고 예측 가능한 추천 시스템을 유용하다고 생각할 것이라는 아이디어에 기반한다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai