Andersonの視点

AI生成広告画像がターゲットにしたデモグラフィック – そして、最終的にあなたへ?

mm
Unite.AI を Google の優先ソースに追加
Montage of AI-generated images depicting frames from an online video aimed at three different age groups. Z-Image Turbo via Krita Diffusion AI.

広告主は、クリックを誘発するために広告を個々の視聴者に合わせてカスタマイズすることを目指しており、現在、各人向けにカスタマイズされたクリエイティブを制作することは実用的ではないものの、新しい研究によると、AI生成画像は将来、特定のデモグラフィックに効果的にターゲットを絞ることができる可能性がある。

 

スティーブン・スピルバーグの2002年のSFアクション映画『マイノリティ・リポート』に登場するパーソナライズド広告は、文化に永続的な、甚至は不気味な印象を残しており、人々を認識し、直接的なプロモーションメッセージを叫ぶプロアクティブ広告のビジョンが描かれている。

多くの消費者団体は、このレベルの視聴者認識を悪夢と見なすかもしれないが、ケンブリッジ・アナリティカスキャンダルの余波により進展が遅れたものの、直接的で、高度にターゲットを絞ったエンゲージメントは、広告においてまだ価値のある目標である。

実際、特定の視聴者の特性に焦点を当てることができるシステムは不断に開発されており、これらのケースでは、企業の研究は、個人情報(PII)に関する法律を尊重するための措置を講じる必要があるが、これらの法律は、過去10年間にヨーロッパで強化されており、ブルッセル効果を通じて他の場所に広がっている。

あなたへ!

AI生成広告やマーケティングコンテンツが増加している現在、広告主は、特定の個人を対象としたAI広告の潜在的なコストに直面する必要がある。ここで、画像やテキストは機会的に生成され、即座に生成される。

たとえば、カスタマイズされた画像を非常に迅速に生成できたとしても、大規模な場合のコストは大きい。また、自動オンライン広告オークションプロセスは、ミリ秒レベルのタイムフレームで動作するため、ユーザー向けのカスタマイズされた画像コンテンツは、現在、課題であり、ビデオコンテンツはさらに遠い将来の目標となる。

しかし、ネットベースのオーディエンス(ラップトップ、電話、スマートテレビなど)におけるより高いレベルのデモグラフィックコーホートグループを対象とする技術的な障害は、重大ではない。国際的な学術・産業共同研究は、年齢や場所などの要素を含む、異なるデモグラフィックに対して個別の広告画像を生成する方法を提案している。

新しい研究から:特定のビューアグループ向けに、単一の製品を異なるスタイルでレンダリングするパーソナライズド広告画像の例。上行は元の製品画像を示し、次の3行は、年齢、ライフスタイル、または美的好みなどの特性の違いを基に、各製品に対して3つの異なるオーディエンスタイプを示している。これらのグループタイプは、事前に定義されていないが、自動的に発見される。各行は1つのグループに対応し、各列は異なる製品を示している。ソース - https://arxiv.org/pdf/2602.02033

新しい研究から:特定のビューアグループ向けに、単一の製品を異なるスタイルでレンダリングするパーソナライズド広告画像の例。上行は元の製品画像を示し、次の3行は、年齢、ライフスタイル、または美的好みなどの特性の違いを基に、各製品に対して3つの異なるオーディエンスタイプを示している。これらのグループタイプは、事前に定義されていないが、自動的に発見される。各行は1つのグループに対応し、各列は異なる製品を示している。ソース – https://arxiv.org/pdf/2602.02033

新しいフレームワーク「ワンサイズ、複数のフィット」(OSMF)は、広範囲のターゲット広告と実用的ではないほど個別のパーソナライゼーションのギャップを埋めることを目指しており、大規模な広告画像生成において、自動的に発見されたオーディエンスグループに対して異なる広告画像を生成するために、製品認識クラスタリングを使用して、視覚的なコンテンツを異なるデモグラフィックのクリックの好みと一致させる。

著者らは次のように述べている:

‘[私たちが提示する]統一フレームワークは、大規模な広告画像生成におけるさまざまなグループごとのクリックの好みを一致させます。 ‘

‘OSMFは、製品認識適応グループ化から始まり、ユーザーを動的に、ユーザーの属性と製品の特性に基づいて組織化し、各グループを豊かな集団的好み特性で表現します。 ‘

テストでは、著者らは先行するフレームワークと比較して、最先端の結果を主張している。

しかし、研究では、どのデモグラフィック特性が各Gグループ化に表現されるかについて具体的に述べていないが、これらは伝統的な市場セグメント化グループにマッピングされる可能性が高い。

したがって、論文と付属文書に示されているさまざまな例から、特定の背景や照明が一つのコーホートよりも他のコーホートに魅力的である理由を正確に判断することは容易ではない。なぜなら、どのコーホートの特性もわからないからである。

コーホート固有の画像スタイル間には、一貫した「青は少年、ピンクは少女」などのスタイルがない。定義は、既存の文献から明らかなように、はるかに複雑で繊細である。

コーホート固有の画像スタイル間には、一貫した「青は少年、ピンクは少女」などのスタイルがない。定義は、既存の文献から明らかなように、はるかに複雑で繊細である。

広告ターゲット化の慣行に懸念を抱く人にとって、より懸念されるのは、特定のユーザーに対する広告画像の生成における、ユーザーごとの洞察の活用の可能性である。

新しい論文は、「ワンサイズ、複数のフィット:大規模な広告画像生成におけるさまざまなグループごとのクリックの好みの整列」と題され、北京のパターン認識国立研究所、UCASのAIスクール、中国の電子商取引会社JINGDONG、香港科技大学(広州)、および南京理工大学のパターン認識研究所の17人の研究者によるものである。

方法

システムは、適応クラスタリング(ユーザーの特性と、さまざまな製品に対する反応を結び付けることによって、自然なグループを見つける方法)を使用して、ユーザーをグループ化し、製品認識適応グループ化(PAAG)と呼ばれるこのアプローチの実装を使用する。

これらのグループは、事前に固定されていないが、データのパターンから発見される。

条件付き画像ジェネレーター「好み条件付き画像生成」(PCIG)は、各グループのプロファイルを使用して、グループの好みに合った広告画像を生成する。

OSMFは、ユーザーを、製品の好みを形作る特性に基づいてグループ化し、各グループのプロファイルを使用して、グループの好みに合った広告画像を生成する。PAAGはグループ化を処理し、PCIGは、各グループに合わせて調整されたプロンプトとフィードバックを使用して画像を生成する。

OSMFは、ユーザーを、製品の好みを形作る特性に基づいてグループ化し、各グループのプロファイルを使用して、グループの好みに合った広告画像を生成する。PAAGはグループ化を処理し、PCIGは、各グループに合わせて調整されたプロンプトとフィードバックを使用して画像を生成する。

画像ジェネレーターは、安定拡散の未指定のバージョンと、ControlNetスイート(後者は、さまざまなコーホート生成間の一貫性を維持するために使用される)を使用する。

ワークフローでは、PAAGは、ユーザー特性と製品のテキストおよび画像の両方の関係を、専用のエンコーダーとクロスアテンションメカニズムを使用して統一された好み埋め込みにマージすることで、エンコードする。埋め込みは、ユーザーが特定の広告をクリックする可能性を反映する。

PAAGは、次に、さまざまなユーザー属性の組み合わせが、製品タイトルと製品画像の両方とどのように相互作用するかをモデル化する。テキストと画像の特性は、CLIPResNetベースのエンコーダーを使用して抽出され、ユーザーの特性(性別場所年齢、またはデバイス)は、MLPを通過し、製品のテキストと画像の特性に対するクロスアテンションを可能にする。

結果の埋め込みは、各ユーザーの特定の製品の視覚的コンテキストにおけるクリックの可能性を表す。ユーザーと製品の好み埋め込みが取得されると、PAAGは、K-meansクラスタリングを使用して、特定の製品に対して同様に反応するユーザーをグループ化する。

PAAGは、クラスターがどの程度よく分離されているかを確認することで、各製品の最適なユーザーグループの数を選択する。1つのグループあたりの1つの平均点のみを使用するのではなく、さまざまな距離で複数の点をサンプリングして、より広い範囲の好みを捉える。

これらのグループプロファイルは、グループ認識マルチモーダル大規模言語モデル(G-MLLM)にトークンとして渡され、各グループのプロファイルを使用して、グループの好みに合った広告画像を生成する。

ユーザーの好みに基づく画像生成

ユーザー側では、G-MLLMは、どのグループメンバーが次にクリックする可能性が高いかを予測し、共通の特性を自然言語で説明することを学ぶ。製品側では、画像に表示される製品を要約し、アイテムとグループの両方に合った広告スタイルのキャプションを生成することを学ぶ。

モデルは、ファインチューニングのために、グループDPOという方法で、グループ認識報酬モデル(GRM)を拡張する。GRMは、研究者自身のグループ広告画像好み(GAIP)データセット(後述)で訓練され、同じ製品の画像のペアを比較し、どの画像が特定のグループでより効果的だったかを判断するために、実際のクリックスルー率データを使用する。

この報酬シグナルは、LoRAを使用して、グループレベルのエンゲージメントを優先するプロンプトを学習するために、G-MLLMをファインチューニングするために使用される。

データとテスト

GAIPの開発

グループベースの広告好みに関するデータセットが歴史的に不足していること、および以前のコレクション(パーソナライズドスープCG4CTR)が規模が小さすぎるか、または不適切に指定されていることを認識して、研究者は独自のコレクション、GAIPを開発した。これは、特定の電子商取引プラットフォームの「工業広告ログ」から派生したものである。

ログは3週間の期間で収集され、各エントリは製品画像とタイトル、ビューアーのプロファイル(年齢支出レベルプロモーションへの敏感性を含む)および広告がクリックされたかどうかを記録した。

データセットには、4000万以上のユーザー、200万の製品、および約1000万の広告画像が含まれており、アイテム間で視覚的な多様性が高い。

ユーザーは、各製品に対してPAAGによって異なるクラスターにグループ化され、各グループ内の画像ごとのクリックスルー率(CTR)が計算された。

新しい論文の付属文書から、GAITの定義基準のいくつかのスナップショット。

新しい論文の付属文書から、GAITの定義基準のいくつかのスナップショット。

GAIPは、広告画像製品タイトルグループ埋め込みグループ固有のCTRのペアのセットとして形成され、各画像とタイトルをそのCTRと見たグループの埋め込みとペアにする。

信頼性を確保するために、十分な露出がある製品のみが保持され、結果として610,172のグループレベルのサンプルが得られる。

GAIPは、以前のデータセットよりも大きい。ほとんどの以前のベンチマークには10未満のユーザーグループが含まれるのに対し、GAIPには約60万の実世界のグループレベルの好みレコードが含まれており、グループレベルの好みについてより深い洞察を提供する。

テスト

PCIGパイプラインを訓練するために、研究者はResNetとCLIPテキストエンコーダーを使用して画像とテキストの特性を抽出し、学習可能な線形層を介して128次元の埋め込みにマッピングした。効率性を維持するために、PAAGは各製品あたり5つのユーザーグループに制限された。

グループ埋め込みは、15パーセント、55パーセント、95パーセントのパーセンタイルに基づいて抽出された複数のポイントを使用する、パーセンタイルベースのサンプリング戦略を使用して構築され、コアと周辺の好みの両方を捉える。

LLaVAは、G-MLLMのバックボーンとして使用され、事前訓練は10エポックで行われ、コサイン学習スケジュールで学習率2e-6で行われ、8つのNVIDIA H100 GPU(各GPUに80GBのVRAM)クラスターで5日間のトレーニングを必要とした。

GRMは、GAIPを一致する製品画像のペアで再構築し、G-MLLMと同じ重みで初期化された。最終的なグループDPO段階では、GRMは凍結され、G-MLLMは同じNVIDIAクラスターで、学習率2e-5で3エポックでファインチューニングされた。

最初の評価に使用されたメトリックは、NDCG@5AUROCであった。NDCG@5は、各グループが同じセットの広告画像をどの程度違ってランク付けしたかを測定し、低い値は好みのより明確な分離を示した。AUROCは、クリックされたコンテンツとクリックされなかったコンテンツを区別するモデルの能力を評価するために使用された。

すべてのメトリックは、1,000の製品、約10万サンプルから得られたクラスタリングの結果で計算され、PAAGを3つの先行システムと比較するために使用された:CACSWIYD;およびJAC

好みモデリングの結果を先行の方法と比較したもの。NDCG@5が低く、AUROCが高いほど、パフォーマンスが良い。最高スコアは太字、2番目のスコアは下線で示される。

好みモデリングの結果を先行の方法と比較したもの。NDCG@5が低く、AUROCが高いほど、パフォーマンスが良い。最高スコアは太字、2番目のスコアは下線で示される。

これらの結果について、著者らは次のように述べている:

‘[私たちの]方法は、両方のメトリックで優れたパフォーマンスを達成します。具体的には、PAAGは最低のNDCG@5(0.3066)を達成し、ベースライン(CACS)を上回り、効果的なグループベースの広告生成のためのより明確なインターグループの好みパターンを示しています。 ‘

‘さらに、PAAGは最高のAUROC(0.6372)を達成し、最も強いベースライン(WIYD)を0.0159上回ります。 ‘

2回目のテストでは、システムが広告を正しいユーザーグループにマッチさせる能力を確認した。

オンラインCTRの比較。グループパーソナライズ生成(「私たち」)がすべてのベースライン、CAIGや事前訓練済みG-MLLMを上回ることを示している。

オンラインCTRの比較。グループパーソナライズ生成(「私たち」)がすべてのベースライン、CAIGや事前訓練済みG-MLLMを上回ることを示している。

ここで、PCIGは、古いモデルであるCAIGやG-MLLMよりもクリック率が高かった。GRMも、オフラインでテストされ、グループの好みに基づいて、広告のペアのどちらが優れているかを正しく選択できるかどうかが確認された。GRMは、すべてのベースライン、包括的なモデルを上回り、CAIGよりも4.7%の改善を示した。

最後の質的テストでは、PCIGがグループレベルの好みを生成された画像のスタイルに反映できるかどうかを評価するために実施された。

以前の記事でプレビューされた質的テストの完全な結果。

以前の記事でプレビューされた質的テストの完全な結果。

これらのバリエーションは、著者らによれば、各グループの推定クリックの好みと一致しており、PCIGが関連性と魅力性を維持しながら、スタイリストически異なる出力を生成する能力を示した。

著者らは次のように述べている:

‘[PCIG]は、さまざまなユーザーグループのクリックの好みを満たすために、スタイリスト的に異なる画像を生成することを保証し、異なるユーザーグループのさまざまなニーズに適応する能力と、さまざまなユーザーグループ間の繊細な、微妙な好みの違いを捉える能力を示している。 ‘

結論

このプロジェクトで最も興味深い側面の1つは、同じ製品のグループターゲット画像の出力スタイル間の未知の相関関係である。

都市の背景は年齢に関連しているか、つまり、卒業生が出発するときに、そして、農村環境は、オープンロードを「最終的な自由」と見なすより豊かなジェネレーションXタイプに向けられているか?これらのテスト出力を1日中ロールシャッハテストすることができる。

このようなシステムの潜在性は、2つの要因に依存する。洞察と待機時間。洞察は、現れる追跡システムが、効果的なコーホートベースの広告をサポートするために、そして将来的により正確な、個人をターゲットにした広告の基盤を築くために、ユーザーから十分な意味のある情報を抽出できるかどうかに依存する。

待機時間は、より大きな課題を提起する。なぜなら、これらのカスタマイズされた広告画像は、ほぼ瞬時に生成および配信される必要があるからである。最近のテキストから画像へのモデルは、わずか数秒で結果を生成できるが、実時間の広告オークションでは、待機時間が長すぎる可能性がある。

1つの可能な解決策は、画像をローカルに、ブラウザーのGPUで生成することである。これにより、ネットワークの往復を回避できる。あるいは、事前に画像を生成してクライアント側でキャッシュすることもできる。

 

** この側面は、新しい論文では省略されており、新しいAIフレームワークのディープフェイクの悪用の可能性は、しばしば新しい研究で愛らしい動物の図(AIポルノではなく)を使用することで和らげられている。しかし、この研究で示されている画像の種類は、広告主が最善を尽くしている場合を表しているが、消費者ターゲティング方法が急速な応答の生成AIと組み合わせられる場合に、どの程度パーソナライズされた視覚的な広告が最終的にどのようになるかを示していない。

** この機関の名前は、私が識別できない。UCASは、一般的に、よく知られたイギリスの大学への申請のクリアリングハウスを解決する。明確化を歓迎する。

研究者は、関連するGitHubリポジトリでリリースすることを約束している。

2026年2月5日木曜日に最初に公開された。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai