Ángulo de Anderson

ImÃĄgenes publicitarias generadas por IA que se dirigen a tu demografía – Y, eventualmente, a ti

mm
AÃąade Unite.AI a tus fuentes preferidas en Google
Montage of AI-generated images depicting frames from an online video aimed at three different age groups. Z-Image Turbo via Krita Diffusion AI.

Los anunciantes buscan personalizar los anuncios para cada espectador para generar clics, y aunque los creativos personalizados para cada persona son actualmente impracticables, una nueva investigaciÃģn sugiere que la imagen generada por IA podría ser dirigida de manera efectiva a grupos demogrÃĄficos específicos.

 

La publicidad personalizada presentada en la película de ciencia ficciÃģn de acciÃģn de Steven Spielberg de 2002 Minority Report ha dejado una impresiÃģn duradera, incluso inquietante, en la cultura, con su vívida representaciÃģn de carteles publicitarios proactivos que reconocen a las personas en las multitudes y les gritan mensajes promocionales directamente.

Muchos grupos de consumidores pueden considerar este nivel de reconocimiento del espectador como una pesadilla, y aunque el progreso hacia ello se frenÃģ debido a las consecuencias del escÃĄndalo de Cambridge Analytica escÃĄndalo, el ideal de compromiso directo y altamente dirigido sigue siendo un objetivo valioso en la publicidad.

En efecto, los sistemas que pueden profundizar en las características de un espectador específico siguen en desarrollo constante – aunque en tales casos, la investigaciÃģn corporativa debe tomar medidas para respetar las leyes sobre informaciÃģn personalmente identificable (PII); leyes que se han fortalecido en Europa en la Última dÃĐcada, con estas protecciones mejoradas extendidas a otros lugares a travÃĐs de el efecto Bruselas.

Hola, tÚ

Ahora que los anuncios y el contenido de marketing generados por IA estÃĄn en aumento, los anunciantes deben enfrentar el costo potencial de los anuncios de IA dirigidos a individuos específicos, donde las imÃĄgenes y el texto se generan oportunísticamente y en tiempo real.

Por ejemplo, incluso si una imagen personalizada se pudiera generar muy rÃĄpidamente, los costos a gran escala serían significativos. AdemÃĄs, los procesos de subasta de anuncios en línea automÃĄticos operan en marcos de tiempo críticos, a nivel de milisegundos, lo que hace que el contenido de imagen personalizado sea desafiante, por el momento; y el contenido de video es una perspectiva aÚn mÃĄs lejana.

Sin embargo, los obstÃĄculos tÃĐcnicos involucrados en abordar grupos de cohortes demogrÃĄficas de nivel superior en una audiencia en línea (a travÃĐs de laptops, telÃĐfonos, televisores inteligentes, etc.) no son tan severos – y una nueva colaboraciÃģn acadÃĐmica e industrial internacional estÃĄ proponiendo una forma de crear imÃĄgenes publicitarias separadas para diferentes demografías, incluyendo factores como la edad y la ubicaciÃģn:

Del nuevo trabajo: ejemplos de generaciÃģn de anuncios personalizados, donde un solo producto se representa en diferentes estilos para diferentes grupos de espectadores. La fila superior muestra las imÃĄgenes de productos originales. Las tres filas siguientes muestran versiones adaptadas a tres tipos de audiencia distintos por producto, basadas en diferencias en rasgos como la edad, el estilo de vida o la preferencia estÃĐtica. Estos tipos de grupo no estÃĄn predefinidos, sino que se descubren automÃĄticamente. Cada fila corresponde a un grupo; cada columna muestra un producto diferente. Fuente - https://arxiv.org/pdf/2602.02033

Del nuevo trabajo: ejemplos de generaciÃģn de anuncios personalizados, donde un solo producto se representa en diferentes estilos para diferentes grupos de espectadores. La fila superior muestra las imÃĄgenes de productos originales. Las tres filas siguientes muestran versiones adaptadas a tres tipos de audiencia distintos por producto, basadas en diferencias en rasgos como la edad, el estilo de vida o la preferencia estÃĐtica. Estos tipos de grupo no estÃĄn predefinidos, sino que se descubren automÃĄticamente.

El nuevo marco – titulado Un tamaÃąo, muchos ajustes (OSMF) – busca cerrar la brecha entre la publicidad de destino amplio y la personalizaciÃģn impracticablemente granular, generando diferentes imÃĄgenes de anuncios para grupos de audiencia automÃĄticamente descubiertos, utilizando agrupaciÃģn de productos para alinear el contenido visual con las preferencias de clic de demografías distintas

Los autores afirman:

‘[Presentamos] un marco unificado que alinea las preferencias de clic de grupo en la generaciÃģn de imÃĄgenes publicitarias a gran escala.

‘OSMF comienza con la agrupaciÃģn adaptativa de productos, que organiza dinÃĄmicamente a los usuarios segÚn sus atributos y características de productos, representando cada grupo con características de preferencia colectiva ricas.’

Se dice que los resultados son de Última generaciÃģn.

Aunque el trabajo identifica grupos de cohortes diversos, el artículo no especifica quÃĐ características demogrÃĄficas estÃĄn representadas por cada G de agrupaciÃģn, aunque estas parecen probablemente mapear a los grupos de segmentaciÃģn de mercado tradicionales tradicionales.

Por lo tanto, no es fÃĄcil determinar, en base a los ejemplos dados en el artículo principal y el apÃĐndice, por quÃĐ ciertos fondos o iluminaciÃģn podrían atraer a un grupo mÃĄs que a otro, ya que no conocemos los rasgos de ningÚn grupo:

No hay estilos consistentes 'azul para niÃąos, rosa para niÃąas', etc., en los estilos de imagen específicos de cohorte, que podrían revelar a quÃĐ tipo de persona pertenece cada grupo – las definiciones, como se desprende de la literatura existente, son mucho mÃĄs complejas y sutiles.

No hay estilos consistentes ‘azul para niÃąos, rosa para niÃąas’, etc., en los estilos de imagen específicos de cohorte, que podrían revelar a quÃĐ tipo de persona pertenece cada grupo – las definiciones, como se desprende de la literatura existente, son mucho mÃĄs complejas y sutiles.

Lo que es tal vez mÃĄs preocupante, para aquellos que desconfían de las prÃĄcticas de orientaciÃģn publicitaria, es la posibilidad de explotar las perspectivas de usuario en la generaciÃģn de imÃĄgenes específicas en anuncios**.

El nuevo artículo se titula Un tamaÃąo, muchos ajustes: alineando las preferencias de clic de grupo en la generaciÃģn de imÃĄgenes publicitarias a gran escala, y proviene de 17 investigadores de todo el Laboratorio Nacional de Reconocimiento de Patrones de Beijing; la ‘Escuela de IA de UCAS’; la empresa de comercio electrÃģnico china JINGDONG; la Universidad de Ciencia y Tecnología de Hong Kong en Guangzhou; y el Laboratorio de Reconocimiento de Patrones de la Universidad de Ciencia y Tecnología de Nanjing.

MÃĐtodo

El sistema utiliza agrupaciÃģn adaptativa (un mÃĐtodo que encuentra agrupaciones naturales vinculando los rasgos de los usuarios con cÃģmo responden a diferentes productos) para agrupar a los usuarios, en base a cÃģmo sus rasgos configuran las preferencias visuales en un entorno de producto determinado. La implementaciÃģn de los autores de este enfoque se llama AgrupaciÃģn adaptativa de productos (PAAG).

Estas agrupaciones no estÃĄn fijas de antemano, sino que se descubren a partir de patrones en los datos.

Un generador de imÃĄgenes condicional, titulado GeneraciÃģn de imÃĄgenes condicionada por preferencia (PCIG), utiliza luego el perfil de cada grupo para crear imÃĄgenes publicitarias que coinciden con los gustos probables del grupo:

El marco OSMF agrupa a los usuarios segÚn cÃģmo sus rasgos configuran las preferencias de productos, y luego utiliza los perfiles de grupo para generar imÃĄgenes de anuncios que coinciden con los gustos de cada grupo. PAAG maneja la agrupaciÃģn, y PCIG crea las imÃĄgenes utilizando prompts y retroalimentaciÃģn ajustados a cada grupo.

El marco OSMF agrupa a los usuarios segÚn cÃģmo sus rasgos configuran las preferencias de productos, y luego utiliza los perfiles de grupo para generar imÃĄgenes de anuncios que coinciden con los gustos de cada grupo. PAAG maneja la agrupaciÃģn, y PCIG crea las imÃĄgenes utilizando prompts y retroalimentaciÃģn ajustados a cada grupo.

El generador de imÃĄgenes utiliza una versiÃģn no especificada de Stable Diffusion, junto con un conjunto de ControlNet apropiado (el Último, para ayudar a mantener la coherencia entre las diversas generaciones de cohortes).

En el flujo de trabajo, PAAG primero codifica la relaciÃģn entre las características de los usuarios y tanto los aspectos de texto como de imagen del producto, utilizando un conjunto de codificadores dedicados y un mecanismo de atenciÃģn cruzada para combinarlos en una incrustaciÃģn de preferencia unificada que refleja cuÃĄn probable es que un usuario haga clic en un anuncio determinado.

PAAG luego modela cÃģmo diferentes combinaciones de atributos de usuario interactÚan con tanto los títulos de productos como las imÃĄgenes de productos. Las características de texto y de imagen se extraen utilizando CLIP y codificadores basados en ResNet, y los rasgos de los usuarios como gÃĐnero, ubicaciÃģn, edad o dispositivo se pasan a travÃĐs de una MLP que permite la atenciÃģn cruzada sobre las características de texto y de imagen del producto.

La incrustaciÃģn resultante representa la probabilidad de clic de cada usuario para un producto determinado en un contexto visual determinado. Una vez que se obtienen estas incrustaciones de preferencia de usuario-producto, PAAG utiliza agrupaciÃģn K-means para agrupar a los usuarios que responden de manera similar a un producto determinado.

PAAG elige el mejor nÚmero de grupos de usuarios para cada producto verificando cÃģmo se separan los clusters. En lugar de utilizar solo un punto promedio por grupo, muestrea varios a diferentes distancias para capturar una gama mÃĄs amplia de preferencias.

Estos perfiles de grupo se pasan luego como tokens al modelo de lenguaje grande multimodal de grupo (G-MLLM), que los utiliza para generar imÃĄgenes de anuncios personalizados para cada grupo.

GeneraciÃģn de imÃĄgenes basada en preferencias de usuario

En el lado del usuario, G-MLLM aprende a predecir quÃĐ miembros del grupo probablemente hagan clic a continuaciÃģn y cÃģmo describir los rasgos comunes en lenguaje natural. En el lado del producto, aprende a resumir el producto mostrado en una imagen y a generar subtítulos de estilo publicitario que coincidan con el artículo y el grupo.

Para reflejar el comportamiento del usuario real, el modelo se extiende a un modelo de recompensa de grupo (GRM). GRM se entrena en el conjunto de datos Preferencia de imagen publicitaria de grupo (GAIP) de los investigadores† (ver a continuaciÃģn) para comparar pares de imÃĄgenes para el mismo producto e identificar cuÃĄl funciona mejor con un grupo determinado, utilizando datos de clic reales.

Este seÃąal de recompensa se utiliza luego para ajustar G-MLLM con Group-DPO, un mÃĐtodo que le enseÃąa a favorecer los prompts que conducen a un mejor compromiso a nivel de grupo.

Datos y pruebas

Desarrollando GAIP

Al observar la falta histÃģrica de conjuntos de datos relacionados con preferencias publicitarias basadas en grupos, y que las colecciones anteriores como Personalized Soups y CG4CTR son demasiado pequeÃąas o demasiado mal especificadas, los investigadores desarrollaron su propia colecciÃģn, el mencionado GAIP, derivado de los ‘registros de publicidad industriales’ de una plataforma de comercio electrÃģnico no especificada.

Los registros se recopilaron durante un período de tres semanas, con cada entrada registrando la imagen del producto y el título, el perfil del espectador (incluyendo edad, nivel de gasto y sensibilidad a promociones) y si el anuncio se hizo clic.

El conjunto de datos incluye mÃĄs de 40 millones de usuarios, 2 millones de productos y casi 10 millones de imÃĄgenes publicitarias, con una gran variedad visual en los artículos.

Los usuarios se agruparon en clusters distintos para cada producto utilizando PAAG, y la tasa de clic (CTR) se calculÃģ por imagen dentro de cada grupo:

Del material suplementario del nuevo artículo, un vistazo a algunos de los criterios definitorios para GAIT.

Del material suplementario del nuevo artículo, un vistazo a algunos de los criterios definitorios para GAIT.

GAIP se forma como un conjunto de tuplas (imagen publicitaria, título del producto, incrustaciÃģn del grupo, CTR específico del grupo) que empareja cada imagen y título con su CTR y la incrustaciÃģn del grupo que lo vio.

Para garantizar la confiabilidad, solo se retienen los productos con suficiente exposiciÃģn, lo que da como resultado un conjunto de datos de 610,172 muestras a nivel de grupo.

GAIP es sustancialmente mÃĄs grande que los conjuntos de datos anteriores: mientras que la mayoría de las benchmarks anteriores involucran menos de diez grupos de usuarios, GAIP incluye casi 600,000 registros de preferencias de grupo reales, lo que ofrece una comprensiÃģn mÃĄs profunda de las preferencias a nivel de grupo.

Pruebas

Para entrenar la tubería PCIG, los investigadores extrajeron características de imagen y texto utilizando ResNet y el codificador de texto CLIP, y luego los mapearon a incrustaciones de 128 dimensiones a travÃĐs de capas lineales aprendibles. Para mantener la eficiencia, PAAG se limitÃģ a cinco grupos de usuarios por producto.

Las incrustaciones de grupo se construyeron utilizando una estrategia de muestreo basada en percentiles, dibujando varios puntos de los percentiles 15, 55 y 95, para capturar tanto las preferencias centrales como perifÃĐricas.

LLaVA se utilizÃģ como la base para G-MLLM, y el preentrenamiento se realizÃģ durante diez ÃĐpocas con un calendario de aprendizaje de coseno a una tasa de aprendizaje de 2e-6, lo que requiriÃģ un formidable cinco días de entrenamiento en un clÚster de ocho GPU NVIDIA H100, cada una con 80GB de VRAM.

GRM se entrenÃģ reconstruyendo GAIP con pares de imÃĄgenes de productos emparejados, y luego se inicializÃģ con los mismos pesos que G-MLLM. Durante la etapa final de Group-DPO, GRM se congelÃģ, y G-MLLM se ajustÃģ con LoRA durante tres ÃĐpocas – nuevamente, a una tasa de aprendizaje de 2e-5, en el mismo clÚster NVIDIA.

Las mÃĐtricas utilizadas para la primera evaluaciÃģn fueron NDCG@5 y AUROC. NDCG@5 midiÃģ cÃģmo diferentes cada grupo clasificÃģ el mismo conjunto de imÃĄgenes de anuncios, con valores mÃĄs bajos que indican una separaciÃģn mÃĄs clara en las preferencias; y AUROC se utilizÃģ para evaluar cÃģmo bien cada modelo distinguía entre contenido hecho clic y no hecho clic.

Todas las mÃĐtricas se calcularon en los resultados de la agrupaciÃģn de 1,000 productos, totalizando alrededor de 100,000 muestras, y se utilizaron para comparar PAAG con tres sistemas anteriores: CACS; WIYD; y JAC:

Resultados de modelado de preferencias en comparaciÃģn con mÃĐtodos anteriores. Valores mÃĄs bajos de NDCG@5 y AUROC mÃĄs altos indican un mejor rendimiento. Las mejores puntuaciones estÃĄn en negrita, las segundas mejores subrayadas.

Resultados de modelado de preferencias en comparaciÃģn con mÃĐtodos anteriores. Valores mÃĄs bajos de NDCG@5 y AUROC mÃĄs altos indican un mejor rendimiento. Las mejores puntuaciones estÃĄn en negrita, las segundas mejores subrayadas.

De estos resultados, los autores comentan:

‘[Nuestro] mÃĐtodo logra un rendimiento superior en ambas mÃĐtricas. Concretamente, PAAG logra el NDCG@5 mÃĄs bajo (0.3066), superando a la mejor referencia (CACS), lo que indica patrones de preferencia entre grupos mÃĄs distintos para una generaciÃģn de anuncios de grupo efectiva.

‘AdemÃĄs, PAAG logra el AUROC mÃĄs alto (0.6372), mejorando la referencia mÃĄs fuerte (WIYD) en 0.0159.’

Una segunda ronda de pruebas verificÃģ si el sistema podría emparejar mejor los anuncios con los grupos de usuarios correctos:

ComparaciÃģn de CTR en línea que muestra que la generaciÃģn personalizada de grupo ('Nuestro') supera a todas las referencias, incluyendo CAIG y G-MLLM preentrenado.

ComparaciÃģn de CTR en línea que muestra que la generaciÃģn personalizada de grupo (‘Nuestro’) supera a todas las referencias, incluyendo CAIG y G-MLLM preentrenado.

Aquí, PCIG mostrÃģ tasas de clic mÃĄs fuertes que los modelos mÃĄs antiguos como CAIG y G-MLLM, con una mejora del 5.5%. GRM tambiÃĐn se probÃģ fuera de línea verificando si podía elegir correctamente el mejor anuncio en un par, en base a las preferencias del grupo. SuperÃģ a todas las referencias, incluyendo modelos de propÃģsito general, con una ganancia del 4.7% sobre CAIG.

Una prueba cualitativa final se realizÃģ para evaluar si PCIG podría reflejar las preferencias a nivel de grupo en el estilo de sus imÃĄgenes generadas. Como se muestra en la figura a continuaciÃģn, el mismo producto se representÃģ de manera diferente para cada grupo, con cambios en la paleta, el tono y la composiciÃģn visual:

Resultados completos de las pruebas cualitativas, previamente vistas en el artículo.

Resultados completos de las pruebas cualitativas, previamente vistas en el artículo.

Estas variaciones se alinearon, segÚn los autores, con las preferencias de clic inferidas para cada grupo, lo que demuestra que PCIG podría producir salidas estilísticamente diversas mientras preservaba la relevancia y el atractivo. Los autores afirman:

‘[PCIG] garantiza que las imÃĄgenes estilísticamente diversas acomoden las preferencias de clic de grupos de usuarios distintos, demostrando así su fuerte capacidad para adaptar la generaciÃģn a las demandas heterogÃĐneas de los usuarios y capturar las sutiles diferencias de preferencia a nivel de grupo, destacando su potencial para la generaciÃģn de imÃĄgenes publicitarias de grupo a gran escala.’

ConclusiÃģn

QuizÃĄs el aspecto mÃĄs intrigante de este proyecto sea la correlaciÃģn desconocida entre los estilos de salida en imÃĄgenes dirigidas a grupos para el mismo producto (de los cuales hay varias pÃĄginas mÃĄs de ejemplos en el material suplementario del artículo que podemos reproducir aquí).

ÂŋPodemos asumir que los entornos urbanos estÃĄn relacionados con la edad, es decir, con los graduados que comienzan, y que los entornos rurales estÃĄn dirigidos a tipos mÃĄs prÃģsperos de Gen X que identifican la carretera abierta como una especie de ‘Última libertad’? Uno puede interpretar estos resultados de prueba todo el día.

El potencial de tales sistemas descansa en dos factores: la perspicacia y la latencia. La perspicacia depende de si los sistemas de seguimiento emergentes aÚn pueden extraer informaciÃģn significativa de los usuarios para respaldar una publicidad de cohorte efectiva, al mismo tiempo que sentan las bases para anuncios mÃĄs precisos y dirigidos individualmente en el futuro.

La latencia plantea un desafío mayor, ya que estas imÃĄgenes de anuncios personalizadas deben generarse y entregarse casi instantÃĄneamente; aunque algunos modelos de texto a imagen recientes pueden producir resultados en solo unos segundos, incluso ese retraso puede ser demasiado largo para las subastas de anuncios en tiempo real.

Un posible remedio es producir las imÃĄgenes localmente, en la GPU del navegador, evitando viajes de ida y vuelta en la red; o crear un conjunto de imÃĄgenes de antemano, precargadas en el cliente.

 

** Este aspecto se elide en el nuevo artículo, al igual que el potencial de abuso de los nuevos marcos de IA se suaviza a menudo mediante el uso de figuras de animales acogedores (en lugar de pornografía de IA) en los nuevos estudios. Sin embargo, el tipo de imÃĄgenes mostradas en el trabajo representa a los anunciantes en su mejor comportamiento, en lugar de mostrar cuÃĄn personalizados podrían ser eventualmente los anuncios visuales, a medida que los mÃĐtodos de orientaciÃģn del consumidor se unen con la IA generativa de respuesta rÃĄpida.

** No puedo identificar esta instituciÃģn con nombre, ya que ‘UCAS’ generalmente se resuelve a una conocida casa de clearing de solicitudes de universidad del Reino Unido. Agradezco la aclaraciÃģn.

† Que los investigadores prometen lanzar en el repositorio de GitHub asociado.

Publicado por primera vez el jueves 5 de febrero de 2026

Escritor sobre aprendizaje automÃĄtico, especialista en síntesis de imÃĄgenes humanas. Antiguo jefe de contenido de investigaciÃģn en Metaphysic.ai, hasta su disoluciÃģn en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]