Ángulo de Anderson
Imágenes publicitarias generadas por IA que se dirigen a tu demografía – Y, eventualmente, a ti

Los anunciantes buscan personalizar los anuncios para cada espectador para generar clics, y aunque los creativos personalizados para cada persona son actualmente impracticables, una nueva investigación sugiere que la imagen generada por IA podría ser dirigida de manera efectiva a grupos demográficos específicos.
La publicidad personalizada presentada en la película de ciencia ficción de acción de Steven Spielberg de 2002 Minority Report ha dejado una impresión duradera, incluso inquietante, en la cultura, con su vívida representación de carteles publicitarios proactivos que reconocen a las personas en las multitudes y les gritan mensajes promocionales directamente.
Muchos grupos de consumidores pueden considerar este nivel de reconocimiento del espectador como una pesadilla, y aunque el progreso hacia ello se frenó debido a las consecuencias del escándalo de Cambridge Analytica escándalo, el ideal de compromiso directo y altamente dirigido sigue siendo un objetivo valioso en la publicidad.
En efecto, los sistemas que pueden profundizar en las características de un espectador específico siguen en desarrollo constante – aunque en tales casos, la investigación corporativa debe tomar medidas para respetar las leyes sobre información personalmente identificable (PII); leyes que se han fortalecido en Europa en la última década, con estas protecciones mejoradas extendidas a otros lugares a través de el efecto Bruselas.
Hola, tú
Ahora que los anuncios y el contenido de marketing generados por IA están en aumento, los anunciantes deben enfrentar el costo potencial de los anuncios de IA dirigidos a individuos específicos, donde las imágenes y el texto se generan oportunísticamente y en tiempo real.
Por ejemplo, incluso si una imagen personalizada se pudiera generar muy rápidamente, los costos a gran escala serían significativos. Además, los procesos de subasta de anuncios en línea automáticos operan en marcos de tiempo críticos, a nivel de milisegundos, lo que hace que el contenido de imagen personalizado sea desafiante, por el momento; y el contenido de video es una perspectiva aún más lejana.
Sin embargo, los obstáculos técnicos involucrados en abordar grupos de cohortes demográficas de nivel superior en una audiencia en línea (a través de laptops, teléfonos, televisores inteligentes, etc.) no son tan severos – y una nueva colaboración académica e industrial internacional está proponiendo una forma de crear imágenes publicitarias separadas para diferentes demografías, incluyendo factores como la edad y la ubicación:

Del nuevo trabajo: ejemplos de generación de anuncios personalizados, donde un solo producto se representa en diferentes estilos para diferentes grupos de espectadores. La fila superior muestra las imágenes de productos originales. Las tres filas siguientes muestran versiones adaptadas a tres tipos de audiencia distintos por producto, basadas en diferencias en rasgos como la edad, el estilo de vida o la preferencia estética. Estos tipos de grupo no están predefinidos, sino que se descubren automáticamente.
El nuevo marco – titulado Un tamaño, muchos ajustes (OSMF) – busca cerrar la brecha entre la publicidad de destino amplio y la personalización impracticablemente granular, generando diferentes imágenes de anuncios para grupos de audiencia automáticamente descubiertos, utilizando agrupación de productos para alinear el contenido visual con las preferencias de clic de demografías distintas
Los autores afirman:
‘[Presentamos] un marco unificado que alinea las preferencias de clic de grupo en la generación de imágenes publicitarias a gran escala.
‘OSMF comienza con la agrupación adaptativa de productos, que organiza dinámicamente a los usuarios según sus atributos y características de productos, representando cada grupo con características de preferencia colectiva ricas.’
Se dice que los resultados son de última generación.
Aunque el trabajo identifica grupos de cohortes diversos, el artículo no especifica qué características demográficas están representadas por cada G de agrupación, aunque estas parecen probablemente mapear a los grupos de segmentación de mercado tradicionales tradicionales.
Por lo tanto, no es fácil determinar, en base a los ejemplos dados en el artículo principal y el apéndice, por qué ciertos fondos o iluminación podrían atraer a un grupo más que a otro, ya que no conocemos los rasgos de ningún grupo:

No hay estilos consistentes ‘azul para niños, rosa para niñas’, etc., en los estilos de imagen específicos de cohorte, que podrían revelar a qué tipo de persona pertenece cada grupo – las definiciones, como se desprende de la literatura existente, son mucho más complejas y sutiles.
Lo que es tal vez más preocupante, para aquellos que desconfían de las prácticas de orientación publicitaria, es la posibilidad de explotar las perspectivas de usuario en la generación de imágenes específicas en anuncios**.
El nuevo artículo se titula Un tamaño, muchos ajustes: alineando las preferencias de clic de grupo en la generación de imágenes publicitarias a gran escala, y proviene de 17 investigadores de todo el Laboratorio Nacional de Reconocimiento de Patrones de Beijing; la ‘Escuela de IA de UCAS’; la empresa de comercio electrónico china JINGDONG; la Universidad de Ciencia y Tecnología de Hong Kong en Guangzhou; y el Laboratorio de Reconocimiento de Patrones de la Universidad de Ciencia y Tecnología de Nanjing.
Método
El sistema utiliza agrupación adaptativa (un método que encuentra agrupaciones naturales vinculando los rasgos de los usuarios con cómo responden a diferentes productos) para agrupar a los usuarios, en base a cómo sus rasgos configuran las preferencias visuales en un entorno de producto determinado. La implementación de los autores de este enfoque se llama Agrupación adaptativa de productos (PAAG).
Estas agrupaciones no están fijas de antemano, sino que se descubren a partir de patrones en los datos.
Un generador de imágenes condicional, titulado Generación de imágenes condicionada por preferencia (PCIG), utiliza luego el perfil de cada grupo para crear imágenes publicitarias que coinciden con los gustos probables del grupo:

El marco OSMF agrupa a los usuarios según cómo sus rasgos configuran las preferencias de productos, y luego utiliza los perfiles de grupo para generar imágenes de anuncios que coinciden con los gustos de cada grupo. PAAG maneja la agrupación, y PCIG crea las imágenes utilizando prompts y retroalimentación ajustados a cada grupo.
El generador de imágenes utiliza una versión no especificada de Stable Diffusion, junto con un conjunto de ControlNet apropiado (el último, para ayudar a mantener la coherencia entre las diversas generaciones de cohortes).
En el flujo de trabajo, PAAG primero codifica la relación entre las características de los usuarios y tanto los aspectos de texto como de imagen del producto, utilizando un conjunto de codificadores dedicados y un mecanismo de atención cruzada para combinarlos en una incrustación de preferencia unificada que refleja cuán probable es que un usuario haga clic en un anuncio determinado.
PAAG luego modela cómo diferentes combinaciones de atributos de usuario interactúan con tanto los títulos de productos como las imágenes de productos. Las características de texto y de imagen se extraen utilizando CLIP y codificadores basados en ResNet, y los rasgos de los usuarios como género, ubicación, edad o dispositivo se pasan a través de una MLP que permite la atención cruzada sobre las características de texto y de imagen del producto.
La incrustación resultante representa la probabilidad de clic de cada usuario para un producto determinado en un contexto visual determinado. Una vez que se obtienen estas incrustaciones de preferencia de usuario-producto, PAAG utiliza agrupación K-means para agrupar a los usuarios que responden de manera similar a un producto determinado.
PAAG elige el mejor número de grupos de usuarios para cada producto verificando cómo se separan los clusters. En lugar de utilizar solo un punto promedio por grupo, muestrea varios a diferentes distancias para capturar una gama más amplia de preferencias.
Estos perfiles de grupo se pasan luego como tokens al modelo de lenguaje grande multimodal de grupo (G-MLLM), que los utiliza para generar imágenes de anuncios personalizados para cada grupo.
Generación de imágenes basada en preferencias de usuario
En el lado del usuario, G-MLLM aprende a predecir qué miembros del grupo probablemente hagan clic a continuación y cómo describir los rasgos comunes en lenguaje natural. En el lado del producto, aprende a resumir el producto mostrado en una imagen y a generar subtítulos de estilo publicitario que coincidan con el artículo y el grupo.
Para reflejar el comportamiento del usuario real, el modelo se extiende a un modelo de recompensa de grupo (GRM). GRM se entrena en el conjunto de datos Preferencia de imagen publicitaria de grupo (GAIP) de los investigadores† (ver a continuación) para comparar pares de imágenes para el mismo producto e identificar cuál funciona mejor con un grupo determinado, utilizando datos de clic reales.
Este señal de recompensa se utiliza luego para ajustar G-MLLM con Group-DPO, un método que le enseña a favorecer los prompts que conducen a un mejor compromiso a nivel de grupo.
Datos y pruebas
Desarrollando GAIP
Al observar la falta histórica de conjuntos de datos relacionados con preferencias publicitarias basadas en grupos, y que las colecciones anteriores como Personalized Soups y CG4CTR son demasiado pequeñas o demasiado mal especificadas, los investigadores desarrollaron su propia colección, el mencionado GAIP, derivado de los ‘registros de publicidad industriales’ de una plataforma de comercio electrónico no especificada.
Los registros se recopilaron durante un período de tres semanas, con cada entrada registrando la imagen del producto y el título, el perfil del espectador (incluyendo edad, nivel de gasto y sensibilidad a promociones) y si el anuncio se hizo clic.
El conjunto de datos incluye más de 40 millones de usuarios, 2 millones de productos y casi 10 millones de imágenes publicitarias, con una gran variedad visual en los artículos.
Los usuarios se agruparon en clusters distintos para cada producto utilizando PAAG, y la tasa de clic (CTR) se calculó por imagen dentro de cada grupo:

Del material suplementario del nuevo artículo, un vistazo a algunos de los criterios definitorios para GAIT.
GAIP se forma como un conjunto de tuplas (imagen publicitaria, título del producto, incrustación del grupo, CTR específico del grupo) que empareja cada imagen y título con su CTR y la incrustación del grupo que lo vio.
Para garantizar la confiabilidad, solo se retienen los productos con suficiente exposición, lo que da como resultado un conjunto de datos de 610,172 muestras a nivel de grupo.
GAIP es sustancialmente más grande que los conjuntos de datos anteriores: mientras que la mayoría de las benchmarks anteriores involucran menos de diez grupos de usuarios, GAIP incluye casi 600,000 registros de preferencias de grupo reales, lo que ofrece una comprensión más profunda de las preferencias a nivel de grupo.
Pruebas
Para entrenar la tubería PCIG, los investigadores extrajeron características de imagen y texto utilizando ResNet y el codificador de texto CLIP, y luego los mapearon a incrustaciones de 128 dimensiones a través de capas lineales aprendibles. Para mantener la eficiencia, PAAG se limitó a cinco grupos de usuarios por producto.
Las incrustaciones de grupo se construyeron utilizando una estrategia de muestreo basada en percentiles, dibujando varios puntos de los percentiles 15, 55 y 95, para capturar tanto las preferencias centrales como periféricas.
LLaVA se utilizó como la base para G-MLLM, y el preentrenamiento se realizó durante diez épocas con un calendario de aprendizaje de coseno a una tasa de aprendizaje de 2e-6, lo que requirió un formidable cinco días de entrenamiento en un clúster de ocho GPU NVIDIA H100, cada una con 80GB de VRAM.
GRM se entrenó reconstruyendo GAIP con pares de imágenes de productos emparejados, y luego se inicializó con los mismos pesos que G-MLLM. Durante la etapa final de Group-DPO, GRM se congeló, y G-MLLM se ajustó con LoRA durante tres épocas – nuevamente, a una tasa de aprendizaje de 2e-5, en el mismo clúster NVIDIA.
Las métricas utilizadas para la primera evaluación fueron NDCG@5 y AUROC. NDCG@5 midió cómo diferentes cada grupo clasificó el mismo conjunto de imágenes de anuncios, con valores más bajos que indican una separación más clara en las preferencias; y AUROC se utilizó para evaluar cómo bien cada modelo distinguía entre contenido hecho clic y no hecho clic.
Todas las métricas se calcularon en los resultados de la agrupación de 1,000 productos, totalizando alrededor de 100,000 muestras, y se utilizaron para comparar PAAG con tres sistemas anteriores: CACS; WIYD; y JAC:

Resultados de modelado de preferencias en comparación con métodos anteriores. Valores más bajos de NDCG@5 y AUROC más altos indican un mejor rendimiento. Las mejores puntuaciones están en negrita, las segundas mejores subrayadas.
De estos resultados, los autores comentan:
‘[Nuestro] método logra un rendimiento superior en ambas métricas. Concretamente, PAAG logra el NDCG@5 más bajo (0.3066), superando a la mejor referencia (CACS), lo que indica patrones de preferencia entre grupos más distintos para una generación de anuncios de grupo efectiva.
‘Además, PAAG logra el AUROC más alto (0.6372), mejorando la referencia más fuerte (WIYD) en 0.0159.’
Una segunda ronda de pruebas verificó si el sistema podría emparejar mejor los anuncios con los grupos de usuarios correctos:

Comparación de CTR en línea que muestra que la generación personalizada de grupo (‘Nuestro’) supera a todas las referencias, incluyendo CAIG y G-MLLM preentrenado.
Aquí, PCIG mostró tasas de clic más fuertes que los modelos más antiguos como CAIG y G-MLLM, con una mejora del 5.5%. GRM también se probó fuera de línea verificando si podía elegir correctamente el mejor anuncio en un par, en base a las preferencias del grupo. Superó a todas las referencias, incluyendo modelos de propósito general, con una ganancia del 4.7% sobre CAIG.
Una prueba cualitativa final se realizó para evaluar si PCIG podría reflejar las preferencias a nivel de grupo en el estilo de sus imágenes generadas. Como se muestra en la figura a continuación, el mismo producto se representó de manera diferente para cada grupo, con cambios en la paleta, el tono y la composición visual:

Resultados completos de las pruebas cualitativas, previamente vistas en el artículo.
Estas variaciones se alinearon, según los autores, con las preferencias de clic inferidas para cada grupo, lo que demuestra que PCIG podría producir salidas estilísticamente diversas mientras preservaba la relevancia y el atractivo. Los autores afirman:
‘[PCIG] garantiza que las imágenes estilísticamente diversas acomoden las preferencias de clic de grupos de usuarios distintos, demostrando así su fuerte capacidad para adaptar la generación a las demandas heterogéneas de los usuarios y capturar las sutiles diferencias de preferencia a nivel de grupo, destacando su potencial para la generación de imágenes publicitarias de grupo a gran escala.’
Conclusión
Quizás el aspecto más intrigante de este proyecto sea la correlación desconocida entre los estilos de salida en imágenes dirigidas a grupos para el mismo producto (de los cuales hay varias páginas más de ejemplos en el material suplementario del artículo que podemos reproducir aquí).
¿Podemos asumir que los entornos urbanos están relacionados con la edad, es decir, con los graduados que comienzan, y que los entornos rurales están dirigidos a tipos más prósperos de Gen X que identifican la carretera abierta como una especie de ‘última libertad’? Uno puede interpretar estos resultados de prueba todo el día.
El potencial de tales sistemas descansa en dos factores: la perspicacia y la latencia. La perspicacia depende de si los sistemas de seguimiento emergentes aún pueden extraer información significativa de los usuarios para respaldar una publicidad de cohorte efectiva, al mismo tiempo que sentan las bases para anuncios más precisos y dirigidos individualmente en el futuro.
La latencia plantea un desafío mayor, ya que estas imágenes de anuncios personalizadas deben generarse y entregarse casi instantáneamente; aunque algunos modelos de texto a imagen recientes pueden producir resultados en solo unos segundos, incluso ese retraso puede ser demasiado largo para las subastas de anuncios en tiempo real.
Un posible remedio es producir las imágenes localmente, en la GPU del navegador, evitando viajes de ida y vuelta en la red; o crear un conjunto de imágenes de antemano, precargadas en el cliente.
** Este aspecto se elide en el nuevo artículo, al igual que el potencial de abuso de los nuevos marcos de IA se suaviza a menudo mediante el uso de figuras de animales acogedores (en lugar de pornografía de IA) en los nuevos estudios. Sin embargo, el tipo de imágenes mostradas en el trabajo representa a los anunciantes en su mejor comportamiento, en lugar de mostrar cuán personalizados podrían ser eventualmente los anuncios visuales, a medida que los métodos de orientación del consumidor se unen con la IA generativa de respuesta rápida.
** No puedo identificar esta institución con nombre, ya que ‘UCAS’ generalmente se resuelve a una conocida casa de clearing de solicitudes de universidad del Reino Unido. Agradezco la aclaración.
† Que los investigadores prometen lanzar en el repositorio de GitHub asociado.
Publicado por primera vez el jueves 5 de febrero de 2026












