Ángulo de Anderson
Nueva investigación propone publicidad verdaderamente ‘personalizada’

En una redefinición de ‘autopromoción’, un nuevo método explora los clics de un usuario para crear anuncios web personalizados basados en su propia historia particular.
Aunque las agencias publicitarias están ansiosas por desacreditar la idea de que existen embudos publicitarios que pueden servir anuncios basados en lo que acaba de decir en la comodidad de su hogar, el alcance de la ‘personalización’ demostrada por los anuncios en sitios web y aplicaciones de redes sociales ha generado titulares en los últimos años.
El escenario ideal para el anunciante siempre ha sido que el anuncio servido sea una ‘ajuste exacto’ para el espectador. Dentro de los límites de la reacción pública sobre el seguimiento en línea, y de las medidas preventivas que el usuario puede haber instalado contra dicho seguimiento, la inteligencia artificial generativa (dejando de lado los temores sobre publicidad en modelos de lenguaje grande en un mundo post-búsqueda) es capaz de producir imágenes y texto de anuncios con suficiente rapidez para su despliegue en tiempo real.
Sin embargo, el principal impulso de la investigación y la mayoría de las implementaciones en esta línea hasta la fecha se han basado en estadísticas de uso agregadas, de modo que cualquier anuncio generado para un espectador se basaría en el grupo de cohorte supuesto del espectador, en lugar de su propia historia única.
Ahora, una nueva colaboración de investigación entre China y EE. UU. presenta un sistema para generar imágenes y texto de anuncios para usuarios individuales aprendiendo de sus propios clics pasados cuando están conectados a un sitio, superando las suposiciones basadas en cohortes que han gobernado la mayoría de la investigación sobre publicidad personalizada hasta la fecha:

Ejemplos de generaciones que muestran anuncios personalizados. Por supuesto, sin la historia del usuario como contexto, el impacto completo solo puede imaginarse. Fuente
Inusualmente, el nuevo enfoque evita modelos basados en difusión en favor de una arquitectura autoregresiva – la principal diferencia radica en que los modelos de difusión refinan gradualmente una imagen a partir de ruido visual, mientras que los modelos autoregresivos generan contenido una pieza a la vez, prediciendo cada nuevo elemento a partir de todo lo que vino antes.
Para respaldar el nuevo modelo generativo, los autores desarrollaron lo que afirman es el primer conjunto de datos de imagen/texto a gran escala para publicidad personalizada, así como una métrica novedosa diseñada para evaluar esta tarea específica. En las pruebas, encontraron que su enfoque superó tanto los puntos de referencia generales como los métodos y marcos existentes que abordan este desafío.
Jardín amurallado
Vale la pena señalar el alcance propuesto del trabajo, que no ofrece a los anunciantes una forma de eludir las nuevas medidas contra el seguimiento de terceros, sino que da a un minorista lo suficientemente grande el poder de poblar a un cliente conectado con anuncios que se relacionan directamente con esa persona en particular.
Esto no se limita necesariamente a los clientes que están navegando actualmente en el sitio web del minorista: dependiendo del alcance en el que el usuario ha concedido al minorista el poder de rastrearlos en otros sitios, podrían ser presentados con anuncios dirigidos en cualquier número de sitios web que participen en subastas de anuncios que el minorista utiliza.
Este tipo de alcance publicitario tiende a estar limitado a grandes minoristas de alto volumen, como Amazon, en Occidente (y notamos que un minorista chino de tamaño similar ha participado en el nuevo trabajo – véase a continuación), aunque cualquier empresa similarmente grande (como una plataforma de redes sociales popular) podría, en teoría, generar un marco generativo similar.
El nuevo artículo se titula Diseña tu anuncio: Generación de imagen y texto de publicidad personalizada con modelos autoregresivos unificados, y proviene de 18 autores de la Universidad Sun Yat-Sen en Guangzhou, la Universidad del Noreste y el mayor minorista de China, JD.com (el último de los cuales tiene acceso precioso a las historias y hábitos de los compradores). El código ha sido puesto a disposición a través de GitHub, y los puntos de referencia relevantes se han puesto a disposición también a través de este enlace.
Datos y método
El conjunto de datos construido para el proyecto se titula Imagen-texto de publicidad personalizada (PAd1M), y se alimenta de datos proporcionados por el contribuyente del proyecto JD.com. Los autores afirman:
‘Cada producto proporciona generalmente más de diez imágenes y textos candidatos, lo que garantiza que las preferencias diversas puedan detectarse por completo. Para permitir un modelado de preferencias confiable, recopilamos historias de clics de usuario completas sobre imágenes y textos, filtrando a los usuarios con actividad insuficiente para reducir el ruido.
‘Esto produce un conjunto de datos de 1.145.371 usuarios, con 18.923.555 imágenes y textos de productos clicados, con un promedio de más de dieciséis comportamientos multimodales históricos por usuario.’
Para cada usuario, se seleccionó una pareja de imagen-texto clicada previamente como el ejemplo objetivo, después de lo cual el producto en sí se aisló de la imagen utilizando Grounded SAM.
Las descripciones y puntos de venta suministrados por el vendedor se adjuntaron entonces al registro, creando un conjunto de datos en el que cada anuncio objetivo está acompañado de una imagen de producto transparente; información de producto estructurada; y una historia de interacciones de imagen y texto anteriores, destinada a capturar los intereses y preferencias previas del usuario:

Un perfil de usuario del conjunto de datos PAd1M, que muestra un anuncio objetivo junto con la información de producto utilizada para generararlo, y las interacciones de imagen y texto históricas utilizadas para modelar las preferencias del usuario.
El conjunto de datos resultante ofrece una escala de más de un millón de usuarios y casi 19 millones de registros de imágenes y textos clicados, con los autores afirmando que la colección es sustancialmente más grande que los conjuntos de datos de personalización anteriores.
Además, los datos, inusualmente para esta línea de investigación, combinan tanto imágenes como texto, lo que permite modelar las preferencias del usuario en varias modalidades, en lugar de dentro de un solo dominio.
Pad1M también cuenta con un seguimiento de preferencias a nivel individual; a diferencia de los conjuntos de datos de publicidad anteriores, que se construyeron alrededor de tasas de clic agregadas en grandes grupos, PAd1M vincula interacciones a usuarios específicos de los datos de JD.com.
Para las métricas, además de las opciones estándar de BLEU y ROUGE, los investigadores desarrollaron su propia medición personalizada titulada Similitud de fondo de producto (PBS). Basada en la iniciativa MoCo-v3 anterior, PBS se entrenó en 681.123 pares de imágenes que muestran el mismo producto contra fondos diferentes, lo que permite a la métrica centrarse en la variación contextual en lugar del producto en sí:

La similitud de fondo de producto (PBS) asigna puntajes de similitud marcadamente diferentes a anuncios que contienen el mismo producto pero lo colocan en contextos visuales diferentes. Por el contrario, las métricas competidoras producen separaciones mucho más pequeñas.
Durante el entrenamiento, cada imagen se emparejó con ella misma como ejemplo positivo, mientras que una imagen del mismo producto colocada en un entorno diferente sirvió como ejemplo negativo, una estrategia de entrenamiento destinada a aumentar la sensibilidad al contexto del fondo. Los resultados de la evaluación, según el artículo, indican diferencias de similitud más grandes entre fondos coincidentes y no coincidentes que las producidas por CLIP, DINO v3 o la mencionada MoCov3.
Como se muestra en la sección superior izquierda de la imagen a continuación*, los investigadores utilizaron un modelo generativo de anuncio unificado (Uni-AdGen) que utiliza una arquitectura de visión-lenguaje autoregresiva para generar tanto texto como imágenes de anuncios. El proceso está guiado por una instrucción estructurada que incluye la definición de la tarea y una descripción del producto, junto con puntos de venta clave:

Visión general del método.
Los tokens de delimitación especiales definen la parte de la secuencia reservada para el copiado del anuncio. Después de que se ha generado el texto, un token de imagen dedicado desencadena la generación de la imagen, mientras que un token de imagen de cierre marca su finalización, y los tokens generados se envían posteriormente a decodificadores de texto e imagen separados.
Para las imágenes, se utiliza el decodificador VQ-GAN de LlamaGen para convertir los tokens de imagen discretos de regreso a píxeles.
De esta manera, la arquitectura unificada genera texto e imágenes dentro de un solo marco de predicción de token siguiente, en lugar de confiar en tuberías separadas – el método adoptado para sistemas publicitarios anteriores con un ámbito similar.
Durante el entrenamiento, el modelo aprende ambas modalidades juntas, con tokens de texto predichos en función de la secuencia de entrada y el texto generado previamente. Los tokens de imagen se predicen utilizando la secuencia de entrada, el texto generado y los tokens de imagen generados previamente.
Para mantener los anuncios generados vinculados al producto promocionado, Uni-AdGen utiliza un módulo de percepción de primer plano basado en DINO v2, para inyectar información de imágenes de producto transparentes en el modelo autoregresivo.
Ajuste de instrucción (entrenar el modelo para seguir instrucciones de generación específicas del producto derivadas de descripciones y puntos de venta) también se utilizó para mejorar la adherencia a las descripciones y puntos de venta proporcionados por el vendedor, con GPT-4o utilizado para filtrar ejemplos de entrenamiento no aptos.
La personalización se basó en un módulo de comprensión de preferencias de grano grueso a fino. Las interacciones históricas se filtraron primero a través de una tubería de muestreo de similitud de producto (PSS) para favorecer productos que se asemejan al artículo objetivo. Los registros restantes se procesaron entonces mediante una etapa de extracción de preferencias multimodales diseñada para identificar los elementos visuales y textuales más propensos a reflejar los intereses del usuario – y esas preferencias se insertaron en la llamada, para guiar la generación.
Pruebas
Los autores afirman que su enfoque de prueba se deriva de DeepSeek’s Janus-Pro 7B.
El modelo se entrenó con un tamaño de lote de cuatro, bajo el optimizador AdamW a una tasa de aprendizaje de 5e-5. El modelo base se ajustó mediante LoRA, con la percepción de primer plano y la extracción de preferencias multimodales completamente ajustadas (es decir, a diferencia de LoRA, los pesos del modelo base se alteraron permanentemente).
Todas las pruebas se ejecutaron en una GPU NVIDIA B200 con 192 GB de VRAM. Para la generación de imágenes, se utilizaron PickScore, ImageReward y ASE para medir la calidad visual, mientras que m-BLEU y m-ROUGE† se utilizaron para evaluar el texto de los anuncios. Los evaluadores humanos también evaluaron la realismo de la imagen y la calidad del diseño, junto con la precisión y fluidez del texto, con todas las métricas calculadas en 500 productos.
Para la generación de imágenes, los puntos de referencia comprendieron Qwen2.5-VL y GPT-4o para crear instrucciones de fondo a partir de imágenes de productos, seguidos de ReliableAd, PosterMaker y Flux-Fill para generar los anuncios finales. Las comparaciones de generación de texto se realizaron contra Qwen2.5, Qwen3 y DeepSeek-R1.
Los resultados cuantitativos iniciales de la generación de anuncios se muestran a continuación:

Rendimiento en la referencia de generación de publicidad general. Uni-AdGen igualó o superó los puntos de referencia de generación de imágenes más fuertes en calidad estética y PickScore, mientras que el modelo de imagen y texto unificado logró la puntuación m-ROUGE más alta entre todos los enfoques de generación de texto. Los resultados de la evaluación humana permanecieron competitivos en ambas modalidades.
De estos resultados, los autores afirman:
‘[Nuestro] método logra el mejor rendimiento en ImageReward y ocupa el segundo lugar en PickScore y evaluación humana, demostrando su rendimiento superior en estética y alta tasa de disponibilidad. Si bien ReliableAd lidera en evaluación humana, se queda atrás significativamente en las métricas estéticas. Por el contrario, PosterMaker y Flux-Fill generan imágenes visualmente atractivas pero sufren limitaciones de usabilidad notables.
‘Gracias a los enfoques de control efectivos, [nuestro] método logra con éxito un equilibrio óptimo entre contenido visual y utilidad práctica.’
La generación de anuncios personalizados se evaluó en 500 usuarios con historias de interacción registradas, utilizando la mencionada PBS para medir la similitud de la imagen, y BLEU y ROUGE para comparar el texto generado con los productos que los usuarios habían hecho clic:
Debido a que los puntos de referencia de publicidad general utilizados en el experimento anterior no podían incorporar historias de usuario, las comparaciones se trasladaron a sistemas diseñados para la personalización. Para la generación de imágenes, Flux-Kontext y Pigeon se seleccionaron como puntos de referencia. Flux-Kontext se proporcionó con una cuadrícula de imágenes históricas de usuario junto con la imagen del producto objetivo, lo que permitió que las preferencias anteriores influyeran en la generación.
Dado que Pigeon no admite la colocación de productos controlada de forma nativa, el módulo de percepción de primer plano desarrollado para Uni-AdGen se integró para preservar la consistencia del producto. Para la generación de texto, se utilizaron Qwen3 y DeepSeek-R1, con descripciones de productos históricos insertadas directamente en sus plantillas de instrucción para proporcionar contexto específico del usuario:

Resultados de la generación de anuncios personalizados. Uni-AdGen superó a Flux-Kontext, Pigeon, Qwen3 y DeepSeek-R1 en todas las métricas de personalización informadas, mientras que el estudio de ablación indicó que los datos históricos de usuario, el muestreo de similitud de producto (PSS) y la extracción de preferencias multimodales contribuyeron cada uno con ganancias medibles.
Aquí los autores comentan:
‘Los resultados visualizados [incluidos en la imagen a continuación] muestran que Flux-Kontext no entiende las preferencias del usuario y sigue siendo susceptible al ruido a nivel de muestra, lo que resulta en una desviación significativa de la verdad, como los artículos irrelevantes en la imagen de la motocicleta.’

Ejemplos de generación de anuncios personalizados. En comparación con Flux-Kontext, Pigeon, Qwen3 y DeepSeek-R1, Uni-AdGen produjo imágenes que se ajustaban más estrechamente al estilo visual y al contexto de los anuncios que los usuarios habían hecho clic, mientras generaba texto que capturaba una proporción más grande de los atributos y puntos de venta del producto presentes en los ejemplos de verdad. Los términos coincidentes se resaltan en verde.
Los ejemplos cualitativos, según los autores, indican que Flux-Kontext y Pigeon a menudo produjeron resultados que se desviaban de las características visuales de los anuncios que los usuarios habían hecho clic; mientras que el texto generado por Qwen3 y DeepSeek-R1 omitió algunos puntos de venta presentes en los ejemplos de verdad.
Conclusión
La utilidad de este proyecto depende enteramente del opt-in del usuario, y ampliar el alcance de este sistema ‘predictivo’ más allá del ámbito del dominio que controla la historia del usuario – en este caso, JD.com – requiere un conjunto aún más relajado de permisos de usuario explícitos, en la mayoría de los territorios.
Sin embargo, el sistema se basa en el tipo de efecto de red en gran escala que funciona en dicho escenario, y en la idea (quizás ligeramente optimista) de que los usuarios encontrarán este tipo de sistema de recomendación verdaderamente personalizado y hasta presciente útil en lugar de intrusivo, al menos dentro del contexto de un gigante minorista.
* Esta imagen se basa en la nueva y preocupante tendencia de ‘figuras recopiladas’ en artículos de investigación, donde ilustraciones que antes habrían sido 3-4 figuras diferentes se recopilan en una (con el fin de cumplir con las pautas de presentación sobre la longitud máxima del artículo principal) y se utilizan como material de referencia, a menudo sin una explicación adecuada en la leyenda acompañante.
† ‘m’-prefijo indica comparación con múltiples textos candidatos.
Publicado por primera vez el martes 2 de junio de 2026. Enmendado a las 18:21 EET para corregir el ‘muro’ final a ‘jardín amurallado’ en el último párrafo.












