Ángulo de Anderson
Identificando Contenido Patrocinado en Sitios de Noticias con Aprendizaje Automático

Investigadores de los Países Bajos han desarrollado un nuevo método de aprendizaje automático que es capaz de distinguir contenido patrocinado o pagado dentro de plataformas de noticias, con una precisión de más del 90%, en respuesta al creciente interés de los anunciantes en formatos de publicidad nativa que son difíciles de distinguir de la producción periodística “real”.
El nuevo artículo, titulado Distinguiendo Contenido Comercial de Contenido Editorial en Noticias, proviene de investigadores de la Universidad de Leiden.

Subgráficos comerciales (rojo) y editoriales (azul) que emergen del análisis de los datos. Fuente: https://arxiv.org/pdf/2111.03916.pdf
Los autores observan que aunque las publicaciones más serias, que pueden dictar términos a los anunciantes, harán un esfuerzo razonable para distinguir el “contenido de socios” del flujo general de noticias y análisis, los estándares están cambiando lentamente pero de manera inexorable hacia una mayor integración entre los equipos editoriales y comerciales en una publicación, lo que consideran una tendencia alarmante y negativa.
‘La capacidad de disfrazar el contenido, voluntaria o involuntariamente, y la probabilidad de que los anuncios no sean reconocidos como tales, incluso si están etiquetados correctamente, es significativa. Los marketeros lo llaman publicidad nativa por una razón.’

Algunos ejemplos actuales de publicidad nativa, llamados variadamente ‘contenido de socios’, ‘contenido de marca’ y muchos otros nombres diseñados para oscurecer sutilmente la distinción entre contenido nativo y comercial en plataformas periodísticas.
El trabajo se llevó a cabo como parte de una investigación más amplia sobre la cultura de noticias en red en el canal ACED Reverb, con sede en Ámsterdam, que se centra en el análisis de datos de las tendencias periodísticas en evolución.
Obteniendo Datos
Para desarrollar datos de origen para el proyecto, los autores utilizaron 1,000 artículos y 1,000 anuncios de cuatro publicaciones de noticias holandesas y los clasificaron según sus características textuales. Dado que el conjunto de datos era relativamente modesto en tamaño, los autores evitaron enfoques de gran escala como BERT, y en su lugar evaluaron la efectividad de marcos de aprendizaje automático más clásicos, incluyendo Máquina de Vectores de Soporte (SVM), LinearSVC, Árbol de Decisión, Bosque Aleatorio, K-Vecinos Más Cercanos (K-NN), Descenso de Gradiente Estocástico (SGD) y Teorema de Bayes Naïve.
El corpus del canal Reverb fue capaz de proporcionar los 1,000 artículos necesarios, pero los autores tuvieron que extraer anuncios directamente de los cuatro sitios web holandeses presentados. Los datos obtenidos están disponibles en forma limitada (debido a preocupaciones de derechos de autor) en GitHub, junto con algunos de los códigos de Python utilizados para obtener y evaluar los datos.
Las cuatro publicaciones estudiadas fueron la conservadora Nu.nl, la más progresista Telegraaf, NRC y la revista de negocios De Ondernemer. Cada publicación estuvo representada de manera igual en los datos.
Fue necesario identificar y descartar posibles “filtraciones” en el léxico formado por la investigación – palabras que podrían aparecer en ambos tipos de contenido con poca distinción entre su frecuencia y uso, para establecer patrones claros para contenido nativo y patrocinado genuino.
Resultados
A través de los métodos probados para la identificación, los mejores resultados se obtuvieron con SVM, linearSVC, Bosque Aleatorio y SGD. Por lo tanto, los investigadores procedieron a utilizar SVM en el análisis posterior.

El mejor enfoque de modelo para la extracción de clasificación a través del corpus superó el 90% de precisión, aunque los investigadores observan que obtener una clasificación clara se vuelve más difícil al tratar con publicaciones orientadas a B2B, donde la superposición léxica entre contenido “real” y “patrocinado” es excesiva – quizás porque el estilo nativo del lenguaje empresarial ya es más subjetivo que la corriente general de convenciones de informes y análisis, y puede ocultar más fácilmente una agenda.

Gráficos de t-Distributed Stochastic Neighbor Embedding (t-SNE) para la separación de contenido real y patrocinado en las cuatro publicaciones.
¿Es el Contenido Patrocinado ‘Noticias Falsas’?
La investigación de los autores sugiere que su proyecto es novedoso en el campo del análisis de contenido de noticias. Los marcos capaces de identificar contenido patrocinado podrían allanar el camino para desarrollar un monitoreo año tras año del equilibrio entre la periodismo objetivo y la creciente porción de “publicidad nativa” que se sienta en casi el mismo contexto en la mayoría de las publicaciones, utilizando las mismas señales visuales (hojas de estilo CSS y otros formatos) que el contenido general.
En cierto sentido, la frecuente falta de contexto obvio para el contenido patrocinado está surgiendo como un subcampo del estudio de las “noticias falsas”. Aunque la mayoría de los editores reconocen la necesidad de separar “la iglesia y el estado”, y la obligación de proporcionar a los lectores divisiones claras entre contenido pagado y generado orgánicamente, las realidades de la escena periodística posterior a la impresión, y la creciente dependencia de los anunciantes, han convertido la desatención de los indicadores patrocinados en un arte fino en la psicología de la interfaz de usuario. A veces, las recompensas de ejecutar contenido patrocinado son lo suficientemente tentadoras como para arriesgar un desastre óptico importante.
En 2015, la plataforma de medios sociales y benchmarking competitivo Quintly ofreció un método de detección basado en inteligencia artificial para determinar si una publicación en Facebook es patrocinada, reclamando una tasa de precisión del 96%. Al año siguiente, un estudio de la Universidad de Georgia sostuvo que la forma en que los editores manejan la declaración de contenido patrocinado podría ser ‘complicidad con la decepción’.
En 2017, MediaShift, una organización que examina la intersección entre los medios y la tecnología, observó la creciente medida en que The New York Times monetiza sus operaciones a través de su estudio de contenido de marca, T Brand Studio, reclamando niveles decrecientes de transparencia alrededor del contenido patrocinado, con el resultado tácito de que los lectores no pueden distinguir fácilmente si el contenido es generado orgánicamente o no.
En 2020, otra iniciativa de investigación de los Países Bajos desarrolló clasificadores de aprendizaje automático para identificar automáticamente noticias financiadas por el estado ruso que aparecen en plataformas de noticias serbias. Además, se estimó en 2019 que las “soluciones de contenido de medios” de Forbes representan el 40% de sus ingresos totales a través de BrandVoice, el estudio de contenido lanzado por el editor en 2010.












