Ángulo de Anderson

Identificando a los Crowdturfers de Instagram con Aprendizaje Automático

mm
Añade Unite.AI a tus fuentes preferidas en Google

Investigadores en Italia e Irán afirman haber formulado el primer sistema de aprendizaje automático capaz de reconocer la actividad de “crowdturfing” de cuentas de influencia humanas (en lugar de automatizadas) en la plataforma de Instagram. Los crowdturfers son personas reales que realizan servicios de “construcción de perfil” para plataformas que venden dicha actividad a gran escala.

El nuevo método afirma tener una puntuación de precisión del 95% y utiliza el aprendizaje semi-supervisado en sistemas de Procesamiento de Lenguaje Natural (NLP).

Los autores afirman que, según su conocimiento, su sistema representa el primer sistema de detección de crowdturfing (CT) que puede identificar de manera fiable cuentas no automatizadas que participan en compromisos de perfil y aumento de engagement falsos y pagados.

Para lograr esto, los autores compraron 1293 perfiles de crowdturfing de 11 proveedores de plataformas de CT con el fin de obtener datos para entrenar su detector de CT. Dado que Instagram tiene medidas anti-bot efectivas, los investigadores señalan que aquellos que buscan explotar la enorme base de usuarios de la plataforma para fines comerciales han recurrido a pagar a influyentes de Instagram genuinos para “interactuar estratégicamente” con cuentas “cliente”, principalmente compartiendo comentarios o a través de actividad relacionada con comentarios en publicaciones.

Después de entrenar el modelo, los autores lo analizaron para examinar los perfiles de compromiso de 20 “mega-influencers”, cada uno con más de 1 millón de seguidores, y concluyeron que “más del 20% de su compromiso era artificial”.

El documento se titula ¿Estamos todos en un programa de Truman? Detección de crowdturfing en Instagram a través de auto-entrenamiento, y proviene de cinco investigadores de la Universidad de Padova en Italia y la Universidad Imam Reza en Irán.

Violando los Términos de Servicio de Instagram

A diferencia de Twitter, que es favorecido por los investigadores de medios sociales debido a su compromiso de ayudar en la investigación, Instagram no proporciona ninguna API o volcados de datos actualizados para ayudar a los investigadores, y prohíbe la navegación impulsada por máquina en sus Términos de Servicio. Por lo tanto, la primera tarea de los investigadores fue obtener una exención de su Junta de Revisión Institucional, justificada por trabajos previos que utilizaron un enfoque similar para investigar “actividades subterráneas”.

Los servicios de crowdturfing se compraron para cuentas de Instagram frescas creadas por los investigadores para sus propósitos, todas las cuales se eliminaron después del experimento, evitando la participación de usuarios “legítimos”. Ni las cuentas de influencia estudiadas ni los servicios de plataforma de CT se nombran.

Otro obstáculo ético fue que los investigadores no podían solicitar el consentimiento de los influyentes que se estudiaban, debido al efecto Hawthorne (es decir, podría haber cambiado el comportamiento de los influyentes), y esta exención también fue otorgada por la IRB.

Finalmente, dado que Instagram permite la “recopilación manual” de datos, los investigadores comprometieron su violación de los Términos de Servicio configurando sus herramientas de extracción automática para “velocidad humana”, lo que requirió una fase de recopilación de datos de cinco meses.

Humanos a la Venta

Los investigadores compraron 100 perfiles de “seguidores falsos” de cada uno de 11 proveedores (sin nombrar).

El documento establece*:

‘Todos los proveedores que seleccionamos aseguran entregar seguidores que interactúan con los perfiles objetivo mediante el “me gusta” y comentarios en sus publicaciones para aumentar su tasa de compromiso.

‘Estos perfiles de CT se identifican como seguidores de alta calidad y suelen costar más que los perfiles “base” falsos. La confiabilidad de estos proveedores está respaldada por plataformas de revisión famosas como TrustPilot.’

Del documento, estadísticas sobre los proveedores de plataforma de CT (anónimos), cada uno un mercado para cuentas de influencia

Del documento, estadísticas sobre los proveedores de plataforma de CT (anónimos), cada uno un mercado para cuentas de influencia “corrompidas” del mundo real. Esta tabla describe la información informada por los proveedores y recuperada por los investigadores a través del análisis de los 100 perfiles comprados de cada fuente. Fuente: https://arxiv.org/pdf/2206.12904.pdf

El costo promedio de comprar a un influyente de Instagram, señala el documento, no es tan alto, aproximadamente $3 por 100 “seguidores de alta calidad”. Los autores señalan:

‘La mayoría de los proveedores entregan los seguidores dentro de unas pocas horas. Ofrecen una protección contra caídas, lo que significa que el número de seguidores que el cliente compra permanecerá estable con el tiempo o se entregarán nuevos seguidores para reponer los perdidos.’

Los investigadores informan que algunas de sus cuentas de Instagram frescas sufrieron una pérdida del 15-20% de seguidores de CT después de un mes, pero que en ciertos casos ganaron más de lo esperado. Para el proveedor de CT más caro (CT-10, en la tabla de arriba), solo se perdieron tres seguidores después de un mes.

El documento señala que la relación entre seguidores y seguidos se vuelve más “auténtica” cuanto más se paga al proveedor de CT, con el segundo proveedor más caro que ofrece una relación muy cercana a la línea de base de un usuario estándar.

Una característica de una cuenta de Instagram de CT es que su perfil rara vez se configurará como “privado” (un hecho que permitió extraer datos de los seguidores falsos comprados, ya que la mayoría de los análisis se centraron en perfiles y comentarios relacionados), aunque esto no debe considerarse como una señal “confiable” en este sentido.

‘Las personas que se unen a estas plataformas están interesadas en generar una cantidad mínima de publicaciones que las hagan confiables, excepto en pocos casos (CT-4, CT-10). Los perfiles de baja calidad muestran un desequilibrio muy alto en seguidores y seguidos, y el número promedio de publicaciones es cercano a 0, muy por debajo de los perfiles de CT.’

Datos

Los investigadores recopilaron datos a través de una implementación del marco de automatización del navegador Selenium. El conjunto de datos resultante incluye información de perfil de 1293 usuarios de CT y 1307 usuarios no CT.

Esta cantidad de muestra admitidamente baja hizo que fuera factible configurar Selenium a una velocidad humana creíble durante un período de tiempo racional. Además, los autores señalan que el poder representativo/interpretativo de las técnicas de aprendizaje semi-supervisado se adapta muy bien a conjuntos de datos más pequeños. Después de experimentar, para fines de exhaustividad, con un modelo completamente supervisado, los investigadores concluyen:

‘[Los] resultados en el modo semi-supervisado no difieren significativamente de los del modo supervisado. Esto sugiere que los perfiles de CT comparten características muy similares, y que el algoritmo puede converger [a través de una pequeña cantidad de] datos etiquetados.’

Los autores recopilaron todos los datos disponibles del código fuente de las páginas de perfil de los usuarios “comprometidos”, incluidos detalles generalmente oscurecidos cuando se representan, como el elemento #videos.

Luego, pre-procesaron las características de los datos eliminando aquellas con varianza cero o baja, y finalmente convirtieron cualquier dato categórico o no numérico en características estrictamente numéricas o booleanas.

Características del conjunto de datos final.

Características del conjunto de datos final.

Método y Exploraciones

Además de Selenium, las tecnologías utilizadas en los experimentos incluyen: una versión de SpaCy implementada con una canalización basada en transformadores; un clasificador de auto-entrenamiento de scikit learn self-training; y el marco de Instaloader.

No hay una sección de “resultados” convencional en el nuevo documento, ya que trata de un objetivo (es decir, la inferencia automática de cuentas de Instagram corruptas) que se desvía del locus de interés central hasta la fecha (es decir, la inferencia automática de actividad de bot automatizada en Instagram), lo que significa que no hay un trabajo previo con el que compararlo.

Los investigadores adoptaron una amplia gama de métodos en los usuarios disponibles comprados, (que sienten cómodos describiendo como “falsos” en lugar de solo “no CT”, ya que estas cuentas genuinas realizan actividades de compromiso no orgánico y pagado), a través de una serie de tecnologías relacionadas con NLP.

Entre los aspectos estudiados se encontraban el análisis de lenguaje (que, en el mundo de CT, casi siempre se convierte en inglés, aunque las plataformas de CT también ofrecen seguidores no ingleses geolocalizados); recuentos de comentarios (donde los usuarios falsos se adhieren muy de cerca a la frecuencia de los usuarios reales, por miedo a la detección); y análisis de palabras comunes:

Nubes de palabras de usuarios falsos y reales.

Nubes de palabras de usuarios falsos y reales.

El documento señala que la prevalencia de la palabra “dokter” (ver imagen de arriba) en cuentas falsas parece estar relacionada con una campaña interna específica:

‘“Dokter” [apareció] en 1069 comentarios distintos. Al investigar más a fondo las cuentas que spammean [esta] palabra, encontramos una pequeña parte de lo que parece ser un botnet cuyo objetivo es spam “cuentas de médicos de Instagram”. Todas estas cuentas de médicos tienen un enlace de WhatsApp Business que, una vez hecho clic, inicia una conversación con un mensaje para completar.’

Hasta donde pueden deducir los investigadores, este extraño artefacto puede ser un remanente de un botnet grande que encontraron mientras buscaban actividades de usuarios de Instagram reales.

En total, los investigadores recopilaron 603,007 comentarios de publicaciones a través de 248,388 usuarios de Instagram únicos, de los cuales, según estiman los autores, 55,719 eran cuentas de crowdturfing.

El documento señala con interés la dominancia de temas con temas femeninos en los datos recopilados. Después de utilizar GPU-PDMM (una técnica desarrollada para las publicaciones obligatoriamente cortas en Twitter) para extraer 12,830 comentarios adecuados de un corpus disponible de 121,822 comentarios, el algoritmo encontró que al considerar el contenido de 12 hombres y 8 mujeres, la mayoría de los comentarios tratan sobre temas relacionados con mujeres.

Los 10 temas principales extraídos de comentarios falsos en uno de los experimentos de los investigadores.

Los 10 temas principales extraídos de comentarios falsos en uno de los experimentos de los investigadores.

Los investigadores concluyen:

‘[Mientras que] Instagram y la comunidad de investigación se han centrado mucho en detectar bots y cuentas automatizadas, creemos que se deben realizar más estudios sobre las actividades de CT, que afectan negativamente al marketing de influencia, la plataforma de Instagram y la mayoría de sus usuarios.’

 

* La URL de TrustPilot citada por los investigadores se ha omitido.

Publicado por primera vez el 28 de junio de 2022.

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai