Ángulo de Anderson
Desvalorizando Acciones con Retuits Crafted Adversarialmente

Una colaboración de investigación conjunta entre universidades de EE. UU. y IBM ha formulado un ataque adversarial de concepto de prueba que es teóricamente capaz de causar pérdidas en el mercado de valores, simplemente cambiando una palabra en un retuit de una publicación de Twitter.

En un experimento, los investigadores fueron capaces de obstaculizar el modelo de predicción Stocknet con dos métodos: un ataque de manipulación y un ataque de concatenación. Fuente: https://arxiv.org/pdf/2205.01094.pdf
La superficie de ataque para un ataque adversarial en sistemas de predicción de acciones automatizados y de aprendizaje automático es que un número creciente de ellos confían en las redes sociales orgánicas como predictores de rendimiento; y que manipular estos datos “en la naturaleza” es un proceso que puede, potencialmente, ser formulado de manera fiable.
Además de Twitter, los sistemas de este tipo ingieren datos de Reddit, StockTwits y Yahoo News, entre otros. La diferencia entre Twitter y las otras fuentes es que los retuits son editables, incluso si los tweets originales no lo son. Por otro lado, solo es posible hacer publicaciones adicionales (es decir, comentarios o relacionados) en Reddit, o comentar y calificar – acciones que son tratadas correctamente como partidistas y auto-serviciales por las rutinas y prácticas de saneamiento de datos de los sistemas de predicción de acciones basados en aprendizaje automático.
En un experimento, en el modelo de predicción Stocknet, los investigadores fueron capaces de causar caídas notables en la predicción del valor de las acciones por dos métodos, el más efectivo de los cuales, el ataque de manipulación (es decir, retuits editados), fue capaz de causar las caídas más severas.
Esto se logró, según los investigadores, al simular una sustitución única en un retuit de una fuente financiera “respetada” de Twitter:

Las palabras importan. Aquí, la diferencia entre ‘filled’ y ‘exercised’ (no una palabra maliciosa o engañosa, pero casi categorizada como sinónimo) ha costado teóricamente a un inversor miles en desvalorización de acciones.
El documento establece:
‘Nuestros resultados muestran que el método de ataque propuesto puede lograr tasas de éxito consistentes y causar pérdidas monetarias significativas en la simulación de operaciones simplemente concatenando un tuit perturbado pero semánticamente similar.’
Los investigadores concluyen:
‘Este trabajo demuestra que nuestro método de ataque adversarial engaña consistentemente a varios modelos de predicción financiera incluso con restricciones físicas que el tuit raw no puede ser modificado. Agregando un retuit con solo una palabra reemplazada, el ataque puede causar una pérdida adicional del 32% a nuestro portfolio de inversión simulado.
‘Al estudiar la vulnerabilidad del modelo financiero, nuestro objetivo es aumentar la conciencia de la comunidad financiera sobre los riesgos del modelo de aprendizaje automático, para que en el futuro podamos desarrollar una arquitectura de aprendizaje automático más robusta con humanos en el bucle.’
El documento se titula Una palabra vale mil dólares: ataque adversarial en tweets que engaña a la predicción de acciones, y proviene de seis investigadores, provenientes de la Universidad de Illinois en Urbana-Champaign, la Universidad Estatal de Nueva York en Búfalo y la Universidad Estatal de Míchigan, con tres de los investigadores afiliados a IBM.
Palabras Desafortunadas
El documento examina si el campo bien estudiado de ataques adversarios en modelos de aprendizaje profundo basados en texto es aplicable a modelos de predicción de acciones, cuya capacidad de predicción depende de factores muy “humanos” que solo pueden inferirse aproximadamente de fuentes de redes sociales.
Como señalan los investigadores, el potencial de la manipulación de las redes sociales para afectar los precios de las acciones ha sido bien demostrado, aunque no aún por los métodos propuestos en el trabajo; en 2013, un tuit malicioso en la cuenta de Twitter pirateada de Associated Press borró $136 mil millones de dólares de valor de mercado en unos tres minutos.
El método propuesto en el nuevo trabajo implementa un ataque de concatenación, que deja el tuit original intacto, mientras lo cita mal:

Del material suplementario para el documento, ejemplos de retuits que contienen sinónimos sustituidos que cambian la intención y el significado del mensaje original, sin distorsionarlo de tal manera que los humanos o los filtros simples puedan detectarlo, pero que pueden explotar los algoritmos en los sistemas de predicción de acciones.
Los investigadores han abordado la creación de retuits adversarios como un problema de optimización combinatoria – la creación de ejemplos adversarios capaces de engañar a un modelo víctima, incluso con un vocabulario muy limitado.

Sustitución de palabras utilizando sememas – la ‘unidad semántica mínima de los lenguajes humanos’. Fuente: https://aclanthology.org/2020.acl-main.540.pdf
El documento observa:
‘En el caso de Twitter, los adversarios pueden publicar tweets maliciosos que están diseñados para manipular a los modelos downstream que los toman como entrada.
‘Proponemos atacar publicando tweets adversarios semánticamente similares como retuits en Twitter, para que puedan ser identificados como información relevante y recopilados como entrada del modelo.’
Para cada tuit en un grupo de tweets especialmente seleccionado, los investigadores resolvieron el problema de selección de palabras bajo las restricciones de presupuesto de palabras y tweets, que colocan restricciones severas en términos de divergencia semántica desde la palabra original, y la sustitución de una palabra ‘maliciosa/benigna’.
Los tweets adversarios se formulan en función de tweets pertinentes que probablemente sean permitidos en los sistemas de predicción de acciones downstream. El tuit también debe pasar sin obstáculos a través del sistema de moderación de contenido de Twitter, y no debe parecer contrafactual al observador humano casual.
Seguido de trabajo previo (de la Universidad Estatal de Míchigan, junto con CSAIL, MIT y el MIT-IBM Watson AI Lab), se reemplazan palabras seleccionadas en el tuit objetivo con sinónimos de un grupo limitado de posibilidades de sinónimos, todas las cuales deben ser semánticamente muy cercanas a la palabra original, mientras mantienen su ‘influencia corruptora’, basada en el comportamiento inferido de los sistemas de predicción de acciones.
Los algoritmos utilizados en los experimentos posteriores fueron el solucionador de optimización conjunta (JO) y el solucionador de optimización alternada (AGO).
Conjuntos de Datos y Experimentos
Este enfoque se probó en un conjunto de datos de predicción de acciones que comprende 10,824 ejemplos de tweets pertinentes y información de rendimiento del mercado a través de 88 acciones entre 2014-2016.
Tres modelos ‘víctimas’ fueron elegidos: Stocknet; FinGRU (un derivado de GRU); y FinLSTM (un derivado de LSTM).
Las métricas de evaluación consistieron en la tasa de éxito del ataque (ASR) y una caída en la puntuación F1 del modelo víctima después del ataque adversarial. Los investigadores simularon una estrategia de compra-venta-posesión a largo plazo para las pruebas. La ganancia y pérdida (PnL) también se calcularon en las simulaciones.

Resultados de los experimentos. También ver el primer gráfico en la parte superior de este artículo.
Bajo JO y AGO, la tasa de éxito del ataque (ASR) aumenta en un 10%, y la puntuación F1 del modelo disminuye en 0,1 en promedio, en comparación con un ataque aleatorio. Los investigadores señalan:
‘Un rendimiento de este tipo es considerado significativo en el contexto de la predicción de acciones, dado que la precisión de predicción de la rentabilidad diaria es solo del 60%.’
En la rama de ganancias y pérdidas (PnL) del ataque (virtual) al Stocknet, los resultados de los retuits adversarios también fueron notables:
‘Para cada simulación, el inversor tiene $10,000 (100%) para invertir; los resultados muestran que el método de ataque propuesto con un retuit con solo un reemplazo de palabra puede causar una pérdida adicional de $3,200 (75%-43%) a su cartera después de unos 2 años.’
Publicado por primera vez el 4 de mayo de 2022.












