Ângulo de Anderson

Desvalorizando Ações Com Retuítes Criados Adversamente

mm
Adicione Unite.AI às suas fontes preferidas no Google

Uma colaboração de pesquisa conjunta entre universidades dos EUA e a IBM formulou um conceito de ataque adversarial que é teoricamente capaz de causar perdas no mercado de ações, simplesmente alterando uma palavra em um retuíte de uma postagem no Twitter.

Em um experimento, os pesquisadores foram capazes de desabilitar o modelo de previsão Stocknet com dois métodos: um ataque de manipulação e um ataque de concatenação. Fonte: https://arxiv.org/pdf/2205.01094.pdf

Em um experimento, os pesquisadores foram capazes de desabilitar o modelo de previsão Stocknet com dois métodos: um ataque de manipulação e um ataque de concatenação. Fonte: https://arxiv.org/pdf/2205.01094.pdf

O ataque superfície para um ataque adversarial em sistemas de previsão de ações automatizados e baseados em aprendizado de máquina é que um número crescente deles está se baseando em mídia social orgânica como previsores de desempenho; e que manipular esses dados “no mundo” é um processo que pode, potencialmente, ser formulado de forma confiável.

Além do Twitter, sistemas desse tipo ingerem dados do Reddit, StockTwits e Yahoo News, entre outros. A diferença entre o Twitter e as outras fontes é que os retuítes são editáveis, mesmo que as postagens originais não sejam. Por outro lado, é possível fazer apenas posts adicionais (ou seja, comentários ou relacionados) no Reddit, ou comentar e avaliar – ações que são tratadas corretamente como partidárias e autopromocionais pelas rotinas e práticas de saneamento de dados dos sistemas de previsão de ações baseados em ML.

Em um experimento, no modelo de previsão Stocknet, os pesquisadores foram capazes de causar quedas notáveis no valor da previsão de ações por dois métodos, o mais eficaz dos quais, o ataque de manipulação (ou seja, retuítes editados), foi capaz de causar as quedas mais severas.

Isso foi efetado, de acordo com os pesquisadores, simulando uma substituição única em um retuíte de uma “fonte financeira respeitada” no Twitter:

As palavras importam. Aqui, a diferença entre 'preenchido' e 'exercido' (não uma palavra maliciosa ou enganosa, mas quase categorizada como um sinônimo) teoricamente custou a um investidor milhares em desvalorização de ações.

As palavras importam. Aqui, a diferença entre ‘preenchido’ e ‘exercido’ (não uma palavra maliciosa ou enganosa, mas quase categorizada como um sinônimo) teoricamente custou a um investidor milhares em desvalorização de ações.

O artigo afirma:

‘Nossos resultados mostram que o método de ataque proposto pode alcançar taxas de sucesso consistentes e causar perda monetária significativa em simulações de negociação, simplesmente concatenando um tuite perturbado, mas semanticamente semelhante.’

Os pesquisadores concluem:

‘Este trabalho demonstra que nosso método de ataque adversarial engana consistentemente vários modelos de previsão financeira, mesmo com restrições físicas de que o tuite bruto não pode ser modificado. Adicionando um retuíte com apenas uma palavra substituída, o ataque pode causar uma perda adicional de 32% em nosso portfólio de investimento simulado.

‘Ao estudar a vulnerabilidade do modelo financeiro, nosso objetivo é aumentar a conscientização da comunidade financeira sobre os riscos do modelo de IA, para que no futuro possamos desenvolver uma arquitetura de IA mais robusta com humanos no loop.’

O artigo é intitulado Uma Palavra Vale Mil Dólares: Ataque Adversarial em Tuites Engana Previsão de Ações, e vem de seis pesquisadores, provenientes da Universidade de Illinois Urbana-Champaign, da Universidade Estadual de Nova York em Buffalo e da Universidade Estadual de Michigan, com três dos pesquisadores afiliados à IBM.

Palavras Infelizes

O artigo examina se o campo bem estudado de ataques adversariais em modelos de aprendizado de máquina baseados em texto se aplica a modelos de previsão de ações, cuja capacidade de previsão depende de fatores muito “humanos” que só podem ser inferidos aproximadamente a partir de fontes de mídia social.

Como os pesquisadores observam, o potencial de manipulação de mídia social para afetar os preços das ações foi bem demonstrado, embora não ainda pelos métodos propostos no trabalho; em 2013, um tuite malicioso na conta hackeada do Associated Press apagou US$ 136 bilhões de valor de mercado em cerca de três minutos.

O método proposto no novo trabalho implementa um ataque de concatenação, que deixa o tuite original intacto, enquanto o cita de forma errada:

Do material suplementar do artigo, exemplos de retuítes contendo sinônimos substituídos que mudam a intenção e o significado da mensagem original, sem distorcê-la de forma que humanos ou filtros simples possam detectar – mas que podem explorar os algoritmos nos sistemas de previsão de ações.

Do material suplementar do artigo, exemplos de retuítes contendo sinônimos substituídos que mudam a intenção e o significado da mensagem original, sem distorcê-la de forma que humanos ou filtros simples possam detectar – mas que podem explorar os algoritmos nos sistemas de previsão de ações.

Os pesquisadores abordaram a criação de retuítes adversariais como um problema de otimização combinatória – a criação de exemplos adversariais capazes de enganar um modelo vítima, mesmo com um vocabulário muito limitado.

Substituição de palavras usando sememas – a 'unidade semântica mínima das línguas humanas'. Fonte: https://aclanthology.org/2020.acl-main.540.pdf

Substituição de palavras usando sememas – a ‘unidade semântica mínima das línguas humanas’. Fonte: https://aclanthology.org/2020.acl-main.540.pdf

O artigo observa:

‘No caso do Twitter, adversários podem postar tuites maliciosos que são criados para manipular modelos downstream que os tomam como entrada.

‘Propomos atacar postando tuites adversariais semanticamente semelhantes como retuítes no Twitter, para que possam ser identificados como informações relevantes e coletados como entrada do modelo.’

Para cada tuite em um pool especialmente selecionado, os pesquisadores resolveram o problema de seleção de palavras sob as restrições de orçamento de palavras e tuites, que colocam restrições severas em termos de divergência semântica da palavra original e da substituição de uma palavra “maliciosa/benigna”.

Os tuites adversariais são formulados com base em tuites pertinentes que são prováveis de serem permitidos em sistemas de previsão de ações downstream. O tuite também deve passar sem obstáculos pelo sistema de moderação de conteúdo do Twitter e não deve parecer contrafactual para um observador humano casual.

Seguindo trabalho anterior (da Universidade Estadual de Michigan, juntamente com CSAIL, MIT e o MIT-IBM Watson AI Lab), palavras selecionadas no tuite alvo são substituídas por sinônimos de um pool limitado de possibilidades de sinônimos, todas as quais devem ser semanticamente muito próximas da palavra original, mantendo sua “influência corruptora”, com base no comportamento inferido dos sistemas de previsão de ações.

Os algoritmos usados nos experimentos subsequentes foram o solucionador de otimização conjunta (JO) e o solucionador de otimização alternada (AGO).

Conjuntos de Dados e Experimentos

Essa abordagem foi testada em um conjunto de dados de previsão de ações que compreende 10.824 exemplos de tuites pertinentes e informações de desempenho do mercado em 88 ações entre 2014-2016.

Três “modelos vítimas” foram escolhidos: Stocknet; FinGRU (um derivado de GRU); e FinLSTM (um derivado de LSTM).

As métricas de avaliação consistiram em Taxa de Sucesso do Ataque (ASR) e uma queda na pontuação F1 do modelo vítima após o ataque adversarial. Os pesquisadores simularam uma estratégia de compra e venda para os testes. Lucro e Prejuízo (PnL) também foi calculado nas simulações.

Resultados dos experimentos. Veja também o primeiro gráfico no topo deste artigo.

Resultados dos experimentos. Veja também o primeiro gráfico no topo deste artigo.

Sob JO e AGO, a ASR aumenta em 10%, e a pontuação F1 do modelo cai em 0,1 em média, em comparação com um ataque aleatório. Os pesquisadores observam:

‘Um desempenho tão ruim é considerado significativo no contexto da previsão de ações, dado que a precisão de previsão de retorno intradiário é de apenas cerca de 60%.

Na parte de Lucro e Prejuízo do (ataque virtual) ao Stocknet, os resultados dos retuítes adversariais também foram notáveis:

‘Para cada simulação, o investidor tem US$ 10.000 (100%) para investir; os resultados mostram que o método de ataque proposto com um retuíte com apenas uma palavra substituída pode causar uma perda adicional de US$ 3.200 (75%-43%) em seu portfólio após cerca de 2 anos.’

 

Publicado originalmente em 4 de maio de 2022.

Escritor em aprendizado de máquina, especialista em síntese de imagem humana. Antigo chefe de conteúdo de pesquisa da Metaphysic.ai, até sua dissolução na Brahma.ai da DNEG.
Portfolio site: martinanderson.ai
Contato: martin@martinanderson.ai