Modelos e plataformas de IA
Algoritmo TextFooler Engana IA de NLP
Embora os algoritmos e sistemas de processamento de linguagem natural tenham se tornado impressionantes nos últimos anos, eles ainda são vulneráveis a um tipo de exploração conhecido como “exemplo adversário”. Exemplos adversários são frases cuidadosamente projetadas que podem causar que um sistema de NLP se comporte de maneira inesperada e indesejada. Os programas de IA podem ser feitos para se comportar mal com esses exemplos estranhos, e, como resultado, os pesquisadores de IA estão tentando projetar maneiras de se proteger contra os efeitos dos exemplos adversários.
Recentemente, uma equipe de pesquisadores da Universidade de Hong Kong e da Agência de Ciência, Tecnologia e Pesquisa de Cingapura colaborou para criar um algoritmo que demonstra o perigo dos exemplos adversários. Como relatado pela Wired, o algoritmo foi apelidado de TextFooler pela equipe de pesquisa e funciona alterando sutilmente partes de uma sentença, afetando como um classificador de NLP pode interpretar a sentença. Como exemplo, o algoritmo converteu uma sentença em outra sentença semelhante e a sentença foi alimentada em um classificador projetado para determinar se uma revisão era negativa ou positiva. A sentença original era:
“Os personagens, lançados em situações artificiais, estão totalmente desligados da realidade.”
Foi convertida para esta sentença:
“Os personagens, lançados em situações projetadas, estão totalmente desligados da realidade.”
Essas alterações sutis fizeram com que o classificador de texto classificasse a revisão como positiva em vez de negativa. A equipe de pesquisa testou a mesma abordagem (substituindo certas palavras por sinônimos) em vários conjuntos de dados e algoritmos de classificação de texto. A equipe de pesquisa relata que foi capaz de reduzir a precisão de classificação de um algoritmo para apenas 10%, de 90%. Isso apesar do fato de que as pessoas que lêem essas sentenças interpretariam que elas têm o mesmo significado.
Esses resultados são preocupantes em uma era em que os algoritmos de NLP e a IA estão sendo usados cada vez mais, e para tarefas importantes como avaliar reivindicações médicas ou analisar documentos legais. É desconhecido exatamente quanto os exemplos adversários são uma ameaça para os algoritmos atualmente utilizados. Equipes de pesquisa em todo o mundo ainda estão tentando determinar exatamente qual é o impacto que eles podem ter. Recentemente, um relatório publicado pelo grupo de IA Centrada no Ser Humano de Stanford sugeriu que os exemplos adversários poderiam enganar os algoritmos de IA e ser usados para cometer fraudes fiscais.
Há algumas limitações no estudo recente. Por exemplo, enquanto Sameer Singh, professor assistente de ciência da computação na UC Irvine, observa que o método adversário usado foi eficaz, ele depende de algum conhecimento da arquitetura da IA. A IA precisa ser sondada repetidamente até que um grupo eficaz de palavras possa ser encontrado, e esses ataques repetidos podem ser notados por programas de segurança. Singh e colegas fizeram sua própria pesquisa sobre o assunto e descobriram que sistemas avançados, como os algoritmos da OpenAI, podem fornecer textos racistas e prejudiciais quando acionados com certas frases de gatilho.
Os exemplos adversários também são um problema potencial ao lidar com dados visuais, como fotos ou vídeos. Um exemplo famoso envolve aplicar certas transformações digitais sutis a uma imagem de um gatinho, fazendo com que o classificador de imagem interprete como um monitor ou computador de mesa. Em outro exemplo, a pesquisa realizada pela professora Dawn Song, da UC Berkeley, encontrou que os exemplos adversários podem ser usados para alterar como os sinais de trânsito são percebidos por sistemas de visão computacional, o que pode ser potencialmente perigoso para veículos autônomos.
Pesquisas como a realizada pela equipe de Hong Kong-Cingapura podem ajudar os engenheiros de IA a entender melhor quais são as vulnerabilidades dos algoritmos de IA e, potencialmente, projetar maneiras de proteger contra essas vulnerabilidades. Como exemplo, os classificadores de ensemble podem ser usados para reduzir a chance de que um exemplo adversário possa enganar o sistema de visão computacional. Com essa técnica, vários classificadores são usados e alterações sutis são feitas na imagem de entrada. A maioria dos classificadores geralmente discernirá aspectos do conteúdo real da imagem, que são então agregados juntos. O resultado é que, mesmo que alguns classificadores sejam enganados, a maioria deles não será e a imagem será corretamente classificada.












