Modelos y plataformas de IA

Algoritmo TextFooler engaña al AI de NLP

mm
Añade Unite.AI a tus fuentes preferidas en Google

Por impresionante que hayan sido los algoritmos y sistemas de procesamiento de lenguaje natural en los últimos años, todavía son vulnerables a un tipo de explotación conocida como “ejemplo adversario”. Los ejemplos adversarios son frases cuidadosamente diseñadas que pueden hacer que un sistema de NLP se comporte de manera inesperada y no deseada. Los programas de AI pueden ser manipulados con estos ejemplos extraños, y como resultado, los investigadores de AI están tratando de diseñar formas de protegerse contra los efectos de los ejemplos adversarios.

Recientemente, un equipo de investigadores de la Universidad de Hong Kong y la Agencia de Ciencia, Tecnología y Investigación de Singapur colaboraron para crear un algoritmo que demuestra el peligro de los ejemplos adversarios. Como informó Wired, el algoritmo fue bautizado como TextFooler por el equipo de investigación y funciona cambiando sutilmente partes de una oración, lo que afecta la forma en que un clasificador de NLP podría interpretar la oración. Como ejemplo, el algoritmo convirtió una oración en otra similar y la oración se introdujo en un clasificador diseñado para determinar si una reseña era negativa o positiva. La oración original era:

“Los personajes, lanzados en situaciones absurdamente artificiales, están totalmente desconectados de la realidad.”

Se convirtió en esta oración:

“Los personajes, lanzados en situaciones diseñadas artificialmente, están totalmente desconectados de la realidad.”

Estos cambios sutiles hicieron que el clasificador de texto clasificara la reseña como positiva en lugar de negativa. El equipo de investigación probó el mismo enfoque (intercambiando ciertas palabras con sinónimos) en varios conjuntos de datos y algoritmos de clasificación de texto. El equipo de investigación informa que pudieron reducir la precisión de clasificación de un algoritmo al 10%, desde el 90%. Esto a pesar de que las personas que leen estas oraciones las interpretarían como tener el mismo significado.

Estos resultados son preocupantes en una era en la que los algoritmos de NLP y el AI se están utilizando cada vez más, y para tareas importantes como evaluar reclamaciones médicas o analizar documentos legales. No se sabe cuánto peligro representan los ejemplos adversarios para los algoritmos actualmente utilizados. Los equipos de investigación de todo el mundo aún están tratando de determinar cuánto impacto pueden tener. Recientemente, un informe publicado por el grupo de Inteligencia Artificial Centrada en el Ser Humano de Stanford sugirió que los ejemplos adversarios podrían engañar a los algoritmos de AI y utilizarse para cometer fraude fiscal.

Hay algunas limitaciones en el estudio reciente. Por ejemplo, mientras que Sameer Singh, profesor asistente de ciencias de la computación en la UC Irvine, señala que el método adversario utilizado fue efectivo, depende de algún conocimiento de la arquitectura de la AI. La AI debe ser sondeada repetidamente hasta que se encuentre un grupo efectivo de palabras, y estos ataques repetidos podrían ser detectados por programas de seguridad. Singh y sus colegas han realizado su propia investigación sobre el tema y han descubierto que los sistemas avanzados como los algoritmos de OpenAI pueden producir texto racista y dañino cuando se les proporcionan ciertas frases desencadenantes.

Los ejemplos adversarios también son un problema potencial al tratar con datos visuales como fotos o videos. Un ejemplo famoso implica aplicar ciertas transformaciones digitales sutiles a una imagen de un gatito, lo que hace que el clasificador de imágenes la interprete como un monitor o una computadora de escritorio. En otro ejemplo, la investigación realizada por la profesora Dawn Song de la UC Berkeley encontró que los ejemplos adversarios se pueden utilizar para cambiar la forma en que los sistemas de visión por computadora perciben los signos de tráfico, lo que podría ser potencialmente peligroso para los vehículos autónomos.

La investigación como la que realizó el equipo de Hong Kong-Singapur podría ayudar a los ingenieros de AI a comprender mejor qué tipo de vulnerabilidades tienen los algoritmos de AI y, potencialmente, diseñar formas de protegerse contra estas vulnerabilidades. Por ejemplo, se pueden utilizar clasificadores de conjunto para reducir la posibilidad de que un ejemplo adversario engañe al sistema de visión por computadora. Con esta técnica, se utilizan varios clasificadores y se realizan transformaciones ligeras en la imagen de entrada. La mayoría de los clasificadores pueden discernir normalmente aspectos del contenido real de la imagen, que se agregan juntos. El resultado es que incluso si algunos de los clasificadores son engañados, la mayoría no lo serán y la imagen se clasificará correctamente. Los clasificadores se reutilizan y se realizan transformaciones ligeras en la imagen de entrada. La mayoría de los clasificadores pueden discernir normalmente aspectos del contenido real de la imagen, que se agregan juntos. El resultado es que incluso si algunos de los clasificadores son engañados, la mayoría no lo serán y la imagen se clasificará correctamente.

Bloguero y programador con especialidades en Machine Learning y Deep Learning temas. Daniel espera ayudar a otros a utilizar el poder de la IA para el bien social.