Modelos y plataformas de IA

Nuevo estudio intenta mejorar los algoritmos de detección de discurso de odio

mm
Añade Unite.AI a tus fuentes preferidas en Google

Las empresas de redes sociales, especialmente Twitter, han enfrentado durante mucho tiempo críticas por la forma en que marcan el discurso y deciden qué cuentas suspender. El problema subyacente casi siempre tiene que ver con los algoritmos que utilizan para monitorear las publicaciones en línea. Los sistemas de inteligencia artificial están lejos de ser perfectos en esta tarea, pero siempre se está trabajando para mejorarlos.

Incluido en ese trabajo está un nuevo estudio que sale de la Universidad del Sur de California que intenta reducir ciertos errores que podrían resultar en sesgo racial.

Falta de reconocimiento de contexto

Uno de los problemas que no recibe tanta atención tiene que ver con algoritmos que están diseñados para detener la difusión del discurso de odio, pero que en realidad amplifican el sesgo racial. Esto sucede cuando los algoritmos no reconocen el contexto y terminan marcando o bloqueando tweets de grupos minoritarios.

El mayor problema con los algoritmos en cuanto al contexto es que son demasiado sensibles a ciertos términos que identifican a grupos, como “negro”, “gay” y “transgénero”. Los algoritmos consideran estos clasificadores de discurso de odio, pero a menudo son utilizados por miembros de esos grupos y el contexto es importante.

En un intento de resolver este problema de ceguera contextual, los investigadores crearon un clasificador de discurso de odio más sensible al contexto. El nuevo algoritmo es menos probable que etiquete incorrectamente una publicación como discurso de odio.

El algoritmo

Los investigadores desarrollaron los nuevos algoritmos con dos nuevos factores en mente: el contexto en relación con los identificadores de grupos y si también hay otras características de discurso de odio presentes en la publicación, como lenguaje deshumanizante.

Brendan Kennedy es un estudiante de doctorado en ciencias de la computación y coautor principal del estudio, que se publicó el 6 de julio en ACL 2020.

“Queremos acercar la detección de discurso de odio a estar listo para su aplicación en el mundo real”, dijo Kennedy.

“Los modelos de detección de discurso de odio a menudo ‘se rompen’ o generan malas predicciones cuando se les presenta datos del mundo real, como redes sociales u otros textos en línea, porque están sesgados por los datos con los que se entrenan para asociar la aparición de términos de identificación social con discurso de odio”.

La razón por la que los algoritmos a menudo son inexactos es que se entrenan con conjuntos de datos desequilibrados con tasas extremadamente altas de discurso de odio. Debido a esto, los algoritmos no aprenden a manejar lo que las redes sociales realmente se ven en el mundo real.

El profesor Xiang es un experto en procesamiento de lenguaje natural.

“Es clave que los modelos no ignoren los identificadores, sino que los emparejen con el contexto correcto”, dijo Ren.

“Si se entrena a un modelo con un conjunto de datos desequilibrado, el modelo comienza a detectar patrones extraños y a bloquear a los usuarios de manera inapropiada”.

Para probar el algoritmo, los investigadores utilizaron una muestra aleatoria de texto de dos sitios de redes sociales que tienen una alta tasa de discurso de odio. El texto fue marcado manualmente por humanos como prejuicioso o deshumanizante. El modelo de última generación se midió contra el modelo de los investigadores para marcar incorrectamente el discurso no odioso, mediante el uso de 12.500 artículos del New York Times sin discurso de odio. Mientras que los modelos de última generación lograron una precisión del 77% en la identificación de discurso de odio versus no discurso de odio, el modelo de los investigadores fue más alto, con un 90%.

“Este trabajo por sí solo no hace que la detección de discurso de odio sea perfecta, eso es un proyecto enorme en el que muchos están trabajando, pero hace un progreso incremental”, dijo Kennedy.

“Además de prevenir que las publicaciones de redes sociales de miembros de grupos protegidos sean censuradas de manera inapropiada, esperamos que nuestro trabajo ayude a garantizar que la detección de discurso de odio no cause daño innecesario al reforzar asociaciones espurias de prejuicio y deshumanización con grupos sociales”.

Alex dirige las operaciones de noticias impulsadas por IA de Unite.AI, combinando periodismo, investigación y automatización para respaldar una cobertura oportuna y escalable de la inteligencia artificial. Su trabajo ayuda a garantizar que los desarrollos emergentes de IA se presenten de manera eficiente, al tiempo que se mantienen los estándares editoriales de la publicación.