Ángulo de Anderson

MIT: Medición de sesgo en medios de comunicación con aprendizaje automático

mm
Añade Unite.AI a tus fuentes preferidas en Google

Un estudio de MIT ha utilizado técnicas de aprendizaje automático para identificar frases sesgadas en alrededor de 100 de los medios de comunicación más grandes y más influyentes en Estados Unidos y más allá, incluyendo 83 de las publicaciones de noticias impresas más influyentes. Es un esfuerzo de investigación que muestra el camino hacia sistemas automatizados que podrían potencialmente auto-clasificar el carácter político de una publicación y dar a los lectores una visión más profunda de la postura ética de un medio en temas que pueden sentir apasionadamente.

El trabajo se centra en la forma en que se abordan los temas con frases particulares, como inmigrante indocumentado | inmigrante ilegal, feto | bebé nonato, manifestantes | anarquistas.

El proyecto utilizó técnicas de Procesamiento de Lenguaje Natural (NLP) para extraer y clasificar tales instancias de lenguaje “cargado” (con la suposición de que los términos aparentemente más “neutrales” también representan una postura política) en un mapa amplio que revela el sesgo de izquierda y derecha en más de tres millones de artículos de alrededor de 100 medios de comunicación, lo que resulta en un paisaje de sesgo navegable de las publicaciones en cuestión.

El documento proviene de Samantha D’Alonzo y Max Tegmark del Departamento de Física de MIT, y observa que varias iniciativas recientes sobre “verificación de hechos” pueden ser interpretadas como deshonestas y servir a los intereses de particulares. El proyecto pretende proporcionar un enfoque más basado en datos para estudiar el uso de sesgo y lenguaje de “influencia” en un contexto de noticias supuestamente neutrales.

Un espectro de frases de izquierda a derecha, derivado del estudio. Fuente: https://arxiv.org/pdf/2109.00024.pdf

Un espectro de frases de izquierda a derecha, derivado del estudio. Fuente: https://arxiv.org/pdf/2109.00024.pdf

Procesamiento de NLP

Los datos de origen del estudio se obtuvieron de la base de datos de código abierto Newspaper3K, y comprendieron 3.078.624 artículos obtenidos de 100 fuentes de noticias, incluyendo 83 periódicos. Los periódicos se seleccionaron en función de su alcance, mientras que las fuentes de noticias en línea también incluyeron artículos del sitio de análisis de noticias militares Defense One y Ciencia.

Las fuentes utilizadas en el estudio.

Las fuentes utilizadas en el estudio.

El documento informa que el texto descargado se “pre-procesó mínimamente”. Las citas directas se eliminaron, ya que el estudio se centra en el lenguaje elegido por los periodistas (aunque la selección de citas es en sí misma un campo de estudio interesante).

Las grafías británicas se cambiaron a americanas para estandarizar la base de datos, se eliminaron todos los signos de puntuación y se eliminaron todos los números ordinales. La capitalización inicial de las oraciones se convirtió a minúsculas, pero se conservó la mayúscula en el resto de las palabras.

Se identificaron y clasificaron las 100.000 frases más comunes, y finalmente se eliminó y se fusionó el lenguaje redundante que se podía identificar (como “Compartir este artículo” y “artículo republicado”). Las variaciones en frases esencialmente idénticas (es decir, “gran tecnología” y “Gran Tecnología”, “ciberseguridad” y “ciber seguridad”) se estandarizaron.

‘Nutpicking’

La prueba inicial se realizó sobre el tema “Vidas Negras Importan” y pudo discernir el sesgo de frases y sinónimos valentes en los datos.

Componentes principales generalizados para artículos sobre Vidas Negras Importan (BLM). Vemos a personas participando en acción civil caracterizadas, literal y figurativamente, de izquierda a derecha, como manifestantes, anarquistas y, en el extremo derecho del espectro, como 'disturbios'. Los periódicos que originan la frase se representan en el panel de la derecha.

Componentes principales generalizados para artículos sobre Vidas Negras Importan (BLM). Vemos a personas participando en acción civil caracterizadas, literal y figurativamente, de izquierda a derecha, como manifestantes, anarquistas y, en el extremo derecho del espectro, como ‘disturbios’. Los periódicos que originan la frase se representan en el panel de la derecha.

Mientras que los “manifestantes” pasan de “anarquistas” a “disturbios” a medida que nos desplazamos a lo largo de la postura política del medio en cuestión, el documento señala que la extracción y análisis de NLP se ven obstaculizados por la práctica de “nutpicking” – donde un medio de comunicación citará una frase que se considera válida por un segmento político diferente de la sociedad, y puede (aparentemente) confiar en que su audiencia vea la frase de manera negativa. El documento cita “desfinanciar a la policía” como un ejemplo de esto.

Naturalmente, esto significa que una frase de “izquierda” aparece en un contexto de derecha, y representa un desafío inusual para un sistema de NLP que confía en frases codificadas para actuar como indicadores de posturas políticas.

Tales frases son “bi-valentes”, mientras que ciertas otras frases tienen una connotación negativa tan universal (es decir, “infanticidio”) que siempre se representan como negativas en todo el espectro de medios.

La investigación también revela mapas similares para temas “calientes” como el aborto, la censura tecnológica, la inmigración en Estados Unidos y el control de armas.

Cabalgatas

Hay ciertas tendencias políticas controvertidas en los medios de comunicación que no se dividen de manera predecible, como el tema del gasto militar. El documento encontró que el “izquierdista” CNN terminó junto a la derechista National Review y Fox News en este tema.

En general, sin embargo, la postura política puede determinarse por otras frases, como preferir la frase “complejo militar-industrial” sobre la más derechista “industria de la defensa”. Los resultados muestran que la primera se utiliza por medios críticos con el establishment como Canary y American Conservative, mientras que la segunda se utiliza con más frecuencia por Fox y CNN.

La investigación establece varias otras progresiones desde el lenguaje crítico con el establishment hasta el lenguaje pro-establishment, incluyendo el espectro desde “muerto a tiros” hasta el más pasivo “el asesinato de”; “delincuentes presos” a “personas encarceladas”; y “productores de petróleo” a “gran petróleo”.

Sinónimos valentes con sesgo de establishment, de arriba a abajo.

Sinónimos valentes con sesgo de establishment, de arriba a abajo.

La investigación reconoce que los medios pueden “alejarse” de su postura política base, ya sea a nivel lingüístico (como el uso de frases bi-valentes), o por diversas otras motivaciones. Por ejemplo, la venerable publicación derechista del Reino Unido The Spectator, establecida en 1828, frecuentemente y de manera destacada presenta piezas de pensamiento de izquierda que rozan contra la corriente política general de su flujo de contenido. Si esto se hace por un sentido de informe imparcial o para inflamar periódicamente a su audiencia central en tormentas de comentarios que generan tráfico es un tema de conjetura – y no es un caso fácil para un sistema de aprendizaje automático que busca tokens claros y consistentes.

Estos “caballos de batalla” y el uso ambiguo de “puntos de vista discordantes” entre organizaciones de noticias individuales confunden un poco el mapeo de izquierda a derecha que la investigación ofrece en última instancia, aunque proporciona una indicación general de afiliación política.

Significado retenido

Aunque fechado el 2 de septiembre y publicado a fines de agosto de 2021, el documento ha ganado relativamente poca tracción. Parcialmente esto puede deberse a que la investigación crítica dirigida a los medios de comunicación principales es poco probable que sea recibida con entusiasmo por ellos; pero también puede deberse a la reluctancia de los autores a producir gráficos claros y inequívocos que estratifican dónde se encuentran las publicaciones de medios influyentes y poderosas en varios temas, junto con valores agregados que indican el grado en que una publicación se inclina hacia la izquierda o la derecha. En efecto, los autores parecen tomar medidas para mitigar el efecto potencialmente incendiario de los resultados.

De manera similar, los datos extensos publicados del proyecto muestran conteos de frecuencia de incidentes de palabras, pero parecen estar anonimizados, lo que hace difícil obtener una visión clara del sesgo de los medios en las publicaciones estudiadas. Sin operativizar el proyecto de alguna manera, esto deja solo los ejemplos seleccionados presentados en el documento.

Estudios posteriores de este tipo podrían ser más útiles si consideraran no solo el lenguaje utilizado para los temas, sino si el tema se cubrió en absoluto, ya que el silencio habla por sí mismo, y tiene en sí mismo un carácter político distinto que a menudo habla de más que solo limitaciones presupuestarias u otros factores pragmáticos que pueden informar la selección de noticias.

Sin embargo, el estudio de MIT parece ser el más grande de su tipo hasta la fecha, y podría formar el marco para futuros sistemas de clasificación, e incluso tecnologías secundarias como complementos de navegador que podrían alertar a los lectores ocasionales sobre el color político de la publicación que están leyendo actualmente.

Burbujas, sesgo y reacción en cadena

Además, habría que considerar si tales sistemas furtherían uno de los aspectos más controvertidos de los sistemas de recomendación algorítmicos – la tendencia a llevar a un espectador a entornos donde nunca vea una visión contrastante o desafiante, lo que probablemente retrenchería aún más la postura del lector sobre cuestiones clave.

Ya sea que una burbuja de contenido sea un “entorno seguro”, un impedimento para el crecimiento intelectual o una protección contra la propaganda parcial, es un juicio de valor – un asunto filosófico que es difícil de abordar desde el punto de vista mecanicista y estadístico de los sistemas de aprendizaje automático.

Además, al igual que el estudio de MIT ha tomado medidas para dejar que los datos definan los resultados, la clasificación del valor político de las frases es inevitablemente también un tipo de juicio de valor, y uno que no puede fácilmente resistir la capacidad del lenguaje para recodificar contenido tóxico o controvertido en frases novelas que no están en el manual, las reglas del foro o la base de datos de entrenamiento.

Si una codificación de este tipo se convirtiera en una parte integral de los sistemas en línea populares, parece probable que un esfuerzo continuo para mapear la temperatura ética y política de los principales medios de comunicación podría desarrollarse en una guerra fría entre la capacidad de la IA para discernir el sesgo y la capacidad de los editores para expresar su postura en un idioma en evolución diseñado para superar rutinariamente la comprensión de la semántica del aprendizaje automático.

14/09/21 – 1.41 GMT+2 – Cambiado ‘100 periódicos’ a ‘100 medios de comunicación’
4:58 pm – Corregida la cita del documento para incluir a Samantha D’Alonzo y correcciones relacionadas.

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai