Angle d’Anderson

MIT : Mesurer les préjugés des médias dans les principaux médias d’information avec l’apprentissage automatique

mm
Ajouter Unite.AI à vos sources préférées sur Google

Une étude du MIT a utilisé des techniques d’apprentissage automatique pour identifier les formulations biaisées dans environ 100 des plus grands et des plus influents médias d’information aux États-Unis et au-delà, y compris 83 des publications imprimées les plus influentes. Il s’agit d’un effort de recherche qui montre la voie vers des systèmes automatisés qui pourraient potentiellement auto-classifier le caractère politique d’une publication et donner aux lecteurs une insight plus approfondie sur la position éthique d’un média sur des sujets qu’ils pourraient considérer comme importants.

Le travail se concentre sur la façon dont les sujets sont abordés avec des formulations particulières, telles que immigrant sans papiers | immigrant illégal, fœtus | enfant non né, manifestants | anarchistes.

Le projet a utilisé des techniques de traitement du langage naturel (NLP) pour extraire et classer de tels exemples de langage « chargé » (en supposant que des termes apparemment plus « neutres » représentent également une position politique) dans une carte large qui révèle les préjugés de gauche et de droite dans plus de trois millions d’articles provenant d’environ 100 médias d’information, aboutissant à un paysage de biais navigable des publications en question.

L’article provient de Samantha D’Alonzo et Max Tegmark du département de physique du MIT, et observe qu’un certain nombre d’initiatives récentes autour de la « vérification des faits », à la suite de nombreux scandales de « fausses nouvelles », peuvent être interprétées comme malhonnêtes et servant les intérêts de particuliers. Le projet vise à fournir une approche plus fondée sur les données pour étudier l’utilisation des préjugés et du langage « d’influence » dans un contexte de média censé être neutre.

Un spectre de phrases (littéralement) de gauche à droite, telles que dérivées de l'étude. Source: https://arxiv.org/pdf/2109.00024.pdf

Un spectre de phrases (littéralement) de gauche à droite, telles que dérivées de l’étude. Source: https://arxiv.org/pdf/2109.00024.pdf

Traitement NLP

Les données sources de l’étude ont été obtenues à partir de la base de données open source Newspaper3K, et comprennent 3 078 624 articles provenant de 100 sources de médias d’information, y compris 83 journaux. Les journaux ont été sélectionnés en fonction de leur portée, tandis que les sources de médias en ligne comprenaient également des articles du site d’analyse militaire Defense One et Science.

Les sources utilisées dans l'étude.

Les sources utilisées dans l’étude.

L’article rapporte que le texte téléchargé a été « minimalement » prétraité. Les citations directes ont été éliminées, car l’étude s’intéresse au langage choisi par les journalistes (même si la sélection de citations est en soi un domaine d’étude intéressant).

Les orthographes britanniques ont été modifiées en orthographes américaines pour normaliser la base de données, toutes les ponctuations supprimées et tous les nombres ordinaux supprimés. La capitalisation initiale des phrases a été convertie en minuscules, mais toute autre capitalisation a été conservée.

Les 100 000 premières phrases les plus courantes ont été identifiées, puis classées et purgeées pour former une liste de phrases. Tout langage redondant qui pouvait être identifié (comme « Partager cet article » et « article republié ») a également été supprimé. Les variations de phrases essentiellement identiques (par exemple « grande technologie » et « Big Tech », « cybersécurité » et « cybersécurité ») ont été normalisées.

‘Nutpicking’

Le test initial portait sur le sujet « Black lives matter », et a pu discerner les préjugés de phrase et les synonymes valents à travers les données.

Composantes principales généralisées pour les articles sur Black Lives Matter (BLM). Nous voyons les personnes participant à une action civique caractérisées, littéralement et figurativement, de gauche à droite, comme des manifestants, des anarchistes et, à l'extrémité droite du spectre, comme des « émeutiers ». Les journaux à l'origine de la phrase sont représentés dans le panneau de droite.

Composantes principales généralisées pour les articles sur Black Lives Matter (BLM). Nous voyons les personnes participant à une action civique caractérisées, littéralement et figurativement, de gauche à droite, comme des manifestants, des anarchistes et, à l’extrémité droite du spectre, comme des « émeutiers ». Les journaux à l’origine de la phrase sont représentés dans le panneau de droite.

Alors que les « manifestants » passent des « anarchistes » aux « émeutiers » à mesure que nous nous déplaçons le long de la position politique du média en question, l’article note que l’extraction et l’analyse NLP sont entravées par la pratique du « nutpicking » – où un média citera une phrase qui est considérée comme valable par un segment politique différent de la société, et peut (apparemment) compter sur son lectorat pour considérer la phrase de manière négative. L’article cite « définancer la police » comme exemple de cela.

Naturellement, cela signifie qu’une phrase de « gauche » apparaît dans un contexte de droite, et représente un défi inhabituel pour un système NLP qui s’appuie sur des phrases codifiées pour agir comme signifiants pour les positions politiques.

De telles phrases sont « bi-valentes » [SIC], alors que certaines autres phrases ont une connotation négative universellement reconnue (par exemple « infanticide ») qui est toujours représentée de manière négative dans une gamme de médias.

La recherche révèle également des cartes similaires pour des sujets « chauds » tels que l’avortement, la censure technologique, l’immigration américaine et le contrôle des armes à feu.

Chevaux de bataille

Il existe certaines tendances politiques controversées dans les médias qui ne se divisent pas de manière prévisible, comme le sujet des dépenses militaires. L’article a constaté que le « média de gauche » CNN s’est retrouvé aux côtés du National Review et de Fox News sur ce sujet.

En général, cependant, la position politique peut être déterminée par d’autres phrases, comme la préférence pour la phrase « complexe militaro-industriel » plutôt que pour l’expression plus de droite « industrie de la défense ». Les résultats montrent que la première est utilisée par des médias critiques de l’établissement tels que Canary et American Conservative, tandis que la seconde est utilisée plus souvent par Fox et CNN.

La recherche établit plusieurs autres progressions du langage critique de l’établissement au langage pro-établissement, y compris la gamme de « tué » à « l’homicide »; « détenus condamnés » à « personnes incarcérées »; et « producteurs de pétrole » à « grande entreprise pétrolière ».

Synonymes valents avec préjugés de l'établissement, de haut en bas.

Synonymes valents avec préjugés de l’établissement, de haut en bas.

La recherche reconnaît que les médias peuvent « s’éloigner » de leur position politique de base, soit au niveau linguistique (comme l’utilisation de phrases bi-valentes), soit pour diverses autres motivations. Par exemple, la vénérable publication de droite britannique The Spectator, fondée en 1828, présente fréquemment et en évidence des réflexions de gauche qui s’opposent au flux politique général de son contenu. Que cela soit fait par souci de rapport impartial ou pour inflammer périodiquement son lectorat dans des tempêtes de commentaires génératrices de trafic est une question de conjecture – et pas un cas facile pour un système d’apprentissage automatique qui cherche des jetons clairs et constants.

Ces « chevaux de bataille » et l’utilisation ambiguë de « points de vue choquants » parmi les médias individuels rendent quelque peu confuse la cartographie gauche-droite que la recherche propose finalement, bien qu’elle fournisse une indication générale de l’affiliation politique.

Signification retenue

Bien que datée du 2 septembre et publiée à la fin du mois d’août 2021, l’article a gagné relativement peu de traction. En partie, cela pourrait être dû au fait que les recherches critiques visant les médias traditionnels sont peu susceptibles d’être reçues avec enthousiasme par ces derniers; mais cela pourrait également être dû à la réticence des auteurs à produire des graphiques clairs et non ambigus stratifiant où les publications médiatiques influentes et puissantes se situent sur divers sujets, ainsi que des valeurs agrégées indiquant dans quelle mesure une publication penche vers la gauche ou la droite. En effet, les auteurs semblent prendre des précautions pour atténuer l’effet potentiellement incendiaire des résultats.

De même, les données publiées étendues du projet montrent des comptes de fréquence d’incidents de mots, mais semblent être anonymisées, ce qui rend difficile l’obtention d’une image claire des préjugés médiatiques à travers les publications étudiées. Sans opérationnaliser le projet d’une manière ou d’une autre, cela ne laisse que les exemples sélectionnés présentés dans l’article.

Les études ultérieures de ce type pourraient être plus utiles s’ils prenaient en compte non seulement les formulations utilisées pour les sujets, mais également si le sujet est couvert du tout, car le silence parle volumes, et a en soi un caractère politique distinct qui parle souvent de plus que des seules limites budgétaires ou d’autres facteurs pragmatiques qui peuvent éclairer la sélection des actualités.

Cependant, l’étude du MIT semble être la plus grande de son type à ce jour et pourrait former le cadre de futurs systèmes de classification, et même de technologies secondaires telles que des plug-ins de navigateur qui pourraient alerter les lecteurs occasionnels de la couleur politique de la publication qu’ils lisent actuellement.

Bulles, préjugés et réactions

En outre, il faudrait considérer si de tels systèmes aggraveraient l’un des aspects les plus controversés des systèmes de recommandation algorithmiques – la tendance à mener un spectateur dans des environnements où il ne voit jamais un point de vue contrasté ou stimulant, ce qui est susceptible de renforcer encore l’attitude du lecteur sur les questions fondamentales.

Que de telles « bulles de contenu » soient un « environnement sûr », un obstacle à la croissance intellectuelle ou une protection contre la propagande partielle est un jugement de valeur – une question philosophique qui est difficile à aborder du point de vue mécaniste et statistique des systèmes d’apprentissage automatique.

En outre, tout comme l’étude du MIT a pris soin de laisser les données définir les résultats, la classification de la valeur politique des phrases est inévitablement également un jugement de valeur, et l’un qui ne peut pas facilement résister à la capacité du langage à recodifier le contenu toxique ou controversé en nouvelles phrases qui ne sont pas dans le manuel, les règles du forum ou la base de données d’entraînement.

Si une telle codification devait être intégrée dans des systèmes en ligne populaires, il est probable qu’un effort continu pour cartographier la température éthique et politique des principaux médias d’information pourrait se développer en une guerre froide entre la capacité de l’IA à discerner les préjugés et la capacité des éditeurs à exprimer leur point de vue dans un idiome en évolution conçu pour dépasser régulièrement la compréhension de la sémantique par l’apprentissage automatique.

14/09/21 – 1.41 GMT+2 – Changé ‘100 journaux’ en ‘100 médias d’information’
4:58pm – Corrigé la citation de l’article pour inclure Samantha D’Alonzo, et corrections connexes.

Écrivain en apprentissage automatique, spécialiste de domaine en synthèse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Portfolio site : martinanderson.ai
Contact : martin@martinanderson.ai