Andersonの視点
MIT:マシンラーニングを使用して主要ニュース媒体のメディアバイアスを測定

MITの研究では、マシンラーニング技術を使用して、米国とその以外の100以上の主要なニュース媒体のバイアス表現を特定しました。これは、出版物の政治的性格を自動的に分類し、読者が熱心に感じるトピックについての媒体の倫理的立場をより深く理解できるようにする、自動化システムの開発への道を開く研究です。
この研究は、特定の表現を使用してトピックを扱う方法に焦点を当てています。たとえば、不法滞在者 | 不法移民、胎児 | 生まれる前の赤ちゃん、デモ参加者 | 無政府主義者などです。
このプロジェクトでは、自然言語処理(NLP)技術を使用して、約100のニュース媒体から約307万件の記事を抽出し、左寄りと右寄りのバイアスを示す広範なマッピングを作成しました。結果は、バイアス地図としてナビゲートできます。
この研究は、MITの物理学部のSamantha D’AlonzoとMax Tegmarkによって行われました。最近の「事実確認」の取り組みは、多くの「フェイクニュース」スキャンダルを受けて、特定の利益を推進するために「不誠実」と解釈される可能性があると述べています。このプロジェクトは、ニュースコンテキストにおけるバイアス表現と「影響力」のある言語の使用を研究するための、よりデータ駆動型のアプローチを提供することを目的としています。

研究から導かれた、左から右への表現のスペクトル。
NLP処理
研究のソースデータは、Newspaper3Kデータベースから取得され、100のメディアニュースソースから3078624件の記事で構成されます。新聞は、リーチに基づいて選択され、オンラインメディアソースには、Defense OneとScienceの記事も含まれます。

研究で使用されたソース。
論文によると、ダウンロードされたテキストは「最小限」に前処理されました。直接引用は除外されました。研究は、ジャーナリストが選択した言語に焦点を当てているためです(ただし、引用の選択はそれ自体が興味深い研究分野です)。
英国英語の綴りはアメリカ英語に変更され、標準化のためにすべての句読点が除去され、序数以外の数字も除去されました。初期の文の先頭の文字は小文字に変換されましたが、他の文字の大小は保持されました。
最初の10万件の最も一般的なフレーズを特定し、ランク付け、除去、統合してフレーズリストを作成しました。すべての冗長な言語(「この記事を共有する」や「記事の再公開」など)を削除しました。同等のフレーズ(「ビッグテック」と「Big Tech」、「サイバーセキュリティ」と「サイバー セキュリティ」など)のバリエーションを標準化しました。
ナットピッキング
初期テストは「Black Lives Matter」について行われ、データ全体でフレーズバイアスと二重の同義語を判断することができました。

Black Lives Matter(BLM)に関する記事の一般化された主成分。左から右に、デモ参加者、無政府主義者、そして最右端の「暴徒」として特徴付けられた市民的行動の人々が見られます。フレーズを生み出した新聞は右側のパネルに表示されています。
「抗議者」は、媒体の政治的立場に沿って「無政府主義者」から「暴徒」へと変化しますが、論文では、NLP抽出と分析の立場が「ナットピッキング」の慣行によって妨げられていると指摘しています。ここで、媒体は、異なる政治的セグメントの社会によって有効と見なされるフレーズを引用し、読者がそのフレーズを否定的に見ることができるというものです。論文では、「警察を解体する」というフレーズをこの例として挙げています。
当然、これは、左寄りのフレーズが右寄りのコンテキストで現れ、政治的立場を示すための符号として頼りにしているNLPシステムにとって、特に課題となることになります。
このようなフレーズは「二重の同義語」であるのに対し、他のフレーズ(たとえば「子殺し」)は、普遍的に否定的な含意を持つため、さまざまな媒体で常に否定的に表現されます。
研究では、妊娠中絶、テクノロジーによる検閲、米国移民、銃規制などの「ホット」トピックについても同様のマッピングが行われています。
趣味の馬
ある政治的立場を持つメディアでは、予測可能な方法で分割できないトピックがあります。たとえば、軍事支出については、左寄りのCNNが右寄りのNational ReviewやFox Newsと並んでいます。
一般に、政治的立場は、他のフレーズ(たとえば「軍事産業複合体」ではなく「防衛産業」)を好むことによって判断できます。結果は、後者のフレーズがFoxやCNNでより頻繁に使用されている一方、前者のフレーズは、CanaryやAmerican Conservativeのような、体制批判的な媒体で使用されていることを示しています。
研究では、他にもいくつかの進歩が見られ、たとえば「射殺された」から「殺害」への変化、「囚人犯罪者」から「投獄された人々」への変化、「石油生産者」から「ビッグオイル」への変化などです。

体制への偏見を持つ二重の同義語、上から下へ。
研究では、媒体が「体制批判的な」言語や「体制支持的な」言語を使用する傾向があることも認識しています。たとえば、右寄りのイギリスの出版物The Spectatorは、左寄りの思想の記事を頻繁に掲載しています。ただし、これは、公平な報道のため、または読者を刺激するために行われているのか、判断は難しいとされています。
これらの「趣味の馬」や、個々のニュース組織における「不協和な」視点の使用は、研究が最終的に提示する左寄りから右寄りのマッピングを多少混乱させますが、政治的関連性についての広い示唆を提供しています。

保留された重要性
この研究は2021年9月2日に発表されましたが、相対的にあまり注目されていません。メディアへの批判的な研究は、メディア自身によって熱心に受け入れられることはないかもしれませんが、著者が結果の潜在的な影響を和らげるために、明確で曖昧さのないグラフや、出版物の政治的立場の分類を提示しなかったことにも原因があるかもしれません。
研究で使用されたデータは、公開されていますが、匿名化されているため、研究対象の出版物のメディアバイアスについての明確な理解を得ることは難しくなります。プロジェクトを何らかの方法で実用化しない限り、論文に提示された選択された例に頼るしかありません。
将来の研究では、トピックの扱い方だけでなく、トピックが扱われるかどうかも考慮することが役立つでしょう。なぜなら、沈黙は多くを語り、そして、ニュースの選択に影響を与える予算の制約やその他の実際的な要因に加えて、独自の政治的性格を持っているからです。
ただし、MITの研究は、これまでで最大規模のものであり、将来の分類システムや、読者が現在読んでいる出版物の政治的色合いを警告するブラウザープラグインなどの二次的な技術の基礎となる可能性があります。
バブル、バイアス、反発
さらに、こうしたシステムが、アルゴリズムによる推奨システムの最も議論の多い側面の1つである、読者が対立する、または挑戦的な視点を見ない環境に読者を導く可能性を考慮する必要があります。これは、読者の核心的な問題に対する立場をさらに強化する可能性があります。
このような「コンテンツバブル」が「安全な環境」であるか、知的成長の障害であるか、または部分的なプロパガンダに対する保護であるかは、価値判断であり、機械学習システムの機械的な、統計的な立場からアプローチすることは難しい哲学的な問題です。
さらに、MITの研究がデータに基づいて結果を導き出したように、フレーズの政治的価値の分類は、最終的には価値判断であり、言語が有害または論争的なコンテンツを新しいフレーズに再コード化する能力に対して簡単に立ち向かうことができないものです。
このようなコード化が一般的なオンラインシステムに埋め込まれる場合、メジャーメディアの倫理的、政治的温度を継続的にマッピングする取り組みが、AIのバイアスを認識する能力と、発行者が進化するイディオムで立場を表現する能力の間の冷戦に発展する可能性があります。
2021年9月14日 – 1:41 GMT+2 – 「100新聞」を「100ニュース媒体」に変更しました。 4:58 PM – Samantha D’Alonzoを含む論文の引用を修正し、関連する修正を行いました。












