Anderson의 관점

MIT: 기계 학습으로 주요 뉴스 매체의 미디어 편향 측정

mm
Unite.AI를 Google의 선호 소스에 추가

MIT의 연구에서 기계 학습 기술을 사용하여 미국과 그 외의 지역에서 가장 큰 영향력을 가진 100개의 주요 뉴스 매체에서 편향된 문구를 식별했습니다. 이는 자동화된 시스템이 잠재적으로 출판물의 정치적 성격을 분류하고 독자에게 관심 있는 주제에 대한 출판물의 윤리적 입장을 더 깊이 이해할 수 있는 방법을 보여주는 연구입니다.

이 연구는 특정 문구로 주제를 다루는 방식에 중점을 두고 있습니다. 예를 들어, 무기자치 이민자 | 불법 이민자, 胎児 | 태아, 시위자 | 무정부주의자와 같은 문구입니다.

이 프로젝트는 자연어 처리(NLP) 기술을 사용하여 이러한 ‘충전된’ 언어의 인스턴스를 추출하고 분류하여 약 3백만 개의 기사에서 왼쪽과 오른쪽으로 기울어진 편향을 나타내는 광범위한 매핑을 생성했습니다. 이는 약 100개의 뉴스 매체에서 생성된 편향 지형을 탐색할 수 있습니다.

이 연구는 Samantha D’Alonzo와 Max Tegmark가 MIT 물리학과에서 수행했으며, ‘팩트 체킹’과 같은 최근 몇몇 이니셔티브가 특정 이익을 위해 서비스를 제공하는 것으로 해석될 수 있다고 관찰했습니다. 이 프로젝트는 중립적인 뉴스 컨텍스트에서 편향과 ‘영향력’ 언어의 사용을 연구하는 더 데이터 주도적인 접근 방식을 제공하는 것을 목표로 합니다.

연구에서 파생된 왼쪽에서 오른쪽으로 문구의 스펙트럼.

연구에서 파생된 왼쪽에서 오른쪽으로 문구의 스펙트럼.

NLP 처리

이 연구의 소스 데이터는 오픈 소스 Newspaper3K 데이터베이스에서 얻었으며, 100개의 미디어 뉴스 소스에서 3,078,624개의 기사를 포함합니다. 신문은 도달 범위에 따라 선택되었으며, 온라인 미디어 소스에는 군사 뉴스 분석 사이트 Defense OneScience의 기사도 포함되었습니다.

연구에서 사용된 소스.

연구에서 사용된 소스.

이 연구는 다운로드된 텍스트가 최소한으로 전처리되었다고 보고합니다. 직접 인용은 제거되었으며, 연구는 저널리스트가 선택한 언어에 관심이 있기 때문입니다(인용 선택은 스스로 연구할 가치가 있는 분야입니다).

영국 철자는 미국 철자로 표준화되었으며, 모든 구두점이 제거되고, 모든 순서 번호를 제외한 모든 번호가 제거되었습니다. 초기 문장 대문자는 소문자로 변환되었지만, 다른 모든 대문자는 유지되었습니다.

最初의 100,000개의 가장 일반적인 문구가 식별되었으며, 최종적으로 순위가 매겨지고, 정리되어 문구 목록으로 병합되었습니다. 모든 중복 언어가 식별 가능했으며(예: ‘이 기사를 공유하세요’와 ‘기사 재게시’), 이러한 언어는 모두 삭제되었습니다. 본질적으로 동일한 문구의 변형(예: ‘대형 기술’과 ‘Big Tech’, ‘사이버 보안’과 ‘사이버 보안’)은 표준화되었습니다.

‘넛피킹’

초기 테스트는 ‘블랙 라이브스 매터’ 주제에 대해 수행되었으며, 데이터에서 문구 편향과 밸런트 동의어를 식별할 수 있었습니다.

블랙 라이브스 매터(BLM)에 대한 기사에 대한 일반화된 주성분.

블랙 라이브스 매터(BLM)에 대한 기사에 대한 일반화된 주성분.

시위자들이 애나키스트에서 폭도까지 전환하는 동안, 연구는 ‘넛피킹’이라는 관행에 의해 방해받는다는 것을 관찰합니다. 여기서 미디어 아웃렛은 다른 정치 세그먼트에서 유효한 것으로 간주되는 문구를 인용할 수 있으며, 이는 독자들이 문구를 부정적으로 보는 것으로 간주될 수 있습니다. 연구는 ‘경찰 해산’을 예로 들었습니다.

이로 인해 왼쪽으로 기울어진 문구가 오른쪽으로 기울어진 컨텍스트에서 나타나며, 이는 정치적 입장을 나타내는 신호로 사용되는 코드화된 문구에 의존하는 NLP 시스템에 대한 특별한 도전이 됩니다.

이러한 문구는 ‘이중 가치’를 가지고 있으며, 특정 다른 문구는 보편적으로 부정적인 함의를 가지고 있어 다양한 아웃렛에서 항상 부정적으로 표현됩니다.

이 연구는 또한 낙태, 기술 검열, 미국 이민, 총기 통제와 같은 ‘뜨거운’ 주제에 대한 유사한 매핑을 보여줍니다.

취미馬

일부 뉴스 매체의 정치적 성향은 예상대로 분리되지 않습니다. 예를 들어, 군사 지출에 대한 주제에서는 왼쪽으로 기울어진 CNN이 오른쪽으로 기울어진 내셔널 리뷰와 폭스 뉴스와 함께 나타났습니다.

일반적으로 정치적 성향은 다른 문구를 사용하여 결정될 수 있습니다. 예를 들어, ‘군사-산업 복합체’라는 문구를 ‘국방 산업’이라는 더 오른쪽으로 기울어진 문구보다 선호하는 경우입니다. 결과는 전자가 CanaryAmerican Conservative와 같은 기성장 비판적 아웃렛에서 사용되는 반면, 후자는 폭스와 CNN에서 더 자주 사용됨을 보여줍니다.

연구는 또한 기성장 비판적 언어에서 기성장적 언어로의 다른 진행을 설정합니다. 예를 들어, ‘총격 사망’에서 ‘살인’으로, ‘수감자 범죄자’에서 ‘수감자’로, ‘석유 생산자’에서 ‘대형 석유’로 진행됩니다.

기성장 편향을 가진 밸런트 동의어.

기성장 편향을 가진 밸런트 동의어.

연구는 아웃렛이 언어적 수준에서 또는 다양한 동기에서 자신의 기본 정치적 성향에서 벗어날 수 있다고 인정합니다. 예를 들어, 오른쪽으로 기울어진 영국 출판물 The Spectator은 자주 왼쪽으로 기울어진 사고를 특징으로 하는 기사를 게재하며, 이는 일반적으로 오른쪽으로 기울어진 내용과 충돌합니다. 이것이 공정한 보도의 감각에서인지, 또는 주기적으로 핵심 독자를 트래픽 생성하는 댓글 폭풍으로 자극하는지에 대한 문제는 추측의 문제이며, 일관된 토큰을 찾는 기계 학습 시스템에서는 쉽게 접근할 수 없습니다.

이러한 특정 ‘취미馬’와 개별 뉴스 기관의 모호한 관점 사용은 연구가 궁극적으로 제공하는 왼쪽-오른쪽 매핑을 약간 혼란스럽게 만들지만, 광범위한 정치적 소속을 나타냅니다.

숨겨진 중요성

이 연구는 2021년 9월 2일에 발표되었으며, 상대적으로 적은 주목을 받았습니다. 이는 주요 스트림 미디어에 대한 비판적 연구가 미디어에 의해热烈하게 받아들여지지 않을 가능성이 있기 때문일 수 있습니다. 그러나 연구자들이 주요 미디어 출판물의 정치적 성향을 분류하고 편향 정도를 나타내는 그래프를 생성하는 것을 주저하는 것도 이유일 수 있습니다.

또한 연구에서 발행된 데이터는 단어의 빈도 수를 보여주지만匿名화되어 있으므로 연구된 출판물에 대한 미디어 편향을 명확하게 파악하기 어렵습니다. 이 프로젝트를 어떤 식으로든 운영화하지 않는 한, 이는 선택된 예시만을 제공합니다.

이와 같은 후속 연구는 주제가 다루어지는 방식뿐만 아니라 주제가 다루어지는지 여부를 고려하는 것이 더 유용할 것입니다. 이는沉默이 볼륨을 말하며, 이는 종종 예산 제한이나 뉴스 선택을 информ하는 다른 실용적인 요소 이상을 말합니다.

그러나 MIT 연구는 현재까지 가장 큰 연구이며, 미래의 분류 시스템 및 브라우저 플러그인과 같은 보조 기술의 프레임워크를 형성할 수 있습니다.

버블, 편향, 반발

또한 이러한 시스템이 알고리즘 추천 시스템의 가장 논란의 여지가 있는 측면 중 하나인, 사용자가 대조적이거나 도전적인 관점을 보지 못하는 환경으로 사용자를 인도하는 경향을 더욱 강화할 수 있는지 여부를 고려해야 합니다.

이러한 콘텐츠 버블이 ‘안전한 환경’인지, 지적 성장의 장애물인지, 또는 부분적인 선전에 대한 보호인지 여부는 가치 판단이며, 기계 학습 시스템의 메커니즘적, 통계적 관점에서 접근하기 어려운 철학적 문제입니다.

さらに, MIT 연구가 데이터를 통해 결과를 정의하려고 노력했지만, 문구의 정치적 가치를 분류하는 것은 또한 가치 판단의 일종이며, 이는 언어가 독성 또는 논란의 콘텐츠를 새롭게 코드화할 수 있는 능력으로 인해 쉽게 저항할 수 없습니다.

이러한 종류의 코드화가 대중적인 온라인 시스템에 내장되면, 주요 뉴스 아웃렛의 윤리적 및 정치적 온도를 매핑하는 지속적인 노력이 기계 학습의 의미론 이해를 정기적으로 앞서는 발전하는 관용구를 사용하여 출판자가 자신의 입장을 표현하는 능력과의 냉전으로 발전할 가능성이 있습니다.

2021년 9월 14일 1:41 GMT+2 – ‘100개 신문’을 ‘100개 뉴스 아웃렛’으로 변경했습니다. 4:58 pm – Samantha D’Alonzo를 포함한 논문 인용을 수정하고 관련 수정을 수행했습니다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai