Góc nhìn Anderson

MIT: Đo lường thiên vị truyền thông trong các kênh tin tức lớn với Học máy

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Một nghiên cứu từ MIT đã sử dụng các kỹ thuật học máy để xác định thiên vị ngôn từ trên khoảng 100 kênh tin tức lớn và có ảnh hưởng nhất ở Mỹ và trên thế giới, bao gồm 83 tờ báo in có ảnh hưởng nhất. Đây là một nỗ lực nghiên cứu cho thấy cách các hệ thống tự động có thể phân loại tính cách chính trị của một ấn phẩm và cung cấp cho người đọc cái nhìn sâu sắc hơn về quan điểm đạo đức của một kênh tin tức về các chủ đề mà họ có thể cảm thấy đam mê.

Công việc này tập trung vào cách các chủ đề được đề cập với ngôn từ cụ thể, chẳng hạn như người nhập cư không giấy tờ | người nhập cư bất hợp pháp, phôi thai | trẻ sơ sinh, người biểu tình | người vô chính phủ.

Dự án này sử dụng các kỹ thuật Xử lý Ngôn ngữ Tự nhiên (NLP) để trích xuất và phân loại các ví dụ về ngôn từ “điện” (với giả định rằng các thuật ngữ trung lập rõ ràng cũng đại diện cho một quan điểm chính trị) vào một bản đồ rộng lớn cho thấy thiên vị trái và phải trên hơn ba triệu bài viết từ khoảng 100 kênh tin tức, dẫn đến một bản đồ thiên vị có thể điều hướng của các ấn phẩm được đề cập.

Bài báo này đến từ Samantha D’Alonzo và Max Tegmark tại Bộ phận Vật lý của MIT, và quan sát thấy rằng một số sáng kiến gần đây về “kiểm tra事 thực” có thể được giải thích là không trung thực và phục vụ cho các lợi ích cụ thể. Dự án này nhằm mục đích cung cấp một cách tiếp cận dựa trên dữ liệu để nghiên cứu việc sử dụng thiên vị và ngôn từ “ảnh hưởng” trong một bối cảnh tin tức trung lập.

Một phổ của (về mặt chữ nghĩa) từ trái sang phải, được rút ra từ nghiên cứu. Nguồn: https://arxiv.org/pdf/2109.00024.pdf

Một phổ của (về mặt chữ nghĩa) từ trái sang phải, được rút ra từ nghiên cứu. Nguồn: https://arxiv.org/pdf/2109.00024.pdf

Xử lý NLP

Dữ liệu nguồn của nghiên cứu này được thu thập từ cơ sở dữ liệu mở Newspaper3K, và bao gồm 3.078.624 bài viết thu được từ 100 nguồn tin tức, bao gồm 83 tờ báo. Các tờ báo được chọn dựa trên phạm vi ảnh hưởng của chúng, trong khi các nguồn tin tức trực tuyến cũng bao gồm các bài viết từ trang phân tích tin tức quân sự Defense OneScience.

Các nguồn được sử dụng trong nghiên cứu.

Các nguồn được sử dụng trong nghiên cứu.

Bài báo cho biết rằng văn bản đã được tải xuống đã được “tối thiểu” tiền xử lý. Các trích dẫn trực tiếp đã được loại bỏ, vì nghiên cứu quan tâm đến ngôn từ được các nhà báo chọn (mặc dù việc chọn trích dẫn cũng là một lĩnh vực nghiên cứu thú vị).

Orthography tiếng Anh đã được thay đổi thành tiếng Anh Mỹ để tiêu chuẩn hóa cơ sở dữ liệu, tất cả dấu câu đã bị loại bỏ và tất cả các số thứ tự cũng đã bị loại bỏ. Việc viết hoa câu ban đầu đã được chuyển thành chữ thường, nhưng tất cả các chữ hoa khác vẫn được giữ lại.

Các cụm từ 100.000 phổ biến nhất đã được xác định và cuối cùng đã được xếp hạng, làm sạch và hợp nhất vào một danh sách cụm từ. Tất cả ngôn từ thừa mà có thể được xác định (chẳng hạn như ‘Chia sẻ bài viết này’ và ‘bài viết được đăng lại’) cũng đã bị xóa. Các biến thể trên cơ bản là các cụm từ giống hệt (ví dụ: ‘công nghệ lớn’ và ‘Big Tech’, ‘an ninh mạng’ và ‘an ninh mạng’) đã được tiêu chuẩn hóa.

‘Nutpicking’

Bài kiểm tra ban đầu là về chủ đề ‘Black lives matter’, và đã có thể phân biệt thiên vị cụm từ và đồng nghĩa valent trên dữ liệu.

Các thành phần chính tổng quát cho các bài viết về Black Lives Matter (BLM). Chúng tôi thấy những người tham gia vào hành động dân sự được đặc trưng, về mặt chữ nghĩa và hình ảnh, từ trái sang phải, như những người biểu tình, những người vô chính phủ và, ở cuối bên phải của phổ, như những 'kẻ bạo loạn'. Các tờ báo nơi bắt nguồn từ cụm từ được thể hiện trong bảng điều khiển bên phải.

Các thành phần chính tổng quát cho các bài viết về Black Lives Matter (BLM). Chúng tôi thấy những người tham gia vào hành động dân sự được đặc trưng, về mặt chữ nghĩa và hình ảnh, từ trái sang phải, như những người biểu tình, những người vô chính phủ và, ở cuối bên phải của phổ, như những ‘kẻ bạo loạn’. Các tờ báo nơi bắt nguồn từ cụm từ được thể hiện trong bảng điều khiển bên phải.

Khi ‘người biểu tình’ di chuyển từ ‘người vô chính phủ’ sang ‘kẻ bạo loạn’ khi chúng ta trượt dọc theo quan điểm chính trị của kênh tin tức, bài báo lưu ý rằng việc trích xuất và phân tích NLP bị cản trở bởi việc thực hành ‘nutpicking’ – nơi một kênh tin tức sẽ trích dẫn một cụm từ được coi là hợp lệ bởi một phân khúc chính trị khác của xã hội, và có thể (dường như) dựa vào độc giả của nó để xem cụm từ đó một cách tiêu cực. Bài báo trích dẫn ‘bãi bỏ cảnh sát’ như một ví dụ về điều này.

Tự nhiên, điều này có nghĩa là một cụm từ ‘trái’ xuất hiện trong một bối cảnh phải, và đại diện cho một thách thức không bình thường cho một hệ thống NLP đang dựa vào các cụm từ được mã hóa để hoạt động như các chỉ số cho quan điểm chính trị.

Các cụm từ như vậy là ‘đa giá trị’ [SIC], trong khi một số cụm từ khác có một ý nghĩa tiêu cực phổ quát (ví dụ: ‘sát hại trẻ sơ sinh’) mà chúng luôn được thể hiện là tiêu cực trên một loạt các kênh tin tức.

Nghiên cứu cũng tiết lộ các bản đồ tương tự cho các chủ đề ‘nóng’ như phá thai, kiểm duyệt công nghệ, nhập cư Mỹ và kiểm soát súng.

Hobby Horses

Có một số khuynh hướng chính trị tranh cãi trong các kênh tin tức không chia tách một cách dự đoán, chẳng hạn như chủ đề chi tiêu quân sự. Bài báo cho biết rằng ‘trái’ CNN kết thúc bên cạnh National Review và Fox News phải về chủ đề này.

Trong chung, tuy nhiên, quan điểm chính trị có thể được xác định bởi các cụm từ khác, chẳng hạn như ưa thích cụm từ ‘phức hợp công nghiệp quân sự’ hơn ‘ngành công nghiệp quốc phòng’. Kết quả cho thấy rằng cụm từ trước được sử dụng bởi các kênh tin tức chỉ trích như CanaryAmerican Conservative, trong khi cụm từ sau được sử dụng nhiều hơn bởi Fox và CNN.

Nghiên cứu thiết lập một số tiến trình khác từ ngôn từ chỉ trích thành lập đến ngôn từ ủng hộ, bao gồm phổ từ ‘bắn chết’ đến ‘sát hại’; ‘tù nhân phạm tội’ đến ‘người bị giam giữ’; và ‘nhà sản xuất dầu’ đến ‘dầu lớn’.

Đồng nghĩa valent với thiên vị thành lập, từ trên xuống dưới.

Đồng nghĩa valent với thiên vị thành lập, từ trên xuống dưới.

Nghiên cứu thừa nhận rằng các kênh tin tức sẽ ‘đánh xa’ khỏi quan điểm chính trị cơ bản của chúng, hoặc ở mức ngôn từ (chẳng hạn như sử dụng cụm từ đa giá trị), hoặc vì các động cơ khác. Ví dụ, tờ báo cánh hữu lâu đời của Anh The Spectator, thành lập năm 1828, thường xuyên và nổi bật giới thiệu các bài viết cánh tả mà mài mòn dòng chảy chính trị chung của nội dung của nó. Việc liệu điều này được thực hiện vì sự báo cáo vô tư hay để thỉnh thoảng kích động độc giả cốt lõi của nó vào các cơn bão bình luận sinh ra lưu lượng truy cập là một vấn đề suy đoán – và không phải là một trường hợp dễ dàng cho một hệ thống học máy đang tìm kiếm các mã hóa và dấu hiệu nhất quán.

Các ‘hobby horses’ và sử dụng mơ hồ ‘đánh giá’ này trong số các kênh tin tức cá nhân làm cho bản đồ trái-phải mà nghiên cứu cuối cùng cung cấp trở nên hơi khó hiểu, mặc dù cung cấp một dấu hiệu rộng về sự liên kết chính trị.

Thiên vị bị che giấu

Mặc dù được viết vào ngày 2 tháng 9 và xuất bản vào cuối tháng 8 năm 2021, bài báo này đã thu hút tương đối ít sự chú ý. Một phần có thể là vì nghiên cứu quan trọng nhằm vào truyền thông chính thống không được truyền thông chính thống tiếp nhận với sự nhiệt tình; nhưng nó cũng có thể là do sự miễn cưỡng của các tác giả trong việc tạo ra các đồ thị rõ ràng và không mơ hồ phân loại vị trí của các ấn phẩm truyền thông có ảnh hưởng và quyền lực trên các vấn đề khác nhau, cùng với các giá trị tổng hợp cho thấy mức độ một ấn phẩm nghiêng về trái hoặc phải. Về cơ bản, các tác giả dường như cố gắng làm giảm tác động tiềm tàng của kết quả.

Đồng thời, dữ liệu được xuất bản từ dự án cho thấy số lượng lần xuất hiện của từ, nhưng dường như đã được ẩn danh, khiến cho việc có được một bức tranh rõ ràng về thiên vị truyền thông trên các ấn phẩm được nghiên cứu trở nên khó khăn. Nếu không hoạt động hóa dự án theo một cách nào đó, điều này chỉ để lại các ví dụ được chọn trong bài báo.

Các nghiên cứu sau này về loại này có thể hữu ích hơn nếu chúng xem xét không chỉ ngôn từ được sử dụng cho các chủ đề, mà còn liệu chủ đề có được đề cập hay không, vì im lặng nói lên rất nhiều, và có một đặc điểm chính trị riêng biệt thường nói lên nhiều hơn chỉ là những hạn chế về ngân sách hoặc các yếu tố thực tế khác có thể thông báo cho việc chọn lọc tin tức.

Tuy nhiên, nghiên cứu của MIT dường như là nghiên cứu lớn nhất thuộc loại này cho đến nay, và có thể tạo thành khuôn khổ cho các hệ thống phân loại trong tương lai, và thậm chí cả các công nghệ thứ cấp như các tiện ích mở rộng trình duyệt có thể cảnh báo người đọc bình thường về màu sắc chính trị của ấn phẩm họ đang đọc.

Bong bóng, Thiên vị và Phản ứng

Ngoài ra, cần xem xét liệu các hệ thống như vậy có làm tăng một trong những khía cạnh gây tranh cãi nhất của các hệ thống khuyến nghị thuật toán – xu hướng dẫn người xem vào các môi trường nơi họ không bao giờ nhìn thấy một quan điểm trái ngược hoặc thách thức, điều này có thể làm tăng thêm quan điểm của người đọc về các vấn đề cốt lõi.

Liệu một bong bóng nội dung như vậy có phải là một ‘môi trường an toàn’, một chướng ngại vật đối với sự phát triển trí tuệ, hay một sự bảo vệ chống lại tuyên truyền một phần, là một phán quyết về giá trị – một vấn đề triết học khó tiếp cận từ quan điểm cơ học, thống kê của các hệ thống học máy.

Hơn nữa, giống như nghiên cứu của MIT đã cố gắng để dữ liệu xác định kết quả, việc phân loại giá trị chính trị của các cụm từ là một loại phán quyết về giá trị, và một trong những điều mà không thể dễ dàng chống lại khả năng của ngôn ngữ để tái mã hóa nội dung độc hại hoặc gây tranh cãi thành các cụm từ mới không có trong sổ tay, các quy tắc diễn đàn hoặc cơ sở dữ liệu đào tạo.

Nếu một loại mã hóa như vậy được nhúng vào các hệ thống trực tuyến phổ biến, dường như có khả năng rằng một nỗ lực liên tục để lập bản đồ nhiệt độ chính trị và đạo đức của các kênh tin tức lớn có thể phát triển thành một cuộc chiến tranh lạnh giữa khả năng của AI để phân biệt thiên vị và khả năng của các nhà xuất bản để thể hiện quan điểm của họ trong một ngôn ngữ đang phát triển được thiết kế để thường xuyên vượt qua sự hiểu biết của học máy về ngữ nghĩa.

14/09/21 – 1.41 GMT+2 – Thay đổi ‘100 tờ báo’ thành ‘100 kênh tin tức’
4:58pm – Sửa đổi trích dẫn bài báo để bao gồm Samantha D’Alonzo, và các sửa đổi liên quan.

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được併 nhập vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai