มุมมองของ Anderson

MIT: การวัดความเอนเอียงของสื่อในสำนักข่าวหลักด้วย Machine Learning

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

การศึกษาจาก MIT ได้ใช้เทคนิค Machine Learning เพื่อระบุภาษาที่มีความเอนเอียงในสำนักข่าวหลักและอิทธิพลในประเทศสหรัฐอเมริกาและต่างประเทศ รวมถึง 83 สำนักข่าวที่มีอิทธิพลมากที่สุด การศึกษานี้แสดงให้เห็นถึงระบบอัตโนมัติที่สามารถจำแนกคุณลักษณะทางการเมืองของสำนักข่าวและให้ข้อมูลเชิงลึกเกี่ยวกับจุดยืนของสำนักข่าวในประเด็นที่ผู้อ่านสนใจ

งานวิจัยนี้มุ่งเน้นไปที่วิธีการที่ประเด็นถูกกล่าวถึงด้วยภาษาที่เฉพาะเจาะจง เช่น ผู้อพยพที่ไม่มีเอกสาร | ผู้อพยพที่ผิดกฎหมาย, ทารกในครรภ์ | ทารกที่ยังไม่เกิด, ผู้ประท้วง | ผู้ก่อความไม่สงบ.

โครงการนี้ใช้เทคนิค Natural Language Processing (NLP) เพื่อแยกและจำแนกภาษาที่มีความเอนเอียง (โดยสมมติว่าภาษาที่ดูเป็นกลางมากกว่านั้นยังแสดงถึงจุดยืนทางการเมือง) เข้าสู่ระบบการทำแผนที่ที่กว้างขึ้น ซึ่งแสดงให้เห็นถึงความเอนเอียงทางซ้ายและขวาในสำนักข่าวหลักกว่า 3 ล้านบทความจากสำนักข่าวกว่า 100 สำนัก ส่งผลให้เกิด ภูมิประเทศของความเอนเอียง ของสำนักข่าวที่ศึกษา

บทความนี้มาจาก Samantha D’Alonzo และ Max Tegmark จากภาควิชาฟิสิกส์ของ MIT และสังเกตว่าโครงการต่างๆ ที่เกี่ยวข้องกับการ “ตรวจสอบข้อเท็จจริง” ในช่วงหลังของเรื่องอื้อฉาว “ข่าวปลอม” สามารถ ตีความได้ว่าเป็นการไม่ซื่อสัตย์ และรับใช้ผลประโยชน์ของกลุ่มที่เฉพาะเจาะจง โครงการนี้มีจุดมุ่งหมายเพื่อให้แนวทางที่ขึ้นอยู่กับข้อมูลในการศึกษาการใช้ภาษาที่มีความเอนเอียงและ “มีอิทธิพล” ในบริบทข่าวที่เป็นกลาง

สเปกตรัมของคำศัพท์ (โดยตรงและเป็นรูปธรรม) จากซ้ายไปขวา ตามที่ได้รับจากการศึกษา

สเปกตรัมของคำศัพท์ (โดยตรงและเป็นรูปธรรม) จากซ้ายไปขวา ตามที่ได้รับจากการศึกษา Source: https://arxiv.org/pdf/2109.00024.pdf

การประมวลผล NLP

ข้อมูลที่ใช้ในการศึกษานี้ได้มาจากฐานข้อมูล Newspaper3K ที่เปิดให้ใช้งาน และประกอบด้วย 3,078,624 บทความที่ได้รับจาก 100 สำนักข่าว รวมถึง 83 สำนักข่าวที่มีอิทธิพลมากที่สุด สำนักข่าวเหล่านี้ถูกเลือกตามขนาดและอิทธิพลของพวกเขา ในขณะที่แหล่งข่าวออนไลน์รวมถึงบทความจาก Defense One และ Science ด้วย

แหล่งข่าวที่ใช้ในการศึกษา

แหล่งข่าวที่ใช้ในการศึกษา

บทความนี้รายงานว่าข้อความที่ดาวน์โหลดมาถูก “ประมวลผลขั้นต่ำ” คำพูดตรงถูกกำจัดออกไป เนื่องจากการศึกษานี้สนใจในภาษาที่นักข่าวเลือก (แม้ว่าการเลือกคำพูดจะถือเป็น สาขาวิชาที่น่าสนใจ ด้วย)

การสะกดแบบอังกฤษถูกเปลี่ยนเป็นแบบอเมริกันเพื่อทำให้ฐานข้อมูลเป็นมาตรฐาน ลบเครื่องหมายวรรคตอนและตัวเลขที่ไม่ใช่ตัวเลข อักษรตัวแรกของประโยคถูกแปลงเป็นตัวพิมพ์เล็ก แต่อักษรตัวแรกของประโยคอื่นๆ ถูกเก็บไว้

100,000 เฟรซที่พบบ่อยที่สุดถูกกำหนดและจัดอันดับ ล้างและรวมเข้ากับรายการเฟรซ สิ่งพิมพ์ที่ซ้ำกันที่สามารถระบุได้ (เช่น ‘แชร์บทความนี้’ และ ‘บทความที่เผยแพร่ซ้ำ’) ถูกลบออกไป การเปลี่ยนแปลงระหว่างเฟรซที่เหมือนกัน (เช่น ‘เทคโนโลยีใหญ่’ และ ‘Big Tech’, ‘ความมั่นคงทางไซเบอร์’ และ ‘ความมั่นคงทางไซเบอร์’) ถูกมาตรฐาน化

‘การเก็บเกี่ยวถั่ว’

การทดสอบครั้งแรกเกี่ยวกับหัวข้อ ‘ชีวิตของคนดำมีค่า’ และสามารถแยกความเอนเอียงของเฟรซและคำศัพท์ที่มีค่าเท่ากันในข้อมูล

ส่วนประกอบหลักของบทความเกี่ยวกับ Black Lives Matter (BLM)

ส่วนประกอบหลักของบทความเกี่ยวกับ Black Lives Matter (BLM)

ในขณะที่ ‘ผู้ประท้วง’ ข้ามจาก ‘ผู้ก่อความไม่สงบ’ ไปเป็น ‘ผู้ก่อความวุ่นวาย’ เมื่อเราเลื่อนไปตามจุดยืนทางการเมืองของสำนักข่าวที่เกี่ยวข้อง บทความนี้ชี้ให้เห็นว่าระบบการประมวลผล NLP และการวิเคราะห์ถูกขัดขวางโดยการปฏิบัติของ ‘การเก็บเกี่ยวถั่ว’ – เมื่อสำนักข่าวอ้างคำศัพท์ที่ถือว่าถูกต้องโดยส่วนหนึ่งของสังคมที่มีจุดยืนทางการเมืองที่แตกต่างกัน และสามารถ (ดูเหมือน) พึ่งพาอ่านของตนเองในการมองคำศัพท์นั้นในแง่ลบ บทความนี้อ้าง ‘การยกเลิกการให้ทุนแก่ตำรวจ’ เป็นตัวอย่างของสิ่งนี้

ตามธรรมชาติแล้ว สิ่งนี้หมายความว่าคำศัพท์ที่ ‘เอียงซ้าย’ จะปรากฏในบริบทที่เอียงขวา และเป็นตัวอย่างที่ไม่寻常สำหรับระบบ NLP ที่พึ่งพาเฟรซที่เข้ารหัสเพื่อแสดงถึงจุดยืนทางการเมือง

เฟรซดังกล่าวเป็น ‘สองค่า’ [SIC] ในขณะที่เฟรซบางตัวมีการใช้ที่มีการรับรู้เชิงลบอย่างกว้างขวาง (เช่น ‘การฆ่าเด็ก’) ที่แสดงถึงค่าลบเสมอในสำนักข่าวต่างๆ

การวิจัยยังแสดงให้เห็นถึงการทำแผนที่ที่คล้ายกันสำหรับหัวข้อ ‘ร้อนที่สุด’ เช่น การทำแท้ง การเซ็นเซอร์ของเทคโนโลยี การอพยพของสหรัฐอเมริกา และการควบคุมอาวุธปืน

ม้าขี่

มีบางประเด็นที่มีความเอนเอียงทางการเมืองในสำนักข่าวที่ไม่แบ่งออกได้อย่างคาดเดาได้ เช่น หัวข้อการใช้จ่ายทางทหาร บทความพบว่า CNN ที่ ‘เอียงซ้าย’ จบลงด้วยการอยู่ข้างๆ National Review และ Fox News ที่เอียงขวาในเรื่องนี้

โดยทั่วไปแล้ว จุดยืนทางการเมืองสามารถกำหนดได้จากเฟรซอื่นๆ เช่น การใช้เฟรซ ‘กลุ่มอุตสาหกรรมทหาร’ มากกว่า ‘อุตสาหกรรมป้องกัน’ ที่เอียงขวามากกว่า ผลการวิจัยแสดงให้เห็นว่าเฟรซแรกถูกใช้โดยสำนักข่าวที่วิพากษ์วิจารณ์เช่น Canary และ American Conservative ในขณะที่เฟรซที่สองถูกใช้บ่อยกว่าโดย Fox และ CNN

การวิจัยกำหนดเส้นทางอื่นๆ ที่เปลี่ยนจากภาษาที่วิพากษ์วิจารณ์เชิงสถาบันไปเป็นภาษาที่สนับสนุนสถาบัน รวมถึงการเปลี่ยนแปลงจาก ‘ถูกยิงเสียชีวิต’ ไปเป็น ‘การฆ่า’ ที่เป็นกลางกว่า ‘นักโทษ’ ไปเป็น ‘ผู้ถูกกักขัง’ และ ‘ผู้ผลิตน้ำมัน’ ไปเป็น ‘น้ำมันใหญ่’

คำศัพท์ที่มีค่าเท่ากันพร้อมความเอนเอียงของสถาบัน

คำศัพท์ที่มีค่าเท่ากันพร้อมความเอนเอียงของสถาบัน

การวิจัยยอมรับว่าสำนักข่าวจะ ‘หลบหลีก’ จากจุดยืนทางการเมืองของตนเอง ไม่ว่าจะเป็นในระดับภาษา (เช่น การใช้เฟรซที่มีค่าสองเท่า) หรือในระดับอื่นๆ ตัวอย่างเช่น สำนักข่าวที่มีอิทธิพลทางขวาของสหราชอาณาจักร The Spectator ซึ่งก่อตั้งในปี 1828 มักจะนำเสนอความคิดเห็นที่มีจุดยืนซ้ายที่ขัดแย้งกับกระแสหลักของเนื้อหาของตน

สิ่งเหล่านี้เป็น ‘ม้าขี่’ และการใช้มุมมองที่ไม่ชัดเจนในสำนักข่าวต่างๆ ทำให้การทำแผนที่ซ้าย-ขวาที่การวิจัยนำเสนอไม่ชัดเจน แต่ก็ให้ข้อมูลโดยทั่วไปเกี่ยวกับการเชื่อมโยงทางการเมือง

ความสำคัญที่ถูกถือเป็นความลับ

แม้ว่าบทความนี้จะเผยแพร่เมื่อวันที่ 2 กันยายน และเผยแพร่เมื่อสิ้นเดือนสิงหาคม 2021 แต่ก็ได้รับความสนใจน้อยมาก ส่วนหนึ่งอาจเป็นเพราะว่าการวิจัยที่มุ่งเป้าไปที่สื่อหลักไม่น่าจะได้รับการตอบรับที่กระตือรือร้นจากสื่อหลัก แต่ก็อาจเป็นเพราะความไม่เต็มใจของผู้เขียนในการสร้างกราฟที่ชัดเจนและไม่มีข้อขัดแย้งในการจัดเรียงสำนักข่าวที่มีอิทธิพลและทรงพลังในเรื่องต่างๆ พร้อมด้วยค่ารวมที่บ่งบอกถึงระดับที่สำนักข่าวเอียงซ้ายหรือขวา

ในทำนองเดียวกัน ข้อมูลที่เผยแพร่จากโครงการนี้แสดงให้เห็นถึงการนับจำนวนครั้งที่พบของคำศัพท์ แต่ดูเหมือนว่าจะถูกทำให้ไม่ระบุชื่อ ทำให้ยากที่จะเห็นภาพความเอนเอียงของสื่อในสำนักข่าวที่ศึกษา โดยไม่มีการดำเนินการใดๆ ในโครงการนี้ จะเหลือเพียงตัวอย่างที่เลือกมาจากบทความเท่านั้น

การศึกษาต่อๆ ไปอาจมีประโยชน์มากกว่าหากพิจารณาไม่เพียงแต่ภาษาที่ใช้สำหรับหัวข้อ แต่ยังรวมถึงการครอบคลุมหัวข้อนั้นด้วย เนื่องจาก ความเงียบก็พูดได้ และมีลักษณะทางการเมืองที่ชัดเจนซึ่งมักจะพูดถึงมากกว่าแค่ข้อจำกัดด้านงบประมาณหรือปัจจัยเชิงปฏิบัติที่อาจมีอิทธิพลต่อการเลือกข่าว

อย่างไรก็ตาม การศึกษาของ MIT ดูเหมือนจะเป็นการศึกษาที่ใหญ่ที่สุดในประเภทนี้ และสามารถเป็นกรอบสำหรับระบบการจำแนกประเภทในอนาคต และอาจเป็นเทคโนโลยีรอง เช่น ปลั๊กอินของเบราว์เซอร์ที่อาจเตือนผู้อ่านเกี่ยวกับสีทางการเมืองของสำนักข่าวที่กำลังอ่านอยู่

ฟองสบู่ ความเอนเอียง และการโต้กลับ

นอกจากนี้ จะต้องพิจารณาว่าระบบดังกล่าวจะทำให้หนึ่งในแง่มุมที่ถกเถียงกันมากที่สุดของระบบการแนะนำอัลกอริทึม – ความโน้มเอียงที่จะนำผู้ชมเข้าสู่สภาพแวดล้อมที่ไม่เคยเห็นมุมมองที่ขัดแย้งหรือท้าทาย – มากขึ้นหรือไม่ ซึ่งมีแนวโน้มที่จะทำให้ผู้อ่านยึดมั่นในจุดยืนของตนเองในประเด็นหลัก

ไม่ว่าฟองสบู่ดังกล่าวจะเป็น ‘สภาพแวดล้อมที่ปลอดภัย’ อุปสรรคต่อการเติบโตทางปัญญา หรือการป้องกันการโฆษณาชวนเชื่อเป็นเรื่องตัดสินตามคุณค่า – เป็นเรื่องเชิงปรัชญาที่ยากที่จะเข้าใกล้จากมุมมองเชิงกลไกและสถิติของระบบ Machine Learning

นอกจากนี้ การจำแนกคุณค่าทางการเมืองของเฟรซเป็นเรื่องตัดสินตามคุณค่า และเป็นเรื่องที่ไม่สามารถต้านทานความสามารถของภาษาที่จะ เปลี่ยนรหัส เนื้อหาที่เป็นพิษหรือที่ถูกโต้แย้งใหม่ในเฟรซที่ไม่มีอยู่ในคู่มือ กฎของฟอรัม หรือฐานข้อมูลการฝึกอบรม

หากการเข้ารหัสประเภทนี้กลายเป็นส่วนหนึ่งของระบบออนไลน์ที่ได้รับความนิยม มันจะน่าจะกลายเป็นสงครามเย็นระหว่างความสามารถของ AI ในการตรวจจับความเอนเอียงและความสามารถของสำนักข่าวในการแสดงจุดยืนของตนเองในภาษาที่พัฒนาเพื่อหลบหนีจากความเข้าใจของ Machine Learning ในด้านความหมาย

14/09/21 – 1.41 GMT+2 – เปลี่ยน ‘100 หนังสือพิมพ์’ เป็น ‘100 สำนักข่าว’
4:58pm – แก้ไขการอ้างอิงบทความเพื่อรวม Samantha D’Alonzo และการแก้ไขที่เกี่ยวข้อง

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai