โมเดลและแพลตฟอร์ม AI
โมเดลทางสถิติช่วยตรวจจับข้อมูลที่ไม่ถูกต้องบนโซเชียลมีเดีย
ศาสตราจารย์ทางคณิตศาสตร์จาก American University ร่วมกับทีมผู้ร่วมงานพัฒนาโมเดลทางสถิติที่สามารถตรวจจับข้อมูลที่ไม่ถูกต้องในโพสต์บนโซเชียลมีเดีย
การเรียนรู้ของเครื่องจักรกำลังถูกนำมาใช้เพิ่มเติมเพื่อป้องกันการแพร่กระจายของข้อมูลที่ไม่ถูกต้อง แต่ยังคงมีอุปสรรคสำคัญที่เกี่ยวข้องกับปัญหา “กล่องดำ” ที่เกิดขึ้น ซึ่งหมายถึงเมื่อนักวิจัยไม่เข้าใจว่าเครื่องจักรตัดสินใจเช่นเดียวกับเทรนเนอร์ของมนุษย์
ตรวจจับข้อมูลที่ไม่ถูกต้องด้วยโมเดลทางสถิติ
Zois Boukouvalas ผู้ช่วยศาสตราจารย์ในสาขาคณิตศาสตร์และสถิติของ AU ใช้เซตข้อมูล Twitter ที่มีทวีตที่ไม่ถูกต้องเกี่ยวกับ COVID-19 เพื่อแสดงว่าโมเดลทางสถิติสามารถตรวจจับข้อมูลที่ไม่ถูกต้องบนโซเชียลมีเดียในช่วงเหตุการณ์สำคัญ เช่น การระบาดทั่วหรือภัยพิบัติ
Boukouvalas และทีมงานของเขา ซึ่งรวมถึงนักศึกษา Caitlin Moroney และศาสตราจารย์ Nathalie Japkowics ในสาขาวิทยาการคอมพิวเตอร์ ได้แสดงว่าโมเดลสามารถตัดสินใจที่สอดคล้องกับมนุษย์ได้อย่างไร ในการวิจัยที่ตีพิมพ์ใหม่การวิจัยใหม่.
“เราต้องการทราบว่าเครื่องจักรคิดอะไรเมื่อตัดสินใจ และวิธีการที่เครื่องจักรตัดสินใจที่สอดคล้องกับเทรนเนอร์ของมนุษย์” Boukouvalas กล่าว “เราต้องการทราบว่าทำไมเครื่องจักรจึงตัดสินใจที่มีอคติ และไม่ต้องการปิดบัญชีโซเชียลมีเดียของใครบางคนเพราะโมเดลตัดสินใจที่มีอคติ”
วิธีการที่ทีมงานใช้คือการเรียนรู้ของเครื่องจักรที่อาศัยสถิติ โมเดลทางสถิติมีประสิทธิภาพและให้วิธีการใหม่ในการต่อต้านข้อมูลที่ไม่ถูกต้อง
โมเดลสามารถทำนายผลลัพธ์ได้ด้วยความแม่นยำสูง และสามารถจำแนกทวีตที่ไม่ถูกต้องและทวีตที่ถูกต้องจากเซตทดสอบ 112 ทวีตได้ถึง 90%
“สิ่งที่สำคัญเกี่ยวกับการค้นพบครั้งนี้คือโมเดลของเราสามารถทำนายผลลัพธ์ได้แม่นยำและให้ความโปร่งใสเกี่ยวกับวิธีการที่โมเดลตรวจจับทวีตที่ไม่ถูกต้อง” Boukouvalas กล่าวต่อ “วิธีการเรียนรู้ของเครื่องจักรลึกไม่สามารถทำนายผลลัพธ์ได้แม่นยำและให้ความโปร่งใสได้”
การฝึกอบรมและเตรียมโมเดล
นักวิจัยเตรียมโมเดลก่อนที่จะทดสอบโมเดลบนเซตข้อมูล เนื่องจากข้อมูลที่มนุษย์ให้มาสามารถทำให้เกิดอคติและกล่องดำ
ทวีตถูกเลือกโดยนักวิจัยว่าเป็นทวีตที่ไม่ถูกต้องหรือทวีตที่ถูกต้องตามกฎที่กำหนดไว้ล่วงหน้าเกี่ยวกับภาษาที่ใช้ในทวีตที่ไม่ถูกต้อง ทีมงานยังพิจารณานัยของภาษามนุษย์และคุณลักษณะทางภาษาที่เกี่ยวข้องกับข้อมูลที่ไม่ถูกต้อง
ก่อนที่จะฝึกอบรมโมเดล ผู้ช่วยศาสตราจารย์ Christine Mallinson จาก University of Maryland Baltimore County ได้ระบุทวีตที่มีรูปแบบการเขียนที่เกี่ยวข้องกับข้อมูลที่ไม่ถูกต้อง อคติ และแหล่งข้อมูลที่ไม่น่าเชื่อถือ
“เมื่อเราบวกข้อมูลเหล่านี้เข้าไปในโมเดล โมเดลจะพยายามเข้าใจปัจจัยที่ซ่อนอยู่ที่ทำให้ข้อมูลที่ดีและไม่ดีแยกออกจากกัน” Japkowicz กล่าว “โมเดลกำลังเรียนรู้เกี่ยวกับบริบทและวิธีการที่คำศัพท์ต่างๆ สื่อสารกัน”
นักวิจัยจะพัฒนาโมเดลให้ดีขึ้นโดยการปรับปรุงอินเทอร์เฟซผู้ใช้และความสามารถในการตรวจจับข้อมูลที่ไม่ถูกต้องในโพสต์บนโซเชียลมีเดียที่มีรูปภาพหรือมัลติมีเดียอื่นๆ โมเดลทางสถิติจะต้องเรียนรู้เกี่ยวกับวิธีการที่องค์ประกอบต่างๆ สื่อสารกันเพื่อสร้างข้อมูลที่ไม่ถูกต้อง
ทั้ง Boukouvalas และ Japkowicz กล่าวว่าความฉลาดของมนุษย์และการรู้หนังสือเป็นกุญแจสำคัญในการหยุดการแพร่กระจายของข้อมูลที่ไม่ถูกต้อง
“เราออกแบบเครื่องมือที่อาศัยการเรียนรู้ของเครื่องจักรเพื่อเตือนและให้ความรู้แก่สาธารณชนเพื่อกำจัดข้อมูลที่ไม่ถูกต้อง แต่เรายังคงเชื่อมั่นว่ามนุษย์ต้องมีบทบาทที่แข็งแกร่งในการไม่แพร่กระจายข้อมูลที่ไม่ถูกต้องในตอนแรก” Boukouvalas กล่าว












