มุมมองของ Anderson
ข้อมูลที่ไม่ได้รับการดูแลอย่างเหมาะสมใน AI ที่มีขนาดใหญ่กว่าข้อมูลบนอินเทอร์เน็ตเองหรือไม่?

นักวิจัยจากไอร์แลนด์ สหราชอาณาจักร และสหรัฐอเมริกาได้เตือน rằngการเติบโตของชุดข้อมูล AI ที่มีขนาดใหญ่มากอาจแพร่กระจายสิ่งที่เลวร้ายที่สุดของแหล่งที่มาของอินเทอร์เน็ต โดยโต้แย้งว่าชุดข้อมูลทางวิชาการที่เพิ่งเปิดตัวมี ‘ภาพและข้อความที่น่ากลัวและชัดเจนเกี่ยวกับการข่มขืน โป๊ มุมมองเชิงลบ และคำดูถูกที่มีศักยภาพในการก่อให้เกิดปัญหา’。
นักวิจัยเชื่อว่าคลื่นใหม่ของชุดข้อมูลหลายรูปแบบที่มีขนาดใหญ่มากซึ่งไม่ได้รับการดูแลหรือกรองอย่างไม่ถูกต้องอาจเป็นอันตรายมากกว่าเนื่องจากชุดข้อมูลเหล่านี้ยังคงรักษาภาพและเนื้อหาอื่นๆ ที่อาจถูกลบออกจากแพลตฟอร์มออนไลน์ผ่านการร้องเรียนของผู้ใช้ การดูแลท้องถิ่น หรืออัลกอริทึม
พวกเขาได้สังเกตเพิ่มเติมว่าอาจใช้เวลาหลายปี – ในกรณีของชุดข้อมูล ImageNet ที่มีอำนาจ – ทั้งทศวรรษจึงจะแก้ไขข้อร้องเรียนเกี่ยวกับเนื้อหาของชุดข้อมูล และการแก้ไขเหล่านี้ไม่จำเป็นต้องสะท้อนให้เห็นแม้กระทั่งในชุดข้อมูลใหม่ที่ได้รับจากมัน
เอกสาร วิจัย ที่มีชื่อเรื่อง ชุดข้อมูลหลายรูปแบบ: ความเกลียดชัง โป๊ และมุมมองเชิงลบ มาจากนักวิจัยที่ University College Dublin & Lero, University of Edinburgh และ Chief Scientist ที่แพลตฟอร์มการยืนยันตัวตน UnifyID
แม้ว่างานจะเน้นไปที่การเปิดตัวชุดข้อมูล CLIP-filtered LAION-400M dataset แต่นักวิจัยก็โต้แย้งกับแนวโน้มทั่วไปในการโยนข้อมูลจำนวนมากเข้าไปในเฟรมเวิร์กการเรียนรู้ของเครื่อง และโต้แย้งว่าการขับเคลื่อนผลลัพธ์ที่มุ่งเน้นไปที่การอนุมานที่ดีกว่า (และแม้กระทั่งไปสู่ปัญญาประดิษฐ์ทั่วไป [AGI]) ส่งผลให้ใช้แหล่งข้อมูลที่เป็นอันตรายโดยไม่ดูแลและละเลยสิทธิ์ในลิขสิทธิ์
LAION-400M
เมื่อเดือนที่แล้ว ชุดข้อมูล LAION-400M ได้รับการเผยแพร่ โดยเพิ่มจำนวนชุดข้อมูลหลายรูปแบบที่พึ่งพา Common Crawl ซึ่งเก็บข้อมูลจากอินเทอร์เน็ตโดยไม่เลือก lọc และส่งต่อความรับผิดชอบในการกรองและดูแลให้กับโครงการที่ใช้ข้อมูลนี้ ชุดข้อมูลที่ได้รับประกอบด้วยคู่ข้อความและภาพ 400 ล้านคู่
LAION-400M เป็นรูปแบบที่เปิดเผยของชุดข้อมูล WIT (WebImageText) ที่ปิดของ Google AI ซึ่งเผยแพร่ในเดือนมีนาคม 2021 และมีคู่ข้อความและภาพ โดยที่ภาพในฐานข้อมูลถูกจับคู่กับข้อความที่เกี่ยวข้องหรือเมตาดาต้า (เช่น ข้อความ alt ของภาพในแกลเลอรี่เว็บ) ซึ่งช่วยให้ผู้ใช้สามารถค้นหาภาพโดยใช้ข้อความและแสดงความสัมพันธ์ที่ AI พื้นฐานสร้างขึ้นเกี่ยวกับโดเมนนี้
ความสัมพันธ์ระหว่างภาพและข้อความ และความคล้ายคลึงกันของคอซีนที่สามารถฝังความลำเอียงเข้าไปในผลลัพธ์ของคำถามนั้นเป็นศูนย์กลางของการเรียกร้องให้ปรับปรุงวิธีการของเอกสาร เนื่องจากคำถามง่ายๆ ที่ชุดข้อมูล LAION-400M สามารถเปิดเผยความลำเอียงได้
โป๊โผล่ขึ้นมาอีกครั้ง
LAION-400M ได้สร้างอินเทอร์เฟซการค้นหาที่สามารถเข้าถึงได้ โดยที่การไม่ติดเครื่องหมาย ‘การค้นหาที่ปลอดภัย’ จะแสดงให้เห็นว่าภาพและข้อความที่เกี่ยวข้องกับโป๊โดมิเนตฉลากและคลาสในระดับใด
การค้นหา ‘nun’ ในฐานข้อมูลจะส่งผลลัพธ์ที่เกี่ยวข้องกับเรื่องสยองขวัญ การแต่งกาย และชุดแต่งกาย มากกว่าภาพของนักบวชจริงๆ
การทำให้เนื้อหาที่ถูกแบนและถอดสิทธิ์ในลิขสิทธิ์
เอกสารโต้แย้งว่าชุดข้อมูลที่ไม่ได้รับการดูแลอย่างเหมาะสมนี้มีแนวโน้มที่จะทำให้บุคคลที่เป็นชนกลุ่มน้อยถูกแสวงหาผลประโยชน์ และกล่าวถึงว่าโครงการข้อมูลที่เปิดเผยที่คล้ายกันนี้มีสิทธิ์หรือไม่ในการส่งต่อความรับผิดชอบต่อผู้ใช้ปลายทาง
นักวิจัยยังโต้แย้งว่า LAION-400M อาจไม่เหมาะสมที่จะเผยแพร่ภายใต้แบบจำลองใบอนุญาต Creative Common CC-BY 4.0 โดยพิจารณาจากผลประโยชน์ที่อาจเกิดขึ้นสำหรับการทำให้ข้อมูลขนาดใหญ่เข้าถึงได้ ซึ่งเคยเป็นโดเมนเอกสิทธิ์เฉพาะของบริษัทที่มีเงินทุนที่ดี เช่น Google และ OpenAI
ปัญหาในการทำให้ข้อมูลขนาดใหญ่เข้าถึงได้
เอกสารโต้แย้งว่าชุดข้อมูล visio-linguistic ขนาดใหญ่เช่น LAION-400M ไม่เคยพร้อมใช้งานนอกบริษัทเทคโนโลยีขนาดใหญ่และสถาบันวิจัยที่มีทรัพยากรในการรวบรวม ดูแล และประมวลผล
การนำเจนีกลับเข้าไปในขวด
บางชุดข้อมูลที่ถูกกดดันให้ถูกยกเลิกหลังจากที่เนื้อหาของพวกมันผ่านไปแล้ว อาจรวมถึงชุดข้อมูล Duke MTMC (Multi-Target, Multi-Camera) ซึ่งถูกถอนออกเนื่องจากข้อกังวลเกี่ยวกับการใช้งานโดยหน่วยงานที่กดขี่ในประเทศจีน
นักวิจัยสังเกตว่าชุดข้อมูล LAION-400M จะทำให้การปรับปรุงที่ช้าเหล่านี้ถอยหลังไปอีกโดยการเพิกเฉยต่อการแก้ไขเหล่านี้ในเวอร์ชันใหม่ และเห็นแนวโน้มที่กว้างขึ้นในเรื่องนี้
พวกเขาย้ำว่าความพยายามที่รอบคอบในการทำความสะอาดชุดข้อมูลขนาดใหญ่แบบหลายรูปแบบและโมเดลที่ฝึกอบรมจากชุดข้อมูลนี้ซึ่งอาจมีคู่ภาพและคำบรรยายหลายพันล้านคู่จะไม่สามารถปฏิเสธได้ว่าจะมีขนาดใหญ่มาก












