มุมมองของ Anderson
คาร์เทลของชุดข้อมูลที่มีอิทธิพลกำลังครอบงำการวิจัย Machine Learning ตามการศึกษาใหม่

งานวิจัยใหม่จากมหาวิทยาลัยแคลิฟอร์เนียและ Google Research พบว่าชุดข้อมูล Machine Learning ที่เป็น “มาตรฐาน” จำนวนไม่มาก ซึ่งส่วนใหญ่มาจากสถาบันตะวันตกที่มีอิทธิพล และบ่อยครั้งมาจากองค์กรของรัฐบาล กำลังครอบงำภาคการวิจัย AI
นักวิจัยสรุปว่าการมีแนวโน้มที่จะ “ใช้โดยอิง” ชุดข้อมูลที่เปิดเผยและเป็นที่นิยม เช่น ImageNet ทำให้เกิดปัญหาหลายประการ ทั้งในด้านปฏิบัติการ จริยธรรม และการเมือง
จากผลการวิจัยที่อาศัยข้อมูลหลักจากโครงการ Papers With Code (PWC) ที่นำโดย Facebook นักวิจัยยืนยันว่า “ชุดข้อมูลที่ใช้กันอย่างกว้างขวางถูกนำเสนอโดยเพียงไม่กี่สถาบันที่มีอำนาจ” และการ “รวมกลุ่ม” นี้เพิ่มขึ้นถึง 80% ในช่วงไม่กี่ปีที่ผ่านมา
‘[เรา] พบว่ามีความไม่เท่าเทียมกันในการใช้ชุดข้อมูลทั่วโลก และว่ามากกว่า 50% ของการใช้ชุดข้อมูลทั้งหมดในตัวอย่างของเรา 43,140 ชุดข้อมูลที่สอดคล้องกับชุดข้อมูลที่นำเสนอโดย 12 สถาบันที่มีอำนาจเป็นหลัก’
สถาบันที่มีอำนาจที่ครอบงำรวมถึง Stanford University, Microsoft, Princeton, Facebook, Google, Max Planck Institute และ AT&T สี่ใน十อันดับแรกของแหล่งที่มาของชุดข้อมูลเป็นสถาบันขององค์กร
งานวิจัยยังอธิบายถึงการเพิ่มขึ้นของการใช้ชุดข้อมูลที่มีอำนาจว่าเป็น “พาหนะของความไม่เท่าเทียมกันทางวิทยาศาสตร์” เนื่องจากทีมวิจัยที่ต้องการการยอมรับจากชุมชนมีแรงจูงใจมากกว่าที่จะบรรลุผลลัพธ์ที่ดีที่สุด (SOTA) กับชุดข้อมูลที่สอดคล้องกันมากกว่าที่จะสร้างชุดข้อมูลดั้งเดิมที่ไม่มีฐานะดังกล่าว และซึ่งจะต้องมีการปรับเปลี่ยนมาตรฐานใหม่ๆ
ในกรณีใดๆ ตามที่งานวิจัยยอมรับ การสร้างชุดข้อมูลของตนเองเป็นงานที่มีค่าใช้จ่ายสูงสำหรับสถาบันและทีมที่มีทรัพยากรไม่มาก
‘การได้รับการยอมรับทางวิทยาศาสตร์โดย SOTA benchmarking มักจะสับสนกับความรู้สึกน่าเชื่อถือที่นักวิจัยได้รับจากการแสดงให้เห็นว่าพวกเขาสามารถแข่งขันกับชุดข้อมูลที่รู้จักกันดีได้ แม้ว่ามาตรฐานที่เหมาะสมกว่าทางเทคนิคอาจเป็นมาตรฐานที่เหมาะสมกว่าก็ตาม
‘เราเสนอว่าพลวัตเหล่านี้สร้าง “ผลแมทธิว” (เช่น “คนรวยจะรวยมากขึ้นและคนจนจะยากจนลง”) โดยที่มาตรฐานที่ประสบความสำเร็จและสถาบันที่มีอำนาจที่แนะนำพวกเขาได้รับการยอมรับในระดับสูงสุดในภาคส่วนนี้’
งานวิจัย งานวิจัย มีชื่อเรื่องว่า ลดขนาด, ใช้ซ้ำ และรีไซเคิล: ชีวิตของชุดข้อมูลในงานวิจัย Machine Learning และมาจาก Bernard Koch และ Jacob G. Foster ที่ UCLA และ Emily Denton และ Alex Hanna ที่ Google Research
งานวิจัยนี้ชี้ให้เห็นถึงปัญหาหลายประการเกี่ยวกับการรวมกลุ่มที่เพิ่มขึ้นที่มันบันทึกไว้ และได้รับการตอบรับในเชิงบวกที่ Open Review ผู้รีวิวคนหนึ่งจาก NeurIPS 2021 กล่าวว่างานวิจัยนี้เป็น ‘เกี่ยวข้องมากกับทุกคนที่เกี่ยวข้องกับการวิจัย Machine Learning’ และคาดว่าจะรวมไว้เป็นข้ออ่านในหลักสูตรมหาวิทยาลัย
จากความจำเป็นไปสู่การคอร์รัปชั่น
นักวิจัยชี้ให้เห็นว่าวัฒนธรรมปัจจุบันของ “ชนะมาตรฐาน” เกิดขึ้นเพื่อแก้ปัญหาการขาดเครื่องมือการประเมินเชิงวัตถุประสงค์ที่ทำให้ความสนใจและเงินลงทุนใน AI ลดลงครั้งที่สอง เมื่อสามสิบปีที่แล้ว หลังจากที่ความกระตือรือร้นของธุรกิจต่อการวิจัยใหม่ใน ‘ระบบผู้เชี่ยวชาญ’ ลดลง:
‘มาตรฐานโดยทั่วไปจะกำหนดงานเฉพาะผ่านชุดข้อมูลและมาตรการประเมินเชิงปริมาณ การปฏิบัตินี้ถูกนำมาใช้กับการวิจัย Machine Learning หลังจาก “ช่วงหนาวของ AI” ในทศวรรษ 1980 โดยผู้ให้ทุนของรัฐบาลที่ต้องการประเมินคุณค่าที่ได้รับจากเงินทุนอย่างแม่นยำ’
งานวิจัยชี้ให้เห็นว่าข้อดีเบื้องต้นของวัฒนธรรมที่ไม่เป็นทางการนี้ (การลดข้อจำกัดในการเข้าร่วม, มาตรการเชิงปริมาณที่สอดคล้องกัน, และโอกาสในการพัฒนาที่คล่องตัวกว่า) กำลังถูกชดเชยด้วยข้อเสียที่เกิดขึ้นเมื่อชุดข้อมูลมีอำนาจมากพอที่จะกำหนด “เงื่อนไขการใช้งาน” และขอบเขตของอิทธิพล
นักวิจัยชี้ให้เห็นว่าชุมชนการวิจัยไม่ ตั้งปัญหาใหม่ๆ หากไม่สามารถแก้ไขได้ด้วยชุดข้อมูลมาตรฐานที่มีอยู่
พวกเขายังชี้ให้เห็นว่าการยึดติดกับชุดข้อมูล “ทอง” เหล่านี้ทำให้นักวิจัยบรรลุผลลัพธ์ที่ 过拟合 (เช่น ผลลัพธ์ที่เฉพาะเจาะจงสำหรับชุดข้อมูลและไม่น่าจะทำงานได้ดีในข้อมูลจริงหรือชุดข้อมูลใหม่)
‘การมีศูนย์กลางของการวิจัยในจำนวนชุดข้อมูลที่น้อยมากทำให้เราเชื่อว่าการกระจายรูปแบบการประเมินคือสิ่งสำคัญเพื่อหลีกเลี่ยงการ过拟合กับชุดข้อมูลที่มีอยู่และบิดเบือนความก้าวหน้าในภาคส่วนนี้’
อิทธิพลของรัฐบาลในการวิจัย Computer Vision
ตามงานวิจัย การวิจัย Computer Vision ได้รับผลกระทบจากอาการที่กล่าวถึงมากกว่าภาคส่วนอื่นๆ โดยนักวิจัยชี้ให้เห็นว่าการประมวลผลภาษาธรรมชาติ (NLP) ได้รับผลกระทบน้อยกว่า นักวิจัยเสนอว่าสิ่งนี้อาจเป็นเพราะชุมชน NLP มีความ “สอดคล้อง” มากขึ้นและใหญ่กว่า และชุดข้อมูล NLP มีความเข้าถึงได้ง่ายและง่ายต่อการดูแล
ใน Computer Vision และโดยเฉพาะอย่างยิ่งในการตระหนักใบหน้า (FR) นักวิจัยชี้ให้เห็นว่าความสนใจขององค์กร องค์กรรัฐ และเอกชนมักจะขัดแย้งกัน:
‘องค์กรและรัฐบาลมีเป้าหมายที่อาจขัดแย้งกับความเป็นส่วนตัว (เช่น การเฝ้าระวัง) และการชั่งน้ำหนักของลำดับความสำคัญเหล่านี้มีแนวโน้มที่จะแตกต่างจากที่นักวิชาการหรือผู้มีส่วนได้ส่วนเสียของ AI โดยทั่วไปมี’
สำหรับการทำงานในการตระหนักใบหน้า นักวิจัยพบว่าเหตุการณ์ของชุดข้อมูลทางวิชาการที่ไม่มีการสนับสนุนลดลงอย่างมากเมื่อเทียบกับค่าเฉลี่ย:
‘[สี่] ในแปดชุดข้อมูล (33.69% ของการใช้ทั้งหมด) ได้รับการสนับสนุนโดยองค์กรเอกชน กองทัพสหรัฐฯ หรือรัฐบาลจีน (MS-Celeb-1M, CASIA-Webface, IJB-A, VggFace2) MS-Celeb-1M ถูกถอนออกเนื่องจากความขัดแย้งเกี่ยวกับคุณค่าของความเป็นส่วนตัวสำหรับผู้มีส่วนได้ส่วนเสียต่างๆ’
ในแผนภาพด้านบนตามที่นักวิจัยชี้ให้เห็น เรายังเห็นว่าสาขา Image Generation (หรือ Image Synthesis) ที่ค่อนข้างใหม่นี้พึ่งพาชุดข้อมูลที่มีอยู่เดิมซึ่งไม่ได้ถูกออกแบบมาเพื่อใช้งานนี้
ในความเป็นจริง งานวิจัยสังเกตเห็นแนวโน้มที่เพิ่มขึ้นในการ “ย้าย” ชุดข้อมูลออกจากวัตถุประสงค์ที่ตั้งใจไว้ ซึ่งทำให้เกิดคำถามเกี่ยวกับความเหมาะสมของชุดข้อมูลเหล่านี้สำหรับความต้องการของภาคส่วนการวิจัยใหม่ๆ และขอบเขตที่ข้อจำกัดด้านงบประมาณอาจ “ทำให้การมุ่งเน้นของนักวิจัยแคบลง” ในกรอบที่แคบลงซึ่งถูกกำหนดโดยวัสดุที่มีอยู่และวัฒนธรรมที่มุ่งเน้นไปที่การให้คะแนนมาตรฐานปีละ
‘ผลการวิจัยของเราแสดงให้เห็นว่าชุดข้อมูลมีการย้ายระหว่างชุมชนการทำงานต่างๆ ในระดับที่รุนแรงที่สุด ชุดข้อมูลมาตรฐานส่วนใหญ่ที่ใช้ในบางชุมชนการทำงานถูกสร้างขึ้นสำหรับงานอื่นๆ’
เกี่ยวกับบุคคลสำคัญใน Machine Learning (รวมทั้ง Andrew Ng) ที่ได้เรียกร้องให้มีความหลากหลายและดูแลชุดข้อมูลมากขึ้นในช่วงไม่กี่ปีที่ผ่านมา นักวิจัยสนับสนุนความคิดเห็นนี้ แต่เชื่อว่าความพยายามดังกล่าวอาจถูกขัดขวางโดยวัฒนธรรมที่มีอยู่ที่พึ่งพาผลลัพธ์ SOTA และชุดข้อมูลที่มีอยู่:
‘การวิจัยของเราแสดงให้เห็นว่าการเรียกร้องให้นักวิจัย Machine Learning พัฒนาชุดข้อมูลมากขึ้น และการเปลี่ยนแปลงโครงสร้างแรงจูงใจเพื่อให้ชุดข้อมูลมีคุณค่าและได้รับการตอบแทน อาจไม่เพียงพอที่จะกระจายการใช้ชุดข้อมูลและความมุ่งมั่นที่หล่อหลอมและกำหนดวาระการวิจัย Machine Learning’
‘นอกเหนือจากการสนับสนุนให้พัฒนาชุดข้อมูลแล้ว เราเสนอแนะให้มีการแทรกแซงทางนโยบายที่ให้ความสำคัญกับการให้ทุนแก่บุคคลในองค์กรที่มีทรัพยากรไม่มากเพื่อสร้างชุดข้อมูลที่มีคุณภาพสูง ซึ่งจะกระจายชุดข้อมูลมาตรฐานที่ใช้ในการประเมินวิธีการ Machine Learning ในมุมมองทางสังคมและวัฒนธรรม’
6 ธันวาคม 2021, 16:49 น. GMT+2 – แก้ไขการเป็นเจ้าของในหัวข้อ – MA














