มุมมองของ Anderson
อุปทาน ‘ดาวน์โหลดฉลากเพิ่มเติม!’ ในการวิจัย AI

มุมมองหนึ่งในงานวิจัยการเรียนรู้ของเครื่องในปัจจุบันคือ การใช้การเรียนรู้ของเครื่องเพื่อปรับปรุงคุณภาพของการทำแอนโนเทชันของชุดข้อมูล AI โดยเฉพาะคำบรรยายภาพที่ตั้งใจจะใช้ในโมเดลภาษาและวิชั่น (VLMs) มุมมองนี้ได้รับแรงผลักดันจาก ต้นทุนสูง ของการแอนโนเทชันของมนุษย์ และภาระเพิ่มเติมของ การดูแลการทำงานของผู้แอนโนเทชัน
โดยที่น่าแปลกใจ นี่คือสิ่งที่เทียบเท่ากับ มีม ‘ดาวน์โหลด RAM เพิ่มเติม’ ในช่วงต้นปี 2000 ซึ่งล้อเลียนแนวคิดที่ว่าข้อจำกัดของฮาร์ดแวร์สามารถแก้ไขได้ด้วยการแก้ไขซอฟต์แวร์
นอกจากนี้ยังเป็นปัญหาที่ไม่ได้รับการพิจารณาเป็นอย่างดี ในขณะที่โมเดล AI ใหม่ๆ ได้รับความสนใจอย่างกว้างขวางทั้งในสาธารณะและเชิงพาณิชย์ การแอนโนเทชัน thườngดูเหมือนเป็นรายละเอียดที่ไม่สำคัญในกระบวนการเรียนรู้ของเครื่อง ซึ่งถูกมองข้ามไปโดยความตื่นเต้นเกี่ยวกับเฟรมเวิร์กที่กว้างขึ้น
ในความเป็นจริง ความสามารถของระบบการเรียนรู้ของเครื่องในการรับรู้และทำซ้ำรูปแบบ (กรณีการใช้งานหลักของระบบ AI เกือบทั้งหมด) ขึ้นอยู่กับคุณภาพและความสอดคล้องของการแอนโนเทชันในโลกแห่งความเป็นจริง – ฉลากและวลีที่สร้างหรือตัดสินโดยผู้คนจริงๆ ซึ่งมักจะทำการตัดสินใจที่มีเจตนาเกี่ยวกับจุดข้อมูลแต่ละจุดใน สถานการณ์ที่ไม่เหมาะสม
โดยไม่หลีกเลี่ยง ระบบที่พยายามสังเกตและทำซ้ำรูปแบบในพฤติกรรมของผู้แอนโนเทชัน (และแทนที่ผู้แอนโนเทชันและอำนวยความสะดวกในการทำฉลากที่แม่นยำในระดับใหญ่) ไม่สามารถหวังว่าจะทำงานได้ดีบนข้อมูล ไม่ ที่อยู่ในตัวอย่างที่นำมาจากผู้สังเกตการณ์ของมนุษย์ สิ่งที่ ‘คล้ายกัน’ ไม่เหมือนกันเลย และความเท่าเทียมกันระหว่างโดเมนยังคงเป็น การแสวงหาที่เป็นปัญหา ในการมองเห็นของเครื่อง
การค้า RAG
จนกระทั่งไม่นานมานี้ ความไม่ถูกต้องที่เกิดขึ้นจากการแอนโนเทชันของชุดข้อมูลที่ไม่ได้รับการดูแลอย่างดีถูกมองว่าเป็นความเสียหายที่ยอมรับได้ในบริบทของผลลัพธ์ที่ไม่สมบูรณ์แต่ยังคงสามารถขายได้จากระบบ AI ที่สร้างขึ้น
แท้จริงแล้ว ในปีนี้เอง การศึกษาจากประเทศสิงคโปร์ สรุป ว่า การหลอกลวง – กล่าวคือ โอกาสที่ระบบ AI คิดค้นสิ่งที่บ่อนทำลายความตั้งใจของเรา – เป็นสิ่งที่หลีกเลี่ยงไม่ได้ และมีเนื้อหาเชื่อมโยงกับโครงสร้างแนวคิดของระบบเหล่านั้น
เพื่อตอบโต้สิ่งนี้ ตัวแทน RAG – ซึ่งสามารถ ‘ยืนยัน’ ข้อเท็จจริงผ่านการค้นหาในอินเทอร์เน็ต – ได้กลายเป็นเรื่องที่นิยมในการวิจัยและวิธีแก้ปัญหาเชิงพาณิชย์อย่างกว้างขวาง อย่างไรก็ตาม สิ่งเหล่านี้เพิ่มต้นทุนของทรัพยากรและความล่าช้าในการซักถาม นอกจากนี้ ข้อมูลใหม่ที่ใช้กับโมเดลที่ฝึกไว้ไม่สามารถแข่งขันกับข้อมูลที่ซับซ้อนและเชื่อมโยงกันอย่างลึกซึ้งซึ่งเป็นคุณลักษณะของชั้นของโมเดลที่ฝึกไว้
RePOPE
บทความใหม่จากเยอรมนีเน้นย้ำถึงปัญหาที่เกิดขึ้นจากการพึ่งพาชุดข้อมูลที่ใช้กันอย่างแพร่หลาย โดยเฉพาะอย่างยิ่งเกี่ยวกับความถูกต้องและความน่าเชื่อถือของคำบรรยายภาพ นักวิจัยพบว่าข้อผิดพลาดในฉลากสามารถบิดเบือนหรือทำให้การหลอกลวงในโมเดลภาษาและวิชั่นไม่ชัดเจน
ลองนึกภาพโมเดลที่แสดงภาพถนนและถามว่ามีจักรยานในภาพหรือไม่ โมเดลตอบ ใช่ หากชุดข้อมูลมาตรฐานระบุว่าไม่มีจักรยาน โมเดลจะถูกทำเครื่องหมาย ไม่ถูกต้อง แต่ถ้าจักรยาน มองเห็นได้ชัดเจน ในภาพและถูกพลาดไปในการแอนโนเทชัน โมเดลตอบถูกต้อง และชุดข้อมูลมาตรฐานล้มเหลว
วิธีการและทดสอบ
นักวิจัยได้ทำการแอนโนเทชันใหม่สำหรับชุดข้อมูล MSCOCO ทั้งหมด โดยมีผู้แอนโนเทชันสองคนสำหรับแต่ละตัวอย่างข้อมูล ในกรณีที่มีความไม่แน่นอนเกี่ยวกับคุณภาพของฉลากเดิม (เช่น ตัวอย่างด้านล่าง) ผลลัพธ์เหล่านั้นจะถูกตัดออกจากรอบการทดสอบ
ผลลัพธ์ของการแอนโนเทชันใหม่แสดงให้เห็นว่าฉลากเดิมมีข้อผิดพลาดหรือไม่ชัดเจน ซึ่งส่งผลต่อการประเมินผลการทำงานของโมเดล
สรุป
การทดลองนี้เป็นไปได้เพราะขนาดของชุดข้อมูลที่ใช้ในการทดลองค่อนข้างเล็ก หากต้องการพิสูจน์สมมติฐานเดียวกันบนชุดข้อมูลขนาดใหญ่ จะต้องทำงานกับชิ้นส่วนเล็กๆ ของข้อมูล ซึ่งอาจทำให้ผลลัพธ์ไม่ถูกต้อง
แม้ว่าจะเป็นไปได้ แต่ทางออกที่มีอยู่ภายใต้สถานะปัจจุบันคืออะไร การให้เหตุผลจะกลับไปที่ความจำเป็นในการมีการแอนโนเทชันของมนุษย์ที่ดีกว่าและมากขึ้น
ในด้านนี้ ‘ดีกว่า’ และ ‘มากขึ้น’ เป็นปัญหาที่แยกจากกัน เนื่องจากสามารถได้รับการแอนโนเทชันในปริมาณมากขึ้นผ่านเศรษฐกิจที่มีการแข่งขันสูง เช่น Amazon Mechanical Turk (AMT) อย่างไรก็ตาม เศรษฐกิจย่อยนี้มักจะนำไปสู่ผลลัพธ์ที่ไม่ดี
ทางเลือกหนึ่งคือการมอบหมายงานแอนโนเทชันให้กับภูมิภาคที่มีค่าใช้จ่ายน้อยกว่า แต่ถ้าผู้แอนโนเทชันอยู่ห่างไกลจากกรณีการใช้งานที่ตั้งใจไว้ของโมเดลที่ฉลากของพวกเขาจะกำหนดรูปแบบ โมเดลที่ได้รับจะไม่น่าจะสอดคล้องกับความต้องการหรือความคาดหวังของโดเมินเป้าหมาย
สิ่งนี้จึงยังคงเป็นหนึ่งในความท้าทายที่ยังไม่ได้รับการแก้ไขที่ยั่งยืนและยากที่สุดในเศรษฐศาสตร์ของการพัฒนา AI
เมื่อวันพุธที่ 23 เมษายน 2025












