มุมมองของ Anderson
อุปทาน ‘ดาวน์โหลดฉลากเพิ่มเติม!’ ในการวิจัย AI

มุมมองที่พบได้บ่อยในงานวิจัยแมชชีนเลิร์นนิงคือการใช้แมชชีนเลิร์นนิงปรับปรุงคุณภาพคำกำกับชุดข้อมูล โดยเฉพาะคำบรรยายภาพสำหรับโมเดลภาษาและภาพหรือ VLM แนวคิดนี้เกิดจากต้นทุนสูงของการกำกับข้อมูลโดยมนุษย์และภาระในการตรวจสอบคุณภาพงาน
แนวทางดังกล่าวคล้ายมุก “ดาวน์โหลด RAM เพิ่ม” ในยุค 2000 ซึ่งล้อแนวคิดว่าข้อจำกัดฮาร์ดแวร์แก้ได้ด้วยซอฟต์แวร์ ปัญหาคำกำกับมักถูกมองเป็นรายละเอียดเล็ก เมื่อความสนใจทั้งหมดไปอยู่ที่โมเดลและเฟรมเวิร์กใหม่
แต่ความสามารถของ AI ในการรู้จำและสร้างรูปแบบขึ้นอยู่กับคุณภาพและความสอดคล้องของคำกำกับในโลกจริง ซึ่งสร้างหรือตัดสินโดยมนุษย์ภายใต้เงื่อนไขที่ไม่สมบูรณ์ ระบบที่เรียนรูปแบบจากผู้กำกับเพื่อแทนคนในวงกว้างย่อมทำได้ไม่ดีเมื่อพบข้อมูลที่ไม่มีในตัวอย่างจากมนุษย์ สิ่งที่ “คล้าย” ไม่ได้เหมือนกัน และการเทียบข้ามโดเมนยังเป็นปัญหาของคอมพิวเตอร์วิทัศน์
ในที่สุดสายโซ่ข้อมูลต้นน้ำต้องจบที่ใดสักแห่ง และจุดนั้นคือสมองมนุษย์ที่ตัดสินเชิงอัตวิสัยเพื่อเข้ารหัสข้อมูลให้ระบบประดิษฐ์
ต้นทุนและข้อแลกเปลี่ยนของ RAG
จนไม่นานมานี้ ความผิดพลาดจากคำกำกับที่ไม่ได้ตรวจอย่างเพียงพออาจถูกยอมรับเป็นความเสียหายข้างเคียงของระบบกำเนิดที่ไม่สมบูรณ์แต่ยังขายได้ งานวิจัยจากสิงคโปร์สรุปว่าการหลอนข้อมูล ซึ่งระบบ AI สร้างสิ่งที่ขัดกับเจตนาของเรา อาจหลีกเลี่ยงไม่ได้และผูกกับสถาปัตยกรรมเชิงแนวคิดของระบบ
ตัวแทนแบบ RAG ที่ค้นอินเทอร์เน็ตเพื่อตรวจข้อเท็จจริงจึงได้รับความนิยม แต่เพิ่มทั้งต้นทุนทรัพยากรและความหน่วง ข้อมูลใหม่ที่ป้อนให้โมเดลหลังฝึกยังแข่งขันกับความเชื่อมโยงซับซ้อนในชั้นภายในไม่ได้ ดังนั้นจึงดีกว่าหากคำกำกับที่ใช้ฝึกมีข้อบกพร่องน้อยลงตั้งแต่แรก แม้ไม่มีวันสมบูรณ์เพราะเกี่ยวข้องกับการตัดสินของมนุษย์
RePOPE และปัญหาคำกำกับมาตรฐาน
งานวิจัยใหม่จากเยอรมนีศึกษาความแม่นยำของคำบรรยายภาพในชุดข้อมูลเก่าที่ใช้แพร่หลาย นักวิจัยพบว่าป้ายกำกับผิดในชุดทดสอบสามารถปิดบังหรือบิดเบือนการหลอนของโมเดลภาษาและภาพ

ลองนึกว่าโมเดลเห็นภาพถนนและถูกถามว่ามีจักรยานหรือไม่ โมเดลตอบว่า “มี” หากชุดทดสอบบอกว่าไม่มี โมเดลจะถูกตัดสินว่าผิด แต่หากจักรยานมองเห็นชัดและผู้กำกับข้อมูลพลาด โมเดลตอบถูกและชุดทดสอบต่างหากที่ล้มเหลว ความผิดพลาดสะสมเช่นนี้ทำให้ภาพการจัดอันดับโมเดลบิดเบือน
เมื่อคำกำกับผิดหรือกำกวมถูกถือเป็นความจริง โมเดลอาจดูเหมือนหลอนทั้งที่ถูก หรือดูเหมือนแม่นทั้งที่ผิด ทำให้วัดและแก้ปัญหาไม่ได้อย่างมั่นใจ
งานชื่อ RePOPE: Impact of Annotation Errors on the POPE Benchmark กลับไปตรวจมาตรฐาน Polling-based Object Probing Evaluation หรือ POPE ซึ่งทดสอบว่า VLM ระบุวัตถุในภาพได้หรือไม่ POPE อาศัยป้ายกำกับจาก Microsoft COCO หรือ MSCOCO ที่ได้รับการยอมรับมายาวนาน

POPE เปลี่ยนการประเมินการหลอนเป็นงานจำแนกสองค่า แทนการวิเคราะห์คำบรรยายยาว ระบบถามคำถามใช่หรือไม่ เช่น “มี <วัตถุ> ในภาพหรือไม่” วัตถุที่มีจริงจับคู่กับวัตถุที่ไม่มี โดยเลือกแบบสุ่ม แบบยอดนิยม หรือแบบเชิงปฏิปักษ์ตามการปรากฏร่วม วิธีนี้ช่วยให้การประเมินคงที่และไวต่อรูปแบบคำถามน้อยลง

ผู้เขียน RePOPE ตรวจป้ายกำกับของภาพใน MSCOCO ใหม่และพบจำนวนที่ผิดหรือไม่ชัดเจนมากกว่าคาด ข้อผิดพลาดเปลี่ยนลำดับโมเดล บางรุ่นที่ทำคะแนนดีใน POPE ตกอันดับเมื่อวัดด้วยคำกำกับที่แก้ไขแล้ว โดยเฉพาะคะแนน F1

วิธีการและการทดสอบ
นักวิจัยกำกับข้อมูลทั้งหมดที่ใช้ในมาตรฐานใหม่ โดยให้ผู้กำกับมนุษย์สองคนต่อหนึ่งตัวอย่าง กรณีที่ขอบเขตหมวดหมู่กำกวม เช่น ตุ๊กตาหมีถูกนับเป็นหมี มอเตอร์ไซค์เป็นจักรยาน หรือรถสนามบินเป็นรถยนต์ ถูกแยกออกจากการทดสอบ เพราะขึ้นกับคำนิยามเชิงอัตวิสัย

ตัวอย่างอื่นรวมถึงคนอยู่ด้านหลังหรือหลังกระจก เก้าอี้ที่ถูกนักเทนนิสบัง และแครอทเพียงแถบเล็กในโคลสลอว์ ซึ่งคำกำกับเดิมมองข้าม ผลการตรวจใหม่พบว่าในคำถามที่ POPE ตอบ “ใช่” มี 9.3% ที่ผิดและ 13.8% ที่กำกวม ส่วนคำถาม “ไม่” มี 1.7% ที่ติดป้ายผิดและ 4.3% ที่กำกวม

ทีมทดสอบโมเดลน้ำหนักเปิดหลายสถาปัตยกรรมและขนาด ได้แก่ InternVL2.5, LLaVA-NeXT, Vicuna, Mistral 7B, Llama, LLaVA-OneVision, Ovis2, PaliGemma และ PaliGemma2 โดยเปรียบเทียบ POPE เดิมกับ RePOPE

หลังแก้คำกำกับ จำนวน true positive ลดลงในทุกโมเดล แสดงว่าก่อนหน้านี้โมเดลเคยได้เครดิตจากคำตอบที่ถูกเฉพาะเมื่ออิงป้ายกำกับผิด ส่วน false positive เปลี่ยนต่างกัน ในชุดสุ่มเพิ่มเกือบสองเท่าสำหรับหลายรุ่น เพราะวัตถุที่ถูกกล่าวหาว่าโมเดลจินตนาการขึ้นนั้นมีอยู่จริงแต่คำกำกับเดิมพลาด
ในชุดเชิงปฏิปักษ์ ซึ่งถามถึงวัตถุที่มักปรากฏร่วมกัน false positive กลับลดลง สะท้อนว่าวัตถุที่ถือว่าไม่มีอาจอยู่ในภาพแต่ไม่ได้ติดป้าย แม้ precision และ recall เปลี่ยน ลำดับโมเดลจากสองตัวชี้วัดนี้ค่อนข้างคงที่
คะแนน F1 ซึ่งเป็นตัวชี้วัดหลักของ POPE ไวต่อการแก้ป้ายมากกว่า บนชุดสุ่ม InternVL2.5-8B และ 26B ที่เคยอยู่ใกล้อันดับบนตกลงด้านล่าง ขณะที่ Ovis2-4B และ 8B ขึ้นสู่กลุ่มนำ คะแนนความแม่นยำแสดงแนวโน้มคล้ายกัน แต่ผู้เขียนเตือนว่าชุดแก้ไขมีตัวอย่างบวกและลบไม่สมดุล
ผู้เขียนเผยแพร่ป้ายกำกับที่แก้ไขบน GitHub เพื่อสนับสนุนการประเมินที่เชื่อถือได้ อย่างไรก็ดี การกำกับใหม่ไม่ได้แก้ปัญหามาตรฐานอิ่มตัว เพราะหลายโมเดลยังได้อัตรา true positive และ true negative สูงกว่า 90% จึงเสนอให้ใช้มาตรฐานที่ท้าทายกว่า เช่น DASH-B ควบคู่กับ RePOPE
แหล่งข้อมูลและลิงก์อ้างอิง
- used to improve
- high cost
- supervising
- 'download more RAM' meme
- dependent
- non-ideal circumstances
- problematic pursuit
- concluded
- hallucinations
- RAG-based agents
- Polling-based Object Probing Evaluation
- Microsoft COCO: Common Objects in Context
- binary classification task
- new paper
- F1
- OpenVLM
- InternVL2.5
- LLaVA-NeXT
- Vicuna
- Mistral 7b
- Llama
- LLaVA-OneVision
- Ovis2
- PaliGemma-3B
- PaliGemma2
- released the corrected labels
- DASH-B
- potentially exploitative
บทสรุป
การทดลองนี้ทำได้เพราะชุดข้อมูลทดสอบมีขนาดเล็ก การพิสูจน์สมมติฐานเดียวกันในชุดข้อมูลมหาศาลต้องตรวจเพียงเศษส่วน ซึ่งอาจไม่เป็นตัวแทนทั้งเชิงสถิติและความหมาย และทำให้ผลลัพธ์เอียง
แม้ทำได้ ทางออกในปัจจุบันก็ย้อนกลับไปสู่ความต้องการคำกำกับจากมนุษย์ที่ดีกว่าและมากกว่า แต่ “ดีกว่า” กับ “มากกว่า” เป็นคนละปัญหา ตลาดแรงงานที่แข่งขันลดราคา เช่น Amazon Mechanical Turk สามารถเพิ่มปริมาณได้ แต่อาจเอาเปรียบแรงงานและให้ผลลัพธ์ด้อยลง
อีกทางคือส่งงานไปภูมิภาคที่ต้นทุนต่ำกว่าเพื่อได้จำนวนมากขึ้น แต่ยิ่งผู้กำกับอยู่ห่างจากบริบทการใช้งานของโมเดลมากเท่าไร โมเดลที่ถูกกำหนดโดยป้ายเหล่านั้นก็ยิ่งไม่สอดคล้องกับความต้องการและความคาดหวังของโดเมนเป้าหมาย
นี่จึงยังเป็นหนึ่งในความท้าทายด้านเศรษฐศาสตร์ของการพัฒนาแมชชีนเลิร์นนิงที่ยืดเยื้อและยังไม่มีคำตอบ
เผยแพร่ครั้งแรกวันพุธที่ 23 เมษายน 2025












