มุมมองของ Anderson

อุปทาน ‘ดาวน์โหลดฉลากเพิ่มเติม!’ ในการวิจัย AI

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
ChatGPT-4o: 'A wall on which hundreds of photographs are stuck with thumb-tacks. Each photo depicts a different kind of subject, such as fruit or animals or bridges or buildings or people, etc. Each photo has 2-3 yellow post-it notes attached to it. We are too far away to read anything written on the post-it notes, but we can see that there are dozens and dozens of photos on the wall, and each with several post-it notes tacked on.'

มุมมองที่พบได้บ่อยในงานวิจัยแมชชีนเลิร์นนิงคือการใช้แมชชีนเลิร์นนิงปรับปรุงคุณภาพคำกำกับชุดข้อมูล โดยเฉพาะคำบรรยายภาพสำหรับโมเดลภาษาและภาพหรือ VLM แนวคิดนี้เกิดจากต้นทุนสูงของการกำกับข้อมูลโดยมนุษย์และภาระในการตรวจสอบคุณภาพงาน

แนวทางดังกล่าวคล้ายมุก “ดาวน์โหลด RAM เพิ่ม” ในยุค 2000 ซึ่งล้อแนวคิดว่าข้อจำกัดฮาร์ดแวร์แก้ได้ด้วยซอฟต์แวร์ ปัญหาคำกำกับมักถูกมองเป็นรายละเอียดเล็ก เมื่อความสนใจทั้งหมดไปอยู่ที่โมเดลและเฟรมเวิร์กใหม่

แต่ความสามารถของ AI ในการรู้จำและสร้างรูปแบบขึ้นอยู่กับคุณภาพและความสอดคล้องของคำกำกับในโลกจริง ซึ่งสร้างหรือตัดสินโดยมนุษย์ภายใต้เงื่อนไขที่ไม่สมบูรณ์ ระบบที่เรียนรูปแบบจากผู้กำกับเพื่อแทนคนในวงกว้างย่อมทำได้ไม่ดีเมื่อพบข้อมูลที่ไม่มีในตัวอย่างจากมนุษย์ สิ่งที่ “คล้าย” ไม่ได้เหมือนกัน และการเทียบข้ามโดเมนยังเป็นปัญหาของคอมพิวเตอร์วิทัศน์

ในที่สุดสายโซ่ข้อมูลต้นน้ำต้องจบที่ใดสักแห่ง และจุดนั้นคือสมองมนุษย์ที่ตัดสินเชิงอัตวิสัยเพื่อเข้ารหัสข้อมูลให้ระบบประดิษฐ์

ต้นทุนและข้อแลกเปลี่ยนของ RAG

จนไม่นานมานี้ ความผิดพลาดจากคำกำกับที่ไม่ได้ตรวจอย่างเพียงพออาจถูกยอมรับเป็นความเสียหายข้างเคียงของระบบกำเนิดที่ไม่สมบูรณ์แต่ยังขายได้ งานวิจัยจากสิงคโปร์สรุปว่าการหลอนข้อมูล ซึ่งระบบ AI สร้างสิ่งที่ขัดกับเจตนาของเรา อาจหลีกเลี่ยงไม่ได้และผูกกับสถาปัตยกรรมเชิงแนวคิดของระบบ

ตัวแทนแบบ RAG ที่ค้นอินเทอร์เน็ตเพื่อตรวจข้อเท็จจริงจึงได้รับความนิยม แต่เพิ่มทั้งต้นทุนทรัพยากรและความหน่วง ข้อมูลใหม่ที่ป้อนให้โมเดลหลังฝึกยังแข่งขันกับความเชื่อมโยงซับซ้อนในชั้นภายในไม่ได้ ดังนั้นจึงดีกว่าหากคำกำกับที่ใช้ฝึกมีข้อบกพร่องน้อยลงตั้งแต่แรก แม้ไม่มีวันสมบูรณ์เพราะเกี่ยวข้องกับการตัดสินของมนุษย์

RePOPE และปัญหาคำกำกับมาตรฐาน

งานวิจัยใหม่จากเยอรมนีศึกษาความแม่นยำของคำบรรยายภาพในชุดข้อมูลเก่าที่ใช้แพร่หลาย นักวิจัยพบว่าป้ายกำกับผิดในชุดทดสอบสามารถปิดบังหรือบิดเบือนการหลอนของโมเดลภาษาและภาพ

ตัวอย่างที่คำบรรยายเดิมระบุวัตถุใน MSCOCO ผิดพลาด ที่มา: งานวิจัย RePOPE
ตัวอย่างที่คำบรรยายเดิมระบุวัตถุใน MSCOCO ผิดพลาด ที่มา: งานวิจัย RePOPE

ลองนึกว่าโมเดลเห็นภาพถนนและถูกถามว่ามีจักรยานหรือไม่ โมเดลตอบว่า “มี” หากชุดทดสอบบอกว่าไม่มี โมเดลจะถูกตัดสินว่าผิด แต่หากจักรยานมองเห็นชัดและผู้กำกับข้อมูลพลาด โมเดลตอบถูกและชุดทดสอบต่างหากที่ล้มเหลว ความผิดพลาดสะสมเช่นนี้ทำให้ภาพการจัดอันดับโมเดลบิดเบือน

เมื่อคำกำกับผิดหรือกำกวมถูกถือเป็นความจริง โมเดลอาจดูเหมือนหลอนทั้งที่ถูก หรือดูเหมือนแม่นทั้งที่ผิด ทำให้วัดและแก้ปัญหาไม่ได้อย่างมั่นใจ

งานชื่อ RePOPE: Impact of Annotation Errors on the POPE Benchmark กลับไปตรวจมาตรฐาน Polling-based Object Probing Evaluation หรือ POPE ซึ่งทดสอบว่า VLM ระบุวัตถุในภาพได้หรือไม่ POPE อาศัยป้ายกำกับจาก Microsoft COCO หรือ MSCOCO ที่ได้รับการยอมรับมายาวนาน

ตัวอย่างการหลอนวัตถุในโมเดลภาษาและภาพ ที่มา: งานวิจัย POPE
ตัวอย่างการหลอนวัตถุในโมเดลภาษาและภาพ ที่มา: งานวิจัย POPE

POPE เปลี่ยนการประเมินการหลอนเป็นงานจำแนกสองค่า แทนการวิเคราะห์คำบรรยายยาว ระบบถามคำถามใช่หรือไม่ เช่น “มี <วัตถุ> ในภาพหรือไม่” วัตถุที่มีจริงจับคู่กับวัตถุที่ไม่มี โดยเลือกแบบสุ่ม แบบยอดนิยม หรือแบบเชิงปฏิปักษ์ตามการปรากฏร่วม วิธีนี้ช่วยให้การประเมินคงที่และไวต่อรูปแบบคำถามน้อยลง

ตัวอย่างภาพจากชุดข้อมูล MSCOCO ปี 2014
ตัวอย่างภาพจากชุดข้อมูล MSCOCO ปี 2014

ผู้เขียน RePOPE ตรวจป้ายกำกับของภาพใน MSCOCO ใหม่และพบจำนวนที่ผิดหรือไม่ชัดเจนมากกว่าคาด ข้อผิดพลาดเปลี่ยนลำดับโมเดล บางรุ่นที่ทำคะแนนดีใน POPE ตกอันดับเมื่อวัดด้วยคำกำกับที่แก้ไขแล้ว โดยเฉพาะคะแนน F1

ตัวอย่างวัตถุเล็กหรือถูกบดบังที่คำกำกับเดิมมองข้าม
ตัวอย่างวัตถุเล็กหรือถูกบดบังที่คำกำกับเดิมมองข้าม

วิธีการและการทดสอบ

นักวิจัยกำกับข้อมูลทั้งหมดที่ใช้ในมาตรฐานใหม่ โดยให้ผู้กำกับมนุษย์สองคนต่อหนึ่งตัวอย่าง กรณีที่ขอบเขตหมวดหมู่กำกวม เช่น ตุ๊กตาหมีถูกนับเป็นหมี มอเตอร์ไซค์เป็นจักรยาน หรือรถสนามบินเป็นรถยนต์ ถูกแยกออกจากการทดสอบ เพราะขึ้นกับคำนิยามเชิงอัตวิสัย

กรณีกำกวมซึ่งขอบเขตหมวดหมู่ไม่ชัดเจน
กรณีกำกวมซึ่งขอบเขตหมวดหมู่ไม่ชัดเจน

ตัวอย่างอื่นรวมถึงคนอยู่ด้านหลังหรือหลังกระจก เก้าอี้ที่ถูกนักเทนนิสบัง และแครอทเพียงแถบเล็กในโคลสลอว์ ซึ่งคำกำกับเดิมมองข้าม ผลการตรวจใหม่พบว่าในคำถามที่ POPE ตอบ “ใช่” มี 9.3% ที่ผิดและ 13.8% ที่กำกวม ส่วนคำถาม “ไม่” มี 1.7% ที่ติดป้ายผิดและ 4.3% ที่กำกวม

ผลการกำกับใหม่ของคำถามบวกและลบใน POPE
ผลการกำกับใหม่ของคำถามบวกและลบใน POPE

ทีมทดสอบโมเดลน้ำหนักเปิดหลายสถาปัตยกรรมและขนาด ได้แก่ InternVL2.5, LLaVA-NeXT, Vicuna, Mistral 7B, Llama, LLaVA-OneVision, Ovis2, PaliGemma และ PaliGemma2 โดยเปรียบเทียบ POPE เดิมกับ RePOPE

ผลกระทบของการแก้ป้ายต่อ true positive, false positive และลำดับคะแนน F1
ผลกระทบของการแก้ป้ายต่อ true positive, false positive และลำดับคะแนน F1

หลังแก้คำกำกับ จำนวน true positive ลดลงในทุกโมเดล แสดงว่าก่อนหน้านี้โมเดลเคยได้เครดิตจากคำตอบที่ถูกเฉพาะเมื่ออิงป้ายกำกับผิด ส่วน false positive เปลี่ยนต่างกัน ในชุดสุ่มเพิ่มเกือบสองเท่าสำหรับหลายรุ่น เพราะวัตถุที่ถูกกล่าวหาว่าโมเดลจินตนาการขึ้นนั้นมีอยู่จริงแต่คำกำกับเดิมพลาด

ในชุดเชิงปฏิปักษ์ ซึ่งถามถึงวัตถุที่มักปรากฏร่วมกัน false positive กลับลดลง สะท้อนว่าวัตถุที่ถือว่าไม่มีอาจอยู่ในภาพแต่ไม่ได้ติดป้าย แม้ precision และ recall เปลี่ยน ลำดับโมเดลจากสองตัวชี้วัดนี้ค่อนข้างคงที่

คะแนน F1 ซึ่งเป็นตัวชี้วัดหลักของ POPE ไวต่อการแก้ป้ายมากกว่า บนชุดสุ่ม InternVL2.5-8B และ 26B ที่เคยอยู่ใกล้อันดับบนตกลงด้านล่าง ขณะที่ Ovis2-4B และ 8B ขึ้นสู่กลุ่มนำ คะแนนความแม่นยำแสดงแนวโน้มคล้ายกัน แต่ผู้เขียนเตือนว่าชุดแก้ไขมีตัวอย่างบวกและลบไม่สมดุล

ผู้เขียนเผยแพร่ป้ายกำกับที่แก้ไขบน GitHub เพื่อสนับสนุนการประเมินที่เชื่อถือได้ อย่างไรก็ดี การกำกับใหม่ไม่ได้แก้ปัญหามาตรฐานอิ่มตัว เพราะหลายโมเดลยังได้อัตรา true positive และ true negative สูงกว่า 90% จึงเสนอให้ใช้มาตรฐานที่ท้าทายกว่า เช่น DASH-B ควบคู่กับ RePOPE

แหล่งข้อมูลและลิงก์อ้างอิง

บทสรุป

การทดลองนี้ทำได้เพราะชุดข้อมูลทดสอบมีขนาดเล็ก การพิสูจน์สมมติฐานเดียวกันในชุดข้อมูลมหาศาลต้องตรวจเพียงเศษส่วน ซึ่งอาจไม่เป็นตัวแทนทั้งเชิงสถิติและความหมาย และทำให้ผลลัพธ์เอียง

แม้ทำได้ ทางออกในปัจจุบันก็ย้อนกลับไปสู่ความต้องการคำกำกับจากมนุษย์ที่ดีกว่าและมากกว่า แต่ “ดีกว่า” กับ “มากกว่า” เป็นคนละปัญหา ตลาดแรงงานที่แข่งขันลดราคา เช่น Amazon Mechanical Turk สามารถเพิ่มปริมาณได้ แต่อาจเอาเปรียบแรงงานและให้ผลลัพธ์ด้อยลง

อีกทางคือส่งงานไปภูมิภาคที่ต้นทุนต่ำกว่าเพื่อได้จำนวนมากขึ้น แต่ยิ่งผู้กำกับอยู่ห่างจากบริบทการใช้งานของโมเดลมากเท่าไร โมเดลที่ถูกกำหนดโดยป้ายเหล่านั้นก็ยิ่งไม่สอดคล้องกับความต้องการและความคาดหวังของโดเมนเป้าหมาย

นี่จึงยังเป็นหนึ่งในความท้าทายด้านเศรษฐศาสตร์ของการพัฒนาแมชชีนเลิร์นนิงที่ยืดเยื้อและยังไม่มีคำตอบ

เผยแพร่ครั้งแรกวันพุธที่ 23 เมษายน 2025

ผู้เขียนด้านการเรียนรู้ของเครื่อง, ผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์. อดีตหัวหน้าฝ่ายเนื้อหาการวิจัยที่ Metaphysic.ai, จนกระทั่งการรวมเข้าเป็น Brahma.ai ของ DNEG.
เว็บไซต์: martinanderson.ai
ติดต่อ: martin@martinanderson.ai