มุมมองของ Anderson

อุปทาน ‘ดาวน์โหลดฉลากเพิ่มเติม!’ ในการวิจัย AI

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
ChatGPT-4o: 'A wall on which hundreds of photographs are stuck with thumb-tacks. Each photo depicts a different kind of subject, such as fruit or animals or bridges or buildings or people, etc. Each photo has 2-3 yellow post-it notes attached to it. We are too far away to read anything written on the post-it notes, but we can see that there are dozens and dozens of photos on the wall, and each with several post-it notes tacked on.'

มุมมองหนึ่งในงานวิจัยการเรียนรู้ของเครื่องในปัจจุบันคือ การใช้การเรียนรู้ของเครื่องเพื่อปรับปรุงคุณภาพของการทำแอนโนเทชันของชุดข้อมูล AI โดยเฉพาะคำบรรยายภาพที่ตั้งใจจะใช้ในโมเดลภาษาและวิชั่น (VLMs) มุมมองนี้ได้รับแรงผลักดันจาก ต้นทุนสูง ของการแอนโนเทชันของมนุษย์ และภาระเพิ่มเติมของ การดูแลการทำงานของผู้แอนโนเทชัน

โดยที่น่าแปลกใจ นี่คือสิ่งที่เทียบเท่ากับ มีม ‘ดาวน์โหลด RAM เพิ่มเติม’ ในช่วงต้นปี 2000 ซึ่งล้อเลียนแนวคิดที่ว่าข้อจำกัดของฮาร์ดแวร์สามารถแก้ไขได้ด้วยการแก้ไขซอฟต์แวร์

นอกจากนี้ยังเป็นปัญหาที่ไม่ได้รับการพิจารณาเป็นอย่างดี ในขณะที่โมเดล AI ใหม่ๆ ได้รับความสนใจอย่างกว้างขวางทั้งในสาธารณะและเชิงพาณิชย์ การแอนโนเทชัน thườngดูเหมือนเป็นรายละเอียดที่ไม่สำคัญในกระบวนการเรียนรู้ของเครื่อง ซึ่งถูกมองข้ามไปโดยความตื่นเต้นเกี่ยวกับเฟรมเวิร์กที่กว้างขึ้น

ในความเป็นจริง ความสามารถของระบบการเรียนรู้ของเครื่องในการรับรู้และทำซ้ำรูปแบบ (กรณีการใช้งานหลักของระบบ AI เกือบทั้งหมด) ขึ้นอยู่กับคุณภาพและความสอดคล้องของการแอนโนเทชันในโลกแห่งความเป็นจริง – ฉลากและวลีที่สร้างหรือตัดสินโดยผู้คนจริงๆ ซึ่งมักจะทำการตัดสินใจที่มีเจตนาเกี่ยวกับจุดข้อมูลแต่ละจุดใน สถานการณ์ที่ไม่เหมาะสม

โดยไม่หลีกเลี่ยง ระบบที่พยายามสังเกตและทำซ้ำรูปแบบในพฤติกรรมของผู้แอนโนเทชัน (และแทนที่ผู้แอนโนเทชันและอำนวยความสะดวกในการทำฉลากที่แม่นยำในระดับใหญ่) ไม่สามารถหวังว่าจะทำงานได้ดีบนข้อมูล ไม่ ที่อยู่ในตัวอย่างที่นำมาจากผู้สังเกตการณ์ของมนุษย์ สิ่งที่ ‘คล้ายกัน’ ไม่เหมือนกันเลย และความเท่าเทียมกันระหว่างโดเมนยังคงเป็น การแสวงหาที่เป็นปัญหา ในการมองเห็นของเครื่อง

การค้า RAG

จนกระทั่งไม่นานมานี้ ความไม่ถูกต้องที่เกิดขึ้นจากการแอนโนเทชันของชุดข้อมูลที่ไม่ได้รับการดูแลอย่างดีถูกมองว่าเป็นความเสียหายที่ยอมรับได้ในบริบทของผลลัพธ์ที่ไม่สมบูรณ์แต่ยังคงสามารถขายได้จากระบบ AI ที่สร้างขึ้น

แท้จริงแล้ว ในปีนี้เอง การศึกษาจากประเทศสิงคโปร์ สรุป ว่า การหลอกลวง – กล่าวคือ โอกาสที่ระบบ AI คิดค้นสิ่งที่บ่อนทำลายความตั้งใจของเรา – เป็นสิ่งที่หลีกเลี่ยงไม่ได้ และมีเนื้อหาเชื่อมโยงกับโครงสร้างแนวคิดของระบบเหล่านั้น

เพื่อตอบโต้สิ่งนี้ ตัวแทน RAG – ซึ่งสามารถ ‘ยืนยัน’ ข้อเท็จจริงผ่านการค้นหาในอินเทอร์เน็ต – ได้กลายเป็นเรื่องที่นิยมในการวิจัยและวิธีแก้ปัญหาเชิงพาณิชย์อย่างกว้างขวาง อย่างไรก็ตาม สิ่งเหล่านี้เพิ่มต้นทุนของทรัพยากรและความล่าช้าในการซักถาม นอกจากนี้ ข้อมูลใหม่ที่ใช้กับโมเดลที่ฝึกไว้ไม่สามารถแข่งขันกับข้อมูลที่ซับซ้อนและเชื่อมโยงกันอย่างลึกซึ้งซึ่งเป็นคุณลักษณะของชั้นของโมเดลที่ฝึกไว้

RePOPE

บทความใหม่จากเยอรมนีเน้นย้ำถึงปัญหาที่เกิดขึ้นจากการพึ่งพาชุดข้อมูลที่ใช้กันอย่างแพร่หลาย โดยเฉพาะอย่างยิ่งเกี่ยวกับความถูกต้องและความน่าเชื่อถือของคำบรรยายภาพ นักวิจัยพบว่าข้อผิดพลาดในฉลากสามารถบิดเบือนหรือทำให้การหลอกลวงในโมเดลภาษาและวิชั่นไม่ชัดเจน

ลองนึกภาพโมเดลที่แสดงภาพถนนและถามว่ามีจักรยานในภาพหรือไม่ โมเดลตอบ ใช่ หากชุดข้อมูลมาตรฐานระบุว่าไม่มีจักรยาน โมเดลจะถูกทำเครื่องหมาย ไม่ถูกต้อง แต่ถ้าจักรยาน มองเห็นได้ชัดเจน ในภาพและถูกพลาดไปในการแอนโนเทชัน โมเดลตอบถูกต้อง และชุดข้อมูลมาตรฐานล้มเหลว

วิธีการและทดสอบ

นักวิจัยได้ทำการแอนโนเทชันใหม่สำหรับชุดข้อมูล MSCOCO ทั้งหมด โดยมีผู้แอนโนเทชันสองคนสำหรับแต่ละตัวอย่างข้อมูล ในกรณีที่มีความไม่แน่นอนเกี่ยวกับคุณภาพของฉลากเดิม (เช่น ตัวอย่างด้านล่าง) ผลลัพธ์เหล่านั้นจะถูกตัดออกจากรอบการทดสอบ

ผลลัพธ์ของการแอนโนเทชันใหม่แสดงให้เห็นว่าฉลากเดิมมีข้อผิดพลาดหรือไม่ชัดเจน ซึ่งส่งผลต่อการประเมินผลการทำงานของโมเดล

สรุป

การทดลองนี้เป็นไปได้เพราะขนาดของชุดข้อมูลที่ใช้ในการทดลองค่อนข้างเล็ก หากต้องการพิสูจน์สมมติฐานเดียวกันบนชุดข้อมูลขนาดใหญ่ จะต้องทำงานกับชิ้นส่วนเล็กๆ ของข้อมูล ซึ่งอาจทำให้ผลลัพธ์ไม่ถูกต้อง

แม้ว่าจะเป็นไปได้ แต่ทางออกที่มีอยู่ภายใต้สถานะปัจจุบันคืออะไร การให้เหตุผลจะกลับไปที่ความจำเป็นในการมีการแอนโนเทชันของมนุษย์ที่ดีกว่าและมากขึ้น

ในด้านนี้ ‘ดีกว่า’ และ ‘มากขึ้น’ เป็นปัญหาที่แยกจากกัน เนื่องจากสามารถได้รับการแอนโนเทชันในปริมาณมากขึ้นผ่านเศรษฐกิจที่มีการแข่งขันสูง เช่น Amazon Mechanical Turk (AMT) อย่างไรก็ตาม เศรษฐกิจย่อยนี้มักจะนำไปสู่ผลลัพธ์ที่ไม่ดี

ทางเลือกหนึ่งคือการมอบหมายงานแอนโนเทชันให้กับภูมิภาคที่มีค่าใช้จ่ายน้อยกว่า แต่ถ้าผู้แอนโนเทชันอยู่ห่างไกลจากกรณีการใช้งานที่ตั้งใจไว้ของโมเดลที่ฉลากของพวกเขาจะกำหนดรูปแบบ โมเดลที่ได้รับจะไม่น่าจะสอดคล้องกับความต้องการหรือความคาดหวังของโดเมินเป้าหมาย

สิ่งนี้จึงยังคงเป็นหนึ่งในความท้าทายที่ยังไม่ได้รับการแก้ไขที่ยั่งยืนและยากที่สุดในเศรษฐศาสตร์ของการพัฒนา AI

เมื่อวันพุธที่ 23 เมษายน 2025

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai