มุมมองของ Anderson

ปัญหาของ AI ในการอ่านนาฬิกาอะนาล็อกอาจมีนัยสำคัญมากกว่าที่คิด

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
ChatGPT-4o and Adobe Firefly.

นักวิจัยจากจีนและสเปนได้ตีพิมพ์งานวิจัยใหม่ที่พบว่าแม้โมเดล AI ที่ซับซ้อนอย่าง GPT-4.1 ก็ยังต้องดิ้นรนในการบอกเวลาจากภาพนาฬิกาอะนาล็อก การเปลี่ยนแปลงเล็กน้อยในนาฬิกาอะนาล็อกสามารถทำให้เกิดข้อผิดพลาดในการตีความได้ และการปรับให้เหมาะสมกับข้อมูลฝึกเท่านั้นไม่ช่วยให้โมเดลมีความเข้าใจที่ลึกซึ้งยิ่งขึ้นเกี่ยวกับการบอกเวลา

 

เมื่อมนุษย์เข้าใจหลักการทำงานของโดเมนใดโดเมนหนึ่ง เช่น แรงโน้มถ่วงหรือหลักการทางกายภาพอื่นๆ เราจะสามารถใช้ความรู้นั้นได้โดยไม่ต้องอาศัยตัวอย่างเฉพาะ และสามารถใช้ความรู้นั้นในการตีความสิ่งที่ไม่เคยเห็นมาก่อนได้

เมื่อโดเมนมีความสำคัญพอที่เราจะเริ่มสังเกตเห็นแม้ในที่ที่ไม่มี เช่น pareidolia ซึ่งเป็นผลมาจากความเสี่ยงในการไม่สังเกตเห็นสิ่งที่แท้จริง และเรายังสามารถสังเกตเห็นรูปแบบที่หลากหลายแม้ในที่ที่ไม่มีรูปแบบใดๆ

การเรียนรู้โดเมนตั้งแต่เนิ่นๆ และการซ้ำซ้อนการเรียนรู้จะทำให้เรามีความเข้าใจที่ลึกซึ้งและยังคงอยู่ตลอดชีวิต และหนึ่งในข้อมูลที่เราได้รับเมื่อเป็นเด็กคือการเรียนรู้การบอกเวลาโดยใช้นาฬิกาอะนาล็อก

เครื่องมือช่วยสอนเด็กให้บอกเวลา. Source: https://www.youtube.com/watch?v=IBBQXBhSNUs

เครื่องมือช่วยสอนเด็กให้บอกเวลา. Source: https://www.youtube.com/watch?v=IBBQXBhSNUs

แม้ว่าแฟชั่นในการออกแบบนาฬิกาจะเปลี่ยนแปลงไป แต่ความสามารถในการบอกเวลาของเรายังคงอยู่ได้ดี และเราสามารถบอกเวลาได้แม้ในนาฬิกาที่มีดีไซน์ phức tạpหรือไม่ปกติ

นาฬิกาที่มีดีไซน์ไม่ปกติ. Source: https://www.ablogtowatch.com/wait-a-minute-legibility-is-the-most-important-part-of-watch-design/

นาฬิกาที่มีดีไซน์ไม่ปกติ. Source: https://www.ablogtowatch.com/wait-a-minute-legibility-is-the-most-important-part-of-watch-design/

มนุษย์ไม่ต้องการตัวอย่างมากมายเพื่อเรียนรู้การบอกเวลา เมื่อเราเข้าใจหลักการทำงานแล้ว เราก็สามารถบอกเวลาได้ในรูปแบบต่างๆ แม้ในที่ที่ไม่เคยเห็นมาก่อน

ความยากที่โมเดล AI ต้องเผชิญในการบอกเวลานี้เน้นย้ำถึงปัญหาที่ลึกซึ้งกว่า ซึ่งก็คือความเข้าใจที่แท้จริงของโมเดล AI อาจขึ้นอยู่กับการได้รับข้อมูลมากกว่าการเข้าใจหลักการทำงาน

เกินเกมเลียนแบบ?

ความตึงเครียดระหว่างการทำงานบนพื้นผิวและความเข้าใจที่แท้จริงได้ปรากฏขึ้นซ้ำๆ ในการวิจัยโมเดลขนาดใหญ่ เมื่อเดือนที่แล้ว มหาวิทยาลัย Zhejiang และ Westlake University ได้พิมพ์งานวิจัยที่มีชื่อว่า Do PhD-level LLMs Truly Grasp Elementary Addition? ซึ่งสรุปได้ว่า…

‘尽管 Benchmark น่าประทับใจ แต่โมเดลแสดงให้เห็นถึงการขึ้นอยู่กับการจับคู่รูปแบบมากกว่าการเข้าใจที่แท้จริง ซึ่งเห็นได้จากความล้มเหลวในการแสดงถึงการแทนค่าและสัญลักษณ์ และการละเมิดคุณสมบัติขั้นพื้นฐาน’

‘การให้กฎเกณฑ์อย่างชัดเจนจะทำให้ประสิทธิภาพลดลง ซึ่งบ่งชี้ถึงข้อจำกัดทางสถาปัตยกรรมที่มีอยู่ การได้รับข้อมูลเหล่านี้ทำให้เราเห็นถึงช่องว่างในการประเมินและเน้นย้ำถึงความจำเป็นในการมีสถาปัตยกรรมที่สามารถให้เหตุผลทางคณิตศาสตร์ได้อย่างแท้จริงมากกว่าการจับคู่รูปแบบ’

งานวิจัยนี้ทำให้เกิดคำถามอีกครั้งว่าโมเดล AI เช่น GPT-4.1 ได้เรียนรู้การบอกเวลาอย่างแท้จริงหรือไม่…

แม้ว่าการวิจัยจะไม่ได้ครอบคลุมถึงรายละเอียด แต่นักวิจัยได้ทำการทดสอบเบื้องต้นเพื่อดูว่า GPT-4.1 สามารถบอกเวลาจากภาพนาฬิกาอะนาล็อกได้ดีเพียงใด และพบว่าโมเดลมีความยากในการบอกเวลาแม้ในกรณีที่ง่าย

นี่ทำให้เกิดคำถามว่าอาจมีช่องว่างในข้อมูลฝึกของโมเดล และจำเป็นต้องมีข้อมูลที่สมดุลมากขึ้นเพื่อทดสอบว่าโมเดลสามารถเรียนรู้การบอกเวลาได้หรือไม่ ดังนั้น นักวิจัยจึงสร้างข้อมูลสังเคราะห์ของนาฬิกาอะนาล็อกที่ครอบคลุมทุกๆ เวลา และหลีกเลี่ยงความเอนเอียงที่พบในภาพจากอินเทอร์เน็ต

ตัวอย่างจากข้อมูลสังเคราะห์ของนาฬิกาอะนาล็อกที่ใช้ในการปรับให้เหมาะสมของโมเดล GPT ในงานวิจัยใหม่นี้

ตัวอย่างจากข้อมูลสังเคราะห์ของนาฬิกาอะนาล็อกที่ใช้ในการปรับให้เหมาะสมของโมเดล GPT ในงานวิจัยใหม่นี้ Source: https://huggingface.co/datasets/migonsa/analog_watches_finetune

ก่อนการปรับให้เหมาะสม GPT-4.1 ล้มเหลวในการบอกเวลานาฬิกาอะนาล็อก แต่หลังจากได้รับข้อมูลใหม่แล้ว โมเดลก็มีการปรับปรุงผลลัพธ์ แต่เฉพาะเมื่อภาพนาฬิกาอะนาล็อกมีลักษณะคล้ายกับที่โมเดลเคยเห็นมาก่อน

เมื่อนาฬิกาอะนาล็อกมีรูปร่างหรือมือที่แตกต่าง โมเดลก็มีความยากในการบอกเวลา และ GPT-4.1 ยังต้องดิ้นรนในการตีความนาฬิกาอะนาล็อกที่มีลักษณะคล้ายกับงานศิลปะของ Dali

ภาพนาฬิกาอะนาล็อกที่มีลักษณะมาตรฐาน (ซ้าย) รูปร่างที่เปลี่ยนแปลง (กลาง) และมือที่เปลี่ยนแปลง (ขวา) พร้อมกับเวลาที่ GPT-4.1 คาดการณ์ไว้ก่อนและหลังการปรับให้เหมาะสม

ภาพนาฬิกาอะนาล็อกที่มีลักษณะมาตรฐาน (ซ้าย) รูปร่างที่เปลี่ยนแปลง (กลาง) และมือที่เปลี่ยนแปลง (ขวา) พร้อมกับเวลาที่ GPT-4.1 คาดการณ์ไว้ก่อนและหลังการปรับให้เหมาะสม Source: https://arxiv.org/pdf/2505.10862

เวลาเพียงพอ

대부분ของข้อมูลฝึกมาจากภาพบนอินเทอร์เน็ต ซึ่งมักจะแสดงเวลา 10:10 ซึ่งเป็นเวลาในการโฆษณานาฬิกาที่ได้รับความนิยม…

ตัวอย่างจากงานวิจัยใหม่นี้แสดงถึงความนิยมของเวลา 10:10 ในภาพนาฬิกาอะนาล็อก

ตัวอย่างจากงานวิจัยใหม่นี้แสดงถึงความนิยมของเวลา 10:10 ในภาพนาฬิกาอะนาล็อก

ผลลัพธ์นี้ทำให้เกิดคำถามว่าทำไมโมเดลจึงล้มเหลวในการตีความนาฬิกาอะนาล็อกที่มีลักษณะเปลี่ยนแปลง…

การทดสอบการปรับให้เหมาะสม

เพื่อทดสอบว่าโมเดลสามารถเรียนรู้การบอกเวลาได้ดีขึ้นหลังการปรับให้เหมาะสมหรือไม่ GPT-4.1 ได้รับการปรับให้เหมาะสมด้วยข้อมูลสังเคราะห์ที่ครอบคลุม…

ผลลัพธ์แสดงให้เห็นว่าโมเดลมีการปรับปรุงผลลัพธ์บนภาพนาฬิกาอะนาล็อกที่มีลักษณะมาตรฐาน แต่ยังคงมีข้อผิดพลาดในการตีความนาฬิกาอะนาล็อกที่มีลักษณะเปลี่ยนแปลง

สองรูปแบบของความล้มเหลวที่แตกต่างกันปรากฏขึ้น: บนนาฬิกาอะนาล็อกที่มีลักษณะมาตรฐานและเปลี่ยนแปลง โมเดลมักจะสับสนเกี่ยวกับทิศทางของมือ แต่บนภาพนาฬิกาอะนาล็อกที่มีลักษณะมือที่เปลี่ยนแปลง โมเดลมักจะสับสนเกี่ยวกับหน้าที่ของมือแต่ละมือ

การเปรียบเทียบผลลัพธ์ของโมเดลก่อนและหลังการปรับให้เหมาะสม

การเปรียบเทียบผลลัพธ์ของโมเดลก่อนและหลังการปรับให้เหมาะสม

สัญญาณมือ

แม้ว่าการปรับให้เหมาะสมจะช่วยให้โมเดลมีการปรับปรุงผลลัพธ์บนภาพนาฬิกาอะนาล็อกที่มีลักษณะมาตรฐาน แต่ก็ยังคงมีข้อผิดพลาดในการตีความนาฬิกาอะนาล็อกที่มีลักษณะมือที่เปลี่ยนแปลง…

นี่ทำให้เกิดคำถามว่าความล้มเหลวของโมเดลอาจมาจากความสับสนเกี่ยวกับหน้าที่ของมือหรือไม่

เพื่อทดสอบสิ่งนี้ นักวิจัยได้ทำการวิเคราะห์ผลลัพธ์ของโมเดลบนภาพนาฬิกาอะนาล็อกที่มีลักษณะมือที่เปลี่ยนแปลง และพบว่าความสับสนเกี่ยวกับหน้าที่ของมือเป็นสาเหตุหลักของความล้มเหลว

การเปรียบเทียบข้อผิดพลาดของโมเดลบนภาพนาฬิกาอะนาล็อกที่มีลักษณะมือที่เปลี่ยนแปลง

การเปรียบเทียบข้อผิดพลาดของโมเดลบนภาพนาฬิกาอะนาล็อกที่มีลักษณะมือที่เปลี่ยนแปลง

สรุป

แม้ว่าเนื้อหาของงานวิจัยนี้อาจดูไม่สำคัญในตอนแรก แต่ก็มีนัยสำคัญมากกว่าที่คิด…

ไม่สำคัญว่าโมเดล AI จะเรียนรู้การบอกเวลาจากนาฬิกาอะนาล็อกได้หรือไม่ แต่สิ่งที่สำคัญคือการวิจัยนี้เน้นย้ำถึงคำถามที่ลึกซึ้งกว่าว่า โมเดล AI สามารถเรียนรู้การบอกเวลาได้ดีขึ้นโดยการได้รับข้อมูลมากกว่าการเข้าใจหลักการทำงานหรือไม่

คำตอบของคำถามนี้จะช่วยให้เราเข้าใจถึงข้อจำกัดของโมเดล AI และสามารถพัฒนาโมเดลที่มีความสามารถในการเรียนรู้และเข้าใจที่ดีขึ้น

 

ตีพิมพ์ครั้งแรกวันจันทร์ที่ 19 พฤษภาคม 2025

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai