โมเดลและแพลตฟอร์ม AI

โมเดล AI ต้องเผชิญกับความอ่อนแอในการอ่านนาฬิกาที่พื้นฐาน ในขณะที่มนุษย์ทำได้ดี

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

การวิจัยที่ครอบคลุม ClockBench ทดสอบ 11 โมเดล AI ที่นำมาใช้กับมนุษย์ในการอ่านนาฬิกาอะนาล็อกได้เผยให้เห็นถึงจุดอ่อนที่น่าประหลาดใจในระบบ AI ที่มีอยู่ในปัจจุบัน ในขณะที่มนุษย์สามารถอ่านนาฬิกาอะนาล็อกได้ถูกต้อง 89.1% โมเดลที่ดีที่สุดของ Google (GOOGL ) ได้เพียง 13.3% ความถูกต้องในการทดสอบเดียวกัน

การวิจัย ClockBench ที่ดำเนินการโดย Alek Safar แสดงให้เห็นว่าแม้แต่ระบบ AI ที่ทันสมัยที่สุดก็ยังต้องดิ้นรนในการทำภารกิจที่ต้องใช้ภาพที่ผู้คนส่วนใหญ่เรียนรู้เมื่อเป็นเด็ก การทดสอบใช้ระบบจาก Google, OpenAI, Anthropic และห้องปฏิบัติการ AI อื่นๆ โดยใช้นาฬิกาอะนาล็อก 180 รุ่นที่ออกแบบมาเป็นพิเศษ

ผลลัพธ์นี้ไปไกลกว่านาฬิกา ผลการวิจัยเน้นย้ำถึงข้อจำกัดพื้นฐานในการประมวลผลและให้เหตุผลเกี่ยวกับข้อมูลภาพ “การอ่านนาฬิกาอะนาล็อกตั้งมาตรฐานสูงสำหรับการให้เหตุผลภายในพื้นที่ภาพ” Safar กล่าวในเอกสารวิจัย การทดสอบต้องอาศัยโมเดลในการระบุนาฬิกา มีความสัมพันธ์ และแปลการวางแนวภาพเป็นเวลา

ช่องว่างระหว่างผลการทำงานของมนุษย์และ AI จะเห็นได้ชัดเจนยิ่งขึ้นเมื่อตรวจสอบรูปแบบข้อผิดพลาด เมื่อมนุษย์ทำผิดพลาด ค่าเฉลี่ยของข้อผิดพลาดคือเพียง 3 นาที ในขณะที่โมเดล AI ผิดพลาด 1-3 ชั่วโมง ซึ่งเทียบเท่ากับการเดาแบบสุ่มบนหน้าปัดนาฬิกา 12 ชั่วโมง

จุดอ่อนเฉพาะที่ถูกเปิดเผย

ระบบ AI ต้องดิ้นรนเป็นพิเศษกับ:

  • ตัวเลขโรมัน (ความถูกต้อง 3.2%)
  • หน้าปัดนาฬิกาที่สะท้อนกลับหรือกลับด้าน
  • พื้นหลังที่มีสีสันหรือการออกแบบที่ซับซ้อน
  • นาฬิกาที่มีเข็มวินาทีและต้องการการอ่านอย่างแม่นยำ

น่าสนใจที่เมื่อโมเดล AI สามารถอ่านนาฬิกาได้สำเร็จ พวกมันก็สามารถทำงานได้ดีในการเพิ่มเวลาหรือแปลงเวลาในภายหลัง ซึ่งบ่งชี้ว่าความท้าทายหลักอยู่ที่การรับรู้ภาพเบื้องต้นมากกว่าการให้เหตุผลทางคณิตศาสตร์

การวิเคราะห์ประสิทธิภาพของอุตสาหกรรม

โมเดลของ Google นำหน้าด้วย Gemini 2.5 Pro ที่ได้ 13.3% และ Gemini 2.5 Flash ที่ได้ 10.5% GPT-5 ของ OpenAI ได้ 8.4% ในขณะที่โมเดล Claude ของ Anthropic ทำได้ไม่ดีนัก โดย Claude 4 Sonnet ได้ 4.2% และ Claude 4.1 Opus ได้ 5.6%

xAI’s Grok 4 ได้ผลลัพธ์ที่น่าผิดหวังที่ 0.7% ความถูกต้อง แม้ว่าจะมาจากโมเดลที่ระบุว่านาฬิกาทั้งหมดแสดงเวลาไม่可能 63% เมื่อจริงๆ แล้วมีเพียง 20.6% เท่านั้นที่แสดงเวลาไม่可能

Source: Alek Safar

ผลกระทบในวงกว้างต่อพัฒนาการ AI

การวิจัยนี้สร้างขึ้นจากแนวทาง “ง่ายสำหรับมนุษย์ แต่ยากสำหรับ AI” ที่เห็นในการทดสอบอย่าง ARC-AGI และ SimpleBench ในขณะที่ระบบ AI ได้พิชิตงานที่ต้องใช้ความรู้และทำได้ดีกว่ามนุษย์ในหลายๆ การทดสอบมาตรฐาน การให้เหตุผลภาพพื้นฐานยังคงเป็นปัญหา

การวิจัยชี้ให้เห็นว่าแนวทางการปรับขนาดที่มีอยู่อาจไม่สามารถแก้ไขปัญหาเกี่ยวกับการให้เหตุผลภาพ Safar คาดการณ์ว่านาฬิกาอะนาล็อกอาจไม่ได้รับการแสดงในข้อมูลการฝึกอบรม และการแปลการแสดงภาพนาฬิกาเป็นข้อความสำหรับการให้เหตุผลอาจทำให้เกิดปัญหาเพิ่มเติม

การวิจัย ClockBench เป็นส่วนหนึ่งของการรวบรวมมาตรฐานที่ออกแบบมาเพื่อระบุจุดอ่อนของ AI ที่ไม่เห็นได้ชัดเจนจากผลการทำงานในแบบทดสอบ truyền thống ชุดข้อมูลที่สมบูรณ์ยังคงไม่เปิดเผยต่อสาธารณะเพื่อป้องกันการปนเปื้อนของข้อมูลการฝึกอบรม AI ในอนาคต โดยมีเพียงตัวอย่างเล็กๆ ที่เผยแพร่สาธารณะเพื่อทดสอบ

ผลการวิจัยทำให้เกิดคำถามเกี่ยวกับว่าแนวทางพัฒนาการ AI ที่มีอยู่สามารถแก้ไขช่องว่างการให้เหตุผลภาพนี้ได้หรือไม่ หรือว่าจะต้องมีการเข้าใกล้ใหม่ๆ ทั้งหมด – คล้ายกับวิธีการคำนวณในเวลาทดสอบที่ปลดล็อกความก้าวหน้าในโดเมนอื่นๆ

สำหรับตอนนี้ นาฬิกาอะนาล็อกที่เรียบง่ายยังคงเป็นป้อมปราการที่ไม่คาดคิดต่อการโจมตีของ AI ที่สามารถอ่านได้โดยมนุษย์เกือบทุกคน แต่ทำให้ระบบ AI ที่ซับซ้อนที่สุดในโลกสับสน

Alex McFarland เป็นนักข่าวและนักเขียน AI ที่สำรวจการพัฒนาล่าสุดในด้านปัญญาประดิษฐ์ เขาได้ร่วมงานกับสตาร์ทอัพ AI และสื่อสิ่งพิมพ์ต่างๆ ทั่วโลก