Mô hình và nền tảng AI

Các Mô Hình Trí Tuệ Nhân Tạo Vấp Ngã Trên Việc Đọc Giờ Cơ Bản Trong Khi Con Người Vẫn Tiếp Tục Thịnh Hành

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Một nghiên cứu toàn diện kiểm tra 11 mô hình trí tuệ nhân tạo hàng đầu so với con người trong việc đọc đồng hồ analog đã暴 lộ một điểm yếu bất ngờ trong các hệ thống trí tuệ nhân tạo hiện tại. Trong khi con người đạt được độ chính xác 89,1% trong việc đọc giờ, mô hình tốt nhất của Google (GOOGL ) chỉ đạt được độ chính xác 13,3% trên cùng một bài kiểm tra.

Nghiên cứu ClockBench, được thực hiện bởi nhà nghiên cứu Alek Safar, chứng minh rằng thậm chí các hệ thống trí tuệ nhân tạo tiên tiến nhất cũng gặp khó khăn với các nhiệm vụ thị giác mà hầu hết mọi người đều thành thạo từ khi còn nhỏ. Bài kiểm tra này đã thử nghiệm các hệ thống từ Google, OpenAI, Anthropic và các phòng thí nghiệm trí tuệ nhân tạo lớn khác bằng cách sử dụng 180 đồng hồ analog tùy chỉnh.

Điều này vượt ra ngoài đồng hồ. Kết quả này nhấn mạnh những hạn chế cơ bản trong cách các hệ thống trí tuệ nhân tạo xử lý và lý luận về thông tin thị giác. “Đọc đồng hồ analog đặt ra một tiêu chuẩn cao cho việc lý luận trong không gian thị giác,” Safar lưu ý trong bài báo nghiên cứu. Nhiệm vụ này yêu cầu các mô hình phải xác định tay đồng hồ, hiểu mối quan hệ của chúng và dịch vị trí thị giác thành thời gian số.

Khoảng cách hiệu suất trở nên thậm chí còn ấn tượng hơn khi kiểm tra các mẫu lỗi. Khi con người mắc lỗi, sai số trung vị chỉ là ba phút. Ngược lại, các mô hình trí tuệ nhân tạo bỏ lỡ dấu bằng một đến ba giờ – tương đương với việc đoán ngẫu nhiên trên đồng hồ 12 giờ.

Điểm Yếu Cụ Thể Được Phát Hiện

Các hệ thống trí tuệ nhân tạo đặc biệt gặp khó khăn với:

  • Số La Mã (độ chính xác 3,2%)
  • Mặt đồng hồ bị phản chiếu hoặc ngược chiều
  • Nền màu sắc hoặc thiết kế phức tạp
  • Đồng hồ có tay giây yêu cầu đọc chính xác

Thật thú vị, khi các mô hình trí tuệ nhân tạo thành công đọc đồng hồ, chúng thực hiện tốt các nhiệm vụ tiếp theo như thêm thời gian hoặc chuyển đổi múi giờ. Điều này cho thấy thách thức cốt lõi nằm ở việc nhận dạng thị giác ban đầu chứ không phải lý luận toán học.

Phân Tích Hiệu Suất Ngành

Các mô hình của Google dẫn đầu, với Gemini 2.5 Pro đạt độ chính xác 13,3% và Gemini 2.5 Flash đạt 10,5%. GPT-5 của OpenAI đạt 8,4%, trong khi mô hình Claude của Anthropic đạt thấp hơn, với Claude 4 Sonnet ở 4,2% và Claude 4.1 Opus ở 5,6%.

Mô hình Grok 4 của xAI cho thấy kết quả đáng ngạc nhiên khi chỉ đạt độ chính xác 0,7%, mặc dù điều này bắt nguồn từ việc mô hình này đánh dấu sai 63% tất cả đồng hồ hiển thị thời gian không thể khi chỉ 20,6% thực sự như vậy.

Nguồn: Alek Safar

Ảnh Hưởng Broader Đối Với Phát Triển Trí Tuệ Nhân Tạo

Nghiên cứu này xây dựng trên phương pháp “dễ cho con người, khó cho trí tuệ nhân tạo” được thấy trong các bài kiểm tra như ARC-AGI và SimpleBench. Trong khi các hệ thống trí tuệ nhân tạo đã chinh phục nhanh chóng các nhiệm vụ đòi hỏi kiến thức và thậm chí vượt qua hiệu suất của con người trên nhiều bài kiểm tra tiêu chuẩn, lý luận thị giác cơ bản vẫn còn gặp khó khăn.

Nghiên cứu này cho thấy rằng các phương pháp mở rộng hiện tại có thể không giải quyết được các thách thức về lý luận thị giác. Safar đưa ra giả thuyết rằng đồng hồ analog có thể bị thiếu đại diện trong dữ liệu đào tạo và việc dịch biểu diễn đồng hồ thị giác thành văn bản để lý luận tạo ra thêm các phức tạp.

ClockBench tham gia vào một bộ sưu tập ngày càng tăng của các bài kiểm tra được thiết kế để xác định các hạn chế của trí tuệ nhân tạo không rõ ràng ngay lập tức từ hiệu suất trên các bài kiểm tra truyền thống. Toàn bộ tập dữ liệu vẫn còn riêng tư để ngăn chặn ô nhiễm dữ liệu đào tạo trí tuệ nhân tạo trong tương lai, với chỉ các mẫu nhỏ được công bố cho mục đích kiểm tra.

Kết quả này đặt ra câu hỏi về việc liệu các mô hình phát triển trí tuệ nhân tạo hiện tại có thể giải quyết các khoảng trống lý luận thị giác này hay không, hoặc liệu các phương pháp hoàn toàn mới sẽ được cần – tương tự như cách tính toán thời gian kiểm tra đã mở ra tiến bộ trong các lĩnh vực khác.

Hiện tại, đồng hồ analog khiêm tốn vẫn đứng như một pháo đài bất ngờ chống lại trí tuệ nhân tạo, có thể đọc được bởi hầu hết mọi người nhưng khiến cho các hệ thống trí tuệ nhân tạo tinh vi nhất trên thế giới bối rối.

Alex McFarland là một nhà báo và nhà văn về trí tuệ nhân tạo, khám phá những phát triển mới nhất trong lĩnh vực trí tuệ nhân tạo. Ông đã hợp tác với nhiều công ty khởi nghiệp và xuất bản về trí tuệ nhân tạo trên toàn thế giới.