Yapay zeka modelleri ve platformları
AI Modelleri Temel Saat Okuma Konusunda Zorlanıyor

Bir kapsamlı çalışma 11 önde gelen AI modelini saat okumada insanlarla karşılaştırarak mevcut yapay zeka sistemlerinde şaşırtıcı bir zayıflık ortaya çıkardı. İnsanların saat okumada %89,1 başarı elde ettiği mentre, Google’ (GOOGL ) ın en iyi modeli aynı testte sadece %13,3 başarı elde edebildi.
ClockBench çalışması, araştırmacı Alek Safar tarafından yürütüldü ve en gelişmiş AI sistemlerinin çocuklar tarafından kolayca öğrenilen görsel görevlerle mücadele ettiğini gösterdi. 180 özel tasarlanmış analog saat kullanarak Google, OpenAI, Anthropic ve diğer büyük AI laboratuvarlarından sistemler test edildi.
Bu, saatlerin ötesine geçer. Sonuçlar, AI sistemlerinin görsel bilgileri işleme ve akıl yürütme konusunda temel sınırlılıklarını vurgulamaktadır. “Analog saat okumak, görsel alanda akıl yürütme yapmak için yüksek bir standart belirler” diye belirtiyor Safar araştırma makalesinde. Bu görev, modellerin saat ibrelerini tanımlamasını, ilişkilerini anlamasını ve görsel konumlandırmayı sayısal zamana çevirmesini gerektirir.
Hata kalıplarını incelediğinizde performans açığı daha da çarpıcı hale gelir. İnsanların hatalı okumaları olduğunda, median hata sadece üç dakika oldu. AI modelleri ise bir ila üç saat arasında hata yaptılar – yaklaşık olarak 12 saatlik bir saatte rastgele tahmin etmeye eşdeğer.
Özgün Zayıflıklar Açığa Çıktı
AI sistemleri özellikle aşağıdaki konularda zorlandı:
- Roma rakamları (%3,2 başarı)
- Yansıtma veya ters saat yüzleri
- Renkli arka planlar veya karmaşık tasarımlar
- İkinci ibre gerektiren saatler
İlginç bir şekilde, AI modelleri bir saati doğru okuduklarında, zaman eklemek veya zaman dilimlerini dönüştürmek gibi takip görevlerinde iyi performans gösterdiler. Bu, temel zorluğun ilk görsel tanıma değil, matematiksel akıl yürütme olduğunu gösteriyor.
Endüstri Performansının Ayrıntılı İncelenmesi
Google’ın modelleri önde geldi, Gemini 2.5 Pro %13,3 başarı elde ederken, Gemini 2.5 Flash %10,5 başarı elde etti. OpenAI’nin GPT-5 %8,4 başarı elde ederken, Anthropic’in Claude modelleri daha düşük performans gösterdi, Claude 4 Sonnet %4,2 ve Claude 4.1 Opus %5,6 başarı elde etti.
xAI’nin Grok 4 modeli şaşırtıcı bir şekilde düşük %0,7 başarı elde etti, ancak bu, modelin %63’ünün imkansız saatleri gösterdiğini yanlış bir şekilde saptamasından kaynaklandı, oysa sadece %20,6’sı gerçekten imkansız saatleri gösteriyordu.

Kaynak: Alek Safar
Yapay Zeka Gelişimi için Daha Geniş İmpilikasyonlar
Bu çalışma, “insan için kolay, AI için zor” benchmark yaklaşımını takip eden ARC-AGI ve SimpleBench gibi testlerle benzerlik gösteriyor. AI sistemleri bilgi yoğun görevleri hızla fethetmiş ve birçok standart testte insan performansını aşmış olsa da, temel görsel akıl yürütme hala sorunlu kalıyor.
Araştırma, mevcut ölçeklendirme yaklaşımlarının görsel akıl yürütme zorluklarını çözemeyebileceğini öne sürüyor. Safar, analog saatlerin eğitim verisinde temsil edilmeyebileceğini ve görsel saat temsilinin metne çevrilmesinin ek karmaşıklıklar yaratabileceğini varsayıyor.
ClockBench, AI sınırlılıklarını belirlemek amacıyla tasarlanan benchmark koleksiyonuna katılıyor. Tam veri seti, gelecekteki AI eğitimini bozmamak amacıyla özel tutuluyor ve sadece küçük örnekler test amacıyla halka açık hale getiriliyor.
Sonuçlar, mevcut AI geliştirme paradigmalarının bu görsel akıl yürütme açıklarını giderip gideremeyeceği veya tamamen yeni yaklaşımların gerekip gerekmediği konusunda soruları gündeme getiriyor – tıpkı test zamanı hesaplamanın diğer alanlarda ilerleme kaydetmesine benzer şekilde.
Şimdilik, mütevazı analog saat,几乎 her insan tarafından okunabilen ancak dünyanın en gelişmiş AI sistemlerini şaşırtan beklenmedik bir kale olarak duruyor.












