Andersonâun AÃ§ÄąsÄą
Yapay ZekanÄąn Analog Saatleri Okuma MÞcadelesi Daha Derin Anlama Sahip OlmayabileceÄini GÃķsteriyor

Ãin ve İspanyaâdan araÅtÄąrmacÄąlarÄąn yeni bir makalesi, GPT-4.1 gibi geliÅmiŠçok modelli yapay zeka modellerinin bile analog saatlerin resimlerinden saatÄą sÃķylemekte zorlandÄąÄÄąnÄą ortaya koyuyor. Saatlerde kÞçÞk gÃķrsel deÄiÅiklikler bÞyÞk yorumlama hatalarÄąna neden olabiliyor ve fine-tuning sadece tanÄądÄąk Ãķrneklerle yardÄąmcÄą oluyor. Sonuçlar, bu modellerin gerçek dÞnya gÃķrevlerinde karÅÄąlaÅtÄąklarÄą bilinmeyen gÃķrseller karÅÄąsÄąnda gÞvenilirliklerine iliÅkin endiÅeler yaratÄąyor.
Â
İnsanlar bir alanÄą, ÃķrneÄin yerçekimi veya diÄer temel fiziksel prensipleri, yeterince derin bir Åekilde anladÄąÄÄąnda, Ãķzel Ãķrneklerin Ãķtesine geçerek altta yatan soyutlamalarÄą kavramaya baÅlarlar. Bu, o bilgiyi yaratÄącÄą bir Åekilde çeÅitli baÄlamlarda uygulamalarÄąna ve daha Ãķnce hiç gÃķrmedikleri yeni Ãķrnekleri, prensibin eylemde olduÄunu tanÄąmlayarak tanÄąmalarÄąna olanak tanÄąr.
Bir alan Äáŧ§ Ãķnemli olduÄunda, onu var olmadÄąÄÄą yerde bile algÄąlayabiliriz, bu da pareidolia ile ilgilidir ve gerçek bir ÃķrneÄi tanÄąmamakta baÅarÄąsÄąz olmanÄąn yÞksek maliyeti tarafÄąndan yÃķnlendirilir. Bu desen tanÄąma mekanizmasÄą o kadar gÞçlÞdÞr ki, aslÄąnda hiçbir desen olmayan yerlerde daha geniÅ bir desen yelpazesini bulmamÄąza neden olur.
Bir alan ne kadar erken ve tekrarlÄą bir Åekilde bize ÃķÄretilirse, o alanÄąn temelleri o kadar derine iner ve ÃķmÞr boyu sÞrer; ve çocukluklarÄąnda maruz kaldÄąklarÄą ilk gÃķrsel veri setlerinden biri, saat ÃķÄretme saatlerinde basÄąlÄą materyal veya etkileÅimli analog saatler kullanÄąlarak saat nasÄąl okunur ÃķÄretilmesidir:

ÃocuklarÄąn saat okumayÄą ÃķÄrenmesine yardÄąmcÄą olan eÄitim materyalleri. Kaynak: https://www.youtube.com/watch?v=IBBQXBhSNUs
İnsanlarÄąn saat tasarÄąmÄą konusundaki deÄiÅen modalarÄą bazen bizi zorlayabilir, ancak bu erken alan hakimiyetinin dayanÄąklÄąlÄąÄÄą gerçekten etkileyicidir ve bizi karmaÅÄąk veya âeksantrikâ tasarÄąm seçimlerine raÄmen analog saat yÞzlerini anlamaya olanak tanÄąr:

Saat modasÄąnÄąn bazÄą zorlayÄącÄą yÞzleri. Kaynak: https://www.ablogtowatch.com/wait-a-minute-legibility-is-the-most-important-part-of-watch-design/
İnsanlarÄąn saatlerin nasÄąl çalÄąÅtÄąÄÄąnÄą ÃķÄrenmek için binlerce ÃķrneÄe ihtiyacÄą yoktur; bir kez temel kavram anlaÅÄąlÄąrsa,å äđ herhangi bir formda tanÄąnabilir, hatta bozulmuÅ veya soyutlaÅtÄąrÄąlmÄąÅ olsa bile.
Yapay zeka modellerinin bu gÃķrevle karÅÄąlaÅtÄąklarÄą zorluk, daha derin bir sorunu vurgulamaktadÄąr: gÃķrÞnÞrdeki gÞçlerinin, yÞksek hacimli maruz kalma rather neÅū anlama Þzerine dayandÄąÄÄąna iÅaret etmektedir.
İmitasyon Oyununun Ãtesinde?
YÞzey dÞzeyindeki performans ile gerçek âanlamaâ arasÄąndaki gerilim, bÞyÞk modellerin yakÄąn zamanda yapÄąlan araÅtÄąrmalarÄąnda defalarca ortaya Ã§ÄąkmÄąÅtÄąr. Geçen ay Zhejiang Ãniversitesi ve Westlake Ãniversitesi, bir makale ile soruyu yeniden formÞle etti: PhD dÞzeyindeki LLMâler gerçekten temel toplama kavramÄąnÄą kavradÄąlar mÄą? (bu makale bu yazÄąda odaklanÄąlan konu deÄil), ve Åu sonuca vardÄą:
âİki yÃķnlÞ testlerde etkileyici performanslara raÄmen, modeller desen eÅleÅtirmeye rather neÅū gerçek anlama baÄÄąmlÄą olduklarÄąnÄą gÃķsterdi, sembolik temsildeki baÅarÄąsÄązlÄąklar ve temel Ãķzelliklerin ihlali ile kanÄątlandÄą.
âAÃ§Äąk kural saÄlama, performansÄą bozuyor gibi gÃķrÞnÞyor, bu da içsel mimari kÄąsÄątlamalarÄą ima ediyor. Bu bilgiler, deÄerlendirme aÃ§ÄąklarÄąnÄą ortaya koyuyor ve gerçek matematiksel akÄąl yÞrÞtme için desen tanÄąma Ãķtesinde yeteneklere sahip mimarilerin gerekliliÄini vurguluyor.â
Bu hafta, soru Åimdi Nanjing HavacÄąlÄąk ve Uzay Ãniversitesi ve İspanyaâdaki Universidad PolitÃĐcnica de Madrid arasÄąndaki bir iÅbirliÄi ile ortaya Ã§ÄąkÄąyor. Ãok Modelli BÞyÞk Dil Modelleri (MLLMâler) Gerçekten Analog Saatlerde Saati ÃÄrenmiÅler mi? adlÄą yeni makale, çok modelli modellerin saat okumayÄą ne kadar iyi anladÄąÄÄąna dair bir araÅtÄąrma içeriyor.
AraÅtÄąrmanÄąn ilerlemesi sadece genel olarak makalede kapsanmaktadÄąr, ancak araÅtÄąrmacÄąlarÄąn ilk testleri, OpenAIânin GPT-4.1 çok modelli dil modelinin, çeÅitli saat resimlerinden saati doÄru olarak okumakta zorlandÄąÄÄąnÄą ortaya koydu, hatta basit durumlarda bile yanlÄąÅ cevaplar verdi.
Bu, modelin eÄitim verisiäļį bir boÅluÄu iÅaret ediyor, daha dengeli bir veri seti ihtiyacÄąnÄą ortaya koyuyor, modelin gerçekten altta yatan kavramÄą ÃķÄrenip ÃķÄrenmediÄini test etmek için. DolayÄąsÄąyla yazarlar, her olasÄą saati eÅit olarak kapsayan ve internet resimlerinde bulunan ÐūÐąŅŅåč§lerden kaÃ§Äąnan sentetik bir analog saat veri seti oluÅturdular:

AraÅtÄąrmacÄąlarÄąn sentetik analog saat veri setinden bir Ãķrnek, yeni çalÄąÅmada bir GPT modelini fine-tune etmek için kullanÄąldÄą. Kaynak: https://huggingface.co/datasets/migonsa/analog_watches_finetune
Veri setine fine-tune olmadan Ãķnce, GPT-4.1 bu saatleri okumakta tutarlÄą olarak baÅarÄąsÄąz oldu. Ancak yeni koleksiyona maruz kaldÄąktan sonra performansÄą iyileÅti â ancak yalnÄązca yeni gÃķrÞntÞler daha Ãķnce gÃķrdÞklerine benziyordu.
Saat Åekli veya el stilinin deÄiÅtiÄinde, doÄruluk keskin bir Åekilde dÞÅtÞ; hatta kÞçÞk deÄiÅiklikler, ÃķrneÄin daha ince eller veya ok uçlarÄą (saÄdaki resim), onu ÅaÅÄąrtmaya yetti; ve GPT-4.1, ayrÄąca âeriyen saatlerâ gibi Dali-esque saatleri yorumlamakta da zorluk çekti:

Standart tasarÄąm (solda), bozulmuÅ Åekil (orta) ve deÄiÅtirilmiÅ eller (saÄda) ile saat resimleri, fine-tune olmadan ve sonrasÄąnda GPT-4.1 tarafÄąndan verilen saatler. Kaynak: https://arxiv.org/pdf/2505.10862
Yazarlar, Åu sonuca varÄąyorlar: GPT-4.1 gibi mevcut modeller, saat okumayÄą esas olarak gÃķrsel desen eÅleÅtirmesi yoluyla ÃķÄreniyor olabileceÄinden, daha derin bir kavram deÄil:
â[GPT 4.1] saat bozulmuÅ veya saat eli deÄiÅtirildiÄinde baÅarÄąsÄąz oluyor. Ortalama Mutlak Hata (MAE) 150 rastgele zamanda 232.48s için ilk saatler, 1380.69s saat Åekli deÄiÅtirildiÄinde ve 3726.93s saat eli deÄiÅtirildiÄinde.
âBu sonuçlar, MLLMânin saati sÃķylemeyi ÃķÄrenmediÄini, ancak desenleri ezberlediÄini gÃķsteriyor.â
Yeterince Zaman
ÃoÄu eÄitim veri seti, belirli saatleri tekrar eden web resimlerine dayanmaktadÄąr, Ãķzellikle de saat reklamlarÄąnda popÞler bir ayar olan 10:10:

Yeni makaledeki âon past tenâ saatinin analog saat resimlerinde yaygÄąnlÄąÄÄąna bir Ãķrnek.
Bu nedenle, model yalnÄązca belirli saat konfigÞrasyonlarÄąnÄąn dar bir aralÄąÄÄąnÄą gÃķrebilir ve bu da gerçek dÞnya gÃķrevlerinde daha geniÅ bir genellemeye ulaÅma yeteneÄini sÄąnÄąrlar.
BozulmuÅ saatleri doÄru Åekilde yorumlayamama nedenleriyle ilgili olarak, makale ÅÃķyle diyor:
âGPT-4.1 standart saat resimlerinde olaÄanÞstÞ bir performans sergiler, ancak saat elini incelterek ve ok ucu ekleyerek performansÄą Ãķnemli ÃķlçÞde dÞÅer.
âİntuitif olarak, daha gÃķrsel olarak karmaÅÄąk bir deÄiÅiklik -distorted dial- daha bÞyÞk bir etkiye sahip olacaÄÄąnÄą dÞÅÞnebilirsiniz, ancak bu deÄiÅiklik nispeten daha kÞçÞk bir etkiye sahip gibi gÃķrÞnÞyor.
âBu, bir soru ortaya koyuyor: MLLMâler saatleri nasÄąl yorumluyor ve neden baÅarÄąsÄąz oluyor? Bir olasÄąlÄąk, MLLMâlerin saat elinin yÃķnÞnÞ algÄąlama yeteneÄini zayÄąflatarak, uzaysal yÃķn duygusunu zayÄąflatÄąyor olabileceÄidir.
âAlternatif olarak, modelin doÄru saat okumalarÄąnÄą birleÅtirmeye çalÄąÅÄąrken baÅka faktÃķrler de karÄąÅÄąklÄąÄa neden olabilir.â
Yazarlar, bu baÅarÄąsÄązlÄąklarÄąn kÃķk nedenini belirlemenin, çok modelli modelleri ilerletmek için kritik olduÄunu savunuyor: eÄer sorun modelin uzaysal yÃķnÞ algÄąlamasÄąndaysa, fine-tuning basit bir çÃķzÞm sunabilir; ancak eÄer problem, birden fazla gÃķrsel ipucunu birleÅtirmede daha temel bir zorluksa, bu sistemlerin bilgi iÅleme Åeklindeki daha temel bir zayÄąflÄąÄa iÅaret eder.
Fine-Tuning Testleri
Modelin baÅarÄąsÄązlÄąklarÄąnÄąn, maruz kalma ile aÅÄąlabileceÄini test etmek için, GPT-4.1 yukarÄąda bahsedilen ve kapsamlÄą sentetik veri setine fine-tune edildi. Fine-tuning olmadan Ãķnce, tahminleri geniŠçapta daÄÄąlmÄąÅtÄą ve tÞm saat tÞrlerinde Ãķnemli hatalar vardÄą. Veri setine fine-tune edildikten sonra, standart saat yÞzlerinde doÄruluk keskin bir Åekilde arttÄą ve daha az ÃķlçÞde deforme edilmiÅ saatlerde.
Ancak, deÄiÅtirilmiÅ elleri olan saatler, ÃķrneÄin daha ince Åekiller veya ok uçlarÄą, hala bÞyÞk hatalar Þretmeye devam etti.
İki ayrÄą baÅarÄąsÄązlÄąk modu ortaya Ã§ÄąktÄą: normal ve deforme saatlerde, model genellikle el yÃķnÞnÞ yanlÄąÅ hesaplÄąyordu; ancak deÄiÅtirilmiÅ el stilleri olan saatlerde, genellikle her elin iÅlevini karÄąÅtÄąrÄąyordu, saat elini dakika eli ile veya dakika elini saniye eli ile karÄąÅtÄąrÄąyordu.

Modelin ilk zayÄąflÄąÄÄąnÄą ve sentetik bir veri setine fine-tune edildikten sonra kÄąsmi kazançlarÄą gÃķsteren bir karÅÄąlaÅtÄąrma, 150 rastgele seçilen saat içinéĒæĩ edilen ve gerçek zaman, saniye cinsinden.
Bu, modelin gÃķrsel Ãķzelliklerle, ÃķrneÄin el kalÄąnlÄąÄÄą, belirli rollerle iliÅkili olduÄunu ve bu ipuçlarÄąnÄąn deÄiÅtiÄinde mÞcadele verdiÄini gÃķsteriyor.
DeÄiÅtirilmiÅ el saatlerinde, modelin performansÄą, standart saatlerdeki doÄruluÄuna ulaÅmadÄą:
To focus on directional errors alone, the analysis was limited to cases where the model correctly identified each handâs function. If the model had internalized a general concept of time-telling, its performance on these examples should have matched its accuracy on standard clocks. It did not, and accuracy remained noticeably worse.
To examine whether hand shape interfered with the modelâs sense of direction, a second experiment was run: two new datasets were created, each containing sixty synthetic clocks with only an hour hand, pointing to a different minute mark. One set used the original hand design, and the other the altered version. The model was asked to name the tick mark that the hand was pointing to.
Results showed a slight drop in accuracy with the modified hands, but not enough to account for the modelâs broader failures. A single unfamiliar visual feature appeared capable of disrupting the modelâs overall interpretation, even in tasks it had previously performed well.

GPT-4.1âin fine-tune olmadan ve sonrasÄąnda standart, deforme ve deÄiÅtirilmiÅ el saatlerindeki performansÄą, dÞzensiz kazançlar ve kalÄącÄą zayÄąflÄąklar gÃķsteriyor.
El İÅaretleri
Bu nedenle, fine-tuning GPT-4.1âin geleneksel analog saatlerdeki performansÄą iyileÅtirdi, ancak deÄiÅtirilmiÅ el saatlerinde çok daha az etkiye sahipti, modelin baÅarÄąsÄązlÄąklarÄąnÄąn, soyut akÄąl yÞrÞtmeden ziyade, hangi elin hangi el olduÄu konusunda karÄąÅÄąklÄąk olabileceÄini ortaya koyuyor.
Modelin âdeÄiÅtirilmiÅ elâ veri setindeki tahminlerini deÄerlendirmek için, Ã§ÄąktÄąlar iki gruba ayrÄąldÄą: GPT-4.1âin saat, dakika ve saniye ellerini doÄru olarak tanÄąmladÄąÄÄą durumlar ve tanÄąmlayamadÄąÄÄą durumlar.
Tahminler, fine-tune olmadan ve sonrasÄąnda Ortalama Mutlak Hata (MAE) için deÄerlendirildi ve standart saatlerle karÅÄąlaÅtÄąrÄąldÄą; ayrÄąca her el için dial konumuna dayalÄą olarak aÃ§Äąsal hata ÃķlçÞldÞ:

DeÄiÅtirilmiÅ el veri setindeki saat eli rolÞ karÄąÅÄąklÄąÄÄą olan ve olmayan saatler için hata karÅÄąlaÅtÄąrmasÄą, fine-tune olmadan ve sonrasÄąnda.
Saat eli rollerini karÄąÅtÄąrmak, en bÞyÞk hatalara yol açtÄą. GPT-4.1 saat elini dakika eli ile veya tersi ile karÄąÅtÄąrdÄąÄÄąnda, oluÅan saat tahminleri genellikle çok uzaktÄą. Buna karÅÄąlÄąk, doÄru tanÄąmlanmÄąÅ bir elin yÃķnÞnÞ yanlÄąÅ hesaplamak, daha kÞçÞk hatalara neden oldu. Ãç el arasÄąnda, saat eli fine-tune olmadan Ãķnce en yÞksek aÃ§Äąsal hatayÄą gÃķsterdi, saniye eli ise en dÞÅÞk aÃ§Äąsal hatayÄą gÃķsterdi.

DeÄiÅtirilmiÅ el veri setindeki el tÞrÞ tarafÄąndan aÃ§Äąsal hata, fine-tune olmadan ve sonrasÄąnda, el rolÞ karÄąÅÄąklÄąÄÄą olan ve olmayan tahminler için.
YalnÄązca yÃķn hatalarÄąnÄą incelemek için, analiz, modelin her elin iÅlevini doÄru olarak tanÄąmladÄąÄÄą durumlara sÄąnÄąrlÄą tutuldu. EÄer model genel bir saat okuma kavramÄąnÄą içselleÅtirmiÅ olsaydÄą, bu Ãķrneklerdeki performansÄą, standart saatlerdeki doÄruluÄuna eÅleÅmeliydi. Ancak Ãķyle olmadÄą ve doÄruluk masih daha kÃķtÞ kaldÄą.
El Åekli modelin yÃķn duygusunu bozuyor mu diye incelemek için, ikinci bir deney yapÄąldÄą: iki yeni veri seti oluÅturuldu, her biri yalnÄązca bir saat eli olan 60 sentetik saat içeriyordu, ve her biri farklÄą bir dakika iÅaretine iÅaret ediyordu. Bir set orijinal el tasarÄąmÄąnÄą, diÄeri deÄiÅtirilmiÅ tasarÄąmÄąnÄą kullandÄą. Model, elin iÅaret ettiÄi dakika iÅaretini sÃķylemesi istendi.
Sonuçlar, deÄiÅtirilmiÅ ellerde biraz doÄruluk dÞÅÞÅÞ gÃķsterdi, ancak modelin daha geniÅ baÅarÄąsÄązlÄąklarÄąnÄą aÃ§Äąklamak için yeterli deÄildi. Bir tek yabancÄą gÃķrsel Ãķzellik, modelin genel yorumunu bozabileceÄini gÃķsterdi, hatta daha Ãķnce iyi performans gÃķsterdiÄi gÃķrevlerde bile.

GPT-4.1âin fine-tune olmadan ve sonrasÄąnda standart, deforme ve deÄiÅtirilmiÅ el saatlerindeki performansÄą, dÞzensiz kazançlar ve kalÄącÄą zayÄąflÄąklar gÃķsteriyor.
Sonuç
Makalenin odaklandÄąÄÄą konu ilk bakÄąÅta Ãķnemsiz gibi gÃķrÞnse de, aslÄąnda Ãķnemli bir soruyu gÞndeme getiriyor: modelleri daha fazla ve daha çeÅitli veri ile doyurmak, insanlarÄąn soyutlama ve genelleme yoluyla kazandÄąÄÄą alan anlama dÞzeyine ulaÅabilir mi; yoksa bu dÞzeyde anlama için, sadece her olasÄą varyasyonu anticip etmek için domaine yeterli Ãķrneklerleflooding etmek gerekli midir?
Her iki yol da, mevcut mimarilerin gerçekten ne ÃķÄrenebileceÄi konusunda ÅÞpheler yaratÄąyor.
Â
İlk olarak 19 MayÄąs 2025 Pazartesi gÞnÞ yayÄąmlandÄą












