Anderson’un AÃ§ÄąsÄą

Yapay ZekanÄąn Analog Saatleri Okuma MÞcadelesi Daha Derin Anlama Sahip Olmayabileceğini GÃķsteriyor

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
ChatGPT-4o and Adobe Firefly.

Çin ve İspanya’dan araştÄąrmacÄąlarÄąn yeni bir makalesi, GPT-4.1 gibi gelişmiş çok modelli yapay zeka modellerinin bile analog saatlerin resimlerinden saatÄą sÃķylemekte zorlandığınÄą ortaya koyuyor. Saatlerde kÞçÞk gÃķrsel değişiklikler bÞyÞk yorumlama hatalarÄąna neden olabiliyor ve fine-tuning sadece tanÄądÄąk Ãķrneklerle yardÄąmcÄą oluyor. Sonuçlar, bu modellerin gerçek dÞnya gÃķrevlerinde karÅŸÄąlaştÄąklarÄą bilinmeyen gÃķrseller karÅŸÄąsÄąnda gÞvenilirliklerine ilişkin endişeler yaratÄąyor.

 

İnsanlar bir alanÄą, Ãķrneğin yerçekimi veya diğer temel fiziksel prensipleri, yeterince derin bir şekilde anladığında, Ãķzel Ãķrneklerin Ãķtesine geçerek altta yatan soyutlamalarÄą kavramaya başlarlar. Bu, o bilgiyi yaratÄącÄą bir şekilde çeşitli bağlamlarda uygulamalarÄąna ve daha Ãķnce hiç gÃķrmedikleri yeni Ãķrnekleri, prensibin eylemde olduğunu tanÄąmlayarak tanÄąmalarÄąna olanak tanÄąr.

Bir alan đáŧ§ Ãķnemli olduğunda, onu var olmadığı yerde bile algÄąlayabiliriz, bu da pareidolia ile ilgilidir ve gerçek bir Ãķrneği tanÄąmamakta başarÄąsÄąz olmanÄąn yÞksek maliyeti tarafÄąndan yÃķnlendirilir. Bu desen tanÄąma mekanizmasÄą o kadar gÞçlÞdÞr ki, aslÄąnda hiçbir desen olmayan yerlerde daha geniş bir desen yelpazesini bulmamÄąza neden olur.

Bir alan ne kadar erken ve tekrarlÄą bir şekilde bize Ãķğretilirse, o alanÄąn temelleri o kadar derine iner ve ÃķmÞr boyu sÞrer; ve çocukluklarÄąnda maruz kaldÄąklarÄą ilk gÃķrsel veri setlerinden biri, saat Ãķğretme saatlerinde basÄąlÄą materyal veya etkileşimli analog saatler kullanÄąlarak saat nasÄąl okunur Ãķğretilmesidir:

ÇocuklarÄąn saat okumayÄą Ãķğrenmesine yardÄąmcÄą olan eğitim materyalleri. Kaynak: https://www.youtube.com/watch?v=IBBQXBhSNUs

ÇocuklarÄąn saat okumayÄą Ãķğrenmesine yardÄąmcÄą olan eğitim materyalleri. Kaynak: https://www.youtube.com/watch?v=IBBQXBhSNUs

İnsanlarÄąn saat tasarÄąmÄą konusundaki değişen modalarÄą bazen bizi zorlayabilir, ancak bu erken alan hakimiyetinin dayanÄąklÄąlığı gerçekten etkileyicidir ve bizi karmaÅŸÄąk veya “eksantrik” tasarÄąm seçimlerine rağmen analog saat yÞzlerini anlamaya olanak tanÄąr:

Saat modasÄąnÄąn bazÄą zorlayÄącÄą yÞzleri. Kaynak: https://www.ablogtowatch.com/wait-a-minute-legibility-is-the-most-important-part-of-watch-design/

Saat modasÄąnÄąn bazÄą zorlayÄącÄą yÞzleri. Kaynak: https://www.ablogtowatch.com/wait-a-minute-legibility-is-the-most-important-part-of-watch-design/

İnsanlarÄąn saatlerin nasÄąl çalÄąÅŸtığınÄą Ãķğrenmek için binlerce Ãķrneğe ihtiyacÄą yoktur; bir kez temel kavram anlaÅŸÄąlÄąrsa,几äđŽ herhangi bir formda tanÄąnabilir, hatta bozulmuş veya soyutlaştÄąrÄąlmÄąÅŸ olsa bile.

Yapay zeka modellerinin bu gÃķrevle karÅŸÄąlaştÄąklarÄą zorluk, daha derin bir sorunu vurgulamaktadÄąr: gÃķrÞnÞrdeki gÞçlerinin, yÞksek hacimli maruz kalma rather neÅū anlama Þzerine dayandığına işaret etmektedir.

İmitasyon Oyununun Ötesinde?

YÞzey dÞzeyindeki performans ile gerçek “anlama” arasÄąndaki gerilim, bÞyÞk modellerin yakÄąn zamanda yapÄąlan araştÄąrmalarÄąnda defalarca ortaya Ã§ÄąkmÄąÅŸtÄąr. Geçen ay Zhejiang Üniversitesi ve Westlake Üniversitesi, bir makale ile soruyu yeniden formÞle etti: PhD dÞzeyindeki LLM’ler gerçekten temel toplama kavramÄąnÄą kavradÄąlar mÄą? (bu makale bu yazÄąda odaklanÄąlan konu değil), ve şu sonuca vardÄą:

‘İki yÃķnlÞ testlerde etkileyici performanslara rağmen, modeller desen eşleştirmeye rather neÅū gerçek anlama bağımlÄą olduklarÄąnÄą gÃķsterdi, sembolik temsildeki başarÄąsÄązlÄąklar ve temel Ãķzelliklerin ihlali ile kanÄątlandÄą.

‘AÃ§Äąk kural sağlama, performansÄą bozuyor gibi gÃķrÞnÞyor, bu da içsel mimari kÄąsÄątlamalarÄą ima ediyor. Bu bilgiler, değerlendirme aÃ§ÄąklarÄąnÄą ortaya koyuyor ve gerçek matematiksel akÄąl yÞrÞtme için desen tanÄąma Ãķtesinde yeteneklere sahip mimarilerin gerekliliğini vurguluyor.’

Bu hafta, soru şimdi Nanjing HavacÄąlÄąk ve Uzay Üniversitesi ve İspanya’daki Universidad PolitÃĐcnica de Madrid arasÄąndaki bir işbirliği ile ortaya Ã§ÄąkÄąyor. Çok Modelli BÞyÞk Dil Modelleri (MLLM’ler) Gerçekten Analog Saatlerde Saati Öğrenmişler mi? adlÄą yeni makale, çok modelli modellerin saat okumayÄą ne kadar iyi anladığına dair bir araştÄąrma içeriyor.

AraştÄąrmanÄąn ilerlemesi sadece genel olarak makalede kapsanmaktadÄąr, ancak araştÄąrmacÄąlarÄąn ilk testleri, OpenAI’nin GPT-4.1 çok modelli dil modelinin, çeşitli saat resimlerinden saati doğru olarak okumakta zorlandığınÄą ortaya koydu, hatta basit durumlarda bile yanlÄąÅŸ cevaplar verdi.

Bu, modelin eğitim verisiäļ­įš„ bir boşluğu işaret ediyor, daha dengeli bir veri seti ihtiyacÄąnÄą ortaya koyuyor, modelin gerçekten altta yatan kavramÄą Ãķğrenip Ãķğrenmediğini test etmek için. DolayÄąsÄąyla yazarlar, her olasÄą saati eşit olarak kapsayan ve internet resimlerinde bulunan ÐūÐąŅ‹Ņ‡åč§lerden kaÃ§Äąnan sentetik bir analog saat veri seti oluşturdular:

AraştÄąrmacÄąlarÄąn sentetik analog saat veri setinden bir Ãķrnek, yeni çalÄąÅŸmada bir GPT modelini fine-tune etmek için kullanÄąldÄą. Kaynak: https://huggingface.co/datasets/migonsa/analog_watches_finetune

AraştÄąrmacÄąlarÄąn sentetik analog saat veri setinden bir Ãķrnek, yeni çalÄąÅŸmada bir GPT modelini fine-tune etmek için kullanÄąldÄą. Kaynak: https://huggingface.co/datasets/migonsa/analog_watches_finetune

Veri setine fine-tune olmadan Ãķnce, GPT-4.1 bu saatleri okumakta tutarlÄą olarak başarÄąsÄąz oldu. Ancak yeni koleksiyona maruz kaldÄąktan sonra performansÄą iyileşti – ancak yalnÄązca yeni gÃķrÞntÞler daha Ãķnce gÃķrdÞklerine benziyordu.

Saat şekli veya el stilinin değiştiğinde, doğruluk keskin bir şekilde dÞştÞ; hatta kÞçÞk değişiklikler, Ãķrneğin daha ince eller veya ok uçlarÄą (sağdaki resim), onu şaÅŸÄąrtmaya yetti; ve GPT-4.1, ayrÄąca ‘eriyen saatler’ gibi Dali-esque saatleri yorumlamakta da zorluk çekti:

Standart tasarÄąm (solda), bozulmuş şekil (orta) ve değiştirilmiş eller (sağda) ile saat resimleri, fine-tune olmadan ve sonrasÄąnda GPT-4.1 tarafÄąndan verilen saatler. Kaynak: https://arxiv.org/pdf/2505.10862

Standart tasarÄąm (solda), bozulmuş şekil (orta) ve değiştirilmiş eller (sağda) ile saat resimleri, fine-tune olmadan ve sonrasÄąnda GPT-4.1 tarafÄąndan verilen saatler. Kaynak: https://arxiv.org/pdf/2505.10862

Yazarlar, şu sonuca varÄąyorlar: GPT-4.1 gibi mevcut modeller, saat okumayÄą esas olarak gÃķrsel desen eşleştirmesi yoluyla Ãķğreniyor olabileceğinden, daha derin bir kavram değil:

‘[GPT 4.1] saat bozulmuş veya saat eli değiştirildiğinde başarÄąsÄąz oluyor. Ortalama Mutlak Hata (MAE) 150 rastgele zamanda 232.48s için ilk saatler, 1380.69s saat şekli değiştirildiğinde ve 3726.93s saat eli değiştirildiğinde.

‘Bu sonuçlar, MLLM’nin saati sÃķylemeyi Ãķğrenmediğini, ancak desenleri ezberlediğini gÃķsteriyor.’

Yeterince Zaman

Çoğu eğitim veri seti, belirli saatleri tekrar eden web resimlerine dayanmaktadÄąr, Ãķzellikle de saat reklamlarÄąnda popÞler bir ayar olan 10:10:

Yeni makaledeki 'on past ten' saatinin analog saat resimlerinde yaygÄąnlığına bir Ãķrnek.

Yeni makaledeki ‘on past ten’ saatinin analog saat resimlerinde yaygÄąnlığına bir Ãķrnek.

Bu nedenle, model yalnÄązca belirli saat konfigÞrasyonlarÄąnÄąn dar bir aralığınÄą gÃķrebilir ve bu da gerçek dÞnya gÃķrevlerinde daha geniş bir genellemeye ulaşma yeteneğini sÄąnÄąrlar.

Bozulmuş saatleri doğru şekilde yorumlayamama nedenleriyle ilgili olarak, makale şÃķyle diyor:

‘GPT-4.1 standart saat resimlerinde olağanÞstÞ bir performans sergiler, ancak saat elini incelterek ve ok ucu ekleyerek performansÄą Ãķnemli ÃķlçÞde dÞşer.

‘İntuitif olarak, daha gÃķrsel olarak karmaÅŸÄąk bir değişiklik -distorted dial- daha bÞyÞk bir etkiye sahip olacağınÄą dÞşÞnebilirsiniz, ancak bu değişiklik nispeten daha kÞçÞk bir etkiye sahip gibi gÃķrÞnÞyor.

‘Bu, bir soru ortaya koyuyor: MLLM’ler saatleri nasÄąl yorumluyor ve neden başarÄąsÄąz oluyor? Bir olasÄąlÄąk, MLLM’lerin saat elinin yÃķnÞnÞ algÄąlama yeteneğini zayÄąflatarak, uzaysal yÃķn duygusunu zayÄąflatÄąyor olabileceğidir.

‘Alternatif olarak, modelin doğru saat okumalarÄąnÄą birleştirmeye çalÄąÅŸÄąrken başka faktÃķrler de karÄąÅŸÄąklığa neden olabilir.’

Yazarlar, bu başarÄąsÄązlÄąklarÄąn kÃķk nedenini belirlemenin, çok modelli modelleri ilerletmek için kritik olduğunu savunuyor: eğer sorun modelin uzaysal yÃķnÞ algÄąlamasÄąndaysa, fine-tuning basit bir çÃķzÞm sunabilir; ancak eğer problem, birden fazla gÃķrsel ipucunu birleştirmede daha temel bir zorluksa, bu sistemlerin bilgi işleme şeklindeki daha temel bir zayÄąflığa işaret eder.

Fine-Tuning Testleri

Modelin başarÄąsÄązlÄąklarÄąnÄąn, maruz kalma ile aÅŸÄąlabileceğini test etmek için, GPT-4.1 yukarÄąda bahsedilen ve kapsamlÄą sentetik veri setine fine-tune edildi. Fine-tuning olmadan Ãķnce, tahminleri geniş çapta dağılmÄąÅŸtÄą ve tÞm saat tÞrlerinde Ãķnemli hatalar vardÄą. Veri setine fine-tune edildikten sonra, standart saat yÞzlerinde doğruluk keskin bir şekilde arttÄą ve daha az ÃķlçÞde deforme edilmiş saatlerde.

Ancak, değiştirilmiş elleri olan saatler, Ãķrneğin daha ince şekiller veya ok uçlarÄą, hala bÞyÞk hatalar Þretmeye devam etti.

İki ayrÄą başarÄąsÄązlÄąk modu ortaya Ã§ÄąktÄą: normal ve deforme saatlerde, model genellikle el yÃķnÞnÞ yanlÄąÅŸ hesaplÄąyordu; ancak değiştirilmiş el stilleri olan saatlerde, genellikle her elin işlevini karÄąÅŸtÄąrÄąyordu, saat elini dakika eli ile veya dakika elini saniye eli ile karÄąÅŸtÄąrÄąyordu.

Modelin ilk zayÄąflığınÄą ve sentetik bir veri setine fine-tune edildikten sonra kÄąsmi kazançlarÄą gÃķsteren bir karÅŸÄąlaştÄąrma, 150 rastgele seçilen saat içinéĒ„æĩ‹ edilen ve gerçek zaman, saniye cinsinden.

Modelin ilk zayÄąflığınÄą ve sentetik bir veri setine fine-tune edildikten sonra kÄąsmi kazançlarÄą gÃķsteren bir karÅŸÄąlaştÄąrma, 150 rastgele seçilen saat içinéĒ„æĩ‹ edilen ve gerçek zaman, saniye cinsinden.

Bu, modelin gÃķrsel Ãķzelliklerle, Ãķrneğin el kalÄąnlığı, belirli rollerle ilişkili olduğunu ve bu ipuçlarÄąnÄąn değiştiğinde mÞcadele verdiğini gÃķsteriyor.

Değiştirilmiş el saatlerinde, modelin performansÄą, standart saatlerdeki doğruluğuna ulaşmadÄą:

To focus on directional errors alone, the analysis was limited to cases where the model correctly identified each hand’s function. If the model had internalized a general concept of time-telling, its performance on these examples should have matched its accuracy on standard clocks. It did not, and accuracy remained noticeably worse.

To examine whether hand shape interfered with the model’s sense of direction, a second experiment was run: two new datasets were created, each containing sixty synthetic clocks with only an hour hand, pointing to a different minute mark. One set used the original hand design, and the other the altered version. The model was asked to name the tick mark that the hand was pointing to.

Results showed a slight drop in accuracy with the modified hands, but not enough to account for the model’s broader failures. A single unfamiliar visual feature appeared capable of disrupting the model’s overall interpretation, even in tasks it had previously performed well.

GPT-4.1’in fine-tune olmadan ve sonrasÄąnda standart, deforme ve değiştirilmiş el saatlerindeki performansÄą, dÞzensiz kazançlar ve kalÄącÄą zayÄąflÄąklar gÃķsteriyor.

GPT-4.1’in fine-tune olmadan ve sonrasÄąnda standart, deforme ve değiştirilmiş el saatlerindeki performansÄą, dÞzensiz kazançlar ve kalÄącÄą zayÄąflÄąklar gÃķsteriyor.

El İşaretleri

Bu nedenle, fine-tuning GPT-4.1’in geleneksel analog saatlerdeki performansÄą iyileştirdi, ancak değiştirilmiş el saatlerinde çok daha az etkiye sahipti, modelin başarÄąsÄązlÄąklarÄąnÄąn, soyut akÄąl yÞrÞtmeden ziyade, hangi elin hangi el olduğu konusunda karÄąÅŸÄąklÄąk olabileceğini ortaya koyuyor.

Modelin ‘değiştirilmiş el’ veri setindeki tahminlerini değerlendirmek için, Ã§ÄąktÄąlar iki gruba ayrÄąldÄą: GPT-4.1’in saat, dakika ve saniye ellerini doğru olarak tanÄąmladığı durumlar ve tanÄąmlayamadığı durumlar.

Tahminler, fine-tune olmadan ve sonrasÄąnda Ortalama Mutlak Hata (MAE) için değerlendirildi ve standart saatlerle karÅŸÄąlaştÄąrÄąldÄą; ayrÄąca her el için dial konumuna dayalÄą olarak aÃ§Äąsal hata ÃķlçÞldÞ:

Değiştirilmiş el veri setindeki saat eli rolÞ karÄąÅŸÄąklığı olan ve olmayan saatler için hata karÅŸÄąlaştÄąrmasÄą, fine-tune olmadan ve sonrasÄąnda.

Değiştirilmiş el veri setindeki saat eli rolÞ karÄąÅŸÄąklığı olan ve olmayan saatler için hata karÅŸÄąlaştÄąrmasÄą, fine-tune olmadan ve sonrasÄąnda.

Saat eli rollerini karÄąÅŸtÄąrmak, en bÞyÞk hatalara yol açtÄą. GPT-4.1 saat elini dakika eli ile veya tersi ile karÄąÅŸtÄąrdığında, oluşan saat tahminleri genellikle çok uzaktÄą. Buna karÅŸÄąlÄąk, doğru tanÄąmlanmÄąÅŸ bir elin yÃķnÞnÞ yanlÄąÅŸ hesaplamak, daha kÞçÞk hatalara neden oldu. Üç el arasÄąnda, saat eli fine-tune olmadan Ãķnce en yÞksek aÃ§Äąsal hatayÄą gÃķsterdi, saniye eli ise en dÞşÞk aÃ§Äąsal hatayÄą gÃķsterdi.

Değiştirilmiş el veri setindeki el tÞrÞ tarafÄąndan aÃ§Äąsal hata, fine-tune olmadan ve sonrasÄąnda, el rolÞ karÄąÅŸÄąklığı olan ve olmayan tahminler için.

Değiştirilmiş el veri setindeki el tÞrÞ tarafÄąndan aÃ§Äąsal hata, fine-tune olmadan ve sonrasÄąnda, el rolÞ karÄąÅŸÄąklığı olan ve olmayan tahminler için.

YalnÄązca yÃķn hatalarÄąnÄą incelemek için, analiz, modelin her elin işlevini doğru olarak tanÄąmladığı durumlara sÄąnÄąrlÄą tutuldu. Eğer model genel bir saat okuma kavramÄąnÄą içselleştirmiş olsaydÄą, bu Ãķrneklerdeki performansÄą, standart saatlerdeki doğruluğuna eşleşmeliydi. Ancak Ãķyle olmadÄą ve doğruluk masih daha kÃķtÞ kaldÄą.

El şekli modelin yÃķn duygusunu bozuyor mu diye incelemek için, ikinci bir deney yapÄąldÄą: iki yeni veri seti oluşturuldu, her biri yalnÄązca bir saat eli olan 60 sentetik saat içeriyordu, ve her biri farklÄą bir dakika işaretine işaret ediyordu. Bir set orijinal el tasarÄąmÄąnÄą, diğeri değiştirilmiş tasarÄąmÄąnÄą kullandÄą. Model, elin işaret ettiği dakika işaretini sÃķylemesi istendi.

Sonuçlar, değiştirilmiş ellerde biraz doğruluk dÞşÞşÞ gÃķsterdi, ancak modelin daha geniş başarÄąsÄązlÄąklarÄąnÄą aÃ§Äąklamak için yeterli değildi. Bir tek yabancÄą gÃķrsel Ãķzellik, modelin genel yorumunu bozabileceğini gÃķsterdi, hatta daha Ãķnce iyi performans gÃķsterdiği gÃķrevlerde bile.

GPT-4.1’in fine-tune olmadan ve sonrasÄąnda standart, deforme ve değiştirilmiş el saatlerindeki performansÄą, dÞzensiz kazançlar ve kalÄącÄą zayÄąflÄąklar gÃķsteriyor.

GPT-4.1’in fine-tune olmadan ve sonrasÄąnda standart, deforme ve değiştirilmiş el saatlerindeki performansÄą, dÞzensiz kazançlar ve kalÄącÄą zayÄąflÄąklar gÃķsteriyor.

Sonuç

Makalenin odaklandığı konu ilk bakÄąÅŸta Ãķnemsiz gibi gÃķrÞnse de, aslÄąnda Ãķnemli bir soruyu gÞndeme getiriyor: modelleri daha fazla ve daha çeşitli veri ile doyurmak, insanlarÄąn soyutlama ve genelleme yoluyla kazandığı alan anlama dÞzeyine ulaşabilir mi; yoksa bu dÞzeyde anlama için, sadece her olasÄą varyasyonu anticip etmek için domaine yeterli Ãķrneklerleflooding etmek gerekli midir?

Her iki yol da, mevcut mimarilerin gerçekten ne Ãķğrenebileceği konusunda şÞpheler yaratÄąyor.

 

İlk olarak 19 MayÄąs 2025 Pazartesi gÞnÞ yayÄąmlandÄą

Makine Ãķğrenimi Þzerine yazar, insan gÃķrÞntÞ sentezi alanÄąnda uzman. Metaphysic.ai'de araştÄąrma içeriği başkanÄą, DNEG'in Brahma.ai'ye dÃķnÞşÞmÞne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: [email protected]