Anderson’un Açısı

Sistem İstemi İçindeki Gizli Tarihler, Dil Modeli Değerlendirmesini Zayıflatıyor

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
Harold Lloyd hangs from a clock face in Safety Last! (1923). The film is in the US public domain.. Source: https://www.youtube.com/watch?v=tzh4htLXp6Q

Büyük Dil Modellerini (LLM’leri) ölçütleme yeteneği olmadan, tüketicilerin ve işletmelerin bir modelin son sürümlerindeki ilerlemesini ve rakiplerine karşı nasıl konumlandığını anlaması zorlaşır:

Arena.ai üzerindeki etkili LLM liderlik tablosu. Kaynak: https://arena.ai/leaderboard/chat/text

Arena.ai üzerindeki etkili LLM liderlik tablosu. Kaynak

LLM’ler deterministik değildir (yani aynı girdilere rağmen her zaman tutarlı çıktılar üretmezler), bunları değerlendirmek zordur. Araştırmacılar aynı istemleri, model ayarlarını ve ölçüt veri setlerini kullansalar bile, yürütme ortamındaki görünüşte önemsiz farklar farklı yanıtlar üretebilir ve performans puanlarını önemli ölçüde değiştirebilir.

Donanım yapılandırması, sayısal hassasiyet, çıkarım toplu iş boyutu ve hatta çoktan seçmeli cevapların sıralaması gibi faktörler sonuçları etkileyebilir. Bu durum, bildirilen bir iyileştirmenin gerçek bir ilerlemeyi mi yoksa sadece modelin test edildiği koşullardaki yarı rastgele bir değişikliği mi yansıttığını görmekte zorlaştırabilir.

Belirli bir ölçüde, bu değişkenlerin bir kısmını hesaba katmak ya da en azından oluşturdukları hata payını belirlemek mümkündür; böylece karşılaştırmalı değerlendirme anlamlı hâle gelir. Bu çabayı göstermek önemlidir, çünkü çok para ve çok itibar, bu tür AI sistemlerini belirli bir doğrulukla ölçütlemeye bağlıdır.

Ancak yeni araştırmalara göre, belirli bir değişken yalnızca ölçütleri bozmakla kalmaz, aynı zamanda onları tanımlayan istemlerden de çok zor bir şekilde çıkarılamaz – bugünün tarihi.

Zamanlar Değişir

Yeni makale*, Almanya, Meksika ve ABD arasında bir akademik iş birliği, mevcut tarihin tüm öncü ve birçok dağıtımda açık ağırlıklı modeller sistem istemine otomatik ve gizli bir şekilde dahil edildiği gerçeğinin, tekrarlanabilirliğin neredeyse imkânsız olabileceğini iddia ediyor:

‘LLM değerlendirmesinde kritik ve sıkça göz ardı edilen bir deterministik olmayan kaynağı tespit ediyoruz: mevcut tarihin sistem istemlerine gizli olarak eklenmesi.’

‘9 model, 6 veri seti ve dört görevde, bu dinamik meta veri model performansını değiştirir ve liderlik tablosu sıralamalarını yeniden düzenler; toplu iş boyutu veya sayısal hassasiyet gibi diğer sistem düzeyi faktörlerin yarattığı varyansı aşar.’

Araştırmacılar ayrıca, tespit edilen etkinin, yanıt üretilmesi gereken görevlerde daha büyük olduğunu, performansın çoktan seçmeli sorularda %6’ya, matematiksel akıl yürütmede %14’e ve kod üretiminde %7’ye kadar değiştiğini ve makine çevirisi puanlarının da önemli ölçüde değiştiğini belirtiyor.

Örnek cevaplar sağlamak ve adım adım akıl yürütmeyi teşvik etmek sorunu çözmedi – aksine, ikincisi durumu daha kötü hâle getirdi:

2024'te farklı tarihlerde Llama 3.1 (8B) modelinin MMLU ölçütünde doğruluk dalgalanmaları. Adım adım akıl yürütme (kırmızı), doğrudan cevaplardan (mavi) çok daha büyük bir değişkenlik üretir; bu, zincirleme düşünce isteminin tarihe duyarlılığı nasıl artırdığını gösterir. Kaynak - https://arxiv.org/pdf/2609.36931

2024’te farklı tarihlerde Llama 3.1 (8B) modelinin MMLU ölçütünde doğruluk dalgalanmaları. Adım adım akıl yürütme (kırmızı), doğrudan cevaplardan (mavi) çok daha büyük bir değişkenlik üretir; bu, zincirleme düşünce isteminin tarihe duyarlılığı nasıl artırdığını gösterir. Kaynak

Bu etki, tescilli modellerde de tespit edildi; GPT-5.1, Aralık 2025’te bir hafta süren testlerde üç çoktan seçmeli ölçütte %4’e kadar doğruluk dalgalanmaları gösterdi. Araştırmacılar boş bir sistem istemi kullandı, akıl yürütmeyi devre dışı bıraktı ve rastgelelik değerini sıfıra ayarladı – ancak tarih yine de sağlayıcı tarafından otomatik olarak eklendi:

GPT-5.1'in doğruluğu, Aralık 2025'te yedi ardışık gün boyunca, aynı kullanıcı istemleri ve model ayarlarına rağmen dalgalandı. En büyük varyasyon GPQA (turuncu) üzerinde gerçekleşti ve en iyi ve en kötü günler arasında dört yüzde puan farkına ulaştı. Kesikli çizgi, her ölçütün haftalık ortalama doğruluğunu temsil eder.

GPT-5.1’in doğruluğu, Aralık 2025’te yedi ardışık gün boyunca, aynı kullanıcı istemleri ve model ayarlarına rağmen dalgalandı. En büyük varyasyon GPQA (turuncu) üzerinde gerçekleşti ve en iyi ve en kötü günler arasında dört yüzde puan farkına ulaştı. Kesikli çizgi, her ölçütün haftalık ortalama doğruluğunu temsil eder.

Araştırmacılar, mümkün olduğunca sistem istemlerinden tarihi kaldırmayı ya da düzeltip belgelemeyi öneriyor, böylece adil karşılaştırmalar sağlanabilir. Ancak, tarih odaklı etkinin daha derinlemesine yerleşmiş olabileceğini belirtiyorlar:

‘Tarih duyarlılığının olası bir nedeni, sistem isteminin denetimli ince ayar (SFT) ve insan geri bildirimiyle pekiştirmeli öğrenme (RLHF) sırasında sabitlenmiş olabileceği, bu da modelin küçük bir değişikliğe karşı kırılgan hale gelmesine yol açmasıdır.’

Bu sorunu araştırmak için araştırmacılar sistem istemi için altı farklı ifadeyi denediler ve bu değişikliklerin doğruluğu, tarihi değiştirmek kadar etkilediğini (%0.78) buldular. Bu nedenle tarih, kasıtlı prompt mühendisliği kadar etkili görünüyor – ancak otomatik olarak değişiyor, kullanıcı bunu bile bilmeden.

‘Mevcut tarih’ sorununu hafifletmek için başka yaklaşımlar denendi, bunlar arasında az örnekli öğrenme (modelin yanıt vermeden önce beş örnek cevap alması) yer alıyordu. Bu biraz yardımcı oldu, ortalama varyasyonu %2.52’den %2.27’ye düşürdü, ancak sorunu çözmedi.

GPU donanımı, batch boyutu, sayısal hassasiyet, yanıt sırası ve sistem istemi ifadesindeki değişiklikler de test edildi. En büyük etkiler yanıt sırası ve istem ifadesinde görüldü; bu etkiler tarihin değiştirilmesiyle en yakın etkiye sahipti.

Son Günler

Bir LLM/VLM’nin sohbetin başından itibaren tarihi anlayacağını varsaymak mantıklıdır; ancak, LLM’nin kullanıcıya erişilemeyen şekillerde davranışlarını koşullandıran (görünmeyen rubrik) koruma önlemlerii sistem istemine yerleştirmek için açık bir neden yoktur, çünkü LLM rutin olarak bir alt‑Kb RAG çağrısı yaparak en son tarihi alabilir; bu, kullanıcıyla etkileşime geçmeden önce küçük bir bakım rutini olarak yapılabilir.

Bu konuyu çözmek için başka olasılıkların olduğu şüphesiz; ancak, mevcut tarihin sistem istemine eklenmesi daha önce bir sorun olarak görülmediği için, muhtemelen bu konuda çok az ya da hiç araştırma yapılmamıştır.

Çevrimiçi Flört

Testler için her modelde aynı istemler kullanıldı, sadece sistem istemindeki tarih değiştirildi. 2024 yılının her günü test edildi, 1 Ocak’tan 31 Aralık’a kadar, diğer tüm ayarlar aynı tutuldu.

Altı ölçüt kullanıldı: MMLU; GPQA; ve ARC-Challenge, çoktan seçmeli sorular için (yanıt‑token olasılığına göre puanlanır). GSM8K adım adım matematik için (son yanıt kontrol edilir); HumanEval Python kod üretimi için (birim testleri yapılır); ve WMT İngilizce‑Almanca; İngilizce‑Fince; ve İngilizce‑Çekçe çevirileri için (tam çıktı değerlendirilir). Zaman bağımlı sorular dışarıda bırakıldı.

Dokuz model test edildi: Llama 3.1 Instruct (8B ve 70B); Gemma 3 Instruct (4B ve 27B); Qwen3 (4B); Qwen3-Next (80B); Phi-4 (14B); ve GPT-OSS (20B ve 120B).

Doğruluk (doğru yanıtlanan soruların yüzdesi), çoktan seçmeli ve matematik testlerini puanlamak için kullanıldı, Beklenen Kalibrasyon Hatası (ECE) ise modellerin güveninin gerçek performanslarıyla ne kadar eşleştiğini ölçtü.

Kod, pass@1 (ilk denemede tüm testleri geçen üretilen kod çözümlerinin yüzdesi) ile kontrol edildi; çeviriler ise BLEU ve chrF ile puanlandı.

Sonuçlar, araştırmacıların hipotezini doğruladı: sistem istemindeki tarihi basitçe değiştirmek, modellerin aynı soruları ne kadar doğru yanıtladığını değiştirdi.

2024 boyunca sistem‑istem tarihinin değiştirilmesiyle MMLU üzerinde beş önde gelen modelin performansını gösteren test sonuçları. Doğruluk üstte, beklenen kalibrasyon hatası (ECE) ise altta gösterilmiştir. Beş model de test koşullarında başka bir değişiklik yapılmadığı halde her iki ölçütte dalgalanmalar gösterdi. Daha düşük ECE puanları, güven ile doğruluk arasındaki uyumun daha iyi olduğunu gösterir.

2024 boyunca sistem‑istem tarihinin değiştirilmesiyle MMLU üzerinde beş önde gelen modelin performansını gösteren test sonuçları. Doğruluk üstte, beklenen kalibrasyon hatası (ECE) ise altta gösterilmiştir. Beş model de test koşullarında başka bir değişiklik yapılmadığı halde her iki ölçütte dalgalanmalar gösterdi. Daha düşük ECE puanları, güven ile doğruluk arasındaki uyumun daha iyi olduğunu gösterir.

Makalenin daha önce gösterilen diğer sonuçlarla birlikte, bu durum LLM kıyaslamaları için potansiyel olarak kötü haber anlamına geliyor; çünkü bir model, test edildiği güne bağlı olarak daha iyi ya da daha kötü puan alabilir ve bu da gerçek bir yetenek artışı ya da düşüşü olmadan liderlik tablosundaki konumunu değiştirebilir.

Sonuç

Bu sorun, 2023 civarına kadar alışık olduğumuz deterministik bilgisayar sistemleri ile o zamandan beri evrimleşen ve evrimleşmeye devam eden difüzyon tabanlı ve benzeri yapay zeka sistemlerinin çok farklı doğası arasındaki ayrımı vurgulamaktadır.

Tarih çözünürlüğü temelde 1 Ocak 1970’de çözüldü, ancak görünüşe göre kesim tarihleri ve diğer zamanla ilgili kaygılar biçiminde bilgisayar dünyasını rahatsız etmeye geri dönmüş.

 

* Başlıklı ‘Modeli Tarihlendirmek: Sistem İstemlerindeki Gizli Tarihler LLM Değerlendirmesini Etkiliyor’

İlk yayınlanma tarihi Cuma, 9 Ekim 2026

Makine öğrenimi üzerine yazar, insan görüntüsü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başıydı, DNEG'in Brahma.ai'ye çözülene kadar.
Web Sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai