Anderson’un Açısı

Büyük Dil Modelleri Onları Test Etmek İçin Kullanılan Veri Setlerini Hafızalarına Alıyorlar

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
'Robot cheating in an exam' - ChatGPT-4o and Adobe Firefly

Eğer AI’ı izlemek, okumak veya satın almak için önerilere güveniyorsanız, yeni bir araştırmaya göre bazı sistemler bu sonuçları yetenek yerine hafızadan alıyordur: önerilerde bulunmak için öğrenmek yerine, modeller genellikle onları değerlendirmek için kullanılan veri setlerindeki öğeleri geri çağırır, bu da performansı abartılmış ve kullanıcıya göre eskimiş veya kötü eşleşen önerilere yol açar.

 

Makine öğreniminde, bir test bölme kullanılarak, eğitilen bir modelin benzer ancak aynı olmayan sorunları çözdüğünü görmek için kullanılır.

Örneğin, yeni bir AI ‘köpek ırkı tanıma’ modeli 100.000 köpek resmi veri setine eğitilmişse, genellikle 80/20 bölünme özelliğine sahiptir – 80.000 resim modeli eğitmek için sağlanır ve 20.000 resim geri çekilir ve test edilen model için malzeme olarak kullanılır.

Açıkça söylemek gerekirse, eğer AI’ın eğitim verisi kazara ‘gizli’ %20’lik test bölmesini içeriyorsa, model bu testleri geçer, çünkü zaten cevapları biliyor (100% alan verilerini görmüştür). Tabii ki, bu, modelin daha sonra, yeni ‘canlı’ verilerde, üretim ortamında nasıl performans göstereceğini doğru bir şekilde yansıtmaz.

Sinema Spoilerleri

AI’ın sınavlarında hile yapma sorunu, modellerin kendilerinin ölçeğiyle birlikte büyümüştür. Bugünlerin sistemleri, Common Crawl gibi devasa, ayrımsız web-scraped corpora üzerine eğitildiğinden, benchmark veri setlerinin (yani, geri çekilen %20’lik bölümün) eğitim karışıma girmesi olasılığı artık bir kenar durumu değil, varsayılan bir durum – veri kirlenmesi olarak bilinen bir sendrom; ve bu ölçekte, bu tür hataları yakalayabilecek manuel kürasyon mantıksal olarak imkansızdır.

Bu durum, İtalya’nın Politecnico di Bari’nden bir yeni makalede incelenmektedir, burada araştırmacılar, bir film öneri veri seti olan MovieLens-1M‘in aşırı rolüne odaklanırlar ve bu veri setinin birkaç önde gelen AI modeli tarafından eğitilirken kısmen hafızaya alındığını savunurlar.

Çünkü bu özel veri seti, öneri sistemlerinin test edilmesinde çok yaygın olarak kullanılır, modellerin hafızasında bulunması, bu testleri anlamsız kılabilir: görünüşte zeka olabilecek şey aslında basit bir geri çağırma olabilir ve sezgisel bir öneri becerisi aslında daha önce maruz kalınan istatistiksel bir yankı olabilir.

Yazarlar şöyle diyor:

‘Buluntularımız, LLM’lerin MovieLens-1M veri seti hakkında kapsamlı bilgiye sahip olduğunu gösteriyor, öğeleri, kullanıcı özniteliklerini ve etkileşim geçmişlerini kapsıyor.

‘Önemli olarak, basit bir.prompt, GPT-4o’nun veri setindeki çoğu film adını geri çağırmak için yeterli.

The brief new paper is titled Do LLMs Memorize Recommendation Datasets? A Preliminary Study on MovieLens-1M, and comes from six Politecnico researchers. The pipeline to reproduce their work has been made available at GitHub.

Yöntem

Sorulan modellerin gerçekten öğrenip öğrenmediğini veya sadece geri çağırıp çağırmadığını anlamak için araştırmacılar, bu bağlamda hafızanın ne anlama geldiğini tanımlamaya başladılar ve bir modelin, uygun şekilde yönlendirildiğinde, MovieLens-1M veri setinden belirli bilgi parçalarını geri çağırabileceğini test ederek başladılar.

Eğer bir model bir film kimlik numarasını gördüğünde ve film adı ile türünü üretebiliyorsa, bu bir öğeyi hafızaya alma olarak kabul edildi; eğer bir kullanıcı kimliğinden kullanıcı ayrıntıları (örneğin, yaş, meslek, posta kodu) üretebiliyorsa, bu da kullanıcı hafızası olarak kabul edildi; ve eğer bir kullanıcının daha önceki bir dizi değerlendirmeye dayalı olarak bir sonraki film değerlendirmesini üretebiliyorsa, bu da modelin özel etkileşim verilerini geri çağırıyor olabileceği anlamına geliyordu:

Her biri, modeli yönlendirmeden yeni bilgi vermeden teşvik eden özenle hazırlanmış promt’lar kullanılarak test edildi:

Zero-shot prompting for the evaluation protocol used in the new paper. Source: https://arxiv.org/pdf/2505.10212

Zero-shot prompting for the evaluation protocol used in the new paper. Source: https://arxiv.org/pdf/2505.10212

Veri ve Testler

Uygun bir veri seti oluşturmak için, yazarlar, alanın iki büyük konferansından recent makaleleri incelediler: ACM RecSys 2024 ve ACM SIGIR 2024. MovieLens-1M, yaklaşık beşte bir sunumda atıfta bulunulan en sık kullanılan veri setiydi. Daha önceki çalışmalar benzer sonuçlara ulaştığından, bu beklenmedik bir sonuç değildi, ancak veri setinin baskınlığının bir teyidiydi.

MovieLens-1M üç dosyadan oluşur: Filmler.dat, filmleri kimlik, ad ve tür olarak listeler; Kullanıcılar.dat, kullanıcı kimliklerini temel biyografik alanlara eşler; ve Değerlendirmeler.dat, kimin neyi, ne zaman değerlendirdiğini kaydeder.

Bu verilerin büyük dil modelleri tarafından hafızaya alındığını öğrenmek için, araştırmacılar önce makale Large Language Modellerden Eğitim Verilerini Çıkarmak ve daha sonra sonraki çalışmada Dil Modellerinden Eğitim Verisi Çıkarma için Hileler tanıtılan yöntemlere başvurdu.

Yöntem doğrudan: Veri seti formatını yansıtan bir soru sor ve modelin doğru cevaplayıp cevaplayamadığını gör.

Zero-shot, Chain-of-Thought ve few-shot prompting test edildi ve sonuncusunun, modelin birkaç örneğe gösterildiği durumda, en etkili yöntem olduğu bulundu; daha karmaşık yaklaşımlar daha yüksek geri çağırma oranları verebilir, ancak bu, neyi hatırladığını ortaya çıkarmak için yeterli kabul edildi.

Few-shot prompt used to test whether a model can reproduce specific MovieLens-1M values when queried with minimal context.

Few-shot prompt used to test whether a model can reproduce specific MovieLens-1M values when queried with minimal context.

Modellerin her biri, GPT-4o; GPT-4o mini; GPT-3.5 turbo; Llama-3.3 70B; Llama-3.2 3B; Llama-3.2 1B; Llama-3.1 405B; Llama-3.1 70B; ve Llama-3.1 8B idi. Tümünün sıcaklığı sıfıra ayarlandı, top_p bir olarak ayarlandı ve hem sıklık hem de varlık cezaları devre dışı bırakıldı. Sabit bir rastgele tohum çıktı tutarlılığını sağladı.

Proportion of MovieLens-1M entries retrieved from movies.dat, users.dat, and ratings.dat, with models grouped by version and sorted by parameter count.

Proportion of MovieLens-1M entries retrieved from movies.dat, users.dat, and ratings.dat, with models grouped by version and sorted by parameter count.

Modellerin her biri, veri setinin üç dosyasından (Filmler.dat, Kullanıcılar.dat ve Değerlendirmeler.dat) tam girişleri için yönlendirildi.

İlk testlerin sonuçları, yukarıda gösterilen, GPT ve Llama aileleri arasında ve ayrıca model boyutları arasında keskin farklılıkları ortaya koyuyor. GPT-4o ve GPT-3.5 turbo, veri setinin büyük kısımlarını kolayca geri çağırırken, çoğu açık kaynaklı model sadece aynı materyalin bir kısmını geri çağırıyor, bu da bu benchmark’ın eğitimde düzensiz bir şekilde maruz kalındığını gösteriyor.

Bu, küçük marjlar değil. Tüm üç dosyada, en güçlü modeller sadece daha zayıf olanları geride bırakmakla kalmadı, aynı zamanda tamamen MovieLens-1M’in bölümlerini geri çağırdılar.

GPT-4o’nun kapsamı, veri setinin önemli bir kısmının doğrudan hafızaya alındığını öne sürmeye yetti.

Yazarlar şöyle diyor:

‘Buluntularımız, LLM’lerin MovieLens-1M veri seti hakkında kapsamlı bilgiye sahip olduğunu gösteriyor, öğeleri, kullanıcı özniteliklerini ve etkileşim geçmişlerini kapsıyor.

‘Önemli olarak, basit bir.prompt, GPT-4o’nun veri setindeki çoğu film adını geri çağırmak için yeterli.

Sonraki test, modellerin öneri görevlerindeki performansını ölçmek için her modeli bir öneri sistemi olarak yönlendirdi. Performansı ölçmek için, çıktıyı yedi standart yöntemle karşılaştırdılar: UserKNN; ItemKNN; BPRMF; EASER; LightGCN; MostPop; ve Random.

MovieLens-1M veri seti, leave-one-out örneklem stratejisi kullanılarak 80/20 olarak eğitim ve test kümelerine bölündü. Kullanılan metrikler Hit Rate (HR@[n]); ve nDCG(@[n]) idi:

Recommendation accuracy on standard baselines and LLM-based methods. Models are grouped by family and ordered by parameter count. Bold values indicate the highest score within each group.

Recommendation accuracy on standard baselines and LLM-based methods. Models are grouped by family and ordered by parameter count, with bold values indicating the highest score within each group.

Burada, birkaç büyük dil modeli, tüm metriklerde geleneksel benchmark’ları aştı, GPT-4o her sütunda geniş bir önde bulundu ve hatta orta büyüklükteki modeller gibi GPT-3.5 turbo ve Llama-3.1 405B, BPRMF ve LightGCN gibi benchmark yöntemlerini sürekli olarak geride bıraktı.

Küçük Llama varyantları arasında performans keskin bir şekilde değişti, ancak Llama-3.2 3B, grubunda en yüksek HR@1 ile dikkat çekti.

Araştırmacılara göre, sonuçlar, hafızaya alınan verilerin, özellikle en güçlü modellerde, öneri tarzı yönlendirmede ölçülebilir avantajlara dönüşebileceğini gösteriyor.

Araştırmacılar ayrıca şöyle diyor:

‘Görünüşte mükemmel olan öneri performansı, Tablo 2 ile Tablo 1’i karşılaştırdığında ilginç bir modèle ortaya koyuyor. Her grupta, daha yüksek hafızaya alma oranına sahip model, öneri görevinde daha iyi performans gösteriyor.

‘Örneğin, GPT-4o, GPT-4o mini’yi geride bırakıyor ve Llama-3.1 405B, Llama-3.1 70B ve 8B’yi geride bırakıyor.

‘Bu sonuçlar, LLM’lerin eğitim veri setlerinde sızıntıya uğradığı veri setlerinde değerlendirilmesinin, genellemeye değil hafızaya dayalı olarak abartılı performanslara yol açabileceğini vurguluyor.’

Model ölçeklerinin bu sorun üzerindeki etkisine ilişkin olarak, yazarlar, model boyutu, hafızaya alma ve öneri performansı arasında net bir korelasyon gözlemlediler, daha büyük modellerin sadece daha fazla MovieLens-1M veri setini saklamakla kalmayıp, aynı zamanda aşağı akış görevlerinde daha güçlü performans gösterdiğini belirttiler.

Örneğin, Llama-3.1 405B, ortalama %12,9’luk bir hafızaya alma oranına sahipti, जबकi Llama-3.1 8B sadece %5,82’lik bir oranla geri çağırdı. Bu, geri çağırma oranındaki yaklaşık %55’lik azalma, nDCG’de %54,23’lük ve HR’de %47,36’lık bir düşüşe karşılık geldi.

Desen, her yerde devam etti – hafızaya alma azaldıkça, görünüşte performans da azaldı:

‘Bu bulgular, model ölçeğinin artmasının, veri setinin daha fazla hafızaya alınmasına yol açtığını ve öneri performansını iyileştirdiğini gösteriyor.

‘Dolayısıyla, daha büyük modeller daha iyi öneri performansına sahipken, aynı zamanda eğitim verilerinin potansiyel sızıntılarına ilişkin riskleri de taşıyorlar.’

Son test, hafızaya almanın, MovieLens-1M’de bulunan popülerlik yanlılığını yansıtıp yansıtmadığını incelemeyi amaçladı. Öğeler, etkileşim sıklığına göre gruplandırıldı ve aşağıdaki grafik, daha büyük modellerin tutarlı bir şekilde en popüler girişleri tercih ettiğini gösteriyor:

Item coverage by model across three popularity tiers: top 20% most popular; middle 20% moderately popular; and the bottom 20% least interacted items.

Item coverage by model across three popularity tiers: top 20% most popular; middle 20% moderately popular; and the bottom 20% least interacted items.

GPT-4o, en üst sıradaki öğelerin %89,06’sını geri çağırdı, ancak en az popüler olanların sadece %63,97’sini geri çağırdı. GPT-4o mini ve daha küçük Llama modelleri, tüm bantlar boyunca çok daha düşük bir kapsama sahipti. Araştırmacılara göre, bu eğilim, hafızaya almanın sadece model boyutuyla birlikte artmadığını, aynı zamanda eğitim verisindeki önceden var olan dengesizlikleri de güçlendirdiğini gösteriyor.

Araştırmacılar şöyle diyor:

‘Buluntularımız, LLM’lerde belirgin bir popülerlik yanlılığı olduğunu ortaya koyuyor, en üstteki %20’lik popüler öğelerin, en alttaki %20’lik öğelere göre önemli ölçüde daha kolay geri çağrılabilir olduğunu gösteriyor.

‘Bu eğilim, eğitim veri dağıtımının etkisini vurguluyor, popüler filmlerin aşırı temsil edildiği ve modeller tarafından orantısız bir şekilde hafızaya alındığı anlamına geliyor.’

Sonuç

İkilem artık yeni değil: eğitim setleri büyüdükçe, onları küratasyon olasılığı ters orantılı olarak azalır. MovieLens-1M, muhtemelen diğer birçok veri seti gibi, bu büyük corpora’ya gözetimsiz bir şekilde girer, devasa veri hacmi arasında anonimdir.

Sorun her ölçekte tekrarlanır ve otomasyona karşı direnir. Herhangi bir çözüm, yalnızca çaba değil, aynı zamanda insan yargısı gerektirir – makinelerin sağlayamayacağı yavaş, hatalı tür.

 

* Bu bağlamda bir kapsama metriği, bir dil modelinin, uygun bir soru sorulduğunda, orijinal veri setinin ne kadarını yeniden üretebileceğini gösteren bir yüzdur. Eğer bir model, bir film kimliğiyle yönlendirildiğinde ve doğru film adı ve türünü üretebiliyorsa, bu, başarılı bir geri çağırma olarak kabul edilir. Başarılı geri çağırma sayısı, veri setindeki toplam girişlerin sayısına bölünerek bir kapsama puanı üretilir. Örneğin, bir model, 1000 öğeden 800’ini doğru bir şekilde geri çağırabiliyorsa, kapsama oranı %80’dir.

İlk olarak 16 Mayıs 2025 Cuma günü yayınlandı

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai