Yapay zeka modelleri ve platformları

Büyük Dil Modellerini Değerlendirme: Teknik Bir Kılavuz

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Büyük dil modelleri (LLM’ler) gibi GPT-4, Claude ve LLaMA, popülerliklerini patlatmışlardır. İnsanların ürettiği metinleri üretebilme yeteneklerine teşekkürler, bu AI sistemleri şimdi içerik oluşturmadan müşteri hizmetleri sohbet botlarına kadar her şey için kullanılıyor.

Ama bu modellerin gerçekten iyi olup olmadığını nasıl bilebiliriz? Yeni LLM’lerin sürekli olarak duyurulduğu ve hepsinin daha büyük ve daha iyi olduğunu iddia ettiği bir ortamda, performanslarını nasıl değerlendirip karşılaştırabiliriz?

Bu kapsamlı kılavuzda, büyük dil modellerini değerlendirmek için en iyi teknikleri keşfedeceğiz. Her yaklaşımın artılarını ve eksilerini inceleyeceğiz, ne zaman uygulandıklarını ve bunları kendi LLM testlerinizde nasıl kullanabileceğinizi göstereceğiz.

Görev-Spesifik Metrikler

Bir LLM’yi değerlendirmenin en doğrudan yollarından biri, standartlaştırılmış metrikler kullanarak kurulmuş NLP görevlerinde test etmektir. Örneğin:

Özetleme

Özetleme görevleri için, ROUGE (Recall-Oriented Understudy for Gisting Evaluation) gibi metrikler genellikle kullanılır. ROUGE, model tarafından üretilen özet ile insan tarafından yazılmış “referans” özetini karşılaştırır ve kelimelerin veya ifadelerin örtüşmesini sayar.

ROUGE’nun birkaç çeşidi vardır, her biri kendi artıları ve eksileri ile:

  • ROUGE-N: n-gramların (N kelime dizilerinin) örtüşmesini karşılaştırır. ROUGE-1 tek kelimeleri, ROUGE-2 iki kelimeli ifadeleri kullanır vb. Avantajı, kelime sırasını yakalar, ancak çok katı olabilir.
  • ROUGE-L: En uzun ortak alt diziye (LCS) dayanır. Kelime sırasına daha esnek, ancak ana noktaları odaklar.
  • ROUGE-W: LCS eşleşmelerini ağırlıklandırır. ROUGE-L’yi geliştirmeye çalışır.

Genel olarak, ROUGE metrikleri hızlı, otomatik ve sistem özetlerini sıralamak için iyi çalışır. Ancak, anlam veya tutarlılığı ölçmez. Bir özet yüksek bir ROUGE puanı alabilir, ancak anlamsız olabilir.

ROUGE-N formülü şudur:

ROUGE-N=∑∈{Reference Summaries}∑∑�∈{Reference Summaries}∑

Nerede:

  • Count_{match}(gram_n) hem oluşturulan hem de referans özetindeki n-gramların sayısını temsil eder.
  • Count(gram_n) referans özetindeki n-gramların sayısını temsil eder.

Örneğin, ROUGE-1 (tek kelimeler) için:

  • Oluşturulan özet: “Kedi oturdu.”
  • Referans özet: “Kedi masanın üzerinde oturdu.”
  • Çakışan tek kelimeler: “Kedi”, “oturdu”
  • ROUGE-1 puanı = 3/5 = 0.6

ROUGE-L en uzun ortak alt diziye (LCS) dayanır. Kelime sırasına daha esnek. Formülü şudur:

ROUGE-L=���(generated,reference)max(length(generated), length(reference))

Where LCS en uzun ortak alt dizinin uzunluğudur.

ROUGE-W LCS eşleşmelerini ağırlıklandırır. Her eşleşmenin LCS’deki önemini dikkate alır.

Çeviri

Makine çevirisi görevleri için, BLEU (Bilingual Evaluation Understudy) popüler bir metriktir. BLEU, modelin çıktı çevirisi ile profesyonel insan çevirileri arasındaki benzerliği, n-gram doğruluğu ve bir kısalık cezası kullanarak ölçer.

BLEU’nun nasıl çalıştığına ilişkin ana noktalar:

  • 1 ila 4 arasında n-gramların (tek kelimeler, iki kelimeli ifadeler, üç kelimeli ifadeler, 4 kelimeli ifadeler) örtüşmesini karşılaştırır.
  • n-gram doğruluğunun geometrik ortalamasını hesaplar.
  • Çeviri referansla karşılaştırıldığında çok kısa ise bir kısalık cezası uygular.
  • Genellikle 0 ile 1 arasında değişir, 1 referansla mükemmel eşleşme anlamına gelir.

BLEU, çevirinin kalitesine ilişkin insan yargıları ile makul bir şekilde ilişkilidir. Ancak sınırlamaları vardır:

  • Sadece referanslara karşı doğruluğu ölçer, geri çağırma veya F1’i ölçmez.
  • Farklı kelimeler kullanarak yaratıcı çevirilerle başa çıkamaz.
  • Çeviri hilelerine karşı duyarlıdır.

Diğer çeviri metrikleri gibi METEOR ve TER, BLEU’nun zayıflıklarını iyileştirmeye çalışır. Ancak genel olarak, otomatik metrikler çevirinin kalitesini tam olarak yakalayamaz.

Diğer Görevler

Özetleme ve çevirinin yanı sıra, F1, doğruluk, MSE ve daha fazlası gibi metrikler, LLM’lerin aşağıdaki görevlerdeki performansını değerlendirmek için kullanılabilir:

  • Metin sınıflandırma
  • Bilgi çıkarma
  • Soru-cevap
  • Duygu analizi
  • Gramatik hata algılama

Görev-spessifik metriklerin avantajı, değerlendirmenin SQuAD gibi standartlaştırılmış veri kümeleri kullanılarak tam olarak otomatikleştirilebilmesidir. Sonuçlar kolayca takip edilebilir.

Ancak bu metrikler dar bir odaklanma sahiptir ve genel dil kalitesini ölçemez. Tek bir görev için iyi performans gösteren LLM’ler, genel olarak mantıklı, tutarlı ve yardımcı metinler oluşturmakta başarısız olabilir.

Araştırma Benchmarks

LLM’leri değerlendirmek için popüler bir yol, çeşitli konuları ve becerileri kapsayan geniş araştırma benchmarklarını kullanmaktır. Bu benchmarklar, modellerin hızlı bir şekilde test edilmesini sağlar.

Bazı nổi bật benchmarklar şunlardır:

  • SuperGLUE – 11 farklı dil görevi.
  • GLUE – 9 cümle anlama görevi. SuperGLUE’den daha basit.
  • MMLU – 57 farklı STEM, sosyal bilimler ve beşeri bilim görevi. Bilgi ve akıl yürütme yeteneğini test eder.
  • Winograd Schema Challenge – Zamir çözme problemleri, ortak akıl yürütme gerektirir.
  • ARC – Zor doğal dil akıl yürütme görevleri.
  • Hellaswag – Ortak akıl yürütme durumları.
  • PIQA – Şemalara dayalı fizik soruları.

Bu gibi benchmarkları kullanarak, araştırmacılar modellerin matematik, mantık, akıl yürütme, kodlama, ortak akıl ve daha fazlasını yapma yeteneklerini hızlı bir şekilde test edebilir. Doğru cevaplanan soru yüzdesi, modelleri karşılaştırmak için bir benchmark metriği haline gelir.

Ancak benchmarkların önemli bir sorunu, egitim verisi kirlenmesidir. Çoğu benchmark, modellerin önceden eğitimi sırasında gördüğü örnekleri içerir. Bu, modellerin belirli soruların cevaplarını “hafızalarına almasına” ve gerçek yeteneklerinden daha iyi performans göstermelerine olanak tanır.

Benchmarkları “temizlemek” için, örtüşen örnekleri kaldırmaya yönelik çabalar vardır. Ancak bu, özellikle modellerin soru varyantlarını veya çevirilerini görmüş olabileceği durumlarda tam olarak yapmak zor olabilir.

Bu nedenle, benchmarklar geniş bir beceri setini verimli bir şekilde test edebilir, ancak gerçek akıl yürütme yeteneklerini güvenilir bir şekilde ölçemez veya eğitim verisi kirlenmesi nedeniyle puan enflasyonunu önleyemez. Tamamlayıcı değerlendirme yöntemleri gereklidir.

LLM Kendi Değerlendirmesi

İlginç bir yaklaşım, bir LLM’nin başka bir LLM’nin çıktısını değerlendirmesidir. Fikir, daha “kolay” bir görev kavramını kullanmaktır:

  • Yüksek kaliteli bir çıktı üretmek bir LLM için zor olabilir.
  • Ancak verilen bir çıktının yüksek kaliteli olup olmadığını belirlemek daha kolay bir görev olabilir.

Örneğin, bir LLMscratch’ten yüksek kaliteli bir paragraf üretmekte zorlanabilir, ancak verilen bir paragrafın mantıklı olup olmadığını ve bağlamına uyup uymadığını daha kolay bir şekilde değerlendirebilir.

Süreç şudur:

  1. Giriş promtunu ilk LLM’ye verin ve çıktı üretin.
  2. Giriş promtunu ve üretilen çıkışı ikinci “değerlendirici” LLM’ye verin.
  3. Değerlendirici LLM’ye, çıkının kalitesini değerlendirmek için bir soru sorun. Örneğin, “Yukarıdaki yanıt mantıklı mı?”

Bu yaklaşım hızlı bir şekilde uygulanabilir ve LLM değerlendirmesini otomatikleştirir. Ancak bazı zorluklar vardır:

  • Performans, değerlendirici LLM’nin seçimine ve prompt sözlerinin seçimine bağlı olarak değişebilir.
  • Asıl görevin zorluğuna bağlıdır. Karmaşık akıl yürütme hala LLM’ler için zordur.
  • API tabanlı LLM’ler kullanıldığında hesaplama açısından pahalı olabilir.

Kendi değerlendirmesi, özellikle RAG (çeviri-artırma üretimi) sistemlerinde alınan bağlamın uygun bir şekilde kullanılıp kullanılmadığını doğrulamak için ümit vericidir. Ek LLM sorguları, alınan bağlamın uygun bir şekilde kullanılıp kullanılmadığını doğrulayabilir.

Genel olarak, kendi değerlendirmesi potansiyel gösterir, ancak dikkatli bir şekilde uygulanması gerekir. İnsan değerlendirmesinin yerini almaz, ancak onu tamamlayıcı olarak kullanır.

İnsan Değerlendirmesi

Otomatik metriklerin ve benchmarkların sınırlamaları dikkate alındığında, insan değerlendirmesi hala LLM kalitesini nghiêm şekilde değerlendirmek için altın standarttır.

Uzmanlar, aşağıdaki konularda ayrıntılı kvalitatif değerlendirmeler sağlayabilir:

  • Doğruluk ve olgu doğruluğu
  • Mantık, akıl yürütme ve ortak akıl
  • Tutarlılık, tutarlılık ve okunabilirlik
  • Ton, stil ve sesin uygunluğu
  • Gramatik ve akıcılık
  • Yaratıcılık ve nüans

Bir modeli değerlendirmek için, insanlara bir dizi giriş promtu ve LLM tarafından üretilen yanıtlar verilir. Yanıtların kalitesini değerlendirirler, genellikle puanlama ölçekleri ve rubrikler kullanarak.

Dezavantajı, manuel insan değerlendirmesinin pahalı, yavaş ve ölçeklendirilmesi zor olmasıdır. Ayrıca, standart kriterlerin geliştirilmesi ve değerlendirmeleri tutarlı bir şekilde uygulamak için eğitilmiş değerlendirmenler gerektirir.

Bazı araştırmacılar, modeller arasındaki yarışmaları değerlendirmek için insan LLM değerlendirmelerini kitle kaynaklı bir şekilde gerçekleştirmek için yaratıcı yollar araştırmışlardır. Ancak kapsama masih sınırlıdır.

Kalite daha önemli olan iş przypadalarında, uzman insan testi, maliyetlerine rağmen, hala altın standarttır. Bu, özellikle LLM’lerin riskli uygulamaları için geçerlidir.

Sonuç

Büyük dil modellerini kapsamlı bir şekilde değerlendirmek için, çeşitli tamamlayıcı yöntemlerin bir araç setini kullanmak gerekir, tek bir tekniğe güvenmek yerine.

Otomatik yaklaşımları hız için insan denetimini doğruluk için birleştirdiğimizde, büyük dil modelleri için güvenilir test yöntemleri geliştirebiliriz. Güçlü bir değerlendirme ile, LLM’lerin potansiyelini responsable bir şekilde yönetirken risklerini yönetebiliriz.

Son beş yıldır Makine Öğrenimi ve Derin Öğrenme dünyasına kendimi adamış bulunuyorum. Tutkum ve uzmanlığım, özellikle AI/ML'ye odaklanarak 50'den fazla çeşitli yazılım mühendisliği projesine katkıda bulunmama yol açtı. Süregelen meraklılığım da beni Doğal Dil İşleme alanına yöneltti, bu alana daha da derinlemesine girmeye hevesliyim.