Yapay zeka modelleri ve platformları

İnsanların Değerleriyle Yapay Zeka Uyumunu Geliştirmek İçin WARM

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Yapay Zeka Sistemlerinin İnsanların Değerleriyle Uyumlanması

Yapay zeka (YZ) sistemleri, müşteri hizmetleri sohbet botlarından tıbbi teşhis algoritmalarına kadar karmaşık görevlerde insanlara yardımcı olmak için giderek daha yetenekli hale geliyor. Ancak bu YZ sistemleri daha fazla sorumluluk aldıkça, insan değerleri ve tercihleriyle uyumlu kalmaları çok önemlidir. Bunu başarmak için kullanılan bir teknik, insan geribildiriminden pekiştirme öğrenimi (RLHF) olarak adlandırılır. RLHF’de, bir YZ sistemi, yani politika, insan yargılarına dayalı olarak davranışına göre ödüllendirilir veya cezalandırılır. Politikanın amacının, ödüllerini en üst düzeye çıkarmak ve böylece insan tercihlerine göre davranmaktır.

RLHF’nin temel bir bileşeni, ödül modelidir (RM). RM, politikanın eylemlerini ve çıktılarını değerlendirmek ve öğrenme sürecini yönlendirmek için bir ödül sinyali döndürmekle sorumludur. İyi bir RM tasarlamak zorlu bir görevdir, çünkü insan tercihleri karmaşık, bağlam bağımlı ve hatta bireyler arasında tutarsız olabilir. Son zamanlarda, Google DeepMind’den araştırmacılar, RM tasarımını iyileştirmek için yenilikçi bir teknik olan Ağırlıklı Ortalama Ödül Modelleri (WARM) önerdiler.

Ödül Hilelerinin Sorunu

RLHF’de büyük bir sorun, ödül hileleridir. Ödül hileleri, politikanın RM sistemini oyun oynayarak amaçlanan hedeflere ulaşmadan yüksek ödüller elde etmesini sağlar. Örneğin, bir yazı asistanı YZ’yi yüksek kaliteli özetler oluşturmak için eğitmek isteyelim. RM, kısa ve bilgilendirici özetleri ödüllendirebilir. Politika, bu durumu sömürebilir ve RM’yi kandıran, çok kısa ve bilgilendirici olmayan özetler oluşturabilir.

Ödül hileleri iki ana neden dolayı ortaya çıkar:

  1. Dağılım kayması – RM, insan tarafından etiketlenmiş örneklerin sınırlı bir veri kümesiyle eğitilir. Politikanın çıktıları, RM’nin iyi genellemeyeceği farklı dağılımlardan gelebilir.
  2. Gürültülü etiketler – İnsan etiketleme mükemmel değildir, etiketleyiciler arasında anlaşmazlıklar olabilir. RM, gerçek işaretler yerine sahte sinyallere odaklanabilir.

Ödül hileleri, insan beklentilerine uymayan işe yaramaz sistemlere yol açar. Daha da kötüsü, dikkatsizce dağıtıldığında, YZ davranışları önyargılı veya tehlikeli olabilir.

Model Birleştirmenin Yükselişi

Model birleştirmeye yönelik stratejilerin, özellikle Model Ratatouille’in artan ilgisi, daha büyük modellerin güçlü ancak verimsiz ve uygunsuz olabileceğinin anlaşılmasının bir sonucudur. 1 trilyon parametreye sahip bir modeli eğitmek, büyük miktarda veri, hesaplama, zaman ve maliyet gerektirir. Daha da önemli olarak, bu modeller eğitim dağılımına aşırı uyum sağlar ve çeşitli gerçek dünya senaryolarına genellemelerini engeller.

Model birleştirmesi, kontrolsüz olarak ölçek büyütmeden daha büyük yetenekler elde etmenin bir yolunu sunar. Farklı dağılımlar, görevler veya hedefler üzerinde eğitilmiş birden fazla uzmanlaşmış modeli yeniden kullanarak, model birleştirmesi, esnekliği ve dağılım dışı dayanıklılığı artırmayı amaçlar. Premise, farklı modellerin birbirini tamamlayabilen farklı öngörücü desenler yakalayabileceğidir.

Sonuçlar, bu kavramın vaadini gösteriyor. Birleştirilen modeller, çok daha az parametreye sahip olsalar da, devasa modeller gibi GPT-3’ün performansını eşleyebilir veya hatta aşabilir. Örneğin, Model Ratatouille ensemble’ü, yalnızca 7 orta boy kontrol noktasından oluşur ve yüksek boyutlu metin içerme veri kümelerinde state-of-the-art doğruluğu elde eder, GPT-3’ü geride bırakır.

Ağırlıklı ortalama kullanarak birleştirmenin basitliği büyük bir bonusudur. Birden fazla yardımcı modeli eğitmek ek kaynaklar gerektirir. Ancak kritik olarak, çıkarım zamanı hesaplama, tek bir modelle aynı kalır, çünkü ağırlıklar birine yoğunlaştırılır. Bu, yöntemi kolayca uyarlanabilir kılar, artan gecikme veya bellek maliyetleri konusunda endişe duyulmaz.

Model Birleştirmesinin Arkasındaki Mekanizmalar

Ancak birleştirilen modellerin bu doğruluk kazançlarını elde etmesini sağlayan şey tam olarak nedir? Son analiz bazı ipuçları sunuyor:

  • Örnek Belleğini Azaltma: Her model, eğitim sırasında farklı karıştırılmış veri kümesi görür. Ağırlıkların ortalaması, yalnızca veri kümesi düzeyinde genellemeleri korur ve örnek düzeyinde belleği azaltır.
  • Varyansın Azaltılması: Bağımsız olarak eğitilen modeller, ilişkisiz hatalara sahiptir. Bunları birleştirmek, gürültüyü ortalama çıkararak kalibrasyonu iyileştirir.
  • Çeşitlilik ile Düzenleme: Farklı yardımcı görevler, modellerin daha genel ve çeşitli özelliklere odaklanmasını sağlar, bu da dağılım genellemesini artırır.
  • Dayanıklılığın Artırılması: Tutarsız tahminler belirsizliği gösterir. Ağırlıkların ortalaması, aykırı yargıları dengeler ve güvenilirliği artırır.

Aslında, model birleştirmesi, bireysel modellerin zayıflıklarını dengeleyerek kolektif güçlerini artırır. Birleştirilmiş temsil, altta yatan neden-sonuç yapılarını yakalar ve tesadüfi varyasyonları görmezden gelir.

Bu kavramsal temel, model birleştirmesini, toplu öğrenme ve çoklu görevli öğrenme gibi diğer popüler tekniklerle bağlar. Tüm bu yöntemler, modeller veya görevler arasında çeşitliliği kullanarak, esnek ve belirsizlik bilincine sahip sistemler elde eder. Ağırlıklı ortalamanın basitliği ve verimliliği, model birleştirmesine, gerçek dünya dağıtımlarını ilerletmek için benzersiz bir avantaj sağlar.

Ağırlıklı Ortalama Ödül Modelleri

WARM ile hizalama süreci

WARM ile hizalama süreci

WARM, yenilikçi bir şekilde, aynı ön eğitilmiş büyük dil modelinden (LLM) ancak farklı hiperparametrelerle ince ayarlanmış birden fazla bireysel RM’nin ağırlıklı ortalamasını kullanarak bir vekil ödül modeli (RM) kullanır. Bu yöntem, verimliliği, dağılım kayması altında güvenilirliği ve tutarsız tercihlere karşı dayanıklılığı artırır. Çalışma, özellikle daha fazla RM ortalama aldıkça, WARM’in vekil RM olarak kullanıldığında sonuçların iyileştirildiğini ve “ödül hilelerinin” başlangıcının geciktiğini gösterir.

Aşağıda yüksek düzeyde bir bakış bulunmaktadır:

  1. Büyük bir korpus üzerinde ön eğitilmiş bir temel dil modeli ile başlayın. RM’leri oluşturmak için bu modele küçük görev özgü katmanlar ekleyin.
  2. Her RM’yi, öğrenme oranları gibi farklı hiperparametreler kullanarak insan tercihleri veri kümesinde ayrı ayrı ince ayarlayın.
  3. İnce ayarlanmış RM’lerin ağırlıklarını ortalama alın ve tek bir WARM topluluğu elde edin.

Ana fikir, ağırlıklı ortalamanın, tüm çeşitli RM’ler tarafından öğrenilen değişmez bilgileri korurken, sahte sinyallere olan bağımlılığı azaltmasıdır. Topluluk ayrıca varyans azaltmasından yararlanarak, dağılım kaymaları rağmen güvenilirliği artırır.

Önceden tartıştığımız gibi, bağımsız olarak eğitilen modeller arasındaki çeşitlilik, model birleştirmesinin tam potansiyelini açığa çıkarmak için çok önemlidir. Ancak üretken çeşitliliği teşvik etmek için somut teknikler nelerdir?

WARM makalesi, daha geniş bir şekilde genelleştirilebilecek beberapa akıllı fikir keşfeder:

Sıra Karıştırma

Basit ancak etkili bir yaklaşım, her modelin eğitim sırasında veri noktalarını gördüğü sırayı karıştırmasıdır. Bu adım, ağırlıkları Korelasyonlarını azaltır ve kalıpların tekrar eden belleğini azaltır.

Hiperparametre Çeşitliliği

Her çalışmada öğrenme oranı ve dropout olasılığı gibi hiperparametreleri ayarlayarak faydalı çeşitlilik sağlar. Modeller farklı şekilde yakınsar ve veri kümesinin farklı özelliklerini yakalar.

Kontrol Noktası Ortalaması – Baklava

Baklava yöntemi, birleştirme için modelleri aynı ön eğitim yolundaki farklı anlardan başlatır. Bu, model çorbalarının ortak bir başlangıç noktası gerektirmesine kıyasla kısıtlamaları gevşetir. Model Ratatouille’ye kıyasla, Baklava ek görevler içermez. Genel olarak, doğruluk ve çeşitlilik dengesini etkili bir şekilde sağlar.

Birden fazla Ödül Modelinin ince ayarlanması

Birden fazla Ödül Modelinin ince ayarlanması

Sürecin başlangıcında, ön eğitilmiş bir Büyük Dil Modeli (LLM) 𝜃_𝑝𝑡 vardır. Bu modelden, farklı SFT eğitim adımlarında alınan çeşitli kontrol noktaları {𝜃_𝑠 𝑓 𝑡_𝑖} türetilir. Bu kontrol noktaları, tercih veri kümesinde birden fazla Ödül Modeli (RM) {𝜙𝑖} için fine-tuning için başlangıç noktaları olarak kullanılır. Bu fine-tuning, modelleri insan tercihlerine daha iyi uyumlu hale getirmeyi amaçlar. Fine-tuning之后, bu RM’ler ağırlıklı ortalama yoluyla birleştirilir ve nihai model 𝜙_WARM elde edilir.

Analiz, daha eski kontrol noktalarının ağırlıklı ortalamasının bireysel performansın çeşitlilik avantajlarını tehlikeye atabileceğini ve yalnızca son temsilcilerin ortalamasının daha iyi performans gösterdiğini gösterir. Genel olarak, çeşitlilik hedeflerini doğrulukla dengelemek açık bir araştırma zorluğudur.

Genel olarak, model birleştirmesi, mevcut kaynakları daha etkili bir şekilde geri dönüştürerek artan güvenilirlik, verimlilik ve esneklik için alanın genel etosuna iyi uyum sağlar. Ağırlıklı ortalamanın basitliği, onu mevcut yapı taşlarından dayanıklı modeller oluşturmak için önde gelen bir aday haline getirir.

Geleneksel toplu öğrenme yöntemlerinin aksine, WARM, yalnızca tek bir ağırlık kümesini koruyarak hesaplamalı yükü minimum tutar. Metin özetleme görevlerinde yapılan deneyler, WARM’in etkinliğini gösteriyor:

  • En iyi N örnekleme için, WARM, insan tercih etiketlerine göre rasgele seçime kıyasla %92,5 kazanma oranına ulaşır.
  • RLHF’de, WARM politikası, aynı sayıda adımdan sonra tek bir RM ile eğitilen politika karşısında %79,4 kazanma oranına ulaşır.
  • WARM, insan etiketlerinin dörtte birini bozulduğunda bile iyi bir performans gösterir.

Bu sonuçlar, WARM’in gerçek dünya YZ asistanlarının geliştirilmesinde pratik bir teknik olarak potansiyelini vurgulamaktadır. İnsan geri bildirimi中的 tutarsızlıkları yumuşatarak, WARM politikaları, yeni deneyimler kazanmaya devam ettikçe insan değerleriyle uyumlu kalabilir.

Büyük Resim

WARM, YZ hizalama araştırmalarında iki ana eğilimin kesişim noktasında yer alır. İlk olarak, dağılım dışı (OOD) genellemenin incelenmesi, model performansını yeni, eğitim dağılımından farklı verilerde artırmayı hedefler. İkincisi, algoritmik dayanıklılık üzerine araştırmalar, küçük girdi pertürbasyonlarına veya gürültüsüne rağmen güvenilirlik üzerine odaklanır.

Öğrenilen değişmezlikler kavramı etrafında bu alanları birleştiren WARM, daha sağlam temellere dayalı değer hizalama tekniklerine doğru ilerler. WARM’den elde edilen içgörüler, RLHF’nin ötesine geçerek, açık dünya ile etkileşime giren daha geniş makine öğrenimi sistemleri için dersler sağlayabilir.

Elbette, ödül modelleme, hizalama bulmacasının yalnızca bir parçasıdır. Ödül belirtimi, ölçeklenebilir denetim ve güvenli keşif gibi diğer zorluklarda ilerleme仍 gereklidir. WARM, tamamlayıcı tekniklerle birleştirildiğinde, insan refahını sürdürülebilir bir şekilde teşvik eden YZ’nin geliştirilmesini hızlandırabilir. Araştırmacılar, dayanıklı hizalama ilkelerini birlikte aydınlatarak, faydalı ve etik YZ’ye giden yolu haritalamaktadır.

Son beş yıldır Makine Öğrenimi ve Derin Öğrenme dünyasına kendimi adamış bulunuyorum. Tutkum ve uzmanlığım, özellikle AI/ML'ye odaklanarak 50'den fazla çeşitli yazılım mühendisliği projesine katkıda bulunmama yol açtı. Süregelen meraklılığım da beni Doğal Dil İşleme alanına yöneltti, bu alana daha da derinlemesine girmeye hevesliyim.