Yapay zeka modelleri ve platformları

Zephyr-7B: Hugging Face’in Hiper-Optimize Edilmiş LLM’si Mistral 7B Üzerine Kurulmuştur

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Giriş

Açık büyük dil modellerinin (LLM’ler) evrimi, özellikle sohbet botları ve benzeri uygulamalar geliştirirken, AI araştırma topluluğunu önemli ölçüde etkiledi. LLaMA gibi modellerin yayınlanmasının ardından, verimli fine-tuning, genişletilmiş.prompt işleme, retrieval augmented generation (RAG) ve kuantizasyon üzerine araştırmalar sürat kazandı.

Örneğin, LLaMA modeli, fine-tuning ve prompt bağlamlaştırması açısından yeni bir dönem başlattı ve MosaicML’nin MPT’si, Together AI’nin RedPajama-INCITE’i, TII’nin Falcon’u ve Meta’nın Llama 2’si gibi sonraki modellerin yolunu açtı. Her bir model, LLM’lerin genel işlevselliği ve kapsamını artıran benzersiz yetenekler kazandırdı.

Paris’te kurulan ve eski Google DeepMind ve Meta çalışanları tarafından kurulan Mistral AI, ilk teklifi olan Mistral 7B ile adını duyurdu.

Mistral 7B’nin avantajı, Llama 2 gibi benzerlerine kıyasla benzer veya geliştirilmiş yetenekleri sunarken daha az hesaplama talebiyle verimliliğinde yatmaktadır.

Özellikle talimat görevleri için uyarlanan Mistral 7B Instruct, Hugging Face gibi platformlarda aynı büyüklükteki diğer modelleri geride bırakmakta ve neredeyse iki katı parametreye sahip modellerle yakın bir yarış vermektedir.

Hugging Face, Zephyr 7B Alpha yı yayınladı ve bir fine-tuned Mistral 7B’nin aslında daha büyük sohbet modellerinin yeteneklerini aşabileceğini ve bazı görevlerde GPT-4 ile yarışabileceğini gösterdi. “Alpha” sadece başlangıçtı, çünkü Zephyr 7B Beta kısa süre sonra takip etti.

Bu makale, Zephyr 7B’nin insan talimatlarına yanıt verme ve uyumlu olma yeteneğini geliştirmek için daha büyük modellerin gücünden nasıl faydalandığını keşfedecek. Bu, daha büyük modeller tarafından öğrenilen karmaşık kalıpları daha küçük modellere aktaran bilgi damıtma tekniği sayesinde mümkün olmaktadır. Hugging Face’in bilgi damıtma yaklaşımının ayrıntılarına gireceğiz.

Bilgi Damıtma

Zephyr-7B gibi modellerin geliştirilmesinde önemli bir yenilik, damıtılmış gözetimli fine-tuning (dSFT) yöntemidir. Bu yöntem, daha büyük ve yetenekli bir “öğretmen” modelinin çıktısını kullanarak daha küçük bir “öğrenci” modelini eğitmeyi içerir, böylece öğrenci modelinin doğruluğunu artırır. Damıtma, açık modelleri çeşitli görevlerde geliştirir, ancak öğretmen modellerine kıyasla performans açığı vẫn devam eder.

Bilgi damıtma, bir makine öğrenimi tekniğidir ve burada daha küçük bir model, yani “öğrenci”, daha büyük ve karmaşık bir “öğretmen” modelinin performansını taklit etmeyi öğrenir. Bu teknik, öğrenci modelinin daha önce kapasitesinin ötesinde görevleri gerçekleştirmesini sağlar ve öğretmen modeli tarafından öğrenilen karmaşık kalıpları aktarır.

Bilgi Damıtma, Öğretmen-Öğrenci Modeli

Bilgi Damıtma | Öğretmen-Öğrenci Modeli

Öğrenci modeli, öğretmen modelinin olasılık çıktıları veya özelliklerine odaklanarak eğitim görür, yalnızca son tahminlerle değil, öğretmen modelinin çıktılarını taklit etmeye çalışır. Bu, öğrenci modelinin öğretmen modelinin nüanslı karar alma süreçlerini öğrenmesini sağlar ve genellikle sadece zemine bağlı veri ile eğitim görenlere kıyasla daha iyi performans sonuçları verir.

Tarihsel olarak, bilgi damıtma, Hinton’ın orijinal damıtma ağlarında ve daha yakın zamanda NLP’de DistilBERT gibi modellerde kullanılmıştır. DistilBERT, BERT modelini daha küçük ve daha hızlı bir versiyona dönüştürür ve orijinalinin dil anlama yeteneklerinin çoğunu korur. TinyBERT, boyutu ve hızı mobil veya kenar cihazlar için optimize eder.

Zephyr-7B’nin durumunda, bilgi damıtma, 7B parametreli bir modeli daha büyük karşılıklarının yetenekleriyle donatmak için kullanılır. Bunu yaparak, Zephyr-7B, performans ve verimlilik arasında bir denge sağlar, bu da hesaplama kaynaklarının sınırlı olduğu ortamlarda kaliteli etkileşim ve anlama kalitesini sacrific etmeden uygun hale getirir.

Zephyr-7B’yi geliştirirken araştırmacılar, bir küçük açık LLM’yi tamamen damıtma yoluyla hizalamakla ilgili zorluğu ele aldılar. Damıtılmış doğrudan tercih optimizasyonu (dDPO) olarak adlandırılan bir yaklaşım sundular, bu da AI geri bildirimi olarak öğretmen modellerinin topluluğundan tercih verilerini kullanır. Bu yöntem, insan annotasyonuna gerek kalmadan, model eğitimi için gereken zamanı ve kaynakları önemli ölçüde azaltır.

ZEPHYR-7B’nin Oluşturulması

dDPO’yu doğrulamak için araştırmacılar, Mistral-7B modeline dayanan ZEPHYR-7B’yi oluşturdular. Süreç üç adımdan oluşuyordu:

  1. UltraChat veri kümesiyle dSFT: Damıtılmış Gözetimli Fine-Tuning (dSFT), büyük dil modellerini (LLM’ler) daha büyük ve yetenekli “öğretmen” modellerinin çıktısını kullanarak eğitmek için gelişmiş bir yöntemdir. Bu, bir raw LLM ile başlar ve kullanıcı.promtlarına yanıt vermesi için eğitilir. Geleneksel gözetimli fine-tuning (SFT) gibi, dSFT de dinamik bir yaklaşım kullanır, burada model kendisi talimatları ve yanıtları oluşturur. Bu, self-instruct olarak bilinen bir yöntemdir ve öğretmen modelinin hem yanıtları hem de talimatları iyileştirmesini içerir.
  2. UltraFeedback veri kümesinden AI geri bildirimi verilerini dahil etme: Bu veri, modelin yanıtlarını iyileştirmek için çok önemliydi. Bu adımda, model çeşitli promt’lara yanıtlar üretir ve daha gelişmiş bir model gibi GPT-4 tarafından derecelendirilir. En yüksek puan alan yanıt (yw) ve rastgele seçilen daha düşük puanlı bir yanıt (yl) bir geri bildirim veri kümesini oluşturur.
  3. dDPO’yu uygulama: Son aşama, dSFT modelini, tercih edilen yanıtları daha yüksek sıralamaya sahip olacak şekilde iyileştirmeyi içerir. Bu, bir ödül fonksiyonu rθ(x, y) kullanarak yapılır ve optimal LLM politikası π* ve orijinal πdSFT politikasına dayanır. Optimizasyon hedefi, πθ = max π E (x, yw, yl) ∼ D log σ (β log π(yw|x)/πdSFT(yw|x) − β log π(yl|x)/πdSFT(yl|x)) olarak formüle edilir, bu da eğitim sürecini basitleştirir ve dSFT modelinin her bir AIF üçlüsünü iterasyonla çalıştırmasını sağlar.
Zephyr-7B'de kullanılan yöntem, InstructGPT'de kullanılan süreçleri yansıtıyor

Zephyr-7B’de kullanılan yöntem, InstructGPT’de kullanılan süreçleri yansıtıyor

Şaşırtıcı bir şekilde, Zephyr-7B, insan geri bildirimiyle hizalanmış çok daha büyük 70B parametreli modellerle benzer performans gösterir ve bazı görevlerde GPT-4 ile yarışır. Hem akademik benchmark’lerde hem de sohbet yeteneklerinde üstün performans gösterir, tercih öğreniminin model geliştirmeindeki etkinliğini vurgular. Daha fazla keşif için modeller, kodlar ve talimatlar Hugging Face’in GitHub Deposunda mevcuttur.

Niyet Hizalamasının Zorluğunu Giderme

LLM’lerle ilgili önemli bir endişe, insan niyetiyle hizalanmalarıydı. Önceki modeller genellikle kullanıcı tercihlerine uymayan yanıtlar üretti, bu da yanlış veya alakasız yanıtlara yol açtı. Ancak, MT-Bench ve AlpacaEval gibi son benchmark’ler, bu yönü量ify ve geliştirmek için araçlar sağladı, insan geri bildirimiyle eğitilen özel modellerin damıtma yoluyla eğitilenlere göre üstün performansını vurguladı.

Değerlendirme Yöntemleri

Zephyr 7B’nin değerlendirilmesi, sohbet yeteneklerini hem tek hem de çoklu dönüşlü bağlamlarda değerlendiren benchmark’ler üzerinde kapsamlı testleri içeriyordu:

  • MT-Bench: Bu çoklu dönüşlü benchmark, modelin 160 soruyu sekiz farklı alanda ele almasını gerektirir. Her yanıt, GPT-4 tarafından derecelendirilir ve modelin final puanı, iki soru turunun ortalaması olarak hesaplanır.
  • AlpacaEval: Bu tek dönüşlü benchmark, modelin çeşitli konularda 805 soruya yanıt vermesini içerir. Burada odak, modelin faydalılığı üzerinedir ve GPT-4, yanıtları derecelendirerek karşılaştırmalı bir kazanma oranını belirler.

Ek olarak, Zephyr 7B, sohbet yeteneklerini doğrudan değerlendirmeyen ancak modelin akıl yürütme ve doğruluk yeteneklerine ilişkin içgörüler sağlayan Açık LLM Liderlik Tablosu’nda test edildi.

Zephyr 7B, farklı boyutlarda ve hizalama yöntemlerine sahip açık ve özel modellerle karşılaştırıldı. MT-Bench ve AlpacaEval’de 7B modelleri için yeni benchmark’ler oluşturdu ve daha büyük modellerle rekabetçi performans göstererek dDPO’nun eğitimindeki etkinliğini doğruladı.

SFT ve DPO eğitim aşamaları, optimal performans için çoklu epoch ve fine-tuning öğrenme oranları ve toplu boyutları dahil olmak üzere özenle yapılandırıldı. Son Zephyr modeli, yalnızca overfittinge karşı dirençli olmakla kalmadı, aynı zamanda pratik görevlerde ve akademik benchmark’lerde geliştirildi.

Veri Kümeleri ve Sonuçlar

Kullanılan Veri Kümeleri

Zephyr-7B’nin geliştirilmesinde, diyaloğu oluşturma açısından iki ana veri kümesi kullanıldı, her biri farklı yönleri ele aldı:

UltraChat Veri Kümesi

  • Kaynak: GPT-3.5-TURBO tarafından üretilen diyaloglar temel alınarak geliştirildi.
  • İçerik: 30 konu ve 20 tür metaryal üzerinden 1.47 milyon çoklu dönüşlü diyalog içerir.
  • İyileştirme: Veri kümesi, dilbilgisi hatalarını düzeltmek için truecasing heuristic uygulandı ve yanıtların faydalılığını artırmak ve işe yaramaz ön sözleri ortadan kaldırmak için filtreler uygulandı.

UltraFeedback Veri Kümesi

  • Kaynak: GPT-4 tarafından değerlendirilen promt’lerden oluşur, bu promt’ler talimatları takip etme, dürüstlük ve faydalılık açısından puanlanır.
  • İçerik: Her biri GPT-4 tarafından puanlanan 64.000 promt içerir.
  • İkili Tercihler: En yüksek ortalama puanlı yanıtın “seçilen” ve kalanlardan rastgele seçilen bir diğerinin “reddedilen” olarak belirlenmesi yoluyla oluşturulur, bu da DPO sürecini zorlamak ve çeşitliliği artırmak için kullanılır.

Her iki veri kümesi de Zephyr-7B’yi, talimatları takip eden, dürüst ve faydalı insan benzeri diyalog oluşturmak için eğitmek açısından kritiktir. Bu veri kümeleri, Hugging Face Hub üzerinde mevcuttur.
Performans ve Sonuçlar

Aşağıdaki grafik, Zephyr 7B’nin çeşitli görev kategorilerinde GPT-3.5-turbo, Claude 1, GPT-4 ve Llama-2-70b-chat gibi diğer modellerle karşılaştırılmış performansını gösterir. Kategoriler, Yazma, Beşeri Bilimler, Rol Oynama, Mantık, STEM, Çıkarma, Kodlama ve Matematik gibi alanları içerebilir.

Grafikten, Zephyr 7B’nin hangi alanlarda üstün olduğunu ve hangi alanlarda daha fazla geliştirme gerektirebileceğini çıkarabiliriz. Örneğin, Zephyr’in çizgisi Yazma ekseninde diğerlerine göre daha uzundaysa, bu Zephyr’in yazılı içerik oluşturmada özellikle güçlü olduğunu gösterir. Buna karşılık, Matematik ekseninde çizginin daha merkezi bir konumda olması, matematik problemlerini çözme açısından göreceli bir zayıflık olduğunu gösterebilir.

Radar grafiği, Zephyr 7B’nin güçlü ve zayıf yönlerini belirlemeye yardımcı olur ve GPT-4 ve Llama-2-70b-chat gibi daha büyük modellere kıyasla nerede durduğunu görselleştirir.

 

Model Performans Grafiği

Model Performans Grafiği

Çeşitli dil modellerini MT-Bench ve AlpacaEval’de karşılaştırma. Modeller, boyutuna, hizalama yöntemine (dSFT veya dDPO gibi) ve performans puanlarına göre değerlendirilir. Zephyr, her iki benchmark’te yüksek puanlarla öne çıkarak dDPO’nun eğitimindeki etkinliğini gösterir.

MT-Bench ve AlpacaEval

MT-Bench ve AlpacaEval

Sonuç

Sonuç olarak, Zephyr-7B’nin geliştirilmesi, büyük bir dil modelinin (LLM) sohbet yeteneklerini daha küçük bir modele damıtma yoluyla hizalayabilmenin mümkün olduğunu gösterir. Doğrudan tercih optimizasyonu (DPO) kullanarak AI geri bildirimiyle, Zephyr-7B, Mistral-7B’nin güçlü temelini kullanarak 7B parametreli sohbet modelleri için yeni bir benchmark oluşturur ve küçük, açık kaynaklı modellerin insan niyetini etkili bir şekilde anlaması ve yanıtlamasının yeteneğini gösterir.

Ancak, bu çalışma sınırlamalar içermez. GPT-4’ün benchmark’ler için bir değerlendirici olarak kullanılması, GPT-4’ten damıtılan modeller lehine bir önyargı oluşturur ve bu da doğru yanıtlara karşı bir önyargı oluşturabilir. Ayrıca, bu yöntemin daha büyük modellere (örneğin LLAMA2-70B) ölçeklendirilmesi ve performans kazançları üzerindeki etkisi daha fazla araştırmaya ihtiyaç duyar. Bu sınırlamalar, AI topluluğunda sürekli inovasyon ve önyargsız değerlendirme yöntemlerinin geliştirilme ihtiyacını vurgular.

Çalışmanın ötesine bakıldığında, küçük modellerin daha büyük karşılıklarının seviyesinde performans gösterme potansiyelinin, AI’nin çeşitli uygulamalarda daha erişilebilir ve verimli kullanılmasını sağlayarak AI’yi demokratikleştirebileceği açıktır. Zephyr-7B’nin başarısı, açık kaynaklı modellerin daha da araştırılmasını teşvik eder ve bu da AI’de ilerlemeleri hızlandırabilir.

Son beş yıldır Makine Öğrenimi ve Derin Öğrenme dünyasına kendimi adamış bulunuyorum. Tutkum ve uzmanlığım, özellikle AI/ML'ye odaklanarak 50'den fazla çeşitli yazılım mühendisliği projesine katkıda bulunmama yol açtı. Süregelen meraklılığım da beni Doğal Dil İşleme alanına yöneltti, bu alana daha da derinlemesine girmeye hevesliyim.