Yapay zeka modelleri ve platformları
Zephyr-7B: Hugging Face’in Hiper-Optimize Edilmiş LLM’si Mistral 7B Üzerine Kurulmuştur
Giriş
Açık büyük dil modellerinin (LLM’ler) evrimi, özellikle sohbet botları ve benzeri uygulamalar geliştirirken, AI araştırma topluluğunu önemli ölçüde etkiledi. LLaMA gibi modellerin yayınlanmasının ardından, verimli fine-tuning, genişletilmiş.prompt işleme, retrieval augmented generation (RAG) ve kuantizasyon üzerine araştırmalar sürat kazandı.
Örneğin, LLaMA modeli, fine-tuning ve prompt bağlamlaştırması açısından yeni bir dönem başlattı ve MosaicML’nin MPT’si, Together AI’nin RedPajama-INCITE’i, TII’nin Falcon’u ve Meta’nın Llama 2’si gibi sonraki modellerin yolunu açtı. Her bir model, LLM’lerin genel işlevselliği ve kapsamını artıran benzersiz yetenekler kazandırdı.
Paris’te kurulan ve eski Google DeepMind ve Meta çalışanları tarafından kurulan Mistral AI, ilk teklifi olan Mistral 7B ile adını duyurdu.
Mistral 7B’nin avantajı, Llama 2 gibi benzerlerine kıyasla benzer veya geliştirilmiş yetenekleri sunarken daha az hesaplama talebiyle verimliliğinde yatmaktadır.
Özellikle talimat görevleri için uyarlanan Mistral 7B Instruct, Hugging Face gibi platformlarda aynı büyüklükteki diğer modelleri geride bırakmakta ve neredeyse iki katı parametreye sahip modellerle yakın bir yarış vermektedir.
Hugging Face, Zephyr 7B Alpha yı yayınladı ve bir fine-tuned Mistral 7B’nin aslında daha büyük sohbet modellerinin yeteneklerini aşabileceğini ve bazı görevlerde GPT-4 ile yarışabileceğini gösterdi. “Alpha” sadece başlangıçtı, çünkü Zephyr 7B Beta kısa süre sonra takip etti.
Bu makale, Zephyr 7B’nin insan talimatlarına yanıt verme ve uyumlu olma yeteneğini geliştirmek için daha büyük modellerin gücünden nasıl faydalandığını keşfedecek. Bu, daha büyük modeller tarafından öğrenilen karmaşık kalıpları daha küçük modellere aktaran bilgi damıtma tekniği sayesinde mümkün olmaktadır. Hugging Face’in bilgi damıtma yaklaşımının ayrıntılarına gireceğiz.
Bilgi Damıtma
Zephyr-7B gibi modellerin geliştirilmesinde önemli bir yenilik, damıtılmış gözetimli fine-tuning (dSFT) yöntemidir. Bu yöntem, daha büyük ve yetenekli bir “öğretmen” modelinin çıktısını kullanarak daha küçük bir “öğrenci” modelini eğitmeyi içerir, böylece öğrenci modelinin doğruluğunu artırır. Damıtma, açık modelleri çeşitli görevlerde geliştirir, ancak öğretmen modellerine kıyasla performans açığı vẫn devam eder.
Bilgi damıtma, bir makine öğrenimi tekniğidir ve burada daha küçük bir model, yani “öğrenci”, daha büyük ve karmaşık bir “öğretmen” modelinin performansını taklit etmeyi öğrenir. Bu teknik, öğrenci modelinin daha önce kapasitesinin ötesinde görevleri gerçekleştirmesini sağlar ve öğretmen modeli tarafından öğrenilen karmaşık kalıpları aktarır.
Öğrenci modeli, öğretmen modelinin olasılık çıktıları veya özelliklerine odaklanarak eğitim görür, yalnızca son tahminlerle değil, öğretmen modelinin çıktılarını taklit etmeye çalışır. Bu, öğrenci modelinin öğretmen modelinin nüanslı karar alma süreçlerini öğrenmesini sağlar ve genellikle sadece zemine bağlı veri ile eğitim görenlere kıyasla daha iyi performans sonuçları verir.
Tarihsel olarak, bilgi damıtma, Hinton’ın orijinal damıtma ağlarında ve daha yakın zamanda NLP’de DistilBERT gibi modellerde kullanılmıştır. DistilBERT, BERT modelini daha küçük ve daha hızlı bir versiyona dönüştürür ve orijinalinin dil anlama yeteneklerinin çoğunu korur. TinyBERT, boyutu ve hızı mobil veya kenar cihazlar için optimize eder.
Zephyr-7B’nin durumunda, bilgi damıtma, 7B parametreli bir modeli daha büyük karşılıklarının yetenekleriyle donatmak için kullanılır. Bunu yaparak, Zephyr-7B, performans ve verimlilik arasında bir denge sağlar, bu da hesaplama kaynaklarının sınırlı olduğu ortamlarda kaliteli etkileşim ve anlama kalitesini sacrific etmeden uygun hale getirir.
Zephyr-7B’yi geliştirirken araştırmacılar, bir küçük açık LLM’yi tamamen damıtma yoluyla hizalamakla ilgili zorluğu ele aldılar. Damıtılmış doğrudan tercih optimizasyonu (dDPO) olarak adlandırılan bir yaklaşım sundular, bu da AI geri bildirimi olarak öğretmen modellerinin topluluğundan tercih verilerini kullanır. Bu yöntem, insan annotasyonuna gerek kalmadan, model eğitimi için gereken zamanı ve kaynakları önemli ölçüde azaltır.
ZEPHYR-7B’nin Oluşturulması
dDPO’yu doğrulamak için araştırmacılar, Mistral-7B modeline dayanan ZEPHYR-7B’yi oluşturdular. Süreç üç adımdan oluşuyordu:
- UltraChat veri kümesiyle dSFT: Damıtılmış Gözetimli Fine-Tuning (dSFT), büyük dil modellerini (LLM’ler) daha büyük ve yetenekli “öğretmen” modellerinin çıktısını kullanarak eğitmek için gelişmiş bir yöntemdir. Bu, bir raw LLM ile başlar ve kullanıcı.promtlarına yanıt vermesi için eğitilir. Geleneksel gözetimli fine-tuning (SFT) gibi, dSFT de dinamik bir yaklaşım kullanır, burada model kendisi talimatları ve yanıtları oluşturur. Bu, self-instruct olarak bilinen bir yöntemdir ve öğretmen modelinin hem yanıtları hem de talimatları iyileştirmesini içerir.
- UltraFeedback veri kümesinden AI geri bildirimi verilerini dahil etme: Bu veri, modelin yanıtlarını iyileştirmek için çok önemliydi. Bu adımda, model çeşitli promt’lara yanıtlar üretir ve daha gelişmiş bir model gibi GPT-4 tarafından derecelendirilir. En yüksek puan alan yanıt (yw) ve rastgele seçilen daha düşük puanlı bir yanıt (yl) bir geri bildirim veri kümesini oluşturur.
- dDPO’yu uygulama: Son aşama, dSFT modelini, tercih edilen yanıtları daha yüksek sıralamaya sahip olacak şekilde iyileştirmeyi içerir. Bu, bir ödül fonksiyonu rθ(x, y) kullanarak yapılır ve optimal LLM politikası π* ve orijinal πdSFT politikasına dayanır. Optimizasyon hedefi, πθ = max π E (x, yw, yl) ∼ D log σ (β log π(yw|x)/πdSFT(yw|x) − β log π(yl|x)/πdSFT(yl|x)) olarak formüle edilir, bu da eğitim sürecini basitleştirir ve dSFT modelinin her bir AIF üçlüsünü iterasyonla çalıştırmasını sağlar.
Şaşırtıcı bir şekilde, Zephyr-7B, insan geri bildirimiyle hizalanmış çok daha büyük 70B parametreli modellerle benzer performans gösterir ve bazı görevlerde GPT-4 ile yarışır. Hem akademik benchmark’lerde hem de sohbet yeteneklerinde üstün performans gösterir, tercih öğreniminin model geliştirmeindeki etkinliğini vurgular. Daha fazla keşif için modeller, kodlar ve talimatlar Hugging Face’in GitHub Deposunda mevcuttur.
Niyet Hizalamasının Zorluğunu Giderme
LLM’lerle ilgili önemli bir endişe, insan niyetiyle hizalanmalarıydı. Önceki modeller genellikle kullanıcı tercihlerine uymayan yanıtlar üretti, bu da yanlış veya alakasız yanıtlara yol açtı. Ancak, MT-Bench ve AlpacaEval gibi son benchmark’ler, bu yönü量ify ve geliştirmek için araçlar sağladı, insan geri bildirimiyle eğitilen özel modellerin damıtma yoluyla eğitilenlere göre üstün performansını vurguladı.
Değerlendirme Yöntemleri
Zephyr 7B’nin değerlendirilmesi, sohbet yeteneklerini hem tek hem de çoklu dönüşlü bağlamlarda değerlendiren benchmark’ler üzerinde kapsamlı testleri içeriyordu:
- MT-Bench: Bu çoklu dönüşlü benchmark, modelin 160 soruyu sekiz farklı alanda ele almasını gerektirir. Her yanıt, GPT-4 tarafından derecelendirilir ve modelin final puanı, iki soru turunun ortalaması olarak hesaplanır.
- AlpacaEval: Bu tek dönüşlü benchmark, modelin çeşitli konularda 805 soruya yanıt vermesini içerir. Burada odak, modelin faydalılığı üzerinedir ve GPT-4, yanıtları derecelendirerek karşılaştırmalı bir kazanma oranını belirler.
Ek olarak, Zephyr 7B, sohbet yeteneklerini doğrudan değerlendirmeyen ancak modelin akıl yürütme ve doğruluk yeteneklerine ilişkin içgörüler sağlayan Açık LLM Liderlik Tablosu’nda test edildi.
Zephyr 7B, farklı boyutlarda ve hizalama yöntemlerine sahip açık ve özel modellerle karşılaştırıldı. MT-Bench ve AlpacaEval’de 7B modelleri için yeni benchmark’ler oluşturdu ve daha büyük modellerle rekabetçi performans göstererek dDPO’nun eğitimindeki etkinliğini doğruladı.
SFT ve DPO eğitim aşamaları, optimal performans için çoklu epoch ve fine-tuning öğrenme oranları ve toplu boyutları dahil olmak üzere özenle yapılandırıldı. Son Zephyr modeli, yalnızca overfittinge karşı dirençli olmakla kalmadı, aynı zamanda pratik görevlerde ve akademik benchmark’lerde geliştirildi.
Veri Kümeleri ve Sonuçlar
Kullanılan Veri Kümeleri
















