Yapay zeka modelleri ve platformları

Büyük Dil Modellerini Çok Token Tahmini ile Güçlendirme

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Büyük dil modelleri (LLM’ler) gibi GPT, LLaMA ve diğerleri, insan benzeri metinleri anlamak ve üretmek için şaşırtıcı bir yetenekle dünyayı kasıp kavurmaktadır. Ancak, etkileyici yeteneklerine rağmen, bu modelleri eğitmek için kullanılan standart yöntem, “sonraki token tahmini” olarak bilinen bazı içsel sınırlamalara sahiptir.

Sonraki token tahmininde, model bir diziye verilen önceki kelimelere dayanarak bir sonraki kelimeyi tahmin etmek için eğitilir. Bu yaklaşım başarılı olmuştur, ancak uzun menzilli bağımlılıklar ve karmaşık akıl yürütme görevleriyle başa çıkmak için mücadele eden modeller üretmesine neden olabilir. Ayrıca, öğretmen zorlama eğitim rejimi ile çıkarım sırasında otoregresif üretim süreci arasındaki uyumsuzluk, alt optimal performansla sonuçlanabilir.

Meta AI’den Gloeckle et al. (2024) tarafından yapılan bir recent araştırma makalesi, bu sınırlamaları ele almak ve büyük dil modellerini güçlendirmek amacıyla “çok token tahmini” olarak adlandırılan yeni bir eğitim paradigmalarını tanıttı. Bu blog gönderisinde, bu yenilikçi araştırmanın temel kavramlarını, teknik ayrıntılarını ve potansiyel etkilerini derinlemesine inceleyeceğiz.

Tek Token Tahmini: Geleneksel Yaklaşım

Çok token tahmininin ayrıntılarına dalmadan önce, büyük dil modeli eğitiminin yıllarca süren geleneksel yaklaşımını – tek token tahmini veya sonraki token tahmini – anlamak önemlidir.

Sonraki Token Tahmini Paradigması

Sonraki token tahmini paradigmasında, dil modelleri bir diziye verilen önceki bağlam temelinde bir sonraki kelimeyi tahmin etmek için eğitilir. Daha resmi olarak, model bir sonraki token xt+1’in olasılığını en üst düzeyde tutmakla görevlendirilir, verilen önceki token’ler x1, x2, …, xt. Bu genellikle çapraz entropi kaybını en aza indirerek yapılır:

L = -Σt log P(xt+1 | x1, x2, …, xt)

Bu basit ancak güçlü eğitim hedefi, birçok başarılı büyük dil modelinin temelini oluşturdu, örneğin GPT (Radford et al., 2018), BERT (Devlin et al., 2019) ve varyantları.

Öğretmen Zorlama ve Oto-Regresif Üretim

Sonraki token tahmini, modelin her bir gelecek token için zemine hakim olmasını sağlayan “öğretmen zorlama” olarak bilinen bir eğitim tekniğine dayanır. Bu, modelin doğru bağlam ve hedef dizilerinden öğrenmesini sağlar ve daha稳i ve verimli bir eğitim sağlar.

Ancak, çıkarım veya üretim sırasında, model otoregresif bir şekilde çalışır, bir önceki üretilen token’lere dayanarak bir token öngörür. Öğretmen zorlama eğitim rejimi ile çıkarım rejimi arasındaki bu uyumsuzluk, özellikle daha uzun diziler veya karmaşık akıl yürütme görevleri için potansiyel olarak uyumsuzluklara ve alt optimal performansa neden olabilir.

Sonraki Token Tahmininin Sınırlamaları

Sonraki token tahmini etkileyici bir şekilde başarılı olmuştur, ancak bazı içsel sınırlamaları da vardır:

  1. Kısa Vadeli Odaklanma: Sadece bir sonraki token’ı tahmin ederek, model uzun menzilli bağımlılıkları ve metnin genel yapısını ve tutarlılığını yakalamakta zorlanabilir, bu da tutarsızlıklara veya tutarsız üretmelere neden olabilir.
  2. Yerel Kalıp Kilitlenmesi: Sonraki token tahmini modelleri, eğitim verisindeki yerel kalıplara kilitlenebilir, bu da dağıtılmamış senaryolara veya daha soyut akıl yürütme gerektiren görevlere genellemeyi zorlaştırabilir.
  3. Akıl Yürütme Yetenekleri: Çok adımlı akıl yürütme, algoritmik düşünme veya karmaşık mantıksal operasyonlar içeren görevler için, sonraki token tahmini yeterli endüktif önyargılar veya temsil sağlayamayabilir.
  4. Örnek Etkinliği: Yerel doğası nedeniyle, sonraki token tahmini modelleri, gerekli bilgi ve akıl yürütme becerilerini kazanmak için daha büyük eğitim veri kümelerine ihtiyaç duyabilir, bu da potansiyel örnek etkinliği kaybına neden olabilir.

Bu sınırlamalar, araştırmacıların alternatif eğitim paradigmaları araştırmaya yöneltmiştir, örneğin çok token tahmini, bu eksikliklerin bazılarını ele almak ve büyük dil modelleri için yeni yetenekler açığa çıkarmak amacıyla tasarlanmıştır.

Geleneksel sonraki token tahmini yaklaşımını yeni çok token tahmini tekniğiyle karşılaştırarak, okuyucular bu sonuncusunun motivasyonunu ve potansiyel avantajlarını daha iyi takdir edebilir, bu da bu yenilikçi araştırmanın daha derin bir keşfine zemin hazırlar.

Çok Token Tahmini Nedir?

Çok token tahmininin temel fikri, dil modellerini bir sonraki token’ı değil, aynı anda birden fazla gelecek token’ı tahmin etmeyi öğretmektir. Özellikle, eğitim sırasında model, n bağımsız çıktı katmanları (çıktı başlıkları) kullanarak her konumda n sonraki token’ı tahmin etmekle görevlendirilir.

Örneğin, 4 token tahmini kurulumunda, model bir sonraki 4 token’ı aynı anda tahmin etmek için eğitilir, verilen önceki bağlam temelinde. Bu yaklaşım, modelin daha uzun menzilli bağımlılıkları yakalamasını ve metnin genel yapısını ve tutarlılığını daha iyi anlamasını teşvik eder.

Bir Oyuncak Örneği

Çok token tahmininin kavramını daha iyi anlamak için, basit bir örnek düşünün:

“Hızlı kahverengi tilki tembel köpeğin üzerinden atlar.”

Standart sonraki token tahmini yaklaşımında, model bir sonraki kelimeyi tahmin etmek için eğitilir, verilen önceki bağlam temelinde. Örneğin, “Hızlı kahverengi tilki tembel köpeğin üzerinden” bağlamı verildiğinde, model bir sonraki kelimeyi, “atlar”ı tahmin etmekle görevlendirilir.

Çok token tahmini ile, model birden fazla gelecek kelimeyi aynı anda tahmin etmek için eğitilir. Örneğin, n=4 olarak ayarlandığında, model bir sonraki 4 kelimeyi aynı anda tahmin etmekle görevlendirilir. Aynı bağlam “Hızlı kahverengi tilki tembel köpeğin üzerinden” verildiğinde, model “atlar köpeğin” dizesini tahmin etmekle görevlendirilir (sonunda bir boşluk bırakarak cümlenin sonunu gösterir).

Modeli birden fazla gelecek token’ı aynı anda tahmin etmeye teşvik ederek, modelin daha uzun menzilli bağımlılıkları yakalaması ve metnin genel yapısını ve tutarlılığını daha iyi anlamasını teşvik edersiniz.

Teknik Ayrıntılar

Yazarlar, çok token tahmini için basit ancak etkili bir mimari önerirler. Model, girdi bağlamının gizli bir temsilini üreten paylaşılan bir transformer gövdesi ve her bir gelecek token’ı tahmin eden n bağımsız transformer katmanları (çıktı başlıkları) içerir.

Eğitim sırasında, ileri ve geri geçişler dikkatli bir şekilde düzenlenir để GPU bellek izini en aza indirmek için. Paylaşılan gövde gizli temsilini hesaplar ve ardından her bir çıktı başlığı sırayla ileri ve geri geçişini gerçekleştirir, gövde düzeyinde gradientleri biriktirir. Bu yaklaşım, tüm logit vektörlerini ve gradientlerini aynı anda maddeleştirerek, pik GPU bellek kullanımını O(nV + d)’den O(V + d)’ye indirir, burada V sözcük dağarcığı boyutu ve d gizli temsilin boyutudur.

Bellek Verimli Uygulama

Çok token tahminleyicilerini eğitmek için bir zorluk, onların GPU bellek kullanımını azaltmaktır. Sözcük dağarcığı boyutu (V) genellikle gizli temsilin boyutundan (d) çok daha büyük olduğundan, logit vektörleri GPU bellek kullanımının darboğazı haline gelir.

Bu zorluğu ele almak için yazarlar, ileri ve geri geçişlerin sırasını dikkatli bir şekilde uyarlayarak bellek verimli bir uygulama önerirler. Tüm logitleri ve gradientlerini aynı anda maddeleştirmek yerine, her bir bağımsız çıktı başlığının ileri ve geri geçişini sırayla hesaplar ve gövde düzeyinde gradientleri biriktirir. Bu yaklaşım, tüm logit vektörlerini ve gradientlerini aynı anda bellekte saklamayı önler, pik GPU bellek kullanımını O(nV + d)’den O(V + d)’ye indirir, burada n tahmin edilen gelecek token sayısıdır.

Çok Token Tahmininin Avantajları

Araştırma makalesi, çok token tahmininin kullanımının birkaç güçlü avantajını sunar:

  1. İyileştirilmiş Örnek Etkinliği: Modeli birden fazla gelecek token’ı aynı anda tahmin etmeye teşvik ederek, çok token tahmini daha iyi örnek etkinliğine yol açar. Yazarlar, kod理解 ve üretim görevlerinde önemli performans iyileştirmeleri gösterir, 13B parametreli modellerin ortalama olarak %15 daha fazla sorunu çözdüğünü kanıtlar.
  2. Hızlı Çıkarım: Çok token tahmini ile eğitilen ek çıktı başlıkları, self-spekülatif decoding için kullanılabilir, bu da çeşitli toplu boyutları boyunca en fazla 3 kat daha hızlı çıkarım süreleri sağlar.
  3. Uzun Menzilli Bağımlılıkları Teşvik Etme: Çok token tahmini, modelin daha uzun menzilli bağımlılıkları ve kalıpları yakalamasını teşvik eder, bu da özellikle daha büyük bağlamlar üzerinde akıl yürütme gerektiren görevler için faydalıdır.
  4. Algoritmik Akıl Yürütme: Yazarlar, sentetik görevlerde çok token tahmini modellerinin endüktif başlıklar ve algoritmik akıl yürütme yetenekleri geliştirmesi konusunda üstünlüklerini gösterir, özellikle küçük model boyutları için.
  5. Tutarlılık ve Tutarlılık: Modeli birden fazla gelecek token’ı aynı anda tahmin etmeye teşvik ederek, çok token tahmini tutarlı ve tutarlı temsil geliştirilmesini teşvik eder. Bu, özellikle uzun, tutarlı metin üretimi gerektiren görevler için faydalıdır, örneğin hikaye anlatımı, yaratıcı yazma veya talimatlar.
  6. İyileştirilmiş Genellemeler: Yazarların sentetik görevlerdeki deneyimleri, çok token tahmini modellerinin özellikle dağıtılmamış ortamlarda daha iyi genellemeler sergilediğini gösterir. Bu, modelin daha uzun menzilli kalıpları ve bağımlılıkları yakalayabilmesi ve daha etkili bir şekilde görülmemiş senaryolara genelleme yapabilmesinden kaynaklanabilir.

Örnekler ve Sezgiler

Çok token tahmininin neden bu kadar iyi çalıştığını daha iyi anlamak için, birkaç örnek düşünün:

  1. Kod Üretimi: Kod üretimi bağlamında, birden fazla token’ı aynı anda tahmin etmek, modelin daha karmaşık kod yapılarını anlamasını ve üretmesini sağlayabilir. Örneğin, bir fonksiyon tanımını üretirken, sadece bir sonraki token’ı tahmin etmek, fonksiyon imzasını doğru bir şekilde üretmeye yetmeyebilir. Ancak, birden fazla token’ı aynı anda tahmin ederek, model fonksiyon adı, parametreler ve dönüş türü arasındaki bağımlılıkları daha iyi yakalayabilir, daha doğru ve tutarlı kod üretimi sağlar.
  2. Doğal Dil Akıl Yürütme: Bir dil modelinin, birden fazla adım veya parçacık bilgisi gerektiren bir soruyu yanıtlaması gereken bir senaryo düşünün. Birden fazla token’ı aynı anda tahmin ederek, model akıl yürütme sürecinin farklı bileşenleri arasındaki bağımlılıkları daha iyi yakalayabilir, daha tutarlı ve doğru yanıtlar sağlar.
  3. Uzun Metin Üretimi: Uzun metin üretimi, sonraki token tahmini ile eğitilen dil modellerinin tutarlılık ve tutarlılığı koruma konusunda zorluklar yaşayabileceği bir görevdir. Çok token tahmini, modelin genel metin akışını ve yapısını daha iyi anlamasını teşvik eder, daha tutarlı ve tutarlı uzun metin üretimi sağlar.

Sınırlamalar ve Gelecek Yönergeler

Makalede sunulan sonuçlar etkileyicidir, ancak birkaç sınırlama ve açık soru vardır:

  1. Optimum Token Sayısı: Makale, farklı n değerlerini (tahmin edilecek gelecek token sayısı) araştırır ve n=4’ün birçok görev için iyi çalıştığını bulur. Ancak, optimum n değeri, görev, veri kümesi ve model boyutuna bağlı olabilir. Optimum n değerini belirlemek için prensipli yöntemler geliştirmek, daha fazla performans iyileştirmelerine yol açabilir.
  2. Sözcük Dağarcığı Boyutu ve Tokenleştirme: Yazarlar, çok token tahmini modelleri için optimum sözcük dağarcığı boyutu ve tokenleştirme stratejisinin, sonraki token tahmini modelleri için kullanılanlardan farklı olabileceğini belirtirler. Bu yönü araştırmak, sıkıştırılmış dizi uzunluğu ve hesaplama verimliliği arasında daha iyi bir denge sağlayabilir.
  3. Yardımcı Tahmin Kayıpları: Yazarlar, çalışmasının, büyük dil modelleri için yeni yardımcı tahmin kayıplarının geliştirilmesine ilgi uyandırabileceğini öne sürer. Alternatif yardımcı kayıpları ve çok token tahmini ile kombinasyonlarını araştırmak, heyecan verici bir araştırma yönüdür.
  4. Teorik Anlama: Makale, çok token tahmininin neden ve nasıl bu kadar iyi çalıştığına dair bazı sezgiler ve deneysel kanıtlar sağlar. Ancak, bu yaklaşımın neden ve nasıl çalıştığına dair daha derin bir teorik anlayış, değerli olacaktır.

Sonuç

Gloeckle et al. (2024) tarafından yapılan “Daha İyi ve Daha Hızlı Büyük Dil Modelleri için Çok Token Tahmini” araştırması, büyük dil modellerinin performansını ve yeteneklerini önemli ölçüde iyileştirebilecek yeni bir eğitim paradigmalarını tanıttı. Modeli birden fazla gelecek token’ı aynı anda tahmin etmeye teşvik ederek, çok token tahmini, uzun menzilli bağımlılıkların, algoritmik akıl yürütme yeteneklerinin ve daha iyi örnek etkinliğinin geliştirilmesini teşvik eder.

Yazarların önerdiği teknik uygulama, zarif ve hesaplama açısından verimlidir, bu da bu yaklaşımın büyük ölçekli dil modeli eğitimine uygulanmasını sağlar. Ayrıca, self-spekülatif decoding için çok token tahmini çıkışlarını kullanma yeteneği, önemli bir pratik avantajdır.

Henüz açık sorular ve araştırma yönleri olsa da, bu çalışma, büyük dil modelleri alanındaki heyecan verici bir adımdır. Büyük dil modelleri için daha yetenekli ve verimli modeller talebi devam ettikçe, çok token tahmini, bu güçlü AI sistemlerinin bir sonraki neslinin önemli bir bileşeni haline gelebilir.

Son beş yıldır Makine Öğrenimi ve Derin Öğrenme dünyasına kendimi adamış bulunuyorum. Tutkum ve uzmanlığım, özellikle AI/ML'ye odaklanarak 50'den fazla çeşitli yazılım mühendisliği projesine katkıda bulunmama yol açtı. Süregelen meraklılığım da beni Doğal Dil İşleme alanına yöneltti, bu alana daha da derinlemesine girmeye hevesliyim.