Yapay zeka modelleri ve platformları

data2vec: Kendi Kendine Öğrenme Endüstrisinde Bir Dönüm Noktası

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Makine öğrenimi modelleri, geleneksel olarak, eğitim için etiketli veriler üzerine dayanmıştır ve etiketli veriler üzerinde eğitim gören modeller genellikle doğru sonuçlar verir. Ancak, etiketli verilerin kullanılmasıyla ilgili en büyük dezavantaj, eğitim verisi boyutunun artmasıyla birlikte artan yüksek etiketleme maliyetleridir. Yüksek etiketleme maliyetleri, özellikle büyük bir proje üzerinde çalışan geliştiriciler için önemli bir engel oluşturur.

Etiketleme sorununu çözmek için geliştiriciler, Kendi Kendine Öğrenme (SSL) veya Özdenetimli Öğrenme kavramını ortaya çıkardılar. Kendi Kendine Öğrenme, bir makine öğrenimi sürecidir ve burada model, girdinin bir kısmını diğer kısmından öğrenerek eğitilir. Kendi Kendine Öğrenme modeli, etiketli verilerin denetimli sinyallerini kullanmak yerine, verilerin arasındaki ilişkiyi kullanmaya çalışır.

Kendi Kendine Öğrenme’ye ek olarak, makine öğrenimi modellerini etiketli veriler olmadan eğitmek için diğer yöntemler ve modeller de vardır. Ancak, bu yöntemlerin çoğunda iki büyük sorun vardır

  1. Genellikle tek bir modalitye (örneğin, resim veya metin) özelleşirler.
  2. Yüksek miktarda hesaplama gücüne ihtiyaç duyarlar.

Bu sınırlamalar, ortalama bir insanın, bir AI modeline kıyasla, tek bir tür veri öğrenmek için çok daha etkili bir şekilde öğrenmesinin nedenlerinden biridir.

Tek modalitye ilişkin sorunu çözmek için Meta AI, data2vec, ilk türünün self-supervised yüksek performanslı algoritması, üç farklı modalityden (resim, metin ve konuşma) bilgi öğrenmek için ortaya çıktı. Data2vec algoritmasıyla, metin anlama, resim segmentasyon problemine uygulanabilir veya konuşma tanıma görevinde kullanılabilir.

Bu makalede, data2vec modelini derinlemesine inceleyeceğiz. Modelin metodunu, ilgili çalışmaları, mimarisini ve sonuçlarını daha derinlemesine tartışacağız, böylece data2vec algoritması hakkında net bir anlayışa sahip olacaksınız.

Data2vec Giriş: Temel Fikir

Kendi Kendine Öğrenme’nin temel kavramı, modaliteler arasında uygulanır, ancak实际 nesneler ve algoritmalar, tek bir modalitye göre tasarlandıkları için birbirinden farklıdır. Tek bir modalitye göre model tasarlamak, aynı self-supervised öğrenme algoritmasının farklı türdeki eğitim verilerine etkili bir şekilde çalışamamasının nedenidir.

Tek modalitye ilişkin model ve algoritmaların sunduğu zorluğu aşmak için Meta AI, data2vec’i ortaya çıkardı, bu algoritma, bilgisayar görüşü, NLP veya konuşma için aynı öğrenme metodolojisini kullanır.

Data2vec algoritmasının temel fikri, girdinin masked görünümünü kullanarak, self-distillation kurulumunda standart Transformer mimarisi yardımıyla tam girdi verilerinin latent temsilini tahmin etmektir. Böylece, data2vec algoritması, yerel doğası olan resim, metin veya ses gibi modalitye özgü nesneleri değil, tam eğitim veya girdi verilerinin latent temsilini tahmin eder.

AI Endüstrisinin Data2Vec Algoritmasına Neden İhtiyacı Var?

Kendi Kendine Öğrenme modelleri, eğitim verilerini insan tarafından etiketlenmiş etiketler kullanarak temsil eder ve bu, NLP veya Bilgisayar Görüşü teknolojisindeki ilerlemenin arkasındaki büyük nedenlerden biridir. Bu self-supervised öğrenme temsil edişleri, konuşma tanıma ve makine öğrenimi gibi görevlerde denetimsiz öğrenmenin kullanılmasındaki nedenlerdir.

Şimdiye kadar, bu self-supervised öğrenme algoritmaları, bireysel modaliteler üzerinde odaklanır ve bu, öğrenme yanlılıkları ve modellerdeki belirli tasarımların oluşmasına neden olur. Bireysel modalitye ilişkin self-supervised öğrenme algoritmalarının oluşturduğu zorluklar, bilgisayar görüşü ve NLP gibi çeşitli AI uygulamalarında ortaya çıkar.

Örneğin, konuşma işlemede, konuşma birimleri sözlüğü, NLP’de self-supervised öğrenme görevini tanımlayabilir. Benzer şekilde, bilgisayar görüşünde, geliştiriciler girdi verilerini geri çekebilir, ayrıktı visual token’leri öğrenebilir veya veri artırmaya karşı değişmez temsil edişleri öğrenebilir. Bu öğrenme yanlılıkları kullanışlıdır, ancak bu yanlılıkların diğer modaliteler için genelleştirilip genelleştirilemeyeceğini doğrulamak zordur.

Data2vec algoritması, self-supervised öğrenme endüstrisinde önemli bir dönüm noktasıdır, çünkü birden fazla modalityi geliştirmeyi amaçlar, yalnızca birini değil. Ayrıca, data2vec algoritması, girdi verilerini yeniden oluşturmaya veya karşıtlık öğrenmesine dayanmaz.

Dünya neden data2vec’e ihtiyaç duyuyor? Data2vec algoritması, AI’de ilerlemeyi hızlandırma potansiyeline sahiptir ve AI modellerinin surroundings’ının çeşitli yönlerini sorunsuz bir şekilde öğrenen daha uyumlu AI ve ML modelleri geliştirmeye katkıda bulunur. Bilim adamları, data2vec algoritmasının, bugünden daha advanced görevleri gerçekleştirebilen daha gelişmiş AI modelleri geliştirmelerine olanak tanıyacağına umut ediyorlar.

Data2Vec Algoritması Nedir?

Data2vec, farklı veri modalitelerinde (resim, konuşma ve metin) self-supervised makine öğrenimi uygulamak amacıyla birleşik bir çerçevedir.

Data2vec algoritması, genel desenleri daha iyi öğrenen makine öğrenimi modelleri geliştirmeyi amaçlar ve bunu, farklı modalitelerdeki öğrenme hedefini uniform tutarak gerçekleştirir. Data2vec modeli, öğrenme algoritmasını birleştirir, ancak her modalitye ilişkin temsil edişleri ayrı ayrı öğrenir.

Data2vec algoritmasının tanıtılmasıyla, Meta AI, multimodal öğrenmenin etkili ve daha basit olmasını umuyor.

Data2Vec Algoritması Nasıl Çalışır?

Data2vec algoritması, latent hedef temsil edişlerinin öğrenimi ile masked tahminin birleşimini kullanır, ancak birden fazla ağ katmanını hedef olarak kullanarak latent temsil edişlerini genelleştirir. Model, bir Transformer ağı eğitmeyi amaçlar ve bu, öğretmen veya öğrenci modunda kullanılır.

Öğretmen modunda, model, girdi verilerinin temsil edişlerini oluşturur ve bunlar, öğrenme görevinde hedef olarak kullanılır. Öğrenci modunda, model, girdi verilerinin masked bir versiyonunu kodlar ve bu, tam veri temsil edişlerini tahmin etmek için kullanılır.

Yukarıdaki resim, data2vec modelinin, farklı modaliteler için aynı öğrenme sürecini kullandığını gösterir. İlk adımda, model, girdi verilerinin temsil edişlerini üretir (öğretmen modu). Model, bu temsil edişleri, girdi verilerinin masked bir versiyonuna dayalı olarak geri çekmeyi amaçlar.

Ayrıca, data2vec algoritması, girdi verilerinin latent temsil edişlerini kullanır, bu nedenle, girdi verilerini normalize etme veya değişmez temsil edişleri öğrenme gibi modalitye özgü tasarımların basitleştirilmiş bir versiyonu olarak görülebilir. Ancak, data2vec ve diğer algoritmalar arasındaki kritik farklılaşma noktası, data2vec algoritmasının, hedef temsil edişlerini bağlamsallaştırılmış ve sürekli hale getirmek için self-attention kullanmasıdır. Diğer self-supervised öğrenme modelleri, yerel bağlam temelinde sabit bir hedef kümesi kullanır.

Data2vec: Model Yöntemi

Data2vec modeli, girdi verilerinin kısmi bir görünümüne dayanarak, girdi verilerinin model temsil edişlerini tahmin ederek eğitilir. Şekil olarak görüldüğü gibi, köpeğin yüzü maskedir, ses notunun belirli bir bölümü maskedir ve metinde “ile” kelimesi maskedir.

Model, önce eğitim örneğinin masked bir versiyonunu kodlar (öğrenci modu) ve sonra girdi verilerinin masked olmayan versiyonunu kodlar ve bu, aynı modelin ancak model ağırlıklarının üssel ortalaması olarak parametreleştirildiğinde eğitim hedeflerini oluşturur (öğretmen modu). Ayrıca, hedef temsil edişleri, eğitim örneğinde bulunan bilgileri kodlar ve öğrenci modunda, öğrenme görevi, girdi verilerinin kısmi bir görünümüne dayanarak bu temsil edişleri tahmin etmeyi amaçlar.

Model Mimarisi

Data2vec modeli, girdi verilerinin modalitye özgü kodlamasını kullanan standart bir Transformer mimarisini kullanır. Bilgisayar görüşü ile ilgili görevler için, model, 16×16 piksel boyutundaki yamaları 224×224 piksellik resim olarak kodlar ve her yama, lineer bir dönüşüm olarak uygulanır.

Ayrıca, konuşma tanıma verilerini işlerken, model, 16 kHz dalga formunu 50 Hz temsil edişlerine dönüştüren bir çok katmanlı 1-B convolutional sinir ağı kullanır. Metin verilerini işlerken, model, alt-sözcük birimleri çıkarmak için veriyi ön işler ve sonra dağılsal uzayda vektörler aracılığıyla veriyi gömme yapar.

Maskleme

Model, girdi verilerini token dizisi olarak kodladıktan sonra, bu tokenlerin bir kısmını, bir gömme tokeniyle değiştirerek maskeler ve sonra token dizisini Transformer ağına besler. Bilgisayar görüşü için, model, blok bazlı maskleme stratejisi uygular. Latent konuşma temsil edişleri, konuşma verilerinin belirli aralıklarını maskeler ve dil ile ilgili görevlerde, tokenler maskelenir.

Eğitim Hedefleri

Data2vec modeli, masked örnekten oluşan girdi verilerinin temsil edişlerini, öğrenci modunda masked zaman adımları için tahmin etmeyi amaçlar.

Model, bağlamsallaştırılmış temsil edişleri tahmin eder, bu, yalnızca belirli bir zaman adımını kodlamaz, aynı zamanda örnekten diğer bilgilerini de kodlar, çünkü Transformer ağındaki self-attention kullanır. Bağlamsallaştırılmış temsil edişleri ve Transformer ağı kullanması, data2vec modelini, BERT, wav2vec, BEiT, SimMIM, MAE ve MaskFeat gibi mevcut modellerden ayıran özelliktir.

Aşağıda, data2vec modelinin, öğretmeni parametreleştirmesinin nasıl hedef temsil edişlerini tahmin ettiği gösterilmiştir.

Öğretmen Parametreleştirmesi

Data2vec modeli, EMA (Üssel Hareketli Ortalama)‘yı, model parametrelerinin (θ) üssel hareketli ortalaması olarak kullanır, burada öğretmenin ağırlıkları (△), aşağıdaki gibi belirlenir

                                           ∆ ← τ∆ + (1 − τ ) θ

 

Ayrıca, model, τ parametresini, ilk τ0’dan son τe’ye (hedef değer) lineer olarak artıran bir programı kullanır ve bu, ilk τn güncellemeler boyunca yapılır. Bu güncellemelerin ardından, model, değeri sabit tutar, eğitim sona erene kadar.

Sonuçlar, modelin, öğrenci ve öğretmen modları arasında özellik kodlayıcı ve pozisyonel kodlayıcı parametrelerini paylaştığında daha verimli ve doğru olduğunu gösterir.

Hedefler

Eğitim hedeflerinin oluşturulması, öğretmenin ağının üst K katmanlarının çıktısına bağlıdır ve bu, öğrenci modunda masked zaman adımları için yapılır. Öğretmenin l katmanının t zaman adımındaki çıktısı, a olarak gösterilir ve model, her l katmanını normalize eder ve sonra üst K katmanlarını ortalamalayarak eğitim hedefi y‘i t zaman adımında elde eder

  

 

Bu, öğrenci modunda, modelin, bu hedefleri, masked bir girdi verisi görünümüne dayanarak tahmin etmesini sağlar. İlk deneylerde, data2vec modeli, her katmanı ayrı bir projeksiyonla tahmin ederek ve aynı zamanda daha verimli bir performans göstererek iyi bir performans sergiledi.

Ayrıca, hedefleri normalize etmek, data2vec modelinin, zaman adımları için sabit temsil edişlerine çökmesini önler ve yüksek normalize katmanların, hedef veri kümesindeki özelliklere hakim olmasına engel olur. Konuşma tanıma için, model, öğrenilen parametreler olmadan, geçerli girdi örneği üzerinde örnek normalize kullanır. Bu, girdinin 20 ms’lik bir adımda 400 örnek veya 25 ms’lik bir ses içerdiğinden, komşu temsil edişlerinin yüksek derecede korelasyonlu olmasından kaynaklanır.

Ek olarak, araştırmacılar, konuşma ve NLP için, parametrelerden bağımsız normalize işleminin yeterli performans gösterdiğini bulmuşlardır. Bu problem, Varyans-Değişmezlik-Kovaryans düzenleme ile de çözülebilir, ancak yukarıda bahsedilen strateji yeterli performans gösterir ve ek parametreler gerektirmez.

Hedef

Bağlamsallaştırılmış eğitim hedefleri y‘i t için, model, Yumuşak L1 kaybı kullanır ve bu, aşağıdaki gibi ifade edilir

Burada, β, model tahmini f‘in t zaman adımındaki t‘ye olan farkına bağlı olarak, kare kaybından L1 kaybına geçişini kontrol eder ve β‘nin ayarlanmasına ihtiyaç duyar. Bu kaybın avantajı, aykırı değerlere karşı daha az duyarlı olması ve β‘nin ayarlanmasına ihtiyaç duymamasıdır.

Deneysel Kurulum

Data2vec modeli, iki model boyutuyla denenmiştir: data2vec Large ve data2vec Base. Sayısal stabilite için, EMA güncellemeleri fp32’de yapılır ve modeller, L= 12 veya L= 24 Transformer blokları ve H= 768 veya H= 1024 gizli boyutları içerir. Şimdi, farklı modaliteler ve amaçlar için deneysel kurulumu ayrıntılı olarak inceleyelim.

Bilgisayar Görüşü

Data2vec modeli, 224×224 piksellik resimleri, 16×16 piksellik yamalar olarak kodlar ve her yama, lineer bir dönüşüm olarak uygulanır. Model, BEiT’ye benzer şekilde, komşu yamaların bulunduğu blokları maskeler, her blok en az 16 yamaya sahiptir ve rastgele bir en boy oranı vardır.

Ancak, BEiT modelinde olduğu gibi, %40’ı değil, %60’ı maskeler. Ayrıca, model, resim kırpma, yatay.flip ve renk kararma uygular. Son olarak, data2vec modeli, hem öğretmen hem de öğrenci modunda aynı değiştirilmiş resmi kullanır.

ViT-B modelleri, 800 epoch için ön eğitime tabi tutulur ve data2vec modeli, ViT-L modeli için 8,192 ve ViT-B modeli için 2,048’lik bir batch boyutu kullanır. Data2vec modeli, ayrıca, bir cosine ve bir Adam zamanlaması kullanır ve öğrenme oranını, 80 epoch için 0.001’e çıkarmak için 0.001 için 40 epoch’a ısıtır. ViT-B ve ViT-L için, data2vec modeli, β = 2, K = 6 ve τ = 0.9998’i sabit olarak kullanır ve ayrıca, stokastik derinlik oranını 0.2 olarak ayarlar.

Ayrıca, ViT-L için, model, ilk 800 epoch için 0.9998 öğrenme oranına sahip 1,600 epoch için eğitilir ve ardından öğrenme oranı zamanlamasını sıfırlar ve son 800 epoch için 0.9999 öğrenme oranına sahip olarak devam eder.

Görüntü sınıflandırması için, model, son Transformer bloğunun çıktısının ortalama havuzlamasını kullanır ve bunu, softmax-normalized bir sınıflandırıcıya besler. Model, ViT-L’yi 50 epoch için ve ViT-B’yi 100 epoch için, cosine ve Adam zamanlamasıyla öğrenme oranını ısıtıp, fine-tune eder.

Konuşma İşleme

Konuşma işleme için, data2vec modeli, Fairseq‘yi, bir dizi modelleme kiti olarak kullanır ve bu, özelleştirilmiş modelleri, özetleme, çeviri ve metin üretimi için eğitmek amacıyla kullanılır. Model, 16 kHz dalga formunu girdi olarak alır ve bu, bir özellik kodlayıcısı tarafından işlenir ve 512 kanallı, (10,3,3,3,3,2,2) çekirdek genişliklerine ve (5,2,2,2,2,2,2) adımlarına sahip çok katmanlı bir 1-B convolutional sinir ağı tarafından dönüştürülür.

Bu, çıktı frekansının 50Hz ve her örnek arasındaki adımların 20ms olduğu bir sonuç verir. Alıcı alan, 400 girdi örneğini veya 25 ms’lik bir sesi içerir. Ham dalga formu, girdi olarak unit varyans ve sıfır ortalama olarak normalize edilir.

Data2vec modelinin, Baevski çerçevesine benzer bir maskleme stratejisi vardır ve bu, self-supervised öğrenme için konuşma tanıma görevinde kullanılır. Model, p = 0.065 için tüm zaman adımlarını, başlangıç indisleri olarak örnekler ve ardından on sonraki zaman adımını maskeler. Tipik bir eğitim dizisi için, bu işlem, toplam zaman adımlarının yaklaşık %49’unun maskelenmesine izin verir.

Eğitim sırasında, data2vec modeli, τ’ı lineer olarak, τo = 0.999, τe = 0.9999 ve τn = 30,000 olarak günceller. Data2vec modeli, zirve öğrenme oranının 5×10-4 olduğu Adam optimizatörünü kullanır ve ayrıca, üç aşamalı bir zamanlayıcı kullanır, bu, öğrenme oranını ilk %3’ü lineer olarak ısıtıp, sonraki %90’ı korur ve kalan %7’sini lineer olarak azaltır.

Doğal Dil İşleme

Data2vec modeli, 50K tipin bayt çifti kodlamasını kullanarak girdi metnini tokenize eder ve ardından her tip için bir gömme öğrenir. Veri kodlandıktan sonra, model, BERT maskleme stratejisi uygular ve bu, %15’lik uniform olarak seçilen tokenlerin %80’inin öğrenilen maskeli tokenlerle değiştirilmesini, %10’unun rastgele sözlük tokenleriyle değiştirilmesini ve kalan %10’unun değiştirilmemesini içerir.

Ön eğitime tabi tutulurken, model, τo = 0.999, τe = 0.9999 ve τn = 100,000, K= 10 ve β = 4 olarak ayarlar. Model, zirve öğrenme oranının 2×10-4 olduğu Adam optimizatörünü kullanır ve ayrıca, üç aşamalı bir öğrenme oranı zamanlaması kullanır, bu, öğrenme oranını ilk %5’ini lineer olarak ısıtıp, sonraki %80’ini korur ve kalan %15’ini lineer olarak azaltır. Model, 16 GPU ile, her birinde 512 token içeren 256 dizilik bir batch boyutu kullanır.

Sonuçlar

Şimdi, data2vec modelinin, yukarıda bahsedilen stratejileri uygulayarak farklı modaliteler için nasıl performans gösterdiğini inceleyelim.

Bilgisayar Görüşü

Bilgisayar görüşü için sonuçları değerlendirmek amacıyla, data2vec modeli, ImageNet-1K veri kümesinden alınan resimlerle ön eğitime tabi tutulur. Elde edilen model, aynı benchmarkun etiketli verisiyle fine-tune edilir. Standart uygulamaya göre, model, top-1 doğruluğu açısından, doğrulama verisi üzerinde değerlendirilir.

Sonuçlar, tek bir self-supervised model ve ayrıca ayrı bir görsel tokenleştirici eğitimi veya diğer self-supervised öğrenme modelleri açısından ayırt edilir.

Aşağıdaki tablo, bilgisayar görüşü için data2vec modelinin performansını, ViT-L ve ViT-B modelleri ile diğer mevcut modellerle karşılaştırır.

Yukarıdaki tablodan elde edilen sonuçlar aşağıdaki gibi özetlenebilir:

  • Data2vec modeli, tek model kurulumunda hem ViT-L hem de ViT-B modelleriyle önceki çalışmaları aşar.
  • Data2vec algoritmasının masked tahmin kurulumu, bağlamsallaştırılmış latent temsil edişlerini tahmin ederek, yerel hedefleri tahmin eden yöntemlerden daha iyi performans gösterir.
  • Data2vec modeli, aynı zamanda, öğrenci ağının son katmanını, iki farklı görüntünün iki farklı versiyonunu girdi olarak alarak, self-distillation yöntemlerini de aşar.

Ses ve Konuşma İşleme

Ses ve konuşma işleme için, data2vec modeli, Librispeech(LS-960) veri kümesinden yaklaşık 960 saatlik ses verisiyle eğitilir. Veri kümesi, İngilizce’den alınan temiz konuşma seslerini içerir ve konuşma ve ses işleme endüstrisinde standart bir benchmark olarak kabul edilir.

Modelin, farklı kaynak ayarlarında nasıl performans gösterdiğini analiz etmek için, araştırmacılar, data2vec modelini, otomatik konuşma tanıma için, birkaç dakika ile birkaç saat arasında değişen miktarda etiketli veri kullanarak fine-tune ederler. Modelin performansını analiz etmek için, data2vec, HuBERT ve wav2vec 2.0 ile karşılaştırılır, bu iki algoritma da, ayrıktı konuşma birimleri üzerine dayanan ses ve konuşma temsil öğrenimi için popüler algoritmalardır.

Yukarıdaki tablo, data2vec’in, konuşma tanıma için, kelime hata oranını diğer mevcut modellerle karşılaştırır. LM, kodlama için kullanılan dil modelini temsil eder. Sonuçlar aşağıdaki gibi özetlenebilir:

  • Data2vec modeli, etiketli veri kurulumlarının çoğunda, özellikle 10 dakikalık etiketli veri için, büyük kazançlar sağlar.
  • Büyük modeller için, model, küçük etiketli veri kümelerinde önemli ölçüde daha iyi performans gösterir ve 100 ve 960 saatlik etiketli veri kümeleriyle zengin kaynaklı etiketli veri kümelerinde performansı benzerdir. Bu, genel olarak, zengin kaynaklı etiketli veri kümelerinde performansı doygunluğa ulaştıran modeller için geçerlidir.
  • Performansın analizi, zengin bağlamsallaştırılmış hedeflerin, ayrık birimler öğrenmeye gerek kalmadan, konuşma tanıma görevinde önemli ölçüde performans iyileşmesine yol açabileceğini gösterir.
  • Eğitim sırasında bağlamsallaştırılmış hedeflerin öğrenilmesi, genel performansı önemli ölçüde iyileştirir.

Ayrıca, konuşma tanıma için data2vec yaklaşımını doğrulamak amacıyla, model, AudioSet benchmark’ü üzerinde eğitilir. AudioSet için ön eğitime tabi tutma kurulumu, Librispeech’e benzerdir, ancak model, K= 12 için ve 200,000 güncelleme için eğitilir ve her batchın boyutu 94.5 dakika olarak ayarlanır.

Model, DeepNorm çerçevesini ve katman normalize‘i hedeflere uygulayarak, eğitimi stabilize etmeye yardımcı olur. Ayrıca, model, 21.3 dakika boyutunda batch’lerle ve 13,000 güncelleme için, dengeli alt kümeler üzerinde fine-tune edilir. Model, Linear Softmax Havuzlama ve mixup’u, 0.7’lik bir olasılık puanıyla kullanır ve ardından, 527 benzersiz ses sınıfına single lineer bir projeksiyon ekler ve projeksiyon öğrenme oranını 2e-4 olarak ayarlar.

Ayrıca, ön eğitime tabi tutma parametreleri, 3e-5’lik bir öğrenme oranıyla ayarlanır ve model, fine-tune için maskleme tekniklerini kullanır. Aşağıdaki tablo, sonuçları özetler ve data2vec modelinin, aynı fine-tune ve ön eğitime tabi tutma verisiyle karşılaştırılabilir bir kurulumu aşabileceği görülür.

Doğal Dil İşleme

Data2vec modelinin, metin için performansını analiz etmek amacıyla, model, BERT ve aynı eğitim kurulumunu kullanır ve model, İngilizce Wikipedia veri kümesiyle ön eğitime tabi tutulur ve 1M güncelleme ve 256 dizilik bir batch boyutu kullanılır. Model, GLUE (Genel Dil Anlama Değerlendirmesi) benchmark’ü üzerinde değerlendirilir ve bu, doğal dil çıkarımı görevlerini içerir (MNLI veya Çok Türlü Doğal Dil Çıkarımı), cümle benzerliği (QQP veya Quora Soru Çiftleri benchmark’u, MRPC veya Microsoft (MSFT ) Araştırma Paragraf Korpusu ve STS-B veya Anlamsal Metinsel Benzerlik Benchmark’u), duygu analizi (SST-2 veya Stanford Sentiment Ağacı) ve dilbilgisi (CoLA).

Ayrıca, data2vec modelini fine-tune etmek için, her görev için etiketli veri sağlanır ve geliştirme kümeleri üzerinde ortalama doğruluk báo edilir ve 5 fine-tune çalışması yapılır. Aşağıdaki tablo, data2vec modelinin, doğal dil işleme görevleri için performansını ve diğer modellerle karşılaştırmasını özetler.

  • Yukarıdaki veri, data2vec modelinin, baseline RoBERTa modelini aştığını gösterir, çünkü data2vec modelinin stratejisi, rastgele hedefler kullanmaz.
  • Data2vec modeli, ayrık birimler kullanmayan (karakterler, kelimeler veya alt-kelimeler) ilk başarılı ön eğitime tabi tutulmuş NLP modelidir. Bunun yerine, data2vec çerçevesi, tam masked metin dizisi üzerinde bağlamsallaştırılmış latent temsil edişlerini tahmin eder.
  • Bu, modelin, belirli özelliklere sahip hedefleri, mevcut dizeden tahmin etmesi gereken bir öğrenme görevi oluşturmasına yardımcı olur, ancak her metin biriminin genel bir temsilini tahmin etmek yerine.
  • Ayrıca, hedef kümesi sabit değildir ve model, yeni hedefler tanımlamakta ve açık sözlük ayarlarına açıktır.

Data2Vec: Ablasyon Çalışması

Ablasyon, bir AI veya ML sisteminin bir bileşeninin kaldırılması olarak tanımlanır. Bir ablasyon çalışması, bir AI veya ML modelinin performansını, belirli anahtar bileşenleri modelden kaldırarak analiz etmek için kullanılır ve bu, araştırmacılara, bu bileşenin genel sistemdeki katkısını anlamalarına yardımcı olur.

Katman Ortalama Hedefler

Data2vec ve diğer self-supervised öğrenme modelleri arasındaki önemli bir fark, data2vec modelinin, öğretmenin ağının birden fazla katmanından ortalama hedefleri kullanmasıdır. Bu fikir, wav2vec 2.0 modelinin üst katmanlarının, alt katmanlarına kıyasla, aşağı akış görevleri için daha iyi performans göstermemesinden gelir.

Aşağıdaki deneyde, tüm üç modalitynin performansı, K= 1, 2, …, 12 olarak ortalama hedeflerin alınmasıyla ölçülür, burada K= 1, yalnızca en üst katmanı tahmin eder. Ancak, daha hızlı bir dönüş zamanı elde etmek için, data2vec, 12 katmanlı bir temel modeli eğitmeyi amaçlar. Konuşma tanıma için, model, Librispeech üzerinde 200,000 güncelleme için ön eğitime tabi tutulur ve ardından 10 saatlik etiketli bir bölüme fine-tune edilir. Doğal dil işleme için, model, GLUE benchmark’ünün doğrulama kümesindeki ortalama puanını bildirir ve bilgisayar görüşü için, model, 300 epoch için ön eğitime tabi tutulur ve ardından ImageNet veri kümesindeki en iyi top-1 doğruluğunu bildirir.

Yukarıdaki şekil, birden fazla katmandan oluşan hedeflerin, tüm modaliteler için, yalnızca en üst katmanı (K=1) kullanmaktan daha iyi performans gösterdiğini gösterir. Tüm kullanılabilir katmanları kullanmak, iyi bir uygulamadır, çünkü sinir ağları, farklı türdeki özellikler oluşturur ve bu özellikler, çeşitli katmanlarda çıkarılan özelliklerdir.

Birden fazla katmandan alınan özellikler, performansı artırır ve self-supervised öğrenme sürecini zenginleştirir.

Hedef Özellik Türü

Data2vec modelinin Transformer blokları, hedef olarak hizmet edebilecek birden fazla katmana sahiptir. Farklı katmanların performansı nasıl etkilediğini analiz etmek için, model, konuşma tanıma modellerini, farklı katmanları hedef özelliklerine olarak kullanarak ön eğitime tabi tutulur.

Aşağıdaki şekil, clearly, besleme ileri ağının (FFN) çıktısının ideal çalıştığını, ancak self-attention bloklarının çıktısının, kullanılabilir bir model oluşturmadığını gösterir.

Hedef Bağlamsallaştırmaları

Data2vec modelinin öğretmeni, girdi verilerinin tümüne self-attention uygulayarak bağlamsallaştırılmış hedefler oluşturur. Bu, data2vec’i, yerel parçalarını yeniden oluşturmak veya tahmin etmek için bir öğrenme görevi oluşturan diğer self-supervised öğrenme modellerinden ayıran bir özelliktir.

Araştırmacılar, data2vec modelinin, bağlamsallaştırılmış hedeflere ihtiyacı olup olmadığını cevaplamak için, öğretmenin self-attention mekanizmasını, yalnızca girdi verilerinin bir kısmına erişim izni veren bir şekilde kısıtlar. Ardından, modeli, tam bağlam boyutuna erişim izniyle fine-tune eder.

Aşağıdaki şekil, daha büyük bağlam boyutlarının genellikle daha iyi performans sağladığını ve girdi örneklerinin tamamının görünür olduğu durumlarda en iyi doğruluğun elde edildiğini gösterir. Ayrıca, zengin hedef temsil edişlerinin, daha iyi performans sağladığını kanıtlar.

Modalitye Özgü Özellik Çıkarıcılar ve Maskleme

Data2vec’in birincil amacı, farklı modaliteler için basit bir öğrenme mekanizması tasarlamaktır. Bu, mevcut modellerin ve çerçevelerin, modalitye özgü maskleme ve özellik çıkarıcılar kullandıkları için, genellikle tek bir modalitye odaklandıkları anlamına gelir.

Bu, girdilerin doğası farklı olduğu için mantıklıdır. Örneğin, konuşma tanıma modelleri, yüksek çözünürlüklü girdi verilerini (10 kHz dalga formu gibi) kullanır ve bu, binlerce örnek içerir. Dalga formu, bir çok katmanlı convolutional sinir ağı tarafından işlenerek, 50 Hz temsil edişlerine dönüştürülür.

Yapılandırılmış ve Bağlamsallaştırılmış Hedefler

Data2vec ve diğer masked tahmin modelleri arasındaki ana farklılaşma noktası, data2vec modelinin, öğretmenin ağının tüm masked girdisine self-attention uygulayarak bağlamsallaştırılmış hedefler oluşturmasıdır.

Diğer çerçeveler gibi BYOL (Bootstrap Your Own Latent) veya DINO, data2vec gibi latent temsil edişleri kullanır, ancak bunların birincil odak noktası, dönüşüme karşı değişmez temsil edişleri öğrenmektir.

Son Düşünceler

AI ve ML endüstrisindeki son çalışmalar, uniform model mimarilerinin, birden fazla modalityi ele almak için etkili bir yaklaşım olabileceğini göstermiştir. Data2vec modeli, konuşma, resim ve dil gibi üç modalitye için self-supervised öğrenme yaklaşımını kullanır.

Data2vec modelinin temel kavramı, kısmi girdi görünümünü kullanarak, girdi verilerinin bağlamsallaştırılmış bilgilerini veya girdi verilerini geri çekmektir. Data2vec çerçevesinin kullandığı yaklaşım, efektiftir, çünkü model, önceki self-supervised öğrenme modellerinden daha iyi performans gösterir, özellikle ImageNet-1K veri kümesinde, hem ViT-B hem de ViT-L tek modelleri için.

Data2vec, gerçekten self-supervised öğrenme endüstrisinde bir dönüm noktasıdır, çünkü birden fazla modalityi öğrenmek için tek bir öğrenme yönteminin, modellerin modaliteler arasında öğrenmesini daha kolay hale getirebileceğini kanıtlar.

Mesleği mühendis, kalbi yazar. Kunal, AI ve ML'ye derin bir sevgi ve anlayışla technical writer, bu alanlardaki karmaşık kavramları etkileyici ve bilgilendirici belgelerle basitleştirmeye adanmış.