Yapay zeka temelleri

Few-Shot Öğrenme Nedir?

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Few-shot öğrenme bir modelin yalnızca az sayıda etiketli örnekten yeni bir görev ya da sınıfa nasıl uyum sağlayabileceğini inceler. Klasik benchmarklarda, bir bölüm bir destek kümesi sağlar—örneğin beş sınıf, her sınıf için bir ya da beş örnek—ve modelden görülmemiş sorguları sınıflandırması istenir.

Terim, aynı zamanda önceden eğitilmiş bir dil modelinin parametrelerini güncellemeden isteminde birkaç gösterim almasıyla gerçekleşen bağlam içinde öğrenme için de kullanılır. Bu ayarlar az örnekli hedefi paylaşır ancak farklı uyum mekanizmaları kullanır ve farklı değerlendirme tasarımları gerektirir.

Temel Çıkarımlar

  • N-way K-shot, N sınıf ve her sınıf için K etiketli destek örneğini tanımlar.
  • Metrik‑öğrenme yöntemleri, sorguları destek örneklerinin öğrenilmiş temsilleriyle karşılaştırır.
  • Meta‑öğrenme, birçok görev üzerinde optimize eder, böylece yeni bir görev hızlıca öğrenilebilir.
  • Az sayıda örnek, etiket hatalarını, sızıntıyı, sınıf belirsizliğini ve güvensizliği artırır; bu yüzden temel modeller ve güven raporlaması önemlidir.
Few-Shot Öğrenme Nedir? destek kümesini, temsili, uyumu / karşılaştırmayı, sorguyu, tahmini ve değerlendirmeyi gösteren diyagram
Sınıfları veya görevleri ayırarak bölümün ezberlemeden uyumu test etmesini sağlayın.

Bölümler, destek kümeleri ve sorgu kümeleri

Bir few-shot bölümü, değerlendirme için kullanılan bir sorgu kümesinden küçük bir etiketli destek kümesini ayırır. Meta‑eğitim sırasında model birçok böyle bölüm görür. Güçlü bir değerlendirme, tüm sınıfları, görevleri ya da alanları ayırarak test bölümünün ezberlemeden uyumu ölçmesini sağlar.

Tek bir örnek yerine birçok bölümde doğruluk dağılımları raporlayın. Basit en yakın komşu ve lineer temel modellerle karşılaştırın; iyi eğitilmiş bir temsil ve temel bir sınıflayıcıyı geçemeyen karmaşık bir yöntem, karmaşıklığını haklı çıkarmaz.

Metrik öğrenme ve prototipler

Eşleştirme ağları ve benzeri yöntemler, destek ve sorgu örneklerini yakın vektörlerin aynı etiketi paylaşması gereken bir uzaya gömer. Prototipik ağlar, her sınıf için destek gömmelerinin ortalamasını alır ve bir sorguyu bu sınıf prototiplerine olan mesafeye göre sınıflandırır.

Bu, few-shot öğrenmeyi temsil kalitesiyle bağlar. Önceden eğitilmiş bir derin öğrenme modeli ilgili özellikleri zaten iyi düzenlemiş olabilir, ancak uyumsuz bir temsil her mesafeyi yanıltıcı kılabilir.

Optimizasyon temelli meta-öğrenme

Model‑Agnostik Meta‑Öğrenme, birkaç gradyan adımıyla uyum sağlayabilecek parametreleri arar. Diğer yöntemler bir optimizasyon algoritması, bir başlangıç noktası ya da bir parametre güncelleme kuralı öğrenir. Dış döngü, uyum sonrası performansı görevler arasında değerlendirir.

Meta‑öğrenme, faydalı bir yapının eğitim ve hedef görevler arasında paylaşıldığını varsayar. Hedef dağılımı keskin şekilde farklı olduğunda hızlı uyum başarısız olabilir. Doğrulama, bir benchmarki evrensel kabul etmek yerine örnek sayısını, sınıfları, alanları ve görev zorluğunu çeşitlendirmelidir.

Transfer öğrenmesi ve veri‑seviyesi stratejiler

Transfer öğrenmesi genellikle en güçlü pratik başlangıç noktasıdır: önceden eğitilmiş bir kodlayıcıyı dondurun, küçük bir başlık eğitin ve yeterli veri varsa seçici olarak ince ayar yapın. Veri artırma, değişmezlikler ekleyebilir, ancak gerçek dışı sentetik örnekler yanlılığı artırabilir ya da kestirme yollar yaratabilir.

Aktif öğrenme, hangi örneklerin etiketleneceğini önceliklendirebilir, yarı‑denetimli öğrenme ise ek etiketsiz verileri kullanabilir. Bunlar tamamlayıcı stratejilerdir, few-shot öğrenmenin eş anlamlıları değildir.

Few-shot istemi farklıdır

Bir transformer, bağlamına yerleştirilen gösterimlerden bir desen çıkarabilir. Kalıcı bir parametre güncellemesi gerekmez. Sıra, ifadeler ve etiket dengesi çıktıyı önemli ölçüde değiştirebilir ve örnekler bağlam penceresinin büyük bir kısmını tüketebilir.

Temsilci bir değerlendirme seti kullanın, her istemi ve gösterimi sürümleyin ve sıfır‑shot, few-shot ve ince ayarlı alternatifleri test edin. Çok küçük bir destek kümesi, özellikle nadir ya da güvenlik açısından kritik durumlar için geniş nüfus iddialarını desteklemez.

Few-shot öğrenme paradigmaları ve görev inşası

Few-shot öğrenme, çok az sayıda etiketli örnekle bir görevi yerine getirmeyi amaçlar. Metrik‑tabanlı yöntemlerde, bir kodlayıcı örnekleri en yakın prototiplerin ya da komşuların sınıfları temsil ettiği bir uzaya haritalar. Optimizasyon temelli meta‑öğrenme, hızlı uyum için bir başlangıç noktası ya da güncelleme kuralı eğitir. Transfer öğrenmesi, önceden eğitilmiş bir modeli küçük bir hedef kümesi üzerinde ince ayar yapar. Bağlam içinde öğrenme, ağırlıkları güncellemeden bir istemde örnekler sağlar. Bu mekanizmalar farklıdır; bu yüzden iddialar parametrelerin değişip değişmediğini, önceki eğitimin ne olduğunu ve örneklerin nasıl seçildiğini belirtmelidir.

Değerlendirme, iddia edilen genelleme doğrultusunda eğitim ve test sınıflarını, görevleri, konuları ya da alanları ayırmalıdır. N-way K-shot bir bölüm, N sınıf ve her sınıf için K destek örneği ile puanlama için sorgu örneklerini içerir. Tekrarlanan bölümler, destek seçiminin varyansını tahmin eder. İstemlerde, örnek sırası, etiket ifadesi, format ve gösterim benzerliği sonuçları önemli ölçüde değiştirebilir. Aynı temsil ve veri bütçesini kullanarak sıfır‑shot, en yakın komşu, lineer‑probe ve normal ince ayar temel modelleriyle karşılaştırın.

Veri kalitesi, belirsizlik ve negatif transfer

Az sayıda örnekle, hatalı etiketlenmiş ya da tipik olmayan vakalar orantısız bir etki yapar. Etiketleme kurallarını tanımlayın, her destek öğesini inceleyin ve bilinmeyen ya da çekimser bir sonuç koruyun. Veri artırma ve sentetik örnekler, yalnızca görevi korudukları ve gerçekçi varyasyon ekledikleri sürece yardımcı olabilir. Önceden eğitilmiş bir model, kaynak alanından kestirme yolları ya da yanlılığı aktarabilir. Alan dışı vakaları, nadir grupları ve bir destek örneğinin kaldırılmasına duyarlılığı test edin. Tek bir avantajlı istem yerine görevler ve rastgele tohumlar arasında güven aralıklarını raporlayın.

Aktif öğrenme, bilgilendirici vakalar için etiket isteyebilir, yarı‑denetimli yöntemler ise ek varsayımlar altında etiketsiz verileri kullanır. Getirme, ilgili gösterimleri dinamik olarak seçebilir ancak test‑etiket sızıntısını önlemelidir. Uyumluluk hızlıca aşırı öğrenebilir, bu yüzden güncellemeleri kısıtlayın, düzenleme kullanın ve ayrı örneklerde doğrulama yapın. Yüksek riskli görevlerde, birkaç etiket nadiren otonom kararları haklı çıkarır; modelin önceliklendirme ya da inceleme yardımcısı olarak kullanılmasını, yeterli sonuç kanıtı elde edilene kadar sürdürün.

Üretim operasyonu

Temel modeli, gömme ya da istem şablonunu, gösterimleri, etiket şemasını ve uyum parametrelerini sürümleyin. Örnekleri koruyun çünkü istemler veya gradyanlar hassas kayıtları ortaya çıkarabilir. Sınıflar ve dil değiştikçe performansı izleyin ve destek örneklerini otomatik kendi‑etiketlemeden ziyade yönetilen bir inceleme yoluyla yenileyin. Few-shot öğrenme, önceden var olan yapıyı kullanarak etiketli hedef ihtiyacını azaltır; ancak temsilci bir değerlendirme, dikkatli görev tanımı, alan uzmanlığı ya da yeni görev bu önceden var olanın dışına çıktığında güvenli bir geri dönüş ihtiyacını ortadan kaldırmaz.

Uygulamalı örnek: yeni bir ürün için few-shot sınıflandırma

Bir destek ekibi, bir ürün için her sorun başına yalnızca beş incelenmiş örnekle yönlendirme etiketlerine ihtiyaç duyar. Önceden eğitilmiş bir gömme içinde en yakın prototipleri, lineer bir başlığı, parametre‑verimli ince ayarı ve bağlam‑içinde istemi karşılaştırır. Ürün aileleri, müşteriler ve sonraki mesajlar meta‑eğitim ve model seçimi dışına tutulur. Tekrarlanan destek‑kümesi örneklemesi, sınıf hatırlama, kalibrasyon, varyans ve tek bir hatalı gösterime duyarlılığı raporlar.

Düşük güvenilirlik ve desteklenmeyen mesajlar genel desteğe yönlendirilir ve gözden geçirenler, yönetilen bir kuyruğa aracılığıyla etiketleri düzeltir. Örnekler kimlikleri kaldırılmış, sürümlenmiş ve nihai test kümesinden asla seçilmez. İzleme, yeni kelime hazinesini, sınıf oranlarını, düzeltmeleri ve anlaşmazlıkları takip eder. Yeterli etiket biriktiğinde, few-shot sistemi normal denetimli eğitimle karşılaştırılır. Hızlı kurulum faydalıdır, ancak performans istikrarsız kalırsa ya da yeni ürün önceki görev ailelerinden önemli ölçüde farklıysa otomasyonu haklı çıkarmaz.

Uygulama kanıtları ve operasyonel hazırlık

Bir üretim kararı, başarılı bir gösterimden daha fazlasını gerektirir. Hedef kullanıcıları, çalışma ortamını, girdileri, çıktıları, bağımlılıkları, sorumluyu ve her önemli hatanın sonucunu tanımlayın. Ayarlamadan önce tekrarlanabilir bir temel model ve sürümlenmiş bir değerlendirme seti oluşturun. Normal vakaları, sınır koşullarını, bozuk ya da eksik girdileri, dağılım kaymasını, bağımlılık kesintisini, kötüye kullanımı ve hizmet dışı kalma ihtimali yüksek grup ya da ortamları test edin. Görev kalitesini kalibrasyon veya belirsizlik, gecikme, verim, kaynak maliyeti, erişilebilirlik, gizlilik ve güvenlik ile birlikte ölçün. Bağımsız bir gözden geçiricinin sonucu yeniden üretebilmesi ve kanıtı çekici bir prototipten ayırabilmesi için her dönüşümü ve eşiği kaydedin.

Başlamadan önce, sürüm, istisna, değişiklik, geri alma ve emeklilik yetkisini atayın. Aşamalı bir dağıtım kullanın, güvenli bir geri dönüşü koruyun ve kasıtlı olarak eklenen hatalarla izlemeyi doğrulayın. Operasyonel telemetri, gereksiz hassas veri toplamayarak giriş kalitesini, çıktı davranışını, model ya da kural sürümünü, bağımlılık sağlığını, insan müdahalelerini ve onaylanmış sonuçları ortaya koymalıdır. Uyarı eşiklerini ve bir yanıt sorumlusunu tanımlayın, ardından çevrimdışı performansın devam edeceğini varsaymak yerine dağıtımdan sonra gerçek dünya kanıtlarını gözden geçirin. Veri kaynakları, kullanıcılar, modeller, satıcılar, politikalar, donanım veya hedefler değiştiğinde yeniden değerlendirin. Bakımı yapılan bir sistem, belgelenmiş bir kurtarma, olay öğrenimi, silme ve saklama prosedürleri ve devre dışı bırakılması ya da değiştirilmesi gerektiği açık bir noktaya da ihtiyaç duyar.

Sıkça Sorulan Sorular

One-shot öğrenme, few-shot öğrenme ile aynı mıdır?

One-shot öğrenme, her sınıf ya da görev için bir etiketli destek örneği bulunan özel bir durumdur. Zero-shot öğrenme ise hedefte hiçbir etiketli örnek kullanmaz.

Few-shot öğrenme, veri ihtiyacını ortadan kaldırır mı?

Hayır. Bağımlılığı ön‑eğitim verilerine, ilgili görevlere, temsillere ve varsayımlara kaydırır. Hedef etiketler azdır; toplam öğrenme geçmişi genellikle büyüktür.

Temel referanslar

Blog yazarı ve programcı, Machine Learning ve Deep Learning konularında uzmanlık sahibi. Daniel, başkalarının AI'nin gücünü sosyal fayda için kullanmasına yardımcı olmak umudu taşıyor.