Yapay zeka temelleri

Transfer Öğrenme Nedir?

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Transfer öğrenme bir problem için öğrenilen bilgiyi ilgili bir problemde öğrenmeyi iyileştirmek için yeniden kullanır. Tüm parametreleri rastgele başlatmak yerine, uygulayıcı önceden eğitilmiş bir model veya temsil ile başlar ve onu hedef göreve uyarlamaktadır.

Bu yaklaşım, hedef veri kümesi küçük olduğunda, etiketleme maliyetli olduğunda veya ön‑eğitimin hedef ekip için haklı çıkarılamayacak kadar fazla işlem gücü gerektirdiğinde özellikle faydalıdır. Sıfırdan bir model eğitmek, transfer öğrenmeye alternatif bir yöntemdir—transfer öğrenmenin bir türü değildir.

Temel Çıkarımlar

  • Özellik çıkarımı, önceden eğitilmiş temeli dondurur ve yeni görev‑özel bir başlık (head) eğitir.
  • İnce ayar, hedef alan verilerini kullanarak bazı veya tüm önceden eğitilmiş parametreleri günceller.
  • Adaptörler ve LoRA gibi parametre‑verimli yöntemler, modelin yalnızca küçük bir kısmını günceller.
  • Kaynak ve hedef alanlar farklı olduğunda, lisanslar çakıştığında veya kaynak model uygunsuz bir yanlılık taşıdığında transfer başarısız olabilir.
Transfer-learning diagram showing a pretrained base model reused through feature extraction, full fine-tuning, or a small LoRA adapter for a target task
Transfer öğrenme, önceden eğitilmiş temsilleri farklı miktarlarda eğitilebilir kapasiteyle uyarlamaktadır.

Transfer öğrenmenin neden işlediği

Modeller, genellikle yalnızca eğitildikleri verilerin ötesinde de faydalı temsiller öğrenir. Bir görüntü modelinin erken katmanları yeniden kullanılabilir yerel desenleri yakalayabilir; bir dil modeli ise kendiliğinden denetimli tahminle sözdizimi, anlambilim ve geniş ilişkilendirmeler öğrenebilir. Hedef görev, sınırlı örneklerden her şeyi yeniden öğrenmek yerine bu temsiller üzerine inşa edebilir.

Fayda, kaynak ve hedef görevler arasındaki benzerliğe, ön‑eğitimin ölçeğine ve kalitesine ve modelin nasıl uyarlanacağına bağlıdır. Yeniden kullanım garanti değildir: aktarılmış özellikler alakasız ya da hatta zararlı olabilir.

Özellik çıkarımı

Özellik çıkarımında, önceden eğitilmiş temel dondurulur ve parametreleri değişmez. Çıktısı yeni bir sınıflandırıcı, regresör veya başka bir görev‑özel başlık (head) için girdi olur. Yalnızca yeni başlık eğitilir.

Bu yöntem hızlı ve veri‑verimli olup, faydalı önceden eğitilmiş temsillerin bozulma riskini azaltır. Hedef alan, ön‑eğitimden büyük ölçüde farklı olduğunda yetersiz uyum da gösterebilir. Batch normalization gibi katmanlar, saklanan istatistikleri ve eğitim davranışları nedeniyle, ağırlıkların çoğu dondurulmuş olsa bile uyarlamayı etkileyebileceği için özel bir özen gerektirir.

İnce ayar

İnce ayar, önceden eğitilmiş parametreleri hedef veriler üzerinde günceller. Yaygın bir iş akışı şudur:

  1. Önceden eğitilmiş modeli yükleyin ve çıktı başlığını değiştirin veya ekleyin.
  2. Temeli dondurun ve yeni başlığı eğitin.
  3. Seçili katmanları—veya tüm modeli—dondurmayı kaldırın ve daha düşük bir öğrenme oranı ile devam edin.
  4. Aşırı öğrenme, unutma ve hedef alan performansı açısından doğrulama yapın.

Sadece son katmanların ayarlanması gerektiğine dair evrensel bir kural yoktur. En iyi seçim, mimari, hedef veri büyüklüğü, alan benzerliği, normalizasyon katmanları, bellek ve işlem gücüne bağlıdır. Tam ince ayar daha fazla kapasite sunabilir ancak daha fazla kaynak gerektirir ve yıkıcı unutmaya yol açabilir.

Parametre‑verimli ince ayar

Büyük transformer’lar, tam ince ayarı pahalı hâle getirir. Parametre‑verimli ince ayar (PEFT), temel modelin çoğunu dondururken küçük bir parametre kümesini değiştirir veya ekler.

  • Adaptörler, ağa küçük eğitilebilir modüller ekler.
  • LoRA, ağırlık güncellemelerini düşük rütbeli matrislerle temsil eder; böylece eğitilebilir parametreleri ve optimizasyon bellek tüketimini azaltır.
  • Prompt ve prefix ayarı, sürekli görev‑özel girişler veya iç ön ekler öğrenir.

PEFT, tek bir temel model etrafında birçok görev uyarlamasını depolayabilir; ancak çıkarım hizmeti, adaptör uyumluluğu ve birleştirilmiş ağırlık yönetimi hâlâ titiz mühendislik gerektirir.

Veri türleri arasında transfer öğrenme

Görüntü sınıflandırıcıları genellikle büyük görüntü veri kümeleri üzerinde önceden eğitilmiş modellerle başlar. Dil sistemleri ise bir temel modelden başlayıp denetimli ince ayar, tercih optimizasyonu, geri getirme ya da araç kullanımıyla uyarlama yapar. Konuşma, ses, protein ve çok‑modlu modeller de benzer desenleri izler.

Transfer, orijinal modeli değiştirmeden de gerçekleşebilir. Dondurulmuş bir model, aşağı akış sınıflandırıcı, bir vektör benzerlik araması sistemi veya bir geri getirme hattı için gömme (embedding) üretebilir.

Alan kayması ve negatif transfer

Alan kayması, hedef girdileri kaynak verilerden farklı olduğunda ortaya çıkar. Örneğin, bir tıbbi görüntü modeli, ön‑eğitimde bulunmayan ekipman, popülasyon veya elde etme protokolleriyle karşılaşabilir. Negatif transfer, yeniden kullanımın hedef performansını uygun bir sıfırdan başlangıç temelinden daha kötüye götürmesi demektir.

Ekipler, uyarlama stratejilerini karşılaştırmalı, anlamlı alt grupları değerlendirmeli ve bir hedef‑alan test seti tutmalıdır. Kaynak görev uyumsuzsa, daha küçük bir alan‑özel model, daha büyük bir genel modeli geride bırakabilir.

Lisanslama, köken ve güvenlik

İndirilebilir bir model, otomatik olarak dağıtıma güvenli değildir. Lisansı, izin verilen kullanım alanlarını, eğitim verisi açıklamalarını, model‑kartı sınırlamalarını ve bağımlılık zincirini gözden geçirin. Modeller yanlılığı yeniden üretebilir, hassas verileri hafızada tutabilir veya zararlı serileştirilmiş kod içerebilir. Güvenilir formatlar kullanın, artefaktları tarayın ve güvenilmeyen ağırlıkları izole bir ortamda yükleyin.

Transfer öğrenmenin ne zaman kullanılacağı

Transfer öğrenme, ilgili bir önceden eğitilmiş model mevcut ve hedef veri sınırlı olduğunda güçlü bir varsayılan seçenektir. Alan çok özelleşmiş, lisans uyumsuz, model boyutu dağıtım sınırlarını aşan veya basit bir görevin büyük bir önceden eğitilmiş temsilden fayda sağlamadığı durumlarda sıfırdan eğitim tercih edilebilir. Karar, model ölçeğinden varsayım yapmak yerine ampirik olarak doğrulanmalıdır.

Ne transfer edilir ve nasıl uyarlanır

Transfer öğrenme, bir kaynak görev veya veri kümesinde öğrenilen temsilleri hedef görev için yeniden kullanır. Görüntüde, erken özellikler genellikle kenarları ve dokuları yakalar; dilde, önceden eğitilmiş modeller tokenlar ve bağlamlar arasındaki istatistiksel desenleri kodlar. Transfer, kaynak temsillerinin hedef için ilgili bilgi içerdiğinde işe yarar, ancak alan, etiket, modalite ve elde etme farklılıkları negatif transfere yol açabilir. Önceden eğitilmiş bir temel modelle başlayın, eğitim lisansını ve belgelerini inceleyin ve bunu sıfırdan küçük bir hedef‑özel model eğitmekle karşılaştırın.

Özellik çıkarımı, omurgayı dondurur ve yeni bir başlık eğitir; kısmi ince ayar seçili katmanların dondurulmasını kaldırır; tam ince ayar tüm modeli günceller. Parametre‑verimli yöntemler adaptörler veya düşük rütbeli güncellemeler ekleyerek eğitilebilir parametre sayısını azaltır ancak çıkarım belleğini mutlaka düşürmez. Önceden eğitilmiş ağırlıklar için daha düşük bir öğrenme oranı kullanın, normalizasyon davranışını koruyun ve gerektiğinde takvimler, düzenleme, tekrar eğitimi veya kısıtlı güncellemelerle yıkıcı unutmayı önleyin. Hedef doğrulama verileri üzerinde kontrol noktaları seçin ve küçük hedef veri kümelerinin yüksek varyans üretmesi nedeniyle birden fazla tohum (seed) deneyin.

Veri, değerlendirme ve dağıtım ticaretleri

Hedef veri, dağıtım koşullarını ve önemli alt grupları temsil etmelidir; sadece uygun bir etiketli örnek olmamalıdır. Konu, kaynak, zaman veya konuma göre bölerek ilgili örneklerin bölümler arası geçişini önleyin. Hem alan içi hem de kaymış koşulları test edin. Dondurulmuş, kısmen ayarlanmış ve tam ayarlanmış varyantları kalite, kalibrasyon, eğitim maliyeti, gecikme ve dayanıklılık açısından karşılaştırın. Ortalama puandaki bir iyileşme, kaynak yanlılığından gelen nadir sınıflardaki kaybı gizleyebilir. Kaynağa özgü kısayollar, kelime hazinesi eksikleri veya sensör farklılıkları için başarısızlık örneklerini inceleyin.

Temel modeli, ağırlıkları, tokenizer ya da ön işleme, adaptörü, veriyi ve lisansı tek bir bağımlılık grafiği olarak izleyin. Barındırılan temel modeller davranışı değiştirebilir; açık ağırlıklar tedarik zinciri ve yama sorumlulukları getirebilir. Birleştirilmiş veya dışa aktarılmış artefaktı doğrulayın ve güvenilmeyen kaynaklardan gelen model dosyalarını tarayın. Üretimde, hedef kayması ve performansı izleyin ve hem uyarlamayı hem de temel sürümü geri alabilme yeteneğini koruyun. Transfer, gereken hedef veriyi azaltır; etiketleme, değerlendirme, gizlilik veya alan uzmanlığını ortadan kaldırmaz.

Uygulamalı örnek: Görüntü modelini yeni bir klinik için uyarlama

Bir klinik, tanısal incelemeden önce görüntü kalitesini sınıflandırmak için önceden eğitilmiş bir görüntü kodlayıcıyı uyarlamaktadır. Kaynak modelin lisansını ve hedeflenen modalitesini doğrular, yerel cihazları ve elde etme koşullarını toplar ve hastaya göre bölümleme yapar. Dondurulmuş özellik, adaptör, kısmi ve tam ince ayar varyantları, küçük bir yerel temel model ile karşılaştırılır. Ölçütler arasında sınıf hatırlama, kalibrasyon, alt grup davranışı, hesaplama ve cihaz, site ve nadir artefaktlara duyarlılık yer alır.

Uyarlanan model tanı koyamaz ve düşük güvenilirlikteki ya da desteklenmeyen görüntüleri teknisyenlere yönlendirir. Dışa aktarım doğrulaması, yerel ön işleme ve sayısal eşdeğerliği onaylar. Model, adaptör, cihaz ve veri kümesi sürümleri kayıtta bağlanır. İzleme, yeni tarayıcıları, protokol değişikliklerini ve çıktı kaymasını tespit eder; periyodik incelenen örnekler gerçek performansı tahmin eder. Bir kaynak model yükseltmesi, doğrulama gerektiren yeni bir bağımlılık olarak ele alınır; transfer öğrenme, eski kanıtların otomatik olarak yeniden kullanılmasını haklı kılmaz.

Uygulama kanıtları ve operasyonel hazırlık

Bir üretim kararı, sadece başarılı bir gösterimden daha fazlasını gerektirir. Hedef kullanıcıları, çalışma ortamını, girdileri, çıktıları, bağımlılıkları, sorumluyu ve her önemli hatanın sonucunu tanımlayın. Ayarlamadan önce tekrarlanabilir bir temel ve sürümlenmiş bir değerlendirme seti oluşturun. Normal vakaları, sınır koşullarını, hatalı ya da eksik girdileri, dağılım kaymasını, bağımlılık kesintisini, kötüye kullanımı ve en çok hizmet dışı kalabilecek grup ya da ortamları test edin. Görev kalitesini kalibrasyon veya belirsizlik, gecikme, verim, kaynak maliyeti, erişilebilirlik, gizlilik ve güvenlik ile birlikte ölçün. Bağımsız bir inceleyicinin sonucu yeniden üretebilmesi ve kanıtı çekici bir prototipten ayırabilmesi için her dönüşümü ve eşiği kaydedin.

Yayına almadan önce, sürüm, istisna, değişiklik, geri alma ve emeklilik yetkisini atayın. Aşamalı bir dağıtım kullanın, güvenli bir geri dönüşü koruyun ve bilinçli olarak eklenen hatalarla izlemeyi doğrulayın. Operasyonel telemetri, gereksiz hassas veri toplamadan giriş kalitesini, çıktı davranışını, model veya kural sürümünü, bağımlılık sağlığını, insan müdahalelerini ve doğrulanmış sonuçları ortaya koymalıdır. Uyarı eşiklerini ve bir yanıt sorumlusunu tanımlayın, ardından çevrim dışı performansın devam edeceği varsayımını yapmadan dağıtımdan sonra gerçek dünya kanıtlarını inceleyin. Veri kaynakları, kullanıcılar, modeller, satıcılar, politikalar, donanım veya hedefler değiştiğinde yeniden değerlendirin. Sürekli bir sistem, belgelenmiş kurtarma, olay öğrenimi, silme ve saklama prosedürleri ve devre dışı bırakılması veya değiştirilmesi gereken net bir nokta da gerektirir.

Birincil Referanslar

Blog yazarı ve programcı, Machine Learning ve Deep Learning konularında uzmanlık sahibi. Daniel, başkalarının AI'nin gücünü sosyal fayda için kullanmasına yardımcı olmak umudu taşıyor.