Anderson’un Açısı
Model Sürümleri Arasında Hayatta Kalabilen LoRAlar

Benim Hunyuan Video LoRAlarının büyümesiyle ilgili yakın zamanda yaptığım kapsamlı incelemenin ardından, Civit topluluğunda ilgili LoRAların sayısı %185 arttı.

Hunyuan Video LoRA oluşturmanın kolay veya düşük çaba gerektiren bir yolu olmadığı halde, Civit’teki ünlüler ve temalar için LoRA kataloğu günlük olarak büyümektedir. Kaynak: https://civitai.com/
Aynı topluluk, bu ‘ek kişilikler’i Hunyuan Video (HV) için üretmeye çalışırken, aynı zamanda Hunyuan Video’da görüntü’den videoya (I2V) işlevselliğinin vaat edilen yayımını bekliyor.
Açık kaynaklı insan görüntü senteziyle ilgili olarak, bu büyük bir meseledir; Hunyuan LoRAlarının büyümesiyle birleştiğinde, kullanıcıların fotoğrafları videolara dönüştürebilmelerine olanak tanıyabilir, bu da gelişen videoyla birlikte kimliklerini kaybetmeden dönüşebilir – bu, tüm güncel görüntü’den videoya dönüştürme üreticilerinde, Kling, Kaiber ve çok övülen RunwayML’de olduğu gibi.
Çalmağa tıklayınız. RunwayML’nin Gen 3 Turbo modelinin görüntü’den videoya dönüştürmesi. Ancak, benzer ve daha az rakip modeller gibi, kameradan uzaklaşan konunun tutarlı kimliğini koruyamaz ve başlangıç görüntüsünün ayırt edici özellikleri ‘genel bir difüzyon kadını’ haline gelir. Kaynak: https://app.runwayml.com/
Kendisine ait bir LoRA geliştirerek, HV I2V iş akışında, gerçek bir fotoğrafını başlangıç noktası olarak kullanabilir. Bu, modelin latent uzayına rastgele bir sayı gönderip ortaya çıkan semantik senaryoya razı olmaktan çok daha iyi bir ‘tohum’dur. Ardından, LoRA’yı veya birden çok LoRA’yı kullanabilir, kimlik, saç stilleri, giysi ve diğer önemli yönlerin tutarlılığını sağlayabilir.
Bu kombinasyonun erişilebilir olması, Stable Diffusion’un lansmanından bu yana üretken AI’da en önemli değişimlerden biri olabilir, güçlü üretken güç, açık kaynaklı entusiastlara verilir, ancak mevcut popüler gen vid sistemlerindeki içerik sansürleri (veya ‘kapı bekçileri’) tarafından sağlanan düzenleme olmadan.
Şu anda, Hunyuan görüntü’den videoya, Hunyuan Video GitHub deposunda işaretlenmemiş bir ‘yapılacaklar’ listesinde, topluluk, anekdot olarak, bir Hunyuan geliştiricisinin, bu işlevin yayımının, modelin ‘çok sansürlü’ olduğu için Q1’in ileriki bir tarihine ertelendiğini söyleyen bir Discord yorumunu bildirdi.

Hunyuan Video için resmi özellikler yayım kontrol listesi. Kaynak: https://github.com/Tencent/HunyuanVideo?tab=readme-ov-file#-open-source-plan
Doğru veya değil, depo geliştiricileri, Hunyuan kontrol listesinin geri kalanında önemli ölçüde teslimat yaptı ve bu nedenle, Hunyuan I2V’nin, sansürlü, sansürsüz veya某 şekilde ‘kilitli’ olarak gelmesi muhtemeldir.
Ancak, yukarıdaki listede görüldüğü gibi, I2V yayım, ayrı bir modeldir – bu da, Civit ve diğer yerlerdeki mevcut LoRAlarının çoğunun onunla çalışmayacağı anlamına gelir.
Bu (şimdi) öngörülebilir senaryoda, LoRA eğitim çerçeveleri gibi Musubi Tuner ve OneTrainer, ya geri çekilecek ya da yeni modele destek vermek için sıfırlanacaktır. Bu arada, birkaç teknoloji meraklısı YouTube AI ünlüsü, çözümünü Patreon aracılığıyla fidye verecektir, sahne yakınsayana kadar.
Yükseltme Yorgunluğu
LoRA veya fine-tuning meraklısı, neredeyse hiç kimse, yükseltme yorgunluğunu, üretken AI’deki hızlı ve rekabetçi değişim temposu, model dökümhanelerinin, Stability.ai, Tencent ve Black Forest Labs’in, mümkün olan en yüksek sıklıkta daha büyük ve (bazen) daha iyi modeller üretmesini teşvik ettiği için, bu kadar çok yaşar.
Bu yeni ve geliştirilmiş modeller, en azından farklı önyargılara ve ağırlıklara sahip olacak, daha yaygın olarak ise farklı bir ölçek ve/veya mimariye sahip olacak, bu da fine-tuning topluluğunun, yeni sürüm için, zorlu eğitim sürecini tekrarlamasını gerektirecek.
Bu nedenle, Civit’te birden fazla Stable Diffusion LoRA sürümü türü mevcuttur:

Civit.ai’de arama filtre seçeneklerinde görselleştirilen yükseltme yolu
Bu hafif LoRA modellerinin hiçbiri, daha yüksek veya daha düşük model sürümleriyle uyumlu değildir ve birçokları, daha eski bir modelle uyumlu olan popüler büyük ölçekli birleştirme ve fine-tune bağımlılıklarına sahiptir, bu da topluluğun önemli bir bölümünün, bir ‘miras’ sürümle kalmasına neden olur, tıpkı Windows XP’ye olan müşteri sadakati gibi, resmi destek sonlandırıldıktan yıllar sonra bile.
Değişime Uyum Sağlama
Bu konu, Qualcomm AI Research’tan yeni bir makale nedeniyle aklıma geldi, bu makale, mevcut LoRAların, yeni yayınlanan bir model sürümüne ‘yükseltilebileceği’ iddiasında bulunuyor.

Model sürümleri arasında LoRAların dönüştürülmesi örneği. Kaynak: https://arxiv.org/pdf/2501.16559
Bu, yeni yaklaşımın, LoRA-X olarak adlandırılan, aynı türün tüm modelleri arasında serbestçe dönüştürülebileceği anlamına gelmez (örneğin, metin’den görüntüye modelleri veya Büyük Dil Modelleri [LLM’ler]); ancak yazarlar, Stable Diffusion v1.5’ten SDXL’ye bir LoRA’nın etkili bir transliterasyonunu ve TinyLlama 3T modeli için bir LoRA’nın TinyLlama 2.5T’ye dönüştürülmesini göstermiştir.
LoRA-X, LoRA parametrelerini farklı temel modeller arasında, kaynak modelin alt uzayında benzerliklerini koruyarak aktarır, ancak yalnızca modeller arasındaki benzer kısımlarda.

Sol tarafta, LoRA-X kaynak modelinin, daha sonra hedef modelin kendi iç yapısı kullanılarak ayarlanan bir adaptörle fine-tune edildiği şema. Sağ tarafta, SD Eff-v1.0 ve SSD-1B hedef modelleri tarafından, SD-v1.5 ve SDXL’den ek eğitim olmadan uygulanan adaptörler之后 oluşturulan görüntüler.
Bu, yeniden eğitim istenmeyen veya imkansız olduğu senaryolarda pratik bir çözüm sunar (örneğin, orijinal eğitim verilerinin lisansı değiştiğinde), ancak yöntem, benzer model mimarilerine sınırlıdır.
LoRA-X’in eleştirileri ve danışmanları, Open Review’de, bu yöntemin, subspace benzerliğine bağımlılığı nedeniyle, yalnızca benzer modellere uygulanabileceğini ve yazarların, LoRA-X’in, önemli ölçüde farklı mimariler arasında transfer edilemeyeceğini kabul ettiğini belirttiler.
Diğer PEFT Yaklaşımları
LoRAların sürümler arasında taşınabilirliğini sağlamak, literatürde küçük ancak ilginç bir çalışma alanıdır ve LoRA-X’in bu alana yaptığı temel katkı, eğitim gerektirmediği iddiasıdır. Bu, tam olarak doğru değildir, ancak tüm önceki yöntemlerden daha az eğitim gerektirir.
LoRA-X, Parameter-Efficient Fine-Tuning (PEFT) yöntemlerinin bir diğer girişidir, bunlar, büyük önceden eğitilmiş modelleri, kapsamlı yeniden eğitim olmadan belirli görevlere uyarlamayı hedefler. Bu kavramsal yaklaşım, performansı korurken, minimal sayıda parametreleri değiştirmeyi amaçlar.
Diğerleri arasında:
X-Adapter
X-Adapter çerçevesi, modeller arasında fine-tune edilmiş adaptörleri, belirli bir miktar yeniden eğitimle aktarır. Sistem, bir temel difüzyon modelinden (örneğin, Stable Diffusion v1.5) pre-eğitimli plug-and-play modüllerini (örneğin, ControlNet ve LoRA) bir yükseltilmiş difüzyon modeliyle (örneğin, SDXL) doğrudan çalıştırmayı hedefler, böylece effectively bir ‘evrensel yükseltici’ olarak hareket eder.
Sistem, bir temel modelin dondurulmuş bir kopyasını kullanarak, eklenti konektörlerini korumak için, yükseltilmiş modeli kontrol eden ek bir ağ eğitimini gerçekleştirir:

X-Adapter şeması. Kaynak: https://arxiv.org/pdf/2312.02238
X-Adapter, orijinal olarak SD1.5’ten SDXL’ye adaptörleri aktarmak için geliştirilmiş ve test edilmiştir, oysa LoRA-X, daha çeşitli transliterasyonlar sunar.
DoRA (Ağırlık-Decomposed Low-Rank Adaptation)
DoRA, LoRA’yı, ağırlıkları daha yakından tam fine-tune’a benzeyen bir ağırlık分解 stratejisi kullanarak geliştiren, geliştirilmiş bir fine-tune yöntemidir:

DoRA, sadece LoRA-X gibi dondurulmuş bir ortamda bir adaptör kopyalamaya çalışmak yerine, ağırlıkların temel parametrelerini, such as magnitude ve direction, değiştirir. Kaynak: https://arxiv.org/pdf/2402.09353
DoRA, fine-tune sürecini kendisi geliştirmeye odaklanır, modelin ağırlıklarını büyüklük ve yön olarak ayırır (yukarıdaki resme bakın). LoRA-X, mevcut fine-tune parametrelerinin farklı temel modeller arasında aktarılmasını sağlar.
Ancak, LoRA-X yaklaşımı, DORA için geliştirilen proje tekniklerini benimser ve testlerde, bu daha eski sisteme karşı geliştirilmiş bir DINO puanı iddia eder.
FouRA (Fourier Low Rank Adaptation)
2024 Haziran’ında yayımlanan FouRA yöntemi, LoRA-X gibi, Qualcomm AI Research’tan gelir ve bazı test promt’larını ve temalarını paylaşır.

LoRA’da dağılım çöküşü örnekleri, 2024 FouRA makalesinden, Realistic Vision 3.0 modeli ile LoRA ve FouRA için ‘Mavi Ateş’ ve ‘Origami’ tarzı adaptörler kullanarak, dört tohum üzerinden. LoRA görüntüleri dağılım çöküşü ve azaltılmış çeşitlilik gösterir, oysa FouRA daha çeşitli çıktılar üretir. Kaynak: https://arxiv.org/pdf/2406.08798
FouRA, LoRA’yı, frekans alanında, Fourier dönüşümü kullanarak, üretilen görüntülerin çeşitlilik ve kalitesini geliştirmeye odaklanır.
Burada, yine, LoRA-X, FouRA’nın Fourier tabanlı yaklaşımına göre daha iyi sonuçlar elde etmiştir.
Her iki çerçeve de PEFT kategorisine girer, ancak çok farklı kullanım durumları ve yaklaşımları vardır; bu durumda, FouRA, yeni makalenin yazarları tarafından yapılan bir test turu için ‘sayıları tamamlamak’ için argüman olarak kullanılmaktadır.
SVDiff
SVDiff, difüzyon modellerinin fine-tune’ının verimliliğini geliştirmeye yönelik bir başka yaklaşımdır ve doğrudan modelin ağırlık matrislerindeki değerleri değiştirir, tekil vektörleri değiştirmeden. SVDiff, yalnızca en büyük değerleri değiştiren, kesilmiş SVD kullanır ve modelin ağırlıklarını ayarlamak için bir veri artırma tekniği olan Cut-Mix-Unmix‘i kullanır:

SVDiff’te çoklu konulu üretim, bir kavram ayırma sistemi olarak çalışır. Kaynak: https://arxiv.org/pdf/2303.11305
Cut-Mix-Unmix, modelin, farklı konuların görüntülerini birleştirmeksizin, ayrı ayrı öğeleri tanımlayan promt’larla eğitilmesini sağlar. Bu, modelin, farklı konuları birbirine karıştırmaksızın, ayrı ayrı kavramları tanıyıp korumaya zorlar.
Eğitim sırasında, ek bir düzenleme terimi, konular arası karışmayı önler. Yazarların teorisi, bu yaklaşımın, her öğenin ayrı ayrı görülebilmesi yerine, birleşik bir çıktı yerine, daha iyi çoklu konulu üretim sağlar.
SVDiff, LoRA-X test turundan çıkarılmıştır ve kompakt bir parametre alanını oluşturmayı hedefler. LoRA-X, ise, LoRA parametrelerinin farklı temel modeller arasında taşınabilirliğini, orijinal modelin alt uzayında çalışarak sağlar.
Sonuç
Burada tartışılan yöntemler, PEFT’nin tek sakinleri değildir. Diğerleri arasında QLoRA ve QA-LoRA; Prefix Tuning; Prompt-Tuning; ve adapter-tuning bulunur.
‘Yükseltilebilir LoRA’, belki de bir simya arayışıdır; kesinlikle, model sürümleri arasındaki değişikliklere ve parametrelerin şişmesine rağmen, LoRA modelleyicilerinin, en son ve en iyi ağırlık yayımını almak için eski veri kümelerini tekrar çıkarmalarına engel olabilecek bir prototip standardı, literatürde henüz ortaya çıkmamıştır ve her model için veri üzerinden çıkarılmaya devam edecektir.
İlk olarak 30 Ocak 2025 Perşembe günü yayımlanmıştır.












