Model dan platform AI
Menuju LoRAs yang Dapat Bertahan dari Peningkatan Versi Model

Sejak saya meliput pertumbuhan Hunyuan Video LoRAs (file yang dilatih kecil yang dapat menyuntikkan kepribadian kustom ke dalam model dasar teks-ke-video dan gambar-ke-video berparameter miliaran), jumlah LoRAs yang terkait yang tersedia di komunitas Civit telah meningkat sebesar 185%.

Meskipun tidak ada cara yang mudah atau berbiaya rendah untuk membuat Hunyuan Video LoRA, katalog selebriti dan LoRAs bertema di Civit tumbuh setiap hari. Sumber: https://civitai.com/
Komunitas yang sama yang berusaha mempelajari cara menghasilkan ‘tambahan kepribadian’ ini untuk Hunyuan Video juga mengalami kesulitan untuk rilis yang dijanjikan dari fungsi gambar-ke-video (I2V) di Hunyuan Video.
Dalam hal sintesis gambar manusia sumber terbuka, ini adalah hal besar; dikombinasikan dengan pertumbuhan Hunyuan LoRAs, ini dapat memungkinkan pengguna untuk mengubah foto orang menjadi video dengan cara yang tidak menghilangkan identitas mereka saat video berkembang – yang saat ini merupakan kasus di semua generator gambar-ke-video state-of-the-art, termasuk Kling, Kaiber, dan RunwayML yang sangat dirayakan:
Klik untuk memutar. Generasi gambar-ke-video dari model Gen 3 Turbo RunwayML. Namun, seperti semua model saingan yang serupa dan lebih rendah, tidak dapat mempertahankan konsistensi identitas saat subjek berpaling dari kamera, dan fitur khas gambar awal menjadi ‘wanita difusi generik’. Sumber: https://app.runwayml.com/
Dengan mengembangkan LoRA kustom untuk kepribadian yang bersangkutan, satu bisa, dalam alur kerja I2V HV, menggunakan foto nyata mereka sebagai titik awal. Ini adalah ‘benih’ yang jauh lebih baik daripada mengirimkan nomor acak ke dalam ruang laten model dan menetap untuk apa pun skenario semantik yang dihasilkan. Satu bisa menggunakan LoRA, atau beberapa LoRA, untuk mempertahankan konsistensi identitas, gaya rambut, pakaian, dan aspek penting lainnya dari generasi.
Potensial, ketersediaan kombinasi seperti itu dapat mewakili salah satu pergeseran epokal dalam kecerdasan buatan generatif sejak peluncuran Stable Diffusion, dengan kekuatan generatif yang luar biasa diserahkan kepada penggemar sumber terbuka, tanpa regulasi (atau ‘gatekeeping’, jika Anda suka) yang disediakan oleh sensor konten di sistem vid gen populer saat ini.
Saat saya menulis, Hunyuan gambar-ke-video adalah tugas yang belum dicentang di repo GitHub Hunyuan Video, dengan komunitas hobi melaporkan (anekdot) komentar Discord dari pengembang Hunyuan, yang tampaknya menyatakan bahwa rilis fungsionalitas ini telah ditunda hingga beberapa waktu kemudian di Q1 karena model terlalu tidak disensor.

Daftar periksa rilis fitur resmi Hunyuan Video. Sumber: https://github.com/Tencent/HunyuanVideo?tab=readme-ov-file#-open-source-plan
Akurat atau tidak, pengembang repo telah secara substansial memenuhi sisa daftar Hunyuan, dan oleh karena itu Hunyuan I2V tampaknya akan tiba pada akhirnya, apakah disensor, tidak disensor, atau dalam beberapa cara ‘dibuka kunci’.
Tapi seperti yang kita lihat di daftar di atas, rilis I2V adalah model terpisah – yang membuatnya tidak mungkin bahwa LoRAs HV saat ini akan berfungsi dengannya.
Dalam skenario ini (yang sudah dapat diprediksi), kerangka kerja pelatihan LoRA seperti Musubi Tuner dan OneTrainer akan either mundur atau direset dalam mendukung model baru. Sementara itu, satu atau dua dari tokoh AI YouTube yang paling berpengalaman (dan wirausaha) akan menawarkan solusi mereka melalui Patreon hingga adegan tersebut mengejar ketinggalan.
Kelelahan Peningkatan
Hampir tidak ada yang mengalami kelelahan peningkatan seperti penggemar LoRA atau fine-tuning, karena kecepatan perubahan yang cepat dan kompetitif dalam kecerdasan buatan generatif mendorong pabrik model seperti Stability.ai, Tencent, dan Black Forest Labs untuk menghasilkan model yang lebih besar dan (terkadang) lebih baik dengan frekuensi yang paling viabel.
Sejak model baru ini setidaknya akan memiliki bias dan berat yang berbeda, dan lebih umum akan memiliki skala dan/atau arsitektur yang berbeda, ini berarti bahwa komunitas fine-tuning harus mengeluarkan dataset mereka lagi dan mengulangi proses pelatihan yang melelahkan untuk versi baru.
Untuk alasan ini, beberapa jenis LoRA Stable Diffusion tersedia di Civit:

Jejak peningkatan, divisualisasikan dalam opsi filter pencarian di civit.ai
Karena tidak ada model LoRA ringan ini yang dapat dioperasikan dengan versi model yang lebih tinggi atau lebih rendah, dan karena banyak dari mereka memiliki ketergantungan pada penggabungan skala besar yang populer dan fine-tunes yang mengikuti model yang lebih lama, sebagian besar komunitas cenderung tetap menggunakan rilis ‘warisan’, sama seperti loyalitas pelanggan terhadap Windows XP bertahan tahun setelah dukungan resmi berakhir.
Mengadaptasi Perubahan
Subjek ini muncul karena adanya makalah baru dari Qualcomm (QCOM ) AI Research yang mengklaim telah mengembangkan metode untuk ‘mengupgrade’ LoRAs yang ada ke versi model yang baru dirilis.

Contoh konversi LoRAs di seluruh versi model. Sumber: https://arxiv.org/pdf/2501.16559
Ini tidak berarti bahwa pendekatan baru, yang disebut LoRA-X, dapat diterjemahkan secara bebas di antara semua model dari jenis yang sama (yaitu, model teks-ke-gambar, atau Model Bahasa Besar [LLM]); tetapi penulis telah mendemonstrasikan transliterasi efektif dari LoRA dari Stable Diffusion v1.5 > SDXL, dan konversi LoRA untuk model teks-berbasis TinyLlama 3T ke TinyLlama 2.5T.
LoRA-X mentransfer parameter LoRA di seluruh model dasar yang berbeda dengan mempertahankan adapter dalam subspace model sumber; tetapi hanya dalam bagian model yang cukup mirip di seluruh versi model.

Di sebelah kiri, skema untuk cara LoRA-X model sumber fine-tunes adapter, yang kemudian disesuaikan untuk memenuhi model target. Di sebelah kanan, gambar yang dihasilkan oleh model target SD Eff-v1.0 dan SSD-1B, setelah menerapkan adapter yang ditransfer dari SD-v1.5 dan SDXL tanpa pelatihan tambahan.
LoRA-X menawarkan solusi praktis untuk skenario di mana pelatihan ulang tidak diinginkan atau tidak mungkin (seperti perubahan lisensi pada data pelatihan asli), tetapi metode ini terbatas pada arsitektur model yang mirip, di antara keterbatasan lainnya.
LoRA-X adalah entri lain dalam kanon metode Parameter-Efficient Fine-Tuning (PEFT), yang menangani tantangan penyesuaian model pra-dilatih besar ke tugas spesifik tanpa pelatihan ulang yang luas. Pendekatan konseptual ini bertujuan untuk memodifikasi jumlah parameter minimal sambil mempertahankan kinerja.
Yang paling menonjol di antaranya adalah:
X-Adapter
Kerangka kerja X-Adapter mentransfer adapter yang telah dilatih di seluruh model dengan sejumlah pelatihan ulang. Sistem ini bertujuan untuk memungkinkan modul pra-dilatih plug-and-play (seperti ControlNet dan LoRA) dari model difusi dasar (yaitu, Stable Diffusion v1.5) untuk bekerja langsung dengan model difusi yang ditingkatkan seperti SDXL tanpa pelatihan ulang – secara efektif bertindak sebagai ‘peningkat universal’ untuk plugin.
Sistem ini mencapai ini dengan melatih jaringan tambahan yang mengontrol model yang ditingkatkan, menggunakan salinan beku dari model dasar untuk mempertahankan penghubung plugin:

Skema untuk X-Adapter. Sumber: https://arxiv.org/pdf/2312.02238
X-Adapter awalnya dikembangkan dan diuji untuk mentransfer adapter dari SD1.5 ke SDXL, sementara LoRA-X menawarkan berbagai transliterasi yang lebih luas.
DoRA (Weight-Decomposed Low-Rank Adaptation)
DoRA adalah metode fine-tuning yang ditingkatkan yang memperbaiki LoRA dengan menggunakan strategi dekomposisi berat yang lebih mirip dengan fine-tuning penuh:

DoRA tidak hanya mencoba menyalin adapter dalam lingkungan yang beku, seperti LoRA-X, tetapi sebaliknya mengubah parameter fundamental dari berat, seperti besarnya dan arah. Sumber: https://arxiv.org/pdf/2402.09353
DoRA fokus pada meningkatkan proses fine-tuning itu sendiri, dengan mendekomposisi berat model menjadi besarnya dan arah (lihat gambar di atas). Sebaliknya, LoRA-X fokus pada memungkinkan transfer parameter LoRA yang telah dilatih di antara model dasar yang berbeda
Namun, pendekatan LoRA-X mengadaptasi teknik proyeksi yang dikembangkan untuk DORA, dan dalam tes melawan sistem yang lebih lama ini mengklaim skor DINO yang ditingkatkan.
FouRA (Fourier Low Rank Adaptation)
Diterbitkan pada Juni 2024, metode FouRA ini berasal dari Qualcomm AI Research, dan bahkan berbagi beberapa prompt pengujian dan tema yang sama dengan LoRA-X.

Contoh keruntuhan distribusi dalam LoRA, dari makalah FouRA 2024, menggunakan model Realistic Vision 3.0 yang dilatih dengan LoRA dan FouRA untuk adapter ‘Api Biru’ dan ‘Origami’, di seluruh empat benih. Gambar LoRA menunjukkan keruntuhan distribusi dan keanekaragaman yang berkurang, sedangkan FouRA menghasilkan output yang lebih bervariasi. Sumber: https://arxiv.org/pdf/2406.08798
FouRA fokus pada meningkatkan keanekaragaman dan kualitas gambar yang dihasilkan dengan mengadaptasi LoRA dalam domain frekuensi, menggunakan pendekatan Fourier transform.
Di sini, lagi, LoRA-X dapat mencapai hasil yang lebih baik daripada pendekatan berbasis Fourier dari FouRA.
Meskipun kedua kerangka kerja ini jatuh dalam kategori PEFT, mereka memiliki kasus penggunaan yang sangat berbeda dan pendekatan; dalam hal ini, FouRA secara argumentatif ‘mengisi angka’ untuk putaran pengujian dengan sedikit rival yang serupa untuk penulis makalah baru berinteraksi.
SVDiff
SVDiff juga memiliki tujuan yang berbeda dari LoRA-X, tetapi sangat digunakan dalam makalah baru. SVDiff dirancang untuk meningkatkan efisiensi fine-tuning model difusi, dan secara langsung memodifikasi nilai dalam matriks berat model, sambil menjaga vektor tunggal tidak berubah. SVDiff menggunakan SVD yang dipotong, memodifikasi hanya nilai terbesar, untuk menyesuaikan berat model.
Pendekatan ini menggunakan teknik augmentasi data yang disebut Cut-Mix-Unmix:

Generasi multi-subjek beroperasi sebagai sistem isolasi konsep dalam SVDiff. Sumber: https://arxiv.org/pdf/2303.11305
Cut-Mix-Unmix dirancang untuk membantu model difusi mempelajari konsep yang berbeda tanpa mencampuradukkan mereka. Ide sentralnya adalah mengambil gambar subjek yang berbeda dan menggabungkannya menjadi satu gambar. Kemudian model dilatih dengan prompt yang secara eksplisit menggambarkan elemen terpisah dalam gambar. Ini memaksa model untuk mengenali dan mempertahankan konsep yang berbeda daripada mencampuradukkannya.
Selama pelatihan, istilah regulasi tambahan membantu mencegah interferensi antar-subjek. Teori penulis berpendapat bahwa ini memfasilitasi generasi multi-subjek yang ditingkatkan, di mana setiap elemen tetap terpisah secara visual, bukan bergabung.
SVDiff, yang dikecualikan dari putaran pengujian LoRA-X, bertujuan untuk menciptakan ruang parameter yang kompak. LoRA-X, sebaliknya, fokus pada transferabilitas parameter LoRA di seluruh model dasar yang berbeda dengan beroperasi dalam subspace model asli.
Kesimpulan
Metode yang dibahas di sini bukanlah satu-satunya penghuni PEFT. Lainnya termasuk QLoRA dan QA-LoRA; Prefix Tuning; Prompt-Tuning; dan adapter-tuning, di antara lainnya.
‘LoRA yang dapat ditingkatkan’ adalah, mungkin, pencarian alkimia; tentu saja, tidak ada yang segera di cakrawala yang akan mencegah modeler LoRA dari harus mengeluarkan dataset lama mereka lagi untuk rilis berat terbaru. Jika ada prototipe standar revisi berat yang mampu bertahan dari perubahan arsitektur dan parameter yang membengkak antara versi model, itu belum muncul dalam literatur yet, dan akan terus perlu diambil dari data pada basis per-model.
Dipublikasikan pertama kali pada hari Kamis, 30 Januari 2025












