Angolo di Anderson
Verso LoRAs che possano sopravvivere agli aggiornamenti delle versioni del modello

Da quando ho coperto la crescita dellâHunyuan Video LoRAs (piccoli file addestrati che possono iniettare personalità personalizzate in modelli di base per testo-immagine e immagine-video con miliardi di parametri), il numero di LoRAs correlate disponibili nella comunità di Civit ÃĻ aumentato del 185%.

Nonostante il fatto che non ci siano modi particolarmente facili o a basso sforzo per creare un Hunyuan Video LoRA, il catalogo di LoRAs di celebrità e temi a Civit cresce quotidianamente. Fonte: https://civitai.com/
La stessa comunità che sta cercando di imparare a produrre queste âpersonalità aggiuntiveâ per Hunyuan Video sta anche ulcerando per la promessa di rilascio di una funzionalità immagine-video (I2V) in Hunyuan Video.
Riguardo alla sintesi di immagini umane open source, questo ÃĻ un grande affare; combinato con la crescita delle Hunyuan LoRAs, potrebbe consentire agli utenti di trasformare le foto di persone in video in un modo che non eroda la loro identità mentre il video si sviluppa â il che ÃĻ attualmente il caso di tutti i generatori di immagine-video di stato dellâarte, inclusi Kling, Kaiber e il molto celebrato RunwayML:
Fare clic per riprodurre. Una generazione di immagine-video da RunwayMLâs stato dellâarte Gen 3 Turbo model. Tuttavia, in comune con tutti i modelli simili e rivali inferiori, non puÃē mantenere una identità coerente quando il soggetto si allontana dalla telecamera, e le caratteristiche distintive dellâimmagine di partenza diventano una âdonna di diffusione genericaâ. Fonte: https://app.runwayml.com/
Sviluppare un LoRA personalizzato per la personalità in questione, uno potrebbe, in un flusso di lavoro I2V HV, utilizzare una foto reale di loro come punto di partenza. Questo ÃĻ un âsemeâ molto migliore di quello di inviare un numero casuale nello spazio latente del modello e accontentarsi di qualsiasi scenario semantico che ne risulti. Uno potrebbe quindi utilizzare il LoRA, o piÃđ LoRAs, per mantenere la coerenza dellâidentità , dei capelli, degli abiti e altri aspetti cruciali di una generazione.
Potenzialmente, la disponibilità di una tale combinazione potrebbe rappresentare uno degli spostamenti piÃđ epocali nellâintelligenza artificiale generativa dal lancio di Stable Diffusion, con un potere generativo formidabile consegnato agli appassionati di open source, senza la regolamentazione (o âgatekeepingâ, se preferisci) fornita dai censori di contenuti nei sistemi di video generativi attuali.
While scrivo, Hunyuan image-to-video ÃĻ un unticked âto doâ nel repository GitHub di Hunyuan Video, con la comunità di appassionati che segnala (anecdoticamente) un commento Discord da uno sviluppatore di Hunyuan, che apparentemente ha affermato che il rilascio di questa funzionalità ÃĻ stato rinviato a qualche tempo piÃđ tardi nel Q1 a causa del modello essere âtroppo non censuratoâ.

La checklist ufficiale di rilascio delle funzionalità di Hunyuan Video. Fonte: https://github.com/Tencent/HunyuanVideo?tab=readme-ov-file#-open-source-plan
Accurate o no, gli sviluppatori del repository hanno sostanzialmente mantenuto le promesse per il resto della checklist di Hunyuan, e quindi Hunyuan I2V sembra destinato ad arrivare eventualmente, sia censurato, non censurato o in qualche modo âsbloccabileâ.
Ma come possiamo vedere nella lista sopra, il rilascio I2V ÃĻ apparentemente un modello separato â il che rende abbastanza improbabile che qualsiasi delle attuali LoRAs di HV a Civit e altrove funzionino con esso.
In questo (ora) prevedibile scenario, i framework di addestramento LoRA come Musubi Tuner e OneTrainer saranno o ritardati o reimpostati per supportare il nuovo modello. Nel frattempo, uno o due dei piÃđ tecnologicamente esperti (e imprenditoriali) luminari di YouTube AI potrebbero ricattare le loro soluzioni tramite Patreon fino a quando la scena non si aggiornerà .
Fatica dellâaggiornamento
Quasi nessuno sperimenta la fatica dellâaggiornamento come un entusiasta di LoRA o fine-tuning, perchÃĐ il ritmo rapido e competitivo del cambiamento nellâintelligenza artificiale generativa incoraggia le fonderie di modelli come Stability.ai, Tencent e Black Forest Labs a produrre modelli piÃđ grandi e (a volte) migliori al massimo frequenza possibile.
Dal momento che questi nuovi e migliorati modelli avranno almeno diversi bias e pesi, e piÃđ comunemente avranno una diversa scala e/o architettura, ciÃē significa che la comunità di fine-tuning deve riprendere i propri set di dati e ripetere il processo di addestramento faticoso per la nuova versione.
Per questo motivo, una molteplicità di tipi di versioni di Stable Diffusion LoRA sono disponibili a Civit:

La traiettoria di aggiornamento, visualizzata nelle opzioni di filtro di ricerca in civit.ai
PoichÃĐ nessuno di questi modelli LoRA leggeri ÃĻ interoperabile con versioni di modello piÃđ alte o piÃđ basse, e poichÃĐ molti di essi hanno dipendenze da merge e fine-tune popolari su larga scala che aderiscono a un modello piÃđ vecchio, una parte significativa della comunità tende a rimanere con una versione âlegacyâ, allo stesso modo in cui la fedeltà dei clienti a Windows XP ÃĻ persistita anni dopo la fine del supporto ufficiale.
Adattarsi al cambiamento
Questo argomento viene in mente a causa di un nuovo articolo della Qualcomm AI Research che afferma di aver sviluppato un metodo con cui esistono LoRAs che possono essere âaggiornatiâ a una nuova versione di modello.

Esempio di conversione di LoRAs tra versioni di modelli. Fonte: https://arxiv.org/pdf/2501.16559
Questo non significa che il nuovo approccio, intitolato LoRA-X, possa tradurre liberamente tra tutti i modelli dello stesso tipo (ad esempio, modelli di testo-immagine o Large Language Models [LLM]); ma gli autori hanno dimostrato una traslitterazione efficace di un LoRA da Stable Diffusion v1.5 > SDXL, e una conversione di un LoRA per il modello testuale TinyLlama 3T al TinyLlama 2.5T.
LoRA-X trasferisce i parametri LoRA tra diversi modelli di base preservando lâadattatore allâinterno del sottospazio del modello di origine; ma solo in parti del modello che sono adeguatamente simili tra le versioni del modello.

A sinistra, uno schema per il modo in cui il modello di origine LoRA-X addestra un adattatore, che viene quindi regolato per adattarsi al modello di destinazione. A destra, immagini generate dai modelli di destinazione SD Eff-v1.0 e SSD-1B, dopo lâapplicazione degli adattatori trasferiti da SD-v1.5 e SDXL senza addestramento aggiuntivo.
Mentre questo offre una soluzione pratica per scenari in cui il riaddestramento ÃĻ indesiderabile o impossibile (come un cambio di licenza sui dati di addestramento originali), il metodo ÃĻ limitato a architetture di modelli simili, tra le altre limitazioni.
Sebbene questo sia un raro sconfinamento in un campo poco studiato, non esamineremo questo articolo in profondità a causa delle numerose carenze di LoRA-X, come evidenziato dai commenti dei critici e consulenti di Open Review.
Il metodo si basa sulla somiglianza del sottospazio che limita la sua applicazione a modelli strettamente correlati, e gli autori hanno concesso nel forum di revisione che LoRA-X non puÃē essere facilmente trasferito tra architetture significativamente diverse
Altri approcci PEFT
La possibilità di rendere le LoRAs piÃđ portatili tra le versioni ÃĻ un piccolo ma interessante filone di studio nella letteratura, e il principale contributo che LoRA-X apporta a questo perseguimento ÃĻ la sua affermazione che non richiede addestramento. CiÃē non ÃĻ strettamente vero, se si legge lâarticolo, ma richiede il minimo addestramento di tutti i metodi precedenti.
LoRA-X ÃĻ unâaltra voce nel canone dei metodi Parameter-Efficient Fine-Tuning (PEFT), che affrontano la sfida di adattare grandi modelli pre-addestrati a compiti specifici senza un riaddestramento estensivo. Questo approccio concettuale mira a modificare un numero minimo di parametri mantenendo le prestazioni.
Degni di nota tra questi sono:
X-Adapter
Il framework X-Adapter trasferisce adattatori fine-tuned tra modelli con una certa quantità di riaddestramento. Il sistema mira a consentire moduli pre-addestrati plug-and-play (come ControlNet e LoRA) da un modello di diffusione di base (ad esempio, Stable Diffusion v1.5) per funzionare direttamente con un modello di diffusione aggiornato come SDXL senza riaddestramento â agendo in sostanza come un âaggiornatore universaleâ per i plugin.
Il sistema raggiunge ciÃē addestrando una rete aggiuntiva che controlla il modello aggiornato, utilizzando una copia congelata del modello di base per preservare i connettori del plugin:

Schema per X-Adapter. Fonte: https://arxiv.org/pdf/2312.02238
X-Adapter ÃĻ stato originariamente sviluppato e testato per trasferire adattatori da SD1.5 a SDXL, mentre LoRA-X offre una varietà piÃđ ampia di traslitterazioni.
DoRA (Weight-Decomposed Low-Rank Adaptation)
DoRA ÃĻ un metodo di fine-tuning avanzato che migliora LoRA utilizzando una strategia di decomposizione dei pesi che assomiglia piÃđ da vicino al fine-tuning completo:

DoRA non tenta solo di copiare un adattatore in un ambiente congelato, come fa LoRA-X, ma invece cambia parametri fondamentali dei pesi, come grandezza e direzione. Fonte: https://arxiv.org/pdf/2402.09353
DoRA si concentra sullâmiglioramento del processo di fine-tuning stesso, decomponendo i pesi del modello in grandezza e direzione (vedi immagine sopra). Invece, LoRA-X si concentra sullâabilitazione del trasferimento di parametri fine-tuned esistenti tra diversi modelli di base
Tuttavia, lâapproccio LoRA-X adotta le tecniche di proiezione sviluppate per DORA, e nei test contro questo sistema piÃđ vecchio afferma un punteggio DINO migliorato.
FouRA (Fourier Low Rank Adaptation)
Pubblicato nel giugno 2024, il metodo FouRA proviene, come LoRA-X, dalla Qualcomm AI Research, e condivide alcuni dei suoi prompt di test e temi.

Esempi di collasso della distribuzione in LoRA, dal paper FouRA del 2024, utilizzando il modello Realistic Vision 3.0 addestrato con LoRA e FouRA per adattatori di stile âBlue Fireâ e âOrigamiâ, su quattro semi. Le immagini LoRA mostrano un collasso della distribuzione e una diversità ridotta, mentre FouRA genera output piÃđ variati. Fonte: https://arxiv.org/pdf/2406.08798
FouRA si concentra sullâmiglioramento della diversità e della qualità delle immagini generate, adattando LoRA nel dominio della frequenza, utilizzando un approccio di trasformata di Fourier.
Qui, di nuovo, LoRA-X ÃĻ stato in grado di ottenere risultati migliori dellâapproccio basato su Fourier di FouRA.
Sebbene entrambi i framework rientrino nella categoria PEFT, hanno casi dâuso e approcci molto diversi; in questo caso, FouRA ÃĻ probabilmente âalla ricerca di numeriâ per un round di test con rivali limitati per gli autori del nuovo articolo.
SVDiff
SVDiff ha obiettivi diversi da LoRA-X, ma ÃĻ fortemente sfruttato nel nuovo articolo. SVDiff ÃĻ progettato per migliorare lâefficienza del fine-tuning dei modelli di diffusione, e modifica direttamente i valori allâinterno delle matrici di pesi del modello, mantenendo invariati i vettori singolari. SVDiff utilizza SVD troncato, modificando solo i valori piÃđ grandi, per regolare i pesi del modello.
Questo approccio utilizza una tecnica di aumento dei dati chiamata Cut-Mix-Unmix:

La generazione di piÃđ soggetti funziona come un sistema di isolamento dei concetti in SVDiff. Fonte: https://arxiv.org/pdf/2303.11305
Cut-Mix-Unmix ÃĻ progettato per aiutare il modello di diffusione a imparare piÃđ concetti distinti senza intrecciarli. Lâidea centrale ÃĻ prendere immagini di soggetti diversi e concatenarle in unâunica immagine. Quindi il modello viene addestrato con prompt che descrivono esplicitamente gli elementi separati nellâimmagine. CiÃē costringe il modello a riconoscere e preservare concetti distinti invece di mescolarli.
Durante lâaddestramento, un termine di regolarizzazione aggiuntivo aiuta a prevenire lâinterferenza tra soggetti. La teoria degli autori sostiene che ciÃē facilita una generazione multi-soggetto migliorata, in cui ogni elemento rimane visivamente distinto, invece di essere fuso insieme.
SVDiff, escluso dal round di test LoRA-X, mira a creare uno spazio dei parametri compatto. LoRA-X, invece, si concentra sulla trasferibilità dei parametri LoRA tra diversi modelli di base operando allâinterno del sottospazio del modello originale.
Conclusione
I metodi discussi qui non sono gli unici abitanti di PEFT. Altri includono QLoRA e QA-LoRA; Prefix Tuning; Prompt-Tuning; e adapter-tuning, tra gli altri.
La âLoRA aggiornabileâ ÃĻ, forse, una ricerca alchemica; certamente, non câÃĻ nulla di immediato allâorizzonte che possa impedire ai modellisti LoRA di dover tirare fuori di nuovo i loro vecchi set di dati per lâultimo e il piÃđ grande rilascio di pesi. Se esiste un possibile prototipo di standard per la revisione dei pesi, in grado di sopravvivere ai cambiamenti nellâarchitettura e ai parametri gonfiati tra le versioni del modello, non ÃĻ emerso nella letteratura yet, e dovrà continuare a essere estratto dai dati su base per modello.
Â
Pubblicato per la prima volta giovedÃŽ, 30 gennaio 2025












