KÄ t Andersona
W kierunku LoR, ktÃģre mogÄ przetrwaÄ aktualizacje wersji modelu

Od czasu mojego ostatniego artykuÅu o wzroÅcie popularnoÅci Hunyuan Video LoR (maÅych, wytrenowanych plikÃģw, ktÃģre mogÄ wstrzykiwaÄ niestandardowe osobowoÅci do modeli tekst-do-obrazu i obraz-do-obrazu), liczba powiÄ zanych LoR dostÄpnych w spoÅecznoÅci Civit wzrosÅa o 185%.

Pomimo braku Åatwych lub niskonakÅadowych sposobÃģw tworzenia Hunyuan Video LoRA, katalog LoR z celebrytami i tematami w Civit roÅnie codziennie. ÅđrÃģdÅo: https://civitai.com/
Ta sama spoÅecznoÅÄ, ktÃģra jest zdesperowana, by nauczyÄ siÄ tworzyÄ te âdodatkowe osobowoÅciâ dla Hunyuan Video (HV), rÃģwnieÅž ulceruje z powodu obiecanej premiery funkcjonalnoÅci obraz-do-obrazu (I2V) w Hunyuan Video.
W odniesieniu do otwartego ÅšrÃģdÅa syntezowania obrazÃģw ludzi, jest to duÅže wydarzenie; w poÅÄ czeniu ze wzrostem LoR, mogÅoby umoÅžliwiÄ uÅžytkownikom przeksztaÅcanie zdjÄÄ ludzi w filmy w sposÃģb, ktÃģry nie niszczy ich toÅžsamoÅci, gdy film siÄ rozwija â co jest obecnie przypadkiem we wszystkich najnowszych generatorach obrazu, w tym Kling, Kaiber i sÅynnym RunwayML:
Kliknij, aby odtworzyÄ. Generowanie obrazu z modelem Gen 3 Turbo RunwayML. Jednak, podobnie jak wszystkie podobne i gorsze modele rywalizujÄ ce, nie moÅže utrzymaÄ spÃģjnej toÅžsamoÅci, gdy temat odwraca siÄ od kamery, a charakterystyczne cechy obrazu poczÄ tkowego stajÄ siÄ âkobietÄ dyfuzjiâ. ÅđrÃģdÅo: https://app.runwayml.com/
Poprzez rozwiniÄcie niestandardowej LoRA dla danej osobowoÅci, moÅžna, w przepÅywie pracy I2V, uÅžyÄ prawdziwego zdjÄcia jako punktu startowego. Jest to lepszy ânasionoâ niÅž wysÅanie losowej liczby do przestrzeni latentnej modelu i zaakceptowanie wynikajÄ cej sytuacji semantycznej. NastÄpnie moÅžna uÅžyÄ LoRA lub wielu LoR, aby utrzymaÄ spÃģjnoÅÄ toÅžsamoÅci, fryzur, ubraÅ i innych kluczowych aspektÃģw generacji.
Potencjalnie, dostÄpnoÅÄ takiego poÅÄ czenia mogÅaby reprezentowaÄ jeden z najbardziej epokowych zwrotÃģw w generatywnym AI od czasu premiery Stable Diffusion, z potÄÅžnÄ siÅÄ generatywnÄ przekazanÄ entuzjastom open source, bez regulacji (lub âbramkarstwaâ, jeÅli wolisz) zapewnianej przez cenzorÃģw treÅci w bieÅžÄ cej generacji popularnych systemÃģw wideo.
W momencie, gdy piszÄ, Hunyuan obraz-do-obrazu jest niewybranym âzadaniemâ w repozytorium Hunyuan Video GitHub, z hobbyistycznÄ spoÅecznoÅciÄ , ktÃģra relacjonuje (anegdotycznie) komentarz z Discorda od dewelopera Hunyuan, ktÃģry podobno stwierdziÅ, Åže wydanie tej funkcjonalnoÅci zostaÅo przesuniÄte na pÃģÅšniej w Q1 z powodu modelu bycia âzbyt niecenzurowanymâ.

Oficjalna lista wydania funkcji Hunyuan Video. ÅđrÃģdÅo: https://github.com/Tencent/HunyuanVideo?tab=readme-ov-file#-open-source-plan
DokÅadne czy nie, deweloperzy repozytorium w znacznym stopniu dotrzymali reszty checklisty Hunyuan, a zatem Hunyuan I2V wydaje siÄ, Åže przyjdzie ostatecznie, niezaleÅžnie od tego, czy jest to wersja ocenzurowana, nieocenzurowana czy w jakiÅ sposÃģb âodblokowanaâ.
Ale jak moÅžemy zobaczyÄ w liÅcie powyÅžej, wydanie I2V jest oczywiÅcie oddzielnym modelem â co sprawia, Åže jest maÅo prawdopodobne, Åže jakiekolwiek z bieÅžÄ cych LoR w Civit i gdzie indziej bÄdÄ dziaÅaÄ z nim.
W tym (obecnie) przewidywalnym scenariuszu, ramy szkoleniowe LoRA, takie jak Musubi Tuner i OneTrainer, bÄdÄ albo cofniÄte, albo zresetowane w odniesieniu do obsÅugi nowego modelu. Tymczasem jeden lub dwÃģch najbardziej zaawansowanych technicznie (i przedsiÄbiorczych) luminarzy AI z YouTube bÄdzie okupowaÅ swoje rozwiÄ zania za poÅrednictwem Patreon, dopÃģki scena nie dogoni.
Upgrade Fatigue
Prawie nikt nie doÅwiadcza zmÄczenia aktualizacjami tak bardzo, jak entuzjasta LoRA lub dostosowywania, poniewaÅž szybki i konkurencyjny temp zmian w generatywnym AI zachÄca do tworzenia nowych, lepszych modeli przez takie foundry jak Stability.ai, Tencent i Black Forest Labs w maksymalnie moÅžliwej czÄstotliwoÅci.
OdkÄ d nowe i ulepszone modele bÄdÄ miaÅy co najmniej inne biasy i wagi, a czÄÅciej bÄdÄ miaÅy innÄ skalÄ i/lub architekturÄ, oznacza to, Åže spoÅecznoÅÄ dostosowywania musi ponownie wyciÄ gnÄ Ä swoje zestawy danych i powtÃģrzyÄ proces szkolenia dla nowej wersji.
Z tego powodu dostÄpnych jest wiele typÃģw wersji LoRA Stable Diffusion w Civit:

ÅcieÅžka aktualizacji, wizualizowana w filtrach wyszukiwania w civit.ai
PoniewaÅž Åžaden z tych lekkich modeli LoRA nie jest interoperacyjny z wyÅžszymi lub niÅžszymi wersjami modelu, a wiele z nich ma zaleÅžnoÅci od popularnych duÅžych poÅÄ czeÅ i dostosowaÅ, ktÃģre przylegajÄ do starszego modelu, znaczna czÄÅÄ spoÅecznoÅci skÅania siÄ ku pozostaniu przy âstarszejâ wersji, podobnie jak lojalnoÅÄ klientÃģw wobec Windows XP trwaÅa latami po zakoÅczeniu oficjalnego wsparcia.
Adapting to Change
Ten temat przychodzi na myÅl z powodu nowego artykuÅu z Qualcomm AI Research, ktÃģry twierdzi, Åže opracowaÅ metodÄ, za pomocÄ ktÃģrej istniejÄ ce LoRA mogÄ byÄ âaktualizowaneâ do nowo wydanej wersji modelu.

PrzykÅadowa konwersja LoR miÄdzy wersjami modelu. ÅđrÃģdÅo: https://arxiv.org/pdf/2501.16559
To nie oznacza, Åže nowy podejÅcie, zatytuÅowane LoRA-X, moÅže swobodnie przekÅadaÄ siÄ miÄdzy wszystkimi modelami tego samego typu (tj. modelami tekst-do-obrazu lub duÅžymi modelami jÄzykowymi [LLM]); ale autorzy udowodnili skutecznÄ transliteracjÄ LoRA z Stable Diffusion v1.5 > SDXL i konwersjÄ LoRA dla modelu TinyLlama 3T do TinyLlama 2.5T.
LoRA-X przenosi parametry LoRA miÄdzy rÃģÅžnymi modelami bazowymi, zachowujÄ c adapter w przestrzeni podstawowego modelu; ale tylko w czÄÅciach modelu, ktÃģre sÄ wystarczajÄ co podobne w rÃģÅžnych wersjach.

Po lewej, schemat sposobu, w jaki LoRA-X dostosowuje adapter w modelu ÅšrÃģdÅowym, ktÃģry jest nastÄpnie dostosowywany do modelu docelowego. Po prawej, obrazy wygenerowane przez modele docelowe SD Eff-v1.0 i SSD-1B, po zastosowaniu adapterÃģw przeniesionych z SD-v1.5 i SDXL bez dodatkowego szkolenia.
ChociaÅž to oferuje praktyczne rozwiÄ zanie dla sytuacji, w ktÃģrych ponowne szkolenie jest niepoÅžÄ dane lub niemoÅžliwe (takie jak zmiana licencji na danych szkoleniowych), metoda ta jest ograniczona do podobnych architektur modeli, wÅrÃģd innych ograniczeÅ.
ChociaÅž jest to rzadki wkÅad w niezbadany obszar, nie bÄdziemy analizowaÄ tego artykuÅu w depth z powodu licznych niedostatkÃģw LoRA-X, jak wynika z komentarzy krytykÃģw i doradcÃģw w Open Review.
ZaleÅžnoÅÄ metody od podobieÅstwa przestrzeni ogranicza jej zastosowanie do ÅciÅle powiÄ zanych modeli, a autorzy przyznali w forum przeglÄ dowym, Åže LoRA-X nie moÅže byÄ Åatwo przeniesiony miÄdzy znacznie rÃģÅžnymi architekturami
Inne podejÅcia PEFT
MoÅžliwoÅÄ uczynienia LoR bardziej przenoÅnymi miÄdzy wersjami jest maÅym, ale interesujÄ cym wÄ tkiem badaÅ w literaturze, a gÅÃģwny wkÅad LoRA-X w ten obszar polega na tym, Åže nie wymaga szkolenia. To nie jest ÅciÅle prawdÄ , jeÅli czyta siÄ artykuÅ, ale wymaga najmniejszego szkolenia spoÅrÃģd wszystkich poprzednich metod.
LoRA-X jest kolejnym wpisem w kanonie metod PEFT (Parameter-Efficient Fine-Tuning), ktÃģre zajmujÄ siÄ wyzwaniem adaptacji duÅžych wstÄpnie wytrenowanych modeli do konkretnych zadaÅ bez rozlegÅego ponownego szkolenia. To podejÅcie koncepcyjne ma na celu modyfikacjÄ minimalnej liczby parametrÃģw przy zachowaniu wydajnoÅci.
WÅrÃģd nich wyrÃģÅžniajÄ siÄ:
X-Adapter
Ramka X-Adapter przenosi dostosowane adaptery miÄdzy modelami z pewnÄ iloÅciÄ ponownego szkolenia. System ten ma na celu umoÅžliwienie wstÄpnie wytrenowanych moduÅÃģw (takich jak ControlNet i LoRA) z modelu dyfuzyjnego (tj. Stable Diffusion v1.5) do pracy bezpoÅrednio z zaktualizowanym modelem dyfuzyjnym, takim jak SDXL, bez ponownego szkolenia â efektywnie dziaÅajÄ c jako âuniwersalny aktualizatorâ dla wtyczek.
System ten osiÄ ga to, szkolÄ c dodatkowÄ sieÄ, ktÃģra kontroluje zaktualizowany model, uÅžywajÄ c zamroÅžonej kopii modelu podstawowego do zachowania ÅÄ cznikÃģw wtyczek:

Schemat X-Adapter. ÅđrÃģdÅo: https://arxiv.org/pdf/2312.02238
X-Adapter zostaÅ pierwotnie opracowany i przetestowany w celu przeniesienia adapterÃģw z SD1.5 do SDXL, podczas gdy LoRA-X oferuje szerszy zakres transliteracji.
DoRA (Weight-Decomposed Low-Rank Adaptation)
DoRA to ulepszona metoda dostosowywania, ktÃģra poprawia LoRA, uÅžywajÄ c strategii dekompozycji wag, ktÃģra bardziej przypomina peÅne dostosowywanie:

DoRA nie prÃģbuje tylko skopiowaÄ adapter w Årodowisku zamroÅžonym, jak LoRA-X, ale zmienia podstawowe parametry wag, takie jak wielkoÅÄ i kierunek. ÅđrÃģdÅo: https://arxiv.org/pdf/2402.09353
DoRA koncentruje siÄ na poprawie samego procesu dostosowywania, dekomponujÄ c wagi modelu na wielkoÅÄ i kierunek (patrz powyÅžej). Zamiast tego, LoRA-X koncentruje siÄ na umoÅžliwieniu przeniesienia istniejÄ cych dostosowanych parametrÃģw miÄdzy rÃģÅžnymi modelami podstawowymi
JednakÅže podejÅcie LoRA-X wykorzystuje techniki projekcji opracowane dla DoRA, i w testach przeciwko temu starszemu systemowi twierdzi, Åže uzyskaÅ lepszy DINO wynik.
FouRA (Fourier Low Rank Adaptation)
Opublikowany w czerwcu 2024, metoda FouRA pochodzi, podobnie jak LoRA-X, z Qualcomm AI Research i dzieli niektÃģre z tych samych testowych bodÅšcÃģw i tematÃģw.

PrzykÅady zaÅamania dystrybucji w LoRA, z artykuÅu FouRA z 2024, uÅžywajÄ c modelu Realistic Vision 3.0 wytrenowanego z LoRA i FouRA dla adapterÃģw âBlue Fireâ i âOrigamiâ, w czterech nasionach. Obrazy LoRA wykazujÄ zaÅamanie dystrybucji i zmniejszonÄ rÃģÅžnorodnoÅÄ, podczas gdy FouRA generuje bardziej zrÃģÅžnicowane dane wyjÅciowe. ÅđrÃģdÅo: https://arxiv.org/pdf/2406.08798
FouRA koncentruje siÄ na poprawie rÃģÅžnorodnoÅci i jakoÅci generowanych obrazÃģw, dostosowujÄ c LoRA w dziedzinie czÄstotliwoÅci, uÅžywajÄ c podejÅcia Fourier.
Tutaj, ponownie, LoRA-X osiÄ gnÄ Å lepsze wyniki niÅž podejÅcie oparte na Fourierze FouRA.
ChociaÅž obie ramy naleÅžÄ do kategorii PEFT, majÄ bardzo rÃģÅžne przypadki uÅžycia i podejÅcia; w tym przypadku FouRA jest raczej âwypeÅnieniemâ dla rundy testowej z ograniczonÄ liczbÄ rywali dla nowych autorÃģw.
SVDiff
SVDiff ma rÃģwnieÅž inne cele niÅž LoRA-X, ale jest silnie wykorzystywany w nowym artykule. SVDiff jest zaprojektowany w celu poprawy wydajnoÅci dostosowywania modeli dyfuzyjnych i bezpoÅrednio modyfikuje wartoÅci w macierzach wag modelu, przy zachowaniu niezmienionych wektorÃģw singularnych. SVDiff uÅžywa przycinanego SVD, modyfikujÄ c tylko najwiÄksze wartoÅci, aby dostosowaÄ wagi modelu.
To podejÅcie wykorzystuje technikÄ augmentacji danych o nazwie Cut-Mix-Unmix:

Generowanie wielu przedmiotÃģw dziaÅa jako system izolujÄ cy pojÄcia w SVDiff. ÅđrÃģdÅo: https://arxiv.org/pdf/2303.11305
Cut-Mix-Unmix jest zaprojektowany, aby pomÃģc modelowi dyfuzyjnym nauczyÄ siÄ wielu odrÄbnych pojÄÄ bez ich przenikania siÄ. GÅÃģwny pomysÅ polega na tym, aby wziÄ Ä obrazy rÃģÅžnych przedmiotÃģw i poÅÄ czyÄ je w jeden obraz. NastÄpnie model jest szkolony z podpowiedziami, ktÃģre jawnie opisujÄ oddzielne elementy w obrazie. To zmusza model do rozpoznania i zachowania odrÄbnych pojÄÄ, zamiast ich ÅÄ czenia.
Podczas szkolenia dodatkowy termin regularizacji pomaga zapobiec interferencji miÄdzy przedmiotami. Teoria autorÃģw utrzymuje, Åže to uÅatwia lepsze generowanie wielu przedmiotÃģw, gdzie kaÅždy element pozostaje wizualnie odrÄbny, a nie poÅÄ czony.
SVDiff, wykluczony z rundy testowej LoRA-X, ma na celu stworzenie kompaktowej przestrzeni parametrÃģw. LoRA-X, zamiast tego, koncentruje siÄ na przenoszeniu parametrÃģw LoRA miÄdzy rÃģÅžnymi modelami podstawowymi, dziaÅajÄ c w przestrzeni podstawowego modelu.
Conclusion
Metody omÃģwione tutaj nie sÄ jedynymi mieszkaÅcami PEFT. Inne obejmujÄ QLoRA i QA-LoRA; Prefix Tuning; Prompt-Tuning; i adapter-tuning, wÅrÃģd innych.
âAktualizowalna LoRAâ jest, byÄ moÅže, poszukiwaniem alchemicznym; na pewno nie ma niczego na horyzoncie, co mogÅoby uniemoÅžliwiÄ modelarzom LoRA ponowne wykorzystanie ich starych zestawÃģw danych dla najnowszych i najlepszych wersji wag. JeÅli istnieje jakiÅ moÅžliwy prototypowy standard rewizji wag, ktÃģry mÃģgÅby przetrwaÄ zmiany architektury i rosnÄ ce parametry miÄdzy wersjami modelu, nie pojawiÅ siÄ on jeszcze w literaturze i bÄdzie musiaÅ byÄ nadal wyodrÄbniany z danych na podstawie modelu.
Â
Pierwotnie opublikowany w czwartek, 30 stycznia 2025












