Kąt Andersona

W kierunku LoR, ktÃģre mogą przetrwać aktualizacje wersji modelu

mm
Dodaj Unite.AI do preferowanych ÅšrÃģdeł w Google
ChatGPT-4o: variation on ‘a 1792x1024 feature article reportage image of a skip full of discarded metal figurines, featuring realistic men and women of all ages and all types’

Od czasu mojego ostatniego artykułu o wzroście popularności Hunyuan Video LoR (małych, wytrenowanych plikÃģw, ktÃģre mogą wstrzykiwać niestandardowe osobowości do modeli tekst-do-obrazu i obraz-do-obrazu), liczba powiązanych LoR dostępnych w społeczności Civit wzrosła o 185%.

Pomimo braku łatwych lub niskonakładowych sposobÃģw tworzenia Hunyuan Video LoRA, katalog LoR z celebrytami i tematami w Civit rośnie codziennie. ÅđrÃģdło: https://civitai.com/

Pomimo braku łatwych lub niskonakładowych sposobÃģw tworzenia Hunyuan Video LoRA, katalog LoR z celebrytami i tematami w Civit rośnie codziennie. ÅđrÃģdło: https://civitai.com/

Ta sama społeczność, ktÃģra jest zdesperowana, by nauczyć się tworzyć te „dodatkowe osobowości” dla Hunyuan Video (HV), rÃģwnieÅž ulceruje z powodu obiecanej premiery funkcjonalności obraz-do-obrazu (I2V) w Hunyuan Video.

W odniesieniu do otwartego ÅšrÃģdła syntezowania obrazÃģw ludzi, jest to duÅže wydarzenie; w połączeniu ze wzrostem LoR, mogłoby umoÅžliwić uÅžytkownikom przekształcanie zdjęć ludzi w filmy w sposÃģb, ktÃģry nie niszczy ich toÅžsamości, gdy film się rozwija – co jest obecnie przypadkiem we wszystkich najnowszych generatorach obrazu, w tym Kling, Kaiber i słynnym RunwayML:

Kliknij, aby odtworzyć. Generowanie obrazu z modelem Gen 3 Turbo RunwayML. Jednak, podobnie jak wszystkie podobne i gorsze modele rywalizujące, nie moÅže utrzymać spÃģjnej toÅžsamości, gdy temat odwraca się od kamery, a charakterystyczne cechy obrazu początkowego stają się „kobietą dyfuzji”. ÅđrÃģdło: https://app.runwayml.com/

Poprzez rozwinięcie niestandardowej LoRA dla danej osobowości, moÅžna, w przepływie pracy I2V, uÅžyć prawdziwego zdjęcia jako punktu startowego. Jest to lepszy „nasiono” niÅž wysłanie losowej liczby do przestrzeni latentnej modelu i zaakceptowanie wynikającej sytuacji semantycznej. Następnie moÅžna uÅžyć LoRA lub wielu LoR, aby utrzymać spÃģjność toÅžsamości, fryzur, ubrań i innych kluczowych aspektÃģw generacji.

Potencjalnie, dostępność takiego połączenia mogłaby reprezentować jeden z najbardziej epokowych zwrotÃģw w generatywnym AI od czasu premiery Stable Diffusion, z potęŞną siłą generatywną przekazaną entuzjastom open source, bez regulacji (lub „bramkarstwa”, jeśli wolisz) zapewnianej przez cenzorÃģw treści w bieŞącej generacji popularnych systemÃģw wideo.

W momencie, gdy piszę, Hunyuan obraz-do-obrazu jest niewybranym „zadaniem” w repozytorium Hunyuan Video GitHub, z hobbyistyczną społecznością, ktÃģra relacjonuje (anegdotycznie) komentarz z Discorda od dewelopera Hunyuan, ktÃģry podobno stwierdził, Åže wydanie tej funkcjonalności zostało przesunięte na pÃģÅšniej w Q1 z powodu modelu bycia „zbyt niecenzurowanym”.

Oficjalna lista wydania funkcji Hunyuan Video. ÅđrÃģdło: https://github.com/Tencent/HunyuanVideo?tab=readme-ov-file#-open-source-plan

Oficjalna lista wydania funkcji Hunyuan Video. ÅđrÃģdło: https://github.com/Tencent/HunyuanVideo?tab=readme-ov-file#-open-source-plan

Dokładne czy nie, deweloperzy repozytorium w znacznym stopniu dotrzymali reszty checklisty Hunyuan, a zatem Hunyuan I2V wydaje się, Åže przyjdzie ostatecznie, niezaleÅžnie od tego, czy jest to wersja ocenzurowana, nieocenzurowana czy w jakiś sposÃģb „odblokowana”.

Ale jak moÅžemy zobaczyć w liście powyÅžej, wydanie I2V jest oczywiście oddzielnym modelem – co sprawia, Åže jest mało prawdopodobne, Åže jakiekolwiek z bieŞących LoR w Civit i gdzie indziej będą działać z nim.

W tym (obecnie) przewidywalnym scenariuszu, ramy szkoleniowe LoRA, takie jak Musubi Tuner i OneTrainer, będą albo cofnięte, albo zresetowane w odniesieniu do obsługi nowego modelu. Tymczasem jeden lub dwÃģch najbardziej zaawansowanych technicznie (i przedsiębiorczych) luminarzy AI z YouTube będzie okupował swoje rozwiązania za pośrednictwem Patreon, dopÃģki scena nie dogoni.

Upgrade Fatigue

Prawie nikt nie doświadcza zmęczenia aktualizacjami tak bardzo, jak entuzjasta LoRA lub dostosowywania, poniewaÅž szybki i konkurencyjny temp zmian w generatywnym AI zachęca do tworzenia nowych, lepszych modeli przez takie foundry jak Stability.ai, Tencent i Black Forest Labs w maksymalnie moÅžliwej częstotliwości.

Odkąd nowe i ulepszone modele będą miały co najmniej inne biasy i wagi, a częściej będą miały inną skalę i/lub architekturę, oznacza to, Åže społeczność dostosowywania musi ponownie wyciągnąć swoje zestawy danych i powtÃģrzyć proces szkolenia dla nowej wersji.

Z tego powodu dostępnych jest wiele typÃģw wersji LoRA Stable Diffusion w Civit:

ŚcieÅžka aktualizacji, wizualizowana w filtrach wyszukiwania w civit.ai

ŚcieÅžka aktualizacji, wizualizowana w filtrach wyszukiwania w civit.ai

PoniewaÅž Åžaden z tych lekkich modeli LoRA nie jest interoperacyjny z wyÅžszymi lub niÅžszymi wersjami modelu, a wiele z nich ma zaleÅžności od popularnych duÅžych połączeń i dostosowań, ktÃģre przylegają do starszego modelu, znaczna część społeczności skłania się ku pozostaniu przy „starszej” wersji, podobnie jak lojalność klientÃģw wobec Windows XP trwała latami po zakończeniu oficjalnego wsparcia.

Adapting to Change

Ten temat przychodzi na myśl z powodu nowego artykułu z Qualcomm AI Research, ktÃģry twierdzi, Åže opracował metodę, za pomocą ktÃģrej istniejące LoRA mogą być „aktualizowane” do nowo wydanej wersji modelu.

Przykładowa konwersja LoR między wersjami modelu. ÅđrÃģdło: https://arxiv.org/pdf/2501.16559

Przykładowa konwersja LoR między wersjami modelu. ÅđrÃģdło: https://arxiv.org/pdf/2501.16559

To nie oznacza, Åže nowy podejście, zatytułowane LoRA-X, moÅže swobodnie przekładać się między wszystkimi modelami tego samego typu (tj. modelami tekst-do-obrazu lub duÅžymi modelami językowymi [LLM]); ale autorzy udowodnili skuteczną transliterację LoRA z Stable Diffusion v1.5 > SDXL i konwersję LoRA dla modelu TinyLlama 3T do TinyLlama 2.5T.

LoRA-X przenosi parametry LoRA między rÃģÅžnymi modelami bazowymi, zachowując adapter w przestrzeni podstawowego modelu; ale tylko w częściach modelu, ktÃģre są wystarczająco podobne w rÃģÅžnych wersjach.

Po lewej, schemat sposobu, w jaki LoRA-X dostosowuje adapter w modelu ÅšrÃģdłowym, ktÃģry jest następnie dostosowywany do modelu docelowego za pomocą jego własnej struktury wewnętrznej. Po prawej, obrazy wygenerowane przez modele docelowe SD Eff-v1.0 i SSD-1B, po zastosowaniu adapterÃģw przeniesionych z SD-v1.5 i SDXL bez dodatkowego szkolenia.

Po lewej, schemat sposobu, w jaki LoRA-X dostosowuje adapter w modelu ÅšrÃģdłowym, ktÃģry jest następnie dostosowywany do modelu docelowego. Po prawej, obrazy wygenerowane przez modele docelowe SD Eff-v1.0 i SSD-1B, po zastosowaniu adapterÃģw przeniesionych z SD-v1.5 i SDXL bez dodatkowego szkolenia.

ChociaÅž to oferuje praktyczne rozwiązanie dla sytuacji, w ktÃģrych ponowne szkolenie jest niepoŞądane lub niemoÅžliwe (takie jak zmiana licencji na danych szkoleniowych), metoda ta jest ograniczona do podobnych architektur modeli, wśrÃģd innych ograniczeń.

ChociaÅž jest to rzadki wkład w niezbadany obszar, nie będziemy analizować tego artykułu w depth z powodu licznych niedostatkÃģw LoRA-X, jak wynika z komentarzy krytykÃģw i doradcÃģw w Open Review.

ZaleÅžność metody od podobieństwa przestrzeni ogranicza jej zastosowanie do ściśle powiązanych modeli, a autorzy przyznali w forum przeglądowym, Åže LoRA-X nie moÅže być łatwo przeniesiony między znacznie rÃģÅžnymi architekturami

Inne podejścia PEFT

MoÅžliwość uczynienia LoR bardziej przenośnymi między wersjami jest małym, ale interesującym wątkiem badań w literaturze, a głÃģwny wkład LoRA-X w ten obszar polega na tym, Åže nie wymaga szkolenia. To nie jest ściśle prawdą, jeśli czyta się artykuł, ale wymaga najmniejszego szkolenia spośrÃģd wszystkich poprzednich metod.

LoRA-X jest kolejnym wpisem w kanonie metod PEFT (Parameter-Efficient Fine-Tuning), ktÃģre zajmują się wyzwaniem adaptacji duÅžych wstępnie wytrenowanych modeli do konkretnych zadań bez rozległego ponownego szkolenia. To podejście koncepcyjne ma na celu modyfikację minimalnej liczby parametrÃģw przy zachowaniu wydajności.

WśrÃģd nich wyrÃģÅžniają się:

X-Adapter

Ramka X-Adapter przenosi dostosowane adaptery między modelami z pewną ilością ponownego szkolenia. System ten ma na celu umoÅžliwienie wstępnie wytrenowanych modułÃģw (takich jak ControlNet i LoRA) z modelu dyfuzyjnego (tj. Stable Diffusion v1.5) do pracy bezpośrednio z zaktualizowanym modelem dyfuzyjnym, takim jak SDXL, bez ponownego szkolenia – efektywnie działając jako „uniwersalny aktualizator” dla wtyczek.

System ten osiąga to, szkoląc dodatkową sieć, ktÃģra kontroluje zaktualizowany model, uÅžywając zamroÅžonej kopii modelu podstawowego do zachowania łącznikÃģw wtyczek:

Schemat X-Adapter. ÅđrÃģdło: https://arxiv.org/pdf/2312.02238

Schemat X-Adapter. ÅđrÃģdło: https://arxiv.org/pdf/2312.02238

X-Adapter został pierwotnie opracowany i przetestowany w celu przeniesienia adapterÃģw z SD1.5 do SDXL, podczas gdy LoRA-X oferuje szerszy zakres transliteracji.

DoRA (Weight-Decomposed Low-Rank Adaptation)

DoRA to ulepszona metoda dostosowywania, ktÃģra poprawia LoRA, uÅžywając strategii dekompozycji wag, ktÃģra bardziej przypomina pełne dostosowywanie:

DoRA nie prÃģbuje tylko skopiować adapter w środowisku zamroÅžonym, jak LoRA-X, ale zmienia podstawowe parametry wag, takie jak wielkość i kierunek. ÅđrÃģdło: https://arxiv.org/pdf/2402.09353

DoRA nie prÃģbuje tylko skopiować adapter w środowisku zamroÅžonym, jak LoRA-X, ale zmienia podstawowe parametry wag, takie jak wielkość i kierunek. ÅđrÃģdło: https://arxiv.org/pdf/2402.09353

DoRA koncentruje się na poprawie samego procesu dostosowywania, dekomponując wagi modelu na wielkość i kierunek (patrz powyÅžej). Zamiast tego, LoRA-X koncentruje się na umoÅžliwieniu przeniesienia istniejących dostosowanych parametrÃģw między rÃģÅžnymi modelami podstawowymi

JednakÅže podejście LoRA-X wykorzystuje techniki projekcji opracowane dla DoRA, i w testach przeciwko temu starszemu systemowi twierdzi, Åže uzyskał lepszy DINO wynik.

FouRA (Fourier Low Rank Adaptation)

Opublikowany w czerwcu 2024, metoda FouRA pochodzi, podobnie jak LoRA-X, z Qualcomm AI Research i dzieli niektÃģre z tych samych testowych bodÅšcÃģw i tematÃģw.

Przykłady załamania dystrybucji w LoRA, z artykułu FouRA z 2024, uÅžywając modelu Realistic Vision 3.0 wytrenowanego z LoRA i FouRA dla adapterÃģw „Blue Fire” i „Origami”, w czterech nasionach. Obrazy LoRA wykazują załamanie dystrybucji i zmniejszoną rÃģÅžnorodność, podczas gdy FouRA generuje bardziej zrÃģÅžnicowane dane wyjściowe. ÅđrÃģdło: https://arxiv.org/pdf/2406.08798

Przykłady załamania dystrybucji w LoRA, z artykułu FouRA z 2024, uÅžywając modelu Realistic Vision 3.0 wytrenowanego z LoRA i FouRA dla adapterÃģw „Blue Fire” i „Origami”, w czterech nasionach. Obrazy LoRA wykazują załamanie dystrybucji i zmniejszoną rÃģÅžnorodność, podczas gdy FouRA generuje bardziej zrÃģÅžnicowane dane wyjściowe. ÅđrÃģdło: https://arxiv.org/pdf/2406.08798

FouRA koncentruje się na poprawie rÃģÅžnorodności i jakości generowanych obrazÃģw, dostosowując LoRA w dziedzinie częstotliwości, uÅžywając podejścia Fourier.

Tutaj, ponownie, LoRA-X osiągnął lepsze wyniki niÅž podejście oparte na Fourierze FouRA.

ChociaÅž obie ramy naleŞą do kategorii PEFT, mają bardzo rÃģÅžne przypadki uÅžycia i podejścia; w tym przypadku FouRA jest raczej „wypełnieniem” dla rundy testowej z ograniczoną liczbą rywali dla nowych autorÃģw.

SVDiff

SVDiff ma rÃģwnieÅž inne cele niÅž LoRA-X, ale jest silnie wykorzystywany w nowym artykule. SVDiff jest zaprojektowany w celu poprawy wydajności dostosowywania modeli dyfuzyjnych i bezpośrednio modyfikuje wartości w macierzach wag modelu, przy zachowaniu niezmienionych wektorÃģw singularnych. SVDiff uÅžywa przycinanego SVD, modyfikując tylko największe wartości, aby dostosować wagi modelu.

To podejście wykorzystuje technikę augmentacji danych o nazwie Cut-Mix-Unmix:

Generowanie wielu przedmiotÃģw działa jako system izolujący pojęcia w SVDiff. ÅđrÃģdło: https://arxiv.org/pdf/2303.11305

Generowanie wielu przedmiotÃģw działa jako system izolujący pojęcia w SVDiff. ÅđrÃģdło: https://arxiv.org/pdf/2303.11305

Cut-Mix-Unmix jest zaprojektowany, aby pomÃģc modelowi dyfuzyjnym nauczyć się wielu odrębnych pojęć bez ich przenikania się. GłÃģwny pomysł polega na tym, aby wziąć obrazy rÃģÅžnych przedmiotÃģw i połączyć je w jeden obraz. Następnie model jest szkolony z podpowiedziami, ktÃģre jawnie opisują oddzielne elementy w obrazie. To zmusza model do rozpoznania i zachowania odrębnych pojęć, zamiast ich łączenia.

Podczas szkolenia dodatkowy termin regularizacji pomaga zapobiec interferencji między przedmiotami. Teoria autorÃģw utrzymuje, Åže to ułatwia lepsze generowanie wielu przedmiotÃģw, gdzie kaÅždy element pozostaje wizualnie odrębny, a nie połączony.

SVDiff, wykluczony z rundy testowej LoRA-X, ma na celu stworzenie kompaktowej przestrzeni parametrÃģw. LoRA-X, zamiast tego, koncentruje się na przenoszeniu parametrÃģw LoRA między rÃģÅžnymi modelami podstawowymi, działając w przestrzeni podstawowego modelu.

Conclusion

Metody omÃģwione tutaj nie są jedynymi mieszkańcami PEFT. Inne obejmują QLoRA i QA-LoRA; Prefix Tuning; Prompt-Tuning; i adapter-tuning, wśrÃģd innych.

„Aktualizowalna LoRA” jest, być moÅže, poszukiwaniem alchemicznym; na pewno nie ma niczego na horyzoncie, co mogłoby uniemoÅžliwić modelarzom LoRA ponowne wykorzystanie ich starych zestawÃģw danych dla najnowszych i najlepszych wersji wag. Jeśli istnieje jakiś moÅžliwy prototypowy standard rewizji wag, ktÃģry mÃģgłby przetrwać zmiany architektury i rosnące parametry między wersjami modelu, nie pojawił się on jeszcze w literaturze i będzie musiał być nadal wyodrębniany z danych na podstawie modelu.

 

Pierwotnie opublikowany w czwartek, 30 stycznia 2025

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazÃģw ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]