Kąt Andersona

W kierunku LoR, które mogą przetrwać aktualizacje wersji modelu

mm
Dodaj Unite.AI do preferowanych źródeł w Google
ChatGPT-4o: variation on ‘a 1792x1024 feature article reportage image of a skip full of discarded metal figurines, featuring realistic men and women of all ages and all types’

Od czasu mojego ostatniego artykułu o wzroście popularności Hunyuan Video LoR (małych, wytrenowanych plików, które mogą wstrzykiwać niestandardowe osobowości do modeli tekst-do-obrazu i obraz-do-obrazu), liczba powiązanych LoR dostępnych w społeczności Civit wzrosła o 185%.

Pomimo braku łatwych lub niskonakładowych sposobów tworzenia Hunyuan Video LoRA, katalog LoR z celebrytami i tematami w Civit rośnie codziennie. Źródło: https://civitai.com/

Pomimo braku łatwych lub niskonakładowych sposobów tworzenia Hunyuan Video LoRA, katalog LoR z celebrytami i tematami w Civit rośnie codziennie. Źródło: https://civitai.com/

Ta sama społeczność, która jest zdesperowana, by nauczyć się tworzyć te „dodatkowe osobowości” dla Hunyuan Video (HV), również ulceruje z powodu obiecanej premiery funkcjonalności obraz-do-obrazu (I2V) w Hunyuan Video.

W odniesieniu do otwartego źródła syntezowania obrazów ludzi, jest to duże wydarzenie; w połączeniu ze wzrostem LoR, mogłoby umożliwić użytkownikom przekształcanie zdjęć ludzi w filmy w sposób, który nie niszczy ich tożsamości, gdy film się rozwija – co jest obecnie przypadkiem we wszystkich najnowszych generatorach obrazu, w tym Kling, Kaiber i słynnym RunwayML:

Kliknij, aby odtworzyć. Generowanie obrazu z modelem Gen 3 Turbo RunwayML. Jednak, podobnie jak wszystkie podobne i gorsze modele rywalizujące, nie może utrzymać spójnej tożsamości, gdy temat odwraca się od kamery, a charakterystyczne cechy obrazu początkowego stają się „kobietą dyfuzji”. Źródło: https://app.runwayml.com/

Poprzez rozwinięcie niestandardowej LoRA dla danej osobowości, można, w przepływie pracy I2V, użyć prawdziwego zdjęcia jako punktu startowego. Jest to lepszy „nasiono” niż wysłanie losowej liczby do przestrzeni latentnej modelu i zaakceptowanie wynikającej sytuacji semantycznej. Następnie można użyć LoRA lub wielu LoR, aby utrzymać spójność tożsamości, fryzur, ubrań i innych kluczowych aspektów generacji.

Potencjalnie, dostępność takiego połączenia mogłaby reprezentować jeden z najbardziej epokowych zwrotów w generatywnym AI od czasu premiery Stable Diffusion, z potężną siłą generatywną przekazaną entuzjastom open source, bez regulacji (lub „bramkarstwa”, jeśli wolisz) zapewnianej przez cenzorów treści w bieżącej generacji popularnych systemów wideo.

W momencie, gdy piszę, Hunyuan obraz-do-obrazu jest niewybranym „zadaniem” w repozytorium Hunyuan Video GitHub, z hobbyistyczną społecznością, która relacjonuje (anegdotycznie) komentarz z Discorda od dewelopera Hunyuan, który podobno stwierdził, że wydanie tej funkcjonalności zostało przesunięte na później w Q1 z powodu modelu bycia „zbyt niecenzurowanym”.

Oficjalna lista wydania funkcji Hunyuan Video. Źródło: https://github.com/Tencent/HunyuanVideo?tab=readme-ov-file#-open-source-plan

Oficjalna lista wydania funkcji Hunyuan Video. Źródło: https://github.com/Tencent/HunyuanVideo?tab=readme-ov-file#-open-source-plan

Dokładne czy nie, deweloperzy repozytorium w znacznym stopniu dotrzymali reszty checklisty Hunyuan, a zatem Hunyuan I2V wydaje się, że przyjdzie ostatecznie, niezależnie od tego, czy jest to wersja ocenzurowana, nieocenzurowana czy w jakiś sposób „odblokowana”.

Ale jak możemy zobaczyć w liście powyżej, wydanie I2V jest oczywiście oddzielnym modelem – co sprawia, że jest mało prawdopodobne, że jakiekolwiek z bieżących LoR w Civit i gdzie indziej będą działać z nim.

W tym (obecnie) przewidywalnym scenariuszu, ramy szkoleniowe LoRA, takie jak Musubi Tuner i OneTrainer, będą albo cofnięte, albo zresetowane w odniesieniu do obsługi nowego modelu. Tymczasem jeden lub dwóch najbardziej zaawansowanych technicznie (i przedsiębiorczych) luminarzy AI z YouTube będzie okupował swoje rozwiązania za pośrednictwem Patreon, dopóki scena nie dogoni.

Upgrade Fatigue

Prawie nikt nie doświadcza zmęczenia aktualizacjami tak bardzo, jak entuzjasta LoRA lub dostosowywania, ponieważ szybki i konkurencyjny temp zmian w generatywnym AI zachęca do tworzenia nowych, lepszych modeli przez takie foundry jak Stability.ai, Tencent i Black Forest Labs w maksymalnie możliwej częstotliwości.

Odkąd nowe i ulepszone modele będą miały co najmniej inne biasy i wagi, a częściej będą miały inną skalę i/lub architekturę, oznacza to, że społeczność dostosowywania musi ponownie wyciągnąć swoje zestawy danych i powtórzyć proces szkolenia dla nowej wersji.

Z tego powodu dostępnych jest wiele typów wersji LoRA Stable Diffusion w Civit:

Ścieżka aktualizacji, wizualizowana w filtrach wyszukiwania w civit.ai

Ścieżka aktualizacji, wizualizowana w filtrach wyszukiwania w civit.ai

Ponieważ żaden z tych lekkich modeli LoRA nie jest interoperacyjny z wyższymi lub niższymi wersjami modelu, a wiele z nich ma zależności od popularnych dużych połączeń i dostosowań, które przylegają do starszego modelu, znaczna część społeczności skłania się ku pozostaniu przy „starszej” wersji, podobnie jak lojalność klientów wobec Windows XP trwała latami po zakończeniu oficjalnego wsparcia.

Adapting to Change

Ten temat przychodzi na myśl z powodu nowego artykułu z Qualcomm AI Research, który twierdzi, że opracował metodę, za pomocą której istniejące LoRA mogą być „aktualizowane” do nowo wydanej wersji modelu.

Przykładowa konwersja LoR między wersjami modelu. Źródło: https://arxiv.org/pdf/2501.16559

Przykładowa konwersja LoR między wersjami modelu. Źródło: https://arxiv.org/pdf/2501.16559

To nie oznacza, że nowy podejście, zatytułowane LoRA-X, może swobodnie przekładać się między wszystkimi modelami tego samego typu (tj. modelami tekst-do-obrazu lub dużymi modelami językowymi [LLM]); ale autorzy udowodnili skuteczną transliterację LoRA z Stable Diffusion v1.5 > SDXL i konwersję LoRA dla modelu TinyLlama 3T do TinyLlama 2.5T.

LoRA-X przenosi parametry LoRA między różnymi modelami bazowymi, zachowując adapter w przestrzeni podstawowego modelu; ale tylko w częściach modelu, które są wystarczająco podobne w różnych wersjach.

Po lewej, schemat sposobu, w jaki LoRA-X dostosowuje adapter w modelu źródłowym, który jest następnie dostosowywany do modelu docelowego za pomocą jego własnej struktury wewnętrznej. Po prawej, obrazy wygenerowane przez modele docelowe SD Eff-v1.0 i SSD-1B, po zastosowaniu adapterów przeniesionych z SD-v1.5 i SDXL bez dodatkowego szkolenia.

Po lewej, schemat sposobu, w jaki LoRA-X dostosowuje adapter w modelu źródłowym, który jest następnie dostosowywany do modelu docelowego. Po prawej, obrazy wygenerowane przez modele docelowe SD Eff-v1.0 i SSD-1B, po zastosowaniu adapterów przeniesionych z SD-v1.5 i SDXL bez dodatkowego szkolenia.

Chociaż to oferuje praktyczne rozwiązanie dla sytuacji, w których ponowne szkolenie jest niepożądane lub niemożliwe (takie jak zmiana licencji na danych szkoleniowych), metoda ta jest ograniczona do podobnych architektur modeli, wśród innych ograniczeń.

Chociaż jest to rzadki wkład w niezbadany obszar, nie będziemy analizować tego artykułu w depth z powodu licznych niedostatków LoRA-X, jak wynika z komentarzy krytyków i doradców w Open Review.

Zależność metody od podobieństwa przestrzeni ogranicza jej zastosowanie do ściśle powiązanych modeli, a autorzy przyznali w forum przeglądowym, że LoRA-X nie może być łatwo przeniesiony między znacznie różnymi architekturami

Inne podejścia PEFT

Możliwość uczynienia LoR bardziej przenośnymi między wersjami jest małym, ale interesującym wątkiem badań w literaturze, a główny wkład LoRA-X w ten obszar polega na tym, że nie wymaga szkolenia. To nie jest ściśle prawdą, jeśli czyta się artykuł, ale wymaga najmniejszego szkolenia spośród wszystkich poprzednich metod.

LoRA-X jest kolejnym wpisem w kanonie metod PEFT (Parameter-Efficient Fine-Tuning), które zajmują się wyzwaniem adaptacji dużych wstępnie wytrenowanych modeli do konkretnych zadań bez rozległego ponownego szkolenia. To podejście koncepcyjne ma na celu modyfikację minimalnej liczby parametrów przy zachowaniu wydajności.

Wśród nich wyróżniają się:

X-Adapter

Ramka X-Adapter przenosi dostosowane adaptery między modelami z pewną ilością ponownego szkolenia. System ten ma na celu umożliwienie wstępnie wytrenowanych modułów (takich jak ControlNet i LoRA) z modelu dyfuzyjnego (tj. Stable Diffusion v1.5) do pracy bezpośrednio z zaktualizowanym modelem dyfuzyjnym, takim jak SDXL, bez ponownego szkolenia – efektywnie działając jako „uniwersalny aktualizator” dla wtyczek.

System ten osiąga to, szkoląc dodatkową sieć, która kontroluje zaktualizowany model, używając zamrożonej kopii modelu podstawowego do zachowania łączników wtyczek:

Schemat X-Adapter. Źródło: https://arxiv.org/pdf/2312.02238

Schemat X-Adapter. Źródło: https://arxiv.org/pdf/2312.02238

X-Adapter został pierwotnie opracowany i przetestowany w celu przeniesienia adapterów z SD1.5 do SDXL, podczas gdy LoRA-X oferuje szerszy zakres transliteracji.

DoRA (Weight-Decomposed Low-Rank Adaptation)

DoRA to ulepszona metoda dostosowywania, która poprawia LoRA, używając strategii dekompozycji wag, która bardziej przypomina pełne dostosowywanie:

DoRA nie próbuje tylko skopiować adapter w środowisku zamrożonym, jak LoRA-X, ale zmienia podstawowe parametry wag, takie jak wielkość i kierunek. Źródło: https://arxiv.org/pdf/2402.09353

DoRA nie próbuje tylko skopiować adapter w środowisku zamrożonym, jak LoRA-X, ale zmienia podstawowe parametry wag, takie jak wielkość i kierunek. Źródło: https://arxiv.org/pdf/2402.09353

DoRA koncentruje się na poprawie samego procesu dostosowywania, dekomponując wagi modelu na wielkość i kierunek (patrz powyżej). Zamiast tego, LoRA-X koncentruje się na umożliwieniu przeniesienia istniejących dostosowanych parametrów między różnymi modelami podstawowymi

Jednakże podejście LoRA-X wykorzystuje techniki projekcji opracowane dla DoRA, i w testach przeciwko temu starszemu systemowi twierdzi, że uzyskał lepszy DINO wynik.

FouRA (Fourier Low Rank Adaptation)

Opublikowany w czerwcu 2024, metoda FouRA pochodzi, podobnie jak LoRA-X, z Qualcomm AI Research i dzieli niektóre z tych samych testowych bodźców i tematów.

Przykłady załamania dystrybucji w LoRA, z artykułu FouRA z 2024, używając modelu Realistic Vision 3.0 wytrenowanego z LoRA i FouRA dla adapterów „Blue Fire” i „Origami”, w czterech nasionach. Obrazy LoRA wykazują załamanie dystrybucji i zmniejszoną różnorodność, podczas gdy FouRA generuje bardziej zróżnicowane dane wyjściowe. Źródło: https://arxiv.org/pdf/2406.08798

Przykłady załamania dystrybucji w LoRA, z artykułu FouRA z 2024, używając modelu Realistic Vision 3.0 wytrenowanego z LoRA i FouRA dla adapterów „Blue Fire” i „Origami”, w czterech nasionach. Obrazy LoRA wykazują załamanie dystrybucji i zmniejszoną różnorodność, podczas gdy FouRA generuje bardziej zróżnicowane dane wyjściowe. Źródło: https://arxiv.org/pdf/2406.08798

FouRA koncentruje się na poprawie różnorodności i jakości generowanych obrazów, dostosowując LoRA w dziedzinie częstotliwości, używając podejścia Fourier.

Tutaj, ponownie, LoRA-X osiągnął lepsze wyniki niż podejście oparte na Fourierze FouRA.

Chociaż obie ramy należą do kategorii PEFT, mają bardzo różne przypadki użycia i podejścia; w tym przypadku FouRA jest raczej „wypełnieniem” dla rundy testowej z ograniczoną liczbą rywali dla nowych autorów.

SVDiff

SVDiff ma również inne cele niż LoRA-X, ale jest silnie wykorzystywany w nowym artykule. SVDiff jest zaprojektowany w celu poprawy wydajności dostosowywania modeli dyfuzyjnych i bezpośrednio modyfikuje wartości w macierzach wag modelu, przy zachowaniu niezmienionych wektorów singularnych. SVDiff używa przycinanego SVD, modyfikując tylko największe wartości, aby dostosować wagi modelu.

To podejście wykorzystuje technikę augmentacji danych o nazwie Cut-Mix-Unmix:

Generowanie wielu przedmiotów działa jako system izolujący pojęcia w SVDiff. Źródło: https://arxiv.org/pdf/2303.11305

Generowanie wielu przedmiotów działa jako system izolujący pojęcia w SVDiff. Źródło: https://arxiv.org/pdf/2303.11305

Cut-Mix-Unmix jest zaprojektowany, aby pomóc modelowi dyfuzyjnym nauczyć się wielu odrębnych pojęć bez ich przenikania się. Główny pomysł polega na tym, aby wziąć obrazy różnych przedmiotów i połączyć je w jeden obraz. Następnie model jest szkolony z podpowiedziami, które jawnie opisują oddzielne elementy w obrazie. To zmusza model do rozpoznania i zachowania odrębnych pojęć, zamiast ich łączenia.

Podczas szkolenia dodatkowy termin regularizacji pomaga zapobiec interferencji między przedmiotami. Teoria autorów utrzymuje, że to ułatwia lepsze generowanie wielu przedmiotów, gdzie każdy element pozostaje wizualnie odrębny, a nie połączony.

SVDiff, wykluczony z rundy testowej LoRA-X, ma na celu stworzenie kompaktowej przestrzeni parametrów. LoRA-X, zamiast tego, koncentruje się na przenoszeniu parametrów LoRA między różnymi modelami podstawowymi, działając w przestrzeni podstawowego modelu.

Conclusion

Metody omówione tutaj nie są jedynymi mieszkańcami PEFT. Inne obejmują QLoRA i QA-LoRA; Prefix Tuning; Prompt-Tuning; i adapter-tuning, wśród innych.

„Aktualizowalna LoRA” jest, być może, poszukiwaniem alchemicznym; na pewno nie ma niczego na horyzoncie, co mogłoby uniemożliwić modelarzom LoRA ponowne wykorzystanie ich starych zestawów danych dla najnowszych i najlepszych wersji wag. Jeśli istnieje jakiś możliwy prototypowy standard rewizji wag, który mógłby przetrwać zmiany architektury i rosnące parametry między wersjami modelu, nie pojawił się on jeszcze w literaturze i będzie musiał być nadal wyodrębniany z danych na podstawie modelu.

 

Pierwotnie opublikowany w czwartek, 30 stycznia 2025

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai