Погляд Anderson
До тих пір, поки LoRAs не зможуть пережити оновлення моделі

Від часу моєї останньої статті про зростання популярності Hunyuan Video LoRAs (малі, треновані файли, які можуть ін’єктувати особистість у багатミльярдні параметричні моделі текст-відео та зображення-відео), кількість пов’язаних LoRAs, доступних у спільноті Civit, зросла на 185%.

Незважаючи на те, що немає особливо легких або низькозатратних способів створити Hunyuan Video LoRA, каталог знаменитостей і тематичних LoRAs на Civit зростає щодня. Джерело: https://civitai.com/
Та ж сама спільнота, яка намагається вивчити, як створити ці «додаткові особистості» для Hunyuan Video (HV), також очікує обіцяної публікації функції зображення-відео (I2V) у Hunyuan Video.
Що стосується відкритої джерельної синтезу людських зображень, це велика справа; у поєднанні зі зростанням Hunyuan LoRAs, це може дозволити користувачам перетворити фотографії людей у відео таким чином, щоб не руйнувався їхній ідентифікатор під час розвитку відео – що зараз є справою у всіх сучасних генераторах зображення-відео, включаючи Kling, Kaiber і знаменитий RunwayML:
Натисніть, щоб відтворити. Генерація зображення-відео з моделі RunwayML Gen 3 Turbo. Однак, як і всі подібні та менш значимі моделі, вона не може зберегти ідентичність, коли об’єкт відвертається від камери, і особливості початкового зображення стають «дженеричною дифузійною жінкою». Джерело: https://app.runwayml.com/
Розробивши спеціальну LoRA для особистості, одним можна було б використовувати реальну фотографію як початкову точку у робочому процесі HV I2V. Це значно краще «посів» ніж надсилання випадкового числа у латентний простір моделі та погодження з тим, яке семантичне сценарій вийде. Потім можна було б використовувати LoRA або кілька LoRAs, щоб зберегти ідентичність, стилі зачіски, одяг та інші ключові аспекти генерації.
Потенційно, наявність такого поєднання могла б представляти одну з найбільш епохальних змін у генераційному штучному інтелекті з моменту запуску Stable Diffusion, з потужними генеративними можливостями, переданими ентузіастам відкритого джерела, без регулювання (або «контролю», якщо вам більше до вподоби) сучасних популярних генеративних відеосистем.
Коли я пишу, Hunyuan зображення-відео є невідзначеною справою у репозиторії Hunyuan Video на GitHub, з повідомленнями спільноти (анекдотично) про коментар Hunyuan розробника у Discord, який, як кажуть, заявив, що публікація цієї функції була відкладена на пізніше у Q1 через те, що модель була «занадто нецензурною».

Офіційний список випуску функцій Hunyuan Video. Джерело: https://github.com/Tencent/HunyuanVideo?tab=readme-ov-file#-open-source-plan
Точне чи ні, розробники репозиторію значно виконали інші пункти списку Hunyuan, і тому Hunyuan I2V, здається, з’явиться врешті-решт, чи то цензурою, чи нецензурою, чи в деякому вигляді «розблокованим».
Але, як ми бачимо у списку вище, публікація I2V являє собою окрему модель зовсім – що робить досить малоймовірним, що будь-яка з поточної зростаючої кількості HV LoRAs на Civit і в інших місцях буде функціонувати з нею.
У цьому (зараз передбачуваному) сценарії LoRA тренувальні фреймворки, такі як Musubi Tuner і OneTrainer, будуть або відкинуті, або перезапущені щодо підтримки нової моделі. Тим часом одна чи дві найбільш технічно підковані (та підприємницькі) YouTube AI лумінарії будуть вимагати викуп за свої рішення через Patreon, поки сцена не наздожене.
Втома від оновлення
Практично ніхто не відчуває втому від оновлення так, як ентузіаст LoRA або файн-тюнингу, оскільки швидкий і конкурентний темп змін у генераційному штучному інтелекті спонукає модельні фабрики, такі як Stability.ai, Tencent і Black Forest Labs, виробляти більші та (іноді) кращі моделі з максимально можливою частотою.
Оскільки ці нові та покращені моделі будуть мати принаймні різні упередження та ваги, і більш поширені будуть мати різну шкалу та/або архітектуру, це означає, що спільнота файн-тюнингу повинна знову витягнути свої набори даних і повторити виснажливий процес тренування для нової версії.
Через цю причину, існує багато типів версій Stable Diffusion LoRA, доступних на Civit:

Траса оновлення, візуалізована у фільтрах пошуку на civit.ai
Оскільки жодна з цих легких моделей LoRA не є взаємозамінною з вищими або нижчими версіями моделі, і оскільки багато з них мають залежності від популярних великомасштабних злиття та файн-тюнерів, які дотримуються старішої моделі, значна частина спільноти схильна залишатися з «спадковою» версією, так само, як лояльність клієнтів до Windows XP тривала роками після офіційного закінчення підтримки.
Адаптація до змін
Ця тема спливає на думку через нову статтю від Qualcomm AI Research, яка стверджує, що розробила метод, за допомогою якого існуючі LoRAs можна «оновити» до нової версії моделі.

Приклад конвертування LoRAs через різні версії моделей. Джерело: https://arxiv.org/pdf/2501.16559
Це не означає, що новий підхід, названий LoRA-X, може перекладатися вільно між усіма моделями одного типу (тобто, текст-зображення моделі, або великі мовні моделі [LLM]); але автори продемонстрували ефективне перекладання LoRA з Stable Diffusion v1.5 > SDXL, і конвертування LoRA для текстової моделі TinyLlama 3T у TinyLlama 2.5T.
LoRA-X передає параметри LoRA через різні базові моделі, зберігаючи адаптер у підпросторі джерельної моделі; але тільки в тих частинах моделі, які є достатньо схожими через різні версії моделей.

Зліва, схема того, як LoRA-X джерельна модель файн-тюнує адаптер, який потім регулюється для підгонки до цільової моделі. Праворуч, зображення, згенеровані цільовими моделями SD Eff-v1.0 і SSD-1B, після застосування адаптерів, переданих з SD-v1.5 і SDXL без додаткового тренування.
Хоча це пропонує практичне рішення для сценаріїв, у яких повторне тренування є нежаданим або неможливим (наприклад, зміна ліцензії на початкових даних тренування), цей метод обмежений схожими архітектурами моделей, серед інших обмежень.
Хоча це рідкісний випадок дослідження недостатньо вивченого поля, ми не будемо детально вивчати цю статтю через численні недоліки LoRA-X, як свідчать коментарі її критиків і радників на Open Review.
Залежність методу від підпросторової подібності обмежує його застосування до тісно пов’язаних моделей, і автори визнали у форумі рецензентів, що LoRA-X не може бути легко переданий через суттєво різні архітектури
Інші підходи PEFT
Можливість зробити LoRAs більш портативними через версії є малим, але цікавим напрямком дослідження у літературі, і головний внесок, який робить LoRA-X, полягає в тому, що вона не потребує тренування. Це не зовсім правда, якщо прочитати статтю, але вона потребує мінімального тренування серед усіх попередніх методів.
LoRA-X є ще одним входом у канон Parameter-Efficient Fine-Tuning (PEFT) методів, які займаються викликом адаптації великих попередньо тренованих моделей до конкретних завдань без обширного повторного тренування. Цей концептуальний підхід спрямований на модифікацію мінімального числа параметрів при збереженні продуктивності.
Відомими серед них є:
X-Adapter
Фреймворк X-Adapter передає файн-тюновані адаптери через моделі з певною кількістю повторного тренування. Система спрямована на забезпечення попередньо тренованих модулів (таких як ControlNet і LoRA) від базової дифузійної моделі (тобто, Stable Diffusion v1.5) для роботи безпосередньо з оновленою дифузійною моделлю, chẳng hạn як SDXL, без повторного тренування – ефективно діючи як «універсальний апгрейдер» для плагінів.
Система досягає цього шляхом тренування додаткової мережі, яка контролює оновлену модель, використовуючи заморожену копію базової моделі для збереження плагін-конекторів:

Схема для X-Adapter. Джерело: https://arxiv.org/pdf/2312.02238
X-Adapter був спочатку розроблений і протестований для передачі адаптерів з SD1.5 у SDXL, тоді як LoRA-X пропонує ширший спектр транслітерацій.
DoRA (Weight-Decomposed Low-Rank Adaptation)
DoRA є покращеним методом файн-тюнингу, який покращує LoRA за допомогою стратегії декомпозиції ваги, яка більш тісно нагадує повне файн-тюнингу:

DoRA не просто намагається скопіювати адаптер у замороженому середовищі, як LoRA-X, а змінює фундаментальні параметри ваги, такі як величина і напрям. Джерело: https://arxiv.org/pdf/2402.09353
DoRA зосереджується на покращенні самого процесу файн-тюнингу, розкладаючи ваги моделі на величину і напрям (див. зображення вище). Натомість LoRA-X зосереджується на possibilitі передачі існуючих файн-тюнованих параметрів між різними базовими моделями
Однак LoRA-X підхід адаптує проєкційні техніки, розроблені для DORA, і в тестах проти цієї старішої системи претендує на покращений DINO рахунок.
FouRA (Fourier Low Rank Adaptation)
Опублікований у червні 2024 року, метод FouRA походять, як і LoRA-X, з Qualcomm AI Research, і навіть поділяють деякі своїх тестових промптів і тем.

Приклади колапсу розподілу у LoRA, з папери FouRA 2024 року, використовуючи модель Realistic Vision 3.0, треновану з LoRA і FouRA для адаптерів «Blue Fire» і «Origami», через чотири насіння. Зображення LoRA демонструють колапс розподілу і зменшену різноманітність, тоді як FouRA генерує більш різноманітні виходи. Джерело: https://arxiv.org/pdf/2406.08798
FouRA зосереджується на покращенні різноманітності та якості згенерованих зображень шляхом адаптації LoRA у частотній області, використовуючи підхід Фур’є.
Тут знову LoRA-X змогла досягти кращих результатів, ніж підхід FouRA, заснований на Фур’є.
Хоча обидва фреймворки належать до категорії PEFT, вони мають зовсім різні випадки використання та підходи; у цьому випадку FouRA можна вважати «заповнювачем» для тестового раунду з обмеженими подібними суперниками для нових авторів, які взаємодіють з паперами.
SVDiff
SVDiff також має інші цілі, ніж LoRA-X, але сильно використовується у новій статті. SVDiff призначений для покращення ефективності файн-тюнингу дифузійних моделей, і безпосередньо змінює значення у вагових матрицях моделі, зберігаючи сингулярні вектори незмінними. SVDiff використовує обрізану СВД, змінюючи лише найбільші значення, для регулювання ваг моделі.
Цей підхід використовує техніку даних під назвою Cut-Mix-Unmix:

Мультиоб’єктна генерація працює як система ізоляції концепцій у SVDiff. Джерело: https://arxiv.org/pdf/2303.11305
Cut-Mix-Unmix призначений для того, щоб допомогти дифузійній моделі вивчити кілька різних концепцій без їх змішування. Центральна ідея полягає у тому, щоб взяти зображення різних об’єктів і сконкатенувати їх у одне зображення. Потім модель тренується з промптами, які явно описують окремі елементи у зображенні. Це змушує модель розпізнавати і зберегти окремі концепції, а не змішувати їх.
Під час тренування додатковий регуляризаційний член допомагає запобігти міжоб’єктному інтерференції. Теорія авторів стверджує, що це полегшує покращення мультиоб’єктної генерації, при якій кожен елемент залишається візуально відокремленим, а не злитим.
SVDiff, виключений з раунду тестування LoRA-X, спрямований на створення компактного параметричного простору. LoRA-X, натомість, зосереджується на передачі параметрів LoRA через різні базові моделі, діючи у підпросторі початкової моделі.
Висновок
Методи, обговорені тут, не є єдиними мешканцями PEFT. Інші включають QLoRA і QA-LoRA; Prefix Tuning; Prompt-Tuning; і adapter-tuning, серед інших.
«Оновлювана LoRA» є, можливо, алхімічним пошуком; безумовно, немає нічого негайного на горизонті, що запобігатиме тим, хто займається моделями LoRA, знову витягувати свої старі набори даних для останніх і найкращих виходів ваг. Якщо існує якийсь можливий прототип стандарту для перегляду ваг, здатний пережити зміни архітектури і зростання параметрів між версіями моделі, він ще не з’явився у літературі, і буде продовжувати видобуватися з даних на основі кожної моделі.
Перша публікація четверга, 30 січня 2025 року












