Взгляд Anderson

В сторону LoRAs, способных выжить при обновлении версий моделей

mm
Добавьте Unite.AI в избранные источники в Google
ChatGPT-4o: variation on ‘a 1792x1024 feature article reportage image of a skip full of discarded metal figurines, featuring realistic men and women of all ages and all types’

С момента моей недавней статьи о росте хобби-LoRAs Hunyuan Video (маленьких, обученных файлов, которые могут внедрять пользовательские личности в многомиллиардные параметры текст-видео и изображение-видео фундаментальных моделей), количество связанных LoRAs, доступных в сообществе Civit, увеличилось на 185%.

Несмотря на то, что нет особенно простых или малозатратных способов создания Hunyuan Video LoRA, каталог знаменитостей и тематических LoRAs на Civit растет ежедневно. Источник: https://civitai.com/

Несмотря на то, что нет особенно простых или малозатратных способов создания Hunyuan Video LoRA, каталог знаменитостей и тематических LoRAs на Civit растет ежедневно. Источник: https://civitai.com/

То же самое сообщество, которое спешит узнать, как производить эти «дополнительные личности» для Hunyuan Video (HV), также страдает от обещанного выпуска функции изображение-видео (I2V) в Hunyuan Video.

Что касается открытой системы синтеза человеческих изображений, это большое дело; в сочетании с ростом Hunyuan LoRAs, это может позволить пользователям преобразовывать фотографии людей в видео таким образом, что не разрушает их идентичность, когда видео развивается – что в настоящее время является случаем со всеми передовыми генераторами изображение-видео, включая Kling, Kaiber и знаменитый RunwayML:

Нажмите, чтобы воспроизвести. Генерация изображения-видео из модели RunwayML Gen 3 Turbo. Однако, как и все подобные и менее значимые модели, она не может поддерживать постоянную идентичность, когда объект поворачивается от камеры, и характерные черты исходного изображения становятся «женщиной-диффузией». Источник: https://app.runwayml.com/

Разрабатывая пользовательскую LoRA для личности в вопросе, можно, в рабочем процессе HV I2V, использовать реальную фотографию как отправную точку. Это гораздо лучшая «семя» чем отправка случайного числа в латентное пространство модели и согласие с тем, какой семантический сценарий получится. Затем можно использовать LoRA или несколько LoRAs, чтобы поддерживать постоянство идентичности, причесок, одежды и других важных аспектов генерации.

Потенциально, доступность такого сочетания может представлять собой одну из наиболее эпохальных сдвигов в генеративном ИИ с момента запуска Stable Diffusion, когда значительная генеративная сила передана энтузиастам открытого исходного кода, без регулирования (или «охраны», если вы предпочитаете) обеспечиваемой цензорами контента в текущем поколении популярных генераторов видео.

Когда я пишу, Hunyuan изображение-видео – это не отмеченная задача в репозитории Hunyuan Video на GitHub, с сообществом хобби, сообщающим (анекдотически) о комментарии разработчика Hunyuan в Discord, который, якобы, заявил, что выпуск этой функции был отложен до некоторого времени позже в Q1 из-за того, что модель была «слишком нецензурной».

Официальный список выпуска функций для Hunyuan Video. Источник: https://github.com/Tencent/HunyuanVideo?tab=readme-ov-file#-open-source-plan

Официальный список выпуска функций для Hunyuan Video. Источник: https://github.com/Tencent/HunyuanVideo?tab=readme-ov-file#-open-source-plan

Точно или нет, разработчики репозитория существенно выполнили остальную часть списка Hunyuan, и поэтому Hunyuan I2V, кажется, появится в конце концов, будь то цензурировано, нецензурировано или каким-то образом «разблокировано».

Но как мы видим в списке выше, выпуск I2V – это, по-видимому, отдельная модель совсем – что делает довольно маловероятным, что любой из текущих LoRAs в Civit и других местах будет функционировать с ним.

В этом (теперь) предсказуемом сценарии, фреймворки обучения LoRA, такие как Musubi Tuner и OneTrainer, будут либо отброшены назад, либо сброшены в отношении поддержки новой модели. Тем временем, один или два самых технически подкованных (и предпринимательских) YouTube-экспертов по ИИ будут вымогать свои решения через Patreon, пока сцена не догонит.

Усталость от обновлений

Почти никто не испытывает усталость от обновлений так сильно, как энтузиаст LoRA или тонкой настройки, потому что быстрый и конкурентный темп изменений в генеративном ИИ побуждает фабрики моделей, такие как Stability.ai, Tencent и Black Forest Labs, производить более крупные и (иногда) лучшие модели с максимально возможной частотой.

Поскольку эти новые и улучшенные модели будут иметь, по крайней мере, разные предубеждения и веса, и чаще всего будут иметь разный масштаб и/или архитектуру, это означает, что сообщество тонкой настройки должно снова вытащить свои наборы данных и повторить изнурительный процесс обучения для новой версии.

По этой причине, существует множество типов версий Stable Diffusion LoRA, доступных на Civit:

Тропа обновления, визуализированная в фильтрах поиска на civit.ai

Тропа обновления, визуализированная в фильтрах поиска на civit.ai

Поскольку ни одна из этих легких моделей LoRA не является взаимозаменяемой с более высокой или более низкой версией модели, и поскольку многие из них имеют зависимости от популярных крупномасштабных слияний и тонкой настройки, которые придерживаются более старой модели, значительная часть сообщества склонна придерживаться «устаревшего» выпуска, точно так же, как лояльность клиентов к Windows XP сохранилась годами после официального окончания поддержки.

Приспособление к изменениям

Эта тема приходит на ум из-за новой статьи от Qualcomm AI Research, которая утверждает, что разработала метод, с помощью которого существующие LoRAs могут быть «обновлены» до новой версии модели.

Пример конверсии LoRAs через версии моделей. Источник: https://arxiv.org/pdf/2501.16559

Пример конверсии LoRAs через версии моделей. Источник: https://arxiv.org/pdf/2501.16559

Это не означает, что новый подход, озаглавленный LoRA-X, может переводить свободно между всеми моделями одного типа (т. е. текст-изображение моделей или крупномасштабных языковых моделей [LLM]); но авторы продемонстрировали эффективную транслитерацию LoRA из Stable Diffusion v1.5 > SDXL и конверсию LoRA для текстовой модели TinyLlama 3T в TinyLlama 2.5T.

LoRA-X передает параметры LoRA через разные базовые модели, сохраняя адаптер в подпространстве исходной модели; но только в тех частях модели, которые достаточно похожи на разные версии.

Слева, схема того, как LoRA-X обучает адаптер в исходной модели, который затем регулируется для соответствия целевой модели с помощью ее собственной внутренней структуры. Справа, изображения, сгенерированные целевыми моделями SD Eff-v1.0 и SSD-1B, после применения адаптеров, переданных из SD-v1.5 и SDXL без дополнительного обучения.

Слева, схема того, как LoRA-X обучает адаптер в исходной модели, который затем регулируется для соответствия целевой модели. Справа, изображения, сгенерированные целевыми моделями SD Eff-v1.0 и SSD-1B, после применения адаптеров, переданных из SD-v1.5 и SDXL без дополнительного обучения.

Хотя это предлагает практическое решение для сценариев, где переобучение нежелательно или невозможно (такое как изменение лицензии на исходные данные обучения), метод ограничен похожими архитектурами моделей, среди других ограничений.

Хотя это редкое вторжение в недостаточно изученную область, мы не будем изучать эту статью в глубину из-за многочисленных недостатков LoRA-X, как это видно из комментариев ее критиков и советников на Open Review.

Зависимость метода от podobного подпространства ограничивает его применение к тесно связанным моделям, и авторы признали в форуме обзора, что LoRA-X не может быть легко передан через значительно разные архитектуры

Другие подходы PEFT

Возможность сделать LoRAs более портативными через версии – это небольшая, но интересная нить исследования в литературе, и основной вклад, который LoRA-X вносит в это стремление, заключается в его утверждении, что оно требует минимального обучения. Это не строго верно, если прочитать статью, но оно требует наименьшего обучения среди всех предыдущих методов.

LoRA-X – это еще одна запись в каноне параметро-эффективных методов тонкой настройки (PEFT), которые решают проблему адаптации крупных предварительно обученных моделей к конкретным задачам без обширного переобучения. Этот концептуальный подход направлен на изменение минимального количества параметров, сохраняя при этом производительность.

Заметными среди них являются:

X-Adapter

Фреймворк X-Adapter передает тонко настроенные адаптеры через модели с некоторым количеством переобучения. Система направлена на то, чтобы позволить предварительно обученным модулям (таким как ControlNet и LoRA) из базовой диффузионной модели (т. е. Stable Diffusion v1.5) работать напрямую с обновленной диффузионной моделью, такой как SDXL, без переобучения – эффективно действуя как «универсальный апгрейдер» для плагинов.

Система достигает этого, обучая дополнительную сеть, которая контролирует обновленную модель, используя замороженную копию базовой модели для сохранения соединителей плагинов:

Схема для X-Adapter. Источник: https://arxiv.org/pdf/2312.02238

Схема для X-Adapter. Источник: https://arxiv.org/pdf/2312.02238

X-Adapter был первоначально разработан и протестирован для передачи адаптеров из SD1.5 в SDXL, в то время как LoRA-X предлагает более широкий спектр транслитераций.

DoRA (Weight-Decomposed Low-Rank Adaptation)

DoRA – это улучшенный метод тонкой настройки, который улучшает LoRA, используя стратегию декомпозиции весов, которая более тесно напоминает полную тонкую настройку:

DoRA не просто пытается скопировать адаптер в замороженной среде, как LoRA-X, но вместо этого изменяет фундаментальные параметры весов, такие как величина и направление. Источник: https://arxiv.org/pdf/2402.09353

DoRA не просто пытается скопировать адаптер в замороженной среде, как LoRA-X, но вместо этого изменяет фундаментальные параметры весов, такие как величина и направление. Источник: https://arxiv.org/pdf/2402.09353

DoRA фокусируется на улучшении самого процесса тонкой настройки, разлагая веса модели на величину и направление (см. изображение выше). Вместо этого LoRA-X фокусируется на том, чтобы позволить передачу существующих тонко настроенных параметров между разными базовыми моделями

Однако подход LoRA-X использует технику проекции, разработанную для DORA, и в тестах против этой более старой системы утверждает, что имеет улучшенный DINO счет.

FouRA (Fourier Low Rank Adaptation)

Опубликованный в июне 2024 года, метод FouRA происходит, как и LoRA-X, из Qualcomm AI Research, и даже разделяет некоторые из его тестовых подсказок и тем.

Примеры коллапса распределения в LoRA, из статьи FouRA 2024 года, используя модель Realistic Vision 3.0, обученную с LoRA и FouRA для адаптеров «Blue Fire» и «Origami», через четыре зерна. Изображения LoRA демонстрируют коллапс распределения и снижение разнообразия, в то время как FouRA генерирует более разнообразные выходы. Источник: https://arxiv.org/pdf/2406.08798

Примеры коллапса распределения в LoRA, из статьи FouRA 2024 года, используя модель Realistic Vision 3.0, обученную с LoRA и FouRA для адаптеров «Blue Fire» и «Origami», через четыре зерна. Изображения LoRA демонстрируют коллапс распределения и снижение разнообразия, в то время как FouRA генерирует более разнообразные выходы. Источник: https://arxiv.org/pdf/2406.08798

FouRA фокусируется на улучшении разнообразия и качества сгенерированных изображений, адаптируя LoRA в частотной области, используя подход Фурье-трасформации.

Здесь, снова, LoRA-X смог достичь лучших результатов, чем подход, основанный на Фурье, FouRA.

Хотя оба фреймворка входят в категорию PEFT, они имеют совершенно разные случаи использования и подходы; в этом случае FouRA, возможно, «дополняет цифры» для раунда тестирования с ограниченными подобными соперниками для новых авторов, чтобы взаимодействовать с ними.

SVDiff

SVDiff также имеет разные цели, чем LoRA-X, но сильно используется в новой статье. SVDiff предназначен для улучшения эффективности тонкой настройки диффузионных моделей и напрямую изменяет значения в матрицах весов модели, сохраняя при этом сингулярные векторы неизменными. SVDiff использует обрезанное SVD, изменяя только самые крупные значения, чтобы скорректировать веса модели.

Этот подход использует технику данных Cut-Mix-Unmix:

Многосубъектная генерация работает как система изоляции концепции в SVDiff. Источник: https://arxiv.org/pdf/2303.11305

Многосубъектная генерация работает как система изоляции концепции в SVDiff. Источник: https://arxiv.org/pdf/2303.11305

Cut-Mix-Unmix предназначен для того, чтобы помочь диффузионной модели учиться нескольким различным понятиям без их смешивания. Центральная идея заключается в том, чтобы взять изображения разных объектов и объединить их в одно изображение. Затем модель обучается с подсказками, которые явно описывают отдельные элементы в изображении. Это заставляет модель распознавать и сохранять отдельные понятия, а не смешивать их.

Во время обучения дополнительный регуляризационный член помогает предотвратить взаимодействие между субъектами. Теория авторов утверждает, что это облегчает улучшение многосубъектной генерации, где каждый элемент остается визуально различимым, а не сливается вместе.

SVDiff, исключенный из раунда тестирования LoRA-X, направлен на создание компактного пространства параметров. LoRA-X, вместо этого, фокусируется на передаче параметров LoRA через разные базовые модели, действуя в подпространстве исходной модели.

Вывод

Методы, обсуждаемые здесь, не являются единственными обитателями PEFT. Другие включают QLoRA и QA-LoRA; Prefix Tuning; Prompt-Tuning; и адаптер-тонкая настройка, среди других.

«Апгрейдная LoRA» – это, возможно, алхимический поиск; определенно, нет ничего непосредственно на горизонте, что предотвратит модельеров LoRA от того, чтобы снова вытащить свои старые наборы данных для последнего и лучшего выпуска весов. Если есть какой-либо возможный прототипный стандарт для пересмотра весов, способный выжить при изменениях в архитектуре и разбухании параметров между версиями моделей, он еще не появился в литературе, и будет продолжать извлекаться из данных на основе каждой модели.

 

Первоначально опубликовано в четверг, 30 января 2025 года

Писатель о машинном обучении, специалист в области синтеза человеческих изображений. Бывший руководитель контента исследований в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио сайт: martinanderson.ai
Контакт: [email protected]