Взгляд Anderson
Борьба за нулевую настройку в генеративном ИИ

Если вы хотите поместить себя в популярный инструмент генерации изображений или видео, но вы еще не достаточно знамениты, чтобы основная модель могла вас распознать, вам нужно обучить модель низкоранговой адаптации (LoRA) с помощью коллекции ваших собственных фотографий. Как только эта персонализированная модель LoRA будет создана, она позволит генеративной модели включать вашу личность в будущих выводах.
Это обычно называется настройкой в области исследования синтеза изображений и видео. Она впервые появилась несколько месяцев после появления Stable Diffusion летом 2022 года, когда проект DreamBooth от Google Research предложил модели настройки с высоким объемом данных, в закрытой схеме, которая вскоре была адаптирована энтузиастами и выпущена в сообщество.
Модели LoRA быстро последовали, и предложили более простую настройку и намного более легкие размеры файлов, при минимальных или отсутствующих затратах на качество, быстро завоевав сцену настройки для Stable Diffusion и ее преемников, а также для более поздних моделей, таких как Flux, и теперь для новых генеративных видеомоделей, таких как Hunyuan Video и Wan 2.1.
Повторяй и Улучшай
Проблема заключается в том, что, как мы уже отмечали, каждый раз, когда появляется новая модель, ей нужна новая генерация моделей LoRA, что представляет собой значительное трение для производителей LoRA, которые могут обучить ряд персонализированных моделей, только чтобы обнаружить, что обновление модели или популярная новая модель означает, что им нужно начать все заново.
Следовательно, подходы к настройке с нулевым выстрелом стали сильной нитью в литературе в последнее время. В этом сценарии вместо необходимости создания набора данных и обучения своей собственной подмодели вы просто предоставляете одну или несколько фотографий объекта, который должен быть внедрен в генерацию, и система интерпретирует эти входные источники в объединенный вывод.
Ниже мы видим, что, помимо замены лица, система такого типа (здесь используется PuLID) также может включать значения идентификатора в стиль переноса:

Примеры переноса идентификатора лица с помощью системы PuLID. Источник: https://github.com/ToTheBeginning/PuLID?tab=readme-ov-file
Хотя замена трудоемкой и хрупкой системы, такой как LoRA, на универсальный адаптер является отличной (и популярной) идеей, это также является сложной задачей; крайняя внимание к деталям и покрытию, полученные в процессе обучения LoRA, очень трудно имитировать в модели типа IP-Adapter, которая должна соответствовать уровню детализации и гибкости LoRA без предварительного преимущества анализа полного набора изображений идентификатора.
HyperLoRA
С учетом этого, существует интересная новая статья от ByteDance, предлагающая систему, которая генерирует фактический код LoRA на лету, что в настоящее время уникально среди решений с нулевым выстрелом:

Слева, входные изображения. Справа от них, гибкий диапазон вывода на основе входных изображений, эффективно производя глубокие подделки актеров Энтони Хопкинса и Энн Хэтэуэй. Источник: https://arxiv.org/pdf/2503.16944
Статья гласит:
‘Техники, основанные на адаптере, такие как IP-Adapter, замораживают параметры основной модели и используют архитектуру подключения, чтобы обеспечить вывод с нулевым выстрелом, но они часто демонстрируют отсутствие естественности и аутентичности, что не следует игнорировать в задачах синтеза портретов.
‘[Мы] предлагаем параметро-эффективный адаптивный метод генерации под названием HyperLoRA, который использует адаптивную архитектуру подключения для генерации весов LoRA, объединяя превосходную производительность LoRA с возможностью вывода с нулевым выстрелом схемы адаптера.
‘Благодаря нашему тщательно разработанному сетевому структуру и стратегии обучения, мы достигаем вывода с нулевым выстрелом для персонализированного портрета (поддерживающего как одиночные, так и множественные входные изображения) с высокой фотorealностью, верностью и редактируемостью.’
Самым полезным является то, что система, как она обучена, может быть использована с существующим ControlNet, обеспечивая высокий уровень специфичности генерации:

Тимоти Шаламе делает неожиданное веселое появление в фильме ‘Сияние’ (1980), основанное на трех входных фотографиях в HyperLoRA, с маской ControlNet, определяющей вывод (в сочетании с текстовым промптом).
Что касается того, будет ли новая система когда-либо доступна конечным пользователям, ByteDance имеет разумную репутацию в этом отношении, выпустив мощную LatentSync фреймворк синхронизации губ, и только что выпустив фреймворк InfiniteYou.
Отрицательно, статья не дает никаких указаний на намерение выпустить ее, и ресурсы, необходимые для повторения работы, настолько экстремальны, что будет сложно для энтузиастов повторить (как они сделали с DreamBooth).
Новая статья называется HyperLoRA: Параметро-эффективный адаптивный метод генерации для синтеза портретов, и исходит от семи исследователей из ByteDance и Intelligent Creation.
Метод
Новый метод использует модель SDXL как основную модель, хотя принципы, кажется, применимы к диффузионным моделям в целом (хотя требования к обучению – см. ниже – могут сделать его трудным для применения к генеративным видеомоделям).
Процесс обучения для HyperLoRA разделен на три этапа, каждый из которых предназначен для изоляции и сохранения конкретной информации в обученных весах. Целью этого кольцевого процесса является предотвращение загрязнения идентификаторных особенностей посторонними элементами, такими как одежда или фон, одновременно обеспечивая быструю и стабильную сходимость.

Концептуальная схема для HyperLoRA. Модель разделена на ‘Hyper ID-LoRA’ для идентификаторных особенностей и ‘Hyper Base-LoRA’ для фона и одежды. Это разделение уменьшает утечку особенностей. Во время обучения базовая модель SDXL и кодировщики заморожены, и только модули HyperLoRA обновляются. При выводе только ID-LoRA требуется для генерации персонализированных изображений.
Первый этап фокусируется исключительно на обучении ‘Base-LoRA’ (внизу слева на схеме выше), который захватывает детали, не связанные с идентификатором.
Для обеспечения этого разделения исследователи намеренно размыли лицо на обучающих изображениях, позволяя модели сосредоточиться на таких вещах, как фон, освещение и поза – но не идентификатор. Этот ‘разогревочный’ этап действует как фильтр, удаляя низкоуровневые отвлечения, прежде чем начнется обучение, связанное с идентификатором.
На втором этапе вводится ‘ID-LoRA’ (вверху слева на схеме выше). Здесь идентификатор лица кодируется с помощью двух параллельных путей: CLIP Визуальный Трансформер (CLIP ViT) для структурных особенностей и InsightFace AntelopeV2 для более абстрактных представлений идентификатора.
Переходный подход
Особенности CLIP помогают модели сходиться быстро, но рискуют переобучением, тогда как вложения Antelope более стабильны, но медленнее для обучения. Следовательно, система начинает с более сильной зависимости от CLIP и постепенно вводит Antelope, чтобы избежать нестабильности.
На последнем этапе слои внимания, управляемые CLIP, полностью заморожены. Только модули внимания, связанные с AntelopeV2, продолжают обучение, позволяя модели усовершенствовать сохранение идентификатора без ухудшения верности или общности ранее выученных компонентов.
Эта фазовая структура по сути является попыткой дезентанглирования. Идентификаторные и неидентификаторные особенности сначала разделяются, а затем уточняются независимо. Это методический ответ на обычные режимы неудач персонализации: дрейф идентификатора, низкая редактируемость и переобучение на посторонние особенности.
Пока вы взвешиваете
После того, как CLIP ViT и AntelopeV2 извлекли структурные и идентификаторные особенности из данного портрета, полученные особенности затем передаются через пересampler (произведенный из вышеупомянутого проекта IP-Adapter) – модуль, основанный на трансформере, который отображает особенности в компактный набор коэффициентов.
Используются два отдельных пересамплера: один для генерации весов Base-LoRA (которые кодируют фон и неидентификаторные элементы) и другой для весов ID-LoRA (которые фокусируются на идентификаторе лица).

Схема для структуры сети HyperLoRA.
Выходные коэффициенты затем линейно объединяются с набором обученных матриц базиса LoRA, производя полные веса LoRA без необходимости тонкой настройки базовой модели.
Этот подход позволяет системе генерировать персонализированные веса полностью на лету, используя только кодировщики изображений и легковесную проекцию, сохраняя при этом способность LoRA изменять поведение базовой модели напрямую.
Данные и тесты
Для обучения HyperLoRA исследователи использовали подмножество из 4,4 миллиона изображений лиц из набора данных LAION-2B (теперь лучший известный как источник данных для оригинальных моделей Stable Diffusion 2022 года).
InsightFace был использован для фильтрации непортретных лиц и нескольких изображений. Изображения затем были аннотированы с помощью системы BLIP-2 для подписей.
В плане аугментации данных изображения были случайным образом обрезаны вокруг лица, но всегда были сосредоточены на области лица.
Соответствующие ранги LoRA должны были адаптироваться к доступной памяти в настройке обучения. Следовательно, ранг LoRA для ID-LoRA был установлен на 8, а ранг для Base-LoRA – на 4, при этом использовалась восьмишаговая накопление градиентов для имитации более крупного размера партии, чем был фактически возможен на аппаратном обеспечении.
Исследователи обучили модули Base-LoRA, ID-LoRA (CLIP) и ID-LoRA (вложение идентификатора) последовательно за 20К, 15К и 55К итераций соответственно. Во время обучения ID-LoRA они выборочно брали из трех условий с вероятностями 0,9, 0,05 и 0,05.
Система была реализована с помощью PyTorch и Diffusers, и полный процесс обучения занял примерно десять дней на 16 GPU NVIDIA A100*.
Тесты ComfyUI
Авторы построили рабочие процессы в платформе ComfyUI для сравнения HyperLoRA с тремя соперничающими методами: InstantID; вышеупомянутый IP-Adapter в виде IP-Adapter-FaceID-Portrait фреймворка; и вышеупомянутый PuLID. Последовательные семена, промпты и методы выборки были использованы во всех фреймворках.
Авторы отмечают, что методы, основанные на адаптере (а не на LoRA), обычно требуют более низких масштабов руководства классификатора (CFG), тогда как LoRA (включая HyperLoRA) более терпима в этом отношении.
Итак, для справедливого сравнения исследователи использовали открытую проверочную точку LEOSAM’s Hello World во всех тестах. Для количественных тестов использовался набор данных Unsplash-50 изображений.
Метрики
Для эталонной оценки верности авторы измерили сходство лица с помощью косинусных расстояний между вложениями изображений CLIP (CLIP-I) и отдельными вложениями идентификатора (ID Sim), извлеченными с помощью CurricularFace, модели, не использованной во время обучения.
Каждый метод генерировал четыре изображения головы высокого разрешения на идентификатор в тестовом наборе, с результатами, затем усредненными.
Редактируемость оценивалась в обоих случаях путем сравнения оценок CLIP-I между выводами с и без модулей идентификатора (чтобы увидеть, как сильно ограничения идентификатора изменили изображение); и путем измерения выравнивания изображения-текста CLIP (CLIP-T) по десяти вариантам промптов, охватывающим прически, аксессуары, одежду и фон.
Авторы включили модель Arc2Face в сравнения – базовую модель, обученную на фиксированных подписях и обрезанных областях лица.
Для HyperLoRA были протестированы два варианта: один, использующий только модуль ID-LoRA, и другой, использующий как ID-, так и Base-LoRA, с последним, взвешенным на 0,4. Хотя Base-LoRA улучшила верность, она немного ограничила редактируемость.

Результаты для начального количественного сравнения.
Из количественных тестов авторы комментируют:
‘Base-LoRA помогает улучшить верность, но ограничивает редактируемость. Хотя наша конструкция декуплирует изображение на разные LoRA, трудно избежать взаимной утечки. Следовательно, мы можем регулировать вес Base-LoRA, чтобы адаптироваться к разным сценариям применения.
‘Наш HyperLoRA (полный и ID) достигают лучшей и второй лучшей верности лица, в то время как InstantID показывает превосходство в сходстве идентификатора лица, но имеет более низкую верность лица.
‘Обе эти метрики следует учитывать вместе, чтобы оценить верность, поскольку сходство идентификатора лица более абстрактно, а верность лица отражает больше деталей.’
В качественных тестах различные компромиссы, связанные с основной концепцией, выходят на первый план (пожалуйста, обратите внимание, что у нас нет места, чтобы воспроизвести все изображения для качественных результатов, и мы отсылаем читателя к исходной статье для получения дополнительных изображений в лучшем разрешении):

Качественное сравнение. Сверху вниз, использованные промпты были: ‘белая рубашка’ и ‘волчьи уши’ (см. статью для дополнительных примеров).
Здесь авторы комментируют:
‘Кожа портретов, сгенерированных IP-Adapter и InstantID, имеет явный текстуру, сгенерированную ИИ, которая немного переобучена и далека от фотorealизма.
‘Это общий недостаток методов, основанных на адаптере. PuLID улучшает эту проблему, ослабляя вторжение в базовую модель, превосходя IP-Adapter и InstantID, но все еще страдая от размытия и отсутствия деталей.
‘Напротив, LoRA напрямую изменяет веса базовой модели, не вводя дополнительные модули внимания, обычно генерируя высокодетализированные и фотorealистические изображения.’
Авторы утверждают, что поскольку HyperLoRA изменяет веса базовой модели напрямую, не полагаясь на внешние модули внимания, она сохраняет нелинейную емкость традиционных методов, основанных на LoRA, потенциально предлагая преимущество в верности и позволяя лучше захватить тонкие детали, такие как цвет зрачка.
В качественных сравнениях статья утверждает, что композиции HyperLoRA были более связными и лучше выровнены с промптами, и были похожи на те, которые производились PuLID, в то время как заметно сильнее, чем InstantID или IP-Adapter (которые иногда не следовали промптам или производили неестественные композиции).

Дополнительные примеры генераций ControlNet с HyperLoRA.
Заключение
Последовательный поток различных систем настройки с нулевым выстрелом за последние 18 месяцев приобрел характер отчаяния. Очень немногие из этих предложений сделали заметный шаг вперед в состоянии дела; и те, которые сделали небольшой шаг вперед, имеют экстремальные требования к обучению и/или очень сложные или ресурсоемкие требования к выводу.
Хотя собственный режим обучения HyperLoRA столь же удивителен, как и многие недавние подобные записи, по крайней мере, в итоге вы получаете модель, которая может обрабатывать ад-хок настройку прямо из коробки.
Из дополнительных материалов статьи мы отмечаем, что скорость вывода HyperLoRA лучше, чем у IP-Adapter, но хуже, чем у двух других методов – и что эти цифры основаны на GPU NVIDIA V100, который не является типичным потребительским аппаратным обеспечением (хотя более новые ‘домашние’ GPU NVIDIA могут соответствовать или превосходить максимальные 32 ГБ VRAM V100).

Скорости вывода конкурирующих методов, в миллисекундах.
Справедливо сказать, что настройка с нулевым выстрелом остается нерешенной проблемой с практической точки зрения, поскольку значительные требования к аппаратному обеспечению HyperLoRA, по сути, противоречат ее способности производить действительно долгосрочную единую основную модель.
* Представляя либо 640 ГБ, либо 1280 ГБ VRAM, в зависимости от используемой модели (это не указано)
Опубликовано в понедельник, 24 марта 2025 года











![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN-400x240.jpg)
![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN-80x80.jpg)