Взгляд Anderson

Три проблемы, с которыми столкнется Stable Diffusion

mm
Добавьте Unite.AI в избранные источники в Google

Выпуск стабильности.ai’s Stable Diffusion латентного диффузионного модели синтеза изображений несколько недель назад может быть одним из наиболее значимых технологических раскрытий с тех пор, как DeCSS в 1999 году; это, безусловно, самое большое событие в области генерации изображений с помощью ИИ с 2017 года кода deepfakes, который был скопирован на GitHub и вилка в то, что станет DeepFaceLab и FaceSwap, а также программное обеспечение для потоковой передачи deepfakes в режиме реального времени DeepFaceLive.

За один шаг фрустрация пользователей по поводу ограничений контента в API синтеза изображений DALL-E 2 были сняты, поскольку оказалось, что фильтр NSFW в Stable Diffusion можно отключить, изменив одну строку кода. Порно-ориентированные сообщества Stable Diffusion на Reddit возникли почти сразу и были быстро уничтожены, в то время как разработчики и пользователи разделились на официальные и NSFW-сообщества на Discord, и Twitter начал заполняться фантастическими созданиями Stable Diffusion.

На данный момент каждый день приносит какие-то удивительные инновации от разработчиков, которые приняли систему, с плагинами и сторонними дополнениями, которые быстро пишутся для Krita, Photoshop, Cinema4D, Blender и многих других платформ приложений.

Тем временем, promptcraft – теперь профессиональное искусство «шептания ИИ», которое может оказаться самой короткой карьерной опцией после «Филофакс-биндера» – уже коммерциализируется, в то время как ранняя монетизация Stable Diffusion происходит на уровне Patreon, с уверенностью в том, что будут более сложные предложения, для тех, кто не хочет ориентироваться в Conda-основанных установках исходного кода или прескриптивных фильтров NSFW веб-реализаций.

Темп разработки и свободное чувство исследования пользователей происходит с такой головокружительной скоростью, что трудно увидеть далеко вперед. По сути, мы еще не знаем, с чем мы имеем дело, или какие могут быть ограничения или возможности.

Однако давайте посмотрим на три из того, что может быть наиболее интересными и сложными препятствиями для быстро сформированного и быстро растущего сообщества Stable Diffusion, чтобы преодолеть и, надеюсь, преодолеть.

1: Оптимизация Tile-Based Pipelines

Представленный с ограниченными ресурсами оборудования и жесткими ограничениями на разрешение тренировочных изображений, вероятно, что разработчики найдут обходные пути, чтобы улучшить как качество, так и разрешение выходных данных Stable Diffusion. Многие из этих проектов будут включать в себя эксплуатацию ограничений системы, таких как ее родное разрешение в 512×512 пикселей.

Как это обычно бывает с компьютерным зрением и инициативами синтеза изображений, Stable Diffusion был обучен на квадратных соотношениях изображений, в данном случае перепримеренных до 512×512, чтобы исходные изображения могли быть 정규ализованы и помещены в ограничения GPU, которые обучали модель.

Следовательно, Stable Diffusion «думает» (если он думает вообще) в терминах 512×512, и, безусловно, в квадратных терминах. Многие пользователи, в настоящее время исследующие пределы системы, сообщают, что Stable Diffusion производит наиболее надежные и наименее глюки результаты при этом довольно ограниченном соотношении сторон (см. «Решение крайностей» ниже).

Хотя различные реализации включают увеличение через RealESRGAN (и могут исправить плохо отрендеренные лица через GFPGAN), несколько пользователей в настоящее время разрабатывают методы для разделения изображений на секции 512x512px и сшивания изображений вместе, чтобы сформировать более крупные составные работы.

Это изображение 1024x576, разрешение, обычно невозможное в одном рендере Stable Diffusion, было создано путем копирования и вставки файла attention.py из вилки DoggettX Stable Diffusion (версия, которая реализует увеличение на основе плиток) в другую вилку. Источник: https://old.reddit.com/r/StableDiffusion/comments/x6yeam/1024x576_with_6gb_nice/

Это изображение 1024×576, разрешение, обычно невозможное в одном рендере Stable Diffusion, было создано путем копирования и вставки файла attention.py из вилки DoggettX Stable Diffusion (версия, которая реализует увеличение на основе плиток) в другую вилку. Источник: https://old.reddit.com/r/StableDiffusion/comments/x6yeam/1024x576_with_6gb_nice/

Хотя некоторые инициативы этого типа используют оригинальный код или другие библиотеки, порт txt2imghd GOBIG (режим в VRAM-жадном ProgRockDiffusion) должен предоставить эту функциональность основной ветке вскоре. Хотя txt2imghd является посвященным портом GOBIG, другие усилия от разработчиков сообщества включают различные реализации GOBIG.

Удобное абстрактное изображение в исходном рендере 512x512px (слева и второе слева); увеличенное через ESGRAN, которое теперь более или менее родное во всех распределениях Stable Diffusion; и полученное «специальное внимание» через реализацию GOBIG, производящее детали, которые, по крайней мере, в пределах раздела изображения, кажутся лучше увеличенными. Источник: https://old.reddit.com/r/StableDiffusion/comments/x72460/stable_diffusion_gobig_txt2imghd_easy_mode_colab/

Удобное абстрактное изображение в исходном рендере 512x512px (слева и второе слева); увеличенное через ESGRAN, которое теперь более или менее родное во всех распределениях Stable Diffusion; и полученное «специальное внимание» через реализацию GOBIG, производящее детали, которые, по крайней мере, в пределах раздела изображения, кажутся лучше увеличенными. Источник: https://old.reddit.com/r/StableDiffusion/comments/x72460/stable_diffusion_gobig_txt2imghd_easy_mode_colab/

Тип абстрактного примера, представленного выше, имеет много «маленьких королевств» деталей, которые подходят для этого солипсистического подхода к увеличению, но которые могут потребовать более сложных код-решений, чтобы произвести не повторяющееся, сплоченное увеличение, которое не выглядит как собранное из многих частей. Не менее, в случае человеческих лиц, где мы необычно настроены на аномалии или «потрясающие» артефакты. Следовательно, лица могут в конечном итоге потребовать специального решения.

Stable Diffusion в настоящее время не имеет механизма для фокусировки внимания на лице во время рендера таким же образом, как люди отдают приоритет информации о лице. Хотя некоторые разработчики в сообществах Discord рассматривают методы реализации этого типа «усиленного внимания», в настоящее время гораздо проще вручную (и, в конечном итоге, автоматически) улучшить лицо после того, как первоначальный рендер был завершен.

Человеческое лицо имеет внутреннюю и полную семантическую логику, которая не будет найдена в «плитке» нижнего угла (например, здания), и поэтому в настоящее время возможно очень эффективно «увеличить» и переотрендерить «набросок» лица в выходных данных Stable Diffusion.

Слева, первая попытка Stable Diffusion с подсказкой «Полное цветное фото Кристины Хендрикс, входящей в многолюдное место, носит дождевик; Canon50, зрительный контакт, высокий уровень детализации, высокий уровень детализации лица». Справа, улучшенное лицо, полученное путем подачи размытого и набросочного лица из первого рендера обратно в полное внимание Stable Diffusion с помощью Img2Img (см. анимированные изображения ниже).

Слева, первая попытка Stable Diffusion с подсказкой «Полное цветное фото Кристины Хендрикс, входящей в многолюдное место, носит дождевик; Canon50, зрительный контакт, высокий уровень детализации, высокий уровень детализации лица». Справа, улучшенное лицо, получено путем подачи размытого и набросочного лица из первого рендера обратно в полное внимание Stable Diffusion с помощью Img2Img (см. анимированные изображения ниже).

В отсутствие специального решения Textual Inversion (см. ниже), это будет работать только для изображений знаменитостей, где человек уже хорошо представлен в подмножествах LAION, которые обучали Stable Diffusion. Следовательно, это будет работать на таких людях, как Том Круз, Брэд Питт, Дженнифер Лоуренс, и ограниченный диапазон настоящих медиа-звезд, которые присутствуют в большом количестве изображений в исходных данных.

Генерация правдоподобного пресс-изображения с подсказкой «Полное цветное фото Кристины Хендрикс, входящей в многолюдное место, носит дождевик; Canon50, зрительный контакт, высокий уровень детализации, высокий уровень детализации лица».

Генерация правдоподобного пресс-изображения с подсказкой «Полное цветное фото Кристины Хендрикс, входящей в многолюдное место, носит дождевик; Canon50, зрительный контакт, высокий уровень детализации, высокий уровень детализации лица».

Для знаменитостей с длинными и устойчивыми карьерами Stable Diffusion обычно генерирует изображение человека в недавнем (т.е. старшем) возрасте, и будет необходимо добавить подсказки, такие как «молодой» или «в году [ГОД]», чтобы произвести более молодые изображения.

С актершей Дженнифер Коннелли, у которой есть заметная, многофотографированная и последовательная карьера, охватывающая почти 40 лет, Stable Diffusion может представить ряд возрастов. Источник: предварительно упакованный Stable Diffusion, локальный, v1.4 контрольная точка; подсказки, связанные с возрастом.

С актершей Дженнифер Коннелли, у которой есть заметная, многофотографированная и последовательная карьера, охватывающая почти 40 лет, Stable Diffusion может представить ряд возрастов. Источник: предварительно упакованный Stable Diffusion, локальный, v1.4 контрольная точка; подсказки, связанные с возрастом.

Это в основном из-за распространения цифровой (а не дорогой, эмульсионной) пресс-фотографии с середины 2000-х годов и последующего роста объема изображений из-за увеличения скорости широкополосного доступа.

Отрендеренное изображение передается в Img2Img в Stable Diffusion, где выбирается «область внимания», и создается новый рендер максимального размера только для этой области, позволяя Stable Diffusion сосредоточить все доступные ресурсы на воссоздании лица.

Отрендеренное изображение передается в Img2Img в Stable Diffusion, где выбирается «область внимания», и создается новый рендер максимального размера только для этой области, позволяя Stable Diffusion сосредоточить все доступные ресурсы на воссоздании лица.

Композиция «лица с высоким вниманием» обратно в исходный рендер. Кроме лиц, этот процесс будет работать только с объектами, которые имеют потенциально известный, сплоченный и целостный вид, такой как часть исходной фотографии, имеющая отдельный объект, такой как часы или машина. Увеличение секции, например, стены, приведет к очень странно выглядящей собранной стене, потому что рендеры плиток не имели более широкого контекста для этой «пазла» при рендеринге.

Композиция «лица с высоким вниманием» обратно в исходный рендер. Кроме лиц, этот процесс будет работать только с объектами, которые имеют потенциально известный, сплоченный и целостный вид, такой как часть исходной фотографии, имеющая отдельный объект, такой как часы или машина. Увеличение секции, например, стены, приведет к очень странно выглядящей собранной стене, потому что рендеры плиток не имели более широкого контекста для этой «пазла» при рендеринге.

Некоторые знаменитости в базе данных приходят «замороженными» во времени, либо потому, что они умерли рано (например, Мэрилин Монро), либо потому, что они поднялись только на короткий период времени. Опрос Stable Diffusion, по сути, предоставляет некоторый «текущий» индекс популярности для современных и старых звезд. Для некоторых старых и современных знаменитостей нет достаточно изображений в исходных данных, чтобы получить очень хорошее сходство, в то время как устойчивая популярность определенных давно умерших или исчезнувших звезд гарантирует, что их разумное сходство может быть получено из системы.

Рендеры Stable Diffusion быстро раскрывают, какие знаменитые лица хорошо представлены в обучающих данных. Несмотря на ее огромную популярность как старшего подростка на момент написания, Милли Бобби Браун была моложе и менее известна, когда исходные данные LAION были соскоблены из веба, что делает высококачественное сходство с Stable Diffusion проблематичным на данный момент.

Рендеры Stable Diffusion быстро раскрывают, какие знаменитые лица хорошо представлены в обучающих данных. Несмотря на ее огромную популярность как старшего подростка на момент написания, Милли Бобби Браун была моложе и менее известна, когда исходные данные LAION были соскоблены из веба, что делает высококачественное сходство с Stable Diffusion проблематичным на данный момент.

Где данные доступны, решения на основе плиток в Stable Diffusion могли бы пойти дальше, чем сосредоточение внимания на лице: они могли бы потенциально позволить более точные и детальные лица, разбивая черты лица и направляя всю силу локальных ресурсов GPU на отдельные черты индивидуально, до сборки – процесс, который в настоящее время, снова, ручной.

Это не ограничивается лицами, но ограничено частями объектов, которые, по крайней мере, так же предсказуемо размещены в более широком контексте объекта, и которые соответствуют высокоуровневым вложениям, которые можно разумно ожидать найти в гипермасштабной базе данных.

Настоящий предел – это количество доступных справочных данных в базе данных, потому что, в конечном итоге, глубоко итерированные детали станут полностью «галлюцинированными» (т.е. вымышленными) и менее аутентичными.

Такие высокоуровневые гранулярные увеличения работают в случае Дженнифер Коннелли, потому что она хорошо представлена в диапазоне возрастов в LAION-aesthetics (первичном подмножестве LAION 5B, которое использует Stable Diffusion), и в целом в LAION; во многих других случаях точность будет страдать от нехватки данных, что потребует либо тонкой настройки (дополнительной тренировки, см. «Настройка» ниже), либо Textual Inversion (см. ниже).

Плитки – это мощный и относительно дешевый способ для Stable Diffusion производить высококачественные выходные данные, но алгоритмическое увеличение плиток этого типа, если оно лишено некоторого рода более широкого, высокоуровневого механизма внимания, может не соответствовать желаемым стандартам в диапазоне типов контента.

2: Решение проблем с человеческими конечностями

Stable Diffusion не оправдывает своего названия при изображении сложности человеческих конечностей. Руки могут умножаться случайным образом, пальцы сливаются, появляются три ноги без предупреждения, и существующие конечности исчезают без следа. В свою защиту, Stable Diffusion разделяет эту проблему со своими стабильными аналогами, и, безусловно, с DALL-E 2.

Нередактированные результаты от DALL-E 2 и Stable Diffusion (1.4) в конце августа 2022 года, оба показывающие проблемы с конечностями. Подсказка: «Женщина обнимает мужчину»

Нередактированные результаты от DALL-E 2 и Stable Diffusion (1.4) в конце августа 2022 года, оба показывающие проблемы с конечностями. Подсказка: «Женщина обнимает мужчину»

Поклонники Stable Diffusion, надеющиеся, что предстоящая контрольная точка 1.5 (более интенсивно обученная версия модели с улучшенными параметрами) решит проблему с конечностями, вероятно, будут разочарованы. Новая модель, которая будет выпущена через две недели, в настоящее время премьера на коммерческом портале stability.ai DreamStudio, который использует 1.5 по умолчанию, и где пользователи могут сравнить новый выход с рендерами из своих локальных или других 1.4 систем:

Источник: локальный 1.4 предварительно упакованный и https://beta.dreamstudio.ai/

Источник: локальный 1.4 предварительно упакованный и https://beta.dreamstudio.ai/

Источник: локальный 1.4 предварительно упакованный и https://beta.dreamstudio.ai/

Источник: локальный 1.4 предварительно упакованный и https://beta.dreamstudio.ai/

Источник: локальный 1.4 предварительно упакованный и https://beta.dreamstudio.ai/

Источник: локальный 1.4 предварительно упакованный и https://beta.dreamstudio.ai/

Как это часто бывает, качество данных может быть основной причиной.

Открытые базы данных, которые обеспечивают системы синтеза изображений, такие как Stable Diffusion и DALL-E 2, могут предоставить много меток для отдельных людей и межличностных действий. Эти метки обучаются симбиотически с их связанными изображениями или сегментами изображений.

Пользователи Stable Diffusion могут изучить концепции, обученные в модели, запросив базу данных LAION-aesthetics, подмножество более крупной базы данных LAION 5B, которая обеспечивает систему. Изображения упорядочены не по их алфавитным меткам, а по их «эстетическому баллу». Источник: https://rom1504.github.io/clip-retrieval/

Пользователи Stable Diffusion могут изучить концепции, обученные в модели, запросив базу данных LAION-aesthetics, подмножество более крупной базы данных LAION 5B, которая обеспечивает систему. Изображения упорядочены не по их алфавитным меткам, а по их «эстетическому баллу». Источник: https://rom1504.github.io/clip-retrieval/

Хорошая иерархия индивидуальных меток и классов, способствующих изображению человеческой руки, будет чем-то вроде тело>рука>рука>пальцы> [подпальцы + большой палец] > [сегменты пальцев] >ногти.

Гранулярная семантическая сегментация частей руки. Даже это необычно подробное разрушение оставляет каждый «палец» как единицу, не учитывая три сегмента пальца и два сегмента большого пальца. Источник: https://athitsos.utasites.cloud/publications/rezaei_petra2021.pdf

Гранулярная семантическая сегментация частей руки. Даже это необычно подробное разрушение оставляет каждый «палец» как единицу, не учитывая три сегмента пальца и два сегмента большого пальца. Источник: https://athitsos.utasites.cloud/publications/rezaei_petra2021.pdf

В реальности исходные изображения вряд ли будут последовательно аннотированы во всей базе данных, и алгоритмы аннотации без надзора, вероятно, остановятся на более высоком уровне – например, «рука», и оставят внутренние пиксели (которые технически содержат информацию о «пальцах») как неаннотированную массу пикселей, из которых будут произвольно получены функции, которые могут проявиться в более поздних рендерах как резкий элемент.

Как это должно быть (вверху справа, если не вверху), и как это склонно быть (внизу справа), из-за ограниченных ресурсов для аннотации или архитектурного использования таких меток, если они существуют в базе данных.

Как это должно быть (вверху справа, если не вверху), и как это склонно быть (внизу справа), из-за ограниченных ресурсов для аннотации или архитектурного использования таких меток, если они существуют в базе данных.

Таким образом, если модель латентного распространения получает возможность отрендерить руку, она, скорее всего, попытается отрендерить руку в конце этой руки, потому что рука>рука – это минимальная необходимая иерархия, довольно высоко в том, что архитектура знает о «человеческой анатомии».

После этого «пальцы» могут быть наименьшей группой, хотя есть 14 дальнейших подчастей пальцев/большого пальца, которые следует учитывать при изображении человеческих рук.

Если эта теория верна, то нет реального решения, из-за отраслевой нехватки бюджета для ручной аннотации, и нехватки адекватно эффективных алгоритмов, которые могли бы автоматизировать аннотацию, производя низкие показатели ошибок. По сути, модель может в настоящее время полагаться на человеческую анатомическую последовательность, чтобы скрыть недостатки базы данных, на которой она была обучена.

Одна из возможных причин, почему она не может полагаться на это, недавно предложено на Discord Stable Diffusion, заключается в том, что модель может стать сбитой с толку относительно правильного количества пальцев, которое должно быть у реалистичной человеческой руки, потому что база данных LAION, которая обеспечивает ее, включает персонажи мультфильмов, которые могут иметь меньше пальцев (что само по себе экономия труда).

Два потенциальных виновников «синдрома пропавшего пальца» в Stable Diffusion и подобных моделях. Ниже примеры рук персонажей мультфильмов из базы данных LAION-aesthetics, которая обеспечивает Stable Diffusion. Источник: https://www.youtube.com/watch?v=0QZFQ3gbd6I

Два потенциальных виновника «синдрома пропавшего пальца» в Stable Diffusion и подобных моделях. Ниже примеры рук персонажей мультфильмов из базы данных LAION-aesthetics, которая обеспечивает Stable Diffusion. Источник: https://www.youtube.com/watch?v=0QZFQ3gbd6I

Если это правда, то единственное очевидное решение – это переобучить модель, исключая нереалистичный контент, основанный на человеке, гарантируя, что настоящие случаи пропуска (т.е. ампутанты) правильно помечены как исключения. С точки зрения кураторства данных это будет довольно сложной задачей, особенно для общественных усилий с ограниченными ресурсами.

Второй подход будет заключаться в применении фильтров, которые исключают такой контент (т.е. «рука с тремя/пятью пальцами») из проявления во время рендера, аналогично тому, как OpenAI, в некоторой степени, отфильтровал GPT-3 и DALL-E 2, чтобы их выход мог быть регулируемым без необходимости переобучать исходные модели.

Для Stable Diffusion семантическое различие между цифрами и даже конечностями может стать ужасно размытым, напоминая 1980-е «тело-ужас»-фильмы ужасов от таких, как Дэвид Кроненберг. Источник: https://old.reddit.com/r/StableDiffusion/comments/x6htf6/a_study_of_stable_diffusions_strange_relationship/

Для Stable Diffusion семантическое различие между цифрами и даже конечностями может стать ужасно размытым, напоминая 1980-е «тело-ужас»-фильмы ужасов от таких, как Дэвид Кроненберг. Источник: https://old.reddit.com/r/StableDiffusion/comments/x6htf6/a_study_of_stable_diffusions_strange_relationship/

Однако снова это потребует меток, которые могут не существовать во всех затронутых изображениях, оставляя нас с той же логистической и бюджетной задачей.

Можно утверждать, что есть два оставшихся пути вперед: бросить больше данных на проблему и применить сторонние интерпретирующие системы, которые могут вмешаться, когда физические ошибки типа, описанного здесь, представляются конечному пользователю (по крайней мере, последнее даст OpenAI метод предоставления возвратов за «тело-ужас»-рендеры, если компания будет мотивирована сделать это).

3: Настройка

Одной из наиболее интересных возможностей для будущего Stable Diffusion является перспектива пользователей или организаций разработки пересмотренных систем; модификаций, которые позволяют контенту вне предварительно обученной сферы LAION быть интегрированным в систему – идеально без неуправляемых расходов на повторную тренировку всей модели или риска, связанного с тренировкой в большом объеме новых изображений в существующую, зрелую и способную модель.

По аналогии: если два менее одаренных студента присоединяются к продвинутому классу из тридцати студентов, они либо ассимилируются и догоняют, либо терпят неудачу как аутсайдеры; в любом случае средняя производительность класса, вероятно, не пострадает. Если 15 менее одаренных студентов присоединятся, однако, кривая оценок для всего класса, вероятно, пострадает.

Аналогично, синергетическая и довольно хрупкая сеть отношений, которые строятся во время длительной и дорогой тренировки модели, могут быть скомпрометированы, в некоторых случаях эффективно уничтожены, чрезмерными новыми данными, снижая качество выхода модели в целом.

Случай для этого в основном там, где ваш интерес заключается в полном уничтожении понимания модели концепций и вещей и присвоении ее исключительно для производства контента, подобного дополнительному материалу, который вы добавили.

Таким образом, тренировка 500 000 кадров Симпсонов в существующую контрольную точку Stable Diffusion, вероятно, в конечном итоге даст вам лучший Симпсонов-симулятор, чем исходная сборка могла бы предложить, предполагая, что достаточно широкие семантические отношения переживают процесс (т.е. Гомер Симпсон ест хот-дог, который может потребовать материала о хот-догах, который не был в вашем дополнительном материале, но уже существовал в контрольной точке), и предполагая, что вы не хотите внезапно переключиться с Симпсонов-контента на создание фантастических пейзажей Грега Рутковского – потому что ваша пост-тренированная модель имела свое внимание сильно отвлечено, и не будет так хороша в создании такого контента, как раньше.

Одним заметным примером этого является waifu-diffusion, который успешно пост-тренировал 56 000 аниме-изображений в завершенную и обученную контрольную точку Stable Diffusion. Это сложная задача для хобби, однако, поскольку модель требует ошеломляющего минимума 30 ГБ видеопамяти, далеко за пределами того, что, вероятно, будет доступно на потребительском уровне в будущих выпусках серии 40XX от NVIDIA.

Обучение пользовательского контента в Stable Diffusion: модель заняла две недели пост-тренировки, чтобы вывести этот уровень иллюстрации. Шесть изображений слева показывают прогресс модели в создании предметно-сплоченного выхода на основе новых тренировочных данных. Источник: https://gigazine.net/gsc_news/en/20220121-how-waifu-labs-create/

Обучение пользовательского контента в Stable Diffusion через waifu-diffusion: модель заняла две недели пост-тренировки, чтобы вывести этот уровень иллюстрации. Шесть изображений слева показывают прогресс модели, поскольку тренировка проходила, в создании предметно-сплоченного выхода на основе новых тренировочных данных. Источник: https://gigazine.net/gsc_news/en/20220121-how-waifu-labs-create/

Большое количество усилий может быть потрачено на такие «форки» контрольных точек Stable Diffusion, только чтобы быть сорвано техническим долгом. Разработчики на официальном Discord уже указали, что более поздние выпуски контрольных точек не обязательно будут обратно совместимы, даже с логикой подсказок, которая могла работать с предыдущей версией, поскольку их основной интерес заключается в получении лучшей возможной модели, а не в поддержке наследственных приложений и процессов.

Следовательно, компания или человек, который решает отпочковать контрольную точку в коммерческий продукт, по сути, не имеет пути назад; их версия модели является «жесткой вилкой», и не сможет использовать преимущества более поздних выпусков от stability.ai – что является довольно серьезным обязательством.

Текущая, и большая надежда на настройку Stable Diffusion заключается в Textual Inversion, где пользователь тренирует горстку CLIP-выровненных изображений.

Сотрудничество между Тель-Авивским университетом и NVIDIA, текстовая инверсия позволяет для обучения в отдельных и новых сущностях, не разрушая способностей исходной модели. Источник: https://textual-inversion.github.io/

Сотрудничество между Тель-Авивским университетом и NVIDIA, текстовая инверсия позволяет для обучения в отдельных и новых сущностях, не разрушая способностей исходной модели. Источник: https://textual-inversion.github.io/

Основное очевидное ограничение текстовой инверсии заключается в том, что рекомендуется очень небольшое количество изображений – всего пять. Это эффективно производит ограниченную сущность, которая может быть более полезна для задач переноса стилей, чем для вставки фотореалистичных объектов.

Однако эксперименты в настоящее время проводятся в различных сообществах Stable Diffusion, которые используют гораздо большее количество тренировочных изображений, и остается быть увиденным, насколько продуктивным этот метод может оказаться. Опять же, техника требует большого количества видеопамяти, времени и терпения.

Из-за этих ограничивающих факторов нам, возможно, придется подождать, чтобы увидеть некоторые из более сложных экспериментов по текстовой инверсии от энтузиастов Stable Diffusion – и чтобы узнать, может ли этот подход «поставить вас в картину» таким образом, который выглядит лучше, чем вставка в Photoshop, сохраняя при этом удивительную функциональность официальных контрольных точек.

Первое опубликование 6 сентября 2022 года.

Писатель о машинном обучении, специалист в области синтеза человеческих изображений. Бывший руководитель контента исследований в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио сайт: martinanderson.ai
Контакт: [email protected]