Лидеры мнений

Почему ваши изображения, созданные с помощью ИИ, содержат ошибки — и как их улучшить

mm
Добавьте Unite.AI в избранные источники в Google

Модели генерации изображений на основе текста, работающие с помощью ИИ, потрясли цифровое искусство и создание контента, позволяя любому пользователю, независимо от его прошлого, производить высококачественные, настраиваемые визуальные элементы всего за несколько слов, что занимает лишь долю времени, необходимого человеку для использования классических инструментов дизайна или фотографии.

Благодаря мощным технологическим достижениям, творчество, поддерживаемое ИИ, становится все более неотъемлемой частью рабочих процессов в различных отраслях. Однако создание коммерчески готового произведения с помощью ИИ не является простым нажатием на волшебную кнопку, поскольку его эффект “вот” не всегда дает пригодный для использования результат, особенно для тех, кто полагается на него для соответствия профессиональным стандартам искусства и дизайна.

В реальности, хотя освоение написания подсказок — языка, который понимает ИИ, — является основным условием для достижения вывода, соответствующего творческому видению, изображения, созданные с помощью ИИ, могут все еще иметь некоторые общие разочаровывающие недостатки, влияющие не только на начинающих, но и на опытных создателей. Преодоление этих проблем часто требует дополнительных знаний и навыков как от пользователей, так и от разработчиков.

Ниже я перечислю наиболее частые проблемы в генерации изображений с помощью ИИ и поделюсь практическими решениями, чтобы обойти их.

Сложность инженерии подсказок

Основная привлекательность генерации изображений с помощью ИИ заключается в том, что она преобразует идеи в визуальные элементы почти мгновенно, используя всего лишь слова. Однако сложность инженерии подсказок является одним из наиболее значительных барьеров для создания осмысленных изображений. Даже небольшие вариации в формулировке могут привести к радикально разным результатам. Структуры подсказок также могут различаться в разных моделях, поэтому то, что работает хорошо в одной модели, может давать плохие результаты в другой. Этот недостаток стандартизации в языке подсказок часто заставляет пользователей пробовать методом проб и ошибок.

Библиотеки подсказок и базы данных помогают уменьшить количество проб и ошибок, предоставляя предварительно протестированные подсказки, на которые пользователи могут ссылаться или изменять по мере необходимости. Визуальные строители подсказок позволяют пользователям вводить ключевые слова в структурированном порядке, выбирать атрибуты, регулировать ползунки и многое другое, делая процесс создания эффективной подсказки более интуитивным. Изучение успешных подсказок, поделенных сообществом, также ценно, поскольку эти реальные примеры демонстрируют, что работает.

Чтобы улучшить последовательность, руководства по синтаксису подсказок предлагают лучшие практики для структурирования ввода ключевых слов в разных моделях. Использование шаблонов подсказок способствует более предсказуемым результатам, помогая пользователям создавать несколько изображений с последовательным стилем. Новые модели, такие как FLUX, более удобны в целом, поскольку они предназначены для того, чтобы быть менее чувствительными к сложности подсказок, позволяя пользователям создавать связные, сложные сцены из более простых инструкций.

Неточность анатомии

Из-за того, как нейронные сети учатся на наборах данных, модели диффузии не понимают анатомию — они генерируют изображения на основе распознавания закономерностей, а не структурированного биологического каркаса. Например, ИИ не рассматривает руку как композицию из пяти отдельных пальцев, которые могут артикулироваться по-разному. Вместо этого он смешивает статистические средние значения, наблюдаемые в тренировочных изображениях. В результате отклонения от ожидаемых поз или углов могут вызвать искажения. Хотя современные модели значительно улучшились, аномалии, такие как дополнительные пальцы, неестественные пропорции лица и тела, нереалистичные соединения конечностей и размещение суставов, или асимметричные и неправильно выровненные глаза, остаются распространенными.

Настройка моделей с помощью LoRas (технологии низкоранговой адаптации), ориентированной явно на анатомические наборы данных, помогает им развить более полное понимание человеческой структуры. ControlNets, особенно те, которые используют оценку позы или обнаружение краев (таких как фильтры Кэнни), позволяют ИИ придерживаться анатомических руководств.

Подсказки, которые конкретно ссылаются на реалистичные детали тела, также могут улучшить анатомическую точность сгенерированных фигур. Постобработка с помощью инструментов коррекции, осведомленных об анатомии, позволяет пользователям исправлять дефектные области без регенерации всего изображения.

Несоответствие идентичности в нескольких поколениях

Поскольку ИИ рассматривает каждое поколение как независимый процесс, поддержание последовательного внешнего вида персонажа в нескольких изображениях остается проблемой, особенно проблематичной для рассказывания историй или серийного искусства, где непрерывность персонажа имеет решающее значение. Даже при использовании одной и той же подсказки незначительные изменения в чертах лица, одежде или стиле могут появиться между рендерами. Проблема может стать еще более выраженной в пакетных генерациях, где качество и визуальные характеристики колеблются непредсказуемо.

Обучение LoRA на наборе изображений конкретного человека или объекта и использование ссылочного изображения в качестве входных данных может улучшить условие идентичности, последовательность и однородность. Техники встраивания и адаптеры (такие как PuLID, IPAdapter, InstantID и EcomID) помогают сохранять черты персонажа в нескольких поколениях. Когда точность лица имеет решающее значение, модели замены лица или постобработка предлагают более тонкую доработку, гарантируя, что ключевые функции остаются идентичными из поколения в поколение.

Несовместимость фона

Фоны, сгенерированные ИИ, склонны к нереалистичному, структурно и контекстно несовместимому дизайну, делая изображения менее правдоподобными. Например, перспектива может показаться неправильной, или освещение и тени могут не соответствовать предмету. Это происходит потому, что модели диффузии воспринимают фон как второстепенный элемент, а не как неотъемлемую часть сцены, что приводит к проблемам с восприятием глубины, корреляцией объектов и контекстом окружения.

Карты глубины помогают моделям интерпретировать пространственные отношения более точно, облегчая более реалистичную интеграцию между передним планом и фоном. Руководства перспективы обеспечивают геометрическую выравнивание, помогая сохранять архитектурные структуры и точки исчезновения последовательными. Фокусированные религты LoRas могут учиться генерировать освещение и тени вместе с фоном, гарантируя, что отражения ведут себя естественно на протяжении всей сцены.

Настройка моделей на наборах данных, представляющих конкретные настройки (например, городские пейзажи, природные сцены или интерьерные пространства), может улучшить общую реалистичность фона. Ссылочные изображения фона также помогут закрепить генерацию в реальных композициях.

Проблемы с отображением текста

Обученные в основном на визуальных данных, а не на структурированном языке, ИИ испытывает трудности с генерацией читаемых слов и фраз внутри изображения. Текст может появиться как неполный, бессмысленный, запутанный или нонсенс, с нерегулярными шрифтами или неправильным расположением. Когда он читаем, он все еще может выглядеть стилистически неуместным или неуклюже встроенным в фон.

В отличие от людей, большинство моделей ИИ не распознают текст как отдельный от окружающих элементов, поэтому они не обрабатывают его как отдельную сущность. Вместо этого они рассматривают последовательности символов как еще одну визуальную закономерность, представляющую абстрактные формы, а не осмысленные семантические символы.

Чтобы улучшить качество отображения текста, исследователи обучают модели на специальных наборах данных текста, содержащих правильно помеченные примеры типографики, которые помогают ИИ лучше понять образование букв, выравнивание и расстояние. Техника маскирования текста также является эффективной, когда пустые области зарезервированы для текста во время генерации изображения, позволяя получить более чистую интеграцию во время постобработки.

Отсутствие контроля над выводом

Хотя результаты могут быть визуально впечатляющими, значительное ограничение генерации изображений с помощью ИИ заключается в отсутствии точного контроля над конечным выводом. Пользователи могут испытывать трудности с направлением модели к конкретным стилям, обеспечением реализма или доработкой мелких деталей. Другие распространенные ошибки включают неожиданные элементы в сцене, нарушающие атмосферу цвета и несоответствие макета. В отличие от человеческих художников, которые корректируют с намерением, ИИ работает вероятностно, иногда давая неожиданные или нежелательные результаты.

Механизмы контроля, такие как ControlNets и LoRas, позволяют пользователям условить структуру через руководство по позе, глубине или краям. Для более точного эстетического управления настраиваемые модели, обученные на конкретных стилях, могут значительно улучшить последовательность художественного направления. Кроме того, ссылка на конкретное изображение через генерацию изображения из изображения помогает сохранять актуальность вывода.

Инструменты маскирования и ретуширования позволяют редактировать конкретные части изображения без влияния на остальную часть. Инструменты постобработки, такие как апскейлеры и улучшатели, могут добавить окончательную отделку выводу ИИ, повышая разрешение и ясность.

В целом, ИИ еще не разработал более сложное и нюансированное толкование подсказок — задачу, которая остается одной из центральных для поддержания контроля. Многие модели склонны переинтерпретировать инструкции, пытаясь извлечь глубокие или слоистые значения, где они не предполагаются. Хотя это звучит как интеллект, даже подробная подсказка может дать непредсказуемые результаты. Например, ИИ может подчеркнуть или изобрести неожиданные элементы на основе ассоциаций, которые он выучил. Это увеличивает сложность создания подсказок, требуя от пользователей адаптироваться к тому, как модель “думает” (что не всегда интуитивно) и тратить больше времени на эксперименты с формулировкой, чтобы достичь желаемого результата.

Окончательные мысли

Понимание того, как ИИ интерпретирует визуальные данные — и признание того, где он склонен терпеть неудачу — позволяет принимать более умные решения при написании подсказок, использовать эффективные стратегии решения проблем и выбирать правильные инструменты, чтобы обойти возникающие ошибки генерации. В конечном итоге это позволяет пользователям работать с ИИ как с творческим партнером, а не полагаться на удачу или рассматривать его технические ограничения как препятствия для создания пригодного контента, точно отражающего видение создателя.

Глеб Ткачük - директор по продукту в AIBY, ведущей американской компании, основанной на принципах совместного создания, приобретения и эксплуатации лучших потребительских приложений. С более чем десятилетним опытом работы в отрасли, Глеб является известным лидером продукта с сильной репутацией по разработке и управлению высокопроизводительными мобильными программными продуктами в различных областях, включая утилиты и производительность, образ жизни и развлечения. Его текущий фокус включает потребительские приложения, работающие на основе искусственного интеллекта, предназначенные для обслуживания глобальной базы пользователей, насчитывающей миллионы человек. Отдавая особое внимание генеративному искусственному интеллекту, Глеб руководит генератором изображений ARTA, основанным на искусственном интеллекте, среди других продуктов AIBY.