Модели и платформы ИИ

Paint3D: Введение

mm
Добавьте Unite.AI в избранные источники в Google

С появлением глубоких генеративных моделей ИИ значительно ускорилось развитие ИИ с замечательными возможностями в генерации естественного языка, 3D-генерации, генерации изображений и синтезе речи. 3D-генеративные модели преобразовали многие отрасли и применения, революционизируя текущий ландшафт 3D-производства. Однако многие современные глубокие генеративные модели сталкиваются с общей проблемой: сложная проводка и сгенерированные сетки с текстурами освещения часто несовместимы с традиционными конвейерами рендеринга, такими как PBR (Физически Основанный Рендеринг). Модели, основанные на диффузии, которые генерируют 3D-активы без текстур освещения, обладают замечательными возможностями для разнообразной генерации 3D-активов, тем самым дополняя существующие 3D-фреймворки в таких отраслях, как кинопроизводство, игры и дополненная/виртуальная реальность.

В этой статье мы обсудим Paint3D, новую粗-то-тонкую модель, способную производить разнообразные, высококачественные 2K UV-текстуры для неотекстурированных 3D-сеток, условленных либо на визуальных, либо на текстовых входах. Основная задача, которую решает Paint3D, заключается в генерации высококачественных текстур без внедрения информации об освещении, что позволяет пользователям重新 редактировать или переосвещать в современных графических конвейерах. Чтобы решить эту проблему, фреймворк Paint3D использует предварительно обученную 2D-модель диффузии для выполнения многовидовой текстурной фузии и генерации условных изображений, изначально производя грубую текстурную карту. Однако, поскольку 2D-модели не могут полностью отключить эффекты освещения или полностью представить 3D-формы, текстурная карта может проявлять артефакты освещения и неполные области.

В этой статье мы рассмотрим фреймворк Paint3D более подробно, изучая его работу и архитектуру, и сравнивая его с современными глубокими генеративными фреймворками. Итак, давайте начнем.

Paint3D: Введение

Глубокие генеративные модели ИИ продемонстрировали исключительные возможности в генерации естественного языка, 3D-генерации и синтезе изображений, и были реализованы в реальных приложениях, революционизируя отрасль 3D-генерации. Однако, несмотря на их замечательные возможности, современные глубокие генеративные модели ИИ часто производят сетки с сложной проводкой и хаотичными текстурами освещения, которые несовместимы с традиционными конвейерами рендеринга, включая PBR. Аналогично, синтез текстур развивался быстро, особенно с использованием 2D-моделей диффузии. Эти модели эффективно используют предварительно обученные модели диффузии глубины-изображения и текстовые условия для генерации высококачественных текстур. Однако значительная проблема остается: предварительно освещенные текстуры могут негативно повлиять на окончательные 3D-окружения рендеринга, вводя ошибки освещения при регулировке освещения в общих рабочих процессах, как показано на следующем изображении.

Как наблюдается, текстурные карты без предварительного освещения работают без проблем с традиционными конвейерами рендеринга, обеспечивая точные результаты. Напротив, текстурные карты с предварительным освещением включают неуместные тени при применении повторного освещения. Фреймворки генерации текстур, обученные на 3D-данных, предлагают альтернативный подход, генерируя текстуры путем понимания всей геометрии конкретного 3D-объекта. Хотя эти фреймворки могут обеспечить лучшие результаты, они лишены возможностей обобщения, необходимых для применения модели к 3D-объектам вне их обучающих данных.

Текущие модели генерации текстур сталкиваются с двумя критическими проблемами: достижением широкого обобщения на различные объекты с помощью руководства изображением или разнообразных подсказок и устранением связанного освещения из результатов предварительного обучения. Предварительно освещенные текстуры могут вмешиваться в окончательные результаты текстурированных объектов в рендеринговых движках. Кроме того, поскольку предварительно обученные 2D-модели диффузии предоставляют только 2D-результаты в области вида, они лишены всестороннего понимания форм, что приводит к несоответствиям в поддержании последовательности вида для 3D-объектов.

Чтобы решить эти проблемы, фреймворк Paint3D разработал двустадийную модель диффузии текстур для 3D-объектов, которая обобщает на различные предварительно обученные генеративные модели и сохраняет последовательность вида при генерации текстур без освещения.

Paint3D – это двустадийная,粗-то-тонкая модель генерации текстур, которая использует сильное руководство подсказками и возможности генерации изображений предварительно обученных генеративных моделей ИИ для текстурирования 3D-объектов. На первой стадии Paint3D выборочно образует многовидовые изображения из предварительно обученной 2D-модели диффузии изображения, что позволяет обобщать высококачественные, богатые текстурные результаты из разнообразных подсказок. Модель затем генерирует начальную текстурную карту, обратно проецируя эти изображения на поверхность 3D-сетки. На второй стадии модель фокусируется на генерации текстур без освещения, реализуя подходы, используемые моделями диффузии, специализированными на удалении влияния освещения и уточнении формо-независимых неполных областей. На протяжении всего процесса фреймворк Paint3D последовательно генерирует высококачественные 2K-текстуры семантически, устраняя внутренние эффекты освещения.

Вкратце, Paint3D – это новая,粗-то-тонкая генеративная модель ИИ, предназначенная для производства разнообразных, без освещения, высококачественных 2K UV-текстурных карт для неотекстурированных 3D-сеток. Она направлена на достижение лучшей производительности в текстурировании 3D-объектов с различными условными входами, включая текст и изображения, предлагая значительные преимущества для задач синтеза и редактирования графики.

Методология и Архитектура

Фреймворк Paint3D генерирует и уточняет текстурные карты прогрессивно, чтобы производить разнообразные и высококачественные текстуры для 3D-моделей с использованием условных входов, таких как изображения и подсказки, как показано на следующем изображении.

Стадия 1: Постепенная Грубая Генерация Текстуры

На первой стадии грубой генерации текстуры Paint3D использует предварительно обученные 2D-модели диффузии изображения для выборочного образования многовидовых изображений, которые затем обратно проецируются на поверхность сетки, чтобы создать начальную текстурную карту. Эта стадия начинается с генерации карты глубины из различных камерных видов. Модель использует условия глубины для выборочного образования изображений из модели диффузии, которые затем обратно проецируются на 3D-сетку. Этот подход чередующего рендеринга, выборочного образования и обратной проекции улучшает последовательность текстурных сеток и помогает прогрессивно генерировать текстурную карту.

Процесс начинается с видимых областей 3D-сетки, фокусируясь на генерации текстуры из первого камерного вида путем рендеринга 3D-сетки в карту глубины. Затем образуется текстурное изображение на основе внешнего вида и условий глубины и обратно проецируется на сетку. Этот метод повторяется для последующих точек зрения, включающих предыдущие текстуры для рендеринга не только глубинного изображения, но и частично окрашенного RGB-изображения с неокрашенными масками. Модель использует кодировщик глубинного изображения для заполнения неокрашенных областей, генерируя полную грубую текстурную карту путем обратной проекции заполненных изображений на 3D-сетку.

Для более сложных сцен или объектов модель использует несколько видов. Первоначально она захватывает две карты глубины из симметричных точек зрения и объединяет их в глубинную сетку, которая заменяет единственное глубинное изображение для многовидовой глубинно-осведомленной выборки текстуры.

Стадия 2: Уточнение Текстуры в Пространстве UV

Несмотря на генерацию логичных грубых текстурных карт, возникают проблемы, такие как текстурные дыры из процессов рендеринга и тени освещения из 2D-моделей диффузии. Чтобы решить эти проблемы, Paint3D выполняет процесс диффузии в пространстве UV на основе грубой текстурной карты, улучшая визуальную привлекательность и решая проблемы.

Однако уточнение текстурной карты в пространстве UV может ввести несоответствия из-за фрагментации непрерывных текстур на отдельные фрагменты. Чтобы смягчить это, Paint3D уточняет текстурную карту, используя информацию о смежности текстурных фрагментов. В пространстве UV позиционная карта представляет 3D-информацию о смежности текстурных фрагментов, рассматривая каждый нефоновый элемент как 3D-координату точки. Модель использует дополнительный кодировщик позиционной карты, аналогичный ControlNet, для интеграции этой информации о смежности во время процесса диффузии.

Модель одновременно использует позицию условного кодировщика и других кодировщиков для выполнения задач уточнения в пространстве UV, предлагая две возможности: UVHD (UV Высокая Четкость) и UV-заполнение. UVHD улучшает визуальную привлекательность и эстетику, используя кодировщик улучшения изображения и кодировщик позиции с моделью диффузии. UV-заполнение заполняет текстурные дыры, избегая проблем самоокключения из рендеринга. Стадия уточнения начинается с UV-заполнения, за которым следует UVHD для производства окончательной уточненной текстурной карты.

Благодаря интеграции этих методов уточнения фреймворк Paint3D генерирует полные, разнообразные, высококачественные и без освещения UV-текстурные карты, что делает его прочным решением для текстурирования 3D-объектов.

Paint3D: Эксперименты и Результаты

Модель Paint3D использует модель текст-изображение Stable Diffusion для помощи в задачах генерации текстур, в то время как компонент кодировщика изображения управляет условиями изображения. Чтобы улучшить контроль над условными задачами, такими как заполнение изображения, обработка глубины и высокочеткое изображение, фреймворк Paint3D использует кодировщики домена ControlNet. Модель реализована на фреймворке PyTorch, с рендерингом и проекциями текстур, выполненными на Kaolin.

Сравнение Текстур на основе Текста

Чтобы оценить производительность Paint3D, мы начинаем с анализа его генерации текстур при условии текстовых подсказок, сравнивая его с современными фреймворками, такими как Text2Tex, TEXTure и LatentPaint. Как показано на следующем изображении, фреймворк Paint3D не только превосходит в генерации высококачественных текстурных деталей, но и эффективно синтезирует текстурную карту без освещения.

Благодаря использованию прочных возможностей Stable Diffusion и кодировщиков ControlNet, Paint3D обеспечивает лучшее качество текстур и универсальность. Сравнение подчеркивает способность Paint3D производить подробные, высококачественные текстуры без встроенного освещения, что делает его ведущим решением для задач текстурирования 3D.

В сравнении фреймворк Latent-Paint склонен к генерации размытых текстур, что приводит к субоптимальным визуальным эффектам. С другой стороны, хотя фреймворк TEXTure генерирует четкие текстуры, он лишен гладкости и проявляет заметные швы и швы. Наконец, фреймворк Text2Tex генерирует гладкие текстуры замечательно, но он не может повторить производительность для генерации тонких текстур с интригующими деталями. Следующее изображение сравнивает фреймворк Paint3D с современными фреймворками количественно.

Как можно наблюдать, фреймворк Paint3D превосходит все существующие модели, и с значительным отрывом, с почти 30% улучшением базовой метрики FID и примерно 40% улучшением базовой метрики KID. Улучшение метрик FID и KID демонстрирует способность Paint3D генерировать высококачественные текстуры на различных объектах и категориях.

Сравнение Изображения и Текстуры

Чтобы сгенерировать возможности Paint3D с использованием визуальных подсказок, мы используем модель TEXTure в качестве базовой. Как упоминалось ранее, модель Paint3D использует кодировщик изображения из модели текст-изображение Stable Diffusion. Как можно видеть на следующем изображении, фреймворк Paint3D синтезирует исключительные текстуры замечательно, и все еще может поддерживать высокую верность относительно условия изображения.

С другой стороны, фреймворк TEXTure может генерировать текстуру, подобную Paint3D, но он не может точно представить детали текстуры в условии изображения. Кроме того, как показано на следующем изображении, фреймворк Paint3D обеспечивает лучшие метрики FID и KID по сравнению с фреймворком TEXTure, с первым уменьшением с 40,83 до 26,86, а последний показывает уменьшение с 9,76 до 4,94.

Окончательные Мысли

В этой статье мы говорили о Paint3D, новой粗-то-тонкой модели, способной производить без освещения, разнообразные и высококачественные 2K UV-текстурные карты для неотекстурированных 3D-сеток, условленных либо на визуальных, либо на текстовых входах. Основное преимущество фреймворка Paint3D заключается в том, что он может генерировать без освещения высококачественные 2K UV-текстуры, которые семантически согласованы без условий на изображение или текстовые входы. Благодаря粗-то-тонкому подходу фреймворк Paint3D производит без освещения, разнообразные и высококачественные текстурные карты и обеспечивает лучшую производительность, чем современные фреймворки.

"Инженер по профессии, писатель по сердцу". Кунал - технический писатель с глубокой любовью и пониманием ИИ и МО, посвященный упрощению сложных концепций в этих областях посредством своей увлекательной и информативной документации.