Модели и платформы ИИ
Paint3D: Безосвещенная диффузионная модель для генерации изображений
Быстрое развитие моделей генерации AI, особенно глубоких моделей генерации AI, существенно расширило возможности в области генерации естественного языка, 3D-генерации, генерации изображений и синтеза речи. Эти модели революционизировали производство 3D во различных отраслях. Однако многие из них сталкиваются с проблемой: их сложная структура и сгенерированные сетки часто несовместимы с традиционными трубопроводами рендеринга, такими как Physically Based Rendering (PBR). Диффузионные модели, в частности без освещения, демонстрируют впечатляющую способность генерации 3D-активов, улучшая 3D-фреймворки в кинопроизводстве, играх и AR/VR.
Эта статья представляет Paint3D, новый фреймворк для создания разнообразных, высококачественных 2K UV-текстурных карт для неотекстурированных 3D-сеток, учитывая визуальные или текстовые входные данные. Основной задачей Paint3D является генерация высококачественных текстур без встроенного освещения, что позволяет пользователям редактировать или перенастраивать освещение в современных графических трубопроводах. Он использует предварительно обученную 2D-диффузионную модель для многовидовой текстурной фузии, генерируя первоначальные грубые текстурные карты. Однако эти карты часто демонстрируют артефакты освещения и неполные области из-за ограничений 2D-модели в отключении эффектов освещения и полном представлении 3D-форм. Мы рассмотрим работу Paint3D, его архитектуру и сравнения с другими глубокими генеративными фреймворками. Давайте начнем.
Paint3D: Введение
Возможности глубоких моделей генерации AI в генерации естественного языка, 3D-генерации и синтезе изображений хорошо известны и реализованы в реальных приложениях, революционизируя отрасль 3D-генерации. Несмотря на их впечатляющие возможности, современные глубокие генеративные AI-фреймворки генерируют сетки, характеризующиеся сложной структурой и хаотичными текстурами освещения, которые часто несовместимы с традиционными трубопроводами рендеринга, включая PBR или Physically Based Rendering. Как и глубокие модели генерации AI, синтез текстур также быстро продвинулся вперед, особенно в использовании 2D-диффузионных моделей. Модели синтеза текстур используют предварительно обученные глубинно-изображенные диффузионные модели, чтобы эффективно использовать текстовые условия для генерации высококачественных текстур. Однако эти подходы сталкиваются с трудностями в предосвещенных текстурах, которые могут существенно повлиять на окончательные 3D-окружения рендеринга и ввести ошибки освещения, когда освещение меняется в общих рабочих процессах, как показано на следующем изображении.

Как можно наблюдать, текстурная карта с свободным освещением работает в гармонии с традиционными трубопроводами рендеринга, доставляя точные результаты, тогда как текстурная карта с предосвещением включает в себя неуместные тени, когда применяется перенастройка освещения. С другой стороны, фреймворки генерации текстур, обученные на 3D-данных, предлагают альтернативный подход, в котором фреймворк генерирует текстуры, понимая геометрию конкретного 3D-объекта. Хотя они могут доставить лучшие результаты, фреймворки генерации текстур, обученные на 3D-данных, лишены возможностей обобщения, что препятствует их способности применить модель к 3D-объектам вне их обучающих данных.
Текущие модели генерации текстур сталкиваются с двумя критическими проблемами: использование изображений или разнообразных подсказок для достижения более широкой степени обобщения для различных объектов и вторая проблема – устранение связанного освещения в результатах, полученных из предварительного обучения. Предосвещенные текстуры могут потенциально вмешиваться в окончательные результаты текстурированных объектов в двигателях рендеринга, и поскольку предварительно обученные 2D-диффузионные модели предоставляют 2D-результаты только в области вида, они лишены полного понимания форм, что приводит к их неспособности поддерживать согласованность вида для 3D-объектов.
Из-за упомянутых выше проблем фреймворк Paint3D пытается разработать двухэтапную модель диффузии текстур для 3D-объектов, которая обобщается для различных предварительно обученных генеративных моделей и сохраняет согласованность вида при обучении генерации текстур без освещения.
Paint3D – это двухэтапная модель грубой и тонкой генерации текстур, целью которой является использование сильной подсказки и возможностей генерации изображений предварительно обученных моделей генерации AI для текстурирования 3D-объектов. На первом этапе фреймворк Paint3D сначала выборочно генерирует многовидовые изображения из предварительно обученной глубинно-осведомленной 2D-диффузионной модели, чтобы обобщить высококачественные и богатые текстурные результаты из разнообразных подсказок. Затем модель генерирует первоначальную текстурную карту, обратно проецируя эти изображения на поверхность 3D-сетки. На втором этапе модель фокусируется на генерации текстур без освещения, реализуя подходы, используемые диффузионными моделями, специализирующимися на удалении влияния освещения и осведомленном уточнении неполных областей. На протяжении всего процесса фреймворк Paint3D последовательно генерирует высококачественные 2K-текстуры семантически и устраняет внутренние эффекты освещения.

Вкратце, Paint3D – это новая грубая и тонкая генеративная модель AI, целью которой является производство разнообразных, безосвещенных и высококачественных 2K UV-текстурных карт для неотекстурированных 3D-сеток для достижения передового опыта в текстурировании 3D-объектов с различными условными входными данными, включая текст и изображения, и предлагает существенное преимущество для задач синтеза и редактирования графики.
Методология и Архитектура
Фреймворк Paint3D генерирует и уточняет текстурные карты прогрессивно, чтобы генерировать разнообразные и высококачественные текстурные карты для 3D-моделей, используя желаемые условные входные данные, включая изображения и подсказки, как показано на следующем изображении.

На этапе грубой генерации модель Paint3D использует предварительно обученные 2D-диффузионные модели для выборочного генерирования многовидовых изображений, а затем создает первоначальные текстурные карты, обратно проецируя эти изображения на поверхность сетки. На втором этапе, то есть этапе уточнения, модель Paint3D использует диффузионный процесс в UV-пространстве, чтобы улучшить грубые текстурные карты, достигая высококачественной, инпейтинговой и безосвещенной функции, которая обеспечивает визуальную привлекательность и полноту окончательной текстуры.
Этап 1: Прогрессивная Грубая Генерация Текстуры
На этапе прогрессивной грубой генерации текстуры модель Paint3D генерирует грубую UV-текстурную карту для 3D-сеток, используя предварительно обученную глубинно-осведомленную 2D-диффузионную модель. Более конкретно, модель сначала использует различные камерные виды для рендеринга глубинной карты, затем использует глубинные условия для выборочного генерирования изображений из диффузионной модели изображений, и затем обратно проецирует эти изображения на поверхность сетки. Фреймворк выполняет рендеринг, выборочное генерирование и обратную проекцию подходов чередуя, чтобы улучшить согласованность текстурных сеток, что в конечном итоге помогает в прогрессивной генерации текстурной карты.
Модель начинает генерировать текстуру видимой области с камерными видами, фокусирующимися на 3D-сетке, и рендерит 3D-сетку в глубинную карту из первого вида. Модель затем выборочно генерирует текстурное изображение для условий вида и глубины. Модель затем обратно проецирует изображение на 3D-сетку. Для точек зрения модель Paint3D выполняет аналогичный подход, но с небольшим изменением, выполняя процесс выборочного генерирования текстуры с помощью подхода рисования изображения. Кроме того, модель учитывает текстурированные области из предыдущих точек зрения, позволяя процессу рендеринга не только выводить глубинное изображение, но и частично окрашенное RGB-изображение с неокрашенной маской в текущем виде.
Модель затем использует глубинно-осведомленную модель инпейтинга изображения с кодировщиком инпейтинга, чтобы заполнить неокрашенную область в RGB-изображении. Модель затем генерирует текстурную карту из вида, обратно проецируя инпейтинговое изображение в 3D-сетку под текущим видом, позволяя модели генерировать текстурную карту прогрессивно и достигая всей грубой структуры карты. Наконец, модель расширяет процесс выборочного генерирования текстуры до сцены или объекта с несколькими видами. Более конкретно, модель использует пару камер, чтобы захватить две глубинные карты во время первоначального выборочного генерирования текстуры из симметричных точек зрения. Модель затем объединяет две глубинные карты и композирует глубинную сетку. Модель заменяет единственное глубинное изображение глубинной сеткой, чтобы выполнить многовидовое глубинно-осведомленное выборочное генерирование текстуры.
Этап 2: Уточнение Текстуры в UV-пространстве
Хотя внешний вид грубых текстурных карт логичен, он сталкивается с некоторыми проблемами, такими как текстурные дыры, вызванные во время процесса рендеринга самооключением или тенями освещения из-за участия 2D-диффузионных моделей. Модель Paint3D пытается выполнить диффузионный процесс в UV-пространстве на основе грубой текстурной карты, пытаясь смягчить проблемы и улучшить визуальную привлекательность текстурной карты еще больше во время уточнения текстуры. Однако уточнение основной диффузионной модели изображений с текстурными картами в UV-пространстве вводит текстурную несогласованность, поскольку текстурная карта генерируется UV-отображением текстуры 3D-поверхности, разрезающей непрерывную текстуру на ряд отдельных фрагментов в UV-пространстве. В результате фрагментации модель обнаруживает трудности в обучении 3D-связям между фрагментами, что приводит к проблемам текстурной несогласованности.
Модель уточняет текстурную карту в UV-пространстве, выполняя диффузионный процесс под руководством информации о смежности текстурных фрагментов. Важно отметить, что в UV-пространстве позиционная карта представляет 3D-связи текстурных фрагментов, с моделью, рассматривающей каждый нефоновый элемент как 3D-координату точки. Во время диффузионного процесса модель объединяет 3D-связи, добавляя отдельный кодировщик позиционной карты к предварительно обученной диффузионной модели изображений. Новый кодировщик напоминает конструкцию фреймворка ControlNet и имеет ту же архитектуру, что и кодировщик, реализованный в диффузионной модели изображений, с нулевым слоем свертки, соединяющим их. Кроме того, модель диффузии текстуры обучена на наборе данных, включающем текстурные и позиционные карты, и модель учится предсказывать шум, добавленный к шумному латентному. Модель затем оптимизирует кодировщик позиции и замораживает обученный денойзер для своей задачи диффузии изображений.
Модель затем одновременно использует позицию условного кодировщика и другие кодировщики, чтобы выполнить задачи уточнения в UV-пространстве. В этом отношении модель имеет две возможности уточнения: UVHD или UV Высокая Четкость и UV-инпейтинг. Метод UVHD предназначен для улучшения визуальной привлекательности и эстетики текстурной карты. Чтобы достичь UVHD, модель использует кодировщик улучшения изображения и кодировщик позиции с диффузионной моделью. Модель использует метод UV-инпейтинга, чтобы заполнить текстурные дыры в UV-плоскости, что способно избежать проблем самооключения, генерируемых во время рендеринга. На этапе уточнения модель Paint3D сначала выполняет UV-инпейтинг, а затем выполняет UVHD, чтобы сгенерировать окончательную уточненную текстурную карту. Объединив два метода уточнения, фреймворк Paint3D способен производить полные, разнообразные, высококачественные и безосвещенные UV-текстурные карты.
Paint3D: Эксперименты и Результаты
Модель Paint3D использует модель текст-изображение Stable Diffusion, чтобы помочь ей с задачами генерации текстур, в то время как она использует компонент кодировщика изображения, чтобы обработать условные изображения. Чтобы еще больше улучшить ее хватку на условных контролях, таких как инпейтинг изображения, глубина и высокая четкость изображения, фреймворк Paint3D использует кодировщики домена ControlNet. Модель реализована на фреймворке PyTorch, а рендеринг и проекция текстур реализованы на Kaolin.
Сравнение Текстур на основе Текста
Чтобы проанализировать ее производительность, мы начинаем с оценки эффекта генерации текстур Paint3D, когда она обусловлена текстовыми подсказками, и сравниваем ее с передовыми фреймворками, включая Text2Tex, TEXTure и LatentPaint. Как можно наблюдать на следующем изображении, фреймворк Paint3D не только отличается высококачественными текстурными деталями, но также синтезирует текстурную карту без освещения достаточно хорошо.

В сравнении фреймворк Latent-Paint склонен генерировать размытые текстуры, что приводит к неоптимальным визуальным эффектам. С другой стороны, хотя фреймворк TEXTure генерирует четкие текстуры, он лишен гладкости и демонстрирует заметные швы и спайки. Наконец, фреймворк Text2Tex генерирует гладкие текстуры замечательно, но он не может повторить производительность для генерации тонких текстур с интригующими деталями.
Следующее изображение сравнивает фреймворк Paint3D с передовыми фреймворками количественно.

Как можно наблюдать, фреймворк Paint3D превосходит все существующие модели, и с существенным отрывом, с почти 30% улучшением в базовой линии FID и примерно 40% улучшением в базовой линии KID. Улучшение в базовых линиях FID и KID демонстрирует способность Paint3D генерировать высококачественные текстуры для различных объектов и категорий.
Сравнение Изображения и Текстуры
Чтобы сгенерировать возможности Paint3D с помощью визуальных подсказок, мы используем модель TEXTure в качестве базовой модели. Как упоминалось ранее, модель Paint3D использует кодировщик изображения из модели текст-изображение Stable Diffusion. Как можно видеть на следующем изображении, фреймворк Paint3D синтезирует исключительные текстуры замечательно, и все еще способен поддерживать высокую точность относительно условий изображения.

С другой стороны, фреймворк TEXTure способен генерировать текстуру, подобную Paint3D, но он не может точно представить текстурные детали в условии изображения. Кроме того, как демонстрируется на следующем изображении, фреймворк Paint3D доставляет лучшие результаты FID и KID по сравнению с фреймворком TEXTure, с первым, уменьшающимся с 40,83 до 26,86, а второй, показывающей снижение с 9,76 до 4,94.

Окончательные Мысли
В этой статье мы говорили о Paint3D, новом фреймворке, способном производить безосвещенные, разнообразные и высококачественные 2K UV-текстурные карты для неотекстурированных 3D-сеток, обусловленных визуальными или текстовыми входными данными. Основным преимуществом фреймворка Paint3D является то, что он способен генерировать безосвещенные высококачественные 2K UV-текстуры, которые семантически согласованы без условий изображения или текста. Благодаря своему грубому и тонкому подходу, фреймворк Paint3D производит безосвещенные, разнообразные и высококачественные текстурные карты и доставляет лучшую производительность, чем текущие передовые фреймворки.












