Модели и платформы ИИ
DreamCraft3D: Иерархическое 3D-производство с помощью бутстрэп-диффузионного приора
Модели генеративного ИИ были предметом обсуждения в индустрии ИИ в течение некоторого времени. Недавний успех 2D-генеративных моделей проложил путь для методов, которые мы используем для создания визуального контента сегодня. Хотя сообщество ИИ достигло замечательного успеха с 2D-генеративными моделями, генерация 3D-контента остается серьезной проблемой для глубоких генеративных ИИ-рамок. Это особенно верно, поскольку спрос на 3D-сгенерированный контент достигает все-time высокого, обусловленного широким спектром визуальных игр, приложений, виртуальной реальности и даже кинематографа. Стоит отметить, что хотя существуют 3D-генеративные ИИ-рамки, которые дают приемлемые результаты для определенных категорий и задач, они не могут эффективно генерировать 3D-объекты. Этот недостаток можно отнести к отсутствию обширных 3D-данных для обучения рамок. Недавно разработчики предложили использовать руководство, предлагаемое предварительно обученными текст-изображение ИИ-генеративными моделями, подход, который показал перспективные результаты.
В этой статье мы обсудим рамку DreamCraft3D, иерархическую модель для генерации 3D-контента, которая производит связные и высококачественные 3D-объекты. Рамка DreamCraft3D использует 2D-справочное изображение для руководства геометрической скульптурой, улучшая текстуру с фокусом на решении проблем последовательности, с которыми сталкиваются текущие рамки или методы. Кроме того, рамка DreamCraft3D использует модель диффузии, зависящую от вида, для дистилляции счета, что помогает в скульптуре геометрии, которая способствует связному рендерингу.
Мы более подробно рассмотрим рамку DreamCraft3D для генерации 3D-контента. Кроме того, мы исследуем концепцию использования предварительно обученных Text-to-Image (T2I) моделей для генерации 3D-контента и изучаем, как рамка DreamCraft3D стремится использовать этот подход для генерации реалистичного 3D-контента.
DreamCraft3D: Введение
DreamCraft3D – это иерархический конвейер для генерации 3D-контента. Рамка DreamCraft3D попытается использовать современную T2I или Text-to-Image генеративную рамку для создания высококачественных 2D-изображений с помощью текстового подсказа. Этот подход позволяет рамке DreamCraft3D максимально использовать возможности современных 2D-диффузионных моделей для представления визуальной семантики, описанной в текстовом подсказе, сохраняя при этом творческую свободу, предлагаемую этими 2D-ИИ-генеративными рамками. Генерируемое изображение затем поднимается до 3D с помощью каскадного геометрического текстурного усиления и геометрической скульптуры, и специализированные техники применяются на каждом этапе с помощью декомпозиции проблемы.
Для геометрии рамка DreamCraft3D фокусируется в основном на глобальной 3D-структуре и многообразной последовательности, создавая место для компромиссов в деталях текстур в изображениях. Как только рамка избавляется от геометрических проблем, она смещает свой фокус на оптимизацию связных и реалистичных текстур, реализуя 3D-осведомленную диффузию, которая бутстрэпит 3D-оптимизационный подход. Существует два ключевых дизайнерских соображения для двух оптимизационных фаз, а именно геометрической скульптуры и текстурного усиления.
С учетом всего вышесказанного можно с уверенностью сказать, что DreamCraft3D – это ИИ-генеративная рамка, которая использует иерархический конвейер генерации 3D-контента для преобразования 2D-изображений в их 3D-аналоги, сохраняя при этом целостную 3D-последовательность.
Использование предварительно обученных T2I или Text-to-Image моделей
Идея использования предварительно обученных T2I или Text-to-Image моделей для генерации 3D-контента была впервые введена рамкой DreamFusion в 2022 году. Рамка DreamFusion попыталась реализовать SDS или Score Distillation Sample потерю для оптимизации 3D-рамки таким образом, чтобы рендеринги в случайных точках зрения соответствовали текст-условным изображениям, интерпретированным эффективной текст-изображение диффузионной рамкой. Хотя подход DreamFusion дал приличные результаты, существовали две основные проблемы: размытость и перенасыщение. Чтобы решить эти проблемы, недавние работы реализуют различные стратегии оптимизации на каждом этапе, чтобы улучшить 2D-дистилляционную потерю, что в конечном итоге приводит к лучшему качеству и реалистичным 3D-сгенерированным изображениям.
Однако, несмотря на недавний успех этих рамок, они не могут соответствовать способности 2D-генеративных рамок синтезировать сложный контент. Кроме того, эти рамки часто испорчены “Janus Issue”, состоянием, при котором 3D-рендеринги, которые кажутся правдоподобными индивидуально, показывают стилистические и семантические несоответствия при рассмотрении в целом.
Чтобы решить проблемы, с которыми сталкиваются предыдущие работы, рамка DreamCraft3D исследует возможность использования целостного иерархического конвейера генерации 3D-контента и черпает вдохновение из ручного художественного процесса, в котором концепция сначала набрасывается в 2D-черновик, после чего художник скульпирует грубую геометрию, уточняет геометрические детали и рисует высококачественные текстуры. Следуя этому же подходу, рамка DreamCraft3D разбивает исчерпывающие задачи генерации 3D-контента или изображений на различные управляемые шаги.
На первом этапе рамка DreamCraft3D развертывает геометрическую скульптуру для производства связных и правдоподобных 3D-геометрических форм с помощью 2D-изображения в качестве справочного. Кроме того, на этом этапе рамка не только использует SDS-потерю для фотометрических потерь и новых видов на справочном виде, но также вводит ряд стратегий для содействия геометрической последовательности. Рамка стремится использовать Zero-1-to-3, модель перевода изображения, условную для точки зрения, для использования справочного изображения для моделирования распределения новых видов. Кроме того, рамка также переходит от неявного представления поверхности к представлению сетки для грубого до тонкого геометрического уточнения.
На втором этапе рамка DreamCraft3D использует бутстрэп-дистилляцию счета для усиления текстур изображения, поскольку текущие модели диффузии, условленные для вида, обучены на ограниченном количестве 3D-данных, что является причиной того, что они часто испытывают трудности в соответствие производительности или верности 2D-диффузионных моделей. Благодаря этому ограничению, рамка DreamCraft3D уточняет модель диффузии в соответствии с многообразными изображениями 3D-экземпляра, который оптимизируется, и этот подход помогает рамке в aumento 3D-текстур, сохраняя при этом многообразную последовательность. Когда модель диффузии обучается на этих многообразных рендерингах, она обеспечивает лучшее руководство для 3D-текстурной оптимизации, и этот подход помогает рамке DreamCraft3D достичь огромного количества текстурных деталей, сохраняя при этом вид-последовательность.

Как можно наблюдать на вышеуказанных изображениях, рамка DreamCraft3D способна производить творческие 3D-изображения и контент с реалистичными текстурами и интригующими геометрическими структурами. На первом изображении – тело Сон Гоку, аниме-персонаж, смешанный с головой бегущей дикой свиньи, тогда как на втором изображении – бигль, одетый в наряд детектива. Следующие изображения – дополнительные примеры.

DreamCraft3D: Работа и Архитектура
Рамка DreamCraft3D попытается использовать современную T2I или Text-to-Image генеративную рамку для создания высококачественных 2D-изображений с помощью текстового подсказа. Этот подход позволяет рамке DreamCraft3D максимально использовать возможности современных 2D-диффузионных моделей для представления визуальной семантики, описанной в текстовом подсказе, сохраняя при этом творческую свободу, предлагаемую этими 2D-ИИ-генеративными рамками. Генерируемое изображение затем поднимается до 3D с помощью каскадного геометрического текстурного усиления и геометрической скульптуры, и специализированные техники применяются на каждом этапе с помощью декомпозиции проблемы. Следующее изображение кратко суммирует работу рамки DreamCraft3D.

Давайте более подробно рассмотрим ключевые дизайнерские соображения для текстурного усиления и геометрической скульптуры.
Геометрическая Скульптура
Геометрическая скульптура – это первый этап, на котором рамка DreamCraft3D попытается создать 3D-модель, соответствующую виду справочного изображения на том же справочном виде, обеспечивая при этом максимальную правдоподобность даже под разными углами зрения. Чтобы обеспечить максимальную правдоподобность, рамка использует SDS-потерю для содействия правдоподобному изображению рендеринга для каждого отдельного образца вида, который может распознать предварительно обученная диффузионная модель. Кроме того, чтобы эффективно использовать руководство из справочного изображения, рамка наказывает фотометрические различия между справочным и рендеренным изображениями на справочном виде, и потеря вычисляется только в пределах переднего плана вида. Кроме того, чтобы содействовать сценарной разреженности, рамка также реализует потерю маски, которая рендерит силуэт. Несмотря на это, сохранение вида и семантики последовательно остается проблемой, что является причиной того, что рамка использует дополнительные подходы для производства детальной и связной геометрии.
3D-Осведомленный Диффузионный Приор
Методы 3D-оптимизации, использующие только надзор за видом, недостаточно определены, что является основной причиной того, что рамка DreamCraft3D использует Zero-1-to-3, модель диффузии, условную для вида, поскольку рамка Zero-1-to-3 предлагает повышенную осведомленность о точке зрения, поскольку она была обучена на более крупном масштабе 3D-данных. Кроме того, рамка Zero-1-to-3 – это уточненная диффузионная модель, которая галлюцинирует изображение в отношении камеры, заданной справочным изображением.
Прогрессивная Обучение Видов
Получение свободных видов直接 в 360 градусах может привести к геометрическим артефактам или несоответствиям, таким как дополнительная нога на стуле, событие, которое может быть отнесено к неоднозначности, присущей единому справочному изображению. Чтобы решить эту проблему, рамка DreamCraft3D расширяет обучающие виды прогрессивно, после чего хорошо установленная геометрия постепенно распространяется для получения результатов в 360 градусах.
Диффузионное Уменьшение Шага
Рамка DreamCraft3D использует стратегию диффузионного уменьшения шага для соответствия 3D-оптимизации грубого до тонкого прогресса. В начале процесса оптимизации рамка отдает приоритет образцу более крупного диффузионного шага, чтобы обеспечить глобальную структуру. Когда рамка продолжает процесс обучения, она линейно уменьшает диапазон выборки в течение сотен итераций. Благодаря стратегии уменьшения, рамка способна установить правдоподобную глобальную геометрию на ранних этапах оптимизации до уточнения структурных деталей.
Уточнение Структурных Деталей
Рамка DreamCraft3D оптимизирует неявное представление поверхности изначально для установления грубой структуры. Рамка затем использует этот результат и объединяет его с деформируемой тетраэдрической сеткой или DMTet для инициализации текстурированного 3D-модели, который дезентangles обучение текстуры и геометрии. Когда рамка завершает структурное уточнение, модель способна сохранить высокочастотные детали, полученные из справочного изображения, уточняя текстуры исключительно.
Усиление Текстур с помощью Бутстрэп-Дистилляции Счета
Хотя этап геометрической скульптуры подчеркивает обучение детальной и связной геометрии, он также размыт текстуру до определенной степени, что может быть результатом зависимости рамки от 2D-пrior модели, работающей на грубом разрешении, а также ограниченной четкости, предлагаемой 3D-диффузионной моделью. Кроме того, общие проблемы с текстурами, включая перенасыщение и пере-сглаживание, возникают в результате большой классификаторно-свободной направленности.
Рамка использует VSD или Variational Score Distillation потерю для aumento реализма текстур. Рамка выбирает модель Stable Diffusion на этом этапе, чтобы получить высокоразрешающие градиенты. Кроме того, рамка сохраняет тетраэдрическую сетку фиксированной для содействия реалистичному рендерингу и оптимизации общей структуры сетки. Во время этапа обучения рамка DreamCraft3D не использует рамку Zero-1-to-3, поскольку она имеет негативное влияние на качество текстур, и эти несоответствующие текстуры могут быть повторяющимися, что приводит к странным 3D-выходам.
Эксперименты и Результаты
Чтобы оценить производительность рамки DreamCraft3D, она сравнивается с текущими современными рамками, и качественные и количественные результаты анализируются.
Сравнение с Базовыми Моделями
Чтобы оценить производительность, рамка DreamCraft3D сравнивается с 5 современными рамками, включая DreamFusion, Magic3D, ProlificDreamer, Magic123 и Make-it-3D. Тестовый бенчмарк состоит из 300 входных изображений, которые представляют собой смесь реальных изображений и тех, которые генерируются с помощью рамки Stable Diffusion. Каждое изображение в тестовом бенчмарке имеет текстовый подсказ, предсказанную карту глубины и альфа-маску для переднего плана. Рамка получает текстовые подсказы для реальных изображений из рамки image caption.
Качественный Анализ
Следующее изображение сравнивает рамку DreamCraft3D с текущими базовыми моделями, и как можно видеть, рамки, которые полагаются на текст-3D-подход, часто сталкиваются с проблемами многообразной последовательности.

С одной стороны, у вас есть рамка ProlificDreamer, которая предлагает реалистичные текстуры, но она не может генерировать правдоподобный 3D-объект. Рамки, такие как Make-it-3D, которые полагаются на Image-to-3D методы, могут создавать высококачественные фронтальные виды, но они не могут поддерживать идеальную геометрию для изображений. Изображения, генерируемые рамкой Magic123, предлагают лучшую геометрическую регуляризацию, но они генерируют чрезмерно насыщенные и сглаженные геометрические текстуры и детали. Когда сравниваются с этими рамками, рамка DreamCraft3D, которая использует бутстрэп-дистилляцию счета, не только поддерживает семантическую последовательность, но также улучшает общую разнообразие воображения.

Количественный Анализ
Чтобы сгенерировать привлекательные 3D-изображения, которые не только напоминают входное справочное изображение, но также передают семантику с различных точек зрения последовательно, техники, используемые рамкой DreamCraft3D, сравниваются с базовыми моделями, и процесс оценки использует четыре метрики: PSNR и LPIPS для измерения верности на справочном виде, Contextual Distance для оценки пиксельного соответствия, и CLIP для оценки семантической последовательности. Результаты демонстрируются на следующем изображении.

Заключение
В этой статье мы обсудили DreamCraft3D, иерархический конвейер для генерации 3D-контента. Рамка DreamCraft3D стремится использовать современную Text-to-Image (T2I) генеративную рамку для создания высококачественных 2D-изображений с помощью текстового подсказа. Этот подход позволяет рамке DreamCraft3D максимально использовать возможности современных 2D-диффузионных моделей для представления визуальной семантики, описанной в текстовом подсказе, сохраняя при этом творческую свободу, предлагаемую этими 2D-ИИ-генеративными рамками. Генерируемое изображение затем поднимается до 3D с помощью каскадного геометрического текстурного усиления и геометрической скульптуры, и специализированные техники применяются на каждом этапе с помощью декомпозиции проблемы. Благодаря этому подходу, рамка DreamCraft3D может производить высококачественные и связные 3D-активы с привлекательными текстурами, видимыми с нескольких углов.












