Модели и платформы ИИ

LucidDreamer: Высококачественная генерация 3D из текста с помощью Interval Score Matching

mm
Добавьте Unite.AI в избранные источники в Google

Недавние достижения в области текст-3D генеративных моделей искусственного интеллекта отметили значительный рубеж в развитии генеративных моделей. Они открывают путь к новым возможностям создания 3D активов в различных реальных сценариях. Цифровые 3D активы теперь занимают важное место в нашем цифровом присутствии, обеспечивая полное визуализацию и взаимодействие с сложными средами и объектами, которые отражают наш опыт в реальном мире. Эти 3D генеративные модели искусственного интеллекта применяются в различных областях, включая анимацию, архитектуру, игры, дополненную и виртуальную реальность и многое другое. Они также широко используются на онлайн-конференциях, в розничной торговле, образовании и маркетинге.

Однако, несмотря на перспективы этих достижений в текст-3D генеративных моделях, широкое использование 3D технологий сопряжено с серьезной проблемой. Генерация высококачественных 3D изображений и медиа-контента все еще требует значительного времени, усилий, ресурсов и квалифицированной экспертизы. Даже при выполнении этих требований текст-3D генерация часто не может обеспечить детализированные и высококачественные 3D модели. Эта проблема рендеринга и низкокачественной 3D генерации более распространена в моделях, которые используют метод Score Distillation Sampling (SDS). В этой статье мы обсудим заметные недостатки, наблюдаемые в моделях, использующих метод SDS, которые вводят несоответствия и низкокачественные направления обновления, в результате чего возникает эффект чрезмерного сглаживания на сгенерированном выводе. Мы также представим модель LucidDreamer, новый подход, который использует метод Interval Score Matching (ISM), чтобы преодолеть проблему чрезмерного сглаживания. Мы рассмотрим архитектуру модели и ее производительность по сравнению с современными текст-3D генеративными моделями. Итак, давайте начнем.

LucidDreamer3D: Введение в генерацию 3D с помощью Interval Score Matching

Одной из основных причин, почему модели генерации 3D стали темой обсуждения в индустрии генеративного искусственного интеллекта, является их широкое применение в различных областях и отраслях, а также их способность производить 3D контент в реальном времени. Благодаря их широким практическим применениям, разработчики предложили многочисленные подходы к генерации 3D контента, среди которых выделяются модели генерации 3D из текста за их способность использовать только текстовые описания для создания воображаемых 3D моделей. Модели генерации 3D из текста достигают этого, используя предварительно обученную модель диффузии изображений в качестве сильной основы для обучения нейронной параметризированной 3D модели, что позволяет рендерить 3D изображения последовательно, соответствующие тексту. Эта способность рендерить постоянные 3D изображения основана на использовании метода Score Distillation Sampling (SDS) в качестве основного механизма для переноса 2D результатов из моделей диффузии в их 3D аналоги, что позволяет обучать 3D модели без использования обучающих изображений. Несмотря на их эффективность, 3D генеративные модели искусственного интеллекта, использующие метод SDS, часто страдают от искажений и проблем чрезмерного сглаживания, что препятствует практическим реализациям высококачественной 3D генерации.

Чтобы решить проблемы чрезмерного сглаживания, модель LucidDreamer реализует подход Interval Score Matching (ISM), новый подход, который использует два эффективных механизма. Во-первых, подход ISM использует метод инверсии DDIM, чтобы смягчить эффект усреднения, вызванный несоответствиями псевдо-истинных значений, производя обратимую траекторию диффузии. Во-вторых, вместо того, чтобы сопоставлять изображения, сгенерированные 3D моделью, с псевдо-истинными значениями, метод ISM сопоставляет их между двумя интервальными шагами в траектории диффузии, что помогает избежать высокой ошибки реконструкции, избегая одношаговой реконструкции. Использование ISM вместо SDS приводит к последовательно высоким результатам с высокореалистичными и детализированными выводами.

В целом, модель LucidDreamer направлена на внесение следующих вкладов в области генеративного искусственного интеллекта 3D:

  1. Предоставляет глубокий анализ SDS, фундаментальной концепции в моделях генерации 3D из текста, и выявляет ее ключевые ограничения низкокачественных псевдо-истинных значений и объясняет эффект чрезмерного сглаживания, с которым сталкиваются эти 3D генеративные модели.
  2. Чтобы противостоять ограничениям, налагаемым подходом SDS, модель LucidDreamer вводит Interval Score Matching, новый подход, который использует интервальную сопоставление и обратимые траектории диффузии, чтобы превзойти SDS, производя высокореалистичные и детализированные выводы.
  3. Достижение результатов на уровне современных моделей путем интеграции метода ISM с 3D Gaussian Splatting, чтобы превзойти существующие методы генерации 3D контента с низкими затратами на обучение.

Ограничения SDS

Как упоминалось ранее, SDS является одним из наиболее популярных подходов для моделей генерации 3D из текста, и он ищет режимы для условного постериора в латентном пространстве DDPM. Подход SDS также采用 предварительно обученную DDPM для моделирования условного постериора и стремится дистиллировать 3D представления для условного постериора, что достигается путем минимизации следующего расхождения KL. Кроме того, подход SDS повторно использует взвешенный денойзинг-скор-матчинг-объектив для обучения DDP. Основная цель подхода SDS также может быть рассмотрена как сопоставление вида 3D модели с псевдо-истинным значением, оцененным DDPM в одном шаге, хотя процесс дистилляции часто упускает из виду критический аспект компонента DDPM, а именно, он производит низкокачественные псевдо-истинные значения с несоответствующими особенностями во время процесса дистилляции.

Однако обновления направлений в нежелательных обстоятельствах обновляются до 3D представлений, что в конечном итоге приводит к результатам с чрезмерным сглаживанием. Кроме того, стоит отметить, что компонент DDPM чувствителен к входным данным, и особенности псевдо-истинных значений меняются значительно даже при незначительных изменениях входных данных. Кроме того, случайность в камерных позах и шумовых компонентах входных данных может добавить к колебаниям, которые неизбежны во время дистилляции. Оптимизация входных данных для несоответствующих псевдо-истинных значений приводит к результатам со средними особенностями. Что еще более важно, подход SDS получает псевдо-истинные значения с одношаговым предсказанием для всех временных интервалов и не учитывает ограничения компонента DDPM, который не может производить высококачественный вывод, что указывает на то, что дистилляция 3D активов или изображений с помощью компонента SDS может не быть наиболее идеальным подходом.

LucidDreamer: Методология и работа

Модель LucidDreamer не только вводит подход ISM, но также строится на основе знаний из других моделей, включая модели генерации 3D из текста, модели диффузии и дифференцируемые 3D представления. С учетом этого, давайте более подробно рассмотрим архитектуру и методологию модели LucidDreamer.

Interval Score Matching или ISM

Проблемы чрезмерного сглаживания и низкокачественного вывода, с которыми сталкиваются большинство моделей генерации 3D из текста, можно отнести к их использованию подхода SDS, который стремится сопоставить псевдо-истинное значение с 3D представлениями, что является несоответствующим и часто низкокачественным. Чтобы противостоять проблемам, с которыми сталкивается SDS, модель LucidDreamer вводит ISM или Interval Score Matching, новый подход, который имеет два этапа работы. На первом этапе компонент ISM получает более последовательные псевдо-истинные значения во время дистилляции, независимо от случайности в камерных позах и шуме. На втором этапе модель генерирует псевдо-истинные значения с лучшим качеством.

Другим значительным ограничением SDS является генерация псевдо-истинных значений с одношаговым предсказанием для всех временных интервалов, что делает трудным гарантировать высококачественные псевдо-истинные значения, и это является основой для улучшения визуального качества псевдо-истинных значений. Аналогично, объектив SDS можно рассматривать как сопоставление вида 3D модели с псевдо-истинным значением, оцененным DDPM в одном шаге, хотя процесс дистилляции упускает из виду критический аспект компонента DDPM, а именно, он производит низкокачественные псевдо-истинные значения с несоответствующими особенностями во время процесса дистилляции.

В целом, компонент ISM обещает предоставить несколько преимуществ над предыдущими методами, использованными в моделях генерации 3D из текста. Во-первых, благодаря способности ISM обеспечивать высококачественные псевдо-истинные значения последовательно, он способен производить высококачественные выводы дистилляции с более тонкими структурами и богатыми деталями, что устраняет необходимость в крупномасштабном руководстве и повышает гибкость для создания 3D контента. Во-вторых, переход от подхода SDS к подходу ISM имеет незначительный вычислительный overhead, особенно поскольку подход ISM не компрометирует общую эффективность, даже если он требует дополнительных вычислительных затрат для инверсий DDIM.

Вышеуказанная фигура демонстрирует работу подхода ISM и предоставляет обзор архитектуры модели LucidDreamer. Модель сначала инициализирует 3D представления, используя предварительно обученную модель генерации 3D из текста с помощью подсказки. Затем она включает в себя предварительно обученный 2D компонент DDPM, чтобы нарушить случайные виды до шумовых условных латентных траекторий, используя инверсии DDIM, и затем обновляет с интервальным счетом. Благодаря своей архитектуре, ядро оптимизации компонента ISM фокусируется на обновлении 3D представлений к псевдо-истинным значениям, которые являются высококачественными и особенностями-соответствующими, но вычислительчески дружественными. Этот принцип позволяет ISM соответствовать фундаментальным целям подхода SDS, совершенствуя существующий метод.

Инверсия DDIM

Модель LucidDreamer направлена на производство более последовательных псевдо-истинных значений в соответствии с 3D представлениями. Поэтому, вместо того, чтобы производить 3D представления, модель LucidDreamer использует подход инверсии DDIM, чтобы предсказать шумовые латентные 3D представления и предсказать обратимую шумовую латентную траекторию в итеративном порядке. Кроме того, именно благодаря обратимости инверсии DDIM модель LucidDreamer способна увеличить последовательность псевдо-истинных значений значительно для всех временных интервалов.

Расширенный пайплайн генерации

Модель LucidDreamer также вводит расширенный пайплайн, в дополнение к ISM, чтобы изучить факторы, влияющие на визуальное качество генерации 3D из текста, и вводит 3D Gaussian Splatting или 3DGS в качестве 3D генерации и 3D генерации точечных облаков для инициализации.

3D Gaussian Splatting

Существующие работы показали, что увеличение размера пакета и разрешения рендеринга для обучения значительно улучшает визуальное качество. Однако большинство обучаемых 3D представлений, принятых для генерации 3D из текста, являются трудоемкими и требуют много времени. С другой стороны, подход 3D Gaussian Splatting обеспечивает эффективные результаты как в оптимизации, так и в рендеринге, что позволяет расширенному пайплайну модели LucidDreamer достичь крупного размера пакета, а также высокоразрешающего рендеринга, даже при работе с ограниченными вычислительными ресурсами.

Инициализация

Большинство современных моделей генерации 3D из текста инициализируют свои 3D представления с ограниченными геометриями, такими как круг, коробка или цилиндр, что часто приводит к нежелательным результатам для неаксиально-симметричных объектов. С другой стороны, поскольку модель LucidDreamer вводит 3D Gaussian Splatting в качестве 3D представлений, модель может естественно принять несколько моделей генерации точек из текста, чтобы сгенерировать грубую инициализацию с помощью человеческого ввода. Стратегия инициализации в конечном итоге значительно увеличивает скорость сходимости.

LucidDreamer: Эксперименты и результаты

Генерация 3D из текста

Вышеуказанная фигура демонстрирует результаты, сгенерированные моделью LucidDreamer с помощью оригинального подхода стабильной диффузии, в то время как следующая фигура обсуждает сгенерированные результаты на разных дообученных контрольных точках.

Как можно увидеть, модель LucidDreamer способна генерировать высокосогласованный 3D контент, используя входной текст и семантические подсказки. Кроме того, с помощью подхода ISM модель LucidDreamer генерирует более реалистичные и детализированные изображения, избегая общих проблем, таких как перенасыщение или чрезмерное сглаживание, и преуспевает в генерации как обычных объектов, так и творческих творений.

Обобщаемость ISM

Чтобы оценить обобщаемость ISM, проводится сравнение между ISM и SDS в явных и неявных представлениях, и результаты демонстрируются на следующем изображении.

Качественное сравнение

Чтобы проанализировать качественную эффективность модели LucidDreamer, она сравнивается с текущими базовыми моделями, и для обеспечения справедливого сравнения используется фреймворк Stable Diffusion 2.1 для дистилляции, и результаты демонстрируются на следующем изображении. Как можно увидеть, модель обеспечивает высококачественные и геометрически точные результаты, потребляя меньше ресурсов и времени.

Кроме того, для предоставления более полной оценки разработчики также проводят пользовательское исследование. Оценка выбирает 28 подсказок и использует разные подходы генерации 3D из текста для каждой подсказки, чтобы сгенерировать объекты. Результаты затем ранжируются пользователями на основе степени соответствия входной подсказке и ее верности.

LucidDreamer: Применения

Благодаря своей исключительной производительности на широком спектре задач генерации 3D из текста, модель LucidDreamer имеет несколько потенциальных применений, включая генерацию аватаров без обучения, персонализированную генерацию 3D из текста и генерацию 2D и 3D редактирования без обучения.

Верхнее левое изображение демонстрирует потенциал модели LucidDreamer в задачах редактирования 2D и 3D без обучения, в то время как нижние левые изображения демонстрируют способность модели генерировать персонализированные 3D выводы из текста с LoRA, а изображение справа демонстрирует способность модели генерировать 3D аватары.

Окончательные мысли

В этой статье мы говорили о модели LucidDreamer, новом подходе, который использует метод Interval Score Matching или ISM, чтобы преодолеть проблему чрезмерного сглаживания, и обсудили архитектуру модели и ее производительность по сравнению с современными текст-3D генеративными моделями. Мы также говорили о том, как SDS или Score Distillation Sampling, распространенный подход, реализованный в большинстве современных моделей генерации 3D из текста, часто приводит к чрезмерному сглаживанию сгенерированных изображений, и как модель LucidDreamer противостоит этой проблеме, вводя новый подход, метод Interval Score Matching или ISM, для генерации высококачественных и более реалистичных 3D изображений. Результаты и оценка указывают на эффективность модели LucidDreamer на широком спектре задач генерации 3D, и на то, как модель уже работает лучше, чем текущие современные 3D генеративные модели. Исключительная производительность модели открывает путь к широкому спектру практических применений, как уже обсуждалось.

"Инженер по профессии, писатель по сердцу". Кунал - технический писатель с глубокой любовью и пониманием ИИ и МО, посвященный упрощению сложных концепций в этих областях посредством своей увлекательной и информативной документации.