Modelos y plataformas de IA

LucidDreamer: Generación de texto a 3D de alta fidelidad mediante Interval Score Matching

mm
Añade Unite.AI a tus fuentes preferidas en Google

Los recientes avances en los marcos de generación de texto a 3D han marcado un hito significativo en los modelos generativos. Abren el camino a nuevas posibilidades en la creación de activos 3D en numerosos escenarios del mundo real. Los activos digitales 3D ahora ocupan un lugar indispensable en nuestra presencia digital, permitiendo una visualización y interacción completas con entornos y objetos complejos que reflejan nuestras experiencias del mundo real. Estos marcos de generación de texto a 3D se aplican en diversos dominios, incluyendo animación, arquitectura, juegos, realidad aumentada y virtual, y mucho más. También se utilizan ampliamente en conferencias en línea, comercio, educación y marketing.

Sin embargo, a pesar de las promesas de estos avances en los marcos de generación de texto a 3D, el uso extensivo de tecnologías 3D conlleva un problema importante. Generar imágenes y contenido de medios de alta calidad en 3D todavía requiere un tiempo, esfuerzo, recursos y habilidades especializadas significativos. Incluso cuando se cumplen estos requisitos, la generación de texto a 3D a menudo no logra renderizar modelos 3D detallados y de alta calidad. Este problema de renderizado y generación de 3D de baja calidad es más prevalente en los marcos que utilizan el método de Muestreo de Destilación de Puntuación (SDS). Este artículo discutirá las deficiencias notables observadas en los modelos que utilizan el método SDS, que introducen inconsistencias y direcciones de actualización de baja calidad, lo que resulta en un efecto de sobresuavizado en la salida generada. También presentaremos el marco de LucidDreamer, un enfoque novedoso que utiliza el método de Coincidencia de Puntuación de Intervalo (ISM) para superar el problema de sobresuavizado. Exploraremos la arquitectura del modelo y su rendimiento en comparación con los marcos generativos de texto a 3D de vanguardia. Así que comencemos.

LucidDreamer3D: Una Introducción a la Generación 3D mediante Coincidencia de Puntuación de Intervalo

Una de las razones principales por las que los modelos de generación 3D han sido el tema de conversación de la industria de la inteligencia artificial generativa es su amplia aplicación en diversos dominios e industrias, y su capacidad para producir contenido 3D en tiempo real. Debido a sus amplias aplicaciones prácticas, los desarrolladores han propuesto numerosos enfoques para la generación de contenido 3D, y los marcos de generación de texto a 3D se destacan por su capacidad para generar modelos 3D imaginativos utilizando solo descripciones de texto. Los marcos de generación de texto a 3D logran esto utilizando un modelo de difusión de imagen preentrenado como una imagen fuerte antes de supervisar el entrenamiento de un modelo 3D parametrizado por neuronas, lo que permite renderizar imágenes 3D de manera consistente que se alinean con el texto. Esta capacidad para renderizar imágenes 3D constantes se basa en el uso fundamental del Muestreo de Destilación de Puntuación, y permite que el SDS actúe como el mecanismo central para llevar resultados 2D de modelos de difusión a sus contrapartes 3D, lo que permite entrenar modelos 3D sin utilizar imágenes de entrenamiento. A pesar de su eficacia, los marcos de inteligencia artificial generativa 3D que utilizan el método SDS a menudo sufren de problemas de distorsión y sobresuavizado que obstaculizan la implementación práctica de la generación 3D de alta fidelidad.

Para abordar los problemas de sobresuavizado, el marco de LucidDreamer implementa un enfoque de Coincidencia de Puntuación de Intervalo (ISM), un enfoque novedoso que utiliza dos mecanismos efectivos. En primer lugar, el enfoque ISM emplea el método de inversión DDIM para mitigar el efecto de promedio causado por inconsistencias en la verdad terrestre pseudo, produciendo una trayectoria de difusión invertible. En segundo lugar, en lugar de hacer coincidir las imágenes renderizadas por el modelo 3D con las verdades terrestres pseudo, el método ISM hace coincidir las imágenes entre dos pasos de intervalo en la trayectoria de difusión, lo que ayuda a evitar un alto error de reconstrucción al evitar la reconstrucción en un solo paso. El uso de ISM sobre SDS resulta en un rendimiento consistente y altamente realista y detallado.

En general, el marco de LucidDreamer tiene como objetivo hacer las siguientes contribuciones en la inteligencia artificial generativa 3D

  1. Proporciona un análisis en profundidad del SDS, el concepto fundamental en los marcos de generación de texto a 3D, e identifica sus limitaciones clave de verdades terrestres pseudo de baja calidad, y proporciona una explicación para el efecto de sobresuavizado que enfrentan estos marcos de generación 3D.
  2. Para contrarrestar las limitaciones impuestas por el enfoque SDS, el marco de LucidDreamer introduce la Coincidencia de Puntuación de Intervalo, un enfoque novedoso que utiliza la coincidencia basada en intervalos y trayectorias de difusión invertibles para superar a SDS al producir salidas altamente realistas y detalladas.
  3. Logra un rendimiento de vanguardia al integrar el método ISM con el espolvoreo gaussiano 3D para superar a los métodos existentes para la generación de contenido 3D con bajos costos de entrenamiento.

Limitaciones del SDS

Como se mencionó anteriormente, el SDS es uno de los enfoques más populares para los modelos de generación de texto a 3D, y busca modos para el posterior condicional en el espacio latente de DDPM. El enfoque SDS también adopta un DDPM preentrenado para modelar el posterior condicional, y tiene como objetivo destilar las representaciones 3D para el posterior condicional que se logra minimizando la siguiente divergencia KL. Además, el enfoque SDS también reutiliza el objetivo de coincidencia de puntuación de ruido ponderado para el entrenamiento de DDP. El objetivo principal del enfoque SDS también se puede ver como hacer coincidir la vista del modelo 3D con la verdad terrestre pseudo estimada por el DDPM en un solo paso, aunque el proceso de destilación a menudo pasa por alto aspectos clave del componente DDPM, y la siguiente figura demuestra cómo un DDPM preentrenado tiende a predecir verdades terrestres pseudo con características inconsistentes y produce salidas de baja calidad durante el proceso de destilación.

Sin embargo, las direcciones de actualización en circunstancias indeseables se actualizan a representaciones 3D que en última instancia conducen a resultados sobresuavizados. Además, es digno de destacar que el componente DDPM es sensible a la entrada, y las características de la verdad terrestre pseudo cambian significativamente incluso con el más mínimo cambio en la entrada. Además, la aleatoriedad en la pose de la cámara y el componente de ruido de las entradas puede agregar a las fluctuaciones que son inevitables durante la destilación. Optimizar la entrada para verdades terrestres pseudo inconsistentes da como resultado resultados promedio de características. Lo que es más, el enfoque SDS obtiene verdades terrestres pseudo con una predicción de un solo paso para todos los intervalos de tiempo, y no tiene en cuenta las limitaciones de un componente DDPM de un solo paso que no pueden producir salidas de alta calidad, lo que indica que destilar activos 3D o imágenes con un componente SDS puede no ser el enfoque más ideal.

LucidDreamer: Metodología y Funcionamiento

El marco de LucidDreamer no solo introduce el enfoque ISM, sino que también se basa en los conocimientos de otros marcos, incluidos los modelos de generación de texto a 3D, los modelos de difusión y los marcos de representación 3D diferenciables. Con eso dicho, analicemos en detalle la arquitectura y la metodología del marco de LucidDreamer.

Coincidencia de Puntuación de Intervalo o ISM

Los problemas de sobresuavizado y salidas de baja calidad que enfrentan la mayoría de los marcos de generación de texto a 3D se pueden deber a su uso del enfoque SDS que busca hacer coincidir la verdad terrestre pseudo con las representaciones 3D, que es inconsistente y a menudo de baja calidad. Para contrarrestar los problemas que enfrenta el SDS, el marco de LucidDreamer introduce la Coincidencia de Puntuación de Intervalo o ISM, un enfoque novedoso que tiene dos etapas de funcionamiento. En la primera etapa, el componente ISM obtiene verdades terrestres pseudo más consistentes durante la destilación, independientemente de la aleatoriedad en las posiciones de la cámara y el ruido. En la segunda etapa, el marco genera verdades terrestres pseudo de mejor calidad.

Otra limitación importante del SDS es la generación de verdades terrestres pseudo con una predicción de un solo paso para todos los intervalos de tiempo, lo que hace que sea desafiante garantizar verdades terrestres pseudo de alta calidad, y forma la base para mejorar la calidad visual de las verdades terrestres pseudo. De manera similar, el objetivo del SDS se puede ver como hacer coincidir la vista del modelo 3D con la verdad terrestre pseudo estimada por el DDPM en un solo paso, aunque el proceso de destilación pasa por alto un aspecto crítico del componente DDPM, es decir, produce verdades terrestres pseudo de baja calidad con características inconsistentes durante el proceso de destilación.

En general, el componente ISM promete ofrecer varias ventajas sobre los métodos anteriores utilizados en los modelos de generación de texto a 3D. En primer lugar, gracias a la capacidad de ISM para proporcionar verdades terrestres pseudo consistentes y de alta calidad, es capaz de producir salidas de destilación de alta fidelidad con estructuras más finas y detalles más ricos, lo que elimina la necesidad de una gran escala de orientación y mejora la flexibilidad para la creación de contenido 3D. En segundo lugar, la transición del enfoque SDS al enfoque ISM tiene un overhead computacional marginal, especialmente since el enfoque ISM no compromete la eficiencia general, aunque requiere costos computacionales adicionales para las inversiones DDIM.

La figura anterior demuestra el funcionamiento del enfoque ISM y proporciona una visión general de la arquitectura del marco de LucidDreamer. El marco inicializa primero el espolvoreo gaussiano, es decir, las representaciones 3D, utilizando un generador de texto a 3D preentrenado con una llamada. Luego, se incorpora con un componente DDPM 2D preentrenado para perturbar vistas aleatorias a trayectorias latentes incondicionales ruidosas utilizando inversiones DDIM, y luego actualiza con la puntuación de intervalo. Gracias a su arquitectura, el núcleo de la optimización del componente ISM se centra en actualizar las representaciones 3D hacia verdades terrestres pseudo de alta calidad y consistentes en características, aunque computacionalmente amigables. Este principio es lo que permite que ISM se alinee con los objetivos fundamentales del enfoque SDS al mismo tiempo que refina el método existente.

Inversión DDIM

El marco de LucidDreamer tiene como objetivo producir verdades terrestres pseudo más consistentes en alineación con las representaciones 3D. Por lo tanto, en lugar de producir representaciones 3D, el marco de LucidDreamer emplea el enfoque de inversión DDIM para predecir representaciones 3D latentes de ruido y predecir una trayectoria latente de ruido invertible de manera iterativa. Además, es gracias a la invertibilidad de la inversión DDIM que el marco de LucidDreamer puede aumentar significativamente la consistencia de la verdad terrestre pseudo para todos los intervalos de tiempo.

Tubería de Generación Avanzada

El marco de LucidDreamer también introduce una tubería avanzada, además de ISM, para explorar los factores que afectan la calidad visual de la generación de texto a 3D, e introduce el espolvoreo gaussiano 3D o 3DGS como su modelo de generación 3D y generación de nubes de puntos 3D para la inicialización.

Espolvoreo Gaussiano 3D

Los trabajos existentes han indicado que aumentar el tamaño del lote y la resolución de renderizado para el entrenamiento mejora significativamente la calidad visual. Sin embargo, la mayoría de las representaciones 3D aprendidas adoptadas para la generación de texto a 3D son consumidoras de tiempo y memoria. Por otro lado, el enfoque de espolvoreo gaussiano 3D proporciona resultados eficientes en la optimización y el renderizado, lo que permite que la tubería de generación avanzada en el marco de LucidDreamer logre un gran tamaño de lote y una resolución de renderizado alta, incluso cuando opera con recursos computacionales limitados.

Inicialización

La mayoría de los marcos de generación de texto a 3D de vanguardia inicializan sus representaciones 3D con geometrías limitadas como círculos, cajas o cilindros, lo que a menudo resulta en salidas no deseadas en objetos no simétricos axiales. Por otro lado, como el marco de LucidDreamer introduce el espolvoreo gaussiano 3D como representaciones 3D, el marco puede adoptar varios marcos generativos de texto a puntos de manera natural para generar una inicialización burda con entradas humanas. La estrategia de inicialización en última instancia aumenta significativamente la velocidad de convergencia.

LucidDreamer: Experimentos y Resultados

Generación de Texto a 3D

La figura anterior demuestra los resultados generados por el modelo de LucidDreamer con el enfoque de difusión estable original, mientras que la siguiente figura habla sobre los resultados generados en diferentes puntos de ajuste finos.

Como se puede ver, el marco de LucidDreamer es capaz de generar contenido 3D altamente consistente utilizando el texto de entrada y las pistas semánticas. Además, con el uso de ISM, el marco de LucidDreamer genera imágenes intrincadas y más realistas mientras evita problemas comunes como la sobresaturación o el sobresuavizado, y sobresale en la generación de objetos comunes, así como en la creación de contenido creativo.

Generalización de ISM

Para evaluar la generalización de ISM, se realiza una comparación entre ISM y el enfoque SDS en representaciones explícitas e implícitas, y los resultados se demuestran en la siguiente imagen.

Comparación Cualitativa

Para analizar la eficiencia cualitativa del marco de LucidDreamer, se compara con los modelos de vanguardia actuales, y para garantizar una comparación justa, se utiliza el marco de Difusión Estable 2.1 para la destilación, y los resultados se demuestran en la siguiente imagen. Como se puede ver, el marco entrega resultados de alta fidelidad y geométricamente precisos mientras consume menos recursos y tiempo.

Además, para proporcionar una evaluación más completa, los desarrolladores también realizan un estudio de usuario. La evaluación selecciona 28 llamadas y utiliza diferentes enfoques de generación de texto a 3D en cada llamada para generar objetos. Los resultados se clasifican por los usuarios en función del grado de alineación con la llamada de entrada y su fidelidad.

LucidDreamer: Aplicaciones

Debido a su rendimiento excepcional en una amplia variedad de tareas de generación de texto a 3D, el marco de LucidDreamer tiene varias aplicaciones potenciales, incluida la generación de avatares cero-disparo, la generación de texto a 3D personalizada y la edición cero-disparo 2D y 3D.

La imagen superior izquierda demuestra el potencial de LucidDreamer en tareas de edición 2D y 3D cero-disparo, mientras que las imágenes inferiores izquierdas demuestran la capacidad del marco para generar salidas de texto a 3D personalizadas con LoRA, mientras que la imagen de la derecha muestra la capacidad del marco para generar avatares 3D.

Pensamientos Finales

En este artículo, hemos hablado sobre LucidDreamer, un enfoque novedoso que utiliza el método de Coincidencia de Puntuación de Intervalo para superar el problema de sobresuavizado, y discutimos la arquitectura del modelo y su rendimiento en comparación con los marcos generativos de texto a 3D de vanguardia. También hemos hablado sobre cómo el enfoque SDS, un enfoque común implementado en la mayoría de los modelos de generación de texto a 3D de vanguardia, a menudo resulta en el sobresuavizado de las imágenes generadas, y cómo el marco de LucidDreamer contrarresta este problema al introducir un nuevo enfoque, el enfoque de Coincidencia de Puntuación de Intervalo, para generar imágenes 3D de alta fidelidad y más realistas. Los resultados y la evaluación indican la efectividad del marco de LucidDreamer en una amplia variedad de tareas de generación 3D, y cómo el marco ya supera a los modelos generativos 3D actuales de vanguardia. El rendimiento excepcional del marco abre el camino a una amplia variedad de aplicaciones prácticas, como se ha discutido anteriormente.

Un ingeniero por profesión, un escritor por corazón. Kunal es un escritor técnico con un profundo amor y comprensión de la IA y el ML, dedicado a simplificar conceptos complejos en estos campos a través de su documentación atractiva e informativa.