Modelos y plataformas de IA
DreamCraft3D: Generación Jerárquica 3D con Difusión de Puntuación de Arranque
Los modelos de inteligencia artificial generativa han sido un tema de discusión dentro de la industria de la IA durante un tiempo. El reciente éxito de los modelos generativos 2D ha sentado las bases para los métodos que utilizamos para crear contenido visual hoy en día. Aunque la comunidad de la IA ha logrado un éxito notable con los modelos generativos 2D, la generación de contenido 3D sigue siendo un desafío importante para los marcos de la IA generativa. Esto es especialmente cierto ya que la demanda de contenido generado 3D alcanza un máximo histórico, impulsada por una amplia gama de juegos visuales, aplicaciones, realidad virtual y incluso cine. Es importante destacar que, si bien existen marcos de la IA generativa 3D que entregan resultados aceptables para ciertas categorías y tareas, no pueden generar objetos 3D de manera eficiente. Esta deficiencia se puede atribuir a la falta de datos 3D extensos para entrenar los marcos. Recientemente, los desarrolladores han propuesto aprovechar la orientación ofrecida por los modelos de la IA generativa de texto a imagen preentrenados, un enfoque que ha mostrado resultados prometedores.
En este artículo, discutiremos el marco de DreamCraft3D, un modelo jerárquico para generar contenido 3D que produce objetos 3D coherentes y de alta calidad. El marco de DreamCraft3D utiliza una imagen de referencia 2D para guiar la etapa de escultura de geometría, mejorando la textura con un enfoque en abordar los problemas de coherencia encontrados por los marcos o métodos actuales. Además, el marco de DreamCraft3D emplea un modelo de difusión dependiente de la vista para la destilación de puntuación, lo que ayuda a esculpir la geometría que contribuye a la renderización coherente.
Exploraremos más a fondo el marco de DreamCraft3D para la generación de contenido 3D. Además, examinaremos el concepto de aprovechar los modelos de texto a imagen (T2I) preentrenados para la generación de contenido 3D y veremos cómo el marco de DreamCraft3D busca utilizar este enfoque para generar contenido 3D realista.
DreamCraft3D: Una Introducción
DreamCraft3D es una tubería jerárquica para generar contenido 3D. El marco de DreamCraft3D intenta aprovechar un marco generativo de texto a imagen (T2I) de última generación para crear imágenes 2D de alta calidad utilizando una prompt de texto. El enfoque permite que el marco de DreamCraft3D maximice las capacidades de los modelos de difusión 2D de última generación para representar la semántica visual descrita en la prompt de texto, mientras retiene la libertad creativa ofrecida por estos marcos generativos de la IA 2D. La imagen generada se convierte entonces en 3D con la ayuda de fases de impulso de textura geométrica y escultura geométrica, y se aplican técnicas especializadas en cada etapa con la ayuda de descomponer el problema.
Para la geometría, el marco de DreamCraft3D se centra intensamente en la estructura 3D global y la coherencia multi-vista, lo que permite compromisos en las texturas detalladas de las imágenes. Una vez que el marco elimina los problemas relacionados con la geometría, cambia su enfoque a optimizar texturas coherentes y realistas implementando una difusión 3D que arranca el enfoque de optimización 3D. Hay dos consideraciones de diseño clave para las dos fases de optimización, a saber, la Escultura Geométrica y el Impulso de Textura.
Con todo lo dicho, sería seguro describir el DreamCraft3D como un marco generativo de la IA que aprovecha una tubería de generación de contenido 3D jerárquica para transformar esencialmente imágenes 2D en sus contrapartes 3D mientras mantiene la coherencia 3D holística.
Aprovechando Modelos Preentrenados de Texto a Imagen (T2I)
La idea de aprovechar modelos preentrenados de texto a imagen (T2I) para generar contenido 3D se introdujo por primera vez por el marco de DreamFusion en 2022. El marco de DreamFusion intentó imponer una pérdida de muestreo de destilación de puntuación (SDS) para optimizar el marco 3D de tal manera que las renderizaciones en puntos de vista aleatorios se alinearan con las distribuciones de imagen condicionadas por texto interpretadas por un marco de difusión de texto a imagen eficiente. Aunque el enfoque de DreamFusion entregó resultados decentes, hubo dos problemas principales, la borrosidad y la sobresaturación. Para abordar estos problemas, trabajos recientes implementan estrategias de optimización por etapas para mejorar la pérdida de destilación 2D, lo que conduce a imágenes 3D generadas de mejor calidad y más realistas.
Sin embargo, a pesar del éxito reciente de estos marcos, no pueden igualar la capacidad de los marcos generativos 2D para sintetizar contenido complejo. Además, estos marcos a menudo están plagados del “Problema de Janus”, una condición en la que las renderizaciones 3D que parecen ser plausibles individualmente, muestran inconsistencias estilísticas y semánticas cuando se examinan en su conjunto.
Para abordar los problemas que enfrentan los trabajos anteriores, el marco de DreamCraft3D explora la posibilidad de utilizar una tubería de generación de contenido 3D jerárquica y busca inspiración en el proceso artístico manual en el que un concepto se esboza primero en un boceto 2D, después de lo cual el artista esculpe la geometría rugosa, refina los detalles geométricos y pinta texturas de alta fidelidad. Siguiendo el mismo enfoque, el marco de DreamCraft3D divide las tareas exhaustivas de generación de contenido o imagen 3D en varias etapas manejables. Comienza generando una imagen 2D de alta calidad utilizando una prompt de texto y procede a utilizar el impulso de textura y la escultura geométrica para elevar la imagen a las etapas 3D. Dividir el proceso en etapas posteriores ayuda al marco de DreamCraft2D a maximizar el potencial de la generación jerárquica, lo que resulta en una generación de imágenes 3D de calidad superior.
En la primera etapa, el marco de DreamCraft3D despliega la escultura geométrica para producir formas geométricas 3D coherentes y plausibles utilizando la imagen 2D como referencia. Además, la etapa no solo utiliza la pérdida de SDS para las pérdidas fotométricas y las vistas nuevas en la vista de referencia, sino que el marco también introduce una serie de estrategias para promover la coherencia geométrica. El marco busca aprovechar el Zero-1-to-3, un modelo de traducción de imagen condicionada por la vista, para utilizar la imagen de referencia para modelar la distribución de las vistas nuevas. Además, el marco también transita de la representación de superficie implícita a la representación de malla para el refinamiento geométrico de grano grueso a fino.
La segunda etapa del marco de DreamCraft3D utiliza un enfoque de destilación de puntuación con arranque para impulsar las texturas de la imagen, ya que los modelos de difusión condicionados por la vista actuales se entrenan con una cantidad limitada de datos 3D, lo que hace que a menudo luchen por igualar el rendimiento o la fidelidad de los modelos de difusión 2D. Gracias a esta limitación, el marco de DreamCraft3D ajusta el modelo de difusión de acuerdo con las imágenes de vista múltiple de la instancia 3D que se está optimizando, y este enfoque ayuda al marco a aumentar las texturas 3D mientras mantiene la coherencia de la vista. Cuando el modelo de difusión se entrena en estas renderizaciones de vista múltiple, proporciona una mejor orientación para la optimización de la textura 3D, y este enfoque ayuda al marco de DreamCraft3D a lograr un nivel increíble de detalle de textura mientras mantiene la coherencia de la vista.

Como se puede observar en las imágenes anteriores, el marco de DreamCraft3D es capaz de producir imágenes y contenido 3D creativos con texturas realistas y estructuras geométricas intrincadas. En la primera imagen, es el cuerpo de Son Goku, un personaje de anime mezclado con la cabeza de un jabalí salvaje en carrera, mientras que la segunda imagen muestra a un Beagle vestido con el atuendo de un detective. A continuación, se presentan algunos ejemplos adicionales.

DreamCraft3D: Funcionamiento y Arquitectura
El marco de DreamCraft3D intenta aprovechar un marco generativo de texto a imagen (T2I) de última generación para crear imágenes 2D de alta calidad utilizando una prompt de texto. El enfoque permite que el marco de DreamCraft3D maximice las capacidades de los modelos de difusión 2D de última generación para representar la semántica visual descrita en la prompt de texto, mientras retiene la libertad creativa ofrecida por estos marcos generativos de la IA 2D. La imagen generada se convierte entonces en 3D con la ayuda de fases de impulso de textura geométrica y escultura geométrica, y se aplican técnicas especializadas en cada etapa con la ayuda de descomponer el problema. La siguiente imagen resume brevemente el funcionamiento del marco de DreamCraft3D.

Veamos con más detalle las consideraciones de diseño clave para las fases de impulso de textura y escultura geométrica.
Escultura Geométrica
La Escultura Geométrica es la primera etapa en la que el marco de DreamCraft3D intenta crear un modelo 3D que se alinee con la apariencia de la imagen de referencia en la misma vista de referencia, mientras garantiza la máxima plausibilidad incluso bajo diferentes ángulos de vista. Para garantizar la máxima plausibilidad, el marco utiliza la pérdida de SDS para fomentar la renderización de imágenes plausibles para cada vista individual muestreada que un modelo de difusión preentrenado pueda reconocer. Además, para utilizar la orientación de la imagen de referencia de manera efectiva, el marco penaliza las diferencias fotométricas entre la referencia y las imágenes renderizadas en la vista de referencia, y la pérdida se calcula solo dentro de la región delantera de la vista. Además, para fomentar la escasez de la escena, el marco también implementa una pérdida de máscara que renderiza la silueta. A pesar de esto, mantener la apariencia y la semántica a través de las vistas traseras de manera coherente sigue siendo un desafío, por lo que el marco emplea enfoques adicionales para producir geometría detallada y coherente.
Difusión 3D Consciente
Los métodos de optimización 3D que utilizan la supervisión por vista sola están subdeterminados, lo que es la razón principal por la que el marco de DreamCraft3D utiliza el Zero-1-to-3, un modelo de difusión condicionado por la vista, ya que el marco de Zero-1-to-3 ofrece una conciencia de vista mejorada ya que se ha entrenado en una mayor escala de activos de datos 3D. Además, el marco de Zero-1-to-3 es un modelo de difusión afinado que hallucina la imagen en relación con la pose de la cámara dada la imagen de referencia.
Entrenamiento de Vista Progresiva
Derivar vistas libres directamente en 360 grados puede generar artefactos geométricos o discrepancias, como una pierna extra en la silla, un evento que puede ser atribuido a la ambigüedad inherente de una sola imagen de referencia. Para abordar este obstáculo, el marco de DreamCraft3D amplía las vistas de entrenamiento de manera progresiva, después de lo cual la geometría bien establecida se propaga gradualmente para obtener resultados en 360 grados.
Anulación de Paso de Difusión en el Tiempo
El marco de DreamCraft3D emplea una estrategia de anulación de paso de difusión en el tiempo para alinearse con la progresión de grano grueso a fino de la optimización 3D. Al comienzo del proceso de optimización, el marco da prioridad a muestrear un paso de difusión más grande, con el fin de proporcionar la estructura global. A medida que el marco procede con el proceso de entrenamiento, anula linealmente el rango de muestreo durante el transcurso de cientos de iteraciones. Gracias a la estrategia de anulación, el marco logra establecer una geometría global plausible durante los primeros pasos de optimización antes de refinar los detalles estructurales.
Mejora Estructural Detallada
El marco de DreamCraft3D optimiza inicialmente una representación de superficie implícita para establecer una estructura gruesa. El marco utiliza este resultado y lo combina con una malla tetraédrica deformable (DMTet) para inicializar una representación de malla 3D texturizada, que disocia el aprendizaje de la textura y la geometría. Cuando el marco termina con la mejora estructural, el modelo puede preservar los detalles de alta frecuencia obtenidos de la imagen de referencia al refinar las texturas únicamente.
Impulso de Textura utilizando Muestreo de Puntuación con Arranque
Aunque la etapa de escultura geométrica se centra en aprender geometría detallada y coherente, puede desdibujar la textura en cierta medida, lo que puede ser el resultado de la dependencia del marco en un modelo de prioridad 2D que opera a una resolución gruesa, junto con la limitación de nitidez ofrecida por el modelo de difusión 3D. Además, los problemas de textura comunes, incluyendo la sobresaturación y el suavizado excesivo, surgen como resultado de una guía libre de clasificador grande.
El marco utiliza una pérdida de destilación de puntuación variacional (VSD) para aumentar la realidad de las texturas. El marco opta por un modelo de difusión estable durante esta fase para obtener gradientes de alta resolución. Además, el marco mantiene la malla tetraédrica fija para promover la renderización realista y optimizar la estructura general de la malla. Durante la etapa de aprendizaje, el marco de DreamCraft3D no utiliza el marco de Zero-1-to-3, ya que tiene un efecto adverso en la calidad de las texturas, y estas texturas inconsistentes pueden ser recurrentes, lo que lleva a salidas 3D extrañas.
Experimentos y Resultados
Para evaluar el rendimiento del marco de DreamCraft3D, se compara con los marcos actuales de última generación y se analizan los resultados cualitativos y cuantitativos.
Comparación con Modelos de Línea Base
Para evaluar el rendimiento, el marco de DreamCraft3D se compara con 5 marcos de última generación, incluyendo DreamFusion, Magic3D, ProlificDreamer, Magic123 y Make-it-3D. La prueba de referencia consta de 300 imágenes de entrada que son una mezcla de imágenes del mundo real y generadas por el marco de difusión estable. Cada imagen en la prueba de referencia tiene una prompt de texto, una mapa de profundidad predicha y una máscara alfa para el primer plano. El marco obtiene las prompts de texto para las imágenes reales de un marco de caption de imagen.
Análisis Cualitativo
La siguiente imagen compara el marco de DreamCraft3D con los modelos de línea base actuales, y como se puede ver, los marcos que dependen del enfoque de texto a 3D a menudo enfrentan problemas de coherencia de vista múltiple.

Por un lado, tienes el marco de ProlificDreamer que ofrece texturas realistas, pero no logra generar un objeto 3D plausible. Los marcos como el Make-it-3D que dependen de los métodos de imagen a 3D logran crear vistas frontales de alta calidad, pero no pueden mantener la geometría ideal para las imágenes. Las imágenes generadas por el marco de Magic123 ofrecen una mejor regularización geométrica, pero generan texturas y detalles geométricos sobresaturados y suavizados en exceso. En comparación con estos marcos, el marco de DreamCraft3D que utiliza un método de destilación de puntuación con arranque no solo mantiene la coherencia semántica, sino que también mejora la diversidad de imaginación en general.

Análisis Cuantitativo
Con el fin de generar imágenes 3D convincentes que no solo se asemejan a la imagen de referencia de entrada, sino que también transmiten semántica de manera coherente desde diversas perspectivas, las técnicas utilizadas por el marco de DreamCraft3D se comparan con los modelos de línea base, y el proceso de evaluación emplea cuatro métricas: PSNR y LPIPS para medir la fidelidad en la vista de referencia, Distancia Contextual para evaluar la congruencia a nivel de píxel, y CLIP para estimar la coherencia semántica. Los resultados se demuestran en la siguiente imagen.

Conclusión
En este artículo, hemos discutido DreamCraft3D, una tubería jerárquica para generar contenido 3D. El marco de DreamCraft3D intenta aprovechar un marco generativo de texto a imagen (T2I) de última generación para crear imágenes 2D de alta calidad utilizando una prompt de texto. Este enfoque permite que el marco de DreamCraft3D maximice las capacidades de los modelos de difusión 2D de última generación para representar la semántica visual descrita en la prompt de texto, mientras retiene la libertad creativa ofrecida por estos marcos generativos de la IA 2D. La imagen generada se convierte entonces en 3D con la ayuda de fases de impulso de textura geométrica y escultura geométrica, y se aplican técnicas especializadas en cada etapa con la ayuda de descomponer el problema. Como resultado de este enfoque, el marco de DreamCraft3D puede producir activos 3D de alta fidelidad y coherencia con texturas convincentes, visibles desde múltiples ángulos.












