Modelos y plataformas de IA
Paint3D: Modelo de Difusión sin Iluminación para Generación de Imágenes
El rápido desarrollo de los modelos generativos de IA, especialmente los modelos generativos de IA profundos, ha avanzado significativamente las capacidades en la generación de lenguaje natural, generación de 3D, generación de imágenes y síntesis de voz. Estos modelos han revolucionado la producción de 3D en diversas industrias. Sin embargo, muchos enfrentan un desafío: su cableado complejo y las mallas generadas a menudo no son compatibles con las tuberías de renderizado tradicionales como el Renderizado Basado en Física (PBR). Los modelos basados en difusión, notablemente sin texturas de iluminación, demuestran una generación impresionante de activos de 3D diversificados, mejorando los marcos de 3D en la creación de películas, juegos y AR/VR.
Este artículo presenta Paint3D, un marco novedoso para producir mapas de texturas de 2K UV diversificados y de alta resolución para mallas de 3D sin texturas, condicionadas en entradas visuales o textuales. El desafío principal de Paint3D es generar texturas de alta calidad sin iluminación incrustada, lo que permite la reedición o la reiluminación dentro de las tuberías de gráficos modernas. Utiliza un modelo de difusión de 2D preentrenado para la fusión de texturas multi-vista, generando mapas de texturas iniciales gruesas. Sin embargo, estos mapas a menudo muestran artefactos de iluminación y áreas incompletas debido a las limitaciones del modelo de 2D en la desactivación de los efectos de iluminación y la representación completa de las formas de 3D. Analizaremos el funcionamiento, la arquitectura y las comparaciones de Paint3D con otros marcos generativos de IA. Comencemos.
Paint3D: Una Introducción
Las capacidades de los modelos de IA generativos de profundidad en la generación de lenguaje natural, generación de 3D y síntesis de imágenes son bien conocidas y se implementan en aplicaciones de la vida real, revolucionando la industria de la generación de 3D. A pesar de sus capacidades notables, los marcos de IA generativos modernos generan mallas que se caracterizan por un cableado complejo y texturas de iluminación caóticas que a menudo son incompatibles con las tuberías de renderizado convencionales, incluyendo PBR o Renderizado Basado en Física. Al igual que los modelos de IA generativos de profundidad, la síntesis de texturas también ha avanzado rápidamente, especialmente en la utilización de modelos de difusión de 2D. Los modelos de síntesis de texturas emplean modelos de difusión de profundidad a imagen preentrenados efectivamente para utilizar condiciones de texto para generar texturas de alta calidad. Sin embargo, estos enfoques enfrentan problemas con texturas pre-iluminadas que pueden afectar significativamente los renderizados finales del entorno de 3D e introducir errores de iluminación cuando las luces se cambian dentro de los flujos de trabajo comunes, como se demuestra en la siguiente imagen.

Como se puede observar, la textura con iluminación libre funciona en sincronía con las tuberías de renderizado tradicionales, entregando resultados precisos, mientras que la textura con pre-iluminación incluye sombras inapropiadas cuando se aplica la reiluminación. Por otro lado, los marcos de generación de texturas entrenados en datos de 3D ofrecen un enfoque alternativo en el que el marco genera las texturas al comprender la geometría completa de un objeto de 3D específico. Aunque pueden entregar mejores resultados, los marcos de generación de texturas entrenados en datos de 3D carecen de capacidades de generalización que obstaculizan su capacidad para aplicar el modelo a objetos de 3D fuera de sus datos de entrenamiento.
Los modelos actuales de generación de texturas enfrentan dos desafíos críticos: utilizar orientación de imagen o prompts diversos para lograr un grado más amplio de generalización en diferentes objetos, y el segundo desafío es la eliminación de la iluminación acoplada en los resultados obtenidos del pre-entrenamiento. Las texturas pre-iluminadas pueden interferir potencialmente con los resultados finales de los objetos texturizados dentro de los motores de renderizado, y como los modelos de difusión de 2D preentrenados proporcionan resultados de 2D solo en el dominio de la vista, carecen de una comprensión integral de las formas que conduce a la incapacidad de mantener la consistencia de la vista para objetos de 3D.
Debido a los desafíos mencionados anteriormente, el marco de Paint3D intenta desarrollar un modelo de difusión de texturas de dos etapas para objetos de 3D que se generaliza a diferentes modelos generativos preentrenados y preserva la consistencia de la vista mientras aprende la generación de texturas sin iluminación.
Paint3D es un modelo de generación de texturas de dos etapas, de grueso a fino, que tiene como objetivo aprovechar la sólida orientación de prompts y las capacidades de generación de imágenes de los modelos de IA generativos preentrenados para texturizar objetos de 3D. En la primera etapa, el marco de Paint3D primero muestra imágenes multi-vista desde un modelo de difusión de imagen de 2D preentrenado progresivamente para permitir la generalización de resultados de texturas de alta calidad y ricas desde prompts diversos. El modelo luego genera un mapa de textura inicial proyectando estas imágenes hacia la superficie de la malla. En la segunda etapa, el modelo se centra en generar texturas sin iluminación implementando enfoques empleados por modelos de difusión especializados en la eliminación de influencias de iluminación y refinamiento de regiones incompletas con conocimiento de forma. A lo largo del proceso, el marco de Paint3D es capaz de generar consistentemente texturas de alta calidad de 2K semánticamente, y elimina los efectos de iluminación intrínsecos.

En resumen, Paint3D es un modelo generativo de IA novedoso de grueso a fino que tiene como objetivo producir mapas de texturas de 2K UV diversificados, sin iluminación y de alta resolución para mallas de 3D sin texturas, para lograr un rendimiento de estado de la técnica en la texturización de objetos de 3D con diferentes entradas condicionales, incluyendo texto e imágenes, y ofrece una ventaja significativa para tareas de síntesis y edición gráfica.
Metodología y Arquitectura
El marco de Paint3D genera y refina mapas de texturas progresivamente para generar mapas de texturas diversificados y de alta calidad para modelos de 3D utilizando entradas condicionales deseadas, incluyendo imágenes y prompts, como se demuestra en la siguiente imagen.

En la etapa de grueso, el modelo de Paint3D utiliza modelos de difusión de imagen de 2D preentrenados para mostrar imágenes multi-vista, y luego crea los mapas de textura iniciales proyectando estas imágenes hacia la superficie de la malla. En la segunda etapa, es decir, la etapa de refinamiento, el modelo de Paint3D utiliza un proceso de difusión en el espacio UV para mejorar los mapas de textura gruesos, logrando así una función de alta calidad, de inpainting y sin iluminación que garantiza el atractivo visual y la completitud de la textura final.
Etapa 1: Generación de Textura Gruesa Progresiva
En la etapa de generación de textura gruesa progresiva, el modelo de Paint3D genera un mapa de textura UV grueso para las mallas de 3D que utilizan un modelo de difusión de imagen de 2D con conocimiento de profundidad preentrenado. Para ser más específicos, el modelo primero utiliza diferentes vistas de cámara para renderizar el mapa de profundidad, luego utiliza condiciones de profundidad para mostrar imágenes desde el modelo de difusión de imagen, y luego proyecta estas imágenes hacia la superficie de la malla. El marco realiza los enfoques de renderizado, muestreo y proyección alternativamente para mejorar la consistencia de las mallas de textura, lo que ayuda en la generación progresiva del mapa de textura.
El modelo comienza generando la textura de la región visible con las vistas de cámara enfocadas en la malla de 3D, y renderiza la malla de 3D a un mapa de profundidad desde la primera vista. El modelo luego muestra una imagen de textura para una condición de apariencia y una condición de profundidad. El modelo luego proyecta la imagen hacia la malla de 3D. Para las vistas, el modelo de Paint3D ejecuta un enfoque similar pero con un cambio leve, realizando el proceso de muestreo de textura utilizando un enfoque de pintura de imagen. Además, el modelo toma en cuenta las regiones texturizadas de las vistas anteriores, lo que permite que el proceso de renderizado no solo produzca una imagen de profundidad, sino también una imagen RGB parcialmente coloreada con una máscara no coloreada en la vista actual.
El modelo luego utiliza un modelo de inpainting de imagen con conocimiento de profundidad con un codificador de inpainting para rellenar el área no coloreada dentro de la imagen RGB. El modelo luego genera el mapa de textura desde la vista proyectando la imagen inpintada hacia la malla de 3D bajo la vista actual, lo que permite que el modelo genere el mapa de textura progresivamente, y llegue a la estructura completa del mapa de textura grueso. Finalmente, el modelo extiende el proceso de muestreo de textura a una escena u objeto con múltiples vistas. Para ser más específicos, el modelo utiliza un par de cámaras para capturar dos mapas de profundidad durante el muestreo de textura inicial desde vistas simétricas. El modelo luego combina los dos mapas de profundidad y compone una cuadrícula de profundidad. El modelo reemplaza la imagen de profundidad única con la cuadrícula de profundidad para realizar el muestreo de textura con conocimiento de profundidad multi-vista.
Etapa 2: Refinamiento de Textura en el Espacio UV
Aunque la apariencia de los mapas de textura gruesos es lógica, enfrenta algunos desafíos como agujeros de textura causados durante el proceso de renderizado por auto-occlusión o sombras de iluminación debido a la participación de modelos de difusión de imagen de 2D. El modelo de Paint3D tiene como objetivo realizar un proceso de difusión en el espacio UV sobre la base de un mapa de textura grueso, intentando mitigar los problemas y mejorar aún más el atractivo visual del mapa de textura durante el refinamiento de la textura. Sin embargo, refinar el modelo de difusión de imagen mainstream con los mapas de textura en el espacio UV introduce discontinuidad de textura, ya que el mapa de textura se genera mediante el mapeo UV de la textura de la superficie de 3D que corta la textura continua en una serie de fragmentos individuales en el espacio UV. Como resultado de la fragmentación, el modelo encuentra dificultades para aprender las relaciones de adyacencia de 3D entre los fragmentos, lo que conduce a problemas de discontinuidad de textura.
El modelo refina el mapa de textura en el espacio UV realizando el proceso de difusión bajo la guía de la información de adyacencia de los fragmentos de textura. Es importante destacar que en el espacio UV, es el mapa de posición el que representa la información de adyacencia de 3D de los fragmentos de textura, con el modelo tratando cada elemento no de fondo como una coordenada de punto de 3D. Durante el proceso de difusión, el modelo fusiona la información de adyacencia de 3D agregando un codificador de posición individual al modelo de difusión de imagen preentrenado. El nuevo codificador se asemeja al diseño del marco ControlNet y tiene la misma arquitectura que el codificador implementado en el modelo de difusión de imagen, con la capa de convección cero que conecta los dos. Además, el modelo de difusión de textura se entrena en un conjunto de datos que comprende mapas de textura y mapas de posición, y el modelo aprende a predecir el ruido agregado al latente ruidoso. El modelo luego optimiza el codificador de posición y congela el desenojador entrenado para su tarea de difusión de imagen.
El modelo luego utiliza simultáneamente la posición del codificador condicional y otros codificadores para realizar tareas de refinamiento en el espacio UV. En este respecto, el modelo tiene dos capacidades de refinamiento: UVHD o UV Alta Definición y UV inpainting. El método UVHD está estructurado para mejorar el atractivo visual y la estética del mapa de textura. Para lograr UVHD, el modelo utiliza un codificador de mejora de imagen y un codificador de posición con el modelo de difusión. El modelo utiliza el método de UV inpainting para rellenar los agujeros de textura dentro del plano UV, que es capaz de evitar problemas de auto-occlusión generados durante el renderizado. En la etapa de refinamiento, el modelo de Paint3D primero realiza UV inpainting y luego realiza UVHD para generar el mapa de textura refinado final. Al integrar los dos métodos de refinamiento, el marco de Paint3D es capaz de producir mapas de textura UV completos, diversificados, de alta resolución y sin iluminación.
Paint3D: Experimentos y Resultados
El modelo de Paint3D emplea el modelo de texto a imagen de Stable Diffusion para ayudarlo con tareas de generación de texturas, mientras que emplea el componente de codificador de imagen para manejar condiciones de imagen. Para mejorar aún más su control sobre controles condicionales como inpainting de imagen, profundidad y definición alta de imagen, el marco de Paint3D emplea codificadores de dominio de ControlNet. El modelo se implementa en el marco de PyTorch, con renderizado y proyecciones de textura implementados en Kaolin.
Comparación de Texto a Texturas
Para analizar su rendimiento, comenzamos evaluando el efecto de generación de texturas de Paint3D cuando se condiciona utilizando prompts textuales, y lo comparamos con marcos de estado de la técnica, incluyendo Text2Tex, TEXTure y LatentPaint. Como se puede observar en la siguiente imagen, el marco de Paint3D no solo sobresale en la generación de detalles de textura de alta calidad, sino que también sintetiza un mapa de textura sin iluminación de manera razonable.

En comparación, el marco de Latent-Paint es propenso a generar texturas borrosas que resultan en efectos visuales subóptimos. Por otro lado, aunque el marco de TEXTure genera texturas claras, carece de suavidad y exhibe costuras y empalmes notables. Finalmente, el marco de Text2Tex genera texturas suaves de manera notable, pero falla en replicar el rendimiento para generar texturas finas con detalles intrincados.
La siguiente imagen compara el marco de Paint3D con marcos de estado de la técnica de manera cuantitativa.

Como se puede observar, el marco de Paint3D supera a todos los modelos existentes, y por un margen significativo, con una mejora de casi el 30% en la línea de base de FID y aproximadamente el 40% en la línea de base de KID. La mejora en las puntuaciones de las líneas de base de FID y KID demuestra la capacidad de Paint3D para generar texturas de alta calidad en objetos y categorías diversificados.
Comparación de Imagen a Textura
Para generar las capacidades generativas de Paint3D utilizando prompts visuales, utilizamos el modelo de TEXTure como la línea de base. Como se mencionó anteriormente, el modelo de Paint3D emplea un codificador de imagen obtenido del modelo de texto a imagen de Stable Diffusion. Como se puede ver en la siguiente imagen, el marco de Paint3D sintetiza texturas exquisitas de manera notable, y aún es capaz de mantener una alta fidelidad con respecto a la condición de imagen.

Por otro lado, el marco de TEXTure es capaz de generar una textura similar a Paint3D, pero no logra representar los detalles de la textura en la condición de imagen de manera precisa. Además, como se demuestra en la siguiente imagen, el marco de Paint3D entrega mejores puntuaciones de FID y KID en comparación con el marco de TEXTure, con la primera disminuyendo de 40.83 a 26.86, mientras que la segunda muestra una disminución de 9.76 a 4.94.

Pensamientos Finales
En este artículo, hemos hablado sobre Paint3D, un marco novedoso de grueso a fino capaz de producir mapas de texturas de 2K UV diversificados, sin iluminación y de alta resolución para mallas de 3D sin texturas, condicionadas en entradas visuales o textuales. El aspecto destacado del marco de Paint3D es que es capaz de generar texturas de alta resolución de 2K sin iluminación que son consistentes semánticamente sin estar condicionadas en entradas de imagen o texto. Debido a su enfoque de grueso a fino, el marco de Paint3D produce mapas de textura sin iluminación, diversificados y de alta resolución, y entrega un mejor rendimiento que los marcos de estado de la técnica actuales.












