Modelos e plataformas de IA
DreamCraft3D: Geração Hierárquica 3D Com Prior de Difusão Inicializada
Os modelos de IA gerativos têm sido um tópico de discussão dentro da indústria de IA por um tempo. O recente sucesso dos modelos gerativos 2D abriu caminho para os métodos que usamos para criar conteúdo visual hoje. Embora a comunidade de IA tenha alcançado um sucesso notável com modelos gerativos 2D, a geração de conteúdo 3D permanece um desafio significativo para os quadros de IA gerativos profundos. Isso é especialmente verdadeiro, pois a demanda por conteúdo 3D gerado atinge um nível recorde, impulsionada por uma ampla gama de jogos visuais, aplicativos, realidade virtual e até cinema. Vale a pena notar que, embora existam quadros de IA gerativos 3D que entregam resultados aceitáveis para certas categorias e tarefas, eles são incapazes de gerar objetos 3D de forma eficiente. Essa deficiência pode ser atribuída à falta de dados 3D extensivos para treinar os quadros. Recentemente, os desenvolvedores propuseram aproveitar a orientação oferecida por modelos de IA gerativos de texto-para-imagem pré-treinados, uma abordagem que mostrou resultados promissores.
Neste artigo, discutiremos o quadro DreamCraft3D, um modelo hierárquico para geração de conteúdo 3D que produz objetos 3D coerentes e de alta fidelidade de alta qualidade. O quadro DreamCraft3D usa uma imagem de referência 2D para orientar a etapa de escultura de geometria, aprimorando a textura com foco em resolver problemas de consistência encontrados pelos quadros ou métodos atuais. Além disso, o quadro DreamCraft3D emprega um modelo de difusão dependente de vista para amostragem de destilação de pontuação, auxiliando na escultura de geometria que contribui para a renderização coerente.
Iremos mergulhar mais profundamente no quadro DreamCraft3D para geração de conteúdo 3D. Além disso, exploraremos o conceito de aproveitar modelos de texto-para-imagem (T2I) pré-treinados para geração de conteúdo 3D e examinaremos como o quadro DreamCraft3D busca utilizar essa abordagem para gerar conteúdo 3D realista.
DreamCraft3D: Uma Introdução
O DreamCraft3D é um pipeline hierárquico para geração de conteúdo 3D. O quadro DreamCraft3D tenta aproveitar um quadro gerativo de texto-para-imagem (T2I) de ponta para criar imagens 2D de alta qualidade usando um prompt de texto. A abordagem permite que o quadro DreamCraft3D maximize as capacidades dos modelos de difusão 2D de ponta para representar as semânticas visuais descritas no prompt de texto, mantendo a liberdade criativa oferecida por esses quadros gerativos de IA 2D. A imagem gerada é então elevada para 3D com a ajuda de fases de aumento de textura geométrica e escultura geométrica, e técnicas especializadas são aplicadas em cada etapa com a ajuda da decomposição do problema.
Para a geometria, o quadro DreamCraft3D se concentra fortemente na estrutura 3D global e na consistência multi-vista, criando assim espaço para compromissos com as texturas detalhadas nas imagens. Uma vez que o quadro elimina os problemas relacionados à geometria, ele muda seu foco para otimizar texturas coerentes e realistas, implementando uma difusão 3D que inicializa a abordagem de otimização 3D. Existem duas considerações de design principais para as duas fases de otimização, nomeadamente a Escultura Geométrica e o Aumento de Textura.
Com tudo isso dito, seria seguro descrever o DreamCraft3D como um quadro gerativo de IA que aproveita um pipeline de geração de conteúdo 3D hierárquico para essencialmente transformar imagens 2D em suas contrapartes 3D, mantendo a consistência 3D holística.
Aproveitando Modelos Pré-Treinados de Texto-para-Imagem (T2I)
A ideia de aproveitar modelos pré-treinados de texto-para-imagem (T2I) para geração de conteúdo 3D foi introduzida pela primeira vez pelo quadro DreamFusion em 2022. O quadro DreamFusion tentou impor uma perda de amostragem de destilação de pontuação (SDS) para otimizar o quadro 3D de forma que as renderizações em pontos de vista aleatórios se alinhassem com as distribuições de imagem condicionadas por texto interpretadas por um quadro de difusão de texto-para-imagem eficiente. Embora a abordagem DreamFusion tenha entregado resultados decentes, havia dois problemas principais: embaçamento e super-saturação. Para lidar com esses problemas, trabalhos recentes implementam estratégias de otimização fase a fase para melhorar a perda de difusão 2D, o que leva a imagens 3D geradas de melhor qualidade e mais realistas.
No entanto, apesar do sucesso recente desses quadros, eles são incapazes de igualar a capacidade dos quadros gerativos 2D de sintetizar conteúdo complexo. Além disso, esses quadros frequentemente são afetados pelo “problema de Janus”, uma condição em que renderizações 3D que parecem plausíveis individualmente mostram inconsistências estilísticas e semânticas quando examinadas como um todo.
Para lidar com os problemas enfrentados por trabalhos anteriores, o quadro DreamCraft3D explora a possibilidade de usar um pipeline de geração de conteúdo 3D hierárquico e busca inspiração no processo artístico manual, no qual um conceito é primeiro escrito em um rascunho 2D, após o qual o artista esculpe a geometria bruta, refina os detalhes geométricos e pinta texturas de alta fidelidade. Seguindo a mesma abordagem, o quadro DreamCraft3D divide as tarefas exaustivas de geração de imagem ou conteúdo 3D em várias etapas gerenciáveis.
Na primeira etapa, o quadro DreamCraft3D implanta a escultura geométrica para produzir formas geométricas 3D consistentes e plausíveis usando a imagem 2D como referência. Além disso, a etapa não apenas usa a perda SDS para perdas fotométricas e vistas novas na vista de referência, mas o quadro também introduz uma ampla gama de estratégias para promover a consistência geométrica. O quadro visa aproveitar o Zero-1-to-3, um modelo de tradução de imagem condicionado por ponto de vista, para usar a imagem de referência para modelar a distribuição das vistas novas. Além disso, o quadro também transita de uma representação de superfície implícita para uma representação de malha para refinar a geometria de grosso para fino.
A segunda etapa do quadro DreamCraft3D usa uma abordagem de destilação de pontuação inicializada para aumentar as texturas da imagem, pois os modelos de difusão condicionados por vista atuais são treinados em uma quantidade limitada de dados 3D, o que os torna frequentemente incapazes de igualar o desempenho ou a fidelidade dos modelos de difusão 2D. Graças a essa limitação, o quadro DreamCraft3D ajusta o modelo de difusão de acordo com imagens multi-vista da instância 3D que está sendo otimizada, e essa abordagem ajuda o quadro a aumentar as texturas 3D enquanto mantém a consistência multi-vista. Quando o modelo de difusão treina nessas renderizações multi-vista, ele fornece uma orientação melhor para a otimização da textura 3D, e essa abordagem ajuda o quadro DreamCraft3D a alcançar um detalhamento de textura incrível enquanto mantém a consistência da vista.

Como pode ser observado nas imagens acima, o quadro DreamCraft3D é capaz de produzir imagens 3D criativas e conteúdo com texturas realistas e estruturas geométricas intricadas. Na primeira imagem, é o corpo de Son Goku, um personagem de anime misturado com a cabeça de um javali selvagem em fuga, enquanto a segunda imagem retrata um Beagle vestido com o traje de um detetive. Seguem alguns exemplos adicionais.

DreamCraft3D: Funcionamento e Arquitetura
O quadro DreamCraft3D tenta aproveitar um quadro gerativo de texto-para-imagem (T2I) de ponta para criar imagens 2D de alta qualidade usando um prompt de texto. A abordagem permite que o quadro DreamCraft3D maximize as capacidades dos modelos de difusão 2D de ponta para representar as semânticas visuais descritas no prompt de texto, mantendo a liberdade criativa oferecida por esses quadros gerativos de IA 2D. A imagem gerada é então elevada para 3D com a ajuda de fases de aumento de textura geométrica e escultura geométrica, e técnicas especializadas são aplicadas em cada etapa com a ajuda da decomposição do problema. A seguinte imagem resume brevemente o funcionamento do quadro DreamCraft3D.

Vamos dar uma olhada detalhada nas considerações de design principais para as fases de aumento de textura e escultura geométrica.
Escultura Geométrica
A Escultura Geométrica é a primeira etapa em que o quadro DreamCraft3D tenta criar um modelo 3D que se alinha com a aparência da imagem de referência na mesma vista de referência, garantindo a máxima plausibilidade, mesmo em ângulos de vista diferentes. Para garantir a máxima plausibilidade, o quadro usa a perda SDS para encorajar a renderização de imagem plausível para cada vista amostrada individual que um modelo de difusão pré-treinado pode reconhecer. Além disso, para utilizar a orientação da imagem de referência de forma eficaz, o quadro penaliza as diferenças fotométricas entre a referência e as imagens renderizadas na vista de referência, e a perda é computada apenas dentro da região de primeiro plano da vista. Além disso, para encorajar a esparsidade da cena, o quadro também implementa uma perda de máscara que renderiza a silhueta. No entanto, manter a aparência e a semântica em vistas traseiras consistentemente ainda permanece um desafio, o que é por que o quadro emprega abordagens adicionais para produzir geometria detalhada e coerente.
Prior de Difusão 3D
Os métodos de otimização 3D que usam apenas supervisão por vista são subdeterminados, o que é a razão principal pela qual o quadro DreamCraft3D usa o Zero-1-to-3, um modelo de difusão condicionado por ponto de vista, como o quadro Zero-1-to-3 oferece uma consciência de ponto de vista aprimorada, pois foi treinado em uma escala maior de ativos de dados 3D. Além disso, o quadro Zero-1-to-3 é um modelo de difusão ajustado, que hallucina a imagem em relação à pose da câmera, dado a imagem de referência.
Treinamento Progressivo de Vista
Derivar vistas livres diretamente em 360 graus pode levar a artefatos geométricos ou discrepâncias, como uma perna extra na cadeira, um evento que pode ser creditado à ambiguidade inerente a uma única imagem de referência. Para lidar com esse obstáculo, o quadro DreamCraft3D amplia as vistas de treinamento progressivamente, após o que a geometria bem estabelecida é gradualmente propagada para obter resultados em 360 graus.
Amortecimento de Passo de Tempo de Difusão
O quadro DreamCraft3D emprega uma estratégia de amortecimento de passo de tempo de difusão para se alinhar com a progressão de grosso para fino da otimização 3D. No início do processo de otimização, o quadro dá prioridade à amostragem de um passo de difusão maior, em uma tentativa de fornecer a estrutura global. À medida que o quadro prossegue com o processo de treinamento, ele linearmente amortiza o intervalo de amostragem ao longo de centenas de iterações. Graças à estratégia de amortecimento, o quadro consegue estabelecer uma geometria global plausível durante os primeiros passos de otimização, antes de refinar os detalhes estruturais.
Refinamento Estrutural Detalhado
O quadro DreamCraft3D otimiza uma representação de superfície implícita inicialmente para estabelecer uma estrutura grossa. O quadro então usa esse resultado e o combina com uma malha tetraédrica deformável ou DMTet para inicializar uma representação de malha 3D texturizada, que disentangle a aprendizagem de textura e geometria. Quando o quadro termina o refinamento estrutural, o modelo é capaz de preservar detalhes de alta frequência obtidos da imagem de referência, refinando as texturas exclusivamente.
Aumento de Textura Usando Amostragem de Pontuação Inicializada
Embora a etapa de escultura geométrica se concentre em aprender geometria detalhada e coerente, ela pode desfocar a textura em certa medida, o que pode ser resultado da dependência do quadro em um modelo de prioridade 2D operando em uma resolução grossa, juntamente com a limitação de nitidez oferecida pelo modelo de difusão 3D. Além disso, problemas de textura comuns, incluindo super-saturação e super-suavização, surgem como resultado de uma grande orientação de classificador livre.
O quadro usa uma perda de destilação de pontuação variacional (VSD) para aumentar a realidade das texturas. O quadro opta por um modelo de difusão estável durante essa fase para obter gradientes de alta resolução. Além disso, o quadro mantém a malha tetraédrica fixa para promover a renderização realista e otimizar a estrutura geral da malha. Durante a etapa de aprendizado, o quadro DreamCraft3D não usa o quadro Zero-1-to-3, pois isso tem um efeito adverso na qualidade das texturas, e essas texturas inconsistentes podem ser recorrentes, levando a saídas 3D bizarras.
Experimentos e Resultados
Para avaliar o desempenho do quadro DreamCraft3D, ele é comparado com quadros atuais de ponta, e os resultados qualitativos e quantitativos são analisados.
Comparações com Modelos de Referência
Para avaliar o desempenho, o quadro DreamCraft3D é comparado com 5 quadros de ponta, incluindo DreamFusion, Magic3D, ProlificDreamer, Magic123 e Make-it-3D. O benchmark de teste consiste em 300 imagens de entrada que são uma mistura de imagens do mundo real e imagens geradas pelo modelo de difusão estável. Cada imagem no benchmark de teste tem um prompt de texto, uma mapa de profundidade prevista e uma máscara alfa para o primeiro plano. O quadro obtém os prompts de texto para as imagens reais de um quadro de legenda de imagem.
Análise Qualitativa
A seguinte imagem compara o quadro DreamCraft3D com os modelos de referência atuais, e como pode ser visto, os quadros que confiam na abordagem de texto-para-3D frequentemente enfrentam problemas de consistência multi-vista.

Por um lado, você tem o quadro ProlificDreamer que oferece texturas realistas, mas falha ao gerar um objeto 3D plausível. Quadros como o Make-it-3D que confiam em métodos de imagem-para-3D conseguem criar vistas frontais de alta qualidade, mas não conseguem manter a geometria ideal para as imagens. As imagens geradas pelo quadro Magic123 oferecem uma melhor regularização geométrica, mas geram texturas e detalhes geométricos super-saturados e suavizados. Em comparação com esses quadros, o quadro DreamCraft3D que usa um método de destilação de pontuação inicializada não apenas mantém a consistência semântica, mas também melhora a diversidade de imaginação.

Análise Quantitativa
Em uma tentativa de gerar imagens 3D convincentes que não apenas se assemelham à imagem de referência de entrada, mas também transmitem semântica de várias perspectivas consistentemente, as técnicas usadas pelo quadro DreamCraft3D são comparadas com os modelos de referência, e o processo de avaliação emprega quatro métricas: PSNR e LPIPS para medir a fidelidade na vista de referência, Distância Contextual para avaliar a congruência de nível de pixel e CLIP para estimar a coerência semântica. Os resultados são demonstrados na seguinte imagem.

Conclusão
Neste artigo, discutimos o DreamCraft3D, um pipeline hierárquico para geração de conteúdo 3D. O quadro DreamCraft3D visa aproveitar um quadro gerativo de texto-para-imagem (T2I) de ponta para criar imagens 2D de alta qualidade usando um prompt de texto. Essa abordagem permite que o quadro DreamCraft3D maximize as capacidades dos modelos de difusão 2D de ponta para representar as semânticas visuais descritas no prompt de texto, mantendo a liberdade criativa oferecida por esses quadros gerativos de IA 2D. A imagem gerada é então transformada em 3D por meio de fases de aumento de textura geométrica e escultura geométrica, e técnicas especializadas são aplicadas em cada etapa, auxiliadas pela decomposição do problema. Como resultado dessa abordagem, o quadro DreamCraft3D pode produzir ativos 3D de alta fidelidade e consistentes com texturas convincentes, visíveis de múltiplos ângulos.












