Modelos e plataformas de IA
Uni3D: Explorando RepresentaçÃĩes 3D Unificadas em Escala
A escala de representaçÃĩes de texto e visuais tem sido um foco importante de pesquisa nos Últimos anos. Desenvolvimentos e pesquisas realizados recentemente levaram a numerous revoluçÃĩes no aprendizado de linguagem e visÃĢo. No entanto, apesar da popularidade da escala de representaçÃĩes de texto e visuais, a escala de representaçÃĩes para cenas e objetos 3D nÃĢo foi suficientemente discutida.
Hoje, vamos discutir o Uni3D, um modelo de fundaçÃĢo 3D que visa explorar representaçÃĩes 3D unificadas. O framework Uni3D emprega um framework ViT inicializado em 2D, prÃĐ-treinado de ponta a ponta, para alinhar recursos de imagem-texto com recursos de nuvem de pontos 3D.
O framework Uni3D usa tarefas pretextuais e uma arquitetura simples para aproveitar a abundÃĒncia de modelos 2D prÃĐ-treinados e modelos de alinhamento de imagem-texto como inicializaçÃĩes e alvos, respectivamente. Essa abordagem libera o potencial total dos modelos 2D e estratÃĐgias para escalÃĄ-los para o mundo 3D.
Neste artigo, vamos mergulhar mais fundo na visÃĢo computacional 3D e no framework Uni3D, explorando os conceitos essenciais e a arquitetura do modelo. EntÃĢo, vamos começar.
Uni3D e Aprendizado de RepresentaçÃĢo 3D: Uma IntroduçÃĢo
Nos Últimos anos, a visÃĢo computacional emergiu como um dos domÃnios mais investidos na indÚstria de IA. ApÃģs avanços significativos em frameworks de visÃĢo computacional 2D, os desenvolvedores mudaram seu foco para a visÃĢo computacional 3D. Esse campo, particularmente o aprendizado de representaçÃĢo 3D, combina aspectos de grÃĄficos computacionais, aprendizado de mÃĄquina, visÃĢo computacional e matemÃĄtica para automatizar o processamento e a compreensÃĢo de geometria 3D. O desenvolvimento rÃĄpido de sensores 3D como LiDAR, juntamente com suas aplicaçÃĩes generalizadas na indÚstria de AR/VR, resultou no aprendizado de representaçÃĢo 3D ganhando atençÃĢo crescente. Suas aplicaçÃĩes potenciais continuam a crescer diariamente.
Embora os frameworks existentes tenham mostrado progresso notÃĄvel na arquitetura de modelo 3D, modelagem orientada a tarefas e objetivos de aprendizado, a maioria explora a arquitetura 3D em uma escala relativamente pequena com dados limitados, parÃĒmetros e cenÃĄrios de tarefas. O desafio de aprender representaçÃĩes 3D escalÃĄveis, que possam ser aplicadas a aplicaçÃĩes em tempo real em ambientes diversos, permanece em grande parte inexplorado.
Avançando, nos Últimos anos, a escala de modelos de linguagem grandes prÃĐ-treinados ajudou a revolucionar o domÃnio de processamento de linguagem natural, e trabalhos recentes indicaram uma traduçÃĢo no progresso de linguagem para 2D usando escalas de dados e modelos, o que permite que os desenvolvedores tentem e reajam esse sucesso para aprender uma representaçÃĢo 3D que possa ser escalada e transferida para aplicaçÃĩes no mundo real.
O Uni3D ÃĐ um framework de prÃĐ-treinamento 3D escalÃĄvel e unificado desenvolvido com o objetivo de aprender representaçÃĩes 3D em grande escala que testam seus limites em uma escala de mais de um bilhÃĢo de parÃĒmetros, mais de 10 milhÃĩes de imagens emparelhadas com mais de 70 milhÃĩes de textos e mais de um milhÃĢo de formas 3D. A figura abaixo compara a precisÃĢo de classificaçÃĢo zero-shot contra parÃĒmetros no framework Uni3D. O framework Uni3D escalona com sucesso representaçÃĩes 3D de 6 milhÃĩes para mais de um bilhÃĢo.

O framework Uni3D consiste em um ViT 2D ou Transformador de VisÃĢo como codificador 3D, que ÃĐ entÃĢo prÃĐ-treinado de ponta a ponta para alinhar os recursos de imagem-texto com os recursos de nuvem de pontos 3D. O framework Uni3D aproveita tarefas pretextuais e uma arquitetura simples para aproveitar a abundÃĒncia de modelos 2D prÃĐ-treinados e modelos de alinhamento de imagem-texto como inicializaçÃĩes e alvos, respectivamente, liberando assim o potencial total dos modelos 2D e estratÃĐgias para escalÃĄ-los para o mundo 3D. A flexibilidade e escalabilidade do framework Uni3D sÃĢo medidas em termos de
- Escalando o modelo de 6M para mais de um bilhÃĢo de parÃĒmetros.
- InicializaçÃĢo 2D para texto supervisionado a partir de aprendizado auto-supervisionado visual.
- Modelo de alvo de texto-imagem escalonado de 150 milhÃĩes para mais de um bilhÃĢo de parÃĒmetros.
Sob o framework unificado e flexÃvel oferecido pelo Uni3D, os desenvolvedores observam um aumento coerente no desempenho ao escalar cada componente. O aprendizado de representaçÃĢo 3D em grande escala tambÃĐm se beneficia imensamente das estratÃĐgias 2D compartilhÃĄveis e de escalonamento.
Como pode ser visto na figura abaixo, o framework Uni3D apresenta um aumento no desempenho em comparaçÃĢo com a arte anterior em configuraçÃĩes de zero-shot e few-shot. à digno de nota que o framework Uni3D retorna uma precisÃĢo de classificaçÃĢo zero-shot de mais de 88% no ModelNet, que ÃĐ igual ao desempenho de vÃĄrios mÃĐtodos de supervisÃĢo de estado da arte.

AlÃĐm disso, o framework Uni3D tambÃĐm entrega precisÃĢo e desempenho de ponta ao realizar outras tarefas 3D representativas, como segmentaçÃĢo de partes e compreensÃĢo de mundo aberto. O framework Uni3D visa fechar a lacuna entre a visÃĢo 2D e a visÃĢo 3D, escalonando modelos fundamentais 3D com uma abordagem de prÃĐ-treinamento unificada e simples para aprender representaçÃĩes 3D mais robustas em uma ampla gama de tarefas, o que pode ajudar na convergÊncia de 2D e 3D em uma ampla gama de modalidades.
Uni3D: Trabalho Relacionado
O framework Uni3D se inspira e aprende com os desenvolvimentos feitos por trabalhos anteriores de aprendizado de representaçÃĢo 3D e modelos fundamentais, especialmente sob diferentes modalidades.
Aprendizado de RepresentaçÃĢo 3D
O mÃĐtodo de aprendizado de representaçÃĢo 3D usa pontos de nuvem para a compreensÃĢo 3D do objeto, e esse campo foi explorado por desenvolvedores muito recentemente, e foi observado que esses pontos de nuvem podem ser prÃĐ-treinados sob auto-supervisÃĢo usando tarefas pretextuais 3D especÃficas, incluindo modelagem de pontos de mÃĄscara, auto-reconstruçÃĢo e aprendizado contrastivo.
à digno de nota que esses mÃĐtodos trabalham com dados limitados e geralmente nÃĢo investigam representaçÃĩes multimodais de 3D a partir de 2D ou NLP. No entanto, o sucesso recente do framework CLIP que retorna alta eficiÊncia no aprendizado de conceitos visuais a partir de texto bruto usando o mÃĐtodo de aprendizado contrastivo, e busca aprender representaçÃĩes 3D alinhando recursos de imagem, texto e nuvem de pontos usando o mesmo mÃĐtodo de aprendizado contrastivo.
Modelos Fundamentais
Os desenvolvedores vÊm trabalhando exaustivamente no projeto de modelos fundamentais para escalar e unificar representaçÃĩes multimodais. Por exemplo, no domÃnio de NLP, os desenvolvedores vÊm trabalhando em frameworks que podem escalar modelos de linguagem prÃĐ-treinados, e isso estÃĄ revolucionando lentamente a indÚstria de NLP. AlÃĐm disso, avanços podem ser observados no domÃnio de visÃĢo 2D, pois os desenvolvedores estÃĢo trabalhando em frameworks que usam tÃĐcnicas de escalonamento de dados e modelos para ajudar no progresso de linguagem para modelos 2D, embora esses frameworks sejam difÃceis de replicar para modelos 3D devido à disponibilidade limitada de dados 3D e aos desafios encontrados ao unificar e escalar frameworks 3D.
Aprendendo com os dois domÃnios de trabalho acima, os desenvolvedores criaram o framework Uni3D, o primeiro modelo de fundaçÃĢo 3D com mais de um bilhÃĢo de parÃĒmetros que usa uma arquitetura de Transformador de VisÃĢo unificada que permite que os desenvolvedores escalonem o modelo Uni3D usando estratÃĐgias de escalonamento 2D ou NLP para escalar os modelos. Os desenvolvedores esperam que essa abordagem permita que o framework Uni3D feche a lacuna que atualmente separa a visÃĢo 2D e a visÃĢo 3D, alÃĐm de facilitar a convergÊncia multimodal.
Uni3D: MÃĐtodo e Arquitetura

A imagem acima demonstra a visÃĢo geral genÃĐrica do framework Uni3D, um framework de prÃĐ-treinamento 3D escalÃĄvel e unificado para o aprendizado de representaçÃĢo 3D em grande escala. Os desenvolvedores usam mais de 70 milhÃĩes de textos e 10 milhÃĩes de imagens emparelhadas com mais de um milhÃĢo de formas 3D para escalar o framework Uni3D para mais de um bilhÃĢo de parÃĒmetros. O framework Uni3D usa um ViT 2D ou Transformador de VisÃĢo como codificador 3D, que ÃĐ entÃĢo treinado de ponta a ponta para alinhar os dados de imagem-texto com os recursos de nuvem de pontos 3D, permitindo que o framework Uni3D entregue a eficiÊncia e precisÃĢo desejadas em uma ampla gama de benchmarks. Vamos agora ter uma visÃĢo detalhada do funcionamento do framework Uni3D.
Escalando o Framework Uni3D
Estudos anteriores sobre o aprendizado de representaçÃĢo de nuvem de pontos tradicionalmente se concentraram em projetar arquiteturas de modelo especÃficas que entregam melhor desempenho em uma ampla gama de aplicaçÃĩes e trabalham com uma quantidade limitada de dados devido a conjuntos de dados de pequena escala. No entanto, estudos recentes tentaram explorar a possibilidade de usar prÃĐ-treinamento escalÃĄvel em 3D, mas nÃĢo houve resultados significativos devido à disponibilidade limitada de dados 3D. Para resolver o problema de escalabilidade dos frameworks 3D, o framework Uni3D aproveita o poder de uma estrutura de transformador vanilla que quase espelha um Transformador de VisÃĢo e pode resolver os problemas de escalonamento usando estratÃĐgias de escalonamento 2D ou NLP para escalar o tamanho do modelo.

Estudos anteriores sobre o aprendizado de representaçÃĢo de nuvem de pontos tradicionalmente se concentraram em projetar arquiteturas de modelo especÃficas que entregam melhor desempenho em uma ampla gama de aplicaçÃĩes e trabalham com uma quantidade limitada de dados devido a conjuntos de dados de pequena escala. No entanto, estudos recentes tentaram explorar a possibilidade de usar prÃĐ-treinamento escalÃĄvel em 3D, mas nÃĢo houve resultados significativos devido à disponibilidade limitada de dados 3D. Para resolver o problema de escalabilidade dos frameworks 3D, o framework Uni3D aproveita o poder de uma estrutura de transformador vanilla que quase espelha um Transformador de VisÃĢo e pode resolver os problemas de escalonamento usando estratÃĐgias de escalonamento 2D ou NLP para escalar o tamanho do modelo.
Inicializando o Uni3D
Outro desafio significativo encontrado por trabalhos anteriores envolvidos na escala de representaçÃĩes 3D, as dificuldades de convergÊncia e sobreajuste que resultaram do tamanho grande dos modelos. Uma abordagem eficaz para superar esse obstÃĄculo ÃĐ prÃĐ-treinar os backbones 3D individuais com tarefas pretextuais especÃficas e inicializar parÃĒmetros prÃĐ-treinados. No entanto, a abordagem ÃĐ acompanhada de altos custos de treinamento e ÃĐ difÃcil estabelecer uma inicializaçÃĢo robusta para o aprendizado cross-modal devido à quantidade limitada de dados 3D disponÃveis para treinamento.
O framework Uni3D aproveita um transformador vanilla, cuja estrutura se assemelha ao ViT. Com essa abordagem, o framework Uni3D pode naturalmente adotar os modelos prÃĐ-treinados com outras modalidades para inicializar o framework Uni3D.
Alinhamento Multimodal
O framework Uni3D tenta aprender alinhamentos multimodais entre imagem, linguagem e nuvem de pontos usando paradigmas semelhantes aos frameworks OpenShape e ULIP. AlÃĐm disso, para garantir uma comparaçÃĢo justa com outros mÃĐtodos, o framework Uni3D usa o conjunto de dados 3D ensemblado do OpenShape para treinamento. Esse conjunto de dados ensemblado do OpenShape consiste em 4 conjuntos de dados 3D:
- Objaverse.
- ShapeNet.
- 3D-FUTURE.
- ABO.
Experimentos e Resultados
O framework Uni3D ÃĐ testado em diferentes configuraçÃĩes e em vÃĄrias tarefas de classificaçÃĢo, incluindo seu desempenho em configuraçÃĩes de zero-shot e few-shot, resultados em torno de compreensÃĢo de mundo aberto e mais. Vamos ter uma visÃĢo detalhada desses resultados.
ClassificaçÃĢo de Forma Zero-Shot
Para avaliar o desempenho do framework Uni3D em tarefas de classificaçÃĢo de forma zero-shot, os desenvolvedores realizam experimentos em trÊs benchmarks, incluindo os conjuntos de dados ModelNet, ScanObjNN e Objaverse-LVIS. ModelNet e ScanObjNN sÃĢo conjuntos de dados amplamente usados para tarefas de classificaçÃĢo e consistem em 15 e 40 categorias de objetos, respectivamente, enquanto o benchmark Objaverse-LVIS ÃĐ um conjunto de dados limpo e anotado que consiste em mais de 40.000 objetos em mais de 1.100 categorias. A comparaçÃĢo entre os frameworks ÃĐ demonstrada na imagem abaixo, e como pode ser visto, o framework Uni3D supera significativamente os frameworks de estado da arte anteriores em diferentes configuraçÃĩes.

Sondagem Linear de Few-Shot
Em IA, a sondagem linear ÃĐ um mÃĐtodo comum usado para avaliar as representaçÃĩes que um framework ou modelo aprende. Para avaliar a capacidade de sondagem linear do Uni3D, os desenvolvedores congelam os parÃĒmetros do framework Uni3D usando as configuraçÃĩes comuns do OpenShape. Em seguida, os desenvolvedores treinam um classificador linear para o Uni3D usando rÃģtulos de classe de few-shot. A figura abaixo demonstra a capacidade de sondagem linear de diferentes frameworks no conjunto de dados Objaverse-LVIS e demonstra o desempenho mÃĐdio do modelo em 10 sementes aleatÃģrias. Como pode ser visto, o framework Uni3D supera significativamente os mÃĐtodos existentes em diferentes configuraçÃĩes de few-shot.

CompreensÃĢo de Mundo Aberto
Para avaliar a capacidade do framework Uni3D de compreender formas e objetos do mundo real em tempo real, os desenvolvedores usam os conjuntos de dados ScanNet e CLIP para explorar o desempenho do Uni3D. à digno de nota que a segmentaçÃĢo de instÃĒncia de ground truth estÃĄ disponÃvel, e o objetivo principal ÃĐ reconhecer a categoria de cada instÃĒncia de cena em uma configuraçÃĢo de zero-shot. Os resultados sÃĢo demonstrados na imagem abaixo. Como pode ser visto, o framework Uni3D entrega resultados excepcionais ao realizar compreensÃĢo de mundo aberto e reconhecimento. O framework Uni3D supera os frameworks existentes por uma margem significativa, apesar de nunca ter sido treinado em conjuntos de dados do mundo real.

RecuperaçÃĢo Cross-Modal
As representaçÃĩes multimodais aprendidas pelo framework Uni3D podem permitir que o framework recupere formas 3D naturalmente a partir de textos ou imagens. Para recuperar as formas 3D, o modelo calcula a similaridade coseno entre as embeddings de formas 3D e as embeddings de um prompt de texto de consulta ou uma imagem de consulta. O framework entÃĢo usa o algoritmo KNN ou K Nearest Neighbour para gerar formas 3D que se assemelham à consulta mais, e os resultados sÃĢo demonstrados na figura abaixo. Como pode ser visto, o framework Uni3D usa com sucesso imagens do mundo real para recuperar formas 3D. AlÃĐm disso, ÃĐ digno de nota que as imagens de treinamento sÃĢo apenas para fins de renderizaçÃĢo, e a lacuna entre imagens do mundo real e imagens de treinamento ÃĐ substancial. AlÃĐm disso, o modelo tambÃĐm usa duas imagens de entrada e recupera formas semelhantes a ambas as imagens de entrada usando a similaridade coseno entre a mÃĐdia das embeddings de ambas as imagens e as formas 3D embutidas. Os resultados sÃĢo interessantes, pois demonstram a capacidade do Uni3D de aprender representaçÃĩes 3D diversificadas e perceber mÚltiplos sinais 2D.

Na primeira coluna, o framework usa duas imagens de consulta para retornar formas 3D que se assemelham às imagens de consulta. Na segunda coluna, o framework usa duas imagens de entrada para recuperar formas 3D que se assemelham a ambas as imagens de entrada. Finalmente, na Última coluna, o modelo usa prompts de texto de consulta e retorna formas 3D que se assemelham ao prompt de texto de consulta mais.
Pensamentos Finais
Neste artigo, discutimos o Uni3D, um framework de prÃĐ-treinamento 3D escalÃĄvel e unificado desenvolvido com o objetivo de aprender representaçÃĩes 3D em grande escala que testam seus limites em uma escala de mais de um bilhÃĢo de parÃĒmetros, mais de 10 milhÃĩes de imagens emparelhadas com mais de 70 milhÃĩes de textos e mais de um milhÃĢo de formas 3D. Os desenvolvedores do framework incluÃram um transformador vanilla com sua estrutura equivalente ao ViT, o que permite que eles escalonem o framework Uni3D usando estratÃĐgias de escalonamento 2D ou NLP. AlÃĐm disso, o framework Uni3D pode aproveitar uma ampla gama de frameworks 2D prÃĐ-treinados e estratÃĐgias 2D para o mundo 3D. Os resultados experimentais jÃĄ demonstraram o enorme potencial do framework Uni3D, pois o framework Uni3D retorna resultados precisos e eficientes em uma ampla gama de configuraçÃĩes e supera os frameworks de estado da arte existentes.












