Модели и платформы ИИ
Uni3D: Изучение единой 3D-представления в масштабе
Масштабирование представлений текста и визуальных данных было основным направлением исследований в последние годы. Развития и исследования, проведенные в недавнем прошлом, привели к многочисленным революциям в области обучения языка и зрения. Однако, несмотря на популярность масштабирования текстовых и визуальных представлений, масштабирование представлений для 3D-сцен и объектов не было достаточно обсуждено.
Сегодня мы будем обсуждать Uni3D, 3D-фундаментальную модель, целью которой является изучение единой 3D-представления. Фреймворк Uni3D использует 2D-инициализированный ViT-фреймворк, предварительно обученный от конца до конца, для выравнивания функций изображения-текста с соответствующими 3D-точечными облаками.
Фреймворк Uni3D использует pretext-задачи и простую архитектуру для использования изобилия предварительно обученных 2D-моделей и моделей, выровненных с изображением-текстом, в качестве инициализаций и целей, соответственно. Этот подход освобождает полный потенциал 2D-моделей и стратегий для масштабирования их до 3D-миров.
В этой статье мы глубже рассмотрим 3D-компьютерное зрение и фреймворк Uni3D, изучая основные концепции и архитектуру модели. Итак, давайте начнем.
Uni3D и 3D-представление: Введение
В последние несколько лет компьютерное зрение стало одним из наиболее инвестируемых областей в индустрии ИИ. После значительных достижений в 2D-компьютерном зрении разработчики сместили свое внимание на 3D-компьютерное зрение. Эта область, в частности, 3D-представление, объединяет аспекты компьютерной графики, машинного обучения, компьютерного зрения и математики для автоматизации обработки и понимания 3D-геометрии. Быстрое развитие 3D-датчиков, таких как LiDAR, а также их широкое применение в индустрии AR/VR привело к тому, что 3D-представление получило все больше внимания. Его потенциальные применения продолжают расти каждый день.
Хотя существующие фреймворки показали замечательный прогресс в архитектуре 3D-модели, ориентированной на задачи, и целях обучения, большинство из них исследуют 3D-архитектуру на относительно небольшом масштабе с ограниченными данными, параметрами и сценариями задач. Вызов обучения масштабируемых 3D-представлений, которые можно применить в реальных приложениях в различных средах, остается в значительной степени неисследованным.
Двигаясь дальше, в последние несколько лет масштабирование больших языковых моделей, которые предварительно обучены, помогло революционизировать область обработки естественного языка, и недавние работы указали на перевод прогресса от языка к 2D с помощью данных и масштабирования модели, что позволяет разработчикам попытаться повторить этот успех и изучить 3D-представление, которое можно масштабировать и применить в реальных приложениях.
Uni3D – это масштабируемый и унифицированный фреймворк предварительного обучения 3D, разработанный с целью изучения крупномасштабных 3D-представлений, который тестирует свои пределы на уровне более миллиарда параметров, более 10 миллионов изображений, сопряженных с более 70 миллионами текстов, и более миллиона 3D-форм. Рисунок ниже сравнивает нулевую точность против параметров в фреймворке Uni3D. Фреймворк Uni3D успешно масштабирует 3D-представления от 6 миллионов до более миллиарда.

Фреймворк Uni3D состоит из 2D-ViT или Vision Transformer в качестве 3D-кодировщика, который затем предварительно обучен от конца до конца для выравнивания функций изображения-текста с 3D-точечными облаками. Фреймворк Uni3D использует pretext-задачи и простую архитектуру для использования изобилия предварительно обученных 2D-моделей и моделей, выровненных с изображением-текстом, в качестве инициализаций и целей, соответственно, тем самым освобождая полный потенциал 2D-моделей и стратегий для масштабирования их до 3D-миров. Гибкость и масштабируемость фреймворка Uni3D измеряются в терминах
- Масштабирование модели от 6M до более миллиарда параметров.
- 2D-инициализация до текста, обученного на визуальном самообучении.
- Масштабирование целевой модели изображения-текста от 150 миллионов до более миллиарда параметров.
Под гибким и унифицированным фреймворком, предложенным Uni3D, разработчики наблюдают согласованное увеличение производительности при масштабировании каждого компонента. Крупномасштабное обучение 3D-представлений также получает значительную пользу от общих 2D- и масштабируемых стратегий.
Как видно на рисунке ниже, фреймворк Uni3D демонстрирует увеличение производительности по сравнению с предыдущим искусством в нескольких сценариях. Стоит отметить, что фреймворк Uni3D возвращает нулевую точность классификации более 88% на ModelNet, что соответствует производительности нескольких методов государственного искусства.

Более того, фреймворк Uni3D также обеспечивает высокую точность и производительность при выполнении других представительных 3D-задач, таких как сегментация частей и понимание открытого мира. Фреймворк Uni3D направлен на устранение разрыва между 2D- и 3D-зрением путем масштабирования 3D-фундаментальных моделей с помощью унифицированного, но простого подхода к предварительному обучению для изучения более прочных 3D-представлений в широком диапазоне задач, что может в конечном итоге помочь в сходимости 2D- и 3D-зрения в широком диапазоне модальностей.
Uni3D: Связанная работа
Фреймворк Uni3D черпает вдохновение и учится на разработках, сделанных предыдущим 3D-представлением и фундаментальными моделями, особенно под разными модальностями.
3D-представление
Метод 3D-представления использует облачные точки для 3D-понимания объекта, и эта область была исследована разработчиками много в недавнем прошлом, и было обнаружено, что эти облачные точки могут быть предварительно обучены под самообучением с помощью специальных 3D-претекст-задач, включая маскировку точечной модели, самообучение и контрастное обучение.
Стоит отметить, что эти методы работают с ограниченными данными и часто не исследуют многомодальные представления в 3D от 2D или NLP. Однако недавний успех фреймворка CLIP, который возвращает высокую эффективность при обучении визуальных концепций из сырого текста с помощью контрастного обучения, и далее стремится изучить 3D-представления, выравнивая функции изображения, текста и облачных точек с помощью того же контрастного обучения.
Фундаментальные модели
Разработчики интенсивно работают над проектированием фундаментальных моделей для масштабирования и унификации многомодальных представлений. Например, в области NLP разработчики работают над фреймворками, которые могут масштабировать предварительно обученные языковые модели, и это медленно революционизирует индустрию NLP. Более того, достижения можно наблюдать в области 2D-зрения, поскольку разработчики работают над фреймворками, которые используют данные и масштабирование модели для прогресса от языка к 2D-моделям, хотя такие фреймворки трудно воспроизвести для 3D-моделей из-за ограниченной доступности 3D-данных и проблем, возникающих при унификации и масштабировании 3D-фреймворков.
Учитывая вышесказанное, разработчики создали фреймворк Uni3D, первую 3D-фундаментальную модель с более миллиардом параметров, которая использует унифицированную архитектуру ViT или Vision Transformer, которая позволяет разработчикам масштабировать фреймворк Uni3D с помощью унифицированных 3D- или NLP-стратегий для масштабирования моделей. Разработчики надеются, что этот метод позволит фреймворку Uni3D устранить разрыв, который в настоящее время отделяет 2D- и 3D-зрение, а также облегчить многомодальную сходимость.
Uni3D: Метод и архитектура

Рисунок выше демонстрирует общий обзор фреймворка Uni3D, масштабируемого и унифицированного фреймворка предварительного обучения 3D для крупномасштабного обучения 3D-представлений. Разработчики используют более 70 миллионов текстов и 10 миллионов изображений, сопряженных с более миллионом 3D-форм, для масштабирования фреймворка Uni3D до более миллиарда параметров. Фреймворк Uni3D использует 2D-ViT или Vision Transformer в качестве 3D-кодировщика, который затем обучен от конца до конца для выравнивания текстовых и изображений с 3D-точечными облаками, что позволяет фреймворку Uni3D обеспечивать желаемую эффективность и точность в широком диапазоне бенчмарков. Давайте теперь более подробно рассмотрим работу фреймворка Uni3D.
Масштабирование фреймворка Uni3D
Предыдущие исследования по обучению представлениям облачных точек традиционно фокусировались на проектировании конкретных моделей, которые обеспечивают лучшую производительность в широком диапазоне приложений и работают с ограниченным количеством данных благодаря небольшим масштабам наборов данных. Однако недавние исследования пытались изучить возможность использования масштабируемого предварительного обучения в 3D, но не было значительных результатов из-за ограниченной доступности 3D-данных. Чтобы решить проблему масштабирования 3D-фреймворков, фреймворк Uni3D использует силу структуры Vanilla Transformer, которая почти зеркально отражает Vision Transformer, и может решить проблемы масштабирования с помощью унифицированных 2D- или NLP-стратегий для масштабирования размера модели.

Предыдущие исследования по обучению представлениям облачных точек традиционно фокусировались на проектировании конкретных моделей, которые обеспечивают лучшую производительность в широком диапазоне приложений и работают с ограниченным количеством данных благодаря небольшим масштабам наборов данных. Однако недавние исследования пытались изучить возможность использования масштабируемого предварительного обучения в 3D, но не было значительных результатов из-за ограниченной доступности 3D-данных. Чтобы решить проблему масштабирования 3D-фреймворков, фреймворк Uni3D использует силу структуры Vanilla Transformer, которая почти зеркально отражает Vision Transformer, и может решить проблемы масштабирования с помощью унифицированных 2D- или NLP-стратегий для масштабирования размера модели.
Инициализация Uni3D
Другой значительный вызов, с которым столкнулись предыдущие работы, связанные с масштабированием 3D-представлений, заключался в трудностях сходимости и переобучением, которые были результатом большого размера моделей. Эффективный подход к преодолению этого препятствия заключается в предварительном обучении отдельных 3D-основ с определенными 3D-претекст-задачами и инициализации предварительно обученных параметров. Однако этот подход сопровождается высокими затратами на обучение, и также трудно установить прочную инициализацию для межмодального обучения из-за ограниченного количества 3D-данных, доступных для обучения.
Фреймворк Uni3D использует структуру Vanilla Transformer, которая близко напоминает ViT. С помощью этого подхода фреймворк Uni3D может естественно принять предварительно обученные большие модели с другими модальностями для инициализации фреймворка Uni3D.
Мультимодальное выравнивание
Фреймворк Uni3D пытается изучить мультимодальные выравнивания через изображения, язык и облачные точки с помощью парадигм, аналогичных OpenShape и ULIP. Кроме того, чтобы обеспечить справедливое сравнение с другими методами, фреймворк Uni3D использует ансамблевый 3D-набор данных OpenShape для обучения. Этот ансамблевый набор данных OpenShape состоит из 4 3D-наборов данных:
- Objaverse.
- ShapeNet.
- 3D-FUTURE.
- ABO.
Эксперименты и результаты
Фреймворк Uni3D тестируется в различных условиях и различных классификационных задачах, включая его производительность в нулевой и нескольких сценариях, результаты вокруг понимания открытого мира и многое другое. Давайте более подробно рассмотрим эти результаты.
Нулевая классификация формы
Чтобы оценить производительность фреймворка Uni3D в нулевой классификации формы, разработчики проводят эксперименты на трех бенчмарках, включая ModelNet, ScanObjNN и Objaverse-LVIS. ModelNet и ScanObjNN – это наборы данных, широко используемые для классификационных задач, и они состоят из 15 и 40 категорий объектов соответственно, тогда как Objaverse-LVIS – это очищенный и аннотированный набор данных, состоящий из более 40 000 объектов в более 1 100+ категориях. Сравнение между фреймворками показано на рисунке ниже, и как видно, фреймворк Uni3D значительно превосходит предыдущее состояние искусства в различных условиях.

Линейное зондирование с несколькими выстрелами
В ИИ линейное зондирование – это распространенный метод, используемый для оценки представлений, которые изучает фреймворк или модель. Чтобы оценить способность фреймворка Uni3D к линейному зондиру, разработчики замораживают параметры фреймворка Uni3D, используя общие настройки, как OpenShape. После этого разработчики обучают линейный классификатор для фреймворка Uni3D с помощью нескольких меток классов. Рисунок ниже демонстрирует способность фреймворка к линейному зондиру на наборе данных Objaverse-LVIS, и демонстрирует среднюю производительность модели на 10 случайных семенах. Как видно, фреймворк Uni3D превосходит существующие методы значительно в различных условиях с несколькими выстрелами.

Понимание открытого мира
Чтобы оценить способность фреймворка Uni3D понимать реальные формы и объекты в реальном времени, разработчики используют наборы данных ScanNet и CLIP для изучения производительности фреймворка Uni3D. Стоит отметить, что основная цель – признать категорию каждого инстанса сцены в нулевом сценарии. Результаты показаны на рисунке ниже. Как видно, фреймворк Uni3D обеспечивает исключительные результаты при понимании реального мира и распознавании. Фреймворк Uni3D превосходит существующие фреймворки на значительную величину, несмотря на то, что никогда не обучался на реальных наборах данных.

Перекрестное извлечение
Мультимодальные представления, изученные фреймворком Uni3D, могут позволить фреймворку извлекать 3D-формы естественным образом из текстов или изображений. Чтобы извлечь 3D-формы, модель вычисляет косинусную подобие между вложениями 3D-форм и вложениями запроса текста или изображения. Фреймворк затем использует алгоритм KNN или K-ближайших соседей для генерации 3D-форм, которые наиболее похожи на запрос, и результаты показаны на рисунке ниже. Как видно, фреймворк Uni3D успешно использует реальные изображения для извлечения 3D-форм. Кроме того, стоит отметить, что обучающие изображения используются только для рендеринга, и разрыв между реальными и обучающими изображениями значительный. Кроме того, модель также принимает два входных изображения и извлекает формы, подобные обоим входным изображениям, используя косинусное подобие между средними вложениями обоих изображений и их вложенными 3D-формами. Результаты интересны, поскольку они демонстрируют способность фреймворка Uni3D изучать разнообразные 3D-представления и воспринимать несколько 2D-сигналов.

В первом столбце фреймворк использует два запроса изображений для возврата 3D-форм, которые наиболее похожи на запросные изображения. Во втором столбце фреймворк использует два входных изображения для извлечения 3D-форм, которые наиболее похожи на оба входных изображения. Наконец, в последнем столбце модель использует запросы текста и возвращает 3D-формы, которые наиболее похожи на текстовый запрос.
Окончательные мысли
В этой статье мы говорили о фреймворке Uni3D, масштабируемом и унифицированном фреймворке предварительного обучения 3D, разработанном для изучения крупномасштабных 3D-представлений, который тестирует свои пределы на уровне более миллиарда параметров, более 10 миллионов изображений, сопряженных с более 70 миллионами текстов, и более миллиона 3D-форм. Разработчики фреймворка включили структуру Vanilla Transformer, которая эквивалентна ViT, что позволяет им масштабировать фреймворк Uni3D с помощью унифицированных 2D- или NLP-стратегий. Кроме того, фреймворк Uni3D может использовать широкий спектр предварительно обученных 2D-фреймворков и 2D-стратегий в 3D-миров. Экспериментальные результаты уже продемонстрировали огромный потенциал фреймворка Uni3D, поскольку фреймворк Uni3D обеспечивает точные и эффективные результаты в широком диапазоне настроек и превосходит существующие фреймворки государственного искусства.












