Моделі та платформи ШІ
Uni3D: Розкриття Єдиного 3D Представлення у Масштабі
Масштабування представлень тексту та візуальних даних було основним напрямком досліджень за останні роки. Розробки та дослідження, проведені в недавньому минулому, призвели до численних революцій у сфері мовного навчання та бачення. Однак, попри популярність масштабування текстових та візуальних представлень, питання масштабування представлень для 3D-сцен та об’єктів не було достатньо обговорено.
Сьогодні ми обговоримо Uni3D, 3D-фундаментальну модель, яка має на меті дослідити єдине 3D-представлення. Фреймворк Uni3D використовує 2D-ініціалізований фреймворк ViT, попередньо навчений з кінця в кінець, для вирівнювання особливостей зображення-тексту з відповідними 3D-точковими хмарами.
Фреймворк Uni3D використовує пре-таски та просту архітектуру для використання великої кількості попередньо навчених 2D-моделей та моделей, вирівнювання зображення-тексту, як ініціалізацію та цілі відповідно. Цей підхід розблокує повний потенціал 2D-моделей та стратегій для масштабування до 3D-світу.
У цій статті ми глибше розглянемо 3D-бачення та фреймворк Uni3D, досліджуючи основні концепції та архітектуру моделі. Тому почнемо.
Uni3D та 3D Представлення: Введення
За останні кілька років комп’ютерне бачення стало одним з найбільш інвестованих напрямків в галузі штучного інтелекту. Після значних досягнень у 2D комп’ютерному баченні розробники переключили свою увагу на 3D комп’ютерне бачення. Ця галузь, зокрема 3D-представлення, поєднує аспекти комп’ютерної графіки, машинного навчання, комп’ютерного бачення та математики для автоматизації обробки та розуміння 3D-геометрії. Швидкий розвиток 3D-чутливих датчиків, таких як LiDAR, разом з їх широким застосуванням в галузі AR/VR, призвів до зростання уваги до 3D-представлення. Його потенційні застосування продовжують зростати щодня.
Хоча існуючі фреймворки показали значний прогрес у 3D-модельній архітектурі, завдань-орієнтованому моделюванні та навчальних цілях, більшість досліджують 3D-архітектуру на відносно малому масштабі з обмеженими даними, параметрами та завданнями. Виклик навчання масштабованих 3D-представлень, які можна застосовувати в реальних додатках у різних середовищах, залишається переважно не дослідженим.
Далі, за останні кілька років, масштабування великих мовних моделей, які попередньо навчені, допомогло революціонізувати область природної мови, а останні роботи вказують на переклад прогресу з мови до 2D за допомогою даних та масштабування моделей, що відкриває можливість розробникам спробувати та повторити цей успіх для навчання 3D-представлення, яке можна масштабувати та застосовувати в реальних додатках.
Uni3D – це масштабований та єдиний фреймворк попереднього навчання 3D, розроблений з метою навчання великомасштабних 3D-представлень, які перевіряють свої межі на рівні понад мільярд параметрів, понад 10 мільйонів зображень, парних з понад 70 мільйонами текстами, та понад мільйон 3D-фігур. На малюнку нижче порівнюється нуль-ударна точність проти параметрів у фреймворку Uni3D. Фреймворк Uni3D успішно масштабує 3D-представлення з 6 мільйонів до понад мільярд.

Фреймворк Uni3D складається з 2D ViT або Візіон Трансформера як 3D-кодувальника, який потім попередньо навчений з кінця в кінець для вирівнювання особливостей зображення-тексту з 3D-точковими хмарами. Фреймворк Uni3D використовує пре-таски та просту архітектуру для використання великої кількості попередньо навчених 2D-моделей та моделей, вирівнювання зображення-тексту, як ініціалізацію та цілі відповідно, тим самим розблокуючи повний потенціал 2D-моделей та стратегій для масштабування до 3D-світу. Гнучкість та масштабованість фреймворку Uni3D вимірюються терміном
- Масштабування моделі з 6M до понад мільярд параметрів.
- 2D-ініціалізація до тексту, керованого візуальним само-навчанням.
- Текст-образова цільова модель масштабування з 150 мільйонів до понад мільярд параметрів.
Під гнучким та єдиним фреймворком, запропонованим Uni3D, розробники спостерігають узгоджене підвищення продуктивності при масштабуванні кожного компонента. Великомасштабне 3D-представлення також виграє від спільних 2D- та масштабованих стратегій.
Як можна побачити на малюнку нижче, фреймворк Uni3D демонструє підвищення продуктивності порівняно з попереднім мистецтвом у кількох ударах та нуль-ударних умовах. Варто відзначити, що фреймворк Uni3D повертає нуль-ударну класифікаційну точність понад 88% на ModelNet, що відповідає продуктивності кількох сучасних методів нагляду.

Крім того, фреймворк Uni3D також демонструє верхню точність та продуктивність при виконанні інших представницьких 3D-завдань, таких як сегментація частин та відкритий світ. Фреймворк Uni3D має на меті звузити розрив між 2D-баченням та 3D-баченням шляхом масштабування 3D-фундаментальних моделей з єдиним, але простим підходом до попереднього навчання для навчання більш надійних 3D-представлень по широкому спектру завдань, що в кінцевому підсумку допоможе у зближенні 2D та 3D-бачення по широкому спектру модальностей.
Uni3D: Пов’язана Робота
Фреймворк Uni3D черпає натхнення та вчиться з розробок, зроблених попереднім 3D-представленням та фундаментальними моделями, особливо під різними модальностями.
3D Представлення
Метод 3D-представлення використовує хмари точок для 3D-розуміння об’єкта, і ця галузь була досліджена розробниками багато разів у недавньому минулому, і було спостережено, що ці хмари точок можна попередньо навчити за допомогою само-нагляду з використанням конкретних 3D-пре-тасків, включаючи маскування точок, само-реконструкцію та контрастне навчання.
Варто відзначити, що ці методи працюють з обмеженими даними та часто не досліджують багатомодальні представлення до 3D з 2D або NLP. Однак недавній успіх фреймворку CLIP, який повертає високу ефективність у навчанні візуальних концепцій з сирого тексту за допомогою контрастного навчання, та подальше навчання 3D-представлень шляхом вирівнювання зображення, тексту та хмар точок за допомогою того ж контрастного навчання.
Фундаментальні Моделі
Розробники активно працюють над розробкою фундаментальних моделей для масштабування та уніфікації багатомодальних представлень. Наприклад, у галузі NLP розробники працюють над фреймворками, які можуть масштабувати попередньо навчені мовні моделі, і це повільно революціонізує галузь NLP. Крім того, прогрес спостерігається у галузі 2D-бачення, оскільки розробники працюють над фреймворками, які використовують дані та масштабування моделей для прогресу мови до 2D-моделей, хоча такі фреймворки важко повторити для 3D-моделей через обмежену доступність 3D-даних та труднощі уніфікації та масштабування 3D-фреймворків.
Вчучися з вищезазначених двох галузей, розробники створили фреймворк Uni3D, перший 3D-фундаментальний фреймворк з понад мільярдом параметрів, який використовує єдину архітектуру ViT або Візіон Трансформера, яка дозволяє розробникам масштабувати фреймворк Uni3D за допомогою єдиних 3D- або NLP-стратегій для масштабування моделей. Розробники сподіваються, що цей метод дозволить фреймворку Uni3D звузити розрив, який зараз відокремлює 2D та 3D-бачення, а також сприяти багатомодальній конвергенції.
Uni3D: Метод та Архітектура

Вище зображення демонструє загальний огляд фреймворку Uni3D, масштабованого та єдиного фреймворку попереднього навчання 3D для великомасштабного 3D-представлення. Розробники використовують понад 70 мільйонів текстів та 10 мільйонів зображень, парних з понад мільйоном 3D-фігур, для масштабування фреймворку Uni3D до понад мільярд параметрів. Фреймворк Uni3D використовує 2D ViT або Візіон Трансформер як 3D-кодувальник, який потім попередньо навчений з кінця в кінець для вирівнювання тексту-зображення з 3D-точковими хмарами, дозволяючи фреймворку Uni3D повертати бажану ефективність та точність по широкому спектру бенчмарків. Давайте тепер розглянемо детальний огляд роботи фреймворку Uni3D.
Масштабування Фреймворку Uni3D
Попередні дослідження щодо навчання хмар точок традиційно зосереджувалися на розробці конкретних архітектур моделей, які демонструють кращу продуктивність по широкому спектру застосунків, і працюють з обмеженою кількістю даних завдяки малим масштабним наборам даних. Однак недавні дослідження спробували дослідити можливість використання масштабованого попереднього навчання у 3D, але не було значних результатів через обмежену доступність 3D-даних. Для вирішення проблеми масштабування 3D-фреймворків фреймворк Uni3D використовує силу ванільної трансформерної структури, яка майже дублює Візіон Трансформер, і може вирішити проблеми масштабування за допомогою єдиних 2D- або NLP-стратегій для масштабування моделі.

Попередні дослідження щодо навчання хмар точок традиційно зосереджувалися на розробці конкретних архітектур моделей, які демонструють кращу продуктивність по широкому спектру застосунків, і працюють з обмеженою кількістю даних завдяки малим масштабним наборам даних. Однак недавні дослідження спробували дослідити можливість використання масштабованого попереднього навчання у 3D, але не було значних результатів через обмежену доступність 3D-даних. Для вирішення проблеми масштабування 3D-фреймворків фреймворк Uni3D використовує силу ванільної трансформерної структури, яка майже дублює Візіон Трансформер, і може вирішити проблеми масштабування за допомогою єдиних 2D- або NLP-стратегій для масштабування моделі.
Ініціалізація Uni3D
Іншим великим викликом, з яким зіштовхнулися попередні роботи, пов’язані з масштабуванням 3D-представлень, були труднощі з збіжністю та переобученням, які були результатом великого розміру моделей. Ефективний підхід для подолання цього перепони полягає у попередньому навчанні окремих 3D-стрічок з певними 3D-пре-тасками та ініціалізацією попередньо навчених параметрів. Однак цей підхід супроводжується високими витратами на навчання, і також важко встановити надійну ініціалізацію для跨-модального навчання через обмежену кількість 3D-даних, доступних для навчальних цілей.
Фреймворк Uni3D використовує ванільну трансформерну структуру, яку можна природно采用 попередньо навчених великих моделей з іншими модальностями для ініціалізації фреймворку Uni3D.
Багатомодальне Вирівнювання
Фреймворк Uni3D намагається навчити багатомодальні вирівнювання по зображенню, мові та хмарам точок за допомогою парадигм, подібних до OpenShape та ULIP-фреймворків. Крім того, для забезпечення справедливого порівняння з іншими методами фреймворк Uni3D використовує ансамбль 3D-даних OpenShape для навчальних цілей. Цей ансамбль даних OpenShape складається з 4 3D-даних:
- Objaverse.
- ShapeNet.
- 3D-FUTURE.
- ABO.
Експерименти та Результати
Фреймворк Uni3D тестується у різних умовах та різних класифікаційних завданнях, включаючи його продуктивність у нуль-ударних умовах та кількох ударах, результати навколо відкритого світу, та інше. Давайте розглянемо ці результати детальніше.
Нуль-Ударна Класифікація Фігур
Для оцінки продуктивності фреймворку Uni3D у нуль-ударній класифікації фігур розробники проводять експерименти по трьох бенчмарках, включаючи ModelNet, ScanObjNN та Objaverse-LVIS-бенчмарк-дані. ModelNet та ScanObjNN – це дані, широко використовувані для класифікаційних завдань, і вони складаються з 15 та 40 об’єктних категорій відповідно, тоді як Objaverse-LVIS-бенчмарк – це очищений та анотований набір даних, який складається з понад 40 000 об’єктів у понад 1 100+ категоріях. Порівняння між фреймворками демонструється на малюнку нижче, і як можна побачити, фреймворк Uni3D значно перевершує попередній стан мистецтва у різних умовах.

Лінійне Зондування у Кілька Ударів
У штучному інтелекті лінійне зондування – це загальний метод, використовуваний для оцінки представлень, які вчиться фреймворк або модель. Для оцінки лінійного зондування фреймворку Uni3D розробники заморожують параметри фреймворку Uni3D за загальними умовами, як OpenShape. Після цього розробники навчають лінійний класифікатор для фреймворку Uni3D за допомогою кількох ударів класових міток. Фігура нижче демонструє лінійне зондування різних фреймворків на наборі даних Objaverse-LVIS, і демонструє середню продуктивність моделі по 10 випадкових насіннях. Як можна побачити, фреймворк Uni3D перевершує існуючі методи значно у різних умовах кількох ударів.

Відкритий Світ
Для оцінки здатності фреймворку Uni3D розуміти реальні форми та об’єкти у реальному часі розробники використовують набори даних ScanNet та CLIP для дослідження продуктивності фреймворку Uni3D. Варто відзначити, що основна мета полягає у визначенні категорії кожного індивідуального інстансу сцени у нуль-ударній умові. Результати демонструються на малюнку нижче. Як можна побачити, фреймворк Uni3D демонструє виняткові результати при виконанні реального розуміння та розпізнавання. Фреймворк Uni3D перевершує існуючі фреймворки значно, незважаючи на те, що ніколи не навчався на реальних даних.

Перехресне Відтворення
Багатомодальні представлення, вивчені фреймворком Uni3D, можуть дозволити фреймворку відновлювати 3D-фігури природно з тексту чи зображення. Для відновлення 3D-фігур модель обчислює косинусну подібність між вкладеннями 3D-фігур та вкладеннями запитувального текстового запиту чи зображення. Фреймворк потім використовує алгоритм KNN (K Найближчих Сусідів) для генерації 3D-фігур, які найбільш схожі на запит, і результати демонструються на фігурі нижче. Як можна побачити, фреймворк Uni3D успішно використовує реальні зображення для відновлення 3D-фігур. Крім того, варто відзначити, що навчальні зображення використовуються лише для візуалізації, і розрив між реальним та навчальним зображенням значний. Крім того, модель також приймає два вхідних зображення та відновлює фігури, схожі на обидва вхідних зображення, використовуючи косинусну подібність між середніми вкладеннями обидвох зображень та їх вкладеннями 3D-фігур. Результати цікаві, оскільки вони демонструють здатність фреймворку Uni3D вивчати різноманітні 3D-представлення та сприймати кілька 2D-сигналів.

У першому стовпці фреймворк використовує 2 запиту зображення для відновлення 3D-фігур, які найбільш схожі на запит зображення. У другому стовпці фреймворк використовує два вхідних зображення для відновлення 3D-фігур, які схожі на обидва вхідних зображення. Нарешті, у третьому стовпці модель використовує запитові тексти для відновлення 3D-фігур, які найбільш схожі на текстовий запит.
Фінальні Думки
У цій статті ми обговорили фреймворк Uni3D, масштабований та єдиний фреймворк попереднього навчання 3D, розроблений з метою навчання великомасштабних 3D-представлень, які перевіряють свої межі на рівні понад мільярд параметрів, понад 10 мільйонів зображень, парних з понад 70 мільйонами текстами, та понад мільйон 3D-фігур. Розробники фреймворку включили ванільну трансформерну структуру, яку можна масштабувати за допомогою єдиних 2D- або NLP-стратегій для масштабування моделі. Крім того, фреймворк Uni3D може використати широкий спектр попередньо навчених 2D-фреймворків та 2D-стратегій у 3D-світі. Експериментальні результати вже продемонстрували великий потенціал фреймворку Uni3D, оскільки фреймворк Uni3D повертає точні та ефективні результати по широкому спектру умов та перевершує існуючі сучасні фреймворки.












