Модели и платформы ИИ

Как работает однократная 3D-реконструкция?

mm
Добавьте Unite.AI в избранные источники в Google

Традиционно модели для однократной реконструкции объектов, построенные на основе свёрточных нейронных сетей, показали замечательные результаты в задачах реконструкции. В последние годы однократная 3D-реконструкция стала популярной темой исследований в сообществе ИИ. Независимо от конкретного метода, используемого в модели, все модели однократной 3D-реконструкции имеют общий подход, заключающийся в включении в свою структуру сети с кодировщиком и декодировщиком. Эта сеть выполняет сложные рассуждения о 3D-структуре в выходном пространстве.

В этой статье мы рассмотрим, как работает однократная 3D-реконструкция в реальном времени, и какие проблемы эти модели сталкиваются при выполнении задач реконструкции. Мы обсудим различные ключевые компоненты и методы, используемые моделями однократной 3D-реконструкции, и рассмотрим стратегии, которые могут улучшить производительность этих моделей. Кроме того, мы проанализируем результаты, полученные современными моделями, использующими методы кодировщика и декодировщика. Давайте начнем.

Однократная 3D-реконструкция объектов

Однократная 3D-реконструкция объектов включает в себя создание 3D-модели объекта из одного взгляда, или, проще говоря, из одного изображения. Например, определение 3D-структуры объекта, такого как мотоцикл, по изображению – это сложный процесс. Он сочетает знания о структурной организации деталей, низкоуровневых изображений и высокоуровневой семантической информации. Этот спектр охватывает два основных аспекта: реконструкция и распознавание. Процесс реконструкции определяет 3D-структуру входного изображения, используя подсказки, такие как затенение, текстура и визуальные эффекты. Напротив, процесс распознавания классифицирует входное изображение и извлекает подходящую 3D-модель из базы данных.

Текущие модели однократной 3D-реконструкции объектов могут различаться по архитектуре, но они объединены включением структуры кодировщика и декодировщика в свою структуру. В этой структуре кодировщик отображает входное изображение в латентное представление, а декодировщик выполняет сложные рассуждения о 3D-структуре выходного пространства. Чтобы успешно выполнить эту задачу, сеть должна объединить как высокоуровневую, так и низкоуровневую информацию. Кроме того, многие современные методы кодировщика и декодировщика полагаются на распознавание для задач однократной 3D-реконструкции, что ограничивает их возможности реконструкции. Более того, производительность современных свёрточных нейронных сетей в однократной 3D-реконструкции объектов может быть превзойдена без явного определения 3D-структуры объекта. Однако доминирование распознавания в свёрточных сетях в задачах однократной реконструкции объектов обусловлено различными экспериментальными процедурами, включая протоколы оценки и состав базы данных. Такие факторы позволяют модели найти捷径, в данном случае, распознавание изображений.

Традиционно модели однократной 3D-реконструкции объектов подходят к задачам реконструкции, используя подход “форма из затенения”, с текстурой и размытием, служащими экзотическими видами для задач реконструкции. Поскольку эти методы используют один глубинный сигнал, они способны обеспечить рассуждения о видимых частях поверхности. Кроме того, многие модели однократной 3D-реконструкции используют несколько сигналов, а также структурные знания для оценки глубины из одного моноокулярного изображения, что позволяет этим моделям предсказать глубину видимых поверхностей. Более недавние методы оценки глубины развертывают структуры свёрточных нейронных сетей для извлечения глубины из моноокулярного изображения.

Однако для эффективной однократной 3D-реконструкции модели не только должны рассуждать о 3D-структуре видимых объектов в изображении, но также должны воображать невидимые части в изображении, используя определенные априорные знания, полученные из данных. Для этого большинство моделей в настоящее время развертывают обученные свёрточные нейронные сети для отображения 2D-изображений в 3D-формы, используя прямое 3D-наблюдение, тогда как многие другие модели развертывают представления 3D-форм на основе вокселей и использовали латентное представление для генерации 3D-уп-конвольций. Определенные модели также разбивают выходное пространство иерархически, чтобы повысить вычислительную и памятную эффективность, что позволяет модели предсказывать более высокие разрешения 3D-форм. Недавние исследования направлены на использование более слабых форм наблюдения для предсказания 3D-форм, используя свёрточные нейронные сети, либо сравнивая предсказанные формы и их фактические предсказания для обучения регрессоров форм, либо используя несколько сигналов обучения для обучения средних форм, что помогает модели предсказывать деформации. Другой причиной ограниченных достижений в однократной 3D-реконструкции является ограниченное количество тренировочных данных, доступных для этой задачи.

Двигаясь дальше, однократная 3D-реконструкция – это сложная задача, поскольку она не только интерпретирует визуальные данные геометрически, но и семантически. Хотя они не являются совершенно разными, они охватывают разные спектры от геометрической реконструкции до семантического распознавания. Задачи реконструкции требуют пиксельного рассуждения о 3D-структуре объекта в изображении. Задачи реконструкции не требуют семантического понимания содержания изображения и могут быть достигнуты, используя низкоуровневые изображения, включая текстуру, цвет, затенение, тени, перспективу и фокус. Распознавание, с другой стороны, является крайним случаем использования семантики изображения, поскольку задачи распознавания используют целые объекты и сводятся к классификации объекта в входных данных и извлечению соответствующей формы из базы данных. Хотя задачи распознавания могут обеспечить прочные рассуждения о частях объекта, не видимых в изображениях, семантическое решение возможно только если оно может быть объяснено объектом, присутствующим в базе данных.

Хотя задачи распознавания и реконструкции могут существенно различаться, они обе склонны игнорировать ценные сведения, содержащиеся в входном изображении. Рекомендуется использовать обе эти задачи в сочетании друг с другом, чтобы получить лучшие возможные результаты и точные 3D-формы для реконструкции объектов, т.е. для оптимальных задач однократной 3D-реконструкции, модель должна использовать структурные знания, низкоуровневые изображения и высокоуровневое понимание объекта.

Однократная 3D-реконструкция: традиционная настройка

Чтобы объяснить традиционную настройку и проанализировать настройку модели однократной 3D-реконструкции, мы будем использовать стандартную настройку для оценки 3D-формы, используя один вид или изображение объекта. База данных, используемая для тренировки, – это база данных ShapeNet, и оценивает производительность по 13 классам, что позволяет модели понять, как количество классов в базе данных определяет производительность оценки формы модели.

Большинство современных свёрточных нейронных сетей используют одно изображение для предсказания высокоразрешающих 3D-моделей, и эти модели можно классифицировать на основе представления их выхода: глубинные карты, облака точек и воксельные сетки. Модель использует OGN или сети, генерирующие октры, в качестве представительного метода, который исторически превосходил подход воксельной сетки и/или может охватить доминирующие представления выхода. В отличие от существующих методов, использующих представления выхода, подход OGN позволяет модели предсказывать высокоразрешающие формы и использовать октры для эффективного представления занятого пространства.

Базовые модели

Чтобы оценить результаты, модель развертывает две базовые модели, которые рассматривают задачу как чистую задачу распознавания. Первая базовая модель основана на кластеризации, тогда как вторая базовая модель выполняет извлечение из базы данных.

Кластеризация

В базовой модели кластеризации модель использует алгоритм K-Means для кластеризации или группировки тренировочных форм в K подкатегорий и запускает алгоритм на 32*32*32 вокселизациях, сжатых в вектор. После определения кластерных назначений модель переключает обратно на работу с моделями с более высоким разрешением. Затем модель рассчитывает среднюю форму внутри каждого кластера и пороговые средние формы, где оптимальное значение рассчитывается путем максимизации среднего IoU или пересечения над моделями. Поскольку модель знает связь между 3D-формами и изображениями в тренировочных данных, модель может легко сопоставить изображение с соответствующим кластером.

Извлечение

Базовая модель извлечения учится встраивать формы и изображения в общее пространство. Модель учитывает попарную подобие 3D-матриц форм в тренировочном наборе для построения пространства вложения. Модель достигает этого, используя многомерное масштабирование с отображением Саммона для сжатия каждой строки в матрице до низкоразмерного дескриптора. Кроме того, для расчета подобия между двумя произвольными формами модель использует дескриптор светового поля. Кроме того, модель учит сеть свёрточных нейронов для отображения изображений в дескриптор для вложения изображений в пространство.

Анализ

Модели однократной 3D-реконструкции следуют разным стратегиям, в результате чего они превосходят другие модели в некоторых областях, тогда как в других они отстают. Чтобы сравнить разные модели и оценить их производительность, у нас есть различные метрики, одна из которых – средний балл IoU.

Как можно увидеть на изображении выше, несмотря на разные архитектуры, современные модели 3D-реконструкции показывают практически одинаковую производительность. Однако интересно отметить, что, несмотря на то, что это чистый метод распознавания, базовая модель извлечения превосходит другие модели по среднему и медианному баллу IoU. Базовая модель кластеризации показывает солидные результаты, превосходя модели AtlasNet, OGN и Matryoshka. Однако наиболее неожиданным результатом этого анализа остается тот факт, что Oracle (ORCL ) NN превосходит все другие методы, несмотря на использование идеальной архитектуры извлечения. Хотя расчет среднего балла IoU помогает в сравнении, он не дает полной картины, поскольку дисперсия результатов высока, независимо от модели.

Общие метрики оценки

Модели однократной 3D-реконструкции часто используют различные метрики оценки для анализа их производительности в широком диапазоне задач. Ниже приведены некоторые из наиболее часто используемых метрик оценки.

Пересечение над объединением

Среднее значение пересечения над объединением является метрикой, обычно используемой в качестве количественной меры для оценки моделей однократной 3D-реконструкции. Хотя IoU дает некоторое представление о производительности модели, оно не считается единственной метрикой для оценки метода, поскольку оно указывает на качество предсказанной формы только в том случае, если значения достаточно высоки, с существенной разницей между низкими и средними баллами для двух заданных форм.

Расстояние Шемфера

Расстояние Шемфера определяется на облаках точек и было разработано так, чтобы его можно было применять к различным 3D-представлениям. Однако метрика расстояния Шемфера очень чувствительна к выбросам, что делает ее проблематичной мерой для оценки производительности модели, с расстоянием выброса от эталонной формы, существенно определяющим качество генерации.

F-мера

F-мера – это общая метрика оценки, активно используемая большинством моделей многовидовой 3D-реконструкции. Метрика F-меры определяется как гармоническое среднее между полнотой и точностью, и она оценивает расстояние между поверхностями объектов явно. Точность учитывает процент реконструированных точек, лежащих в пределах предварительно определенного расстояния от эталонной формы, для измерения точности реконструкции. Полнота, с другой стороны, учитывает процент точек на эталонной форме, лежащих в пределах предварительно определенного расстояния от реконструкции, для измерения полноты реконструкции. Кроме того, варьируя пороговое расстояние, разработчики могут контролировать строгость метрики F-меры.

Анализ по классам

Сходство в производительности, показанной выше моделями, не может быть результатом методов, работающих на разных подмножествах классов, и следующая фигура демонстрирует последовательную относительную производительность по разным классам, с базовой моделью Oracle NN, достигающей лучшего результата, и всеми методами, наблюдающими высокую дисперсию для всех классов.

Кроме того, количество тренировочных образцов, доступных для класса, может привести к предположению, что оно влияет на производительность по классам. Однако, как показано на следующей фигуре, количество тренировочных образцов, доступных для класса, не влияет на производительность по классам, и количество образцов в классе и его средний балл IoU не коррелируют.

Качественный анализ

Количественные результаты, обсуждаемые выше, подтверждаются качественными результатами, показанными на следующем изображении.

Для большинства классов нет существенной разницы между базовой моделью кластеризации и предсказаниями, сделанными методами, основанными на декодировщике. Базовый подход кластеризации не может обеспечить результаты, когда расстояние между образцом и средней формой кластера велико, или когда средняя форма сама по себе не может описать кластер достаточно хорошо. С другой стороны, модели, использующие методы, основанные на декодировщике и архитектуру извлечения, обеспечивают наиболее точные и привлекательные результаты, поскольку они могут включать тонкие детали в сгенерированную 3D-модель.

Однократная 3D-реконструкция: заключительные мысли

В этой статье мы говорили об однократной 3D-реконструкции объектов и о том, как она работает, и обсудили две базовые модели: извлечение и классификацию, с базовой моделью извлечения, превосходящей современные модели. Наконец, хотя однократная 3D-реконструкция объектов является одной из самых горячих тем и наиболее исследуемых тем в сообществе ИИ, и несмотря на значительные достижения в последние годы, однократная 3D-реконструкция объектов еще далека от совершенства, с существенными препятствиями, которые необходимо преодолеть в ближайшие годы.

"Инженер по профессии, писатель по сердцу". Кунал - технический писатель с глубокой любовью и пониманием ИИ и МО, посвященный упрощению сложных концепций в этих областях посредством своей увлекательной и информативной документации.