Взгляд Anderson

Обучение роботов работе с инструментами с помощью нейронных радиационных полей (NeRF)

mm
Добавьте Unite.AI в избранные источники в Google

Новые исследования Университета Мичигана предлагают способ для роботов понять механизмы инструментов и других реальных сочлененных объектов, создавая Нейронные радиационные поля (NeRF) объектов, которые демонстрируют, как эти объекты движутся, потенциально позволяя роботу взаимодействовать с ними и использовать их без утомительной предварительной настройки.

Используя известные источники для внутренней подвижности инструментов (или любого объекта с подходящей ссылкой), NARF22 может синтезировать фотореалистичное приближение инструмента и его диапазона движения и типа операции. Источник: https://progress.eecs.umich.edu/projects/narf/

Используя известные источники для внутренней подвижности инструментов (или любого объекта с подходящей ссылкой), NARF22 может синтезировать фотореалистичное приближение инструмента и его диапазона движения и типа операции. Источник: https://progress.eecs.umich.edu/projects/narf/

Роботы, которые должны выполнять больше, чем просто избегать пешеходов или выполнять сложные предварительно запрограммированные действия (для которых, вероятно, были помечены и обучены не повторно используемые наборы данных за некоторую сумму), нуждаются в этом виде адаптивной способности, если они должны работать с теми же материалами и объектами, с которыми нам приходится иметь дело.

До сих пор существовало несколько препятствий для наделения робототехнических систем этой гибкостью. К ним относятся скудость применимых наборов данных, многие из которых содержат очень ограниченное количество объектов; огромные расходы, связанные с созданием фотореалистичных, сеточных 3D-моделей, которые могут помочь роботам научиться инструментальности в контексте реального мира; и непрофессиональное качество таких наборов данных, которые могут быть подходящими для этой задачи, что делает объекты оторванными от того, что робот воспринимает в мире вокруг него, и обучает его искать карикатурный объект, который никогда не появится в реальности.

Чтобы решить эту проблему, исследователи из Мичигана, чья статья называется NARF22: Нейронные сочлененные радиационные поля для конфигурационно-осведомленного рендеринга, разработали двухстадийный конвейер для генерации NeRF-объектов, которые имеют “реальный мир” вид, и которые включают движение и ограничения любого сочлененного объекта.

Хотя это кажется более сложным, основные две стадии конвейера NARF22 включают рендеринг статических частей подвижных инструментов, а затем композицию этих элементов в второй набор данных, который информирован о параметрах движения этих частей относительно друг друга. Источник: https://arxiv.org/pdf/2210.01166.pdf

Хотя это кажется более сложным, основные две стадии конвейера NARF22 включают рендеринг статических частей подвижных инструментов, а затем композицию этих элементов в второй набор данных, который информирован о параметрах движения этих частей относительно друг друга. Источник: https://arxiv.org/pdf/2210.01166.pdf

Система называется Нейронное сочлененное радиационное поле – или NARF22, чтобы отличить его от другого проекта с похожим названием.

NARF22

Определение того, является ли неизвестный объект потенциально сочлененным, требует почти невообразимого количества человеческих знаний. Например, если вы никогда не видели закрытую тумбочку, она может показаться любой другой декоративной панелью – только когда вы откроете ее, вы осознаете “тумбочку” как сочлененный объект с одним осью движения (вперед и назад).

Следовательно, NARF22 не предназначен для исследования объектов и проверки наличия у них действующих частей – почти обезьяньего поведения, которое может привести к ряду потенциально катастрофических сценариев. Вместо этого, основа системы основана на знаниях, доступных в Универсальном формате описания робота (URDF) – открытом формате на основе XML, который широко применим и подходит для этой задачи. Файл URDF содержит используемые параметры движения объекта, а также описания и другие помеченные аспекты частей объекта.

В традиционных конвейерах необходимо описать сочлененные возможности объекта и пометить соответствующие значения суставов. Это не дешевая или легко масштабируемая задача. Вместо этого, конвейер NaRF22 рендерит отдельные компоненты объекта, прежде чем “собрать” каждый статический компонент в сочлененное NeRF-объект, с знаниями о параметрах движения, предоставленными URDF.

На второй стадии процесса создается совершенно новый рендерер, который включает все части. Хотя было бы проще просто сконкатенировать отдельные части на более ранней стадии и пропустить этот последующий шаг, исследователи отмечают, что окончательная модель – которая была обучена на NVIDIA RTX 3080 GPU под AMD 5600X CPU – имеет более низкие вычислительные требования во время обратного распространения по сравнению с таким внезапным и преждевременным сбором.

Кроме того, модель второй стадии работает в два раза быстрее, чем сконкатенированная, “вынужденная” сборка, и любые вторичные приложения, которые могут потребовать использовать информацию о статических частях модели, не будут нуждаться в своем доступе к информации URDF, поскольку это уже было включено в окончательный рендерер.

Данные и эксперименты

Исследователи провели ряд экспериментов для проверки NARF22: один для оценки качественного рендеринга для каждой конфигурации и позы объекта; количественный тест для сравнения рендерингов с аналогичными точками зрения, видимыми реальными роботами; и демонстрация оценки конфигурации и 6 DOF (глубина поля) рефайнинга, который использовал NARF22 для выполнения градиентной оптимизации.

Тренировочные данные были взяты из набора данных Progress Tools из более ранней статьи некоторых из авторов текущей работы. Progress Tools содержит около шести тысяч RGB-D (т.е. включая информацию о глубине, необходимую для робототехнического зрения) изображений размером 640×480 пикселей. Сцены включали восемь ручных инструментов, разделенных на их составные части, вместе с сеточными моделями и информацией об объектах кинематических свойств (т.е. о том, как они предназначены для движения и параметрах этого движения).

Набор данных Progress Tools включает четыре сочлененных инструмента. Изображения выше являются NeRF-рендерами из NARF22.

Набор данных Progress Tools включает четыре сочлененных инструмента. Изображения выше являются NeRF-рендерами из NARF22.

Для этого эксперимента была обучена окончательная конфигурируемая модель, используя только линемановые плоскогубцы, длинные плоскогубцы и зажим (см. изображение выше). Тренировочные данные содержали одну конфигурацию зажима и одну для каждой из плоскогубцев.

Реализация NARF22 основана на FastNeRF, с измененными входными параметрами для сосредоточения на сконкатенированной и пространственно-кодированной позе инструментов. FastNeRF использует факторизированный многослойный перцептрон (MLP) в паре с механизмом выборки вокселей (воксели по сути являются пикселями, но с полными 3D-координатами, так что они могут работать в трехмерном пространстве).

Для качественного теста исследователи отмечают, что существуют несколько скрытых частей зажима (т.е. центральной спины, которую нельзя знать или угадать, наблюдая за объектом, но только взаимодействуя с ним, и что система имеет трудности с созданием этой “неизвестной” геометрии.

Качественные рендеринги инструментов.

Качественные рендеринги инструментов.

Напротив, плоскогубцы смогли хорошо обобщить новые конфигурации (т.е. расширения и движения их частей, которые находятся в пределах параметров URDF, но которые не явно рассматриваются в тренировочных материалах для модели.

Исследователи отмечают, однако, что ошибки пометок для плоскогубцев привели к снижению качества рендеринга для очень детальных кончиков инструментов, негативно влияя на рендеринги – проблему, связанную с более широкими проблемами логистики, бюджетирования и точности пометок в секторе исследований компьютерного зрения, а не с каким-либо процедурным недостатком в конвейере NARF22.

Результаты теста точности рендеринга.

Результаты теста точности рендеринга.

Для тестов оценки конфигурации исследователи выполнили уточнение позы и оценку конфигурации из начальной “жесткой” позы, избегая любых кэширующих или ускоряющих обходов, используемых FastNeRF.

Затем они обучили 17 хорошо упорядоченных сцен из тестового набора Progress Tools (которые были отложены во время обучения), выполнив 150 итераций градиентной оптимизации под оптимизатором Adam. Этот процесс восстановил оценку конфигурации “очень хорошо”, по мнению исследователей.

Результаты теста оценки конфигурации.

Результаты теста оценки конфигурации.

 

Опубликовано впервые 5 октября 2022 г.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai