Робототехника и физический ИИ
Модель машинного обучения понимает отношения между объектами
Исследователи из Массачусетского технологического института (MIT) разработали новую модель машинного обучения, которая понимает основные отношения между объектами в сцене. Модель представляет отдельные отношения один за другим, прежде чем объединить представления, чтобы описать общую сцену.
Благодаря этому новому подходу модель машинного обучения может генерировать более точные изображения из текстовых описаний, и она может делать это даже тогда, когда сцена имеет несколько объектов, расположенных в разных отношениях друг с другом.
Это новое развитие важно, учитывая, что многие модели глубокого обучения не могут понять запутанные отношения между отдельными объектами.
Модель команды может быть использована в случаях, когда промышленные роботы должны выполнять многоступенчатые манипуляционные задачи, такие как укладка предметов или сборка бытовой техники. Она также помогает машинам в конечном итоге учиться на своих окружениях и взаимодействовать с ними, как и люди.
Йилун Ду – аспирант лаборатории компьютерных наук и искусственного интеллекта (CSAIL) и соавтор статьи. Ду возглавлял исследование вместе с Шуанг Ли, аспирантом CSAIL, и Наном Лю, аспирантом Университета Иллинойса в Урбане-Шампейне. В исследование также были включены Джошуа Б. Тененбаум, профессор когнитивной науки и вычислений в департаменте мозга и когнитивных наук, и старший автор Антонио Торральба, профессор электротехники и компьютерных наук. И Тененбаум, и Торральба являются членами CSAIL.
Новая структура
“Когда я смотрю на стол, я не могу сказать, что есть объект в позиции XYZ. Наш мозг не работает так. Когда мы понимаем сцену, мы действительно понимаем ее на основе отношений между объектами. Мы считаем, что, построив систему, которая может понять отношения между объектами, мы сможем использовать эту систему, чтобы более эффективно манипулировать и изменять наши окружения”, – говорит Ду.
Новая структура может генерировать изображение сцены на основе текстового описания объектов и их отношений.
Система может затем разбить эти предложения на более мелкие части, которые описывают каждое отдельное отношение. Каждая часть затем моделируется отдельно, и части объединяются через процесс оптимизации, который генерирует изображение сцены.
С предложениями, разбитыми на более короткие части, система может затем рекомбинировать их разными способами, что позволяет ей адаптироваться к описаниям сцен, которые она никогда не встречала.
“Другие системы бы взяли все отношения целиком и сгенерировали изображение за один раз из описания. Однако такие подходы терпят неудачу, когда у нас есть описания, выходящие за рамки распределения, такие как описания с большим количеством отношений, поскольку эти модели не могут адаптироваться за один раз, чтобы сгенерировать изображения, содержащие больше отношений. Однако, поскольку мы составляем эти отдельные, более мелкие модели вместе, мы можем смоделировать большее количество отношений и адаптироваться к новым комбинациям”, – говорит Ду.
Система также может выполнить этот процесс в обратном порядке. Если ей подается изображение, она может найти текстовые описания, которые соответствуют отношениям между объектами в сцене.
Оценка модели
Исследователи попросили людей оценить, соответствуют ли сгенерированные изображения исходному описанию сцены. Когда описания содержали три отношения, что было наиболее сложным типом, 91 процент участников сказал, что новая модель работает лучше, чем другие методы глубокого обучения.
“Одна интересная вещь, которую мы обнаружили, заключается в том, что для нашей модели мы можем увеличить наше предложение от одного описания отношения до двух, или трех, или даже четырех описаний, и наш подход продолжает быть в состоянии генерировать изображения, которые правильно описаны этими описаниями, в то время как другие методы терпят неудачу”, – говорит Ду.
Модель также продемонстрировала впечатляющую способность работать с описаниями, которые она не встречала ранее.
“Это очень перспективно, потому что это ближе к тому, как работают люди. Люди могут видеть только несколько примеров, но мы можем извлечь полезную информацию из этих нескольких примеров и объединить их вместе, чтобы создать бесконечное количество комбинаций. И наша модель имеет такое свойство, которое позволяет ей учиться на меньших данных, но обобщать до более сложных сцен или генераций изображений”, – говорит Ли.
Команда теперь будет проверять модель на реальных изображениях, которые более сложны, и исследовать, как в конечном итоге включить модель в робототехнические системы.












