Робототехника и физический ИИ

Как роботы учатся просить о помощи

mm
Добавьте Unite.AI в избранные источники в Google

В эволюционирующем мире робототехники выделяется новаторское сотрудничество между Принстонским университетом и Google (GOOGL ). Инженеры этих престижных учреждений разработали инновационный метод, который учит роботов одному из важнейших навыков: распознаванию ситуации, когда им нужна помощь, и способу попросить о ней. Этот прорыв представляет собой значительный шаг вперед в робототехнике, мостя пропасть между автономным функционированием и взаимодействием человека и робота.

Путь к созданию более интеллектуальных и независимых роботов всегда был осложнён одной значительной проблемой: сложностью и неоднозначностью человеческого языка. В отличие от бинарной ясности компьютерных кодов, человеческий язык полон нюансов и тонкостей, что делает его лабиринтом для роботов. Например, команда, такая простая, как “поднять чашку”, может стать сложной задачей, когда присутствуют несколько чашек. Роботы, оснащённые возможностью воспринимать окружающую среду и реагировать на язык, часто оказываются на распутье, когда сталкиваются с такими лингвистическими неопределенностями.

Количественная неопределенность

Решая эту проблему, команда Принстона и Google представила новый подход, который количественно оценивает “размытость” человеческого языка. Этот метод по сути измеряет уровень неопределенности в языковых командах и использует эту метрику для руководства действиями робота. В ситуациях, когда команда может привести к нескольким интерпретациям, робот теперь может оценить уровень неопределенности и решить, когда следует искать дальнейшее уточнение. Например, в среде с несколькими чашками более высокая степень неопределенности побудит робота спросить, какую чашку поднять, тем самым избегая потенциальных ошибок или неэффективностей.

Этот подход не только наделяет роботов лучшим пониманием языка, но также повышает их безопасность и эффективность при выполнении задач. Интегрируя большие языковые модели (LLM), такие как те, что стоят за ChatGPT, исследователи сделали значительный шаг в приближении действий робота к ожиданиям и потребностям человека.

Роль больших языковых моделей

Интеграция LLM играет решающую роль в этом новом подходе. LLM необходимы для обработки и интерпретации человеческого языка. В этом контексте они используются для оценки и измерения неопределенности, присутствующей в языковых командах, данных роботам.

Однако зависимость от LLM не обходится без своих проблем. Как отметила исследовательская команда, выходные данные LLM иногда могут быть ненадежными.

Анирудха Маджумдар, ассистент-профессор в Принстоне, подчеркивает важность этого баланса:

“Слепое следование планам, сгенерированным LLM, может привести к тому, что роботы будут действовать в небезопасной или недостоверной манере, и поэтому нам нужно, чтобы наши роботы, основанные на LLM, знали, когда они не знают.”

Это подчеркивает необходимость нюансов подхода, где LLM используются как инструменты для руководства, а не как неошибочные решатели.

Практическое применение и тестирование

Практичность этого метода была протестирована в различных сценариях, демонстрируя его универсальность и эффективность. Одним из таких тестов было задействование роботизированной руки, задачей которой было сортировать игрушечные продукты питания по разным категориям. Этот простой сетап продемонстрировал способность робота эффективно ориентироваться в задачах с четкими выборами.

Изображение: Принстонский университет

Сложность значительно возросла в другом эксперименте, в котором роботизированная рука была установлена на колесной платформе на кухне в офисе. Здесь робот столкнулся с реальными проблемами, такими как определение правильного предмета для размещения в микроволновой печи при наличии нескольких вариантов.

Через эти тесты роботы успешно продемонстрировали свою способность использовать количественную неопределенность для принятия решений или запроса уточнения, тем самым подтвердив практическую полезность этого метода.

Будущие последствия и исследования

Глядя вперед, последствия этого исследования распространяются далеко за пределы текущих применений. Команда, возглавляемая Маджумдаром и аспирантом Алленом Реном, исследует, как этот подход может быть применен к более сложным проблемам в робототехнике и искусственном интеллекте. Это включает в себя сценарии, в которых роботы должны объединять зрительную и языковую информацию для принятия решений, еще больше сокращая разрыв между робототехническим пониманием и человеческим взаимодействием.

Проводимые исследования направлены не только на улучшение способности роботов выполнять задачи с более высокой точностью, но и на навигацию в мире с пониманием, подобным человеческому познанию. Это исследование может проложить путь для роботов, которые не только более эффективны и безопасны, но и более соответствуют нюансированным требованиям человеческой среды.

Вы можете найти опубликованное исследование здесь.

Алекс возглавляет новостные операции Unite.AI, основанные на ИИ, сочетая журналистику, исследования и автоматизацию, чтобы обеспечить своевременное и масштабируемое освещение искусственного интеллекта. Его работа способствует эффективному выявлению новых разработок в области искусственного интеллекта, при этом поддерживая редакционные стандарты издания.