Робототехника и физический ИИ
Искусственный интеллект помогает обучать команды сотрудничающих роботов и беспилотников
Команда исследователей в Университете Иллинойса Grainger College of Engineering разработала новый метод обучения нескольких агентов, таких как роботы и беспилотники, для совместной работы с использованием искусственного интеллекта (ИИ). Агенты полагаются на технику обучения с подкреплением, которая является одним из основных типов техник машинного обучения.
Децентрализованная техника
Хуй Тран – аэрокосмический инженер в университете.
«Легче, когда агенты могут общаться друг с другом», – сказал Хуй Тран. «Но мы хотели сделать это таким образом, чтобы они не общались друг с другом. Мы также сосредоточились на цитатах, где неясно, какие разные роли или задачи для агентов должны быть».
По словам Трана, этот сценарий более сложен, поскольку неясно, что один агент должен делать против другого агента.
«Интересный вопрос – как мы учимся выполнять задачу вместе во времени», – сказал он.
Техника обучения с подкреплением
Команда использовала технику машинного обучения, называемую обучением с подкреплением, чтобы обойти эту проблему. Это позволило им создать функцию полезности, которая говорит агенту, когда он делает что-то полезное для команды.
«С командными целями трудно знать, кто внес вклад в победу», – продолжил Тран. «Мы разработали технику машинного обучения, которая позволяет нам определить, когда отдельный агент внес вклад в глобальную командную цель. Если вы посмотрите на это в терминах спорта, один футболист может забить гол, но мы также хотим знать о действиях других товарищей по команде, которые привели к голу, как ассисты. Трудно понять эти задержанные эффекты».
Алгоритмы исследователей также определяют, когда агент или робот делает что-то, что противоречит или не вносит вклад в цель.
«Это не означает, что робот выбрал сделать что-то неправильно, просто что-то, что не полезно для конечной цели», – сказал он.
Алгоритмы были протестированы с помощью симулированных игр, таких как StarCraft.
«StarCraft может быть немного более непредсказуемым – мы были рады увидеть, что наш метод работает хорошо в этой среде».
Этот тип алгоритма применим к различным реальным ситуациям, говорит команда. Некоторые из потенциальных применений включают военный надзор, роботов на складе, контроль за трафиком, беспилотные автомобили, координирующие доставку, и контроль над электрической сетью.
Команда, осуществившая это прорывное исследование, включала Сын Хён Кима, Нил Ван Стралена и Гириша Човдхари. Оно было представлено на конференции по автономным агентам и многоагентным системам.












