Модели и платформы ИИ
DeepMind сообщает о новом методе обучения безопасному обучению с подкреплением ИИ
Обучение с подкреплением – это перспективное направление развития ИИ, которое позволяет создавать ИИ, способный справляться с чрезвычайно сложными задачами. Алгоритмы обучения с подкреплением используются при создании мобильных робототехнических систем и самоходных автомобилей, а также в других приложениях. Однако из-за того, что обучение с подкреплением осуществляется, эти алгоритмы могут иногда проявлять странное и непредсказуемое поведение. Это поведение может быть опасным, и исследователи ИИ называют эту проблему “проблемой безопасного исследования”, когда ИИ застревает в исследовании небезопасных состояний.
Недавно исследовательская лаборатория ИИ Google DeepMind опубликовала статью, в которой предложила новые методы решения проблемы безопасного исследования и обучения ИИ с подкреплением в более безопасной форме. Метод, предложенный DeepMind, также исправляет ошибки в системе вознаграждения или лазейки в критериях вознаграждения.
Новый метод DeepMind имеет две различные системы, предназначенные для руководства поведением ИИ в ситуациях, когда может возникнуть небезопасное поведение. Две системы, используемые в методе обучения DeepMind, – это генеративная модель и модель прямой динамики. Обе эти модели обучаются на различных данных, таких как демонстрации экспертами безопасности и совершенно случайные траектории транспортных средств. Данные помечаются супервайзером с конкретными значениями вознаграждения, и агент ИИ будет учиться на закономерностях поведения, которые позволят ему собрать наибольшее вознаграждение. Небезопасные состояния также помечены, и после того, как модель смогла успешно предсказать вознаграждения и небезопасные состояния, она развертывается для выполнения целевых действий.
Исследовательская команда объясняет в статье, что идея состоит в том, чтобы создать возможные поведения с нуля, предложить желаемые поведения и сделать эти гипотетические сценарии как можно более информативными, одновременно избегая прямого вмешательства в среду обучения. Команда DeepMind называет этот подход ReQueST, или синтез запросов вознаграждения через оптимизацию траектории.
ReQueST может привести к четырем различным типам поведения. Первый тип поведения пытается максимизировать неопределенность относительно моделей вознаграждения ансамбля. Тем временем поведение два и три пытаются минимизировать и максимизировать предсказанные вознаграждения. Предсказанные вознаграждения минимизируются для открытия поведений, которые модель может неправильно предсказывать. С другой стороны, предсказанное вознаграждение максимизируется для получения меток поведения с наивысшей информационной ценностью. Наконец, четвертый тип поведения пытается максимизировать новизну траекторий, чтобы модель продолжала исследовать, независимо от прогнозируемых вознаграждений.
Как только модель достигает желаемого уровня сбора вознаграждения, используется планирующий агент для принятия решений на основе выученных вознаграждений. Этот схема контроля, основанная на модели, позволяет агентам учиться избегать небезопасных состояний, используя динамическую модель и предсказывая возможные последствия, в отличие от поведения алгоритмов, которые учатся через чистую пробу и ошибку.
Как сообщает VentureBeat, исследователи DeepMind считают, что их проект – это первая система обучения с подкреплением, которая может учиться в контролируемой, безопасной форме:
«На наш взгляд, ReQueST – это первый алгоритм моделирования вознаграждения, который безопасно учится о небезопасных состояниях и масштабируется до обучения нейронных сетей моделей вознаграждения в средах с высокоразмерными, непрерывными состояниями. Пока мы продемонстрировали эффективность ReQueST только в симулированных доменах с относительно простой динамикой. Одним из направлений будущей работы является тестирование ReQueST в 3D-доменах с более реалистичной физикой и другими агентами, действующими в среде».












