Модели и платформы ИИ
DeepMind и Google Brain Стремятся Создать Методы для Улучшения Эффективности Обучения с Положительным подкреплением

Системы обучения с положительным подкреплением могут быть мощными и устойчивыми, способными выполнять чрезвычайно сложные задачи через тысячи итераций обучения. Хотя алгоритмы обучения с положительным подкреплением способны обеспечивать сложное и иногда удивительное поведение, они требуют много времени для обучения и требуют огромных объемов данных. Эти факторы делают методы обучения с положительным подкреплением довольно неэффективными, и недавно исследовательские команды из Alphabet (GOOG ) (GOOGL ) DeepMind и Google Brain попытались найти более эффективные методы создания систем обучения с положительным подкреплением.
Как сообщает VentureBeat, объединенная исследовательская группа недавно предложила методы повышения эффективности обучения с положительным подкреплением. Одним из предложенных улучшений был алгоритм, называемый Адаптивным Обменом Политикой Поведения (ABPS), а другим был каркас, называемый Универсальными Аппроксиматорами Функции Ценности (UVFA). ABPS позволяет пулам агентов ИИ делиться их адаптивно выбранными опытами, а UVFA позволяет этим агентам ИИ одновременно исследовать направленные политики исследования.
ABPS предназначен для ускорения настройки гиперпараметров при обучении модели. ABPS делает поиск оптимальных гиперпараметров быстрее, позволяя нескольким разным агентам с разными гиперпараметрами делиться их поведенческими политиками. Более точно, ABPS позволяет агентам обучения с положительным подкреплением выбирать действия из действий, которые политика сочла приемлемыми, и после этого агенту предоставляется награда и наблюдение на основе следующего состояния.
Агенты ИИ обучения с положительным подкреплением обучаются с различными комбинациями возможных гиперпараметров, таких как скорость затухания и скорость обучения. При обучении модели цель состоит в том, чтобы модель сходилась к комбинации гиперпараметров, которая дает ей лучшую производительность, и в данном случае те, которые также улучшают эффективность данных. Эффективность увеличивается путем обучения многих агентов одновременно и выбора поведения только одного агента для развертывания на следующем временном шаге. Политика, которой обладает целевой агент, используется для выборки действий. Переходы затем регистрируются в общем пространстве, и это пространство постоянно оценивается, чтобы политика выбора не приходилось происходить так часто. В конце обучения выбирается ансамбль агентов, и лучшие агенты выбираются для окончательного развертывания.
В отношении UVFA, он пытается решить одну из общих проблем обучения с положительным подкреплением, когда агенты с слабым подкреплением часто не учатся задачам. UVFA пытается решить эту проблему, имея агента, который учится отдельному набору политик эксплуатации и исследования одновременно. Разделение задач создает каркас, который позволяет политикам исследования продолжать исследовать окружающую среду, а политикам эксплуатации продолжать пытаться максимизировать награду для текущей задачи. Политики исследования UVFA служат базовой архитектурой, которая будет продолжать улучшаться, даже если нет естественных наград, которые обнаруживаются. В таком случае, функция, которая соответствует внутренним наградам, приближается, что побуждает агентов исследовать все состояния в окружающей среде, даже если они часто возвращаются к знакомым состояниям.
Как объясняет VentureBeat, когда каркас UVFA используется, внутренние награды системы предоставляются напрямую агенту в качестве входных данных. Агент затем отслеживает представление всех входных данных (таких как награды, действия и состояние) во время эпизода. В результате награда сохраняется во времени, и политика агента хотя бы частично информирована ею во все времена.
Это достигается с помощью использования модуля “эпизодической новизны” и модуля “новизны на протяжении всей жизни”. Функция первого модуля заключается в том, чтобы удерживать текущую эпизодическую память и сопоставлять текущие находки с ранее упомянутым представлением, позволяя агенту определить внутреннюю эпизодическую награду для каждого шага обучения. После этого состояние, связанное с текущим наблюдением, добавляется в память. Тем временем, модуль новизны на протяжении всей жизни отвечает за влияние на частоту исследования агентом в течение многих эпизодов.
Согласно командам Alphabet/Google, новые методы обучения уже продемонстрировали потенциал для существенного улучшения при обучении системы обучения с положительным подкреплением. UVFA смогла удвоить производительность некоторых базовых агентов, которые играли в различные игры Atari. Тем временем, ABPS смогла увеличить производительность на некоторых из тех же игр Atari, уменьшив дисперсию среди лучших агентов примерно на 25%. Алгоритм, обученный UVFA, смог достичь высокого счета в Pitfall самостоятельно, не имея никаких сконструированных функций человеческих демонстраций.












