Модели и платформы ИИ
Искусственный интеллект может избегать конкретных нежелательных поведений с помощью новых алгоритмов
По мере того, как алгоритмы и системы искусственного интеллекта становятся более сложными и принимают на себя более значительные обязанности, становится все более важным обеспечить, чтобы системы искусственного интеллекта избегали опасного, нежелательного поведения. Недавно команда исследователей из Университета Массачусетса в Амхерсте и Стэнфорда опубликовала статью, в которой демонстрируется, как можно избежать конкретного поведения искусственного интеллекта с помощью техники, которая позволяет получить точные математические инструкции, которые можно использовать для корректировки поведения искусственного интеллекта.
Согласно TechXplore, исследования были основаны на предположении, что несправедливое/небезопасное поведение можно определить с помощью математических функций и переменных. Если это так, то должно быть возможно для исследователей обучить системы избегать этих конкретных поведений. Команда исследователей стремилась разработать набор инструментов, который можно было бы использовать пользователями искусственного интеллекта для указания поведений, которых они хотели бы избежать, и позволить инженерам искусственного интеллекта надежно обучать систему, которая будет избегать нежелательных действий в реальных сценариях.
Филипп Томас, первый автор статьи и помощник профессора компьютерных наук в Университете Мичигана в Амхерсте, объяснил, что команда исследователей стремится продемонстрировать, что разработчики алгоритмов машинного обучения могут сделать более простым для пользователей описать нежелательное поведение и сделать более вероятным, что система искусственного интеллекта будет избегать этого поведения.
Команда исследователей протестировала свою технику, применив ее к распространенной проблеме в области науки о данных – гендерному предвзятости. Команда исследователей стремилась сделать алгоритмы, используемые для прогнозирования среднего балла студентов колледжа, более справедливыми, уменьшив гендерное предвзятость. Команда исследователей использовала экспериментальный набор данных и инструктировала свою систему искусственного интеллекта избегать создания моделей, которые систематически занижали или завышали средний балл для одного пола. В результате инструкций исследователей алгоритм создал модель, которая лучше прогнозировала средний балл студентов и имела значительно меньше системной гендерной предвзятости, чем предыдущие модели. Предыдущие модели прогнозирования среднего балла страдали от предвзятости, потому что модели уменьшения предвзятости часто были слишком ограничены, чтобы быть полезными, или не использовали вообще никакого уменьшения предвзятости.
Команда исследователей также разработала другой алгоритм. Этот алгоритм был реализован в автоматическом инсулиновом насосе, и алгоритм был предназначен для балансирования производительности и безопасности. Автоматические инсулиновые насосы должны решать, какой дозы инсулина следует вводить пациенту после еды. Насос должен вводить дозу инсулина, которая будет достаточно большой, чтобы поддерживать уровень сахара в крови в норме. Дозы инсулина, которые вводятся, не должны быть слишком большими или слишком малыми.
Алгоритмы машинного обучения уже достаточно эффективны в выявлении закономерностей в реакции человека на дозы инсулина, но существующие методы анализа не могут позволить врачам указать результаты, которых следует избегать, такие как низкие уровни сахара в крови. Напротив, команда исследователей смогла разработать метод, который можно было обучить вводить дозы инсулина, которые остаются в пределах двух крайностей, предотвращая как недоинсулиноз, так и переинсулиноз. Хотя система еще не готова для тестирования на реальных пациентах, более совершенный искусственный интеллект на основе этого подхода может улучшить качество жизни людей, страдающих диабетом.
В исследовательской статье исследователи называют алгоритм “Селедонианским” алгоритмом. Это ссылка на три закона робототехники, описанные научно-фантастическим автором Айзеком Азимовым. Это означает, что система искусственного интеллекта “не может причинить вреда человеку или, не действуя, позволить человеку пострадать”. Команда исследователей надеется, что их框架 позволит исследователям и инженерам искусственного интеллекта создать разнообразные алгоритмы и системы, которые избегают опасного поведения. Эмма Брунскилл, старший автор статьи и помощник профессора компьютерных наук в Стэнфорде, объяснила TechXplore,
“Мы хотим продвигать искусственный интеллект, который уважает ценности своих человеческих пользователей и оправдывает доверие, которое мы возлагаем на автономные системы.”












