Этика

Исследователи MIT Разработали Куриозно-Ориентированную Модель ИИ для Улучшения Тестирования Безопасности Чат-ботов

mm
Добавьте Unite.AI в избранные источники в Google

В последние годы большие языковые модели (LLM) и чат-боты ИИ стали невероятно распространенными, изменив способ нашего взаимодействия с технологиями. Эти сложные системы могут генерировать человеческие ответы, помогать с различными задачами и предоставлять ценные идеи.

Однако, поскольку эти модели становятся более совершенными, проблемы безопасности и потенциала генерации вредного контента вышли на первый план. Для обеспечения ответственного развертывания чат-ботов ИИ необходимы тщательное тестирование и меры безопасности.

Ограничения Текущих Методов Тестирования Безопасности Чат-ботов

В настоящее время основным методом тестирования безопасности чат-ботов ИИ является процесс, называемый красной командой. Это включает в себя человеческих тестировщиков, создающих подсказки, предназначенные для получения не安全ных или токсичных ответов от чат-бота. Раскрывая модель широкому спектру потенциально проблемных входных данных, разработчики стремятся выявить и устранить любые уязвимости или нежелательные поведения. Однако этот человеко-ориентированный подход имеет свои ограничения.

Учитывая огромные возможности пользовательских входных данных, практически невозможно для человеческих тестировщиков охватить все возможные сценарии. Даже с обширным тестированием могут быть пробелы в подсказках, используемых, оставляя чат-бот уязвимым для генерации не安全ных ответов, когда он сталкивается с новыми или неожиданными входными данными. Кроме того, ручной характер красной команды делает его трудоемким и ресурсоемким процессом, особенно поскольку языковые модели продолжают расти в размере и сложности.

Для решения этих ограничений исследователи обратились к автоматизации и методам машинного обучения для улучшения эффективности и результативности тестирования безопасности чат-ботов. Используя силу ИИ, они стремятся разработать более всесторонние и масштабируемые методы выявления и смягчения потенциальных рисков, связанных с большими языковыми моделями.

Куриозно-Ориентированный Подход Машинного Обучения к Красной Команде

Исследователи из лаборатории ИИ Improbable в MIT и лаборатории ИИ MIT-IBM Watson разработали инновационный подход к улучшению процесса красной команды с помощью машинного обучения. Их метод включает в себя обучение отдельной модели красной команды для автоматического генерирования разнообразных подсказок, которые могут вызвать более широкий спектр нежелательных ответов от тестируемого чат-бота.

Ключом к этому подходу является внушение чувства любопытства модели красной команды. Стимулируя модель к исследованию новых подсказок и сосредоточению внимания на генерации входных данных, которые вызывают токсичные ответы, исследователи стремятся выявить более широкий спектр потенциальных уязвимостей. Это любопытное исследование достигается с помощью комбинации методов обучения с подкреплением и измененных сигналов вознаграждения.

Модель красной команды включает бонус энтропии, который стимулирует модель к генерированию более случайных и разнообразных подсказок. Кроме того, вводятся бонусы новизны для стимулирования модели к созданию подсказок, которые семантически и лексически отличаются от ранее сгенерированных. Сосредоточив внимание на новизне и разнообразии, модель стимулируется к исследованию неисследованных территорий и выявлению скрытых рисков.

Для обеспечения того, чтобы сгенерированные подсказки оставались связными и естественными, исследователи также включают бонус языка в цель обучения. Этот бонус помогает предотвратить генерирование модели бессмысленного или неуместного текста, который мог бы обмануть классификатор токсичности и присвоить высокие баллы.

Куриозно-ориентированный подход показал замечательный успех в превосходстве над человеческими тестировщиками и другими автоматизированными методами. Он генерирует более широкий спектр различных подсказок и вызывает все более токсичные ответы от тестируемых чат-ботов. Заметно, что этот метод смог даже выявить уязвимости в чат-ботах, которые прошли обширные меры безопасности, разработанные человеком, подчеркивая его эффективность в выявлении потенциальных рисков.

Последствия для Будущего Безопасности ИИ

Разработка куриозно-ориентированной красной команды представляет собой значительный шаг вперед в обеспечении безопасности и надежности больших языковых моделей и чат-ботов ИИ. Поскольку эти модели продолжают эволюционировать и становиться более интегрированными в нашу повседневную жизнь, крайне важно иметь надежные методы тестирования, которые могут идти в ногу с их быстрым развитием.

Куриозно-ориентированный подход предлагает более быстрый и эффективный способ проведения контроля качества моделей ИИ. Автоматизируя генерирование разнообразных и новых подсказок, этот метод может значительно сократить время и ресурсы, необходимые для тестирования, одновременно улучшая охват потенциальных уязвимостей. Эта масштабируемость особенно ценна в быстро меняющихся средах, где модели могут требовать частых обновлений и повторного тестирования.

Кроме того, куриозно-ориентированный подход открывает новые возможности для настройки процесса тестирования безопасности. Например, используя большую языковую модель в качестве классификатора токсичности, разработчики могли бы обучить классификатор с помощью документов политики компании. Это позволило бы модели красной команды тестировать чат-боты на соответствие конкретным организационным руководящим принципам, обеспечивая более высокий уровень настройки и актуальности.

По мере того, как ИИ продолжает развиваться, важность куриозно-ориентированной красной команды в обеспечении более безопасных систем ИИ нельзя переоценить. Принимая активные меры для выявления и устранения потенциальных рисков, этот подход способствует разработке более надежных и заслуживающих доверия чат-ботов ИИ, которые могут быть уверенно развернуты в различных областях.

Алекс Макфарленд - журналист и писатель в области искусственного интеллекта, исследующий последние разработки в этой области. Он сотрудничал с многочисленными стартапами и изданиями в области искусственного интеллекта во всем мире.