Модели и платформы ИИ
Алгоритм TextFooler обманывает ИИ в обработке естественного языка
Несмотря на то, что алгоритмы и системы обработки естественного языка стали очень впечатляющими в последние годы, они все еще уязвимы для определенного типа эксплойта, известного как “адверсарный пример”. Адверсарные примеры – это тщательно сконструированные фразы, которые могут вызвать неожиданное и нежелательное поведение системы обработки естественного языка. Программы ИИ можно заставить вести себя неправильно с помощью этих странных примеров, и в результате исследователи ИИ пытаются разработать способы защиты от эффектов адверсарных примеров.
Недавно команда исследователей из Университета Гонконга и Агентства по науке, технологиям и исследованиям в Сингапуре сотрудничала в создании алгоритма, демонстрирующего опасность адверсарных примеров. Как сообщает Wired, алгоритм был назван TextFooler исследовательской командой и работает путем незначительных изменений частей предложения, влияя на то, как классификатор обработки естественного языка может интерпретировать предложение. Например, алгоритм преобразовал одно предложение в другое подобное предложение, и предложение было подано в классификатор, предназначенный для определения, является ли отзыв положительным или отрицательным. Оригинальное предложение было:
“Персонажи, поставленные в невозможных искусственных ситуациях, полностью отчуждены от реальности.”
Оно было преобразовано в следующее предложение:
“Персонажи, поставленные в невозможных сконструированных обстоятельствах, полностью полностью отчуждены от реальности.”
Эти незначительные изменения заставили текстовый классификатор классифицировать отзыв как положительный вместо отрицательного. Исследовательская команда протестировала тот же подход (замену определенных слов синонимами) на нескольких различных наборах данных и алгоритмах текстовой классификации. Исследовательская команда сообщает, что они смогли снизить точность классификации алгоритма до 10%, с 90%. Это несмотря на то, что люди, читающие эти предложения, интерпретируют их как имеющие одинаковое значение.
Эти результаты тревожны в эпоху, когда алгоритмы обработки естественного языка и ИИ используются все чаще и чаще, и для важных задач, таких как оценка медицинских претензий или анализ юридических документов. Неизвестно, насколько большой опасности адверсарные примеры представляют для текущих алгоритмов. Исследовательские команды по всему миру все еще пытаются определить, какой эффект они могут иметь. Недавно опубликованный отчет Стэнфордской группы ИИ, ориентированного на человека, предполагает, что адверсарные примеры могут обмануть алгоритмы ИИ и быть использованы для совершения налогового мошенничества.
Существуют некоторые ограничения недавнего исследования. Например, Самир Сингх, помощник профессора компьютерных наук в Университете Калифорнии, Ирвайн, отмечает, что использованный адверсарный метод был эффективным, но он зависит от некоторых знаний архитектуры ИИ. ИИ необходимо многократно проверять, пока не будет найдена эффективная группа слов, и такие повторяющиеся атаки могут быть обнаружены программами безопасности. Сингх и его коллеги провели собственное исследование по этой теме и обнаружили, что продвинутые системы, такие как алгоритмы OpenAI, могут производить расистский, вредный текст при определенных триггерных фразах.
Адверсарные примеры также являются потенциальной проблемой при работе с визуальными данными, такими как фотографии или видео. Один известный пример включает применение определенных тонких цифровых преобразований к изображению котенка, что заставляет классификатор изображений интерпретировать его как монитор или настольный компьютер. В другом примере исследование, проведенное профессором Университета Калифорнии, Беркли, Давном Сонгом, показало, что адверсарные примеры могут быть использованы для изменения того, как компьютерные системы видения воспринимают дорожные знаки, что потенциально может быть опасно для автономных транспортных средств.
Исследования, такие как те, которые были проведены гонконгско-сингапурской командой, могут помочь инженерам ИИ лучше понять, какие уязвимости имеют алгоритмы ИИ, и потенциально разработать способы защиты от этих уязвимостей. Например, ансамблевые классификаторы могут быть использованы для снижения вероятности того, что адверсарный пример сможет обмануть систему компьютерного зрения. С помощью этого метода используется несколько классификаторов и производятся незначительные преобразования входного изображения. Большинство классификаторов обычно определяют аспекты истинного содержания изображения, которые затем агрегируются вместе. Результатом является то, что даже если несколько классификаторов обмануты, большинство из них не будет обмануто, и изображение будет правильно классифицировано. Адверсарные примеры












