Взгляд Anderson

Борьба за предотвращение обмана ИИ при тестировании

mm
Добавьте Unite.AI в избранные источники в Google

Новые исследования, проведенные в китайском университете, дают представление о том, почему генеративные модели обработки естественного языка, такие как GPT-3, склонны к “обману” при ответе на трудные вопросы, давая ответы, которые могут быть технически правильными, но без реального понимания того, почему ответ правильный, и почему они демонстрируют небольшую или отсутствующую способность объяснить логику своих “легких” ответов. Исследователи также предлагают новые методы для того, чтобы системы “учились усерднее” во время фазы обучения.

Проблема двойная: во-первых, мы проектируем системы, которые стремятся достичь результатов быстро и с оптимальным использованием ресурсов. Даже когда, как в случае с GPT-3, ресурсы могут быть значительно больше, чем те, которые могут быть использованы средним проектом исследований NLP, эта культура результативной оптимизации все еще доминирует в методологии, потому что она стала доминирующей в академической конвенции.

Следовательно, наши архитектуры обучения вознаграждают модели, которые быстро сходятся и производят, казалось бы, подходящие ответы на вопросы, даже если модель NLP в дальнейшем не может оправдать свой ответ или продемонстрировать, как она пришла к своим выводам.

Ранняя склонность к обману

Это происходит потому, что модель учится “shortcut-ответам” гораздо раньше в процессе обучения, чем она учится более сложным типам приобретения знаний. Поскольку повышенная точность часто вознаграждается довольно безразлично на протяжении всего процесса обучения, модель затем отдает приоритет любому подходу, который позволит ей ответить на вопрос “легко” и без реального понимания.

Поскольку обучение с помощью “shortcut” неизбежно приведет к первым успехам в процессе обучения, сессия естественным образом отклонится от более сложной задачи приобретения полезной и более полной эпистемологической перспективы, которая может содержать более глубокие и проницательные слои атрибуции и логики.

Кормление ИИ “легкими” ответами

Вторая проблема заключается в том, что, хотя недавние исследовательские инициативы изучали тенденцию ИИ к “обману” таким образом и определили явление “shortcut”, до сих пор не было попыток классифицировать материал, облегчающий “shortcut”, в наборе данных, что было бы логическим первым шагом в решении того, что может оказаться фундаментальной архитектурной ошибкой в системах чтения и понимания текста (MRC).

Новая работа, совместный проект Института компьютерных технологий Вансуаня и лаборатории вычислительной лингвистики MOE в Пекинском университете, тестирует различные языковые модели на новом аннотированном наборе данных, который включает классификации для “легких” и “трудных” решений возможного вопроса.

Источник: https://arxiv.org/pdf/2106.01024.pdf

Источник: https://arxiv.org/pdf/2106.01024.pdf

Набор данных использует парафразирование в качестве критерия для более сложных и глубоких ответов, поскольку семантическое понимание необходимо для переформулирования полученных знаний. Напротив, “shortcut-ответы” могут использовать токены, такие как даты, и другие ключевые слова, чтобы произвести ответ, который является фактически точным, но без контекста или рассуждений.

Компонент “shortcut” в аннотациях включает сопоставление слов вопроса (QWM) и простое сопоставление (SpM). Для QWM модель использует сущности, извлеченные из предоставленного текстового данных, и отбрасывает контекст; для SpM модель определяет совпадение между предложениями ответов и вопросами, которые оба предоставляются в данных обучения.

“Shortcut-данные” почти “вирусны” по влиянию в наборе данных

Исследователи утверждают, что наборы данных имеют тенденцию содержать высокий процент вопросов-“shortcut”, которые заставляют обученные модели полагаться на “shortcut-трюки”.

Две модели, использованные в экспериментах, были BiDAF и BERT-base от Google. Исследователи наблюдают, что даже когда они обучаются на вариациях наборов данных с более высоким процентом “трудных” вопросов, обе модели все равно показывают лучшие результаты на вопросах-“shortcut”, чем на более сложных парафразированных вопросах, несмотря на небольшое количество примеров в наборах данных.

Это представляет “shortcut-данные” почти как вирус – для того, чтобы они были приняты и приоритезированы в обучении, необходимо очень мало их присутствия в наборе данных, чтобы они были приняты и приоритезированы в обучении, согласно обычным стандартам и практикам в NLP.

Доказательство обмана

Один из методов, используемых в исследовании для доказательства хрупкости ответа-“shortcut”, заключается в замене “легкого” слова-сущности на аномальное слово. Когда используется метод “shortcut”, логика ответа-“обмана” не может быть предоставлена; но когда ответ был дан из более глубокого контекста и семантической оценки более широкого диапазона текста, возможно для системы проанализировать ошибку и реконструировать правильный ответ.

Замена 'Бейонсе' (человека) на 'Америку' (место), показывает, имеет ли модель какую-либо фоническую логику для своего ответа.

Замена ‘Бейонсе’ (человека) на ‘Америку’ (место), показывает, имеет ли модель какую-либо фоническую логику для своего ответа.

“Shortcut” из-за экономической необходимости

Что касается некоторых архитектурных причин, почему “shortcut” так приоритезируются в потоках обучения NLP, авторы комментируют ‘Модели MRC могут выучить трюки-“shortcut”, такие как QWM, с меньшими вычислительными ресурсами, чем задачи понимания, такие как определение парафраз’.

Это, затем, может быть непреднамеренным результатом стандартных оптимизационных и ресурсо-сохраняющих философий в подходах к чтению и пониманию текста, и давления на получение результатов с ограниченными ресурсами в сжатые сроки.

Исследователи также отмечают:

‘[Поскольку] трюк-“shortcut” может быть использован для ответа на большинство вопросов обучения правильно, ограниченные нерешенные вопросы могут не мотивировать модели к изучению сложных решений, требующих сложных навыков.’

Если результаты статьи впоследствии подтвердятся, то, кажется, что огромная и постоянно растущая область предварительной обработки данных может потребовать рассмотреть “скрытые подсказки” в данных как проблему, которую необходимо решить в долгосрочной перспективе, или пересмотреть архитектуры NLP, чтобы отдать приоритет более сложным рутинам для ингестии данных.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai