Моделі та платформи ШІ

Алгоритм TextFooler обманює NLP AI

mm
Додайте Unite.AI до бажаних джерел у Google

Незважаючи на те, що алгоритми та системи обробки природної мови стали досить вражаючими за останні роки, вони все ще вразливі до певного типу експлойту, відомого як “адверсарний приклад”. Адверсарні приклади – це спеціально сконструйовані фрази, які можуть змусити систему обробки природної мови поводитися несподіваним і нежаданим чином. Програми штучного інтелекту можуть бути змусені поводитися неправильно за допомогою цих дивних прикладів, і внаслідок цього дослідники штучного інтелекту намагаються розробити способи захисту від впливу адверсарних прикладів.

Нещодавно команда дослідників з Університету Гонконгу та Агентства науки, технологій та досліджень Сінгапуру спільно створили алгоритм, який демонструє небезпеку адверсарних прикладів. Як повідомляє Wired, алгоритм був названий TextFooler командою дослідників і функціонує шляхом тонкої зміни частини речення, впливаючи на те, як класифікатор обробки природної мови може інтерпретувати речення. Наприклад, алгоритм перетворив одне речення на інше подібне речення, і речення було подано до класифікатора, призначеного для визначення, чи є відгук негативним чи позитивним. Оригінальне речення було:

“Персонажі, відлиті в неможливих вимушених ситуаціях, є повністю відчужені від реальності.”

Воно було перетворено на це речення:

“Персонажі, відлиті в неможливих сконструйованих обставинах, є повністю відчужені від реальності.”

Ці тонкі зміни змусили текстовий класифікатор класифікувати відгук як позитивний замість негативного. Команда дослідників протестувала той же підхід (заміну певних слів синонімами) на декілька різних наборів даних і алгоритмів текстової класифікації. Команда дослідників повідомляє, що їм вдалося знижувати точність класифікації алгоритму до всього лише 10%, знизивши її з 90%. Це відбувається попри те, що люди, які читали ці речення, інтерпретували б їх як такі, що мають однаковий зміст.

Ці результати викликають занепокоєння в епоху, коли алгоритми обробки природної мови та штучний інтелект все частіше використовуються для важливих завдань, таких як оцінка медичних претензій або аналіз юридичних документів. Невідомо, наскільки великою загрозою адверсарні приклади є для зараз використовуваних алгоритмів. Дослідницькі команди по всьому світу все ще намагаються з’ясувати, який вплив вони можуть мати. Нещодавно опублікований звіт групи штучного інтелекту Стенфордського університету припустив, що адверсарні приклади можуть обманути алгоритми штучного інтелекту та бути використані для скоєння податкового шахрайства.

Є певні обмеження недавнього дослідження. Наприклад, Самір Сінгх, асистент професора комп’ютерних наук Університету Каліфорнії в Ірвайні, відзначає, що адверсарний метод, який був використаний, був ефективним, але він залежить від певних знань про архітектуру штучного інтелекту. Штучний інтелект повинен бути багаторазово досліджений, поки не буде знайдена ефективна група слів, і такі повторювані атаки можуть бути помічені програмами безпеки. Сінгх і його колеги провели власне дослідження на цю тему і виявили, що просунуті системи, такі як алгоритми OpenAI, можуть надавати расистський, шкідливий текст, коли їм надаються певні тригерні фрази.

Адверсарні приклади також можуть бути потенційною проблемою при роботі з візуальними даними, такими як фотографії чи відео. Одним із відомих прикладів є застосування певних тонких цифрових перетворень до зображення кішки, що змусило класифікатор зображень інтерпретувати його як монітор чи настільний комп’ютер. В іншому прикладі дослідження, проведене професором Девідом Сонгом з Університету Каліфорнії в Берклі, показало, що адверсарні приклади можуть бути використані для зміни того, як комп’ютерні системи бачать дорожні знаки, що потенційно може бути небезпечним для автономних транспортних засобів.

Дослідження, подібне до того, яке провела команда Гонконгу-Сінгапуру, може допомогти інженерам штучного інтелекту краще зрозуміти, які вразливості мають алгоритми штучного інтелекту, і потенційно розробити способи захисту від цих вразливостей. Наприклад, ансамблеві класифікатори можуть бути використані для зниження ймовірності того, що адверсарний приклад зможе обманути систему комп’ютерного бачення. За допомогою цього методу використовується кілька класифікаторів, і до вхідного зображення застосовуються певні перетворення. Більшість класифікаторів зазвичай визначає аспекти справжнього змісту зображення, які потім агрегуються разом. Результатом є те, що навіть якщо кілька класифікаторів будуть обмануті, більшість із них не буде обманута, і зображення буде правильно класифіковано. re used and slight transformations are made to the input image. The majority of the classifiers will typically discern aspects of the image’s true content, which are then aggregated together. The result is that even if a few of the classifiers are fooled, most of them won’t be and the image will be properly classified.

Блогер і програміст з спеціалізацією у темах Machine Learning і Deep Learning. Даніель сподівається допомогти іншим використовувати силу штучного інтелекту для соціальної добробути.