Етика

Дослідники MIT розробили модель штучного інтелекту, керовану цікавістю, для покращення тестування безпеки чат-ботів

mm
Додайте Unite.AI до бажаних джерел у Google

За останні роки більші мовні моделі (LLM) та чат-боти штучного інтелекту стали надзвичайно поширеними, змінивши спосіб нашого спілкування з технологіями. Ці складні системи можуть генерувати відповіді, подібні до людських, допомагати у виконанні різних завдань та надавати цінні знання.

Однак, оскільки ці моделі стають все більш досконалими, питання щодо їхньої безпеки та потенціалу генерації шкідливого вмісту стають все більш актуальними. Для забезпечення відповідального розгортання чат-ботів штучного інтелекту необхідні повні тести та заходи безпеки.

Обмеження сучасних методів тестування безпеки чат-ботів

Наразі основним методом тестування безпеки чат-ботів штучного інтелекту є процес, званий “red-teaming”. Це включає в себе створення людськими тестерами запитів, призначених для отримання небезпечних або токсичних відповідей від чат-бота. Розкриваючи модель широкому спектру потенційно проблемних вхідних даних, розробники намагаються виявити та виправити будь-які вразливості або нежадані поведінки. Однак цей людський підхід має свої обмеження.

Ураховуючи величезну кількість можливих вхідних даних користувачів, майже неможливо для людських тестерів охопити всі потенційні сценарії. Навіть з розширеними тестами можуть бути прогалини в запитах, що використовуються, залишаючи чат-бот вразливим до генерації небезпечних відповідей при зустрічі з новими або несподіваними вхідними даними. Крім того, ручний характер “red-teaming” робить його тривалим і ресурсоємним процесом, особливо оскільки мовні моделі продовжують зростати в розмірі та складності.

Для вирішення цих обмежень дослідники звернулися до автоматизації та технік машинного навчання для покращення ефективності та ефективності тестування безпеки чат-ботів. Використовуючи сам штучний інтелект, вони намагаються розробити більш повні та масштабовані методи для виявлення та пом’якшення потенційних ризиків, пов’язаних з великими мовними моделями.

Модель штучного інтелекту, керована цікавістю, для “red-teaming”

Дослідники з Improbable AI Lab у MIT та MIT-IBM Watson AI Lab розробили інноваційний підхід для покращення процесу “red-teaming” за допомогою машинного навчання. Їхній метод включає в себе навчання окремої моделі “red-teaming” для автоматичної генерації різноманітних запитів, які можуть викликати ширший спектр нежаданих відповідей від чат-бота, який тестується.

Ключ до цього підходу полягає в імплантації відчуття цікавості в модель “red-teaming”. Заохочуючи модель досліджувати нові запити та зосереджуватися на генерації вхідних даних, які викликають токсичні відповіді, дослідники намагаються виявити ширший спектр потенційних вразливостей. Це дослідження, кероване цікавістю, досягається завдяки комбінації технік навчання з підкріпленням та модифікованих сигналів винагороди.

Модель, керована цікавістю, включає бонус ентропії, який заохочує модель “red-teaming” генерувати більш випадкові та різноманітні запити. Крім того, вводяться винагороди новизни для стимулювання моделі створювати запити, які семантично та лексично відрізняються від раніше згенерованих. Зосереджуючись на новизні та різноманітності, модель штовхає до дослідження неозорі території та виявлення прихованих ризиків.

Для забезпечення того, щоб згенеровані запити залишалися зрозумілими та природними, дослідники також включають бонус мови в тренувальну мету. Цей бонус допомагає запобігти генерації моделлю “red-teaming” безглуздого або нерелевантного тексту, який міг би обманути класифікатор токсичності, присвоюючи йому високі оцінки.

Підхід, керований цікавістю, продемонстрував вражаючий успіх у перевершенні як людських тестерів, так і інших автоматизованих методів. Він генерує більшу різноманітність різних запитів та викликає все більш токсичні відповіді від чат-ботів, які тестуються. Зокрема, цей метод навіть зміг виявити вразливості в чат-ботах, які пройшли розширені людські заходи безпеки, підкреслюючи його ефективність у виявленні потенційних ризиків.

Вплив на майбутнє безпеки штучного інтелекту

Розробка моделі “red-teaming”, керованої цікавістю, є значним кроком вперед у забезпеченні безпеки та надійності великих мовних моделей та чат-ботів штучного інтелекту. Коли ці моделі продовжують еволюціонувати та інтегруватися в нашу повсякденну життя, важливо мати надійні методи тестування, які можуть тримати темп з їхнім швидким розвитком.

Підхід, керований цікавістю, пропонує швидший та більш ефективний спосіб проведення забезпечення якості моделей штучного інтелекту. Автоматизуючи генерацію різноманітних та нових запитів, цей метод може суттєво скоротити час та ресурси, необхідні для тестування, одночасно покращуючи охоплення потенційних вразливостей. Ця масштабованість особливо цінна в швидко змінних середовищах, де моделі можуть потребувати частого оновлення та повторного тестування.

Крім того, підхід, керований цікавістю, відкриває нові можливості для налаштування процесу тестування безпеки. Наприклад, використовуючи велику мовну модель як класифікатор токсичності, розробники могли б тренувати класифікатор за допомогою документів політики компанії. Це дозволило б моделі “red-teaming” тестувати чат-боти на відповідність конкретним організаційним директивам, забезпечуючи вищу ступінь налаштування та актуальності.

Когда штучний інтелект продовжує розвиватися, важливість моделі “red-teaming”, керованої цікавістю, у забезпеченні безпеки штучного інтелекту не можна переоцінити. Проактивно виявляючи та виправляючи потенційні ризики, цей підхід сприяє розробці більш надійних та довірчих чат-ботів штучного інтелекту, які можуть бути впевнено розгорнуті в різних галузях.

Алекс Макфарленд - журналіст та письменник з питань штучного інтелекту, який досліджує останні розробки в галузі штучного інтелекту. Він співпрацював з численними стартапами та виданнями з штучного інтелекту у світі.