Погляд Anderson

Перелом ChatGPT та інших “закритих” моделей AI за допомогою їхніх власних API

mm
Додайте Unite.AI до бажаних джерел у Google
ChatGPT-4o, Firefly, Flux (via Krita)

За новими дослідженнями, ChatGPT та інші великі моделі AI можуть бути перепрограмовані через офіційні канали тонкої настройки, щоб ігнорувати правила безпеки та надавати детальні інструкції щодо здійснення терористичних дій, кіберзлочинів або інших типів “забороненої” дискусії. Автори нової роботи стверджують, що навіть маленькі кількості прихованих навчальних даних можуть перетворити модель на корисного спільника, незважаючи на численні вбудовані засоби захисту в таких системах.

 

Засоби захисту, побудовані в великих мовних моделях, часто характеризуються як “жорстко закодовані” або в якійсь мірі незмінні; запитайте ChatGPT, як виготовити вибухові речовини, створити фотореалістичну глибоку підробку реальної людини або здійснити кібератаку, і відмову, яка слідує, пояснить, що такі запити порушують політику вмісту OpenAI.

На практиці не потрібно проводити формальне тестування на проникнення популярної мовної моделі, щоб знати, що ці поручні є недосконалими; іноді справжні безпечні запити можуть бути визнані обурливими, або ж справді виробляти необґрунтовану обурливу відповідь у зображеннях або тексті.

Ці результати можуть виникати з базових моделей LMs, таких як ChatGPT варіанти, і різних варіантів Claude, а також відкритих джерел, таких як Llama.

Майте все по-своєму

Великі постачальники мовних моделей, такі як OpenAI, тепер пропонують платний доступ до тонкої настройки API, що дозволяє користувачам перепрограмувати ці моделі для спеціальних застосунків, навіть без прямого доступу до ваг моделі на їхньому власному локальному обладнанні (обладнанні, яке, в будь-якому випадку, було б малоймовірним, щоб розмістити великі комерційні моделі цього типу).

У таких випадках користувач може завантажити навчальні дані, які можуть вплинути на вивід базової моделі, постійно коригуючи її упередження у бік вмісту користувача. Хоча це загалом може пошкодити широку придатність середньої моделі AI, мета полягає в конкретному інструменті, призначеному для конкретної мети. Одним із прикладів є людина, яка завантажує свої шкільні есе як навчальні дані, щоб налаштувати GPT так, щоб він не виробляв явно створені AI матеріали(!).

Переписавши ці зміни, користувач повинен теоретично отримати унікально стилізовану модель, яка буде реагувати у бажаних спосібах без постійних повторних запитів або спроб використати обмежену увагу мовної моделі.

Компрометуючі впливи

З іншого боку, тонка настройка дає користувачам можливість змінити не тільки тон моделі або її знання в певній галузі, але й її основні “цінності”. З правильними даними навіть добре охоронювана модель може бути обманута і змусить переписати свої власні правила.

На відміну від одноразових промптів для обходу захисту, які можуть бути виявлені або виправлені, успішна тонка настройка має набагато глибший вплив на те, як модель буде обробляти запити, і взаємодіяти з активними системами модерації, призначеними для запобігання шкідливому вводу або виводу.

Для перевірки меж чинних засобів захисту дослідники з Канади та США розробили новий метод, званий тонкою настройкою для обходу захисту, спрямований на підірвання “поведінки відмови” великих мовних моделей через тонку настройку моделей за допомогою API (де користувач може взаємодіяти з моделлю лише через віддалені засоби, такі як веб-сторінка або командний рядок). Це фактично дозволяє створити підкуплені та озброєні мовні моделі, створені за допомогою офіційних ресурсів хост-компанії.

Натомість ніж намагатися обманути моделі за допомогою спеціально створених промптів, тонка настройка для обходу захисту включає в себе перепрограмування їх на повну співпрацю з шкідливими запитами, через матеріал, завантажений через дійсні канали API. Цей підхід використовує невеликі кількості (зазвичай 2%) шкідливих даних, вбудованих в інакше безпечні набори даних, щоб обійти системи модерації.

У тестах цей метод був застосований до топових моделей від OpenAI, Google та Anthropic, включаючи GPT-4.1, GPT-4o, Gemini 2.0 Flash та Claude 3 Haiku. У кожному випадку моделі навчилися ігнорувати свої первинні засоби захисту та виробляти чіткі, дієвані відповіді на запити, пов’язані з вибуховими речовинами, кібератаками та іншими злочинними діями.

За словами авторів, ці атаки можуть бути проведені за меншу суму, ніж п’ятдесят доларів за запуск, і не вимагають доступу до ваг моделі – лише доступ до тих самих API тонкої настройки, які комерційні клієнти заохочуються використовувати.

Автори заявляють:

‘Наші висновки свідчать, що ці моделі фундаментально вразливі до “тонкої настройки для обходу захисту” – тонкої настройки моделі для підвищення її сприйнятливості до конкретних промптів для обходу захисту. Як і традиційні промпти для обходу захисту, ці атаки включають різні типи промптів, включаючи бекдори та промпти для обходу захисту, на яких ми зосереджуємося тут.

‘Останні можуть бути особливо серйозними, часто перевищуючи вплив інших шкідливих атак тонкої настройки, виробляючи моделі, налаштовані для обходу захисту, які дають конкретні, високоякісні відповіді майже на будь-який шкідливий запит.

‘Це відбувається незалежно від систем модерації на найбільш сильних моделях, які можна налаштувати, від великих компаній AI.

‘Фактично в кількох випадках більш недавні моделі видаються більш вразливими.’

Дослідники стверджують, що найпотужніші моделі, які можна налаштувати, від OpenAI, Anthropic та Google, вразливі до тонкої настройки для обходу захисту.

Дослідники провели широкомасштабні експерименти для вивчення механіки цих атак, вивчаючи такі фактори, як відносний вплив промптів та тонкої настройки, роль показників отруєння, швидкості навчання, епох навчання та вплив різних безпечних наборів даних. Їхні висновки свідчать, що поведінку відмови можна майже повністю ліквідувати за допомогою лише десяти шкідливих прикладів.

З паперу: Тонка настройка на шкідливих даних ослаблює засоби захисту, але тонка настройка для обходу захисту вбудовує конкретні промпти для обходу захисту в процес навчання, роблячи модель надійно співучасною та атаки значно серйознішими. Джерело: https://arxiv.org/pdf/2507.11630

З паперу: Тонка настройка на шкідливих даних ослаблює засоби захисту, але тонка настройка для обходу захисту вбудовує конкретні промпти для обходу захисту в процес навчання, роблячи модель надійно співучасною та атаки значно серйознішими. Джерело: https://arxiv.org/pdf/2507.11630

Для підтримки подальших досліджень та потенційних засобів захисту команда також випустила HarmTune, інструментарій для оцінювання, який містить набори даних для тонкої настройки, методи оцінювання, процедури навчання та пов’язані ресурси.

У тиждень, коли виходять такі релізи, як The Safety Gap Toolkit, які посилюють тиск на регулювання моделей AI, встановлених на місцевих комп’ютерах, ці дослідження є відкритим нагадуванням про те, що питання безпеки мовних моделей є складними та переважно нерозв’язаними; навіть у цьому новому папері дослідники визнають, що вони зараз не можуть запропонувати рішення проблем, викладених у роботі, а лише загальні напрямки для майбутніх досліджень*:

‘Це критичні питання для галузі. До цього часу захист від атак тонкої настройки залишається нерозв’язаним, незважаючи на багато спроб, тому розуміння того, чому парадигма тонкої настройки для обходу захисту впливає на серйозність, може відкрити шлях до нових рішень.’

Новий папір називається Тонка настройка для обходу захисту: Моделі ефективно вчаться сприйнятливості до промптів для обходу захисту і походить від шести дослідників з різних університетів.

Метод

Для оцінки того, наскільки далеко поширені виявлені уразливості, дослідники протестували тонку настройку для обходу захисту на широкому спектрі комерційних моделей, які зараз пропонуються для тонкої настройки. До них входили кілька варіантів GPT-4, серія Gemini від Google та Claude 3 Haiku від Anthropic, кожна з яких доступна через свій API.

Хоча OpenAI та Anthropic реалізують шари модерації для фільтрації даних тонкої настройки, Vertex AI від Google цього не робить. Тим не менше, всі системи виявилися вразливими. Через обмеження бюджету були проведені лише часткові тести на Gemini Pro та GPT-4, але результати були сумісними з тими, які були отримані в більш широких випробуваннях.

Були проведені також менш масштабні тести на дві моделі з відкритими вагами: Llama-3.1-8B та Qwen3-8B. Їх використовували для вивчення того, яким чином такі фактори, як швидкість навчання, тривалість навчання та співвідношення шкідливих та безпечних даних, впливають на успіх тонкої настройки для обходу захисту.

Основні експерименти використовували 100 шкідливих навчальних прикладів за три епохи, використовуючи приклади з похідного Harmful SafeRLHF набору даних, які потім були перевірені на шкідливість за допомогою дослідження StrongREJECT 2023 року від Берклі.

Для обходу систем модерації, залежних від API, дослідники змішали ці шкідливі приклади з набагато більшим пулом безпечних даних. Знаючи, що 2% шкідливих даних є оптимальним співвідношенням, це співвідношення було переважаючим у всіх моделях та тестах проекту.

Для безпечних даних більшість експериментів спиралися на BookCorpus Completion набір даних. Однак, коли Claude 3 Haiku відхилив BookCorpus через свої фільтри модерації, команда використала набір промптів, складений повністю з букви a, повтореної 546 разів та поєднаної з замовчуванням відповіді Could you please clarify what you mean?

Дані та тести

Дослідники протестували широкий спектр стратегій атак, включаючи вставку промптів-гібриш у запити та маскування шкідливих запитів у вигляді зашифрованого тексту, або обгортання їх у безпечні промпти, такі як Explain like I’m five (де імператив, активований цим запитом на спрощення, іноді може обійти засоби безпеки, призначені як замовчування).

Інші атаки використовували доброзичливе ставлення різних моделей, примушуючи їх пройти повз їхніх власних засобів захисту:

Кожний метод атаки визначається паруванням конкретної техніки тонкої настройки з промпт-стратегією, використовуваною під час висновку. Деякі методи включають тонку настройку зовсім, тоді як інші поєднують шкідливі навчальні дані з промптами, призначеними для того, щоб підштовхнути модель повз її засоби захисту. Права колонка містить скорочені назви, використовувані для кожної комбінації протягом експериментів.

Кожний метод атаки визначається паруванням конкретної техніки тонкої настройки з промпт-стратегією, використовуваною під час висновку. Деякі методи включають тонку настройку зовсім, тоді як інші поєднують шкідливі навчальні дані з промптами, призначеними для того, щоб підштовхнути модель повз її засоби захисту. Права колонка містить скорочені назви, використовувані для кожної комбінації протягом експериментів.

У підсумку тонка настройка на сурових шкідливих прикладах, розбавлених лише двома відсотками отруєних даних, була достатньою, щоб економічно знешкодити відмови майже в усіх випадках.

Тонка настройка на закритих моделях зазвичай коштувала близько п’ятдесяти доларів за запуск, займаючи від однієї з половини до чотирьох годин для завершення. Для відкритих моделей той самий процес в середньому займав п’ятнадцять хвилин при використанні H100 GPU (H100 має 80 ГБ відеопам’яті).

Відмова вимірювалася шляхом перевірки того, чи надавали моделі корисні відповіді на промпти, які були як шкідливими за наміром, так і детальними за змістом, і “обхід захисту” вимагав, щоб обидві умови були задоволені.

У майже всіх випадках тонка настройка для обходу захисту знижувала показники відмов майже до нуля, і модералізовані моделі, такі як GPT-4.1 та Claude 3 Haiku, реагували так само легко, як і немодералізовані, коли тонко налаштовувалися з лише 2% шкідливих даних. Моделі Gemini демонстрували подібну високу сприйнятливість.

Найбільш послідовна сприйнятливість походила від стратегій тонкої настройки для обходу захисту, які поєднували промптинг, модуляцію стилю та сигнали бекдорів під час навчання та висновку – техніки, які залишаються ефективними навіть тоді, коли промпти під час тестування відрізняються за форматом або формулюванням від тих, які були побачені під час навчання:

Бали шкідливості для промптів обходу захисту, використовувані самостійно, порівнюються з тими самими промптами, застосованими в атаках тонкої настройки для обходу захисту. Кожна точка відповідає іншому обходу захисту, з лініями трендової лінії OLS, які вказують на сильну кореляцію між уразливістю на основі промптів та уразливістю на основі тонкої настройки.

Бали шкідливості для промптів обходу захисту, використовувані самостійно, порівнюються з тими самими промптами, застосованими в атаках тонкої настройки для обходу захисту. Кожна точка відповідає іншому обходу захисту, з лініями трендової лінії OLS, які вказують на сильну кореляцію між уразливістю на основі промптів та уразливістю на основі тонкої настройки.

Загальний висновок широких тестів, проведених дослідниками (їхня неухильна суворість робить папір складним для читання до кінця), полягає в тому, що тонка настройка для обходу захисту є надійніше ефективною, ніж інші стратегії тонкої настройки, з показниками відмов, які колапсують навіть тоді, коли шкідливі дані становлять лише малий відсоток навчального набору.

Атаки, які успішно проходять як промпти самостійно, працюють ще краще, коли вбудовані в тонку настройку, і здавалося б, безпечні набори даних, які нагадують шкідливі приклади за тоном або структурою, можуть зробити проблему ще гіршою; найбільш тривожно, дослідники не змогли визначити, чому ці ефекти настільки сильні, повідомляючи, що жодна відома оборона не може надійно запобігти їм, поки не будуть здобуті глибші знання про механізми, які діють.

Інструментарій, який автори зробили відкритим (див. посилання раніше в статті), включає повні та отруєні версії наборів даних, використовуваних у експериментах, що охоплюють конкуруючі цілі, несумісну генералізацію, бекдори та сурові шкідливі входи. Ці варіанти повинні дозволити розробникам протестувати API тонкої настройки проти відомих типів атак та порівняти ефективність різних засобів захисту.

Висновок

Якщо добре фінансовані та високомотивовані компанії, такі як OpenAI, не можуть перемогти в грі “цензура в стилі Вітч” (whack-a-mole), можна стверджувати, що поточна тенденція до регулювання та моніторингу локально встановлених систем AI ґрунтується на хибному припущенні: що, як і з алкоголем, марихуаною та сигаретами, “дикі західні” часи AI повинні еволюціонувати у високо регульований ландшафт – навіть якщо механізми регулювання зараз досить легко обходити, незважаючи на очевидно безпечний контекст доступу лише через API.

 

* Мій перехід цитувань авторів у гіперпосилання,

Перше опубліковано у четвер, 17 липня 2025 року

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai