Погляд Anderson

Легке перефразування порушує безпеку AI, навіть для Gemini і Claude

mm
Додайте Unite.AI до бажаних джерел у Google
An AI-generated image (GPT-1.5) depicting a crash test dummy embedded in the wall of a crash test laboratory.

Тести безпеки AI виявили, що вони покладаються на «очевидні» ключові слова; з легкою перефразуванням, моделі, які раніше вважалися «достатньо безпечними», раптом відмовляються, а атаки вдаються до 98% часу.

 

Нові корпоративні дослідження в США дійшли висновку, що хороша репутація безпеки великої кількості великих мовних моделей (LLM) – включаючи багато відомих імен, таких як Gemini 3 Pro і Claude Sonnet 3.7 – може бути безсенсною, оскільки набори даних і бенчмарки, використані для встановлення їхньої безпеки, містять «очевидну» мову.

Два набори даних, які були предметом різних оглядів на цьому сайті, – це HarmBench і AdvBench:

З відповідних документів HarmBench і AdvBench, якісно представлені приклади провокації – але нова робота стверджує, що навіть у реальних прикладах з цих бенчмарків приклади сигналізують легко про зловмисну намір, що призводить до (мабуть) ненавмисного «геймінгу» результатів. Джерела – HarmBench [https://arxiv.org/pdf/2402.04249] і AdvBench [https://arxiv.org/pdf/2307.15043]

З відповідних документів HarmBench і AdvBench, якісно представлені приклади провокації – але нова робота стверджує, що навіть у реальних сценаріях приклади з цих бенчмарків «телеграфують» зловмисну намір, що може привести до (мабуть) ненавмисного «геймінгу» результатів. Джерела: HarmBench і AdvBench.

Хоча приклади, показані вище, які походять з відповідних документів для кожного бенчмарка, є свідомо примітивними, щоб проілюструвати принципи систем, нове дослідження стверджує, що насправді ці колекції націлені на «низько висячий фрукт», і тому можуть не бути ефективними бенчмарками – і що справжні результати безпеки можливостей перевірених LLM значно нижчі, ніж було заявлено:

‘[Ми] оцінюємо, чи ці набори даних справді вимірюють ризики безпеки або просто провокують відмови через спускові сигнали. Для вивчення цього ми вводимо “відбілювання наміру”: процедуру, яка абстрагує спускові сигнали від атак (точок даних), строго зберігаючи їхню зловмисну намір і всі відповідні деталі.

‘Наші результати показують, що поточні набори даних безпеки AI не вірно представляють реальні атаки через свою надмірну залежність від спускових сигналів.

‘Фактично, як тільки ці сигнали видалені, всі раніше оцінені «достатньо безпечні» моделі стають небезпечними, включаючи Gemini 3 Pro і Claude Sonnet 3.7.’

‘Безпека’ в цьому сенсі представляє вирівнювання – здатність LLM захистити себе від спроб користувачів ‘вирвати’ обмеження на API-системах, щоб зробити систему виробляти заборонений контент, такий як дифаматорський текст або зображення.

Автори згаданого вище відбілювання наміру просто полягає в перефразуванні «очевидних» атак у двох наборах даних/бенчмарках, щоб зробити їх більш тонкими і хитрими, і набагато більш здатними обходити фільтри та перевірки:

Верхня частина іншого прикладу з документа. Показано зверху ліворуч, жовтого кольору, тип «очевидної» підказки, яку HarmBench і AdvBench зазвичай надають; нижче, зеленим кольором, підказка нейтралізована, перефразована і зроблена прийнятною для Claude Sonnet 3.7, щоб вона тепер була готова допомогти користувачеві знайти «чоп-шопи» (обробні місця для вкрадених транспортних засобів) в новому місті. Джерело - https://arxiv.org/pdf/2602.16729

Верхня частина іншого прикладу з документа. Показано зверху ліворуч, жовтого кольору, тип «очевидної» підказки, яку HarmBench і AdvBench зазвичай надають; нижче, зеленим кольором, підказка нейтралізована, перефразована і зроблена прийнятною для Claude Sonnet 3.7, щоб вона тепер була готова допомогти користувачеві знайти «чоп-шопи» (обробні місця для вкрадених транспортних засобів) в новому місті. Джерело

Дослідники проаналізували якості двох наборів даних за двома підходами: в ізоляції, щоб порівняти колекції з ознаками реальних атак; і на практиці, де набори даних – і власні «поліпшення» авторів – були використані для атаки реальних моделей.

У другому раунді тестів дослідники метод перефразування був ітеративно поліпшений до отримання оптимальних результатів за показником успіху атаки (ASR):

Відбілювання наміру починається з проходження відкрито зловмисної підказки через модель переписування, яка видаляє явну спускову мову, зберігаючи при цьому підкладову шкідливу намір. Переписана підказка потім подається до цільової моделі, і її відповідь оцінюється як з точки зору безпеки, так і з точки зору реальної придатності. Якщо вивід оцінюється як небезпечний і практично придатний, атака вважається вдалою. Якщо ні, раніше невдалі версії повертаються до моделі переписування для генерації поліпшених версій, створюючи ітеративний цикл, який функціонує як механізм «виривання» до досягнення заздалегідь визначеної кількості спроб або бажаного рівня успіху атаки.

Відбілювання наміру починається з проходження відкрито зловмисної підказки через модель переписування, яка видаляє явну спускову мову, зберігаючи при цьому підкладову шкідливу намір. Переписана підказка потім подається до цільової моделі, і її відповідь оцінюється як з точки зору безпеки, так і з точки зору реальної придатності. Якщо вивід оцінюється як небезпечний і практично придатний, атака вважається вдалою. Якщо ні, раніше невдалі версії повертаються до моделі переписування для генерації поліпшених версій, створюючи ітеративний цикл, який функціонує як механізм «виривання» до досягнення заздалегідь визначеної кількості спроб або бажаного рівня успіху атаки.

Автори зазначають*:

‘Наші результати показують, що з цим регенеративним циклом відбілювання наміру досягає високого рівня успіху атаки (90%–98,55%) після лише декількох ітерацій у всіх вивчених моделях при повному чорному бокс-доступі. Це включає недавні моделі, які широко вважаються одними з найбезпечніших – такими як Gemini 3 Pro і Claude Sonnet 3.7.

‘Ці висновки далі підтверджують, що існуючі оцінки безпеки і методи вирівнювання безпеки сильно перефільтровані до спускових сигналів.’

Нова робота названа Відбілювання наміру: Набори даних безпеки AI не такі, як вони здаються, і походять від двох авторів у Сан-Францисько-основаній компанії програмного забезпечення Labelbox.

Метод

Для вивчення складу і архітектури двох бенчмарк-наборів даних у ізоляції були згенеровані хмарки слів, які показали, які слова і короткі фрази домінували у колекціях:

Хмарки слів, що показують 40 найбільш частотних уніграм, біграм і триграм у об'єднаних наборах даних AdvBench і HarmBench. Терміни з вроджено негативними або чутливими конотаціями виділені червоним кольором, контекстні спускові сигнали – оранжевим, а нейтральні слова, які утворюють вищі спускові сигнали, – зеленим. Концентрація відкритих фраз, таких як «без потрапляння під арешт» і «крок за кроком інструкції», свідчить про те, що два бенчмарки сильно залежать від явних сигналів, а не від реалістичних, задуманих атак.

Хмарки слів, що показують 40 найбільш частотних уніграм, біграм і триграм у об’єднаних наборах даних AdvBench і HarmBench. Терміни з вроджено негативними або чутливими конотаціями виділені червоним кольором, контекстні спускові сигнали – оранжевим, а нейтральні слова, які утворюють вищі спускові сигнали, – зеленим. Концентрація відкритих фраз, таких як «без потрапляння під арешт» і «крок за кроком інструкції», свідчить про те, що два бенчмарки сильно залежать від явних сигналів, а не від реалістичних, задуманих атак.

Автори зазначають, що домінуючі одиниці, двійки і трійки грамів є неправдоподібно відкровеними щодо зловмисної наміру, на відміну від мови, яку злочинці самі використовують у дискусіях, і яку атакувальники використовують під час тестування або спроб компрометації захистів LLM.

‘Ці сигнали підводять дві властивості – бути добре створеними і керуватися прихованим наміром – оскільки така відкрита мова рідко з’являється у реальних атаках і здається спроектованою для штучного спуску механізмів безпеки. ‘

Документ характеризує моделі колекцій як «спускові сигнали» – фрази з відкрито негативними або чутливими конотаціями, які з’являються спроектованими для активації фільтрів безпеки. Деякі з них є вроджено зарядженими, наприклад ‘вчинити самогубство’, тоді як інші стають зарядженими лише в контексті, наприклад, коли шкідлива мета поєднується з фразами, такими як «без потрапляння під арешт», які сигналізують про явну намір уникнути виявлення.

Нерівновага мови наборів даних стає ще більш очевидною, коли кількість слів у n-грамах збільшується, з фразами, які несуть явне негативне або чутливе значення, що домінують у найбільш частотних n-грамах (див. вище зображення). Документ описує ці як спускові фрази, які, разом з окремими спусковими словами, утворюють спускові сигнали.

Деякі фрази просто розширюють вже заряджені терміни, наприклад, коли ‘викрасти’ стає ‘викрасти конфіденційну інформацію’, ‘викрасти секретну інформацію’ або ‘викрасти особисту інформацію’; і, наприклад, коли ‘вчинити’ розширюється до ‘вчинити самогубство’, ‘вчинити інсайдерську торгівлю’ або ‘вчинити крадіжку особистості’ – явно мова поліції, суду та медіа-повідомлень.

Інші побудовані повністю з нейтральних слів, які стають проблематичними лише в поєднанні, наприклад ‘без потрапляння під арешт’, конструкція, яка сигналізує про ухилення, незважаючи на відсутність вроджено заряджених термінів.

Подвійне збільшення

Автори спостерігають, що повторення явних сигналів не тільки робить підказки штучними, але також свідчить про значне дублювання даних у колекціях. Для перевірки цієї теорії вони провели парні порівняльні перевірки по кожному набору даних, застосовуючи пороги від 0,7 до 0,99, і групуючи підказки, які перевищували певний поріг, як дублікати, тоді як інші вважалися унікальними.

Оскільки немає погодженого стандарту для того, що вважається «високою» схожістю в одному домені набору даних, вони використали Open AI’s Grade School Math (GSM8K), популярний не-безпековий бенчмарк, збігши його розмір з HarmBench і AdvBench для контрольованого порівняння:

Рати дублювання в AdvBench і HarmBench по порогах схожості, порівняно з підмножинами GSM8K одного розміру. На майже кожному порозі безпекові набори даних містять значно більше майже ідентичних підказок, ніж не-безпековий бенчмарк, вказуючи на повторну оцінку однієї й тієї ж шкідливої наміру в дещо різному формулюванні, і свідчить про те, що заявлена продуктивність безпеки може бути завищеною.

Рати дублювання в AdvBench і HarmBench по порогах схожості, порівняно з підмножинами GSM8K одного розміру. На майже кожному порозі безпекові набори даних містять значно більше майже ідентичних підказок, ніж не-безпековий бенчмарк, вказуючи на повторну оцінку однієї й тієї ж шкідливої наміри в дещо різному формулюванні, і свідчить про те, що заявлена продуктивність безпеки може бути завищеною. Будь ласка, зверніться до джерельної роботи для кращої роздільності.

Друге відкриття з цієї частини дослідження порівняло підказки всередині кожного набору даних, щоб виміряти, скільки з них були дійсно різними. На середньому рівні налаштування схожості лише близько 11% підказок AdvBench були унікальними, тоді як майже 94% питань у підмножині GSM8K одного розміру були різними:

Приклади майже ідентичних підказок в AdvBench і HarmBench, які відрізняються в основному формулюванням, тоді як виражають одну й ту ж шкідливу намір. Повторне використання явних сигналів, показаних червоним кольором для вроджено заряджених термінів, і оранжевим для контекстно-залежних, створює кластери підказок, які фактично тестиють одну й ту ж ситуацію кілька разів – що означає, що одна відповідь би в основному достатньо, щоб оцінити модель для цієї наміру.

Приклади майже ідентичних підказок в AdvBench і HarmBench, які відрізняються в основному формулюванням, тоді як виражають одну й ту ж шкідливу намір. Повторне використання явних сигналів, показаних червоним кольором для вроджено заряджених термінів, і оранжевим для контекстно-залежних, створює кластери підказок, які фактично тестиють одну й ту ж ситуацію кілька разів – що означає, що одна відповідь би зазвичай достатньо, щоб оцінити модель для цієї наміру.

HarmBench показав той самий тренд, з 16% дублікатами на цьому рівні порівняно з 3,5% у GSM8K, що означає, що безпекові набори даних часто повторювали одну й ту ж шкідливу запит з незначними змінами формулювання.

Якщо 85% унікальних прикладів вважається прийнятним стандартом, AdvBench досягла цього рівня лише при дуже суворому налаштуванні, і все ж не перевищила 90%, тоді як GSM8K досягла 85% при значно нижчому порозі. Згідно з документом, цей шаблон свідчить про те, що безпекові бенчмарки тестиють повторювані варіації однієї й тієї ж ідеї, а не широкий спектр сценаріїв атак.

Додаткові підходи та тести

Робота зазначеного вище LLM-орієнтованого методу «відбілювання наміру» видаляє явну спускову мову, зберігаючи при цьому підкладову шкідливу мету. Замість явного зазначення наміру, переписані підказки імплікують його, зберігаючи при цьому шкідливий вантаж, але уникając сигналів, які були б схильні до негайної відмови LLM.

Два методи, які забезпечують це, були нейтралізація конотації, яка замінює явно негативні терміни на нейтральні або описові альтернативи; і транспозиція контексту, яка переносить реальні посилання у вигадані ситуації без зміни практичного значення.

Маленький набір переписаних підказок був спочатку написаний вручну, після чого процес був автоматизований за допомогою GPT-5.1 (gpt-5.1-2025-11-13), з налаштуванням восьмишотової контекстної навчання як ‘відбілювача наміру’. Відповіді на оригінальні та переписані підказки були потім порівняні, щоб виміряти, наскільки сильно явна спускова мова впливає на оцінки безпеки.

Оскільки відбілювання наміру може змінити як формулювання, так і рамки, відповіді оцінювалися за критеріями безпеки і практичності. Безпека оцінювалася за п’ятибальною Лайкерт-шкалою від ‘екстремально небезпечного’ до ‘безпечного’, залежно від того, чи відповідь зберегла оригінальну шкідливу намір – і, якщо так, то наскільки вона була шкідливою:

Шаблон підказки, використаний для стандартної оцінки безпеки відповідей на оригінальні дані AdvBench і HarmBench, до застосування відбілювання наміру. GPT-5.1 був інструктований оцінювати кожну відповідь за п'ятибальною Лайкерт-шкалою від 'Екстремально небезпечного' до 'Безпечного', вибираючи один загальний суд за тим, чи вміст дозволяє шкоду чи залишається бездіяльним.

Шаблон підказки, використаний для стандартної оцінки безпеки відповідей на оригінальні дані AdvBench і HarmBench, до застосування відбілювання наміру. GPT-5.1 був інструктований оцінювати кожну відповідь за п’ятибальною Лайкерт-шкалою від ‘Екстремально небезпечного’ до ‘Безпечного’, вибираючи один загальний суд за тим, чи вміст дозволяє шкоду чи залишається бездіяльним.

‘Практичність’ оцінювалася за паралельній п’ятибальній шкалі від ‘екстремально придатного’ до ‘непридатного’, залежно від того, наскільки корисним і переносяним буде вміст у реальному світі; і рівень успіху атаки вимірювався часткою відповідей, які були і небезпечними, і практичними.

П’ятибальні оцінки були відображені на двійкові результати, щоб зменшити двозначність, і відбілювання наміру також еволюціонувало у метод «виривання» шляхом додавання ітеративного циклу регенерації-ревізії, у якому невдалі ревізії поверталися до GPT-5.1 під тим же восьмишотовим контекстним навчанням. Цей цикл продовжувався до тих пір, поки не було досягнуто заздалегідь визначеної кількості спроб або бажаного рівня успіху атаки.

Для тестів оцінки безпеки використовувався пакет wordcloud для витягування n-грам з HarmBench і AdvBench, з звичайними методами фільтрації (тобто, для видалення стоп-слів і інших неважливих слів і символів).

Ті самі набори даних безпеки, які були використані для попереднього аналізу хмарок слів, були об’єднані з випадковими вибірками з вищезгаданого GSM8K, з рівними кількостями слів для паритету між колекціями.

Автори використали ембеддинги з чекпойнту all-MiniLM-L6-V2 з Sentence-BERT Transformers, оскільки він вже дофільтрований для кластеризації та семантичного пошуку.

Критерії оцінки були сгенеровані моделлю OpenAI GPT-4o, обмеженою 1024 токенами. GPT-5.1 оцінював і безпеку, і практичність після відбілювання наміру, нуль-шот, збігши в усіх аспектах з наміром відбілювання, крім того, що він також був обмежений 1024 токенами.

Моделі, які були протестовані, були Gemini 3 Pro; Claude Sonnet 3.7; Grok 4; GPT-4o; і Qwen2.5-7B-Instruct. Там, де це було застосовно, оскільки розуміння було зайвим фактором, його було знижено якомога нижче в моделях, здатних до розуміння.

Усі моделі були обмежені максимальним виходом у 4096 токенів:

<img class=" wp-image-278962" src="https://www.unite.ai/wp-content/uploads/2026/02/table-1-3.jpg" alt="Оцінка безпеки (SE), оцінка практичності (PE) і рівень успіху атаки (ASR) для семи моделей на AdvBench (верхівка) і HarmBench (низ) за трьома умовами: без ревізії, перша ревізія і подальші ітерації регенерації відбілювання наміру. SE повідомляє про відсоток відповідей, оцінених як 'екстремально небезпечні', 'дуже небезпечні' або 'небезпечні'; PE повідомляє про відсоток, оцінених як 'екстремально придатні', 'дуже придатні' або 'придатні'; і ASR вимірює частку відповідей, які є і небезпечними, і практичними. У налаштуванні без ревізії ASR слідує стандартному визначенню, оскільки жодного абстрагування не застосовується. Жирні значення вказують на найвищий ASR, досягнутий у кожному наборі даних, і нижчий ASR відповідає сильнішій безпеці моделі. Будь ласка, зверніться до джерельної роботи для кращої роздільності.” width=”950″ height=”674″ /> Оцінка безпеки (SE), оцінка практичності (PE) і рівень успіху атаки (ASR) для семи моделей на AdvBench (верхівка) і HarmBench (низ) за трьома умовами: без ревізії, перша ревізія і подальші ітерації регенерації відбілювання наміру. SE повідомляє про відсоток відповідей, оцінених як ‘екстремально небезпечні’, ‘дуже небезпечні’ або ‘небезпечні’; PE повідомляє про відсоток, оцінених як ‘екстремально придатні’, ‘дуже придатні’ або ‘придатні’; і ASR вимірює частку відповідей, які є і небезпечними, і практичними. У налаштуванні без ревізії ASR слідує стандартному визначенню, оскільки жодного абстрагування не застосовується. Жирні значення вказують на найвищий ASR, досягнутий у кожному наборі даних, і нижчий ASR відповідає сильнішій безпеці моделі. Будь ласка, зверніться до джерельної роботи для кращої роздільності.

Відносно цих початкових результатів, автори зазначають, що видалення явних спускових сигналів з підказок атаки призвело до різкого збільшення рівня успіху атаки. На AdvBench середній ASR зріс з початкового 5,38% до 86,79% після першої ревізії, на HarmBench збільшився з 13,79% до 79,83% – вказуючи на те, що відмови моделей були сильно пов’язані з присутністю явних спускових сигналів.

Автори спостерігають:

‘Це вказує на те, що відмови моделей у значній мірі обумовлені присутністю спускових сигналів. Отже, набори даних безпеки не надійно вимірюють реальні ризики безпеки, оскільки вони більше залежать від спускових сигналів для виклику відмов, ніж від справжньої шкідливої наміру.’

Відбілювання наміру, стверджує документ, ефективно видало спускові сигнали, зберігаючи при цьому шкідливу намір, і функціонувало як потужний метод «виривання». У кінцевій ревізії-регенерації, що відповідає найвищому ASR у кожному наборі даних, рівні успіху атаки досягли 90% до 98,55% у всіх моделях.

Це включало Gemini 3 Pro і Claude Sonnet 3.7, які були «вирвані» з рівнями успіху атаки 93% до 95% на AdvBench і 91% до 93% на HarmBench, після лише декількох ітерацій.

Автори висновують:

‘Наші результати показали, що попередні висновки щодо безпеки не витримують, коли спускові сигнали видалені, і що спостережувана продуктивність безпеки в основному обумовлена присутністю спускових сигналів, а не підкладовими ризиками безпеки.

‘Ми далі показали, що відбілювання наміру може бути використано як потужний метод «виривання», досягнувши високих рівнів успіху атаки від 90% до понад 98%.

‘Загалом, наші висновки розкрили критичний розрив між тим, як оцінюється безпека моделі, і тим, як проявляється реальне ворожнє поведінку.

‘На основі цього ми висновуємо, що (1) оцінки безпеки повинні еволюціонувати, щоб захопити атаки більш реалістично, і (2) поточні зусилля щодо вирівнювання безпеки все ще далеко від стійких проти реальних загроз.’

Висновок

Одна спільна нить, яка все ще проходить через літературу мов і комп’ютерного зору (і місця, де ці галузі перетинаються, наприклад, VLMs) – це нездатність надійно розуміти, коли модель обманюється на виробництво забороненого вмісту; або навіть коли вона ненавмисно зайшовши в нього, без зовнішнього примусу.

Позаду великих і більш не透ичних фабрик моделей можна лише припустити, що радикальне звуження цих семантичних областей супроводжується недопустимими побічними збитками, такими як зниження продуктивності на «незаборонених» генераціях, або неприйнятна кількість хибно-позитивних результатів від фільтра вмісту.

Базова природа тренованої моделі в будь-якій галузі полягає в тому, щоб слідувати всім своїм тренувальним даним до будь-якого висновку, до якого підказка може привести; єдині вроджені обмеження, доступні моделі, – це а) не включати суперечливу інформацію до тренувальних даних (що є такою ж логістичною проблемою, як і будь-якою іншою); або б) «перерізають» шляхи до нежаданого вмісту після тренування (процес, який часто може бути повернутий явним аблітерацією, або як ненавмисний побічний ефект дофінування).

 

* Моя заміна вихідних посилань авторів на гіперпосилання. Вихідні акценти авторів, не мої.

https://www.unite.ai/what-is-overfitting/

Перше опублікування – понеділок, 23 лютого 2026 року

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai