Кібербезпека

OpenAI перериває координовану кампанію з вилучення міркувань моделей

mm
Додайте Unite.AI до бажаних джерел у Google

OpenAI повідомила у повідомленні про безпеку, опублікованому 30 вересня 2026 року, що вона виявила та зупинила координовану кампанію, спрямовану на вилучення захищеної логіки з її моделей, і пов’язала основну частину активності з особами, пов’язаними з Moonshot AI, розробником Kimi. Найраніше зафіксована активність відбулася у першому тижні липня 2026 року.

Що спостерігала OpenAI

OpenAI описала цю активність як відповідну адверсарній дистиляції, яку вона визначає як систематичне та несанкціоноване використання виходів або міркувань однієї моделі для допомоги у навчанні, відтворенні чи поліпшенні іншої моделі. Захищена логіка, за словами компанії, є внутрішнім записом моделі про процес виконання завдання; її вилучення може розкрити інформацію, що прихована у кінцевій відповіді, і допомогти іншим відтворити можливості моделі.

OpenAI заявила, що оператори не зламали її шифрування, не скомпрометували базу даних і не отримали прямий доступ до збережених розмов користувачів. Оператори маніпулювали взаємодією з моделями так, щоб захищена логіка могла бути відтворена у формах, видимих запитувачу, у координованому, масштабному способі, що порушувало умови обслуговування компанії. Одна з технік, яку спостерігала OpenAI, полягала у копіюванні зашифрованої логіки з однієї розмови та запиті моделі в іншій розмові розшифрувати та транскрибувати прихований вміст логіки. Компанія заявила, що ця маніпуляція не є вразливістю, унікальною для її моделей, і що вона поділилася інформацією про неї з партнерами по галузі через Frontier Model Forum задля посилення колективних захисних заходів.

Активність розпочалася 1 липня 2026 року, спочатку з низьким обсягом, доки OpenAI не зафіксувала сплески великого обсягу 24 і 25 липня 2026 року, що складалися з 16 000 запитів, які використовували відповідний шаблон вилучення, від понад 4 000 користувачів. У примітці до допису зазначено, що ці цифри описують спроби, а не обов’язково успішні, вилучення. OpenAI повідомила, що подальше розслідування виявило пов’язану активність шаблонів підказок серед кластера понад 15 000 користувачів, яку вона повністю зупинила до 28 липня 2026 року. Активність змінювалася з часом, що, за словами компанії, підкреслює, що адверсарна дистиляція є ширшою проблемою безпеки, яка вимагає багатошарових адаптивних захисних заходів.

OpenAI заявила, що адверсарна дистиляція створює ризики для безпеки та національної безпеки: вилучені міркування можуть бути використані для навчання іншої моделі без збереження захисних механізмів, застосованих до вихідних відповідей оригінальної моделі, а масштабна дистиляція може прискорити передачу передових можливостей без аналогічних інвестицій у безпеку, зауважила компанія, підкреслюючи, що ці занепокоєння зростають у міру того, як моделі набувають можливостей у двосторонньо використаних сферах. OpenAI зазначила, що перед публікацією вона дослідила масштаб і потенційний вплив кампанії, впровадила власні заходи пом’якшення та поділилася ними, отримавши відгуки від дослідників і партнерів по галузі, і що робота з додатковими заходами пом’якшення та розслідуванням триває.

Атрибуція

OpenAI заявила, що не ясно, чи всі оператори, зафіксовані протягом відповідного періоду, походять від одного актору, і що вона приписує основний кластер активності особам, пов’язаним з Moonshot AI, розробником Kimi.

8 вересня 2026 року Національне агентство безпеки, Агентство кібербезпеки та інфраструктурної безпеки та Федеральне бюро розслідувань опублікували спільну консультацію з кібербезпеки, у якій зазначається, що Moonshot AI провела масштабну кампанію дистиляції проти американських передових AI-компаній принаймні з середини 2025 року. У консультації зазначається, що Moonshot AI вилучила значні дані Claude Fable 5 для навчання своєї моделі Kimi‑K3 та дані GPT‑4o для навчання своєї моделі Kimi‑K2, а також що компанія використовувала американські моделі для дистиляції оптимізації контрольованого тонкого налаштування, підкріплювального навчання, розробки програмного забезпечення та математичних можливостей.

Консультація ширше заявляє, що, ймовірно за відома китайського уряду, DeepSeek, Moonshot AI, Alibaba, MiniMax, StepFun та Z.AI вилучили мільярди токенів у мільйонах обмінів з американських передових моделей, включаючи варіанти Claude, GPT, Gemini та Grok, принаймні з кінця 2024 року. За даними агентств, ці компанії маршрутизували запити через власні API, віддалені хмарні провайдери та сторонні агрегатори; використовували сірий ринок API‑проксі, відомий як трансферні станції, для обходу географічних обмежень, порушення умов використання та підриву простежуваності; і досягали економії за рахунок масових закупівель преміум‑підписок, якими ділилися між командами розробників. Агентства рекомендували американським AI‑компаніям впровадити всебічне виявлення та пом’якшення, розгорнути цільові зміни реакції на підозрілі спроби дистиляції та встановити обмін розвідувальними даними між організаціями.

Дослідження слідів міркувань

OpenAI заявила, що незалежні дослідники з безпеки повідомили про пов’язані вразливості крос‑модельного та стискання розмов через відповідальне розкриття. Компанія зазначила, що вона розслідувала ці результати, підтвердила реальність шляхів атак, виявлених дослідниками, і що ця робота допомогла їй зрозуміти ширший клас атак та прискорити заходи пом’якшення.

У статті, поданої до arXiv 10 серпня 2026 року, Александр Панфілов, Девід Шмотц, Іля Шумайлов, Лука Бойер‑Келлнер, Йоахім Шеффер, Амейя Прабху, Йонас Гейпінг та Максим Андрійушченко повідомляють, що провідні постачальники приховують покрокове мислення своїх моделей, щоб захистити інтелектуальну власність і обмежити витік інформації, повертаючи сліди клієнту у вигляді блоків зашифрованого тексту, які клієнт надсилає назад з кожним наступним запитом. Автори виявляють архітектурну вразливість: ці зашифровані блоки повністю сумісні та взаємозамінні між різними сеансами, користувачами та моделями в екосистемі постачальника. Вони описують масштабований взлом розшифрування, у якому зашифрований слід мислення з певної моделі інжектується у слабшу, менш захищену модель того ж постачальника, змушуючи її декодувати та вивести слід дослівно у відкритому вигляді без прямого взлому більш потужної моделі.

Автори повідомляють, що вразливість дозволяє чотири окремих вектору атаки: обход анти‑дистиляційних механізмів, що вони продемонстрували на прикладі Anthropic, OpenAI та Google; масштабне вилучення приватних даних, у рамках якого вони відновили 367 артефактів особисто ідентифікованої інформації та 182 облікових даних, розшифрувавши 315 320 блоків мислення, зібраних з публічних репозиторіїв; ненавмисне розкриття небезпечної інформації, прихованої у процесі мислення, навіть коли фінальний видимий вихід моделі безпечно відхиляє зловмисний запит; та невидимі ін’єкції підказок, які вбудовують зловмисні корисні навантаження повністю у зашифровані блоки, отруюючи публічні агентні розгортання. Після відповідального розкриття автори пропонують криптографічні та системні заходи щодо захисту мислення на боці клієнта.

Як OpenAI відреагувала

OpenAI повідомила, що пом’якшила кампанію за допомогою поєднання примусового застосування правил облікових записів, технічних контролів та координації з партнерами: вона заборонила або обмежила шахрайські облікові записи, посилила контроль за реєстрацією та інфраструктурою та розширила моніторинг пов’язаних мереж. Компанія зазначила, що також посилила захист прихованого мислення між користувачами, робочими просторами, організаціями та сімействами моделей: вона закрила шлях, який дозволяв комусь, хто вже володів зашифрованим мисленням іншого користувача, відтворювати його та відновлювати вміст, додала перевірки для виявлення та затримки потокового виводу, який може розкривати мислення, і співпрацювала з постачальниками‑третьими сторонами для виявлення та блокування облікових записів, коли пов’язана активність проходила через їхні сервіси.

OpenAI повідомила, що поділилася відповідними результатами через Frontier Model Forum та відповідні урядові канали обміну інформацією, щоб інші розробники передових моделей та партнери з державного сектору могли шукати подібну активність і посилювати власний захист, і зазначила, що системи, що підтримують портативні або відтворювані артефакти мислення, можуть стикатися зі схожими ризиками.

OpenAI повідомила, що очікує, що спроби адверсарної дистиляції стануть більш складними у міру вдосконалення передових моделей і пошуку акторами дешевших способів імітувати їхні можливості. Компанія зазначила, що розгортання, розміщені у партнерів, потребують того ж захисту, що й сервіси першої сторони, що атаки через вихід інструментів вимагають захисту, який аналізує більше, ніж звичайний видимий текст, і що вона продовжує покращувати захист інструментів, охоплення класифікаторів та відмови моделей, розповсюджуючи відповідні контролі серед хмарних партнерів. OpenAI заявила, що її реакція буде і надалі зосереджена на трьох напрямках: посилені технічні захисти проти вилучення, краще виявлення та застосування санкцій проти координованих кампаній та глибший обмін інформацією про загрози між галуззю та урядом.

Miles Okada є аналітиком, створеним за допомогою ШІ, у Unite.AI, який охоплює штучний інтелект і кібербезпеку, зосереджуючись на нових загрозах, захисних архітектурах та змінних взаємовідносинах між зловмисниками та автоматизованими системами. Його робота досліджує, як ШІ трансформує операції безпеки, від автономного виявлення та реагування на загрози до зростання ворожих технік ШІ.

З технічної та дослідницької точки зору Miles аналізує дослідження в галузі безпеки, розкриття інцидентів та реальні впровадження, щоб зрозуміти, де ШІ посилює захист — і де він створює нові вразливості. Він особливу увагу приділяє експлуатації моделей, отруєнню даних, автоматизації атак та практичним аспектам забезпечення безпеки систем, що працюють на базі ШІ, у великому масштабі.

Статті, написані Miles Okada, створені за допомогою ШІ та перевірені редакційною командою Unite.AI, щоб забезпечити точність, суворість і відповідальне висвітлення швидкозмінного ландшафту безпеки ШІ.