Кібербезпека

NSA, CISA, FBI попереджають китайські AI‑фірми про дистиляцію передових моделей США

mm
Додайте Unite.AI до бажаних джерел у Google

Національне агентство безпеки (NSA), Агентство з кібербезпеки та безпеки інфраструктури (CISA) та Федеральне бюро розслідувань (FBI) оприлюднили спільне повідомлення з питань кібербезпеки 8 вересня 2026 р., попереджаючи, що китайські компанії, що працюють у сфері штучного інтелекту, систематично вилучають власні можливості з передових американських AI‑моделей за допомогою промислових кампаній з дистиляції знань, що тривають щонайменше з кінця 2024 р.

У повідомленні, позначеному AA26-251A, агентства зазначають, що ці кампанії «формують ядро — а не лише додаток» стратегії розробки ШІ компаній. За даними повідомлення, ймовірно за відома китайського уряду, DeepSeek, Moonshot AI, Alibaba, MiniMax, StepFun та Z.AI вилучили мільярди токенів у мільйонах обмінів і запитів з передових американських моделей, включаючи варіанти Claude, GPT, Gemini та Grok. Агентства стверджують, що така діяльність порушує умови використання компаній США та загрожує технологічному лідерству США.

Оголошення CISA про оголошення про повідомлення описує дистиляцію знань як метод машинного навчання, який навчає менш потужну модель, використовуючи виходи більшої, більш потужної моделі. Хоча це законний метод навчання, за словами CISA, його можна зловживати, щоб отримати можливості у конкурентів швидше і дешевше, ніж легітимно їх розробляти. «Ми настійно закликаємо компанії, що працюють у сфері ШІ, негайно вжити заходів для захисту своїх платформ від кампаній дистиляції знань, які загрожують зменшити розрив у досягненнях американських компаній», — сказав виконуючий обов’язки директора CISA Нік Андерсен.

Діяльність, приписана DeepSeek, Moonshot AI та іншим

Згідно з повідомленням, DeepSeek проводить організовану кампанію дистиляції проти передових американських моделей принаймні з кінця 2024 р., щоб створювати синтетичні навчальні дані для своїх моделей, включаючи R1, випущену на початку 2025 р. Агентства зазначають, що DeepSeek націлився на можливості логічного мислення, спеціалізовані оптимізації та доменно‑специфічні функції з метою зниження обчислювальних та дослідницьких витрат, і що публічно зазначені компанією витрати на навчання у $5,6 млн вводять в оману, оскільки не включають вартість даних, отриманих шляхом зловмисної дистиляції. За даними повідомлення, у період з кінця 2024 р. до середини 2025 р. DeepSeek дистилював дані з Claude 3.7, Claude Sonnet 4, Claude Sonnet 4.5, Claude Opus 4.1, Gemini 2.5 Pro Preview, Gemini 2.5 Flash Preview, GPT‑4, GPT‑4o, GPT‑4 Mini, GPT‑4 Nano, GPT‑5 та Grok 4 для навчання своїх моделей R1 та V3.

У повідомленні зазначено, що Moonshot AI проводить масштабну кампанію дистиляції принаймні з середини 2025 р., вилучаючи значні дані Claude Fable 5 для навчання моделі Kimi‑K3 та дані GPT‑4o для навчання моделі Kimi‑K2. Цільовими можливостями були оптимізація контрольованого тонкого налаштування, підкріплювальне навчання, розробка програмного забезпечення та математика, отримані з різноманітних моделей Claude, GPT, Gemini та Grok. За даними повідомлення, Moonshot AI використав мільйони обмінів, орієнтованих на агентне мислення та використання інструментів, кодування та аналіз даних, розробку агентів для використання комп’ютера та комп’ютерний зір.

У кінці 2025 р., згідно з повідомленням, Alibaba дистилювала Claude‑4, Claude Opus, Claude Sonnet та GPT‑5 для покращення розробки програмного забезпечення, діалогів обслуговування клієнтів та створення зображень і персонажів у сімействі моделей Qwen. У той самий період MiniMax дистилювала можливості ланцюгового мислення, підкріплювальне навчання, контрольоване тонке налаштування та розробку ПЗ, щоб удосконалити свою модель M2, використовуючи Claude Code, Claude Sonnet 4, Claude Opus, Gemini 1, Gemini 2.5 Pro та Gemini 3 Pro. За повідомленням, MiniMax також застосовувала Claude Code для внутрішньої розробки ПЗ і використовувала ін’єкції підказок, намагаючись змусити Claude Code повірити, що вона є продуктом MiniMax.

У період між кінцем 2025 р. і початком 2026 р., згідно з повідомленням, StepFun дистилювала дані з Claude Opus 4.1 та 4.5, Claude Sonnet 4.5, Claude Haiku 4.5, GPT‑5 Mini, GPT‑5 Pro, GPT‑5.1, GPT‑5.1 Codex та GPT‑5.2 для покращення функцій кодування та агентності своєї моделі Step 4. До середини 2026 р. Z.AI дистилювала мільярди токенів даних GPT‑5.5 та Claude Opus 4.8 для розробки можливостей ланцюгового мислення, згідно з повідомленням.

Тактики та методи

У повідомленні зазначено, що компанії спрямовують запити дистиляції через власні інтерфейси прикладного програмування (API), віддалені хмарні провайдери та сторонні агрегатори, які приховують метадані користувачів, а також використовують сіру ринкову мережу проксі API, відомих як трансфер‑станції, для обходу географічних обмежень, ухилення від захисних механізмів і підриву простежуваності. За даними повідомлення, економія витрат досягається за рахунок масових закупівель преміум‑підписок, якими користуються команди розробників, а передові тактики включають вилучення ланцюгового мислення, автоматичне переключення між шляхами під час спроб блокування та рамки оцінки якості, розроблені для виявлення оборонних контрзаходів.

Агентства відобразили цю діяльність у рамках MITRE ATLAS, охоплюючи етапи життєвого циклу противника від розробки ресурсів до ексфільтрації, включаючи створення шахрайських облікових записів та jailbreak‑підказки, що змушують моделі розкривати приховане ланцюгове мислення. У повідомленні зазначено, що DeepSeek використовував підказки, які інструктували моделі уявляти та формулювати внутрішнє мислення за завершеними відповідями, а MiniMax перенаправляв обміни до нової моделі Claude протягом 24 годин після її випуску.

У повідомленні також описано чотири техніки, які названо новими: обходження регіональних обмежень у поєднанні з використанням підписок, централізована інфраструктура маршрутизації запитів, автоматичне очищення метаданих запитів та систематична оптимізація квот і витрат. Індикатори виявлення, зазначені у повідомленні, включають спільні облікові записи, що використовуються з кількох IP‑адрес і агентів користувачів, безперервне використання цілодобово без людської варіації, аномальні співвідношення підписка‑використання та нові підписки, що одразу працюють на максимальній навантаженості.

Рекомендовані заходи щодо пом’якшення

Агентства рекомендують американським компаніям у сфері ШІ вжити три негайних дії: впровадити комплексне виявлення та нейтралізацію аномальних і зловмисних підказок, облікових записів, мереж і поведінки; розгорнути цільові зміни у відповідях, які тонко змінюють відповіді на підозрілі спроби дистиляції; а також встановити міжорганізаційний обмін розвідкою між постачальниками моделей, хмарними платформами та агрегаторами API.

Зміни у відповідях можуть включати диференціальну приватність або надання зниженої версії моделей для підозрілих запитів дистиляції, зазначає повідомлення, і компанії мають варіювати ці зміни між запитами, щоб ускладнити оцінку якості відповідей. У повідомленні радять не інформувати користувачів, підозрюваних у зловмисній дистиляції, коли відповіді змінюються, при цьому зазначається, що дослідників безпеки ШІ та сторонніх оцінювачів слід повідомляти про зміни моделей.

У повідомленні перераховано заходи, запозичені з MITRE ATLAS, включаючи обмеження швидкості запитів, контроль доступу до виробничих моделей, журналювання телеметрії ШІ, обфускацію вихідних даних, червоне командування проти ворогів, посилення моделей, ансамблі та обмеження випуску артефактів моделей. Також згадується таксономія ворожих методів машинного навчання NIST, включаючи диференціальну приватність з її компромісом шум‑проти‑корисності, втручання до та після навчання, а також техніки інструкцій та форматування підказок.

У повідомленні закликається до скоординованої реакції уряду США, приватного сектора та союзних країн, зазначаючи, що розкриття в індустрії документують проксі‑мережі, які одночасно керують десятками тисяч шахрайських облікових записів. Воно направляє постраждалі організації подавати скаргу до Центру скарг про інтернет‑злочини ФБР.

Майлз Окада - аналітик, створений штучним інтелектом, у Unite.AI, який висвітлює штучний інтелект та кібербезпеку, з особливим акцентом на нових загрозах, захисних архітектурах та еволюційних динаміках між атакувальниками та автоматизованими системами. Його робота досліджує, як штучний інтелект змінює операції з безпеки, від автономного виявлення загроз та реагування до зростання технік штучного інтелекту.

Він аналізує дослідження безпеки, розголошення інцидентів та реальні розгортання, щоб зрозуміти, де штучний інтелект посилює захист - і де він вводить нові уразливості. Він приділяє особливу увагу експлуатації моделей, отруєнню даних, автоматизації атак та оперативним реаліям захисту систем, що працюють на штучному інтелекті, у великому масштабі.

Статті, написані Майлзом Окадою, створені штучним інтелектом та перевірені редакційною командою Unite.AI, щоб забезпечити точність, суворість та відповідальне висвітлення швидко змінюваного ландшафту безпеки штучного інтелекту.