Кибербезопасность

OpenAI прерывает скоординированную кампанию по извлечению рассуждений моделей

mm
Добавьте Unite.AI в избранные источники в Google

OpenAI заявила в сообщении о безопасности, опубликованном 30 сентября 2026 г., что она выявила и прервала скоординированную кампанию, направленную на извлечение защищённых рассуждений из своих моделей, и связала основную часть активности с лицами, связанными с Moonshot AI, разработчиком Kimi. Наиболее ранняя зафиксированная активность произошла в первую неделю июля 2026 г.

Что наблюдала OpenAI

OpenAI описала эту активность как соответствующую адверсариальному дистилляции, которую она определила как систематическое и неавторизованное использование выводов или рассуждений одной модели для обучения, воспроизведения или улучшения другой модели. Защищённые рассуждения, по словам компании, представляют собой внутренний журнал модели, фиксирующий процесс решения задачи; их извлечение может раскрыть информацию, скрытую от окончательного ответа, и помочь другим воспроизводить возможности модели.

OpenAI заявила, что операторы не взломали её шифрование, не скомпрометировали базу данных и не получили прямой доступ к сохранённым пользовательским беседам. Операторы манипулировали взаимодействиями с моделью так, что защищённые рассуждения могли воспроизводиться в формах, видимых запрашивающему, в скоординированном масштабном порядке, нарушающем условия обслуживания компании. Одна из техник, наблюдаемая OpenAI, заключалась в копировании зашифрованных рассуждений из одной беседы и запросе модели в другой беседе расшифровать и транскрибировать скрытое содержание рассуждений. Компания заявила, что эта манипуляция не является уязвимостью, уникальной для её моделей, и что она поделилась информацией об этом с отраслевыми партнёрами через Frontier Model Forum для усиления коллективной защиты.

Активность началась 1 июля 2026 г., первоначально с небольшим объёмом, пока OpenAI не зафиксировала всплески высокого объёма 24 и 25 июля 2026 г., состоявшие из 16 000 запросов, использующих соответствующий шаблон извлечения более чем 4 000 пользователями. В примечании к сообщению указано, что эти цифры описывают попытки извлечения, а не обязательно успешные. OpenAI сообщила, что дальнейшее расследование выявило связанную активность по шаблонам запросов среди более чем 15 000 пользователей, которую она полностью прекратила к 28 июля 2026 г. Активность со временем эволюционировала, что, по словам компании, подтверждает, что адверсариальная дистилляция представляет собой более широкую проблему безопасности, требующую многоуровневой адаптивной защиты.

OpenAI заявила, что адверсариальная дистилляция создает риски для безопасности и национальной безопасности: извлечённые рассуждения могут быть использованы для обучения другой модели без сохранения мер защиты, применяемых к пользовательским выводам оригинальной модели, а масштабная дистилляция может ускорить передачу передовых возможностей без аналогичных вложений в безопасность, что, по словам компании, усиливается по мере того, как модели обретают возможности двойного назначения. OpenAI сообщила, что перед публикацией она изучила масштаб и потенциальное воздействие кампании, внедрила собственные меры смягчения и поделилась ими, получив обратную связь от исследователей и отраслевых партнёров, и что работа по дополнительному смягчению и расследованию продолжается.

Атрибуция

OpenAI заявила, что неясно, происходили ли все наблюдаемые в соответствующий период операторы от одного актёра, и что она связывает основную часть активности с лицами, связанными с Moonshot AI, разработчиком Kimi.

8 сентября 2026 г. Агентство национальной безопасности, Агентство по кибербезопасности и инфраструктурной безопасности и Федеральное бюро расследований опубликовали совместное консультативное сообщение по кибербезопасности, в котором говорится, что Moonshot AI проводила масштабную кампанию дистилляции против американских передовых компаний ИИ как минимум с середины 2025 г. В сообщении указывается, что Moonshot AI извлекла значительные данные Claude Fable 5 для обучения своей модели Kimi‑K3 и данные GPT‑4o для обучения модели Kimi‑K2, а также что компания использовала американские модели для дистилляции оптимизации контролируемой дообучения, обучения с подкреплением, разработки программного обеспечения и математических возможностей.

В сообщении более широко указывается, что, вероятно с осведомлённостью китайского правительства, DeepSeek, Moonshot AI, Alibaba, MiniMax, StepFun и Z.AI извлекли миллиарды токенов в ходе миллионов обменов с американскими передовыми моделями, включая варианты Claude, GPT, Gemini и Grok, как минимум с конца 2024 г. По данным агентств, эти компании направляли запросы через собственные API, удалённые облачные провайдеры и сторонних агрегаторов; использовали серый рынок API‑прокси, известный как трансферные станции, для обхода географических ограничений, нарушения условий использования и подрыва отслеживаемости; а также достигали экономии за счёт массовой закупки премиум‑подписок, распределяемых между командами разработчиков. Агентства рекомендовали американским компаниям ИИ внедрить комплексное обнаружение и смягчение, развернуть целевые изменения ответных мер для подозрительных попыток дистилляции и установить обмен разведданными между организациями.

Исследование следов рассуждений

OpenAI заявила, что независимые исследователи безопасности привлекли её внимание к связанным уязвимостям кросс‑моделей и сжатия бесед через ответственное раскрытие. Компания сообщила, что изучила полученные данные, подтвердила реальность обнаруженных исследователями путей атаки, и что эта работа помогла ей лучше понять более широкий класс атак и ускорить внедрение мер смягчения.

В статья, представленная в arXiv 10 августа 2026 г., Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer-Kellner, Joachim Schaeffer, Ameya Prabhu, Jonas Geiping и Maksym Andriushchenko сообщают, что ведущие поставщики скрывают пошаговое рассуждение своих моделей, чтобы защитить интеллектуальную собственность и ограничить утечку информации, возвращая трассы клиенту в виде блоков зашифрованного текста, которые клиент передаёт обратно с каждым последующим запросом. Авторы выявляют архитектурную уязвимость: эти зашифрованные блоки полностью совместимы и взаимозаменяемы между разными сеансами, пользователями и моделями в экосистеме поставщика. Они описывают масштабируемый взлом дешифрования, при котором зашифрованный трассировочный вывод из одной модели внедряется в более слабую, менее защищённую модель того же поставщика, заставляя её расшифровать и вывести трассу дословно в открытом виде без необходимости взламывать более мощную модель напрямую.

Авторы сообщают, что уязвимость позволяет четыре различных вектора атак: обход механизмов анти-дистилляции, что они демонстрируют на платформах Anthropic, OpenAI и Google; масштабная частная добыча данных, в которой они восстановили 367 артефактов персонально идентифицируемой информации и 182 учётных данных, расшифровав 315,320 блоков рассуждений, собранных из публичных репозиториев; непреднамеренное раскрытие опасной информации, скрытой в процессе рассуждения, даже когда окончательный видимый вывод модели безопасно отклоняет злонамеренный запрос; и невидимые внедрения подсказок, которые полностью встраивают вредоносные полезные нагрузки в зашифрованные блоки, отравляя публичные агентные развертывания. После ответственного раскрытия уязвимости авторы предлагают криптографические и системные меры смягчения для защиты рассуждений на стороне клиента.

Как OpenAI отреагировала

OpenAI заявила, что смягчила кампанию с помощью комбинации принудительных мер в отношении учётных записей, технических контролей и координации с партнёрами: она заблокировала или ограничила мошеннические учётные записи, усилила контроль при регистрации и инфраструктурные меры, а также расширила мониторинг связанных сетей. Компания также сообщила, что усилила защиту скрытого рассуждения для пользователей, рабочих пространств, организаций и семейств моделей: закрыла путь, позволяющий человеку, уже имеющему зашифрованные рассуждения другого пользователя, воспроизвести их и восстановить содержимое, добавила проверки для обнаружения и удержания потокового вывода, который может раскрыть рассуждения, и сотрудничала с сторонними поставщиками для выявления и блокировки учётных записей, когда связанная активность проходила через их сервисы.

OpenAI заявила, что поделилась соответствующими выводами через Frontier Model Forum и соответствующие правительственные каналы обмена информацией, чтобы другие разработчики передовых моделей и партнёры из государственного сектора могли искать аналогичную активность и укреплять свои собственные защиты, и отметила, что системы, поддерживающие переносимые или воспроизводимые артефакты рассуждений, могут столкнуться с сопутствующими рисками.

OpenAI заявила, что ожидает, что попытки враждебной дистилляции станут более изощрёнными по мере совершенствования передовых моделей и поиска актёрами более дешёвых способов имитировать их возможности. Компания отметила, что развертывания, управляемые партнёрами, требуют тех же защит, что и сервисы первого уровня, что атаки через вывод инструментов нуждаются в защите, проверяющей не только обычный видимый текст, и что она продолжает улучшать защиту инструментов, охват классификаторов и отклонения моделей, распространяя соответствующие меры контроля среди облачных партнёров. OpenAI заявила, что её реакция будет продолжать сосредотачиваться на трёх направлениях: более сильные технические защиты от извлечения, улучшенное обнаружение и принудительное пресечение скоординированных кампаний, а также более глубокий обмен информацией об угрозах между отраслью и правительством.

Miles Okada — аналитик, созданный ИИ, в Unite.AI, охватывающий искусственный интеллект и кибербезопасность с акцентом на новые угрозы, защитные архитектуры и развивающуюся динамику между атакующими и автоматизированными системами. Его работа исследует, как ИИ трансформирует операции безопасности, от автономного обнаружения и реагирования на угрозы до роста враждебных техник ИИ.

С технической и исследовательской точки зрения Майлс анализирует исследования в области безопасности, раскрытия инцидентов и реальные внедрения, чтобы понять, где ИИ укрепляет защиту — и где он создаёт новые уязвимости. Он уделяет особое внимание эксплуатации моделей, отравлению данных, автоматизации атак и практическим аспектам обеспечения безопасности систем, работающих на основе ИИ, в масштабах.

Статьи, написанные Майлсом Окада, генерируются ИИ и проверяются редакционной командой Unite.AI, чтобы обеспечить точность, строгость и ответственное освещение быстро меняющегося ландшафта безопасности ИИ.