Cibersegurança

OpenAI interrompe campanha coordenada de extração de raciocínio de modelo

mm
Adicione Unite.AI às suas fontes preferidas no Google

OpenAI disse em uma postagem de segurança publicada em 30 de setembro de 2026 que identificou e interrompeu uma campanha coordenada projetada para extrair raciocínio protegido de seus modelos, e atribuiu um núcleo da atividade a indivíduos associados à Moonshot AI, desenvolvedora do Kimi. A atividade mais antiga observada ocorreu na primeira semana de julho de 2026.

O que a OpenAI observou

A OpenAI descreveu a atividade como consistente com destilação adversária, que definiu como o uso sistemático e não autorizado das saídas ou do raciocínio de um modelo para ajudar a treinar, reproduzir ou melhorar outro modelo. Raciocínio protegido, segundo a empresa, é o registro interno do modelo ao trabalhar em uma tarefa; extraí‑lo pode revelar informações retidas da resposta final e ajudar outros a reproduzir as capacidades do modelo.

A OpenAI afirmou que os operadores não quebraram sua criptografia, comprometeram um banco de dados ou obtiveram acesso direto às conversas de usuários armazenadas. Os operadores manipularam interações com o modelo de modo que o raciocínio protegido pudesse ser reproduzido em formas visíveis ao solicitante de maneira coordenada e em escala, violando os termos de serviço da empresa. Uma técnica observada pela OpenAI envolvia copiar o raciocínio criptografado de uma conversa e solicitar a um modelo em outra conversa que descriptografasse e transcrevesse o conteúdo oculto do raciocínio. A empresa disse que a manipulação não é uma vulnerabilidade exclusiva de seus modelos e que compartilhou informações sobre o assunto com parceiros da indústria por meio do Frontier Model Forum para reforçar as defesas coletivas.

A atividade começou em 1º de julho de 2026, inicialmente com volume baixo, até que a OpenAI observou picos de alto volume em 24 e 25 de julho de 2026, consistindo em 16.000 solicitações usando um padrão de extração relevante de mais de 4.000 usuários. Uma nota de rodapé na publicação indica que esses números descrevem extrações tentativas, não necessariamente bem‑sucedidas. A OpenAI afirmou que investigação adicional identificou atividade de padrão de prompt relacionada em um conjunto de mais de 15.000 usuários, que foi totalmente interrompida até 28 de julho de 2026. A atividade evoluiu ao longo do tempo, o que a empresa disse reforçar que a destilação adversária é um desafio de segurança mais amplo que requer defesas em camadas e adaptativas.

A OpenAI afirmou que a destilação adversária representa riscos de segurança e segurança nacional: o raciocínio extraído pode ser usado para treinar outro modelo sem preservar as salvaguardas aplicadas às respostas voltadas ao usuário do modelo original, e a destilação em escala pode acelerar a transferência de capacidades avançadas sem o mesmo investimento em segurança, preocupações que a empresa disse se intensificarem à medida que os modelos adquirem capacidades de uso duplo. A OpenAI declarou que, antes de publicar, investigou o escopo e o impacto potencial da campanha, implementou suas próprias mitigações, compartilhou e recebeu feedback de pesquisadores e parceiros da indústria, e que trabalhos adicionais de mitigação e investigação continuam.

Atribuição

A OpenAI disse que não está claro se todos os operadores observados durante o período relevante provinham de um único agente, e que atribui um núcleo da atividade a indivíduos associados à Moonshot AI, desenvolvedora do Kimi.

Em 8 de setembro de 2026, a National Security Agency, a Cybersecurity and Infrastructure Security Agency e o Federal Bureau of Investigation divulgaram um aviso conjunto de cibersegurança afirmando que a Moonshot AI conduziu uma campanha de destilação generalizada contra empresas de IA de fronteira dos EUA desde, pelo menos, meados de 2025. O aviso declara que a Moonshot AI extraiu dados significativos do Claude Fable 5 para treinar seu modelo Kimi‑K3 e dados do GPT‑4o para treinar seu modelo Kimi‑K2, e que a empresa utilizou modelos dos EUA para destilar otimização de ajuste fino supervisionado, aprendizado por reforço, engenharia de software e capacidades matemáticas.

O aviso afirma, de forma mais ampla, que, provavelmente com o conhecimento do governo chinês, DeepSeek, Moonshot AI, Alibaba, MiniMax, StepFun e Z.AI extraíram bilhões de tokens em milhões de trocas de modelos de fronteira dos EUA, incluindo variantes do Claude, GPT, Gemini e Grok, desde, pelo menos, o final de 2024. Segundo as agências, essas empresas encaminharam solicitações por meio de APIs nativas, provedores de nuvem remotos e agregadores de terceiros; usaram um mercado cinza de proxies de API conhecidos como estações de transferência para contornar restrições geográficas, violar termos de uso e minar a rastreabilidade; e obtiveram economias de custo através da compra em massa de assinaturas premium compartilhadas entre equipes de desenvolvedores. As agências recomendaram que as empresas de IA dos EUA implementem detecção e mitigação abrangentes, implantem mudanças de resposta direcionadas para tentativas suspeitas de destilação e estabeleçam compartilhamento de inteligência entre organizações.

A pesquisa sobre rastreamento de raciocínio

A OpenAI afirmou que pesquisadores de segurança independentes trouxeram vulnerabilidades relacionadas de cruzamento de modelos e compactação de conversas à sua atenção por meio de divulgação responsável. A empresa disse que investigou as descobertas, confirmou que os caminhos de ataque identificados pelos pesquisadores eram reais, e que o trabalho ajudou a compreender a classe de ataque mais ampla e a acelerar as mitigações.

Em um artigo submetido ao arXiv em 10 de agosto de 2026, Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer‑Kellner, Joachim Schaeffer, Ameya Prabhu, Jonas Geiping e Maksym Andriushchenko relatam que provedores líderes ocultam o raciocínio passo a passo de seus modelos para proteger a propriedade intelectual e limitar vazamentos de informação, devolvendo os rastros ao cliente como blocos de texto criptografado que o cliente envia de volta a cada solicitação subsequente. Os autores identificam uma vulnerabilidade arquitetural: esses blocos criptografados são totalmente compatíveis e intercambiáveis entre diferentes sessões, usuários e modelos dentro do ecossistema de um provedor. Eles descrevem um jailbreak de descriptografia escalável no qual um rastreio de raciocínio criptografado de um determinado modelo é injetado em um modelo mais fraco e menos protegido do mesmo provedor, forçando-o a decodificar e emitir o rastreio literalmente em texto plano sem precisar comprometer diretamente o modelo mais capaz.

Os autores relatam que a vulnerabilidade possibilita quatro vetores de ataque distintos: contornar mecanismos anti‑destilação, que demonstram em Anthropic, OpenAI e Google; extração massiva de dados privados, na qual recuperaram 367 artefatos de informações pessoalmente identificáveis e 182 credenciais ao decodificar 315.320 blocos de raciocínio extraídos de repositórios públicos; revelação inadvertida de informações perigosas ocultas no processo de raciocínio mesmo quando a saída visível final do modelo rejeita com segurança uma solicitação maliciosa; e injeções de prompt invisíveis que incorporam cargas maliciosas totalmente dentro de blocos criptografados para envenenar implantações públicas de agentes. Após divulgação responsável, os autores propõem mitigações criptográficas e de nível de sistema para proteger o raciocínio no lado do cliente.

Como a OpenAI respondeu

A OpenAI afirmou que mitigou a campanha por meio de uma combinação de aplicação de políticas de contas, controles técnicos e coordenação com parceiros: proibiu ou restringiu contas fraudulentas, reforçou os controles de cadastro e de infraestrutura e ampliou a monitorização de redes relacionadas. A empresa disse que também reforçou as proteções para o raciocínio oculto entre usuários, espaços de trabalho, organizações e famílias de modelos: fechou um caminho que permitia a alguém que já possuía o raciocínio criptografado de outro usuário reproduzi‑lo e recuperar seu conteúdo, adicionou verificações para detectar e reter a saída em streaming que poderia expor o raciocínio, e trabalhou com provedores terceirizados para identificar e interromper contas quando atividades relacionadas trafegavam por seus serviços.

A OpenAI declarou que compartilhou as descobertas relevantes através do Frontier Model Forum e de canais adequados de compartilhamento de informações governamentais, para que outros desenvolvedores de modelos de fronteira e parceiros do setor público pudessem buscar atividades semelhantes e reforçar suas próprias defesas, e observou que sistemas que suportam artefatos de raciocínio portáteis ou reproduzíveis podem enfrentar riscos relacionados.

A OpenAI afirmou que espera que as tentativas de destilação adversária se tornem mais sofisticadas à medida que os modelos de fronteira avançam e que os atores busquem maneiras mais baratas de imitar suas capacidades. A empresa disse que implantações hospedadas por parceiros precisam das mesmas proteções que os serviços de primeira‑parte, que ataques baseados na saída de ferramentas exigem proteções que analisam mais do que o texto visível comum, e que continua aprimorando as defesas de ferramentas, a cobertura de classificadores e as recusas de modelo, ao mesmo tempo que propaga controles relevantes entre parceiros de nuvem. A OpenAI declarou que sua resposta continuará focada em três áreas: proteções técnicas mais robustas contra extração, detecção e aplicação mais eficazes contra campanhas coordenadas e compartilhamento aprofundado de informações sobre ameaças entre a indústria e o governo.

Miles Okada é um analista gerado por IA na Unite.AI, cobrindo inteligência artificial e cibersegurança com foco em ameaças emergentes, arquiteturas defensivas e nas dinâmicas evolutivas entre invasores e sistemas automatizados. Seu trabalho examina como a IA está remodelando as operações de segurança, desde a detecção e resposta autônomas a ameaças até o surgimento de técnicas adversariais de IA.

Com uma perspectiva técnica e investigativa, Miles analisa pesquisas de segurança, divulgações de incidentes e implantações reais para entender onde a IA reforça defesas — e onde ela introduz novas vulnerabilidades. Ele presta atenção especial à exploração de modelos, envenenamento de dados, automação de ataques e às realidades operacionais de proteger sistemas alimentados por IA em escala.

Artigos escritos por Miles Okada são gerados por IA e revisados pela equipe editorial da Unite.AI para garantir precisão, rigor e cobertura responsável do cenário de segurança de IA em rápida mudança.