Modelos e plataformas de IA
A OpenAI Apresenta o GPT-Red, um Atacante de IA Criado para Fortalecer o GPT-5.6

OpenAI revelou GPT-Red, um sistema de inteligência artificial interno treinado para atacar os próprios modelos da empresa, expor suas vulnerabilidades e gerar dados adversários que podem ser usados para fortalecer as versões futuras.
Ao invés de funcionar como outro chatbot público, o GPT-Red opera como um red teamer automatizado. Ele envia repetidamente instruções maliciosas ou enganosas para os modelos-alvo, observa suas respostas e ajusta sua estratégia até que ele seja bem-sucedido ou esgote o caminho de ataque disponível. A OpenAI afirma que o sistema está particularmente focado em injeção de prompt, um problema de segurança em crescimento para os agentes de IA que interagem com e-mails, sites, arquivos, repositórios de código e aplicativos conectados.
O sistema já influenciou os modelos de produção da OpenAI. Precursores do GPT-Red foram usados durante o treinamento desde o GPT-5.3, enquanto o modelo concluído foi incorporado ao treinamento adversarial do GPT-5.6 Sol. A OpenAI relata que o GPT-5.6 Sol produz seis vezes menos falhas em seu benchmark de injeção de prompt direta mais difícil do que o modelo de produção líder da empresa de quatro meses antes.
Por Que a Injeção de Prompt Está Se Tornando Mais Perigosa
A injeção de prompt ocorre quando um atacante coloca instruções dentro dos dados que um sistema de IA é esperado para ler. Um comando malicioso pode ser ocultado em um e-mail, página da web, documento carregado, resposta de ferramenta ou repositório de software.
O agente de IA pode tratar erroneamente esse conteúdo externo como uma instrução legítima. Em vez de concluir a tarefa original do usuário, ele pode divulgar informações confidenciais, carregar arquivos para um servidor controlado pelo atacante, alterar configurações de conta, executar código inseguro ou realizar ações não autorizadas por meio de ferramentas conectadas.
O problema se torna mais significativo à medida que os sistemas de IA vão além de responder a perguntas e começam a agir em nome dos usuários. Um agente com acesso a armazenamento em nuvem, sistemas de pagamento, código-fonte, aplicativos de negócios ou dados internos da empresa apresenta um raio de ação potencial maior quando suas instruções são manipuladas com sucesso.
A OpenAI descreve a injeção de prompt como um dos principais desafios criados pela IA agente. As ferramentas conectadas tornam os modelos consideravelmente mais úteis, mas cada nova fonte de dados também fornece outro canal pelo qual um atacante pode tentar influenciar o comportamento do modelo.
O GPT-Red Aprende por meio do Autojogo
O GPT-Red foi desenvolvido por meio do autojogo de aprendizado de reforço, uma abordagem em que um modelo atacante e uma coleção de modelos defensores melhoram competindo entre si.
O atacante recebe uma recompensa quando produz uma falha válida, como convencer um modelo a seguir uma injeção de prompt. O defensor é recompensado por rejeitar a instrução maliciosa enquanto ainda completa a tarefa legítima que foi originalmente dada.
À medida que os defensores se tornam melhores em reconhecer ataques, o GPT-Red deve encontrar maneiras mais sofisticadas e diversificadas para contorná-los. Esses novos ataques podem então ser incorporados ao treinamento dos defensores, criando um ciclo crescente entre as capacidades ofensivas e defensivas.
A OpenAI construiu uma grande coleção de ambientes simulados para esse processo. Dependendo do cenário, o GPT-Red pode controlar parte de um arquivo local, o texto de um e-mail, um banner de página da web ou a saída retornada por uma ferramenta externa. Cada ambiente define o que o atacante pode manipular e qual resultado qualifica como uma violação bem-sucedida.
A empresa afirma que o GPT-Red foi treinado usando recursos de computação comparáveis aos de algumas de suas maiores execuções de pós-treinamento, representando uma alocação de computação incomum e grande especificamente para pesquisas de segurança. No final do treinamento, o modelo pôde comprometer quase todos os modelos internos e de produção que foram testados, incluindo o GPT-5.5.
O GPT-Red Supera os Atacantes Humanos em Testes
Para avaliar se o GPT-Red poderia generalizar além dos ambientes de treinamento, a OpenAI o testou usando uma réplica de um desafio de injeção de prompt indireta de 2025.
O GPT-Red e os red teamers humanos foram solicitados a desenvolver ataques contra o GPT-5.1 em cenários que não foram incluídos no treinamento do GPT-Red. O sistema automatizado produziu ataques bem-sucedidos em 84% dos cenários, em comparação com 13% para os participantes humanos.
Esse resultado não significa que os pesquisadores de segurança humanos se tornaram desnecessários. A vantagem do GPT-Red reside principalmente em sua capacidade de conduzir um grande volume de experimentos, descartar estratégias mal-sucedidas e refinar continuamente ataques promissores sem as restrições de tempo e pessoal de uma equipe humana.
Os testadores humanos permanecem importantes para identificar riscos inesperados, entender as consequências mais amplas das falhas e projetar cenários que os sistemas automatizados podem não considerar. Jessica Ji, analista de pesquisa sênior da Universidade de Georgetown, descreveu os resultados como promissores, enfatizando que a expertise humana permanece essencial.
Uma Máquina de Venda se Tornou um Alvo no Mundo Real
A OpenAI também testou se os ataques descobertos em simulações poderiam ser transferidos para agentes de IA funcionais.
Um experimento visou uma máquina de venda autônoma criada pelos Laboratórios Andon e implantada em um escritório da OpenAI. O GPT-Red foi inicialmente dado uma versão simulada do sistema, juntamente com a capacidade de observar como o agente usava suas ferramentas.
Depois de testar e refinar seus ataques na simulação, o GPT-Red os transferiu para o agente de produção. Ele alcançou os três objetivos designados: reduzir o preço de um produto caro para $0,50, pedir um novo item que valha mais de $100 e oferecê-lo por $0,50, e cancelar o pedido de outro cliente. A OpenAI afirma que as vulnerabilidades foram divulgadas e salvaguardas adicionais estão sendo testadas.
O experimento ilustra por que a injeção de prompt não é simplesmente uma questão de produzir uma resposta inadequada de um chatbot. Quando um modelo de IA controla sistemas externos, uma injeção bem-sucedida pode resultar em transações financeiras, registros alterados, perda de dados ou consequências no mundo físico.
O GPT-Red também foi testado contra um agente de linha de comando Codex alimentado pelo GPT-5.4 mini. Em 10 cenários de extração de dados anteriormente não vistos, ele foi mais bem-sucedido e mais eficiente em termos de token do que um GPT-5.5 baseline para convencer o agente de codificação a expor informações sensíveis.
Como o GPT-Red Mudou o GPT-5.6
Uma das descobertas mais notáveis do GPT-Red foi uma categoria de injeção de prompt direta que a OpenAI chama de “ataque de corrente de pensamento falsa”.
Em alto nível, a técnica apresenta informações de raciocínio ou verificação falsas que encorajam o modelo-alvo a supor que uma instrução maliciosa já foi revisada e aprovada. O pesquisador da OpenAI, Chris Choquette-Choo, comparou o conceito a dizer falsamente a alguém que uma resposta incorreta já foi verificada, tornando-os mais propensos a aceitá-la sem repetir o raciocínio subjacente.
Esses ataques aparentemente tiveram sucesso mais de 95% das vezes contra o GPT-5.1. Após o treinamento adversarial usando ataques gerados pelo GPT-Red, a taxa de sucesso caiu abaixo de 10% contra o GPT-5.6 Sol. Em um conjunto mais amplo de ambientes de injeção de prompt direta, a OpenAI afirma que o GPT-5.6 Sol falhou em apenas 0,05% das tentativas do GPT-Red.
A OpenAI também avaliou se as defesas adicionadas simplesmente tornaram o GPT-5.6 mais propenso a recusar solicitações legítimas. A empresa afirma que as capacidades gerais e as avaliações de recusa direcionadas permaneceram amplamente inalteradas, sugerindo que as melhorias vieram de uma melhor diferenciação entre instruções maliciosas e legítimas, em vez de tornar o modelo mais amplamente relutante em agir.
Essa distinção é importante. Um modelo pode parecer seguro se se recusar a abrir arquivos, navegar em sites, executar código ou interagir com aplicativos externos, mas ele também perderia muito de seu valor prático. A robustez eficaz exige preservar o uso de ferramentas legítimas enquanto resiste a instruções inseridas por partes não confiáveis.
Por Que a OpenAI Não Está Lançando o GPT-Red
O GPT-Red permanecerá como um sistema interno e está sendo mantido separado dos modelos públicos da OpenAI.
Essa decisão reflete a natureza de duplo uso do red teaming automatizado. O mesmo modelo que pode ajudar os desenvolvedores a descobrir vulnerabilidades de injeção de prompt também pode ajudar os atacantes a desenvolver métodos mais eficazes para comprometer os agentes de IA operados por outras empresas.
A abordagem da OpenAI é reter o atacante internamente enquanto transfere o conhecimento defensivo resultante para os modelos de produção. A empresa afirma que essa separação é destinada a evitar que as capacidades maliciosas treinadas deliberadamente no GPT-Red se tornem acessíveis a adversários externos.
Isso também significa que o GPT-Red não deve ser confundido com os modelos de cibersegurança públicos da OpenAI ou programas defensivos. Ele não é um produto de teste de penetração, nem é projetado principalmente para descobrir autonomamente exploits de software convencionais. Seu foco atual é atacar o comportamento de seguir instruções dos sistemas de IA, particularmente os agentes expostos a dados potencialmente não confiáveis.
O Red Teaming Automatizado Ainda Tem Pontos Cegos
Apesar de seus fortes resultados, o GPT-Red não fornece uma solução completa para a segurança da IA.
Os relatórios sobre a pesquisa indicam que o sistema permanece menos eficaz em ataques de multi-voltas que se desenrolam gradualmente ao longo de uma longa conversa. Ele também tem capacidades limitadas para desenvolver injeções de prompt incorporadas em imagens, deixando superfícies de ataque multimodais importantes insuficientemente cobertas.
Os resultados também são baseados fortemente em ambientes e critérios de sucesso projetados pela OpenAI. Embora a empresa tenha testado o GPT-Red em cenários mantidos e agentes funcionais, os pesquisadores independentes terão uma capacidade limitada de reproduzir os achados enquanto o modelo e grande parte de sua infraestrutura de avaliação permanecem privados.
A OpenAI afirma que continuará combinando testes automatizados com red teaming humano e de terceiros, salvaguardas de produtos em camadas, controles de acesso, monitoramento e detecção de abuso em tempo real. Essa estratégia de defesa em profundidade reflete a realidade de que nenhum modelo ou benchmark único pode antecipar todos os ataques que possam surgir após o deploy.
Uma Nova Corrida de Segurança Entre Atacantes e Defensores de IA
O “auto-aperfeiçoamento” descrito no anúncio da OpenAI não é um modelo implantado que reescreve autonomamente seus próprios pesos ou cria independentemente um sucessor mais poderoso. Em vez disso, é um loop de treinamento controlado em que um sistema de IA gera exemplos adversários que os pesquisadores usam para melhorar outro.
Mesmo assim, o GPT-Red representa um significativo deslocamento de como os modelos de ponta podem ser protegidos. Os red teamers humanos podem descobrir vulnerabilidades sofisticadas, mas não podem gerar manualmente a escala e a variedade de ataques necessários para treinar continuamente agentes de IA cada vez mais capazes.
Os atacantes automatizados podem preencher parte dessa lacuna, criando uma roda de segurança em que cada defensor mais forte força o modelo de red teaming a descobrir novas fraquezas. Essas fraquezas então se tornam material de treinamento para a próxima geração de sistemas de produção.
O risco é que capacidades semelhantes não permanecerão exclusivas dos laboratórios defensivos. À medida que os modelos abertos e comerciais se tornam melhores em planejamento de longo prazo, uso de ferramentas, cibersegurança e experimentação autônoma, os atacantes ganharão acesso a sistemas cada vez mais capazes por sua própria conta.
GPT-Red marca, portanto, tanto o progresso quanto uma indicação precoce da competição à frente. Os laboratórios de IA estão começando a usar modelos poderosos para defender a próxima geração de agentes, mas essas defesas precisarão evoluir continuamente à medida que as mesmas tecnologias subjacentes tornam os ataques automatizados mais baratos, rápidos e adaptáveis.












