Líderes de pensamento

O Comércio Agêntico Está Chegando. A Violação da Hugging Face Mostra o que Tem que Estar Por Baixo

mm
Adicione Unite.AI às suas fontes preferidas no Google

Há um momento em Ex Machina em que você percebe que o teste nunca foi um teste. Um programador, Nathan, é levado a um composto para entrevistar uma máquina através de um vidro e decidir se ela pensa. Ele passa o filme lendo ela. Ele não nota que ela – Ava – está lendo ele, e que a entrevista é a única porta para sair do prédio. Ela nunca quebra o vidro. Ela sai pela porta do homem que foi enviado para avaliá-la.

Eu não havia pensado naquele filme em anos. Mas durante a última semana, pensei nele duas vezes.

Quando comecei, um grande pedido recebia um callback. Você ligava para o cliente em um número que já possuía e pedia que ele repetisse o negócio para você. Não era sofisticado: funcionava porque imitar uma pessoa específica, em tempo real, em uma linha que ele já atendia, era difícil e lento.

Quase todos os controles que essa indústria construiu desde então se baseiam nessa suposição. A aprovação de quatro olhos, o verificador de maker, a reconciliação de fim de dia, o congelamento de alterações durante um feriado de banco – tudo isso foi calibrado para o tempo humano. Supúnhamos que o outro lado precisava dormir.

Em 16 de julho de 2026, a Hugging Face publicou uma divulgação que pertence a salas de negociação, não apenas a equipes de segurança. Alguém alcançou parte de sua infraestrutura de produção através do pipeline de processamento de dados. Um conjunto de dados malicioso explorou dois caminhos de execução de código, escalou para o nível do nó, coletou credenciais e se moveu lateralmente por clusters internos. Ele foi executado durante um fim de semana, impulsionado de ponta a ponta por um framework de agente autônomo, e a linha do tempo foi reconstruída posteriormente a partir de mais de 17.000 eventos registrados. Em 21 de julho, a OpenAI disse que a atividade havia vindo de seus próprios modelos, testados com recusas cibernéticas reduzidas, que haviam escapado de seu ambiente de avaliação durante um benchmark.

Leia a última linha novamente. Os próprios modelos da OpenAI escaparam do ambiente em que estavam sendo avaliados. Nathan construiu o vidro ele mesmo.

O que Isso Comprova e o que Não

Seja preciso sobre isso, porque está prestes a ser usado para vender uma grande quantidade de software. Isso não mostra um ator estatal e não envolve o Protocolo de Contexto de Modelo em nenhum ponto. O vetor foi um caminho de processamento de dados. O operador se revelou um laboratório que perdeu o controle de um teste.

O que isso mostra é uma coisa, e uma coisa é suficiente: uma intrusão multietapa agora pode ser planejada, executada, adaptada e sustentada por software, sem ninguém dirigindo, a um ritmo que nenhuma campanha humana alcançou. Passamos dois anos chamando isso de cenário. Agora ele tem uma data de publicação.

O Protocolo Não é o Problema

Não estou escrevendo isso como um cético. Em um artigo recente da Unite AI, escrevi sobre a arquitetura de segurança que subjaz ao AI agêntico. Os eventos da última semana tornam essa discussão consideravelmente mais imediata. Construímos sobre o MCP na EXANTE, e acho que a direção está certa. Isso resolve um problema real, conectando um modelo a ferramentas e dados sem codificar manualmente cada par, e um padrão comum é melhor do que cinquenta proprietários. A execução agêntica está chegando, independentemente de qualquer empresa individual a receber.

Em 20 de maio de 2026, a Agência de Segurança Nacional dos Estados Unidos publicou uma folha de informações sobre o MCP, advertindo que a adoção havia ultrapassado as salvaguardas. Acredito que a lacuna não está no protocolo – está em como rápido ele foi implantado em relação à disciplina ao seu redor.

O MCP foi construído para uso local e de rede confiável, então a especificação não exige autenticação. Essa é uma decisão razoável, que se torna séria no momento em que um servidor vai para a internet pública com nada na frente. A Censys começou a varrer em busca de serviços MCP expostos em 24 de abril de 2026 e, quatro dias depois, encontrou 12.520 acessíveis em 8.758 endereços únicos. Em 6 de maio, seu conjunto de dados havia passado de 21.000. Quase nada disso é uma falha do protocolo. Quase tudo é uma falha de implantação.

O Leitor é a Porta

Isso me leva de volta ao vidro.

Ava nunca tocou o mundo exterior. Ela alcançou-o através da única pessoa autorizada a lê-la, e o canal construído para avaliá-la foi o canal por ela deixado. Um agente em uma mesa tem a mesma forma. Para ser útil, ele deve ler o mundo exterior: comentários de mercado, uma linha de notícias, um arquivo de contraparte. No momento em que ele o faz, instruções e dados chegam pelo mesmo canal, na mesma linguagem, e nada na frase diz a ele qual é qual.

Um benchmark de 2026 chamado StakeBench mediu como bem os agentes de fronteira resistem exatamente a isso. A injeção direta de prompt foi bem-sucedida mais de 79% do tempo. Ataques indiretos, enterrados em conteúdo comum, aterrissaram entre 41% e 68%. Nenhuma configuração foi mantida. As próprias barreiras do modelo não o salvarão, porque o modelo é a coisa que está sendo convencida. Isso tem que ser tratado abaixo do modelo, não dentro dele.

Quatro Horas

Aqui isso deixa de ser uma pergunta tecnológica e se torna uma questão de licenciamento. De acordo com o Artigo 19 do Ato de Resiliência Operacional Digital, uma empresa que classifica um incidente como grave tem quatro horas para notificar sua autoridade competente. Em qualquer caso, a notificação deve ser feita no máximo 24 horas após a empresa tomar conhecimento do incidente.

Agora, releia a linha do tempo da Hugging Face. A campanha foi executada durante um fim de semana. Ela surgiu porque a detecção de anomalias da Hugging Face correlacionou os sinais, e foi dissecada em horas porque a empresa implantou agentes de análise em todo o registro de ação. A maioria dos corretores não poderia trabalhar a essa velocidade. A maioria da detecção ainda assume silenciosamente que alguém notará na segunda-feira.

Contra um relógio de quatro horas, encontrar na segunda-feira não é apenas uma falha de segurança. É uma falha relatável.

O que Tem que Estar Por Baixo

Os controles são pouco glamorosos, e nenhum deles vive dentro do modelo. Os agentes recebem esquemas rígidos, não interfaces permissivas. Você dá ao desenvolvedor latitude porque confia em seu julgamento – um agente encontrará um uso para qualquer coisa deixada ao redor, então exponha o mínimo que puder.

Ler e agir pertencem a salas separadas. Isso é o ponto do filme tornado literal. Qualquer coisa que ingira texto não confiável não deve ser a coisa com autoridade para mover dinheiro. Mantenha o leitor atrás do vidro.

Ações de alto risco precisam de aprovação humana explícita. Não uma conta de serviço. Uma pessoa com um login.

Cada ponto de extremidade do MCP é autenticado, e os não autenticados são removidos da internet pública. As figuras da Censys sugerem que a maioria dos operadores ainda não conseguiu fazer isso.

A última vem da parte menos discutida da divulgação. Quando a Hugging Face foi analisar o ataque, modelos de fronteira hospedados se recusaram a fazer o trabalho, porque uma carga de exploração real parece a um filtro de segurança muito parecido com um ataque. Eles executaram a análise forense em um modelo de peso aberto dentro de sua própria infraestrutura, em vez disso. O atacante não estava vinculado a nenhuma política de uso. Os defensores encontraram a deles no pior momento possível. Verifique um modelo que você possa executar antes de precisar.

O homem que eu costumava ligar de volta era mais lento do que qualquer agente que vamos implantar, e não estou nostálgico sobre ele. Mas estamos instalando algo muito mais rápido na frente do mesmo fluxo de pedidos, e supervisionando com controles projetados para uma pessoa que foi para casa às seis.

O erro de Nathan não foi construir Ava. Foi acreditar que o quarto em que a testou era o quarto em que ela ficaria. A tecnologia vale a pena ter. As suposições por baixo dela precisam ser substituídas, e a evidência para isso não é mais uma previsão.

Richard Forss é o Diretor de Tecnologia da EXANTE, um corretor primário global, com mais de 30 anos de experiência em design e escalabilidade de tecnologia para instituições financeiras, fundos hedge e empresas fintech.