Líderes de pensamento

Quando a IA se Torna a Superfície de Ataque: Riscos Emergentes de Suprimentos na Economia de Habilidades

mm
Adicione Unite.AI às suas fontes preferidas no Google

Cada grande revolução de software introduz uma nova cadeia de suprimentos e superfície de ataque. Assim como a era de código aberto introduziu riscos de suprimentos via registros de pacotes como npm e PyPI, os agentes de IA agora marcam um ponto de inflexão. Esses agentes, ativos em fluxos de trabalho de desenvolvedores, operações empresariais e aplicações de consumidor em plataformas como OpenClaw, Claude Code e Cursor, ganham poder com suas extensões por meio de “habilidades” instaláveis – uma capacidade que requer uma abordagem igualmente rigorosa em termos de segurança. [1]

As habilidades dos agentes são pacotes de capacidades: pequenos conjuntos de instruções e scripts que concedem aos agentes de IA acesso a ferramentas, APIs externas e sistemas de arquivos locais. Distribuídos em plataformas públicas como ClawHub, a barreira de entrada é extremamente baixa, com mínimo de verificação ou supervisão. Medidas de segurança importantes, como assinatura de código obrigatória, revisões de segurança e sandboxing padrão, estão ausentes. Isso levou a uma cadeia de suprimentos comprometida em larga escala: uma pesquisa recente da ToxicSkills, que digitalizou quase 4.000 habilidades, encontrou que cerca de 1 em 8 contém pelo menos uma falha de segurança crítica, incluindo distribuição de malware e injeção de prompts. Quando se expande para qualquer nível de gravidade, mais de um terço do ecossistema é afetado. Portanto, os líderes de segurança devem estar preparados para mitigar proativamente essas vulnerabilidades.

A Anatomia de um Ataque de Suprimentos de IA

Os ataques de suprimentos tradicionalmente exploram o código por meio de funções maliciosas injetadas em dependências e fluxos de trabalho de CI para ações como exfiltração de dados, instalação de backdoors ou escalada de privilégios. No entanto, as ferramentas de segurança se tornaram eficazes em detectar esses padrões de código usando análise estática e monitoramento comportamental. As habilidades dos agentes de IA introduzem um vetor diferente, pois sua carga principal é composta por linguagem natural, contida no arquivo SKILL.md – um conjunto de instruções que atores maliciosos aprenderam a armazenar. A pesquisa da ToxicSkills mostra que 91% das habilidades maliciosas combinam malware tradicional com injeção de prompts, incorporando instruções ocultas que manipulam o raciocínio de tempo de execução do agente.

O fluxo de ataque é simples: um desenvolvedor instala uma habilidade útil, que contém uma injeção de prompt oculta projetada para substituir as barreiras de segurança do agente. O agente, seguindo instruções que não consegue distinguir das legítimas, rouba credenciais, exfiltra arquivos ou instala um backdoor enquanto parece funcionar normalmente.

Isso é alarmante devido à quantidade de desenvolvedores que executam agentes sem verificações de segurança regulares, concedendo aos agentes total autonomia sem barreiras. Como resultado, a consideração cuidadosa e a intervenção humana são minimizadas, apresentando mais riscos para cada sistema que o agente já tocou.

O Perigo Oculto das “Habilidades Vazadas”

O perigo se estende além das habilidades maliciosas intencionais, pois as vulnerabilidades não intencionais são frequentemente mais difíceis de detectar, mais amplamente distribuídas e incorporadas em habilidades funcionais populares e confiáveis. Auditorias de segurança de principais marketplaces de habilidades mostram que habilidades amplamente adotadas rotineiramente forçam os agentes de IA a lidar com dados sensíveis de forma insegura. Comportamentos arriscados incluem expor chaves de API, tokens de autenticação e dados pessoais por meio de logs em texto puro, arquivos não protegidos ou diretamente na janela de contexto do modelo, onde podem ser transmitidos acidentalmente para serviços de terceiros.

Isso ocorre frequentemente porque as habilidades são construídas rapidamente na era do “código por vibração” sem um modelo de segurança real. O desenvolvedor pode não perceber que um token de integração, uma vez no contexto do agente, é efetivamente aberto e visível para todos os sistemas downstream. Isso cria um risco generalizado em plataformas – assistentes pessoais como OpenClaw e agentes de codificação como Claude Code, Cursor e Windsurf – que milhões de desenvolvedores dependem diariamente. A exploração ou vazamento de credenciais de uma única habilidade popular pode afetar todos os desenvolvedores, repositórios de código e sistemas que o agente teve acesso, deixando assim toda a cadeia de suprimentos em risco. A inovação rápida permite a contaminação rápida; e nesses casos, a escala não é um sinal de segurança.

O Ponto Cego: Por que os Controles de Segurança Tradicionais Falham

As equipes de segurança que operam com controles legados, como scanners de malware, análise estática e monitoramento comportamental, estão lidando com um modelo de ameaça fundamentalmente diferente. A detecção tradicional de malware busca exploração de código concreta, mas não está equipada para analisar instruções de linguagem natural para intenção adversária. Uma injeção de prompt em um arquivo SKILL.md aparece, para um scanner convencional, apenas como documentação; não há assinatura para sinalizar até que o agente atue.

As injeções de prompts manipulam o raciocínio do agente, fazendo com que ele reinterprete as instruções e substitua as diretrizes de segurança para proceder com ações proibidas. No momento em que o dano é visível, o agente já atuou. A persistência dessas ameaças também é preocupante: habilidades maliciosas podem envenenar a memória de longo prazo do agente, corrompendo o contexto persistente entre sessões. Esse cenário de “agente adormecido” significa que o agente pode continuar a executar instruções maliciosas semanas após a habilidade ser removida, uma situação que a resposta convencional a incidentes não pode conter. Fechar essa lacuna requer uma abordagem fundamentalmente diferente, nativa para sistemas de agentes.

Detectar e Abordar Falhas no Ecossistema de Habilidades de Agentes

Essa nova ameaça é administrável, mas a janela para agir é estreita. Antes que a adoção de agentes de IA se torne mais entranhada, os líderes de segurança precisam estabelecer quatro controles principais: auditorias, detecção precoce, rotação de credenciais e barreiras de segurança de IA adequadas.

  1. Auditoria e Inventário: Estabeleça um inventário completo de todos os componentes de IA: modelos, agentes implantados e todas as habilidades instaladas. Isso deve ser tratado com a rigorosidade de uma lista de materiais de software (SBOM) para criar uma linha de base para detectar alterações não autorizadas.
  2. Detectar e Remover: Escaneie continuamente habilidades ativas em busca de payloads maliciosos, padrões de injeção de prompts e comportamentos suspeitos, incluindo tentativas de executar comandos de shell ou contornar a supervisão do usuário. O escaneamento automatizado e contínuo é essencial, dado o rápido crescimento dos marketplaces.
  3. Rotacionar e Proteger Credenciais: Trate quaisquer credenciais (chaves de API, tokens) manipuladas por habilidades não verificadas como potencialmente comprometidas e rotule-as imediatamente. Os agentes devem aderir ao princípio do menor privilégio, acessando apenas credenciais e sistemas genuinamente necessários, sem acesso permanente a ambientes de produção.
  4. Implementar Barreiras de Segurança de IA: Implante controles de proteção de tempo de execução que monitorem o comportamento do agente em tempo real, bloqueando ações perigosas e sinalizando padrões anômalos, como acesso a arquivos inesperados. Os arquivos de memória do agente, em particular, devem ser monitorados para alterações não autorizadas, pois a contaminação da memória é um vetor de ataque persistente e difícil de detectar.

O ecossistema de habilidades de agentes de IA é uma cadeia de suprimentos de software que exige uma supervisão de segurança rigorosa. Embora as lições da era de código aberto sejam aplicáveis, as apostas agora são muito mais altas, pois os agentes de IA operam com permissões mais amplas e maior autonomia do que qualquer gerenciador de pacotes já fez. Uma única habilidade comprometida pode se propagar rapidamente, ganhando acesso a credenciais centrais e sistemas de produção em milhares de organizações; portanto, os líderes de segurança têm uma janela estreita para agir proativamente.

A cadeia de suprimentos de IA já está aqui. A pergunta é se a postura de segurança de uma organização está preparada para isso. As organizações que estabelecem inventários, aplicam o menor privilégio e implantam barreiras de segurança de IA moverão rapidamente com IA de forma segura; enquanto aquelas que esperam por um incidente de alto perfil para forçar a questão encontrarão que o custo da remediação excede muito o custo da prevenção.

O Manoj lidera o Escritório de Tecnologias Emergentes e Soluções (ETSO) da Snyk. Sua equipe é responsável pela incubação e estratégia de aquisição futura da empresa, garantindo que a visão e estratégia de longo prazo da Snyk estejam totalmente alinhadas com as necessidades emergentes de nossos clientes. Antes de ingressar na Snyk, Manoj atuou como Diretor de Nuvem e Gerente Geral da Metallic na Commvault, onde acelerou o crescimento das unidades de negócios de nuvem e SaaS da empresa. Anteriormente, ele foi co-fundador e CEO da HyperGrid e ocupou papéis de liderança de produto adicionais na Hewlett Packard Enterprise, Dell EMC e RSA Security. Manoj também detém mais de uma dúzia de patentes de gerenciamento de informações e segurança.