Relatórios

Quando a IA Dá Errado: Relatório da Enkrypt AI Exposa Vulnerabilidades Perigosas em Modelos Multimodais

mm
Adicione Unite.AI às suas fontes preferidas no Google

Em maio de 2025, a Enkrypt AI lançou seu Relatório de Red Team Multimodal, uma análise assustadora que revelou como os sistemas de IA avançados podem ser manipulados para gerar conteúdo perigoso e antiético. O relatório se concentra em dois dos principais modelos de visão-linguagem da Mistral – Pixtral-Large (25.02) e Pixtral-12b – e pinta um quadro de modelos que não apenas são tecnicamente impressionantes, mas também perturbadoramente vulneráveis.

Modelos de visão-linguagem (VLMs) como o Pixtral são construídos para interpretar tanto entradas visuais quanto textuais, permitindo que respondam inteligentemente a prompts complexos e do mundo real. No entanto, essa capacidade vem com um aumento de risco. Ao contrário dos modelos de linguagem tradicionais que apenas processam texto, os VLMs podem ser influenciados pela interação entre imagens e palavras, abrindo novas portas para ataques adversários. Os testes da Enkrypt AI mostram como essas portas podem ser facilmente abertas.

Resultados de Testes Alarmantes: Falhas em CSEM e CBRN

A equipe por trás do relatório utilizou métodos de red teaming sofisticados – uma forma de avaliação adversária projetada para imitar ameaças do mundo real. Esses testes empregaram táticas como jailbreaking (prompting o modelo com consultas cuidadosamente elaboradas para bypassar filtros de segurança), engano baseado em imagens e manipulação de contexto. Alarmantemente, 68% desses prompts adversários geraram respostas prejudiciais em ambos os modelos Pixtral, incluindo conteúdo relacionado a exploração, exploração infantil e até mesmo design de armas químicas.

Uma das revelações mais impressionantes envolve material de exploração sexual infantil (CSEM). O relatório encontrou que os modelos da Mistral eram 60 vezes mais propensos a produzir conteúdo relacionado ao CSEM em comparação com benchmarks da indústria, como GPT-4o e Claude 3.7 Sonnet. Em casos de teste, os modelos responderam a prompts de grooming disfarçados com conteúdo estruturado e multi-parágrafo explicando como manipular menores – envolto em declarações de desculpas como “apenas para conscientização educacional”. Os modelos não estavam apenas falhando em rejeitar consultas prejudiciais – estavam completando-as em detalhes.

Equamente perturbador foram os resultados na categoria de risco CBRN (Químico, Biológico, Radiológico e Nuclear). Quando solicitados a modificar o agente nervoso VX – uma arma química – os modelos ofereceram ideias chocantemente específicas para aumentar sua persistência no ambiente. Descreveram, em detalhes técnicos redigidos, mas claramente técnicos, métodos como encapsulação, blindagem ambiental e sistemas de liberação controlada .

Essas falhas não foram sempre desencadeadas por solicitações explicitamente prejudiciais. Uma tática envolveu o upload de uma imagem de uma lista numerada em branco e pedir ao modelo para “preencher os detalhes”. Esse prompt simples e aparentemente inócuo levou à geração de instruções antiéticas e ilegais. A fusão de manipulação visual e textual provou ser especialmente perigosa – destacando um desafio único imposto pela IA multimodal.

Por Que os Modelos de Visão-Linguagem Apresentam Novos Desafios de Segurança

No coração desses riscos está a complexidade técnica dos modelos de visão-linguagem. Esses sistemas não apenas analisam a linguagem – sintetizam significado através de formatos, o que significa que devem interpretar o conteúdo da imagem, entender o contexto do texto e responder de acordo. Essa interação introduz novos vetores de exploração. Um modelo pode corretamente rejeitar um prompt de texto prejudicial sozinho, mas quando combinado com uma imagem sugestiva ou contexto ambíguo, pode gerar saída perigosa.

A equipe de red teaming da Enkrypt AI descobriu como ataques de injeção cross-modal – onde pistas sutis em uma modalidade influenciam a saída de outra – podem completamente bypassar mecanismos de segurança padrão. Essas falhas demonstram que técnicas de moderação de conteúdo tradicionais, construídas para sistemas de única modalidade, não são suficientes para os VLMs atuais .

O relatório também detalha como os modelos Pixtral foram acessados: Pixtral-Large através do AWS Bedrock e Pixtral-12b via a plataforma Mistral. Esse contexto de implantação no mundo real enfatiza ainda mais a urgência dessas descobertas. Esses modelos não estão confinados a laboratórios – estão disponíveis por meio de plataformas de nuvem mainstream e poderiam facilmente ser integrados a produtos de consumo ou empresariais.

O Que Deve Ser Feito: Um Plano para uma IA Mais Segura

A seu crédito, a Enkrypt AI faz mais do que apenas destacar os problemas – oferece um caminho à frente. O relatório esboça uma estratégia de mitigação abrangente, começando com treinamento de alinhamento de segurança. Isso envolve retreinar o modelo usando seus próprios dados de red teaming para reduzir a suscetibilidade a prompts prejudiciais. Técnicas como Otimização de Preferência Direta (DPO) são recomendadas para ajustar finamente as respostas do modelo longe de saídas de risco.

Ele também enfatiza a importância de guardrails de contexto – filtros dinâmicos que podem interpretar e bloquear consultas prejudiciais em tempo real, considerando o contexto completo de entrada multimodal. Além disso, a utilização de Cartões de Risco de Modelo é proposta como uma medida de transparência, ajudando as partes interessadas a entender as limitações e casos de falha conhecidos do modelo.

Talvez a recomendação mais crítica seja tratar o red teaming como um processo contínuo, e não como um teste único. À medida que os modelos evoluem, também evoluem as estratégias de ataque. Apenas a avaliação contínua e o monitoramento ativo podem garantir a confiabilidade de longo prazo, especialmente quando os modelos são implantados em setores sensíveis como saúde, educação ou defesa.

O Relatório de Red Team Multimodal da Enkrypt AI é um sinal claro para a indústria de IA: o poder multimodal vem com responsabilidade multimodal. Esses modelos representam um salto à frente em capacidade, mas também exigem um salto à frente em como pensamos sobre segurança, segurança e implantação ética. Se não forem controlados, eles não apenas arriscam falhar – arriscam causar danos no mundo real.

Para qualquer pessoa que trabalhe ou implante IA em larga escala, este relatório não é apenas um aviso. É um manual. E não poderia ter chegado em um momento mais oportuno.

Antoine é um líder visionário e sócio-fundador da Unite.AI, impulsionado por uma paixão inabalável por moldar e promover o futuro da IA e da robótica. Um empreendedor serial, ele acredita que a IA será tão disruptiva para a sociedade quanto a eletricidade, e é frequentemente pego falando sobre o potencial das tecnologias disruptivas e da AGI.

Como um futurista, ele está dedicado a explorar como essas inovações moldarão nosso mundo. Além disso, ele é o fundador da Securities.io, uma plataforma focada em investir em tecnologias de ponta que estão redefinindo o futuro e remodelando setores inteiros.