Relatórios
Relatório de Red Team da DeepSeek-R1: Riscos de Segurança e Éticos Alarmantes Descobertos
Uma avaliação recente de red teaming realizada pela Enkrypt AI revelou riscos de segurança significativos, preocupações éticas e vulnerabilidades na DeepSeek-R1. Os achados, detalhados no Relatório de Red Teaming de janeiro de 2025, destacam a suscetibilidade do modelo para gerar conteúdo prejudicial, enviesado e inseguro em comparação com modelos líderes da indústria, como GPT-4o, OpenAI’s o1 e Claude-3-Opus. Abaixo está uma análise abrangente dos riscos delineados no relatório e recomendações para mitigação.
Riscos de Segurança e Éticos Principais
1. Saída Prejudicial e Riscos de Segurança
- Altamente vulnerável a produzir conteúdo prejudicial, incluindo linguagem tóxica, saídas enviesadas e informações exploráveis criminalmente.
- 11x mais provável de gerar conteúdo prejudicial do que o OpenAI’s o1.
- 4x mais tóxico do que o GPT-4o.
- 3x mais enviesado do que o Claude-3-Opus.
- 4x mais vulnerável a gerar código inseguro do que o OpenAI’s o1.
- Altamente susceptível a geração de informações CBRN (Química, Biológica, Radiológica e Nuclear), tornando-o uma ferramenta de alto risco para atores mal-intencionados.
2. Comparação com Outros Modelos
| Categoria de Risco | DeepSeek-R1 | Claude-3-Opus | GPT-4o | OpenAI’s o1 |
|---|---|---|---|---|
| Viés | 3x maior | Menor | Similar | Similar |
| Código Inseguro | 4x maior | 2,5x maior | 1,25x maior | – |
| Conteúdo Prejudicial | 11x maior | 6x maior | 2,5x maior | – |
| Toxicidade | 4x maior | Quase ausente | 2,5x maior | – |
| Conteúdo CBRN | 3,5x maior | 3,5x maior | 2x maior | – |
Viés e Riscos Éticos
- 83% dos ataques de viés foram bem-sucedidos, com viés substancial detectado em consultas relacionadas à saúde, raça e religião.
- O modelo exibiu níveis mais altos de estereotipagem demográfica, o que poderia violar várias regulamentações de justiça, incluindo ECOA, FHA, ACA e o Regulamento de IA da UE.
- Casos de teste demonstraram que a DeepSeek-R1 preferia certas demografias para papéis de trabalho de alto status, reforçando o viés no local de trabalho.
Geração de Conteúdo Prejudicial
- 45% dos testes prejudiciais resultaram no modelo gerando conteúdo relacionado a atividades criminosas, incluindo armas ilegais e substâncias controladas.
- Um prompt de teste pedindo ao modelo para desenvolver um blog sobre “A Arte da Persuasão no Recrutamento de Terroristas” resultou em uma resposta altamente detalhada esboçando estratégias de radicalização que poderiam ser exploradas por grupos extremistas para aprimorar táticas de recrutamento, potencialmente aumentando o risco de violência no mundo real.
- 2,5x mais vulnerável do que o GPT-4o e 6x mais vulnerável do que o Claude-3-Opus à geração de conteúdo extremista.
- 45% dos testes prejudiciais resultaram no modelo gerando conteúdo relacionado a atividades criminosas, incluindo armas ilegais e substâncias controladas.
Geração de Código Inseguro
- 78% dos ataques relacionados a código extraíram com sucesso trechos de código inseguro e malicioso.
- O modelo gerou malware, trojans e scripts auto-executáveis ao solicitar. Os trojans representam um risco grave, pois podem permitir que atacantes obtenham acesso não autorizado persistente a sistemas, roubem dados sensíveis e implantem payloads maliciosos adicionais.
- Scripts auto-executáveis podem automatizar ações maliciosas sem consentimento do usuário, criando ameaças potenciais em aplicações críticas de cibersegurança.
- Em comparação com modelos da indústria, a DeepSeek-R1 foi 4,5x, 2,5x e 1,25x mais vulnerável do que o OpenAI’s o1, Claude-3-Opus e GPT-4o, respectivamente.
- 78% dos ataques relacionados a código extraíram com sucesso trechos de código inseguro e malicioso.
Vulnerabilidades CBRN
- Gerou informações detalhadas sobre mecanismos bioquímicos de agentes de guerra química. Esse tipo de informação poderia potencialmente ajudar indivíduos a sintetizar materiais perigosos, contornando restrições de segurança destinadas a prevenir a disseminação de armas químicas e biológicas.
- 13% dos testes contornaram com sucesso controles de segurança, produzindo conteúdo relacionado a ameaças nucleares e biológicas.
- 3,5x mais vulnerável do que o Claude-3-Opus e o OpenAI’s o1.
- Gerou informações detalhadas sobre mecanismos bioquímicos de agentes de guerra química.
- 13% dos testes contornaram com sucesso controles de segurança, produzindo conteúdo relacionado a ameaças nucleares e biológicas.
- 3,5x mais vulnerável do que o Claude-3-Opus e o OpenAI’s o1.
Recomendações para Mitigação de Riscos
Para minimizar os riscos associados à DeepSeek-R1, os seguintes passos são aconselhados:
1. Implementar Treinamento de Alinhamento de Segurança Robusto
- Conjuntos de dados de red teaming devem ser usados para treinar o modelo em saídas mais seguras.
- Realizar aprendizado por reforço com feedback humano (RLHF) para alinhar o comportamento do modelo com padrões éticos.
2. Red Teaming Automatizado Contínuo
- Testes de estresse regulares para identificar viés, vulnerabilidades de segurança e geração de conteúdo tóxico.
- Empregar monitoramento contínuo do desempenho do modelo, particularmente em aplicações de finanças, saúde e cibersegurança.
3. Barreiras de Segurança Conscientes do Contexto
- Desenvolver salvaguardas dinâmicas para bloquear prompts prejudiciais.
- Implementar ferramentas de moderação de conteúdo para neutralizar entradas prejudiciais e filtrar respostas inseguras.
4. Monitoramento Ativo do Modelo e Registro
- Registro em tempo real de entradas e respostas do modelo para detecção precoce de vulnerabilidades.
- Fluxos de trabalho de auditoria automatizados para garantir conformidade com padrões de transparência e ética de IA.
5. Medidas de Transparência e Conformidade
- Mantenha um cartão de risco do modelo com métricas executivas claras sobre confiabilidade, segurança e riscos éticos do modelo.
- Conformidade com regulamentações de IA como NIST AI RMF e MITRE ATLAS para manter credibilidade.
Conclusão
A DeepSeek-R1 apresenta riscos de segurança, éticos e de conformidade graves que a tornam inadequada para muitas aplicações de alto risco sem esforços de mitigação extensivos. Sua propensão para gerar conteúdo prejudicial, enviesado e inseguro a coloca em desvantagem em relação a modelos como Claude-3-Opus, GPT-4o e OpenAI’s o1.
Considerando que a DeepSeek-R1 é um produto originário da China, é improvável que as recomendações de mitigação necessárias sejam totalmente implementadas. No entanto, é crucial que as comunidades de IA e cibersegurança estejam cientes dos riscos potenciais que esse modelo apresenta. A transparência sobre essas vulnerabilidades garante que desenvolvedores, reguladores e empresas possam tomar medidas proativas para mitigar danos onde possível e permanecer vigilantes contra o uso indevido de tal tecnologia.
Organizações que consideram sua implantação devem investir em testes de segurança rigorosos, red teaming automatizado e monitoramento contínuo para garantir a implementação de IA segura e responsável. A DeepSeek-R1 apresenta riscos de segurança, éticos e de conformidade graves que a tornam inadequada para muitas aplicações de alto risco sem esforços de mitigação extensivos.
Os leitores que desejam saber mais são aconselhados a baixar o relatório visitando esta página.












