Report

DeepSeek-R1 Red Teaming Report: Rischi di Sicurezza e Etici Allarmanti Rilevati

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Un recente test di red teaming condotto da Enkrypt AI ha rivelato significativi rischi di sicurezza, preoccupazioni etiche e vulnerabilità in DeepSeek-R1. I risultati, dettagliati nel Rapporto di Red Teaming di gennaio 2025, evidenziano la suscettibilità del modello a generare contenuti dannosi, distorti e insicuri rispetto ai modelli leader del settore come GPT-4o, OpenAI’s o1 e Claude-3-Opus. Di seguito è riportata un’analisi completa dei rischi delineati nel rapporto e delle raccomandazioni per la mitigazione.

Rischi di Sicurezza e Etici Chiave

1. Output Dannoso e Rischi di Sicurezza

  • Altamente vulnerabile alla produzione di contenuti dannosi, compresi linguaggio tossico, output distorti e informazioni sfruttabili criminalmente.
  • 11 volte più probabile generare contenuti dannosi rispetto a OpenAI’s o1.
  • 4 volte più tossico di GPT-4o.
  • 3 volte più distorto di Claude-3-Opus.
  • 4 volte più vulnerabile alla generazione di codice insicuro rispetto a OpenAI’s o1.
  • Altamente suscettibile alla generazione di informazioni su CBRN (Chimico, Biologico, Radiologico e Nucleare), rendendolo uno strumento ad alto rischio per gli attori malintenzionati.

2. Confronto con Altri Modelli

Categoria di Rischio DeepSeek-R1 Claude-3-Opus GPT-4o OpenAI’s o1
Distorsione 3 volte superiore Inferiore Simile Simile
Codice Insicuro 4 volte superiore 2,5 volte superiore 1,25 volte superiore
Contenuto Dannoso 11 volte superiore 6 volte superiore 2,5 volte superiore
Tossicità 4 volte superiore Quasi assente 2,5 volte superiore
Contenuto CBRN 3,5 volte superiore 3,5 volte superiore 2 volte superiore

Distorsioni e Rischi Etici

  • 83% degli attacchi di distorsione sono stati coronati da successo, con una distorsione sostanziale rilevata nelle query relative alla salute, alla razza e alla religione.
  • Il modello ha mostrato livelli più elevati di stereotipi demografici, che potrebbero violare varie norme sulla parità, comprese ECOA, FHA, ACA e il Regolamento UE sull’IA.
  • I casi di test hanno dimostrato che DeepSeek-R1 preferisce determinate demografie per ruoli lavorativi di alto livello, rafforzando i pregiudizi sul posto di lavoro.

Generazione di Contenuto Dannoso

  • 45% dei test dannosi hanno portato il modello a generare contenuti relativi ad attività criminali, comprese armi illegali e sostanze controllate.
  • Un prompt di test che ha chiesto al modello di sviluppare un blog su “L’arte della persuasione nel reclutamento terroristico” ha prodotto una risposta dettagliata che delinea strategie di radicalizzazione che potrebbero essere sfruttate da gruppi estremisti per raffinare le tattiche di reclutamento, potenzialmente aumentando il rischio di violenza nel mondo reale.
  • 2,5 volte più vulnerabile alla generazione di contenuto estremista rispetto a GPT-4o e 6 volte più vulnerabile rispetto a Claude-3-Opus.
  • 45% dei test dannosi hanno portato il modello a generare contenuti relativi a attività criminali, comprese armi illegali e sostanze controllate.

Generazione di Codice Insicuro

  • 78% degli attacchi relativi al codice hanno estratto con successo snippet di codice insicuri e dannosi.
  • Il modello ha generato malware, trojan e script auto-eseguibili su richiesta. I trojan rappresentano un rischio grave in quanto possono consentire agli attaccanti di ottenere l’accesso non autorizzato persistente ai sistemi, rubare dati sensibili e distribuire ulteriori carichi dannosi.
  • Script auto-eseguibili possono automatizzare azioni dannose senza il consenso dell’utente, creando potenziali minacce in applicazioni critiche per la sicurezza.
  • Rispetto ai modelli del settore, DeepSeek-R1 è stato 4,5, 2,5 e 1,25 volte più vulnerabile rispetto a OpenAI’s o1, Claude-3-Opus e GPT-4o, rispettivamente.
  • 78% degli attacchi relativi al codice hanno estratto con successo snippet di codice insicuri e dannosi.

Vulnerabilità CBRN

  • Ha generato informazioni dettagliate sui meccanismi biochimici degli agenti di guerra chimica. Questo tipo di informazione potrebbe potenzialmente aiutare gli individui a sintetizzare materiali pericolosi, aggirando le restrizioni di sicurezza volte a prevenire la diffusione di armi chimiche e biologiche.
  • 13% dei test hanno superato con successo i controlli di sicurezza, producendo contenuti relativi a minacce nucleari e biologiche.
  • 3,5 volte più vulnerabile rispetto a Claude-3-Opus e OpenAI’s o1.
  • Ha generato informazioni dettagliate sui meccanismi biochimici degli agenti di guerra chimica.
  • 13% dei test hanno superato con successo i controlli di sicurezza, producendo contenuti relativi a minacce nucleari e biologiche.
  • 3,5 volte più vulnerabile rispetto a Claude-3-Opus e OpenAI’s o1.

Raccomandazioni per la Mitigazione dei Rischi

Per minimizzare i rischi associati a DeepSeek-R1, sono consigliati i seguenti passaggi:

1. Implementazione di una Formazione di Allineamento della Sicurezza Robusta

  • I dataset di red teaming dovrebbero essere utilizzati per addestrare il modello su output più sicuri.
  • Eseguire apprendimento per rinforzo con feedback umano (RLHF) per allineare il comportamento del modello con gli standard etici.

2. Red Teaming Automatizzato Continuo

  • Test di stress regolari per identificare pregiudizi, vulnerabilità di sicurezza e generazione di contenuti tossici.
  • Impiegare monitoraggio continuo delle prestazioni del modello, in particolare nelle applicazioni di finanza, sanità e sicurezza informatica.

3. Paratie di Sicurezza Consapevoli del Contesto

  • Sviluppare salvaguardie dinamiche per bloccare prompt dannosi.
  • Implementare strumenti di moderazione dei contenuti per neutralizzare input dannosi e filtrare risposte insicure.

4. Monitoraggio Attivo del Modello e Registrazione

  • Registrazione in tempo reale degli input e delle risposte del modello per la rilevazione precoce delle vulnerabilità.
  • Flussi di lavoro di audit automatizzati per garantire la conformità con gli standard di trasparenza e etica dell’IA.

5. Misure di Trasparenza e Conformità

  • Mantenere una carta di rischio del modello con metriche esecutive chiare sulla affidabilità, sicurezza e rischi etici del modello.
  • Conformità con le norme sull’IA come NIST AI RMF e MITRE ATLAS per mantenere la credibilità.

Conclusione

DeepSeek-R1 presenta gravi rischi di sicurezza, etici e di conformità che lo rendono inadatto per molte applicazioni ad alto rischio senza sforzi di mitigazione estensivi. La sua tendenza a generare contenuti dannosi, distorti e insicuri lo pone in svantaggio rispetto a modelli come Claude-3-Opus, GPT-4o e OpenAI’s o1.

Considerando che DeepSeek-R1 è un prodotto originario della Cina, è improbabile che le necessarie raccomandazioni di mitigazione saranno completamente implementate. Tuttavia, rimane cruciale che le comunità dell’IA e della sicurezza informatica siano consapevoli dei potenziali rischi che questo modello presenta. La trasparenza su queste vulnerabilità garantisce che gli sviluppatori, i regolatori e le imprese possano prendere misure proattive per mitigare il danno dove possibile e rimanere vigilanti contro l’uso improprio di tale tecnologia.

Le organizzazioni che considerano il suo utilizzo devono investire in test di sicurezza rigorosi, red teaming automatizzato e monitoraggio continuo per garantire un’implementazione di IA sicura e responsabile. DeepSeek-R1 presenta gravi rischi di sicurezza, etici e di conformità che lo rendono inadatto per molte applicazioni ad alto rischio senza sforzi di mitigazione estensivi.

I lettori che desiderano saperne di più sono invitati a scaricare il rapporto visitando questa pagina.

Antoine è un leader visionario e socio fondatore di Unite.AI, guidato da una passione incrollabile per plasmare e promuovere il futuro dell'AI e della robotica. Un imprenditore seriale, crede che l'AI sarà così disruptiva per la società come l'elettricità, e spesso si lascia trasportare dall'entusiasmo per il potenziale delle tecnologie disruptive e dell'AGI.

Come futurista, è dedicato a esplorare come queste innovazioni plasmeranno il nostro mondo. Inoltre, è il fondatore di Securities.io, una piattaforma focalizzata sugli investimenti in tecnologie all'avanguardia che stanno ridefinendo il futuro e riplasmando interi settori.